O possível atraso das GPUs Blackwell da Nvidia para aplicações de IA e HPC não terá um impacto dramático nos fabricantes de servidores de IA e no mercado de servidores de IA, segundo a Supermicro, um importante fornecedor de servidores. O comentário de Charles Liang (via SeekingAlpha), CEO da Supermicro, pode ser considerado uma confirmação de que os processadores B100 e B200 de próxima geração da Nvidia estão realmente atrasados, pois precisam de retrabalho.
“Ouvimos que a Nvidia pode ter algum atraso, e tratamos isso como uma possibilidade normal”, disse Liang durante a chamada de resultados da empresa com analistas financeiros e investidores. Ele afirmou: “Quando eles introduzem uma nova tecnologia, um novo produto, [sempre há uma chance] de que haverá um pequeno adiamento. Neste caso, foi adiado um pouco. Mas, para nós, acredito que não teremos problemas em fornecer ao cliente uma nova solução como o H200 com resfriamento líquido. Temos muitos clientes que gostam disso. Então, embora esperemos um melhor cumprimento do cronograma, isso é bom para uma empresa de tecnologia, mas esse adiamento geral não deve ter muito impacto para nós.”
As GPUs B100 e B200 da Nvidia são os primeiros produtos da indústria a usar o empacotamento CoWoS-L da TSMC com um interposer Super Carrier. Isso permite a construção de sistemas em pacotes até seis vezes o tamanho do retículo, usando pontes de interconexão de silício locais ativas ou passivas (LSI) integradas em uma camada de redistribuição (RDL) (em vez de um interposer de silício no caso do CoWoS-S usado para o H100).
A colocação das matrizes de ponte exige precisão excepcional, particularmente para as pontes entre as duas matrizes de computação principais, pois são essenciais para manter a interconexão de 10 TB/s chipset-to-chipset. Um problema de design significativo é rumor de envolver essas matrizes de ponte, necessitando de seu redesenho. Analistas da SemiAnalysis sugerem que pode haver uma incompatibilidade do coeficiente de expansão térmica (CTE) entre os chiplets da GPU, pontes LSI, o interposer RDL e o substrato da placa-mãe, o que causa empenamento e falha de todo o SiP. Isso nunca foi confirmado oficialmente. Além disso, há relatos de um redesenho necessário das camadas de metal de roteamento global superior e dos bumps do silício da GPU Blackwell, o que significa um atraso de vários meses.
A SemiAnalysis relata que a Nvidia ainda produzirá o B200 de 1000W em volumes baixos no quarto trimestre de 2024 para servidores HGX, conforme planejado, em parte devido à capacidade limitada do CoWoS-L e em parte devido aos problemas mencionados. Além disso, servidores de ponta baseados no GB200, como NVL36 e NVL72 (usando B200 de 1200W), estarão disponíveis para alguns clientes, embora em volumes baixos no quarto trimestre.
Para atender à demanda por sistemas de IA de baixo e médio porte, a Nvidia está trabalhando em seu produto B200A, que apresenta um silício monolítico B102 com 144 GB (quatro pilhas) de HBM3E e embalado usando o bom e velho CoWoS-S (ou tecnologias concorrentes da Amkor, ASE, SPIL ou até mesmo Samsung). Esta parte será lançada no segundo trimestre de 2025. O novo modelo estará disponível em fatores de forma HGX de 700W e 1000W, apresentando até 144GB de memória HBM3E e até 4 TB/s de largura de banda de memória. No entanto, é essencial notar que isso oferece menos largura de banda de memória do que o H200. No entanto, não está claro se o die B102 tem alguma relação com o processador GB202 voltado para gráficos para placas gráficas.
Não sabemos se a Nvidia planeja redesenhar o B200 original, seu LSI ou o pacote em si. Ainda assim, a SemiAnalysis afirma que a Nvidia está trabalhando na atualização de meio de geração da série Blackwell chamada Blackwell Ultra. A linha ‘Ultra’ usará dois chiplets, empacotamento CoWoS-L, formalmente chamados de B210 ou B200 Ultra. O Blackwell Ultra inclui uma atualização de memória para até 288 GB de HBM3E 12Hi e um aumento de desempenho em FLOPS de até 50%.
Espera-se que o Nvidia B210/B200 Ultra esteja disponível em versões de 1000W e 1200W em algum momento do terceiro trimestre de 2025, então o atraso das GPUs Blackwell de alto volume e alta qualidade parece significativo. Considerando a demanda por servidores de IA em geral e as GPUs H100/H200 da Nvidia, é provável que a empresa consiga navegar pelos problemas relacionados ao B200.
Fonte: Tom’s Hardware

