Tecnologia

Nvidia revela avanços na plataforma Blackwell antes da Hot Chips 2024

Antes do início da feira Hot Chips 2024, a Nvidia revelou mais elementos de sua plataforma Blackwell, incluindo servidores sendo instalados e configurados. É uma maneira sutil de dizer que Blackwell está a caminho — apesar dos atrasos. A empresa também falou sobre suas soluções Hopper H200 existentes, mostrou otimizações FP4 LLM usando seu novo Quasar Quantization System, discutiu o resfriamento líquido com água morna para data centers e mencionou o uso de IA para ajudar a construir chips ainda melhores para IA. Reiterou que Blackwell é mais do que apenas uma GPU, é uma plataforma e um ecossistema completos.

Grande parte do que será apresentado pela Nvidia na Hot Chips 2024 já é conhecido, como o roadmap de data centers e IA mostrando que o Blackwell Ultra chegará no próximo ano, com CPUs Vera e GPUs Rubin em 2026, seguido pelo Vera Ultra em 2027. A Nvidia confirmou esses detalhes pela primeira vez na Computex em junho. Mas a IA continua sendo um grande tópico, e a Nvidia está mais do que feliz em continuar batendo na tecla da IA.

Nvidia Hot Chips 2024
(Crédito da imagem: Nvidia)
Nvidia Hot Chips 2024
(Crédito da imagem: Nvidia)
Nvidia Hot Chips 2024
(Crédito da imagem: Nvidia)
Nvidia Hot Chips 2024
(Crédito da imagem: Nvidia)
Nvidia Hot Chips 2024
(Crédito da imagem: Nvidia)

Enquanto Blackwell foi supostamente adiado por três meses, a Nvidia nem confirmou nem negou essa informação, optando por mostrar imagens de sistemas Blackwell sendo instalados, bem como fornecendo fotos e renderizações mostrando mais do hardware interno nas racks Blackwell GB200 e switches NVLink. Não há muito o que dizer, além de que o hardware parece consumir muita energia e tem um resfriamento bastante robusto. Também parece muito caro.

A Nvidia também mostrou alguns resultados de desempenho de seu H200 existente, rodando com e sem NVSwitch. Segundo a empresa, o desempenho pode ser até 1,5 vezes maior em cargas de trabalho de inferência em comparação com designs ponto a ponto — isso usando um modelo de parâmetro Llama 3.1 70B. Blackwell dobra a largura de banda do NVLink para oferecer melhorias adicionais, com um NVLink Switch Tray oferecendo uma largura de banda total agregada de 14,4 TB/s.

Devido ao aumento das necessidades de energia dos data centers, a Nvidia também está trabalhando com parceiros para aumentar o desempenho e a eficiência. Um dos resultados mais promissores é o uso de resfriamento com água morna, onde a água aquecida pode potencialmente ser recirculada para aquecimento, reduzindo ainda mais os custos. A Nvidia afirma que viu uma redução de até 28% no uso de energia dos data centers usando essa tecnologia, com uma grande parte dessa redução vindo da remoção de hardware de resfriamento abaixo da temperatura ambiente.

Nvidia Hot Chips 2024
(Crédito da imagem: Nvidia)
Nvidia Hot Chips 2024
(Crédito da imagem: Nvidia)
Nvidia Hot Chips 2024
(Crédito da imagem: Nvidia)

Acima, você pode ver o conjunto completo de slides da apresentação da Nvidia. Há alguns outros itens interessantes a serem observados.

Para se preparar para Blackwell, que agora adiciona suporte nativo a FP4 que pode aumentar ainda mais o desempenho, a Nvidia trabalhou para garantir que seu software mais recente se beneficie dos novos recursos de hardware sem sacrificar a precisão. Após usar seu Quasar Quantization System para ajustar os resultados das cargas de trabalho, a Nvidia consegue entregar basicamente a mesma qualidade que FP16 usando um quarto da largura de banda. As duas imagens de coelho geradas podem variar em aspectos menores, mas isso é bastante típico de ferramentas de texto-para-imagem como o Stable Diffusion.

A Nvidia também falou sobre o uso de ferramentas de IA para projetar chips melhores — IA construindo IA, com infinitas possibilidades. A Nvidia criou um LLM para uso interno que ajuda a acelerar o design, depuração, análise e otimização. Ele funciona com a linguagem Verilog, usada para descrever circuitos, e foi um fator chave na criação da GPU Blackwell B200 com 208 bilhões de transistores. Isso será então usado para criar modelos ainda melhores, permitindo que a Nvidia trabalhe na próxima geração de GPUs Rubin e além. [Sinta-se à vontade para inserir sua própria piada sobre Skynet neste ponto.]

Concluindo, temos uma imagem de melhor qualidade do roadmap de IA da Nvidia para os próximos anos, que novamente define a “plataforma Rubin” com switches e interlinks como um pacote completo. A Nvidia apresentará mais detalhes sobre a arquitetura Blackwell, usando IA generativa para engenharia assistida por computador e resfriamento líquido na conferência Hot Chips na próxima semana.

Fonte: Tom’s Hardware

Shares:

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *