Tecnologia

Nvidia revela avanços na plataforma Blackwell antes da Hot Chips 2024

Antes do início da feira Hot Chips 2024, a Nvidia revelou mais elementos de sua plataforma Blackwell, incluindo servidores sendo instalados e configurados. É uma maneira sutil de dizer que Blackwell está a caminho — apesar dos atrasos. A empresa também falou sobre suas soluções Hopper H200 existentes, mostrou otimizações FP4 LLM usando seu novo Quasar Quantization System, discutiu o resfriamento líquido com água morna para data centers e mencionou o uso de IA para ajudar a construir chips ainda melhores para IA. Reiterou que Blackwell é mais do que apenas uma GPU, é uma plataforma e um ecossistema completos.

Grande parte do que será apresentado pela Nvidia na Hot Chips 2024 já é conhecido, como o roadmap de data centers e IA mostrando que o Blackwell Ultra chegará no próximo ano, com CPUs Vera e GPUs Rubin em 2026, seguido pelo Vera Ultra em 2027. A Nvidia confirmou esses detalhes pela primeira vez na Computex em junho. Mas a IA continua sendo um grande tópico, e a Nvidia está mais do que feliz em continuar batendo na tecla da IA.


(Crédito da imagem: Nvidia)

(Crédito da imagem: Nvidia)

(Crédito da imagem: Nvidia)

(Crédito da imagem: Nvidia)

(Crédito da imagem: Nvidia)

Enquanto Blackwell foi supostamente adiado por três meses, a Nvidia nem confirmou nem negou essa informação, optando por mostrar imagens de sistemas Blackwell sendo instalados, bem como fornecendo fotos e renderizações mostrando mais do hardware interno nas racks Blackwell GB200 e switches NVLink. Não há muito o que dizer, além de que o hardware parece consumir muita energia e tem um resfriamento bastante robusto. Também parece muito caro.

A Nvidia também mostrou alguns resultados de desempenho de seu H200 existente, rodando com e sem NVSwitch. Segundo a empresa, o desempenho pode ser até 1,5 vezes maior em cargas de trabalho de inferência em comparação com designs ponto a ponto — isso usando um modelo de parâmetro Llama 3.1 70B. Blackwell dobra a largura de banda do NVLink para oferecer melhorias adicionais, com um NVLink Switch Tray oferecendo uma largura de banda total agregada de 14,4 TB/s.

Devido ao aumento das necessidades de energia dos data centers, a Nvidia também está trabalhando com parceiros para aumentar o desempenho e a eficiência. Um dos resultados mais promissores é o uso de resfriamento com água morna, onde a água aquecida pode potencialmente ser recirculada para aquecimento, reduzindo ainda mais os custos. A Nvidia afirma que viu uma redução de até 28% no uso de energia dos data centers usando essa tecnologia, com uma grande parte dessa redução vindo da remoção de hardware de resfriamento abaixo da temperatura ambiente.


(Crédito da imagem: Nvidia)

(Crédito da imagem: Nvidia)

(Crédito da imagem: Nvidia)

Acima, você pode ver o conjunto completo de slides da apresentação da Nvidia. Há alguns outros itens interessantes a serem observados.

Para se preparar para Blackwell, que agora adiciona suporte nativo a FP4 que pode aumentar ainda mais o desempenho, a Nvidia trabalhou para garantir que seu software mais recente se beneficie dos novos recursos de hardware sem sacrificar a precisão. Após usar seu Quasar Quantization System para ajustar os resultados das cargas de trabalho, a Nvidia consegue entregar basicamente a mesma qualidade que FP16 usando um quarto da largura de banda. As duas imagens de coelho geradas podem variar em aspectos menores, mas isso é bastante típico de ferramentas de texto-para-imagem como o Stable Diffusion.

A Nvidia também falou sobre o uso de ferramentas de IA para projetar chips melhores — IA construindo IA, com infinitas possibilidades. A Nvidia criou um LLM para uso interno que ajuda a acelerar o design, depuração, análise e otimização. Ele funciona com a linguagem Verilog, usada para descrever circuitos, e foi um fator chave na criação da GPU Blackwell B200 com 208 bilhões de transistores. Isso será então usado para criar modelos ainda melhores, permitindo que a Nvidia trabalhe na próxima geração de GPUs Rubin e além. [Sinta-se à vontade para inserir sua própria piada sobre Skynet neste ponto.]

Concluindo, temos uma imagem de melhor qualidade do roadmap de IA da Nvidia para os próximos anos, que novamente define a “plataforma Rubin” com switches e interlinks como um pacote completo. A Nvidia apresentará mais detalhes sobre a arquitetura Blackwell, usando IA generativa para engenharia assistida por computador e resfriamento líquido na conferência Hot Chips na próxima semana.

Fonte: Tom’s Hardware

Shares:

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *