A Nvidia publicou os primeiros resultados do MLPerf 4.1 de seu processador Blackwell B200. Os resultados revelam que uma GPU Blackwell oferece até quatro vezes o desempenho de seu predecessor H100, baseado na arquitetura Hopper, destacando a posição da Nvidia como líder em hardware de IA. No entanto, há algumas ressalvas e isenções de responsabilidade que precisamos apontar.
Baseado nos resultados da Nvidia, uma GPU B200 baseada em Blackwell entrega 10.755 tokens/segundo em um teste de inferência de servidor com uma única GPU e 11.264 tokens/segundo em um teste de referência offline. Um rápido olhar nos resultados do benchmark MLPerf Llama 2 70B disponíveis publicamente revela que uma máquina com quatro GPUs Hopper H100 entrega resultados similares, dando credibilidade à afirmação da Nvidia de que um único processador Blackwell é cerca de 3,7X a 4X mais rápido do que uma única GPU Hopper H100. Mas precisamos dissecar os números para entendê-los melhor.
Primeiro, o processador Blackwell da Nvidia usou precisão FP4, pois sua quinta geração de Tensor Cores suporta esse formato, enquanto o H100 baseado em Hopper suporta e usa apenas FP8. Esses formatos diferentes são permitidos pelas diretrizes do MLPerf, mas o desempenho FP4 no Blackwell dobra sua taxa de transferência FP8, então esse é o primeiro item importante a ser observado.
Em seguida, a Nvidia é um pouco desonesta ao usar uma única B200 contra quatro GPUs H100. A escalabilidade nunca é perfeita, então uma única GPU tende a ser algo como um cenário ideal para desempenho por GPU. Não há resultados de uma única GPU H100 listados para o MLPerf 4.1, e apenas um único resultado B200, então se torna ainda mais uma comparação de maçãs e laranjas. Uma única H200 alcançou 4.488 tokens/s, no entanto, o que significa que a B200 é apenas 2,5X mais rápida para essa comparação específica.
A capacidade e a largura de banda da memória também são fatores críticos, e há grandes diferenças geracionais. A GPU B200 testada possui 180GB de memória HBM3E, a H100 SXM tem 80GB de HBM (até 96GB em algumas configurações), e a H200 tem 96GB de HBM3 e até 144GB de HBM3E. Um resultado para uma única H200 com 96GB de HBM3 alcançou apenas 3.114 tokens/s no modo offline.
Portanto, há potenciais diferenças no formato dos números, na contagem de GPUs e na capacidade e configuração da memória que influenciam a figura “até 4X”. Muitas dessas diferenças são simplesmente devido ao fato de o Blackwell B200 ser um chip novo com uma arquitetura mais recente, e todas essas coisas influenciam seu desempenho final.
Voltando à H200 da Nvidia com 141GB de memória HBM3E, ela também teve um desempenho excepcional não apenas no benchmark de IA generativa com o modelo de linguagem grande Llama 2 70B, mas também em todos os testes dentro da categoria de data center. Por razões óbvias, ela ficou significativamente mais rápida do que a H100 em testes que aproveitam a capacidade de memória da GPU.
Por enquanto, a Nvidia compartilhou apenas o desempenho de sua B200 no benchmark de IA generativa MLPerf 4.1 no modelo Llama 2 70B. Se isso se deve ao fato de ainda estar trabalhando em ajustes ou outros fatores, não podemos dizer, mas o MLPerf 4.1 tem nove disciplinas principais e, por enquanto, só podemos adivinhar como o Blackwell B200 lidará com os outros testes.
Fonte: Nvidia Blog

