A AMD finalmente publicou seus primeiros resultados oficiais no MLPerf para o acelerador Instinct MI300X para IA e HPC. O processador MI300X aparentemente tem desempenho semelhante ao da GPU H100 da geração anterior da Nvidia no modelo Llama 2 70B para IA generativa, mas fica bem atrás da versão H200 — sem mencionar a próxima Nvidia B200, que também obteve seus primeiros resultados no MLPerf ontem.
É notável que a AMD compartilhou apenas os números de desempenho do MI300X no benchmark MLPerf 4.1 de IA generativa no modelo Llama 2 70B. Com base nos dados compartilhados pela AMD, um sistema com oito processadores MI300X foi apenas ligeiramente mais lento (23.512 tokens/segundo offline) do que um sistema com oito processadores Nvidia H100 SXM3 (24.323 tokens/segundo offline), o que pode ser considerado ‘competitivo’, dado o quão bem a pilha de software da Nvidia é otimizada para modelos de linguagem grandes e populares como o Llama 2 70B. O sistema AMD MI300X também é ligeiramente mais rápido do que a máquina Nvidia H100 em um benchmark de servidor mais próximo do mundo real: 21.028 tokens/segundo vs 20.605 tokens/segundo.
Há dois grandes pontos a serem considerados aqui. O desempenho máximo do MI300X da AMD para IA é de 2,6 POPs (ou 5,22 POPs com sparsidade estruturada), enquanto o desempenho máximo do H100 da Nvidia é de 1,98 FP8/INT8 TFLOPS/TOPS (3,96 TFLOPS/TOPS com sparsidade). Além disso, o módulo H100 SXM3 da Nvidia possui 80GB de memória HBM3 com uma largura de banda máxima de 3,35 TB/s, enquanto o Instinct MI300X da AMD é equipado com 192GB de memória HBM3 com uma largura de banda máxima de 5,3 TB/s.
Isso deveria dar ao processador MI300X da AMD uma enorme vantagem sobre o H100 da Nvidia em termos de desempenho. A capacidade e a largura de banda da memória desempenham um papel crucial nas cargas de trabalho de inferência de IA generativa, e o Instinct MI300X da AMD tem mais do que o dobro da capacidade e 58% mais largura de banda do que o H100 da Nvidia. No entanto, o Instinct MI300X mal consegue vencer no benchmark de inferência de servidor e fica atrás do H100 no benchmark de inferência offline.
Parece que o MI300X não consegue aproveitar ao máximo suas capacidades de hardware, provavelmente por causa da pilha de software. Isso provavelmente também explica por que a AMD evitou até agora mostrar quaisquer resultados no MLPerf. A Nvidia está fortemente envolvida com o MLPerf e trabalha com o consórcio de benchmarks desde os primeiros dias (o MLPerf 0.7 foi lançado em 2020). Supõe-se que seja um consórcio aberto e agnóstico de fornecedores de hardware e software, mas ainda pode levar tempo para obter uma boa otimização para qualquer carga de trabalho de IA específica.
O fato de a AMD finalmente ter enviado resultados de GPU única e de 8 vias é promissor, e ser competitivo com o H100 da Nvidia é um grande feito. O MI300X também mostra bons resultados de escalabilidade, pelo menos até oito GPUs — embora isso não necessariamente diga muito sobre como as coisas se escalam ao considerar potencialmente dezenas de milhares de GPUs trabalhando em conjunto para cargas de trabalho de treinamento de LLM.
Claro, quando se trata de comparações de desempenho entre o MI300X da AMD e o mais novo H200 da Nvidia, o último é significativamente mais rápido. Isso se deve em grande parte ao aumento na capacidade e largura de banda da memória, já que o processamento bruto do H200 não mudou em relação ao H100. Além disso, o processador de próxima geração B200 da Nvidia eleva ainda mais a aposta no benchmark MLPerf 4.1 de IA generativa no modelo Llama 2 70B, mas essa é uma conversa diferente, já que o B200 ainda está para chegar ao mercado.
O que resta ver do MI300X da AMD é uma submissão completa no MLPerf 4.1, para todos os nove benchmarks padronizados. Llama 2 70B é apenas um deles, com 3D Unet, BERT (Bidirectional Encoder Representations from Transformers), DLRM (Deep Learning Recommendation Model), GPT-J (Generative Pre-trained Transformer-Jumbo), Mixtral, Resnet, Retinanet e Stable Diffusion XL sendo todos parte da versão atual. Não é incomum que uma empresa envie resultados apenas para um subconjunto desses testes (veja a submissão do B200 da Nvidia), então teremos que esperar para ver o que acontece no restante desses testes de carga de trabalho de inferência.
Fonte: Tom’s Hardware

