As instruções AVX-512 podem aumentar significativamente o desempenho em várias cargas de trabalho, mas a forma como essas instruções foram implementadas nas CPUs causou uma queda significativa na frequência e um aumento no consumo de energia. No entanto, como o AVX-512 é implementado nos processadores Ryzen 9000 da AMD, baseados na arquitetura Zen 5, não causa uma queda considerável na velocidade do clock nem um aumento massivo no consumo de energia, conforme testado por InstLatX64.
Como se constata, o Ryzen 9 9950X da AMD reduz a frequência em 10% com uso intenso de AVX-512: ele reduz a velocidade do clock de 5.700 MHz para 5.300 MHz, o que não é substancial e está em linha com o que AMD disse em uma entrevista com o Tom’s Hardware em julho. Em contraste, os processadores da Intel que suportam AVX-512 (a empresa é conhecida por desativar o AVX-512 nos CPUs Alder Lake e Raptor Lake por vários motivos) geralmente reduzem drasticamente seus clocks ao executar instruções AVX-512.
Em certa medida, isso acontece porque os CPUs da Intel que suportam AVX-512 são feitos em tecnologias de processo bastante desatualizadas. Por outro lado, caminhos de dados largos consomem muita energia, então ainda resta saber quanto de energia os processadores da série Ryzen 9000 da AMD (que são feitos na tecnologia de processo N4P de 4nm da TSMC) consomem ao executar instruções AVX-512.
Os processadores desktop baseados na arquitetura Zen 5 da AMD possuem quatro unidades de execução de 512 bits de largura total para AVX-512, o que torna a execução dessas instruções muito eficiente (já que algumas partes usam unidades AVX-256 de bomba dupla para executar instruções de 512 bits), mas ao custo do tamanho do die.
Desktops de alto desempenho, estações de trabalho e servidores são frequentemente usados para várias cargas de trabalho vetoriais dos domínios de IA e HPC, então implementar corretamente o AVX-512 foi crucial para a AMD ao projetar sua implementação Zen 5 para desktops e servidores. No entanto, as partes móveis da AMD, como os processadores com codinome Strix Point, usam AVX-256 de bomba dupla para executar instruções AVX-512.
Embora essa abordagem provavelmente confunda desenvolvedores de software e, em certa medida, os usuários finais, deve-se notar que, ao evitar a implementação de caminhos de dados completos de 512 bits, a AMD torna seus núcleos ligeiramente mais compactos. Isso permite que a empresa embale mais núcleos em seus processadores, e mais núcleos trazem maior desempenho para mais usuários do que o AVX-512 sozinho.
Fonte: Tom’s Hardware

