A Nvidia está se preparando para lançar mais uma GPU voltada para a China, com o objetivo de cumprir as regulamentações de exportação dos EUA. Fontes da Reuters revelam que a mais recente GPU da Nvidia será uma ramificação do Blackwell B200, a GPU de IA mais rápida da Nvidia até hoje. A GPU deve ser lançada no próximo ano, mas as especificações ainda são uma incógnita.
Provisoriamente chamada de “B20”, o novo chip será distribuído na China pela Inspur, um dos principais parceiros da Nvidia na região. O B20 deve fazer sua estreia oficial no segundo trimestre de 2025.
As especificações são completamente desconhecidas neste momento em relação à GPU Blackwell reduzida, embora pareça inevitável que o B20 será uma peça de nível de entrada — um contraste marcante com o B200 e seu desempenho líder de mercado em IA. Os EUA têm regulamentações rigorosas de desempenho para exportações de GPU para a China, usando uma métrica chamada “Potência Total de Processamento” (TPP), que leva em conta a quantidade de TFLOPS e a precisão das capacidades de computação de uma GPU. Especificamente, multiplique os TFLOPS (sem esparsidade) pela precisão em bits para obter o TPP.
O limite atual é de 4.800 TPP. Para referência, o Hopper H100 e H200 ultrapassam esse limite, com 16.000 TPP em ambas as GPUs — a métrica não leva em conta diretamente a largura de banda ou capacidade de memória, que são as principais melhorias que o H200 traz. Até mesmo a RTX 4090 ultrapassa o limite com seus 660,6 TFLOPS de computação FP8. A GPU de desktop mais poderosa da Nvidia que permanece dentro do limite de 4.800 TPP é a RTX 4090D, que foi construída especificamente para cumprir as restrições de exportação.
O Blackwell eleva o nível de desempenho de computação, com uma solução de dois chips potencialmente entregando cerca de 4.500 TFLOPS de computação FP8. Isso o tornaria 7,5 vezes o limite permitido. Mesmo o B100 menor entregará 3,5 PFLOPS de computação FP8 densa, ou 28.000 TPP.
O B20 também enfrenta restrições adicionais, já que os EUA também impõem uma restrição de “densidade de desempenho” (PD) direcionada especificamente a GPUs de data center (GPUs de consumo estão isentas dessa restrição). Pegue a pontuação TPP e divida pelo tamanho do chip para obter a métrica PD; qualquer valor acima de 6,0 é restrito. Usando essa métrica, todas as GPUs da série RTX 40 seriam restritas para uso em data center, e o Blackwell deve melhorar sobre a densidade e desempenho do Ada Lovelace. Então, a Nvidia precisará reduzir severamente o desempenho do B20 e/ou usar um chip proporcionalmente maior para cumprir as regulamentações. (Ainda não sabemos o tamanho exato do chip do já anunciado B200.)
Esperamos que o B20 seja um sucessor das GPUs de IA de nível de entrada A30 e H20 da Nvidia. O H20, por exemplo, oferece apenas 296 TFLOPS de FP16, em comparação com 1.979 TFLOPS no H100/H200. Isso é um TPP de 2.368, para manter o PD abaixo de 6,0 — tem uma classificação PD de apenas 2,90. O A30, por sua vez, tem uma classificação TPP de 2.640 e uma pontuação PD de 3,20. Portanto, há espaço para a Nvidia criar uma GPU de IA mais rápida para a China… só não muito mais rápida.
Não podemos deixar de pensar que o B20 será um chip difícil de vender. Tanto o Ampere quanto o Hopper já estão além do limite de desempenho, então a Nvidia criou SKUs específicos para a China para cumprir as regulamentações. Todos os avanços na arquitetura Blackwell a empurram ainda mais para a não conformidade, já que o TPP máximo não mudou, o que significa retroceder o desempenho para permanecer em conformidade. Melhor cenário? A Nvidia estaria procurando criar uma GPU com talvez 4.000–4.500 TPP e um tamanho de chip de 800 mm².
Fonte: Reuters

