As unidades de shader de GPU — chamadas de núcleos CUDA na terminologia da Nvidia — e ROPs são aspectos importantes das GPUs modernas. Com a próxima série RTX 50, parece que a Nvidia se concentrou mais no primeiro do que em ambos. Harukaze5719 relata no X (anteriormente Twitter) que as próximas GPUs Blackwell RTX 50-series da Nvidia verão apenas melhorias na contagem de núcleos CUDA em relação às GPUs Ada Lovelace RTX 40-series, com os ROPs permanecendo os mesmos nos vários níveis. A única exceção é o die GB207 de nível de entrada, que terá uma redução de 33% na contagem de ROPs.
ROPs, ou Render Output units (também Raster Operations Pipelines), desempenham um papel vital no pipeline tradicional de renderização 3D da GPU. Como o nome sugere, esses componentes lidam com o processamento de informações de pixel e texel, ou seja, cargas de trabalho de rasterização. Os ROPs geralmente não são tão importantes quanto os núcleos de shader, mas ainda desempenham um papel fundamental no pipeline da GPU. É desejável escalar o número de ROPs em relação ao número de núcleos de shader e outros clusters de processamento para proporcionar um desempenho ideal.
So then might be like this one? All number based on kopite7kimi and formula isn’t change (1 GPC = 1 ROPs / 1 TPC = 2 SM / SM = 128 CUDA)
https://t.co/158neeR86i
pic.twitter.com/xmuvANTXi1
June 11, 2024
As novas informações de Harukaze (baseadas em uma fórmula do popular vazador Kopite7kimi) sugerem que a Nvidia não adicionará mais unidades de saída de renderização à sua variante voltada para jogos da arquitetura de GPU Blackwell. Desde o presumivelmente mainstream GB206 até o die carro-chefe GB202, as várias GPUs supostamente terão a mesma contagem de ROPs que seus predecessores Ada Lovelace (RTX 40-series). O GB207, a única exceção, aparentemente reduzirá ainda mais a contagem de ROPs, com uma redução de 33% em comparação com o AD107.
Pode parecer estranho que a Nvidia não aumente a contagem de ROPs, mas muito provavelmente os arquitetos da empresa acham que já há ROPs suficientes para o Blackwell. Como mencionado anteriormente, os ROPs não são o fator determinante do desempenho da GPU, especialmente em cargas de trabalho modernas que incorporam ray tracing, upscaling e outros efeitos. Mais ROPs não necessariamente significam mais desempenho se a arquitetura se tornar desequilibrada. A Nvidia também pode estar melhorando o desempenho individual dos ROPs no Blackwell, o que explicaria as mudanças rumoradas.
Consideremos a redução de 33% dos ROPs no GB207. O die AD107 da Nvidia tem uma contagem de ROPs idêntica ao ligeiramente maior e, portanto, mais caro AD106. Mas, apesar dessa aparente vantagem, as GPUs baseadas no AD107 nunca conseguiram competir com as GPUs baseadas no AD106. Como mostrado em nossa análise da RTX 4060, o cartão RTX 4060 equipado com AD107 não chega perto da RTX 4060 Ti em desempenho de jogos. As principais diferenças entre os dois são as contagens de núcleos CUDA e outros núcleos de processamento (RT, tensor e textura).
Talvez o AD107 tenha sido “superespecificado” e a Nvidia cortará a contagem de ROPs no GB207, potencialmente criando uma diferença maior para o GB206. Também parece que a Nvidia reduzirá a contagem de núcleos CUDA para apenas 2.560 — menos do que os 3.072 na RTX 4060. O GB206, por sua vez, terá até 4.608 shaders, o mesmo número que o AD106 (mas a RTX 4060 Ti tinha apenas 4.342 núcleos habilitados). Essas mudanças provavelmente criarão uma diferença maior entre as partes GB207 e GB206.
Falando de núcleos CUDA, a Nvidia supostamente terá até 24.576 shaders (192 SMs — Streaming Multiprocessors) no seu die superior GB202. Isso também terá uma interface de memória de 512 bits, que quando acoplada ao GDDR7 pode proporcionar um grande aumento na largura de banda de memória. O GB203, por outro lado, será semelhante ao atual AD103, com até 84 SMs e 10.752 shaders em comparação com 80 SMs e 10.240 núcleos CUDA no AD103, e também a mesma interface de 256 bits (mas com suporte a GDDR7). Isso cria um abismo absolutamente enorme entre o potencial RTX 5090 e o RTX 5080, se esses rumores se confirmarem.
Descendo na pilha, o GB205 substitui o AD104, mas onde o AD104 tinha até 60 SMs e 7.680 shaders, o novo chip aparentemente terá no máximo 50 SMs e 6.400 shaders — e novamente, manterá a mesma interface de memória de 192 bits. O GB206 manterá os mesmos 36 SMs e a contagem de núcleos CUDA de 4.608 que seu predecessor AD106, com uma interface de 128 bits. E por último e menos importante, o die GB207 oferecerá apenas 20 SMs e 2.560 núcleos CUDA, com uma interface de memória GDDR6 de 128 bits.
É importante notar que todas as informações fornecidas devem ser recebidas com uma grande dose de ceticismo. Esses dados não oficiais podem vir de um vazamento ou podem simplesmente ser rumores baseados em suposições. A Nvidia lançará as duas primeiras GPUs da série RTX 50 no final do ano, segundo os rumores atuais, mas os três últimos dies não serão lançados até 2025. Isso deixa muito tempo para mudanças e especulações adicionais. Ainda não ouvimos falar das mudanças arquitetônicas do Blackwell para consumidores, embora seja seguro apostar que haverá melhorias nos núcleos CUDA, Tensor e RT — e potencialmente mudanças nos ROPs e outros elementos também.
Uma coisa é certa: se a Nvidia realmente planeja uma interface de memória de 512 bits e até 192 SMs com a solução GB202 superior, isso não será barato. Desempenho máximo, muito poder e um grande impacto no seu bolso.
Fonte: Tom’s Hardware

