Tecnologia

Elon Musk revela supercomputador Cortex com 50.000 Nvidia H100s

As façanhas de supercomputação de Elon Musk continuam avançando esta semana, já que o tecnocrata compartilhou um vídeo de seu recém-renomeado supercluster de IA “Cortex” no X. A recente expansão da fábrica “Giga Texas” da Tesla conterá 70.000 servidores de IA e exigirá 130 megawatts (MW) de refrigeração e energia no lançamento, aumentando para 500 MW até 2026.

O vídeo de Musk do supercluster Cortex mostra a montagem em andamento de um número impressionante de racks de servidores. No vídeo desfocado, os racks parecem estar dispostos em uma matriz de 16 racks de computação por fila, com cerca de quatro racks não-GPU dividindo as filas. Cada rack de computador contém 8 servidores. Em algum lugar entre 16-20 filas de racks de servidores são visíveis no clipe de 20 segundos, então uma estimativa rápida sugere que 2.000 servidores GPU podem ser vistos, menos de 3% da implantação em escala total estimada.

Musk compartilhou na chamada de resultados de julho da Tesla que o supercluster Cortex será o maior cluster de treinamento da Tesla até hoje, contendo “50.000 [Nvidia] H100s, além de 20.000 de nosso hardware.” Este é um número menor do que Musk compartilhou anteriormente, com tweets de junho estimando que o Cortex abrigaria 50.000 unidades do hardware de IA Dojo da Tesla. Comentários anteriores do CEO da Tesla também sugerem que o próprio hardware da Tesla entrará em operação em uma data posterior, com o Cortex esperado para ser alimentado exclusivamente pela Nvidia no lançamento.

O cluster de treinamento Cortex está sendo construído para “resolver a IA do mundo real”, segundo o Twitter de Elon. Na chamada de resultados do segundo trimestre de 2024 da Tesla, isso significa treinar o sistema de piloto automático Full Self Driving (FSD) da Tesla — que alimentará os Teslas de consumo e o prometido produto “Cybertaxi” — e treinar a IA para o robô Optimus, um robô humanoide autônomo esperado para começar a produção limitada em 2025 para ser usado no processo de fabricação da Tesla.

O Cortex chamou a atenção da imprensa graças aos enormes ventiladores em construção para resfriar todo o supercluster, mostrados por Musk em junho. A pilha de ventiladores resfria a solução de resfriamento líquido fornecida pela Supermicro, construída para lidar com 500 MW de resfriamento e energia em plena potência. Para contextualizar, uma usina de carvão média pode produzir cerca de 600 MW de energia.

(Crédito da imagem: Elon Musk via X)

O Cortex junta-se ao estábulo de supercomputadores em desenvolvimento de Elon Musk. Até agora, o primeiro dos centros de dados de Musk a se tornar operacional é o Memphis Supercluster, propriedade da xAI e alimentado por 100.000 Nvidia H100s. Todos os 100.000 servidores de Memphis estão conectados com uma única malha RDMA (acesso remoto à memória direta) e também são resfriados com a ajuda da Supermicro. Musk também anunciou planos para um supercomputador Dojo de $500 milhões em Buffalo, Nova York, outra operação da Tesla.

Espera-se que o Memphis Supercluster também atualize sua base H100 para 300.000 GPUs B200, mas atrasos na produção do Blackwell devido a falhas de design adiaram esse pedido massivo por vários meses. Como um dos maiores clientes únicos de GPUs de IA da Nvidia, Musk parece estar seguindo a matemática do CEO Jensen Huang: “Quanto mais você compra, mais você economiza.” O tempo dirá se isso se provará verdadeiro para Musk e sua coleção de supercomputadores.

Fonte: Tom’s Hardware

Shares:

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *