O magnata da tecnologia Elon Musk foi ao Twitter/X para se gabar de ter iniciado “o cluster de treinamento de IA mais poderoso do mundo”, que ele usará para criar a autoproclamada “IA mais poderosa do mundo por todos os critérios até dezembro deste ano”. Hoje, o Memphis Supercluster da xAI começou o treinamento de IA usando 100.000 GPUs Nvidia H100 resfriadas a líquido, conectadas com um único tecido RDMA (acesso remoto direto à memória).
Nice work by @xAI team, @X team, @Nvidia & supporting companies getting Memphis Supercluster training started at ~4:20am local time. With 100k liquid-cooled H100s on a single RDMA fabric, it’s the most powerful AI training cluster in the world! July 22, 2024
Se Musk pessoalmente acionou o interruptor para iniciar o supercluster parece improvável, já que foi notado que a tarefa gigantesca começou às 4h20 CDT, mas como você pode ver abaixo, ele ajudou o técnico de fibra óptica.
Em maio, relatamos a ambição de Musk de abrir a Gigafactory of Compute até o outono de 2025. Na época, Musk se apressou para começar a trabalhar no supercluster, necessitando a compra de GPUs H100 da geração atual ‘Hopper’. Isso parecia sinalizar que o magnata da tecnologia não tinha paciência para esperar pelos chips H200, sem mencionar as próximas GPUs B100 e B200 baseadas em Blackwell. Isso apesar da expectativa de que as novas GPUs de data center Nvidia Blackwell seriam enviadas antes do final de 2024.
Come help xAI route photons as a elite fiber tech in Memphis! pic.twitter.com/JJShV75May July 15, 2024
Então, se a Gigafactory of Compute foi anunciada para abrir até o outono de 2025, a notícia de hoje significa que o projeto foi concluído um ano antes? Pode ser que sim, mas parece mais provável que as fontes que falaram com a Reuters e The Information no início deste ano tenham se enganado ou sido mal interpretadas quanto ao cronograma do projeto. Além disso, com o xAI Memphis Supercluster já em funcionamento, as perguntas sobre por que a xAI não esperou por GPUs mais poderosas ou de próxima geração foram respondidas.
Glad to be making history with @elonmusk, such a great experience to work with his Memphis team! To meet the target, our execution had to be as perfect as possible, as quick as possible, as efficient as possible and as environmentally friendly as possible – lots of hard work, but… July 22, 2024
A Supermicro forneceu grande parte do hardware, e o CEO da empresa, Charles Liang, também comentou na thread de Musk, elogiando a execução da equipe. Isso segue as recentes palavras elogiosas de Liang para os data centers de IA resfriados a líquido de Musk.
Em um Tweet de acompanhamento, Musk explica que o novo supercluster estará “treinando a IA mais poderosa do mundo por todos os critérios”. De declarações anteriores de intenção, assumimos que o poder da instalação de 100.000 GPUs H100 da xAI agora será direcionado ao treinamento do Grok 3. Musk disse que o LLM refinado deve terminar a fase de treinamento “até dezembro deste ano”.
Para colocar os recursos de computação do Memphis Supercluster em algum contexto, certamente, em termos de escala, o novo xAI Memphis Supercluster supera facilmente qualquer coisa na lista mais recente do Top500 em termos de potência de GPU. Os supercomputadores mais poderosos do mundo, como o Frontier (37.888 GPUs AMD), Aurora (60.000 GPUs Intel) e Microsoft Eagle (14.400 GPUs Nvidia H100) parecem ser significativamente superados pela máquina da xAI.
Fonte: Tom’s Hardware

