A Apple revelou que não usou os aceleradores de hardware da Nvidia para desenvolver os recursos recentemente divulgados do Apple Intelligence. De acordo com um artigo de pesquisa oficial da Apple (PDF), a empresa confiou nos TPUs do Google para processar os dados de treinamento por trás dos Apple Intelligence Foundation Language Models.
Sistemas equipados com chips Google TPUv4 e TPUv5 foram fundamentais para a criação dos Apple Foundation Models (AFMs). Esses modelos, AFM-server e AFM-on-device, foram projetados para alimentar recursos online e offline do Apple Intelligence, anunciados na WWDC 2024 em junho.
AFM-server é o maior LLM da Apple e, portanto, permanece apenas online. De acordo com o artigo de pesquisa recentemente divulgado, o AFM-server da Apple foi treinado em 8.192 chips TPUv4 “provisionados como 8 × 1.024 fatias de chips, onde as fatias são conectadas pela rede do data center (DCN).” O pré-treinamento foi um processo de três etapas, começando com 6,3T tokens, continuando com 1T tokens e depois alongando o contexto usando 100B tokens.
A Apple disse que os dados usados para treinar seus AFMs incluíam informações coletadas do rastreador web Applebot (obedecendo ao robots.txt) além de vários datasets licenciados de “alta qualidade”. Também aproveitou dados públicos cuidadosamente escolhidos de código, matemática e outros datasets.
Claro, o modelo ARM-on-device é significativamente reduzido, mas a Apple acredita que suas técnicas de destilação de conhecimento otimizaram o desempenho e a eficiência desse modelo menor. O artigo revela que o AFM-on-device é um modelo de 3B parâmetros, destilado do modelo de 6.4B do servidor, que foi treinado nos 6.3T tokens completos.
Ao contrário do treinamento do AFM-server, clusters de TPUv5 do Google foram usados para preparar o modelo ARM-on-device. O artigo revela que “AFM-on-device foi treinado em uma fatia de 2.048 chips TPUv5p.”
É interessante ver a Apple divulgando um artigo tão detalhado, revelando técnicas e tecnologias por trás do Apple Intelligence. A empresa não é conhecida por sua transparência, mas parece estar se esforçando para impressionar na área de IA, talvez por ter chegado tarde ao jogo.
De acordo com os testes internos da Apple, AFM-server e AFM-on-device se destacam em benchmarks como Instruction Following, Tool Use, Writing e mais. Incorporamos o gráfico de Writing Benchmark, acima, como exemplo.
Se você estiver interessado em mais detalhes sobre o treinamento e as otimizações usadas pela Apple, além de mais comparações de benchmarks, confira o PDF linkado na introdução.
Fonte: Tom’s Hardware


