“`html
Nvidia e Mistral AI lançaram um novo modelo de linguagem pequeno que supostamente apresenta precisão “de última geração” em um formato reduzido. O novo LM é conhecido como Mistral-NemMo-Minitron 8B, uma versão miniaturizada do NeMo 12B que foi reduzida de 12 bilhões para 8 bilhões de parâmetros.
O novo modelo de linguagem pequeno de 8 bilhões de parâmetros foi reduzido por meio de dois métodos diferentes de otimização de IA, disse Bryan Catanzaro, VP de pesquisa em deep learning da Nvidia, em um post no blog. A equipe por trás do novo LM usou um processo que combina poda e destilação. “A poda reduz o tamanho de uma rede neural removendo pesos do modelo que contribuem menos para a precisão. Durante a destilação, a equipe re-treinou esse modelo podado em um pequeno conjunto de dados para aumentar significativamente a precisão, que havia diminuído durante o processo de poda.”
Essas otimizações permitiram aos desenvolvedores treinar o modelo de linguagem otimizado em uma “fração do conjunto de dados original”, resultando em até 40x de economia de custos em termos de computação bruta. Normalmente, os modelos de IA precisam equilibrar entre o tamanho do modelo e a precisão, mas com as novas técnicas de poda e destilação da Nvidia e Mistral AI, os modelos de linguagem podem ter o melhor dos dois mundos.
O Mistral-NeMo-Minitron 8B, armado com essas melhorias, supostamente lidera nove benchmarks de IA orientados por linguagem com tamanho semelhante. A quantidade de poder de computação economizado é suficiente para que laptops e PCs de workstation executem o Minitron 8B localmente, tornando-o mais rápido e mais seguro de operar em comparação com serviços em nuvem.
A Nvidia projetou o Minitron 8B em torno de hardware de computador baseado no consumidor. O LM é embalado como um microserviço Nvidia NIM, e o modelo de IA é otimizado para baixa latência, o que melhora os tempos de resposta. A Nvidia fornece seu serviço de modelo personalizado, AI Foundry, para pegar o Minitron 8B e manipulá-lo para funcionar em sistemas ainda menos poderosos, como smartphones. A precisão e o desempenho não serão tão bons, mas a Nvidia afirma que o modelo ainda seria um LM de alta precisão, exigindo uma fração dos dados de treinamento e da infraestrutura de computação que precisaria de outra forma.
A poda e a destilação parecem ser a próxima fronteira para a otimização de desempenho da inteligência artificial. Teoricamente, não há nada impedindo os desenvolvedores de aplicarem essas técnicas de otimização a todos os modelos de linguagem atuais, o que aumentaria significativamente o desempenho em geral, incluindo modelos de linguagem grandes que só podem ser alimentados por fazendas de servidores aceleradas por IA.
Fonte: Nvidia Blog
“`

