NotíciasProdutos

Micron estuda NAND colada na GPU para rodar LLMs maiores

Micron avalia NAND de alta resistência junto da GPU como camada entre HBM e SSD, para rodar LLMs maiores com menos placas. Entenda o conceito.
Micron estuda memória NAND próxima da GPU para rodar LLMs maiores
Foto: reprodução / TechPowerUp

A Micron está estudando colocar memória NAND próxima da GPU — não no fundo do subsistema de armazenamento, atrás de várias camadas de protocolo, mas praticamente colada ao processador gráfico. O objetivo é claro: permitir que modelos de linguagem gigantes rodem em sistemas com menos GPUs.

Segundo reportagem da TechPowerUp, com base em informações do DigiTimes, o conceito é chamado internamente de “near-GPU NAND” e consiste em módulos flash de alta resistência posicionados no próprio pacote ou na PCB da placa de vídeo.

Uma camada nova na hierarquia de memória

Hoje, o caminho dos dados numa carga de IA é bastante desigual. No topo está a HBM, absurdamente rápida e absurdamente cara. Embaixo está o armazenamento em SSD, barato e vasto, mas lento demais para inferência. No meio, um vazio.

É exatamente esse vazio que a proposta pretende ocupar:

  • Densidade menor que a NAND TLC ou QLC convencional
  • Foco em velocidade de I/O, largura de banda e tempo de leitura, em vez de capacidade máxima
  • Centenas de gigabytes acessíveis diretamente pela GPU
  • Custo muito abaixo do de HBM ou DRAM convencional
  • Resistência elevada, para suportar ciclos intensos de leitura e escrita

Na prática, seria um buffer muito rápido entre a memória da GPU e o armazenamento do sistema. E isso muda a economia da inferência: modelos deixam de ser limitados pela memória, podendo rodar em máquinas com menos placas de vídeo e mais camadas de memória e armazenamento compensando o volume necessário.

A Micron não está sozinha nessa corrida

SK hynix e Sandisk já padronizaram um conceito equivalente sob o nome High-Bandwidth Flash (HBF), com a mesma proposta de estender o espaço de HBM da GPU aproximando a NAND e tornando-a mais durável.

O desafio comum a todos é o mesmo: fechar a lacuna de largura de banda e de resistência. NAND, por natureza, é mais lenta e tem vida útil de escrita limitada em comparação com DRAM. Sem resolver esses dois pontos, a camada intermediária vira gargalo em vez de solução.

Precisa dimensionar armazenamento para IA e dados?

SSDs, storages e servidores com nota fiscal eletrônica, garantia oficial e faturamento empresarial em até 90 dias.

Ver storages na GOIG
Pedir cotação no WhatsApp

Primeira compra? Use o cupom BEMVINDOGOIG e ganhe 5% de desconto.

Por que isso interessa a empresas brasileiras

A conta da IA local hoje esbarra quase sempre no mesmo lugar: memória. Rodar um modelo grande exige VRAM suficiente para mantê-lo residente, e VRAM é justamente o componente cujo preço mais subiu com a demanda dos data centers.

Se a NAND próxima da GPU se consolidar, o efeito para o comprador corporativo é direto: menos placas de vídeo necessárias para o mesmo modelo, ou modelos maiores rodando no mesmo orçamento. Para empresas que precisam manter dados dentro de casa por exigência de LGPD ou por contrato, isso pode ser a diferença entre viabilizar um projeto de IA interna ou continuar dependendo de API externa.

O que não muda no curto prazo

Vale calibrar a expectativa. Isso ainda é pesquisa e padronização, não produto em prateleira. Quem está dimensionando infraestrutura de IA em 2026 precisa trabalhar com o que existe hoje: memória unificada em plataformas compactas, GPUs profissionais com VRAM generosa e SSDs NVMe rápidos para o pipeline de dados.

A boa notícia é que a direção do mercado está clara. Como observa a TechPowerUp, com Micron, SK hynix e Sandisk empurrando o mesmo conceito em paralelo, a chance de virar padrão é alta.

Perguntas frequentes sobre NAND próxima da GPU

O que é near-GPU NAND?

É uma proposta de posicionar módulos de memória NAND de alta resistência no pacote ou na PCB da GPU, criando uma camada intermediária entre a memória gráfica e o armazenamento do sistema.

Isso substitui a HBM?

Não. A ideia é complementar a HBM, oferecendo uma camada mais barata e densa para dados que não exigem a latência extrema da memória de alta largura de banda.

O que é High-Bandwidth Flash?

É o conceito equivalente padronizado por SK hynix e Sandisk, com a mesma proposta de aproximar a NAND da GPU e aumentar sua durabilidade.

Qual a vantagem para rodar LLMs?

Modelos deixam de ser limitados pela memória disponível, permitindo rodar cargas maiores em sistemas com menos GPUs e custo total mais baixo.

Quando essa tecnologia chega ao mercado?

Ainda está em fase de exploração e padronização. Não há previsão de produtos comerciais divulgada pelas fabricantes.

Infraestrutura de IA e dados sob medida

Workstations, servidores, SSDs e storages dimensionados para a sua carga de trabalho, com atendimento consultivo e orçamento rápido.

Ver soluções de IA na GOIG
Falar com um especialista

Faturamento empresarial em até 90 dias e nota fiscal eletrônica para CNPJ.

Fonte original: TechPowerUp, com informações do DigiTimes. Imagem: reprodução / TechPowerUp.

Shares:

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *