A Nvidia está sendo acusada de coletar milhões de vídeos online para treinar seus próprios produtos de IA. Fontes afirmam que os vídeos não foram apenas destinados à pesquisa, mas deveriam ser usados nos produtos da empresa, incluindo o gerador de mundos 3D Omniverse, sistemas de carros autônomos e o gerador de avatares Digital Humans. Esses relatos supostamente vieram de um ex-funcionário anônimo da Nvidia que compartilhou os dados com 404 Media.
De acordo com o portal, vários funcionários foram instruídos a baixar vídeos para treinar a IA da Nvidia. Muitos levantaram preocupações sobre a legalidade e a ética da ação, mas os gerentes de projeto sempre tranquilizaram a equipe. Ming-Yu Liu, vice-presidente de Pesquisa da Nvidia, supostamente respondeu a uma pergunta dizendo: “Esta é uma decisão executiva. Temos uma aprovação abrangente para todos os dados.”
Não é a primeira vez que uma empresa de tecnologia de IA é acusada de coletar conteúdo online sem permissão. Existem várias ações judiciais contra empresas de IA como OpenAI, Stability AI, Midjourney, DeviantArt e Runway. A Nvidia não está afetada no momento, pois é principalmente conhecida por fornecer centros de dados de chips de IA, o que ajudou a torná-la uma das empresas mais valiosas do mundo.
No entanto, parece que a Nvidia também quer entrar no jogo de processamento de dados criando modelos de IA fundamentais que outras empresas possam utilizar. Para ajudar a empresa a obter uma vantagem no mercado de IA altamente competitivo, a Nvidia estaria mirando treinar seus sistemas usando uma enorme biblioteca de dados de vídeo online.
“Estamos finalizando o pipeline de dados v1 e garantindo os recursos computacionais necessários para construir uma fábrica de dados de vídeo que possa gerar uma experiência visual de vida humana em termos de dados de treinamento por dia”, disse Liu em um e-mail.
Algumas fontes relatam que a Nvidia usou vídeos publicamente disponíveis, dados licenciados exclusivamente para pesquisa não comercial, vídeos do YouTube e até filmes e shows da Netflix. Há até uma sugestão de que a empresa teria alguém assistindo aos filmes enquanto usa tecnologia de captura de tela para gravar da Netflix, embora não possamos confirmar se isso foi uma piada. “Devemos obter muitos vídeos de rostos de alta qualidade com isso”, acrescenta Liu.
A equipe da Nvidia que trabalha no treinamento de IA também deve considerar capturar vídeos de gameplay e envolver a equipe da GeForce Now para ajudá-los a obter isso. No entanto, Jim Fan, um cientista sênior de pesquisa na Nvidia, disse: “Ainda não temos estatísticas ou arquivos de vídeo, porque a infraestrutura ainda não está configurada para capturar muitos vídeos e ações de jogos ao vivo. Existem obstáculos tanto de engenharia quanto regulatórios para superar. Mas adicionaremos dados limpos e processados do GFN (GeForce Now) ao team-vfm assim que chegarem.”
O 404 Media diz que o projeto de IA, chamado Cosmos, começou em fevereiro de 2024. Em março, a equipe havia baixado 100.000 vídeos, e em maio, um e-mail disse que eles haviam compilado 38,5 milhões de URLs, com quase 40% deles vindo de vídeos cinematográficos.
Não está claro a profundidade e a extensão do projeto Cosmos na Nvidia, mas o 404 Media citou o CEO da Nvidia, Jensen Huang, respondendo a um e-mail sobre o assunto com: “Ótima atualização. Muitas empresas precisam construir modelos fundamentais de vídeo. Podemos oferecer um pipeline totalmente acelerado.”
A Nvidia provavelmente está correndo para construir seu modelo enquanto questões de direitos autorais e outros problemas de treinamento de IA ainda não foram resolvidos, resultando em uma enorme área cinzenta legal. No momento, não há uma lei específica que trate do treinamento de IA, mas os legisladores já estão atentos. Vários projetos de lei no Congresso abordam especificamente isso, como o AI Foundation Model Transparency Act e o Generative AI Copyright Disclosure Act.
O Google argumenta que a coleta de IA é ‘Uso Justo’, mas não sabemos onde essas leis nos levarão. Portanto, enquanto nada está claro, muitas empresas querem tirar o máximo proveito dos dados online para ganhar uma vantagem competitiva.
Fonte: 404 Media


