Algumas das empresas mais ricas do mundo, incluindo Apple e Nvidia, estão entre as inúmeras partes que supostamente treinaram suas IAs usando vídeos do YouTube extraídos como dados de treinamento. As transcrições do YouTube foram supostamente acumuladas por meios que violam os Termos de Serviço do YouTube e deixaram alguns criadores indignados. A notícia foi descoberta em uma investigação conjunta da Proof News e Wired.
Enquanto grandes empresas e produtores de IA frequentemente mantêm seus dados de treinamento em segredo, gigantes como Apple, Nvidia e Salesforce revelaram seu uso de “The Pile”, um conjunto de dados de treinamento de 800GB criado pela EleutherAI, e o conjunto de dados YouTube Subtitles dentro dele. Os dados de treinamento do YouTube Subtitles são compostos por 173.536 transcrições em texto simples do YouTube extraídas do site, incluindo mais de 12.000 vídeos que foram removidos desde a criação do conjunto de dados em 2020.
Partes afetadas cujo trabalho foi supostamente extraído para os dados de treinamento incluem canais educacionais como Crash Course (1.862 vídeos usados para treinamento) e Philosophy Tube (146 vídeos usados), estrelas do YouTube como MrBeast (dois vídeos) e Pewdiepie (337 vídeos), e TechTubers como Marques Brownlee (sete vídeos) e Linus Tech Tips (90 vídeos). A Proof News criou uma ferramenta que você pode usar para pesquisar a totalidade dos vídeos do YouTube supostamente usados sem consentimento.
EleutherAI é uma força considerável no espaço de treinamento de IA. O laboratório de pesquisa de IA sem fins lucrativos é um dos muitos que visam “democratizar” a IA para as massas, com seu site afirmando o objetivo de “garantir que a capacidade de estudar modelos de base não seja restrita a um punhado de empresas”. The Pile e YouTube Subtitles foram criados com esse propósito, para fornecer dados de alta qualidade até mesmo para os codificadores de IA mais caseiros. No entanto, esse sonho idílico de apoiar o pequeno com The Pile tornou-se outra fonte de combustível para grandes corporações treinarem IA, em vez de DIYers.
No entanto, o YouTube Subtitles viola os Termos de Serviço do YouTube com base no uso do conteúdo do YouTube sem permissão e no uso de “meios automatizados” para acessar os dados. No artigo de pesquisa sobre The Pile e YouTube Subtitles, a EleutherAI reconhece sua violação dos TOS, mas afirma que as ferramentas usadas para extrair dados do YouTube já eram amplamente difundidas o suficiente para que nenhum dano adicional fosse causado.
Muitos dos afetados reagiram fortemente contra o uso de seu conteúdo. Abigail Thorn, produtora do canal do YouTube Philosophy Tube e atriz em House of the Dragon, compartilhou no X (anteriormente Twitter): “Quando me contaram sobre isso, eu deitei no chão e chorei, é tão violador, me fez querer parar de escrever para sempre. A razão pela qual me levantei foi porque sei que meu público vem ao meu show para uma conexão real e ideias, não lixo barato de IA.”
Ela continuou: “Gostaria de ver o YouTube fazer mais para evitar roubos como esse.” Thorn e outros YouTubers confirmam que ninguém jamais solicitou inicialmente a extração ou o uso posterior de qualquer um dos vídeos como dados de treinamento.
Quem culpar é difícil, pois ninguém aceitará a culpa ou a responsabilidade pelo uso das transcrições. A Apple e outras grandes empresas de tecnologia que usaram os dados de treinamento evitam a culpa porque não foram elas que fizeram a extração, embora conversas devam ser realizadas dentro dessas empresas sobre a obtenção ética de dados de treinamento. A EleutherAI, criadora do conjunto de dados, não respondeu a nenhum pedido de comentário das publicações e rejeita qualquer irregularidade ou dano em seu artigo de pesquisa inicial sobre The Pile.
A indústria de tecnologia está gastando em hardware de IA a uma taxa insustentável, com o mercado de IA precisando gerar $600 bilhões em lucro por ano para acompanhar sua compra insana de hardware. À medida que as empresas buscam gastar menos em IA, mais casos de dados obtidos ilicitamente se tornam mais prováveis, como esse roubo do YouTube e o Gemini do Google lendo arquivos sem permissão. Em pouco tempo, pode não ser chocante ver o conteúdo da web terminar com “Você excedeu o limite de taxa do GPT. Não se esqueça de esmagar o botão de curtir!”
Fonte: Proof News


