Japão: Venda de livros por tonelada alimenta IAs nos EUA
Sebos no Japão registram um aumento sem precedentes nas vendas de livros usados, com a exportação de mais de 50 toneladas de obras para os Estados Unidos desde o ano passado. A movimentação atípica no mercado livreiro japonês levanta fortes suspeitas de que as compras em massa estão sendo realizadas por empresas de tecnologia americanas para abastecer o treinamento de sistemas de Inteligência Artificial (IA), especialmente Grandes Modelos de Linguagem (LLMs).
Padrão de Compra e Volume Incomum
Lojas de livros usados em diversas regiões do Japão têm reportado um volume de vendas até cinco vezes maior que o normal, com centenas de exemplares sendo negociados diariamente. O que mais intriga os livreiros é o perfil dos títulos procurados: em vez de best-sellers e ficção popular, a demanda se concentra em obras de áreas como filosofia, história, medicina, direito, política, cultura japonesa, além de publicações sobre o período Edo e ensaios políticos antigos. Esse padrão sugere uma busca por conteúdo denso e diversificado, ideal para enriquecer a base de dados de IAs.
Logística Misteriosa e Destino Final
Investigações da emissora japonesa NTV revelaram que centenas de pedidos, feitos por diferentes contas, convergiam para um único endereço em um centro logístico na cidade de Okayama. Desse ponto, as obras eram despachadas para os Estados Unidos. A empresa responsável pelo centro logístico, no entanto, não divulgou a identidade dos compradores, aumentando o mistério em torno da operação.
Digitalização Destrutiva para Treinamento de IA
A principal hipótese é que os livros físicos são adquiridos para serem digitalizados. O processo, frequentemente denominado digitalização destrutiva, envolve o corte da lombada dos livros para que as páginas possam ser escaneadas em alta velocidade por equipamentos industriais. Após a conversão para formato digital, os exemplares físicos são, em muitos casos, descartados. Essa metodologia permite que as empresas de IA processem milhões de volumes de forma rápida e eficiente.
Precedentes e Implicações Legais
A prática de adquirir grandes volumes de livros para treinamento de IA não é nova. A empresa Anthropic, desenvolvedora do chatbot Claude, esteve no centro de um processo judicial nos Estados Unidos. Documentos do caso expuseram que a Anthropic comprou milhões de livros físicos, digitalizou seu conteúdo e os utilizou para treinar seus modelos de linguagem. Embora uma decisão judicial inicial em 2025 tenha considerado o uso como “fair use” (uso justo) dentro das leis de direitos autorais americanas, o caso levantou discussões significativas sobre a ética e legalidade da prática.
Por que livros antigos e específicos?
A preferência por obras mais antigas e de nicho pode ser explicada pela busca por conteúdo de alta qualidade e original, publicado antes de 2022, ano de lançamento do ChatGPT. Isso ajuda as empresas de IA a evitar o que é conhecido como “AI slop” – conteúdo de baixa qualidade gerado por IA que pode contaminar os bancos de dados e prejudicar o treinamento de novos modelos. Ao focar em fontes humanas originais, as desenvolvedoras buscam aprimorar a capacidade de suas IAs de gerar textos mais precisos e bem informados.
Desdobramentos e o Futuro do Conhecimento
O fenômeno no Japão reflete uma tendência global no mercado de IA, onde a demanda por dados para treinamento de modelos de linguagem continua a crescer exponencialmente. Enquanto livreiros veem um inesperado impulso nas vendas, levantam-se questões sobre o destino do patrimônio literário e a preservação do conhecimento físico. A discussão sobre o licenciamento de dados e a digitalização não destrutiva ganha força, com propostas para que as próprias instituições ou criadores digitalizem e licenciem seus acervos, garantindo a integridade das obras e um controle maior sobre seu uso.
