Em sebos e livrarias ao redor do mundo, empresas de tecnologia adquirem silenciosamente acervos de livros antigos e raros para submetê-los à chamada 'digitalização destrutiva' — um processo pelo qual as obras são escaneadas e então fisicamente descartadas, transformadas em dados para alimentar modelos de inteligência artificial. A prática é legal, mas levanta questões que transcendem a legalidade: o que significa destruir deliberadamente um objeto cultural insubstituível em nome do progresso algorítmico? Enquanto tribunais nos Estados Unidos debatem os limites do direito autoral, a humanidade
Gigantes da IA destroem livros raros em 'digitalização destrutiva' para treinar algoritmos
Uma obra rara, uma vez destruída, não volta
Por que as empresas de IA preferem livros antigos em vez de simplesmente usar textos disponíveis online?
Porque um livro de 1950 foi escrito por um ser humano, do começo ao fim. Não tem influência de algoritmos, não tem viés de IA. É texto puro, humano. Os textos online de hoje já podem ter sido tocados por ferramentas de IA, o que contamina o treinamento.
Mas eles estão comprando legalmente. Qual é exatamente o problema moral?
O problema é que legal não é a mesma coisa que certo. Você pode comprar legalmente um quadro de Picasso e queimá-lo. Ninguém vai prender você. Mas você destruiu algo que não pode ser recriado. Com livros raros é assim — uma vez que a cópia física desaparece, se era a última, desapareceu para sempre.
As empresas diriam que estão preservando o conteúdo em formato digital.
Estão preservando o texto, sim. Mas não estão preservando o livro. Um livro antigo é mais que palavras — é um objeto histórico, um artefato. A encadernação, o papel, a tipografia, tudo conta uma história sobre como as pessoas faziam coisas naquela época. Quando você destrói o objeto, perde tudo isso.
E quanto aos direitos dos autores? As empresas estão usando essas obras para treinar máquinas que depois competem com escritores vivos.
Exatamente. Um autor que publicou um livro em 1985 nunca concordou que seu trabalho seria usado para treinar uma IA que agora escreve histórias. Mas como o livro foi vendido legalmente, a empresa diz que tem direito. Os tribunais ainda estão tentando decidir se isso é verdade.
Isso vai continuar acontecendo?
Provavelmente. Enquanto houver livros antigos disponíveis e as empresas precisarem de dados para treinar modelos, a pressão vai existir. A única coisa que pode mudar isso é uma decisão legal clara ou uma mudança na forma como essas empresas obtêm dados de treinamento.
The Pulse
- A demanda voraz por texto humano 'puro' — escrito antes da era da IA generativa — transformou livros antigos em matéria-prima estratégica para as grandes empresas de tecnologia.
- Livreiros em vários países relatam uma procura anormal por títulos esgotados e obras raras, compradas em lotes por intermediários que ocultam a identidade dos verdadeiros compradores.
- Obras que existiam em apenas dois ou três exemplares no mundo podem ter desaparecido para sempre, destruídas após a extração digital de seu conteúdo.
- Processos judiciais nos Estados Unidos questionam se digitalizar em massa obras protegidas por copyright para treinar IA constitui uso legítimo ou violação dos direitos de autores e editoras.
- As empresas defendem a legalidade das aquisições, mas críticos alertam que o verdadeiro custo é pago pelo patrimônio cultural coletivo — e pelos próprios criadores, cujas obras agora treinam concorrentes artificiais.
Em sebos e livrarias ao redor do mundo, empresas de tecnologia adquirem silenciosamente acervos de livros antigos e raros para submetê-los à chamada 'digitalização destrutiva' — um processo pelo qual as obras são escaneadas e então fisicamente descartadas, transformadas em dados para alimentar modelos de inteligência artificial. A prática é legal, mas levanta questões que transcendem a legalidade: o que significa destruir deliberadamente um objeto cultural insubstituível em nome do progresso algorítmico? Enquanto tribunais nos Estados Unidos debatem os limites do direito autoral, a humanidade se vê diante de uma escolha silenciosa entre preservar sua memória escrita e acelerar a criação de máquinas que aprendem com ela.
Nos sebos e livrarias especializadas de todo o mundo, intermediários contratados por empresas de tecnologia chegam discretamente, compram centenas ou milhares de livros antigos e desaparecem com eles. O destino desses volumes é perturbador: suas encadernações são removidas, as páginas escaneadas em alta velocidade e os originais descartados. Chama-se digitalização destrutiva — e seu único objetivo é alimentar algoritmos de inteligência artificial com texto escrito exclusivamente por seres humanos.
A lógica por trás da prática é fria e precisa. Livros publicados antes de 2022, quando a IA generativa ainda não havia contaminado a produção textual, são considerados ouro puro para o treinamento de modelos. Um romance do século XIX ou uma coleção de ensaios dos anos 1980 valem não pelo que dizem, mas pelo que representam: palavras humanas sem interferência de máquinas. Quanto mais antigo, mais valioso para os algoritmos.
O efeito colateral é uma pressão inédita sobre acervos históricos. Obras raras que talvez existissem em apenas três cópias no mundo podem ter desaparecido para sempre. Preservacionistas e livreiros alertam que o patrimônio bibliográfico está sendo consumido de forma irreversível — não pelo esquecimento, mas pela destruição deliberada em nome do progresso tecnológico.
Sobre tudo isso paira ainda a sombra jurídica dos direitos autorais. Nos Estados Unidos, processos em andamento investigam se a digitalização em massa de obras protegidas configura uso legítimo ou violação. As empresas sustentam que apenas processam o que compraram legalmente. Os críticos respondem que estão se apropriando da criatividade humana para construir máquinas que depois competem com os próprios autores. Os tribunais ainda não decidiram — mas os sebos continuam vendendo, os intermediários continuam comprando e as máquinas continuam devorando páginas.
Nos sebos e livrarias especializadas de todo o mundo, algo inusitado está acontecendo. Empresas de tecnologia chegam com intermediários, compram centenas ou milhares de livros antigos e raros, e desaparecem com eles. O que fazem depois é o que preocupa preservacionistas, livreiros e colecionadores: destroem os volumes físicos.
A prática tem um nome: digitalização destrutiva. O processo é simples e brutal. Os livros são adquiridos legalmente, suas encadernações são removidas, as páginas são escaneadas em alta velocidade por máquinas especializadas, e então os volumes originais são descartados. O que importa é apenas o arquivo digital — o conteúdo capturado em bits, pronto para alimentar algoritmos de inteligência artificial. O objeto físico, não importa sua idade ou raridade, vira lixo.
A corrida pela criação de sistemas de IA cada vez mais sofisticados criou uma demanda voraz por texto. As empresas do setor descobriram que livros publicados antes da explosão da inteligência artificial generativa — digamos, antes de 2022 — contêm algo precioso: palavras escritas exclusivamente por seres humanos, sem qualquer contaminação de ferramentas de IA. Esses textos são ouro para treinar modelos. Um livro de 1950, um romance do século XIX, uma coleção de ensaios dos anos 1980 — tudo serve. E quanto mais antigo, mais puro, melhor.
O efeito colateral é uma pressão nunca vista antes sobre acervos históricos. Livreiros em diversos países começaram a notar algo estranho: uma procura anormal por títulos esgotados, obras fora de catálogo, livros que ninguém procurava há anos. As compras vêm em lotes grandes, feitas por intermediários cujos nomes não revelam quem realmente está por trás. É difícil rastrear. É fácil desaparecer com um livro raro que talvez existisse em apenas três cópias no mundo.
O debate que isso acendeu é profundo. Sim, as empresas estão comprando esses livros legalmente. Ninguém está roubando. Mas há algo que incomoda: a destruição deliberada de patrimônio cultural. Uma obra rara, uma vez destruída, não volta. Se era a última cópia conhecida, desapareceu para sempre. Os críticos argumentam que isso representa uma ameaça real ao que resta de nossa herança bibliográfica — especialmente as obras que já são difíceis de encontrar, que não serão reimpressas, que existem em poucos exemplares espalhados por bibliotecas e coleções privadas.
Por trás disso tudo está também a questão dos direitos autorais. Processos judiciais em andamento, principalmente nos Estados Unidos, estão investigando se essa digitalização em massa de livros protegidos por copyright pode ser considerada uso legítimo ou se viola os direitos de autores e editoras. As empresas argumentam que estão apenas comprando e processando um produto que adquiriram legalmente. Os críticos dizem que estão se apropriando de obras criativas para treinar máquinas que depois competem com os próprios autores. Os tribunais ainda não decidiram.
O que está claro é que a corrida pela inteligência artificial criou um novo tipo de pressão sobre o mundo dos livros — não a pressão do esquecimento ou da falta de leitura, mas a pressão de ser consumido, digitalizado e descartado em nome do progresso tecnológico. Os sebos continuam vendendo. Os intermediários continuam comprando. E em algum lugar, máquinas continuam devorando páginas.
Notable Quotes
A prática abriu um intenso debate sobre os limites da tecnologia e a ameaça ao patrimônio bibliográfico, especialmente de obras raras e fora de catálogo— Críticos e especialistas em preservação histórica