El mayor vendedor de libros del mundo los destruye ahora para entrenar IA
La escasez de datos únicos ya produce daños físicos visibles y cotizables
Hay un patrón que se acumula desde hace semanas: en el mercado global de libros usados, los precios de títulos agotados y ediciones raras llevan meses en alza, con un comportamiento que los anticuarios no saben bien cómo explicar. La respuesta llegó el 17 de agosto, con la elegancia analítica de un buen thriller: un AirTag escondido en un cargamento de libros raros reveló que Amazon envía esas adquisiciones directamente a instalaciones de entrenamiento de IA, donde los volúmenes son procesados y destruidos. La empresa que empezó vendiendo libros ya los usa como materia prima para sus modelos.
La escasez de datos valiosos toca fondo físico
El internet disponible para entrenamiento de modelos de lenguaje está, en la práctica, agotado. Los grandes labs han rastreado la web accesible varias veces. Lo que queda — los datos que todavía tienen valor diferencial — son los que nunca fueron digitalizados: manuscritos, correspondencia privada, ediciones limitadas, libros fuera de catálogo. La rareza no es cultural sino estratégica: estos textos no están en Common Crawl, no los tienen los competidores.
Amazon compró en masa libros raros en mercados de segunda mano, anticuarios y subastas — muchas veces a precios bien por encima del valor de mercado previo. El cargamento no iba a un almacén de reventa. Iba a un escáner industrial, y después, al triturador.
El mercado lo detectó antes que nadie
La señal más extraña del patrón no fue la investigación de AirTag: fue que el mercado de libros de segunda mano empezó a comportarse de manera inusual varias semanas antes. Las ventas de libros usados llevan meses en auge, con precios que suben en categorías específicas — ciencia, filosofía, historia técnica, textos académicos descatalogados — sin una explicación obvia de demanda de lectores.
Los anticuarios especializados reportaron compradores institucionales pagando precios fuera de mercado, a veces por colecciones enteras sin selección visible. Eso no es comportamiento de coleccionista ni de revendedor. Es comportamiento de alguien que quiere el texto, no el objeto. La investigación de 404 Media confirmó el destino final: una instalación de entrenamiento de IA.
Lo que Amazon tiene y sus competidores no
La ventaja de Amazon en este movimiento es estructural. Es el mayor marketplace de libros usados del mundo — Abebooks, que controla, es la plataforma líder en antigüedades bibliográficas. Puede comprar a escala y con discreción antes de que el mercado sepa qué está pasando. Google y Meta tienen ventajas en datos de búsqueda y redes sociales; Amazon tiene acceso sistemático a la producción editorial física de los últimos dos siglos.
La ironía histórica es considerable: Amazon no solo fue el mayor vendedor de libros del mundo, sino el actor que más contribuyó a presionar los precios editoriales a la baja y a digitalizar el mercado del libro. Ahora usa esa red física para extraer el único activo que internet no pudo replicar: los textos que quedaron analógicos.
Los modelos de frontera del próximo ciclo tendrán datos que sus competidores no pueden comprar, porque el objeto físico ya no existe. Esa ventaja es permanente. En este contexto, la concentración de revenue en los labs de frontera adquiere una dimensión adicional: quien controla los datos únicos también controla la siguiente generación de modelos.
Ganadores, perdedores, y lo que falta regular
Gana Amazon: datos únicos que sus competidores no pueden replicar fácilmente. Gana el mercado de segunda mano en el corto plazo, con precios más altos y demanda activa. Pierden los archivos culturales: libros que no volverán a circular, textos que no estarán disponibles para investigadores o lectores.
La implicación regulatoria es incipiente pero real. Varias jurisdicciones europeas tienen leyes de patrimonio bibliográfico que limitan la exportación o destrucción de obras históricas. Si las adquisiciones cruzaron esas líneas — comprar colecciones en Europa o LATAM para destruirlas en EE.UU. — hay terreno jurídico por explorar. El Ars Technica que levantó primero la historia lo pone en términos simples: lo que nadie anticipó cuando diseñó las leyes de propiedad intelectual es que el libro físico podía convertirse en dato de entrenamiento antes de que existiera un marco legal para eso. El patrón de reguladores llegando tarde a los movimientos de infraestructura de IA se repite aquí con una dimensión física que las leyes existentes no anticiparon.
Conclusión falsable
Si Amazon continúa este patrón a la misma escala, las instituciones académicas y los archivos nacionales empezarán a reportar escasez de materiales que antes encontraban con facilidad. El precio de ejemplares raros en plataformas como Abebooks subirá de forma sostenida y específica en categorías técnicas y académicas, no solo en ficción popular.
Qué mirar: si en los próximos seis meses aparecen reportes de bibliotecas universitarias que no pueden reponer fondos deteriorados porque el precio de segunda mano los supera, la tesis está confirmada. Para un decisor en LATAM, la pregunta práctica es concreta: si hay acervos locales — editoriales regionales descatalogadas, revistas técnicas de los 80 y 90, colecciones privadas — que tienen valor de entrenamiento que nadie está evaluando todavía, ese es un activo. La pregunta es si conviene monetizarlo, preservarlo, o exigir que quien lo use para entrenar modelos obtenga permiso primero.