Los datos de entrenamiento escasean y los laboratorios compran activos del mundo físico
Amazon y Google compran activos físicos — la escasez de datos llegó al mundo real.
La imagen mental del entrenamiento de modelos de IA —millones de páginas web aspiradas por un scraper— lleva años siendo inexacta. Pero esta semana quedó formalmente obsoleta. Entre el 15 y el 18 de agosto, tres señales distintas confirmaron que la frontera de la adquisición de datos de entrenamiento cruzó al mundo físico: una investigación periodística rastreó libros raros con AirTags hasta instalaciones de Amazon, Google compró los emails y chats de una aerolínea en quiebra en subasta judicial, y el mercado de libros de segunda mano muestra señales de que la demanda de texto físico está empujando los precios hacia arriba. La carrera por datos de entrenamiento entró en una fase donde el activo buscado no está en ningún servidor.
La investigación que lo hizo visible
El 17 de agosto, 404 Media publicó la investigación que rastreó un envío de libros raros hasta una instalación de entrenamiento de IA de Amazon. Un AirTag oculto en el paquete reveló el recorrido completo. Amazon, la empresa que empezó vendiendo libros en 1994, ahora compra —y según otras fuentes destruye textos raros para entrenar sus modelos— precisamente porque son raros: los modelos ya han procesado todo lo que circula en digital, y los libros que nunca fueron escaneados representan territorio virgen de entrenamiento.
Un día después, Google ganó la subasta de quiebra de Spirit Airlines y se quedó con los emails, chats y documentos de toda la operación de la aerolínea. No por los activos operativos de Spirit —sus rutas, sus slots, su marca— sino por los datos que generó a lo largo de su existencia. Para Google, los emails de una aerolínea son texto humano en contexto específico: comunicaciones internas, atención al cliente, disputas operativas. El tipo de datos que no se puede fabricar ni sintetizar convincentemente.
Y el 15 de agosto, la BBC reportó que las ventas de libros de segunda mano están en auge, con la hipótesis de que parte de la demanda viene de la industria de IA buscando texto de buena calidad. El mercado le está poniendo precio a lo que los laboratorios quieren pero no pueden simplemente descargar.
La lógica del follow-the-money
La explicación de superficie es la escasez. Los grandes modelos ya procesaron la mayor parte del texto disponible en internet — libros con derechos liberados, Wikipedia, código de repositorios públicos, foros, artículos académicos. La frontera del pre-entrenamiento se desplazó hacia lo que nunca fue digitalizado o lo que fue generado en contextos cerrados.
Pero la explicación más interesante no es la escasez en sí misma: es el incentivo de aceleración que crea. Si tu competidor puede ganar acceso a un conjunto de datos que vos no tenés, y ese acceso mejora la calidad del modelo en áreas que los benchmarks públicos no miden bien, entonces adquirir ese dataset antes que él vale lo que sea. Google comprando datos de Spirit Airlines no tiene sentido si se evalúa la calidad del texto de una aerolínea en sí mismo — tiene todo el sentido si se evalúa como movimiento para que el competidor no tenga ese conjunto específico. Es la misma lógica que llevó al capital de IA a apostar por categorías enteras antes de que aparezcan los ganadores: cuando el terreno todavía no está repartido, la velocidad de adquisición vale más que la precisión de la valuación.
Esta lógica convierte cualquier archivo que no sea digital en un activo potencialmente estratégico: archivos de hospitales, actas notariales, correspondencia corporativa de empresas en quiebra, fondos documentales de universidades. Los laboratorios tienen capital, los archivos tienen datos, y las leyes de privacidad todavía no cubrieron este vector con nitidez.
Quién captura el valor y quién asume el riesgo
Los vendedores de libros raros y los síndicos de quiebras están comenzando a entender que tienen algo que los laboratorios quieren pagar. Eso es poder de negociación genuino, y probablemente transitorio: una vez que los conjuntos de datos más valiosos queden adquiridos, el mercado spot de texto físico se seca.
Las editoriales que todavía tienen control sobre archivos sin digitalizar tienen una ventana corta para negociar licencias con condiciones en lugar de ver su material adquirido por vías indirectas. La alternativa —ver cómo Amazon compra sus ediciones rarísimas en librerías de anticuario— ya está documentada.
El riesgo regulatorio es real pero lento. Los datos personales de los pasajeros de Spirit Airlines estaban en esos emails. ¿Qué pasa con el consentimiento cuando los datos se adquieren en una subasta de quiebra? Las leyes de privacidad en EE.UU. tienen lagunas específicas para activos en liquidación que los reguladores europeos y de LATAM aún no absorbieron completamente.
Conclusión falsable: el primer caso regulatorio como señal de madurez
La tesis se confirma o refuta con el primer caso regulatorio exitoso contra una adquisición de datos en subasta de quiebra. Si algún regulador —europeo o latinoamericano— logra bloquear o multar una operación de este tipo antes de fin de 2027, significa que el vacío legal se está cerrando y que la vía del archivo físico adquiere un costo de compliance que hoy no tiene.
Qué mirar: si Microsoft o Meta hacen movimientos similares en subastas de quiebra de empresas con grandes archivos de comunicación interna. Uno o dos casos más confirman que se trata de una estrategia deliberada del sector, no de oportunismo aislado de Google y Amazon.
Para decisores en LATAM y España: si su empresa tiene archivos históricos no digitalizados, o datos de comunicación interna acumulados durante décadas, existe una probabilidad no trivial de que algún laboratorio esté dispuesto a pagar por ellos. La ventana para negociar condiciones —incluyendo restricciones de uso y participación en royalties— se cierra a medida que el mercado madura y los laboratorios aprenden a adquirir estas fuentes por vías más discretas.
- Meet the startup helping Wall Street put a price on AI compute· 19-ago-2026
- Mathematics in the age of AI· 19-ago-2026
- Etched’s valuation doubles to $21B in a month· 18-ago-2026
- Anthropic's War on open source AI· 17-ago-2026