Microsoft y OpenAI ante el conflicto por el uso de contenidos periodísticos para entrenar la IA

“Microsoft exec called AI scraping the ‘largest theft of labor in human history’”, Ars Technica, 17 de septiembre de 2026.
Artículo original en Ars Technica

Se analiza nuevos documentos judiciales que han salido a la luz en el litigio por derechos de autor entre The New York Times y otras organizaciones periodísticas frente a Microsoft y OpenAI. Los documentos, que permanecieron confidenciales durante buena parte del proceso, muestran que dentro de Microsoft y OpenAI existían importantes preocupaciones acerca de las consecuencias económicas y legales de utilizar grandes cantidades de contenidos periodísticos para entrenar modelos de inteligencia artificial.

Uno de los elementos más llamativos es que Brent Hecht, director de Applied Science de Microsoft, llegó a describir internamente el scraping de noticias como “un robo asombroso de proporciones sin precedentes” y como “el mayor robo de trabajo de la historia de la humanidad”.

La cuestión central no es solamente si los modelos de IA pueden utilizar contenidos protegidos por derechos de autor durante su entrenamiento, sino qué ocurre cuando esos modelos terminan sustituyendo económicamente a las fuentes de las que obtienen la información. Los documentos citados en el proceso judicial muestran que algunos responsables de Microsoft y OpenAI eran conscientes de este problema. Un documento interno de Microsoft hablaba de un posible “doom loop” —círculo vicioso—, según el cual la IA podía reducir el tráfico hacia las organizaciones periodísticas, deteriorar sus ingresos y, finalmente, debilitar la producción de nuevos contenidos de calidad que los propios modelos de IA necesitan para seguir funcionando.

El problema adquiere especial importancia porque los buscadores y los chatbots están modificando la manera en que las personas acceden a la información. Tradicionalmente, un buscador mostraba un enlace y el usuario visitaba posteriormente la página del periódico. En cambio, un chatbot puede leer, sintetizar y presentar directamente la información, reduciendo la necesidad de acceder a la fuente original. En documentos internos citados por los demandantes aparecen estimaciones de Microsoft según las cuales determinados productos de IA habrían provocado descensos muy importantes en las tasas de clic hacia algunos medios: entre un 83 % y un 93 % en determinados casos, y entre un 51 % y un 94 % en otros.

Uno de los aspectos jurídicamente relevantes es precisamente este posible efecto de sustitución. La defensa de Microsoft y OpenAI sostiene que el entrenamiento de modelos de IA constituye un uso transformador de las obras y que puede estar protegido por la doctrina estadounidense de fair use (uso legítimo). Sin embargo, los demandantes intentan demostrar que el problema cambia cuando los sistemas no solo utilizan las obras para aprender, sino que pueden proporcionar al usuario fragmentos extensos o incluso reproducciones muy próximas al contenido original, evitando que este visite el medio que produjo la información. Para los demandantes, esto perjudica directamente el mercado de las publicaciones originales.

Los documentos también revelan una tensión entre las posiciones públicas y algunas conversaciones internas. Por ejemplo, Nick Turley, responsable de ChatGPT, habría escrito que los editores se enfrentaban a una “amenaza existencial” derivada de productos comerciales entrenados con contenidos periodísticos. En otra comunicación interna, Turley describió los chatbots como “largamente sustitutivos” y anticipó que serían todavía más sustitutivos a medida que mejorasen. El propio CEO de Microsoft, Satya Nadella, reconoció en una declaración que los chatbots pueden quitar clics a los sitios de noticias porque proporcionan directamente al usuario la información que antes obtenía visitando la fuente.

Otro elemento especialmente significativo es el acceso a contenidos protegidos por sistemas de pago (paywalls). Según los documentos presentados por los demandantes, un empleado de OpenAI informó a Greg Brockman, presidente de la compañía, de que se había encontrado un método para sortear el muro de pago de The New York Times. La respuesta atribuida a Brockman fue positiva. Las organizaciones periodísticas utilizan este episodio para argumentar que las empresas conocían las restricciones existentes sobre determinados contenidos y, aun así, desarrollaron mecanismos para obtenerlos. Estas afirmaciones forman parte de los argumentos de los demandantes y deberán valorarse dentro del proceso judicial.

La escala de la utilización de contenidos también resulta relevante. Según la información incorporada a los documentos judiciales, determinados conjuntos de datos empleados durante el desarrollo de los modelos contenían decenas de miles de copias de trabajos publicados por The New York Times, Daily News y Center for Investigative Reporting. TechCrunch, al informar sobre los mismos documentos, señala además que uno de los conjuntos derivados de Common Crawl contenía más de dos millones de documentos procedentes de nytimes.com, mientras que otro conjunto relacionado con el denominado Project Mango habría reunido copias de más de de 160.000 obras diferentes de organizaciones periodísticas.

Los documentos plantean además otra cuestión importante: la eliminación o pérdida de información sobre derechos de autor dentro de los conjuntos de entrenamiento. Según los demandantes, determinados procesos de preparación de los datos habrían eliminado avisos de copyright porque los investigadores no querían que los modelos reprodujeran posteriormente esas indicaciones. De demostrarse las conductas descritas y su relevancia jurídica, podrían ser importantes para evaluar no solo cómo se recopilaron los contenidos, sino también cómo fueron preparados para el entrenamiento.

Microsoft, sin embargo, ha respondido que las declaraciones de Hecht representan la opinión individual de un empleado y que no constituyen un análisis jurídico ni la posición oficial de la compañía. La empresa mantiene que sus productos de IA realizan un uso transformador de los contenidos y que no sustituyen a los medios de comunicación. En consecuencia, las declaraciones internas no deben confundirse automáticamente con hechos jurídicamente establecidos: proceden en buena medida de documentos y argumentos presentados por los demandantes en el litigio.

Los documentos revelados no demuestran por sí mismos que Microsoft u OpenAI hayan cometido una infracción de copyright; eso corresponde determinarlo al proceso judicial. Pero sí muestran que dentro de las propias empresas existía una conciencia bastante clara del posible conflicto entre el desarrollo de modelos de IA y la sostenibilidad económica de las industrias que producen los contenidos utilizados por esos modelos. El caso constituye, por tanto, un episodio especialmente relevante del debate sobre el futuro del periodismo, el copyright y la inteligencia artificial.