
Amanda Silberling, “Is it legal to train AI models on copyrighted books? It’s complicated”, TechCrunch, 23 de agosto de 2026. Artículo original en TechCrunch
Los modelos de inteligencia artificial generativa como ChatGPT, Gemini o Claude se entrenan con enormes cantidades de información procedente de libros, artículos, trabajos académicos y contenidos disponibles en Internet. Esto ha provocado un conflicto creciente con autores y titulares de derechos, que cuestionan que sus obras puedan utilizarse para entrenar sistemas de IA sin su conocimiento o autorización. Sin embargo, la cuestión jurídica es mucho más compleja de lo que parece, porque las actuales leyes de copyright fueron concebidas mucho antes de la aparición de la inteligencia artificial generativa.
Uno de los casos más relevantes es el de Anthropic, que llegó a un acuerdo por 1.500 millones de dólares con un grupo de escritores cuyas obras habían sido utilizadas para entrenar sus modelos. No obstante, el juez William Alsup había considerado que el entrenamiento de la IA con obras protegidas podía ser legal. Lo que sancionó fue que Anthropic hubiera obtenido algunos de esos libros mediante bibliotecas clandestinas ilegales. El razonamiento establece una diferencia fundamental entre utilizar una obra para entrenar un modelo y obtenerla de manera ilícita.
El debate se centra en buena medida en la doctrina estadounidense del fair use (uso legítimo), que permite determinadas utilizaciones de obras protegidas sin autorización. Los tribunales valoran factores como la finalidad del uso, su carácter transformador, la cantidad de material utilizado y el efecto sobre el mercado de la obra original. En este contexto, algunos jueces consideran que entrenar un modelo para generar algo nuevo puede ser una utilización transformadora, mientras que existe mayor riesgo cuando la IA se utiliza para crear un producto que compite directamente con el material protegido.
El caso Thomson Reuters contra Ross Intelligence muestra precisamente esa diferencia. Un tribunal consideró que Ross había utilizado contenidos de Reuters para desarrollar una plataforma jurídica de IA que competía directamente con el producto original, por lo que no podía acogerse al fair use. Esta resolución contrasta con el enfoque aplicado al entrenamiento de modelos de propósito general y demuestra que los tribunales todavía están construyendo, caso por caso, los criterios que determinarán qué usos de materiales protegidos son legítimos.
El artículo destaca además que no existe todavía una respuesta jurídica definitiva. Las diferentes demandas contra empresas de IA siguen abiertas y las decisiones iniciales podrían ser modificadas por tribunales superiores. La legislación estadounidense sobre copyright procede esencialmente de una época anterior a Internet y, por supuesto, a la IA generativa. Por ello, las próximas resoluciones judiciales tendrán una importancia decisiva para determinar cómo pueden utilizarse libros, artículos y otras obras protegidas para entrenar modelos de inteligencia artificial y quién debe asumir los costes de ese uso.








