
Hargitt, Patrick; Smith, Steve. “AI Can Find the Article. Can It Tell Which Version It Used?”. The Scholarly Kitchen, 19 de agosto de 2026. Artículo original en The Scholarly Kitchen
La expansión de la inteligencia artificial en la búsqueda y recuperación de información científica está generando un problema que va mucho más allá de localizar correctamente un artículo: determinar exactamente qué versión del trabajo ha utilizado la IA.
Patrick Hargitt y Steve Smith parten de una cuestión fundamental para la comunicación científica: un mismo trabajo puede existir simultáneamente como preprint, manuscrito revisado, manuscrito aceptado, versión publicada por el editor, copia depositada en un repositorio institucional y versiones posteriores corregidas o retractadas. Los sistemas de IA pueden recuperar cualquiera de estas manifestaciones, fragmentar su contenido en pequeños bloques y utilizar determinados pasajes para elaborar una respuesta sin mostrar necesariamente al usuario el contexto o la versión concreta de la que procede la información. Por ello, la ambigüedad de las versiones deja de ser únicamente un problema bibliográfico o de descubrimiento y se convierte en un problema de procedencia, especialmente importante cuando una IA genera revisiones de literatura, informes, resúmenes o respuestas basadas en investigación científica.
Los autores destacan que los identificadores persistentes (PID), especialmente los DOI, siguen siendo esenciales, pero por sí solos no resuelven el problema. Un DOI puede identificar de manera estable un trabajo y conducir al registro mantenido por el editor, pero eso no significa necesariamente que sea la versión que un sistema de IA utilizó. Una IA podría haber recuperado, por ejemplo, una copia anterior depositada en un repositorio, mientras que la referencia final apunta al DOI de la versión publicada. Del mismo modo, un artículo puede haber sido corregido o retractado después de que una plataforma de IA incorporara una copia anterior. Por tanto, no basta con saber qué trabajo se ha utilizado: es necesario conocer qué estado o versión concreta del trabajo se empleó y si en ese momento existían correcciones, actualizaciones, retractaciones o versiones posteriores relevantes. El valor de un PID depende así del ecosistema de metadatos y relaciones que lo acompaña, capaz de explicar qué objeto representa, cómo se relaciona con otras versiones y cuál es su situación actual dentro del registro académico.
En este contexto cobra especial importancia la próxima revisión de la recomendación NISO Journal Article Versions (JAV). Según los autores, esta revisión se encuentra en fase editorial final y pretende proporcionar una descripción más precisa de las diferentes etapas por las que puede pasar un artículo científico. La propuesta combina etapas y estados del artículo con versionado semántico, permitiendo distinguir no solo entre un preprint, un manuscrito aceptado o una versión del registro (Version of Record), sino también entre diferentes modificaciones producidas dentro de una misma etapa. Esta distinción resulta especialmente relevante porque un artículo puede experimentar varias modificaciones sin cambiar necesariamente de categoría: una corrección menor de metadatos no tiene la misma importancia que un cambio sustancial que pueda afectar a la interpretación de los resultados. El versionado estructurado permitiría que tanto los investigadores como los sistemas automatizados comprendieran mejor qué versión están manejando y cuál es su relación con las demás.
El artículo propone, en esencia, distinguir tres capas de identidad. La primera responde a la pregunta «¿qué trabajo u objeto científico es este?» y se resuelve mediante un PID, como un DOI, acompañado de metadatos y relaciones. La segunda responde a «¿en qué estado o versión se encuentra el trabajo?» y requiere información sobre la etapa editorial, el estado y el número o versión semántica. La tercera, mucho más novedosa en el contexto de la inteligencia artificial, responde a «¿qué utilizó realmente el sistema de IA?». Esta última dimensión exige información de procedencia, es decir, conocer la fuente concreta y la versión exacta que fueron recuperadas para fundamentar una determinada respuesta. Para los autores, esta tercera capa será cada vez más importante porque una referencia bibliográfica aparentemente correcta puede ocultar el recorrido real que siguió la IA para obtener la información. En consecuencia, la especificidad de la versión debería empezar a considerarse parte de la precisión de una cita, y no simplemente un detalle adicional de presentación.

Otro aspecto fundamental es que los metadatos de versión deben pasar de ser una información meramente descriptiva a convertirse en información operativa dentro de los sistemas de IA. Un sistema de recuperación debería poder identificar si está accediendo a un preprint, un manuscrito en revisión, un manuscrito aceptado o una versión del registro; debería comprobar si esa versión ha sido posteriormente corregida, retractada o sustituida; y, cuando sea posible, debería conocer si existe una versión posterior antes de generar una respuesta. Si la IA utiliza una versión antigua o no definitiva, esa circunstancia debería poder aparecer en la referencia o en la evidencia que acompaña a la respuesta. El problema adquiere todavía mayor importancia cuando el contenido se incorpora a sistemas de IA mediante procesos de ingestión estática: los artículos pueden transformarse, dividirse en fragmentos, convertirse en embeddings e incorporarse a índices vectoriales, mientras que la información sobre su versión, estado editorial o historial de correcciones puede quedar separada del texto. De ahí la necesidad de que los metadatos permanezcan vinculados al contenido durante todo el proceso de ingestión, recuperación y generación.
Los autores subrayan también el riesgo de que las correcciones y retractaciones no lleguen a las plataformas de IA. Un artículo puede haber sido incorporado a una colección licenciada o a un índice en una determinada fecha y, posteriormente, ser corregido o retractado por el editor. Si el sistema conserva una copia estática y no dispone de mecanismos para recibir las actualizaciones, puede seguir utilizando información que el propio editor ya no considera válida en su forma anterior. El problema no afecta solamente a las editoriales: también involucra a repositorios, índices bibliográficos, agregadores, proveedores de contenidos y empresas de inteligencia artificial. Los autores plantean que las correcciones, retractaciones y nuevas versiones deberían propagarse por todo el ecosistema académico mediante mecanismos fiables de actualización. En este sentido, mencionan iniciativas como CUSAP, orientada a la comunicación de actualizaciones de contenidos, y servicios destinados a transmitir información sobre retractaciones y erratas.
Desde la perspectiva de las bibliotecas y las instituciones académicas, el problema tiene consecuencias directas sobre la contratación y evaluación de servicios de IA. Ya no debería bastar con preguntar si una herramienta tiene acceso a millones de artículos científicos. También habría que saber si conserva los metadatos de versión, si actualiza los contenidos cuando se producen correcciones o retractaciones, si identifica la procedencia de los fragmentos utilizados y si puede informar de qué versión concreta respaldó una respuesta. Esto introduce una nueva dimensión en la evaluación de proveedores de IA y en las licencias de contenidos científicos. Las instituciones podrían exigir que los sistemas demuestren durante las pruebas piloto que son capaces de mantener la relación entre contenido, versión, estado, procedencia y actualización. De este modo, la calidad de un sistema de IA para investigación no dependería únicamente de su capacidad para recuperar documentos relevantes, sino también de su capacidad para recuperar y utilizar la versión correcta y vigente de esos documentos.





