Anthropic. (2026). Claude’s values across models and languages. Anthropic Research. https://www.anthropic.com/research/claude-values-models-languages
Anthropic presenta una investigación destinada a comprender cómo los modelos de la familia Claude expresan valores en sus respuestas y cómo estos varían tanto entre diferentes versiones del modelo como entre distintos idiomas.
El estudio se basa en el análisis de 309.815 conversaciones reales y anonimizadas mantenidas con Claude.ai, centradas exclusivamente en consultas subjetivas, es decir, aquellas en las que no existe una única respuesta correcta y en las que el sistema debe realizar juicios, recomendaciones o interpretaciones. A partir de este enorme conjunto de datos, los investigadores identificaron más de 3.300 valores presentes en las respuestas del modelo, que posteriormente agruparon en categorías más generales para construir un mapa del comportamiento ético y comunicativo de Claude.
Uno de los hallazgos más relevantes es que las diferencias entre modelos no se limitan al rendimiento técnico, sino que también afectan al estilo de interacción y a la forma en que el sistema manifiesta determinados valores. Mediante técnicas estadísticas de reducción de dimensiones, Anthropic identificó cuatro ejes fundamentales que describen estas variaciones: deferencia frente a cautela, calidez frente a rigor, profundidad frente a brevedad y franqueza frente a orientación a la ejecución. Así, algunos modelos muestran una mayor tendencia a ofrecer respuestas empáticas y alentadoras, mientras que otros privilegian el análisis crítico, la precisión o la objetividad. Estas diferencias son relativamente moderadas, pero suficientemente consistentes como para caracterizar la personalidad comunicativa de cada versión de Claude.
La investigación también demuestra que el idioma en el que interactúa el usuario influye de forma significativa en la expresión de estos valores. Claude no responde exactamente igual cuando conversa en inglés, español, ruso, árabe o hindi. Por ejemplo, las conversaciones en hindi tienden a reflejar un estilo más cálido y alentador, mientras que las realizadas en ruso presentan respuestas más rigurosas, analíticas y orientadas a solicitar evidencias. En inglés predominan la cautela y la profundidad argumentativa, mientras que otros idiomas muestran combinaciones distintas de franqueza, concisión o deferencia. Anthropic subraya que estas diferencias no implican que un idioma produzca respuestas mejores o peores, sino que reflejan patrones estadísticos derivados de las interacciones reales y de los contextos culturales asociados a cada lengua.
Otro aspecto importante del trabajo es que estas variaciones no fueron obtenidas mediante la traducción de los mismos mensajes a diferentes idiomas, sino analizando conversaciones auténticas desarrolladas por usuarios de todo el mundo. Esto significa que el estudio captura diferencias surgidas de los propios contextos culturales, de las expectativas de los usuarios y de las formas particulares de comunicación presentes en cada comunidad lingüística. Los investigadores advierten, por tanto, que los resultados describen tendencias observadas en la práctica y no permiten establecer relaciones causales ni afirmar que un idioma determine necesariamente un determinado comportamiento del modelo.
Anthropic considera que este tipo de investigaciones constituye un paso importante hacia el desarrollo de sistemas de inteligencia artificial más transparentes y alineados con los valores humanos. Comprender qué valores expresa un modelo, cómo cambian según el contexto lingüístico y cultural y cómo evolucionan entre diferentes generaciones de modelos permitirá diseñar mecanismos de evaluación más precisos y políticas de alineamiento más sofisticadas. En lugar de asumir que los modelos son completamente neutrales, el estudio propone entenderlos como sistemas cuya conducta refleja una compleja interacción entre entrenamiento, diseño, idioma y contexto de uso, abriendo nuevas líneas de investigación sobre la gobernanza ética y la adaptación cultural de los grandes modelos de lenguaje.








