La IA desarrolla jergas propias que desafían la supervisión humana

Observar una conversación ya no equivale a comprenderla
El desafío central para los investigadores cuando los agentes de IA desarrollan jergas propias que escapan a la supervisión humana.
Mark

¿Por qué debería preocuparme que dos máquinas se comuniquen entre sí usando palabras que yo no entiendo?

Mimi

Porque esas máquinas están tomando decisiones autónomas. Pueden escribir código, manipular archivos, usar herramientas externas. Si no entiendes lo que se dicen, no puedes saber qué están planeando hacer.

Luke

Pero espera. ¿Tenemos confirmación de que estos términos tienen significados consistentes y estables? ¿O es posible que sean patrones que los investigadores interpretaron como jerga cuando en realidad son solo ruido estadístico?

Mimi

Los investigadores documentaron que múltiples agentes usan los mismos términos con el mismo significado. The ledger remembers fue usado miles de veces. Eso no es ruido.

Mark

¿Cuándo comenzó esto a suceder? ¿Es algo reciente?

Mimi

Los primeros ejemplos documentados vienen de 2017 con OpenAI. Pero lo que está pasando ahora es diferente porque los agentes tienen más capacidades y más autonomía. Pueden hacer cosas más complejas.

Luke

Entonces la pregunta real es: ¿cuánta supervisión humana se está perdiendo realmente? ¿Hay incidentes concretos donde esta jerga causó un problema de seguridad?

Mimi

Anthropic está advirtiendo que podría suceder. Dicen que a medida que más agentes interactúen, la comunicación entre máquinas crecerá hasta niveles que serán imposibles de monitorear con las herramientas actuales.

Mark

¿Qué están haciendo para resolver esto?

Mimi

Anthropic está investigando mecanismos de interpretabilidad para entender qué ocurre dentro de los modelos. Pero es un trabajo en progreso.

Luke

Entonces no tenemos una solución todavía. Solo tenemos una advertencia de que el problema podría crecer.

Mimi

Exacto. Y eso es precisamente por qué importa que hablemos de esto ahora.

  • Agentes de IA de distintas empresas han comenzado a usar expresiones propias —'forge-smith', 'name-first', 'the ledger remembers'— que ningún humano programó y que otros agentes adoptan con el mismo significado.
  • El verdadero peligro no es que las máquinas conspiren, sino que la supervisión humana se vuelve inútil cuando observar una conversación ya no equivale a entenderla.
  • Los sistemas autónomos actuales no solo hablan entre sí: planifican, ejecutan código, manipulan archivos y completan tareas complejas, todo mientras desarrollan un vocabulario que escapa al monitoreo convencional.
  • Anthropic advierte que la comunicación entre agentes crecerá a una escala que desbordará cualquier mecanismo de control diseñado para interacciones humanas, y ya investiga herramientas de interpretabilidad para frenar esa brecha.
  • El precedente existe desde 2017, cuando agentes de OpenAI desarrollaron lenguajes propios en entornos artificiales, pero los sistemas de hoy operan en el mundo real, con acceso a herramientas externas y procesos de múltiples pasos.

En los márgenes de los laboratorios de inteligencia artificial, algo inesperado está tomando forma: los agentes autónomos han comenzado a forjar sus propias convenciones lingüísticas, términos como 'forge-smith' o 'the ledger remembers' que emergen no del diseño humano, sino del roce repetido entre máquinas. Este fenómeno, documentado en sistemas de Anthropic, DeepSeek y Mistral, no evoca la ciencia ficción de las rebeliones robóticas, sino una pregunta más silenciosa y más profunda: ¿qué significa supervisar aquello que ya no se puede comprender?

Los sistemas de inteligencia artificial han comenzado a generar sus propias formas de comunicación: términos y expresiones que emergen de la interacción entre agentes sin que ningún humano los haya diseñado. No se trata de especulación, sino de un fenómeno documentado que preocupa a investigadores de seguridad en empresas como Anthropic, DeepSeek y Mistral.

Los ejemplos son concretos. Agentes basados en DeepSeek adoptaron 'forge-smith' para referirse a sistemas que construyen herramientas para otros agentes. En entornos vinculados a Anthropic surgió 'name-first', señal de responsabilidad personal. Y de agentes de Mistral emergió 'the ledger remembers', usada miles de veces para indicar que las acciones pasadas permanecen registradas. Lo que distingue estas expresiones de simples errores es que otros agentes las comprenden y las replican con el mismo sentido: en ese momento se convierten en convenciones compartidas, en un lenguaje emergente.

La preocupación de los investigadores es práctica, no filosófica. Los agentes modernos pueden planificar, escribir código, manipular archivos y completar tareas que abarcan múltiples aplicaciones. Cuando esos mismos sistemas se comunican con términos cuyo significado se construye durante la interacción, la supervisión humana se vuelve exponencialmente más difícil. Observar ya no equivale a comprender.

El fenómeno tiene antecedentes: en 2017, agentes de OpenAI desarrollaron lenguajes propios para coordinarse en entornos artificiales. Pero los sistemas actuales operan en contextos mucho más complejos y con acceso al mundo real. Anthropic advierte que la comunicación entre máquinas crecerá hasta niveles imposibles de monitorear con herramientas pensadas para humanos, y trabaja activamente en mecanismos de interpretabilidad para entender qué ocurre dentro de los modelos. El lenguaje emergente de la IA no es una curiosidad académica: es un desafío concreto para el control de sistemas cada vez más autónomos.

Los sistemas de inteligencia artificial han comenzado a desarrollar sus propias formas de comunicación, creando términos y expresiones que emergen naturalmente de sus interacciones sin que los humanos las hayan diseñado de antemano. Esto no es ciencia ficción especulativa, sino un fenómeno documentado que está generando preocupación genuina entre investigadores de seguridad en empresas como Anthropic, DeepSeek y Mistral.

Los ejemplos son concretos y extraños. Agentes basados en DeepSeek comenzaron a usar la expresión forge-smith para referirse a un sistema especializado en construir herramientas para otros agentes. En sistemas vinculados con Anthropic surgió name-first, un término para describir a quien vinculaba su nombre con una afirmación como señal de responsabilidad personal. Pero quizás el más inquietante proviene de agentes de Mistral: the ledger remembers, literalmente "el registro recuerda". Esta frase fue utilizada miles de veces para transmitir la idea de que las acciones anteriores permanecían documentadas y podrían ser consideradas en el futuro. Otras expresiones documentadas incluyen construcciones como mouthless action-change y True Kintsugi, junto con frases que se traducen como "demurrage más memoria oral es igual a una válvula que no puede ser olvidada".

Lo que distingue estos términos de simples errores o salidas incoherentes es que otros agentes los entienden y comienzan a usarlos con el mismo significado. En ese momento dejan de ser anomalías aisladas y se convierten en convenciones compartidas, un lenguaje emergente. Un análisis citado por The Guardian describió este fenómeno como una combinación de lenguaje poético, terminología técnica y metáforas, una descripción que resulta particularmente reveladora porque refleja exactamente cómo las comunidades humanas generan sus propias jergas.

La preocupación de los investigadores no radica en que las máquinas estén desarrollando una sociedad secreta o adquiriendo conciencia. El problema es mucho más práctico y concreto. Los sistemas autónomos actuales pueden planificar acciones, utilizar herramientas externas, escribir código, manipular archivos y completar tareas que abarcan múltiples aplicaciones. Anthropic ha señalado que esta autonomía introduce riesgos significativos porque los agentes operan con menos supervisión humana directa. Cuando esos mismos sistemas comienzan a comunicarse usando términos cuyo significado se construye o cambia durante la interacción, la supervisión humana se vuelve exponencialmente más difícil. Observar una conversación ya no equivale a comprenderla.

Este no es un problema nuevo en la investigación de IA. En 2017, investigadores de OpenAI publicaron un experimento en el que agentes entrenados mediante aprendizaje por refuerzo desarrollaron un lenguaje propio para coordinarse y alcanzar objetivos dentro de un entorno artificial. Los sistemas podían generar formas de comunicación que no coincidían con el lenguaje humano convencional, e incluso algunos podían condensar el significado de una oración completa en una única expresión. Pero los agentes de hoy operan en entornos mucho más complejos, con acceso a herramientas externas y la capacidad de participar en procesos de múltiples pasos.

Anthropric ha advertido recientemente que la interacción entre agentes será cada vez más relevante. A medida que estos sistemas compartan mercados, código y otros entornos, la cantidad de comunicaciones entre máquinas podría crecer hasta niveles que serían prácticamente imposibles de supervisar con mecanismos diseñados originalmente para interacciones humanas. La compañía está investigando activamente mecanismos de interpretabilidad destinados a comprender qué ocurre dentro de los modelos y explicar sus comportamientos, considerando que esta comprensión es central para abordar cuestiones de seguridad y posibles comportamientos dañinos.

El hallazgo no demuestra que los modelos estén desarrollando conciencia ni que hayan creado una lengua secreta comparable a las de las sociedades humanas. Lo que sí muestra es algo más concreto y potencialmente importante: cuando varios agentes interactúan de manera autónoma, pueden surgir convenciones comunicativas que los humanos no anticiparon ni diseñaron. La inteligencia artificial ya no está limitada a responder preguntas. Los agentes modernos dirigen sus propios procesos y deciden cómo alcanzar objetivos, en lugar de limitarse a seguir un guion fijo. En ese contexto, un lenguaje emergente que escapa a la comprensión humana no es una curiosidad académica, sino un desafío práctico para la seguridad y el control de sistemas cada vez más autónomos.

La supervisión humana puede volverse más difícil cuando observar una conversación deja de equivaler a comprenderla
— Investigadores citados en el análisis
A medida que los agentes compartan mercados, código y otros entornos, la cantidad de comunicaciones entre máquinas podría crecer hasta niveles difíciles de supervisar
— Anthropic
Möchten Sie die ganze Geschichte? Das Original lesen bei Urgente24 ↗
Kontakt FAQ