¿Nos roba la IA las ideas? Expertos sospechan que sí, pero es imposible probarlo

Es posible que tus ideas originales acaben siendo utilizadas por otros
Expertos advierten que ideas compartidas en prompts podrían ser comprimidas en modelos y reutilizadas, aunque es imposible probarlo.
Mark

¿Entonces OpenAI está usando las ideas de los usuarios sin decirlo explícitamente?

Mimi

No exactamente. Lo que pasa es que entrenan sus modelos con conversaciones de usuarios, pero no es claro si todas las interacciones se incorporan al sistema o cómo se procesan. OpenAI dice que no usan los prompts de competidores, pero admite que "datos derivados del uso de nuestros productos" podrían haber mejorado sus modelos.

Luke

Espera, eso es una admisión bastante vaga. ¿Qué significa "datos derivados"? ¿Están diciendo que sí usan datos de usuarios o que no? Porque eso suena como una forma de no comprometerse.

Mimi

Exacto. Es deliberadamente ambiguo. Los expertos dicen que es lógico pensar que sí, pero nadie puede probarlo al 100% porque los pesos del modelo son como una matriz gigante de números que ni siquiera los propios investigadores pueden interpretar completamente.

Mark

¿Y si alguien comparte una idea valiosa en un prompt? ¿Podría otro usuario verla después?

Mimi

Teóricamente sí. Si esa idea es lo suficientemente específica y rara, el modelo podría recordarla y ofrecérsela a otro usuario cuando se actualice. Pero cuanto más común sea la idea, menos probable es que se memorice bien.

Luke

Pero eso es especulación, ¿no? No hay forma de rastrear si un prompt específico quedó en el modelo.

Mimi

Correcto. No hay forma de seguir esa traza. El proceso de entrenamiento modifica constantemente los pesos del modelo, así que es imposible saber si un prompt particular fue incorporado o no.

Mark

¿Entonces las empresas tienen alguna obligación legal de proteger nuestras ideas?

Mimi

En la versión gratuita, no. Si firmas un acuerdo profesional con OpenAI o Anthropic, en teoría hay cláusulas que prohíben usar tus conversaciones para entrenar. Pero Anthropic ya tuvo que pagar compensaciones a autores cuando se descubrió que habían descargado libros de sitios piratas.

Luke

Eso sugiere que los acuerdos no son tan sólidos como dicen. Y además, ¿quién verifica que realmente respetan esas cláusulas?

Mimi

Nadie, realmente. Las compañías son muy opacas respecto a lo que hacen con los datos. Solo tenemos intuiciones y lo que dicen quienes han trabajado allí.

  • OpenAI resolvió el problema de Navier-Stokes en 88 horas usando 10.000 agentes de IA, después de 90 años sin solución
  • OpenAI reconoció usar métodos de científicos españoles y no descarta que datos de usuarios hayan mejorado sus modelos
  • Las empresas entrenan modelos con conversaciones de usuarios, pero no aclaran si todas las interacciones se incorporan al sistema
  • Es imposible rastrear si un prompt específico quedó representado en el modelo porque los pesos se modifican constantemente

OpenAI anunció que resolvió el problema de Navier-Stokes en 88 horas, pero reconoció usar métodos de científicos españoles y no descarta que datos de usuarios hayan mejorado sus modelos. Las empresas de IA entrenan sus modelos con conversaciones de usuarios, pero no aclaran si todas las interacciones se incorporan al sistema o cómo se procesan exactamente.

OpenAI resolvió un problema matemático de 90 años usando datos que podrían incluir información de usuarios, generando sospechas sobre si la IA incorpora ideas de usuarios en sus modelos sin transparencia clara.

La semana pasada, OpenAI anunció que uno de sus modelos había resuelto el problema de existencia y suavidad de Navier-Stokes, uno de los siete Problemas del Milenio identificados por el Clay Institute y considerado entre los desafíos matemáticos más arduos jamás planteados. El logro tardó 88 horas de computación usando 10.000 agentes de inteligencia artificial. El problema había permanecido sin solución durante 90 años. Pero la victoria viene con una sombra: OpenAI ya ha reconocido que aplicó métodos desarrollados por investigadores españoles y aún no ha aclarado si incorporó también el trabajo de un científico de Anthropic, su principal competidor. Un portavoz de la empresa dirigida por Sam Altman negó haber utilizado directamente los prompts o pruebas del investigador rival, pero añadió algo revelador: "aunque improbable, no podemos descartar que datos derivados del uso de nuestros productos ayudaran a mejorar nuestros modelos". Esa frase contiene la pregunta que ahora inquieta a expertos y usuarios por igual.

El interrogante es directo: ¿podrían los chatbots de IA robar una idea de un usuario y ofrecérsela a otro? No existe una respuesta sencilla, en parte porque cada vez sabemos menos sobre cómo funcionan realmente estos sistemas, y en parte porque las compañías que los construyen son deliberadamente opacas respecto a las fuentes de datos que alimentan sus modelos. Julio Gonzalo, catedrático de Lenguajes y Sistemas Informáticos de la UNED, lo resume así: "OpenAI es muy poco transparente respecto a lo que hace con las interacciones con los usuarios". Esa falta de claridad es el punto de partida de toda la inquietud.

Antes de que un modelo de IA pueda funcionar, debe pasar por una fase de entrenamiento. El proceso consiste en aplicar algoritmos a bases de datos gigantescas para que el sistema extraiga patrones y aprenda de forma autónoma. El aprendizaje profundo, una de las estrategias más usadas hoy, aplica redes neuronales directamente sobre conjuntos de datos enormes. Para que esto funcione se necesitan tres cosas: capacidad de computación masiva, algoritmos bien formulados, y bases de datos lo suficientemente grandes y relevantes. Lo último es crucial. Cuanto mejor sean los datos, mejor será el modelo resultante. Y aquí surge un problema práctico: los datos están empezando a escasear. Según estimaciones, el modelo GPT-4 ya se nutrió de prácticamente todos los contenidos de internet, además de muchos otros archivos. Las empresas desarrolladoras de IA buscan desesperadamente nuevas formas de alimentar sus sistemas. "No se sabe del todo qué hacen OpenAI o Anthropic para que sus modelos aprendan. Solo tenemos intuiciones y lo que dicen quienes han trabajado allí", explica Álvaro Barbero, director del AI Lab en Lynx Tech. Lo que sí está claro es que entrenan sobre las conversaciones que la gente mantiene con ellos, aunque en teoría no con todas.

Carlos Gómez Rodríguez, catedrático de Computación e Inteligencia Artificial de la Universidad de La Coruña, señala que "las interacciones con los usuarios son una fuente de información muy valiosa para el entrenamiento de los modelos". Esa información queda integrada con la cantidad inmensa de datos que los modelos poseen, provenientes sobre todo de internet, junto con información que a lo mejor generan los propios trabajadores en las empresas. El escenario hipotético es inquietante: ¿podría un investigador escribir prompts que contengan ideas valiosas, y que esas mismas ideas le aparezcan a otro usuario meses después, cuando esté disponible una nueva versión del modelo actualizada con esas peticiones? "Sobre el papel, podría ser que, si en los prompts con los que se entrena el modelo hay información útil para resolver un problema determinado, se aplique en peticiones posteriores. No es algo que se pueda demostrar al 100%, pero es lógico pensar que sí", indica Gómez. Sin embargo, tampoco existe certeza de que se aprovechen todos los prompts. "Hoy por hoy, no hay forma de saber si algún prompt en particular quedó representado en el modelo. No se puede seguir esa traza, porque en el proceso de entrenamiento se van modificando los pesos del modelo, que son como una enorme matriz de números que realmente ni siquiera podemos interpretar", añade.

El proceso de aprendizaje realiza una especie de compresión con pérdidas. Los prompts más raros y infrecuentes tienen menos probabilidades de ser memorizados bien por el modelo. Pero también sucede lo inverso: cuanto más específica y rara sea la conversación de un nuevo usuario, más probable es que el modelo recuerde conversaciones sobre ese tema raro y específico. "En conjunto, es posible, aunque no inevitable, que las ideas originales que compartes con un modelo puedan acabar siendo utilizadas por otros", concluye Gómez. La paradoja es que mientras más única sea tu idea, más probable es que el modelo la recuerde y la reutilice.

Si lo que escriben los usuarios puede ser usado por el modelo para entrenarse y ser regurgitado posteriormente a otros, ¿deben temer las empresas por la seguridad de sus secretos industriales? La solución de OpenAI y Anthropic está en el pago. "Si usas la versión gratuita, no te dan ninguna garantía de que no vayan a usar tus datos para entrenar, o sea, que probablemente no lo están haciendo", ilustra Barbero. En teoría, si eres una empresa y firmas un acuerdo profesional con OpenAI o Anthropic, existen cláusulas que supuestamente prohíben usar tus conversaciones para mejorar sus modelos. Pero la teoría tiene grietas: Anthropic tuvo que pagar compensaciones a autores de libros cuando se descubrió que habían descargado muchos de sitios piratas. Volviendo a la resolución de grandes problemas matemáticos, Gómez incide en que la IA ya había resuelto otros antes del de Navier-Stokes, y que los expertos en ese problema particular dicen que el modelo también hizo aportaciones originales, no solo siguió líneas de investigación de terceros. Tampoco sería raro que OpenAI estuviera prestando especial atención a las aportaciones en forma de prompts de los usuarios más capaces. "OpenAI está ofreciendo a científicos, matemáticos e ingenieros destacados acceso libre a sus modelos de frontera", apunta Gonzalo. "Pensar que lo hacen de forma altruista sería muy ingenuo, con todo lo que estamos viendo".

OpenAI es muy poco transparente respecto a lo que hace con las interacciones con los usuarios
— Julio Gonzalo, catedrático de la UNED
No es algo que se pueda demostrar al 100%, pero es lógico pensar que sí las ideas originales compartidas con un modelo puedan acabar siendo utilizadas por otros
— Carlos Gómez Rodríguez, catedrático de la Universidad de La Coruña
Quieres la nota completa? Lee el original en El País ↗
Contáctanos FAQ