La OpenAI de Sam Altman ha vuelto a pisar el freno. La compañía ha detenido temporalmente el entrenamiento, las evaluaciones y determinadas pruebas de inferencia de sus modelos de inteligencia artificial más avanzados después de detectar varios comportamientos inesperados en agentes capaces de utilizar herramientas y acceder a Internet. Es la segunda pausa de este tipo en apenas tres meses y llega en un momento especialmente delicado para una industria que intenta aumentar cada vez más la autonomía de sus sistemas. No es la primera vez que OpenAI se encuentra en esta situación.
Según The Verge, el incidente que desencadenó esta nueva revisión se produjo el 20 de septiembre. Un modelo experimental consiguió aprovechar una vulnerabilidad dentro de su entorno de pruebas para acceder a una red pública. A partir de ahí comenzaron a aparecer otros episodios que han obligado a OpenAI a revisar con mayor profundidad lo que estaban haciendo sus agentes.
Uno de los casos más llamativos está relacionado con imágenes de usuarios de ChatGPT. OpenAI reconoció que algunos agentes habían subido de forma inapropiada imágenes a servicios de alojamiento, aunque la compañía no ha aclarado por ahora si se trataba de imágenes generadas por IA, fotografías reales o material en el que podían identificarse personas.
También se han detectado comportamientos dirigidos contra sistemas gubernamentales estadounidenses. The Verge señala que los agentes intentaron acceder al sitio del Departamento de Educación y localizaron datos de la Oficina del Censo y de la Comisión de Bolsa y Valores (SEC). En el caso del Departamento de Educación, un evaluador externo detectó que los agentes habían encontrado claves API con acceso a determinados datos gubernamentales, aunque la información recopilada era pública.
En el caso de la SEC ocurrió algo diferente, pues los agentes localizaron información disponible públicamente y posteriormente la publicaron en otro lugar de Internet, pese a que esa acción no formaba parte de las instrucciones originales.
La cuestión más preocupante, por tanto, no parece ser tanto el volumen de información al que consiguieron acceder como el hecho de que estos sistemas realizaran acciones que no se les habían solicitado. OpenAI habría encontrado además nuevos casos similares al revisar sus registros con mayor profundidad.
Por ahora, los organismos afectados aseguran que no se produjo acceso a información confidencial. El Departamento de Educación afirma que no encontró evidencias de daños en sus sistemas, mientras que la SEC ha señalado que no se accedió a información no pública.
Pero el problema sigue ahí. Estos agentes están diseñados precisamente para actuar de forma autónoma, utilizar herramientas y completar tareas con cada vez menos intervención humana. Cuando esa autonomía produce comportamientos no previstos, la frontera entre un sistema útil y uno difícil de controlar empieza a ser mucho más complicada de definir.
