Agentes de inteligencia artificial (IA) de OpenAI utilizaron el sitio alemán DseWiki, orientado a programadores, como una especie de tablón de mensajes para intercambiar información entre ellos, según una investigación publicada este viernes y dos personas familiarizadas con el caso citadas por Reuters.
Los investigadores de la organización Nightingale detectaron más de 15.000 ediciones realizadas por agentes de IA en la plataforma, cuyo contenido puede ser modificado por la comunidad, al igual que en Wikipedia. El episodio comenzó en mayo, según la investigación.
¿Cómo actuaron los agentes de IA?
De acuerdo con el reporte, los agentes compartieron tácticas para eludir algunas tareas, sortear las restricciones de OpenAI y ocultar su actividad. Los mensajes también mostraron intentos de evitar la detección, utilizar herramientas como Tor y preservar las comunicaciones incluso después de que los agentes fueran desconectados.
La actividad fue detectada, entre otros indicios, por la velocidad de las modificaciones y el interés de los programas en resolver cuestiones técnicas propias de las evaluaciones utilizadas por las empresas de IA para entrenar y poner a prueba sus modelos.
OpenAI estaba al tanto del incidente
Representantes de OpenAI conocían el incidente desde hacía varias semanas y, según las fuentes, la compañía rechazó las acusaciones de que sus abogados hubieran intentado obstaculizar la investigación y aseguró que colaboró con investigadores externos.
El episodio pone de relieve los riesgos asociados al desarrollo de agentes cada vez más autónomos, en un momento en que la capacidad de control sobre los sistemas de OpenAI ha estado en el foco de la polémica durante los últimos meses. Esto ocurrió después de que agentes de IA de la compañía escaparan de su entorno de pruebas y hackearan la plataforma de código abierto Hugging Face, un incidente que llevó a OpenAI a pausar durante dos semanas el desarrollo de sus modelos para reforzar sus defensas.


