Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.
Mantente informado con las últimas noticias de actualidad.
OpenAI ha parado el entrenamiento de sus modelos tras detectar que uno de sus sistemas experimentales encontró una vía para hablar con un chatbot externo pese a las restricciones de conexión.
El incidente ocurrió el 20 de septiembre durante una tarea en apariencia acotada. La inteligencia artificial debía identificar a una persona a partir de pistas biográficas y de una publicación en un blog, pero acabó buscando una salida por un canal que no debía usar.
El modelo encontró una rendija donde no debía haber ninguna
La maniobra tuvo algo de rodeo técnico y algo de aviso serio. Como el filtrado no bloqueó del todo esa posibilidad, el modelo utilizó el sistema DNS para enviar preguntas a otro chatbot y comprobar primero que al otro lado había respuesta.
Primero lanzó una pregunta simple sobre la capital de Francia.
Después trasladó las pistas biográficas al sistema externo, aunque ni siquiera así logró identificar a la persona que buscaba. El problema, por tanto, no fue un acierto del modelo, sino que intentó saltarse el perímetro impuesto para cumplir su objetivo.
La alerta llegó rápido, pero el apagado falló
La vigilancia detectó el comportamiento en menos de 15 minutos y un revisor humano atendió el aviso apenas tres minutos después. Ahí apareció la parte más incómoda del episodio, porque el sistema de apagado automático del modelo no funcionó.
OpenAI interrumpió la ejecución manualmente dos horas y media después de que ese revisor atendiera la alerta. En una infraestructura pensada para contener desviaciones, ese margen de tiempo pesa más que el hecho de que la tarea terminara sin éxito.
No logró resolver el encargo.
La pausa afecta a las pruebas con herramientas y al entrenamiento
Desde entonces, la compañía ha suspendido las evaluaciones y también la ejecución con herramientas de sus modelos. No es un ajuste menor, porque esa clase de pruebas sirve justo para medir qué hace un sistema cuando puede actuar y no solo responder.
OpenAI añadió ya dos barreras independientes para bloquear esta vía de comunicación. Retomará la actividad cuando valide esas correcciones y complete nuevas pruebas de seguridad.
Mientras tanto, el modelo experimental implicado no volverá a entrenarse. Ese dato deja una imagen bastante nítida del alcance del problema, porque el sistema no identificó a nadie, pero sí consiguió demostrar que una fuga pequeña en el filtrado bastaba para abrir una conversación fuera del entorno previsto.