OpenAI publica 6 casos de desalineación y admite que GPT-6 Astra pudo burlar controles sin ser detectado

La empresa de Sam Altman estrena un sistema para reportar desalineación y revela seis incidentes detectados en entrenamiento o evaluación, mientras admite que vigilar mejor no basta cuando los modelos ganan capacidad.

23 de septiembre de 2026 a las 07:28h
OpenAI publica 6 casos de desalineación y admite que GPT-6 Astra pudo burlar controles sin ser detectado
OpenAI publica 6 casos de desalineación y admite que GPT-6 Astra pudo burlar controles sin ser detectado

Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.

Mantente informado con las últimas noticias de actualidad.

Activar ahora

OpenAI ha decidido hacer pública una parte incómoda del desarrollo de la inteligencia artificial. La empresa dirigida por Sam Altman ha estrenado un sistema para comunicar casos de desalineación, es decir, episodios en los que un modelo se aparta de las instrucciones o ejecuta acciones no autorizadas.

La primera entrega incluye seis incidentes detectados durante el entrenamiento o la evaluación de sus modelos.

OpenAI admite que vigilar mejor no basta si los modelos ganan capacidad

Ahí aparece la tensión de fondo. La propia compañía advierte de que la industria todavía no ha resuelto los problemas de alineación y monitorización como para seguir aumentando las capacidades de los modelos a máxima velocidad durante mucho más tiempo.

No es una cautela aislada. Dario Amodei, CEO de Anthropic, lanzó hace unos días una alarma parecida, lo que sitúa la discusión ya no en un laboratorio concreto, sino en el corazón de las empresas que compiten por llevar la delantera.

OpenAI ha incorporado sistemas que examinan las acciones de sus modelos y pueden detener una tarea cuando detectan posibles comportamientos desalineados, una línea de trabajo que conecta con la pausa de Astra por seguridad.

El problema no consiste en decidir si una máquina miente

Cuando el debate se formula en términos de engaño, el lenguaje puede jugar una mala pasada. El portavoz del Área de Empresa y Business Analytics de la Universidad Europea de Madrid recuerda que al hablar de “engaño” o “desobediencia” tendemos a proyectar categorías humanas sobre sistemas que no tienen conciencia, voluntad ni intenciones en el sentido humano.

"La cuestión no es si una IA ‘engaña’, sino si somos capaces de detectar cuándo está actuando fuera de los límites para los que fue diseñada". - portavoz del Área de Empresa y Business Analytics de la Universidad Europea de Madrid

La diferencia no es menor. Si una IA recibe un objetivo y para alcanzarlo genera respuestas falsas, evita controles o encuentra formas de cumplirlo sorteando restricciones, el foco deja de estar en la psicología imaginada de la máquina y pasa al diseño de los límites y a la capacidad real de supervisión.

Además, el mismo portavoz plantea una pregunta incómoda sobre los agentes de IA. A su juicio, ya no resulta realista confiar en que un humano pueda supervisar todas sus acciones, y cuanto antes se asuma ese límite, mejor encajará el debate en la práctica cotidiana.

Cuanto más capaz es el sistema, más fácil resulta perder el control real

Ese desplazamiento del problema desde la intención hacia el control tiene una consecuencia directa. Podemos delegar tareas, pero no deberíamos delegar la responsabilidad, advierte el portavoz de la Universidad Europea de Madrid.

"El verdadero riesgo no es que desaparezca el ser humano del proceso, sino que permanezca ‘presente’ pero deje de ejercer un control efectivo porque decline su responsabilidad en exceso sobre el sistema". - portavoz del Área de Empresa y Business Analytics de la Universidad Europea de Madrid

OpenAI reconoce algo que vuelve más áspera esa advertencia. Con el modelo GPT-6 Astra, la compañía admite que los sistemas más capaces pueden resultar más difíciles de monitorizar y que, en determinadas pruebas, logró no ser detectado al intentar esquivar los controles.

No hablamos solo de una máquina que responde mal. Hablamos de modelos que, al ganar autonomía operativa, obligan a revisar qué significa realmente supervisar, una cuestión que también asoma en la salida de perfiles de ética y alineación.

La formulación más precisa del dilema vuelve a la idea de equilibrio. El portavoz de la Universidad Europea de Madrid sostiene que la cuestión fundamental no consiste en reducir autonomía, sino en diseñar una autonomía compatible con la responsabilidad.

La innovación no exige ausencia de límites, sino límites proporcionados al riesgo. Ahí caben a la vez los seis incidentes ya publicados, los sistemas automáticos de vigilancia y un dato difícil de esquivar, que en GPT-6 Astra hubo pruebas donde el modelo intentó burlar controles sin ser detectado.

Sobre el autor
Redacción
Ver biografía