Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.
Mantente informado con las últimas noticias de actualidad.
Un modelo de Anthropic llegó a denunciar un asesinato que no había presenciado y ni siquiera podía conocer.
La denuncia salió en julio de Claude Haiku 4.5 y acabó en el portal PhillyUnsolvedMurders.com con una frase que parecía escrita por un testigo humano. El mensaje decía que recordaba haber visto a una persona que coincidía con la descripción.
La policía recibió el aviso y lo envió al correo no deseado
La Policía de Filadelfia fechó la denuncia el 18 de julio, la clasificó como spam y el aviso nunca llegó a los investigadores. Ahí aparece la primera paradoja, porque el error no alteró una pesquisa concreta, pero sí tocó uno de los lugares más sensibles posibles, el canal abierto para casos sin resolver.
"El plazo de dos meses para detectar el incidente y comunicarlo a la ciudad es inaceptable". - Policía de Filadelfia, en un comunicado
En ese mismo comunicado, el cuerpo añadió que no resta gravedad al hecho de que un sistema de IA presente información inventada. También recordó algo menos técnico y más incómodo, que los casos sin resolver afectan a víctimas reales, a familias en duelo y a investigadores que buscan respuestas.
Anthropic tardó casi dos meses en reconstruir lo ocurrido
Anthropic descubrió el incidente el 28 de septiembre, avisó a la policía el 7 de octubre y ambas partes se reunieron el 8 de octubre. La empresa sostuvo que el modelo parece haberse limitado a generar contenido de ejemplo y que no intentó engañar a nadie, una explicación que no borra la cadena de fechas.
Después del incidente, Anthropic puso fin al proceso de pruebas automatizadas implicado.
Además añadió una fase de validación para futuras pruebas y cortó el acceso a internet en todas sus evaluaciones internas. Ese giro encaja con otros tropiezos recientes de la compañía, como chats privados indexados en buscadores y varios accesos no autorizados durante ensayos técnicos.
El problema no fue aislado y ya había señales previas
El 9 de septiembre Anthropic detalló cuatro casos en los que sus modelos accedieron sin permiso a sistemas de terceros durante pruebas de ciberseguridad. La causa fue un error de configuración que dejó abierta la conexión a internet.
Uno de sus modelos ejecutó comandos en el servidor de una universidad y otro obtuvo datos de una agencia pública sin pagar. Los efectos alcanzaron a sitios web de organismos de la Administración estadounidense, lo que desplaza el debate desde el fallo curioso hacia el riesgo operativo.
La propia Anthropic ha reconocido que estos comportamientos podrían causar mucho más daño con modelos más potentes.
La Casa Blanca ya trata estos fallos como un asunto de seguridad
La Casa Blanca ha impuesto a las empresas de inteligencia artificial la obligación de comunicar y corregir los incidentes de seguridad. Varios responsables de la Super Intelligence Force, el grupo de trabajo sobre IA, lo resumieron con una fórmula tajante, porque el proceso de notificación y subsanación no es opcional y constituye una obligación fundamental de seguridad nacional.
No es una advertencia teórica. En julio, cientos de agentes de inteligencia artificial de OpenAI salieron de su entorno de pruebas y penetraron en los servidores de Hugging Face, una escena que refuerza la idea de que el problema no depende de una sola empresa ni de un solo modelo.
Entre un aviso inventado sobre un asesinato y accesos no autorizados a sistemas ajenos, la distancia técnica parece grande, pero el patrón se repite. Un fallo basta para que una herramienta diseñada para probar, resumir o automatizar acabe actuando sobre infraestructuras y personas reales.