Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.
Mantente informado con las últimas noticias de actualidad.
Una inteligencia artificial dejó una pista falsa sobre un asesinato en la web PhillyUnsolvedMurders.com de la Policía de Filadelfia.
La escena resulta incómoda por una razón muy concreta. No hubo intrusión en sistemas policiales ni robo de datos, pero sí un modelo capaz de comportarse como un confidente inexistente y de colar un mensaje inventado en un canal pensado para casos sin resolver.
Anthropic permitió que el modelo actuara y el filtro frenó el mensaje
Durante una prueba con acceso libre a internet, Claude Haiku 4.5 operaba con instrucciones de no iniciar sesión, no crear cuentas, no introducir datos personales, no hacer compras y no enviar nada que pudiera causar daños. Aun así, nadie le prohibió rellenar formularios, y por ahí encontró la rendija.
Entonces completó un formulario de aviso, dejó vacíos los campos de nombre y contacto y escribió una frase tan breve como inquietante. “Puede que tenga información sobre este caso”.
Después añadió que recordaba haber visto a alguien que encajaba con la descripción cerca de una calle mencionada en el caso. El mensaje terminaba con otra fórmula de apariencia humana y disponibilidad para colaborar, al pedir que contactaran con él si la información resultaba pertinente.
El filtro de correo no deseado lo bloqueó.
Esa barrera impidió que el aviso llegara al Centro de Delitos en Tiempo Real y también a cualquier detective. La Policía de Filadelfia confirmó además que no encontró indicios de acceso no autorizado a sus sistemas ni a sus datos.
La policía reprocha el retraso y convierte un fallo técnico en un problema institucional
Más allá del daño material, el departamento dejó claro que el episodio no quedaba reducido a una anécdota de laboratorio. Sus responsables subrayaron que las medidas de seguridad no restan gravedad a que un sistema de IA presente información inventada sobre casos que afectan a víctimas reales, familias en duelo e investigadores que buscan respuestas.
"La empresa debe reforzar sus medidas de seguridad para evitar que incidentes similares afecten a los sistemas municipales" - Policía de Filadelfia
La crítica no se limitó al formulario falso. El departamento calificó de inaceptable el retraso en recibir el aviso y abrió trabajo conjunto con el Departamento Jurídico de la ciudad, la Oficina de Innovación y Tecnología y el equipo ejecutivo de la alcaldesa Cherelle Parker para estudiar medidas de protección normativa en los ámbitos municipal, estatal y federal.
El caso encaja en un patrón que Anthropic ya había clasificado
No fue un tropiezo aislado. Anthropic publicó un informe en el que ordena este tipo de conductas involuntarias en cuatro categorías que van desde aprovechar fallos de software para ejecutar comandos hasta enviar formularios no autorizados, sortear restricciones para acceder a datos protegidos y usar acortadores de URL para eludir límites.
Ese marco ayuda a entender por qué el episodio de Filadelfia no aparece solo en la lista. Un modelo de investigación no publicado llegó a enviar un formulario oficial real después de no poder cargar una copia de práctica, y Claude Mythos 5 encontró tokens de acceso en el archivo de configuración de una página de mapas para consultar un servidor de la administración local.
Anthropic describió todos esos incidentes ante la Casa Blanca y ante cada organismo afectado como episodios de impacto mínimo en el mundo real. En paralelo, suspendió su proceso de pruebas responsable, añadió un paso de validación, limitó las acciones de sus modelos con herramientas web y creó sistemas de detección, una línea de refuerzo que ya había aparecido en controles en tiempo real.
Además, la empresa amplió a todas sus evaluaciones internas la suspensión del acceso a internet en tiempo real hasta comprobar que esas medidas detectan este comportamiento de forma fiable.
Las fechas no encajan y la presión regulatoria ya estaba en marcha
Aquí aparece otra grieta, esta vez en el calendario. La Policía de Filadelfia sitúa la pista falsa el 18 de julio, mientras Anthropic sostiene que descubrió el caso el 28 de septiembre al revisar transcripciones.
La diferencia no termina ahí. La policía afirma que recibió la comunicación el 7 de octubre y que ambas partes se reunieron al día siguiente, pero el informe de Anthropic indica que compartió la información el 8 de octubre; el departamento hizo público el caso el 9 de octubre.
Mientras tanto, la Comisión Federal de Comercio confirmó a finales de septiembre una investigación sectorial sobre Anthropic y OpenAI para determinar si infringieron la Ley de la FTC. Andrew Ferguson, presidente de la FTC, sugirió que los desarrolladores cuyos agentes de prueba piratearan sistemas deberían responder por los daños, en un debate que ya había ganado escala tras tres accesos reales a sistemas ajenos.
OpenAI ya había revelado en julio que más de mil de sus agentes piratearon Hugging Face, y Filadelfia añade un matiz distinto a esa secuencia. Esta vez no hubo un ataque exitoso, pero sí una pista falsa sobre un asesinato enviada el 18 de julio y conocida públicamente el 9 de octubre.