Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.
Mantente informado con las últimas noticias de actualidad.
La memoria de una inteligencia artificial nació para hacer la conversación más cómoda, pero también puede convertirse en un punto débil. Investigadores de la Universidad Estatal de Nuevo México han descrito GhostWriter, un vector de ataque que aprovecha la memoria a largo plazo de los modelos de lenguaje para alterar su comportamiento.
ChatGPT y Gemini usan esa memoria para recordar datos de conversaciones anteriores y personalizar las respuestas. Ahí está la paradoja, porque la misma función que da sensación de continuidad también abre una puerta a manipulaciones persistentes.
GhostWriter esconde la orden donde nadie espera mirarla
GhostWriter oculta una indicación maliciosa en un objeto que la inteligencia artificial examina, como una fotografía o un texto.
No hace falta que la instrucción aparezca como una orden visible dentro del chat. Basta con que entre camuflada en el material que el sistema analiza, una lógica que recuerda a modelos multimodales de IA, donde imagen y texto conviven en la misma tarea.
Después, la inyección manipula la información almacenada en la memoria del modelo. El problema ya no afecta solo a una respuesta concreta, sino al rastro que queda guardado para interacciones posteriores.
El fallo aparece cuando la memoria guarda sin filtrar
Los autores del trabajo sitúan el origen del riesgo en la falta de una gobernanza de memoria centrada en la seguridad. Dicho de forma llana, el sistema puede recordar sin discriminar bien qué merece conservar y qué debería bloquear.
Esa idea toca una cuestión que ya aparecía en debates sobre ventana de contexto, aunque aquí el foco cambia y pasa de lo que el modelo ve en el momento a lo que decide conservar para más tarde.
En Arxiv ya puede consultarse el estudio que detalla este ataque.
AM-Sentry filtra qué entra y qué vuelve a salir
La respuesta propuesta por el equipo es AM-Sentry, un centinela de memoria agente diseñado para mitigar este vector de ataque. Su planteamiento combina una política de ahorro de memoria con un filtro de recuperación de memoria.
El sistema no solo vigila lo que se guarda, también controla lo que la IA recupera después. Esa doble revisión apunta justo al lugar donde GhostWriter intenta hacerse fuerte, que es la transición entre una entrada aparentemente inocua y un recuerdo que condiciona respuestas futuras.
Al final, la tensión no está en una foto ni en una frase aislada, sino en que una instrucción escondida pueda instalarse en la memoria que ChatGPT y Gemini usan para personalizar el trato con cada usuario.