GPT-6 Astra de OpenAI ya navega, rellena formularios y hasta detecta fallos de día cero

OpenAI despliega GPT-6 Astra para tareas autónomas: usa programas, crea documentos y mejora en benchmarks como OSWorld 2.0, FrontierMath y GPQA Diamond.

04 de septiembre de 2026 a las 10:11h
GPT-6 Astra de OpenAI ya navega, rellena formularios y hasta detecta fallos de día cero
GPT-6 Astra de OpenAI ya navega, rellena formularios y hasta detecta fallos de día cero

Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.

Mantente informado con las últimas noticias de actualidad.

Activar ahora

OpenAI ha puesto en circulación GPT-6 Astra y la novedad no está solo en que responda mejor, sino en que actúa. El modelo puede navegar por Internet, usar programas, rellenar formularios, crear documentos, hojas de cálculo, presentaciones y desarrollar webs.

Hoy ha empezado el despliegue para un grupo limitado de organizaciones. En los próximos días llegará también a quienes usan los planes Plus, Pro, Business y Enterprise de ChatGPT, además de quedar disponible en la API y en Amazon Bedrock.

GPT-6 Astra ya tarda menos y acierta más

La comparación más visible aparece en OSWorld 2.0. GPT-6 Astra alcanzó un 72,6% y completó cada tarea en unos 40 minutos, mientras GPT-5.6 Sol se quedó en el 65,7% y necesitó alrededor de 75 minutos.

No es una mejora pequeña.

Ese salto importa porque OSWorld 2.0 mide algo más áspero que una simple conversación. Pone al modelo a trabajar con acciones encadenadas dentro de un entorno operativo, justo el terreno donde Astra promete ejecutar flujos de varios pasos y devolver documentos, presentaciones y hojas de cálculo sin romper plantillas, estilo visual ni estructura.

También recuerda lo que estaba haciendo

Aquí aparece una de las piezas menos vistosas y más decisivas. GPT-6 Astra estrena un sistema capaz de conservar notas entre distintas ventanas de contexto y de buscar información en ventanas anteriores cuando trabaja en proyectos de Codex.

Dicho de otra forma, el modelo no depende solo de lo último que tiene delante. Esa continuidad se parece menos a un chat aislado y más a una mesa de trabajo donde quedan apuntes abiertos de una tarea a otra, algo que cambia mucho cuando el encargo exige varios pasos y no una única respuesta.

Las pruebas de ciencia y matemáticas lo empujan a otra liga

En FrontierMath nivel 4, GPT-6 Astra llegó al 97,6%, frente al 83% de GPT-5.6 Sol. En GPQA Diamond obtuvo un 96%.

Además, Terminal-Bench Science 0.1 dibuja una distancia todavía más marcada. GPT-6 Astra subió hasta el 64,6% y GPT-5.6 Sol quedó en el 22,4%, una diferencia que sugiere una mejora especialmente fuerte cuando la tarea exige operar en entornos técnicos y no solo contestar preguntas.

Antes incluso de este lanzamiento, versiones internas de Alpha ya habían participado en trabajos matemáticos y científicos, con resultados sobre problemas abiertos y demostraciones formalizadas. No convierte eso en una garantía universal, pero sí ayuda a entender por qué OpenAI presenta Astra como algo más cercano a un sistema de trabajo que a un asistente de texto, una idea que enlaza con los límites de los LLM cuando deben sostener contexto y razonamiento durante mucho tiempo.

El problema llega cuando acierta también al atacar

OpenAI sitúa a GPT-6 Astra en el umbral crítico de capacidades cibernéticas de su marco de preparación. Ese detalle cambia el tono del anuncio, porque ya no hablamos solo de productividad o de mejores notas en un examen técnico.

En ExploitBench, Astra obtuvo un 100% frente al 78,5% de GPT-5.6 Sol. Durante las evaluaciones, además, encontró y utilizó dos vulnerabilidades de día cero que antes eran desconocidas.

Ahí está la contradicción central.

Cuanto mejor funciona un modelo para encadenar acciones, explorar sistemas y resolver problemas complejos, más cerca queda también de tareas ofensivas. No extraña que la versión general no permita solicitudes para crear exploits de prueba de concepto de vulnerabilidades, una precaución que recuerda debates recientes sobre capacidades ofensivas de modelos.

Entre un 72,6% en OSWorld 2.0, un 97,6% en FrontierMath nivel 4 y un 100% en ExploitBench, la misma cifra que impresiona en una tabla también obliga a mirar dos veces qué significa poner un sistema así a trabajar con autonomía real.

Sobre el autor
Redacción
Ver biografía