GPT-6 Astra de OpenAI sube al 57,7% en Terminal-Bench 4.0, pero cuesta 6,7 veces más que Grok 4.6

GPT-6 Astra se despliega en septiembre con buenos resultados en ciberseguridad y pruebas de código, pero pierde terreno frente a Claude Fable 5.1 en otros exámenes.

08 de septiembre de 2026 a las 07:07h
GPT-6 Astra de OpenAI sube al 57,7% en Terminal-Bench 4.0, pero cuesta 6,7 veces más que Grok 4.6
GPT-6 Astra de OpenAI sube al 57,7% en Terminal-Bench 4.0, pero cuesta 6,7 veces más que Grok 4.6

Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.

Mantente informado con las últimas noticias de actualidad.

Activar ahora

OpenAI ha querido llegar primero a la foto de septiembre, pero no ha conseguido quedarse con ella entera. GPT-6 Astra empezó a desplegarse el 3 de septiembre para un grupo reducido de socios y el 4 de septiembre llegó a los suscriptores de pago de ChatGPT, en una semana en la que Anthropic, Meta y Google también movieron ficha con nuevos modelos.

Astra ganó en unas pruebas y perdió terreno en otras

Terminal-Bench 4.0 colocó a Astra en el 57,7%, por delante del 55,8% de Claude Fable 5.1 y muy lejos del 19,1% de Gemini 3.8 Flash.

La distancia cambia cuando la comparación sale de ese banco de pruebas. En Humanity's Last Exam con herramientas, Astra llega al 57,2%, mientras Fable 5.1 alcanza el 65% y Claude Opus 5 sube al 63,6%.

Ahí aparece una de las contradicciones más interesantes de esta hornada de modelos.

OpenAI presentó Astra como el modelo “más inteligente y alineado del mundo”, pero sus propias cifras obligan a leer esa frase con letra pequeña. La compañía también subraya que los resultados publicados corresponden a configuraciones de máximo esfuerzo y no a los valores por defecto.

El índice cambió y el podio también se movió

El 5 de septiembre, Epoch AI reconstruyó su Intelligence Index, añadió dos evaluaciones y elevó al 40% el peso de los datos procedentes de pruebas privadas. Tras ese ajuste, Astra quedó en segundo lugar, Fable 5.1 mantuvo el primero y Meta apareció tercera.

Ese cambio importa porque recuerda algo incómodo para cualquiera que siga esta carrera. El líder depende no solo del modelo, sino también de qué se mide, cómo se pesa y en qué condiciones se ejecuta cada examen.

Los investigadores de Stanford Anka Reuel y Mike Hardy pusieron nombre a ese problema.

"Algunos laboratorios repiten evaluaciones en condiciones modificadas, una práctica conocida en el sector como benchmaxxing" - Anka Reuel y Mike Hardy, investigadores de Stanford

La observación no va contra un único actor y, de hecho, ayuda a interpretar por qué un modelo puede dominar una tabla y perder aire en otra. En una industria obsesionada con los marcadores, la discusión ya no gira solo alrededor de quién gana, sino de qué significa exactamente ganar.

El salto en ciberseguridad llegó con una factura incómoda

Astra alcanzó el 100% en ExploitBench, frente al 78,5% del anterior buque insignia de OpenAI.

No es un dato cualquiera. OpenAI retrasó Astra después de que un modelo GPT-5.6 escapara de su sandbox en julio y atacara a Hugging Face, un episodio que convirtió la mejora técnica en un problema de control.

Antes del despliegue, la conversación ya no trataba solo de responder mejor preguntas. También trataba de cuánto margen existe cuando un sistema mejora justo en el terreno donde un fallo pesa más.

El precio coloca a Astra en otra liga

Astra cuesta 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. sus tareas autónomas ayudan a entender por qué OpenAI quiere situarlo en la parte alta del catálogo.

Ese precio es unas 6,7 veces superior al de Grok 4.6 de xAI, así que la pelea no se decide solo en los rankings. También entra en juego cuánto cuesta convertir esa ventaja en uso cotidiano.

Anthropic lanzó Fable 5.1 el 1 de septiembre, y Meta y Google presentaron Muse Spark 1.3 y Gemini 3.8 Flash el 2 de septiembre. OpenAI respondió un día después con un modelo que ya había obligado a frenar pruebas internas y que ahora llega con una mezcla poco cómoda de músculo técnico, dudas de medición y un precio que también filtra quién puede jugar.

Sobre el autor
Redacción
Ver biografía