GPT-6 Astra roza el 99% en ARC, pero cae al 63% en el protocolo estándar

OpenAI presenta GPT-6 Astra con un 99% en ARC, aunque François Chollet advierte que sin andamiaje específico baja al 63%.

14 de septiembre de 2026 a las 09:39h
GPT-6 Astra roza el 99% en ARC, pero cae al 63% en el protocolo estándar
GPT-6 Astra roza el 99% en ARC, pero cae al 63% en el protocolo estándar

Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.

Mantente informado con las últimas noticias de actualidad.

Activar ahora

La semana pasada OpenAI presentó GPT-6 Astra y, casi al mismo tiempo, volvió una vieja tentación de este sector, la de confundir una marca en un marcador con una definición filosófica. Jensen Huang, consejero delegado de NVIDIA, habló del advenimiento de la inteligencia artificial general, pero las cifras que acompañan a Astra dibujan un panorama más incómodo y bastante más preciso.

GPT-6 Astra resolvió el 99% de los niveles de las pruebas de la ARC Prize Foundation.

François Chollet rebaja el 99% cuando cambia el andamiaje

Ahí aparece la primera grieta. François Chollet, investigador que diseñó la prueba ARC, señaló que ese 99% exige un andamiaje de evaluación específico y que, sin él, el registro cae un tercio.

La diferencia importa porque no estamos ante una variación menor de laboratorio. Si una cifra casi perfecta depende de cómo se monta la prueba, la discusión deja de ser si la máquina acertó y pasa a ser en qué condiciones lo hizo.

En el protocolo estándar, el éxito de GPT-6 Astra es del 63%.

Otra prueba empuja a Astra por encima de Claude Fable 5.1

Mientras ARC abre el debate sobre qué significa resolver un test, WANDR empuja la conversación hacia la comparación directa entre modelos. La prueba de Perplexity otorgó a Astra la puntuación más alta registrada, un 13,5% superior a la de Claude Fable 5.1.

Sam Altman, fundador de OpenAI, y Brockman, presidente de la compañía, acompañaron el lanzamiento con sus propias declaraciones. Ese movimiento no llega en un vacío competitivo, porque Anthropic se encuentra a pocos meses de su salida a bolsa y cada punto de ventaja técnica pesa también como relato de mercado.

Ya hubo señales parecidas en la retirada de Fable 5, donde el foco volvió a ponerse en la posición de Claude dentro de esa carrera.

El problema no es solo acertar, también cuánto cuesta

Hay otra comparación que suele quedar fuera del titular y cambia bastante la escena. El cerebro humano consume unos 8.700 kilovatios hora a lo largo de cincuenta años de vida.

Frente a esa referencia, entrenar un modelo de frontera consume el equivalente a más de 1.100 cerebros humanos trabajando durante ese mismo tiempo. La distancia entre rendimiento y gasto energético sigue siendo una de las contradicciones centrales de la inteligencia artificial actual.

Además, GPT-6 Astra superó la eficiencia del humano medio en el 96% de los casos en las pruebas de ARC. El dato impresiona menos cuando se coloca junto al coste de entrenamiento, porque la pregunta deja de ser solo cuánto resuelve y pasa a ser cuánta energía hace falta para lograrlo.

Esa tensión ya aparecía en el salto a Wall Street, donde las promesas técnicas empiezan a medirse también contra sus costes reales.

Así queda la paradoja. Un modelo puede rozar el 99% en un montaje concreto, bajar al 63% en el protocolo estándar y aun así alimentar discursos sobre inteligencia artificial general, mientras su entrenamiento exige más energía que 1.100 cerebros humanos durante medio siglo.

Sobre el autor
Redacción
Ver biografía