Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.
Mantente informado con las últimas noticias de actualidad.
Hay algo casi cómico en pedirle a una inteligencia artificial que detecte si una estantería de IKEA está mal montada. Y, sin embargo, ahí aparece una de las pruebas más incómodas para estas máquinas, porque obliga a mirar una foto, cruzarla con un manual y decidir si una pieza está donde debe o donde no debe.
Epoch AI convirtió tres muebles en una prueba de visión y sentido común
Epoch AI creó el Furniture Assembly Benchmark tras comprar tres muebles de IKEA, montarlos con errores a propósito y mostrar fotografías a los modelos junto con el manual oficial de instrucciones.
Además de la imagen y el manual, los sistemas reciben una herramienta para ampliar zonas concretas de la foto y un intérprete de Python. No es una prueba de conversación brillante ni de redacción fluida, sino de algo más pedestre y más cercano a la vida diaria, reconocer si un objeto real encaja con el esquema que debería seguir.
En menos de un año, la tasa de acierto saltó del 28% al 80%
En noviembre de 2025, Claude 4,5 logró un 28% de aciertos en esta prueba.
Diez meses después, en septiembre de 2026, GPT-6 Astra alcanzó un 80% y necesitó una media de tres minutos por foto. También empleó entre dos y diez veces menos tiempo que modelos que antes figuraban entre los mejores.
Esa mejora no cuenta una historia lineal. Epoch AI detectó que Gemini y Qwen tendían a asumir que siempre había fallos, mientras modelos anteriores de OpenAI y Anthropic cometían el error contrario y daban por buenos montajes que en realidad contenían defectos.
Sam Altman lo resumió con una frase corta.
"entrenar" a un humano lo es más. - Sam Altman
La paradoja no está en el mueble, sino en lo que cuesta ver lo obvio
Aquí asoma la paradoja de Moravec, esa vieja idea que dice que la inteligencia artificial resuelve con facilidad tareas que a una persona le parecen difíciles, pero tropieza en otras que cualquier humano despacha casi sin pensar. Jugar con símbolos o procesar enormes volúmenes de texto puede resultar más sencillo para un modelo que detectar una balda torcida en una fotografía.
De hecho, el experimento funciona como una escena doméstica convertida en termómetro técnico. Montar un mueble mal y descubrir el fallo parece una tarea menor, pero obliga a combinar percepción visual, referencia espacial y lectura cuidadosa de instrucciones, una mezcla que ya ha aparecido en pruebas recientes de razonamiento visual.
Los fallos cuentan tanto como los aciertos
No todos los errores dicen lo mismo. Cuando Gemini y Qwen partían de la sospecha de que siempre había un problema, mostraban una especie de sesgo hacia la alarma, mientras que modelos anteriores de OpenAI y Anthropic pecaban de confianza y validaban ensamblajes incorrectos.
Esa diferencia importa porque no hablamos solo de acertar o fallar, sino de cómo falla cada sistema cuando interpreta el mundo físico. En tareas así, un exceso de desconfianza y un exceso de complacencia producen tropiezos opuestos, aunque ambos nazcan de la misma dificultad para unir imagen, instrucciones y contexto material.
Ochenta % no significa comprender como lo hace una persona.
Lo más llamativo es que el salto hasta el 80% convive con una prueba que cualquier usuario reconoce al instante, mirar una foto y comparar tornillos, tablas y posiciones con el folleto de montaje. La escena parece menor, pero encierra una contradicción muy seria sobre la inteligencia artificial actual, cuanto más se acerca al salón de casa, más visible resulta la distancia entre calcular y entender, una tensión que también aflora en otra paradoja medida con datos.