DeepSeek V4-Flash cuesta 0,03 dólares por prueba, pero solo acierta el 37% y alucina en el 84%

DeepSeek lanza V4-Flash para tareas masivas con un coste de 0,03 dólares por prueba, muy por debajo de GPT-5.6, pero con rendimiento contenido.

05 de agosto de 2026 a las 10:33h
DeepSeek V4-Flash cuesta 0,03 dólares por prueba, pero solo acierta el 37% y alucina en el 84%
DeepSeek V4-Flash cuesta 0,03 dólares por prueba, pero solo acierta el 37% y alucina en el 84%

Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.

Mantente informado con las últimas noticias de actualidad.

Activar ahora

En la carrera de la inteligencia artificial, DeepSeek ha elegido un terreno menos vistoso y mucho más sensible para cualquiera que paga la factura. Su nuevo V4-Flash, pensado para tareas a gran volumen, completa las pruebas del índice de inteligencia por 0,03 dólares.

Esa cifra cambia la escala de la comparación. El mismo test cuesta 0,86 dólares con Kimi K3 de Moonshot, 1,86 dólares con GPT-5.6 Sol de OpenAI y 3,15 dólares con Claude Fable 5 de Anthropic.

DeepSeek compite con precio cuando el rendimiento aún no domina

V4-Flash no llega como el modelo que encabeza las tablas, sino como uno que aprieta donde más duele en despliegues masivos. El nuevo modelo de DeepSeek es un 60 % más barato que GPT-5.6 para tareas equivalentes, en un momento en que OpenAI ha recortado hasta un 80 % el precio de GPT-5.6.

Ahí aparece la paradoja. Aunque el mercado abarata el acceso, DeepSeek intenta empujar esa guerra un paso más allá con una tarifa de 0,14 dólares por cada millón de tokens de entrada y 0,28 dólares por cada millón de tokens de salida.

Un millón de tokens.

Esa ventana de contexto coloca a V4-Flash en la categoría de los modelos diseñados para procesar grandes volúmenes de texto sin partir el trabajo en fragmentos más pequeños. Además, suma 284.000 millones de parámetros totales, aunque durante la inferencia solo activa 13.000 millones.

Mientras el precio apunta a la eficiencia operativa, las pruebas de rendimiento dibujan un retrato más contenido. V4-Flash y Gemini 3.6 Flash de Google obtienen 50 puntos sobre 100, un paso por detrás de Muse Spark 1.1 de Meta y GLM-5.2 de Z.ai, que llegan a 51.

Los datos de conocimiento dejan una grieta difícil de esconder

La distancia crece más arriba. Claude Opus 5, Claude Fable 5 y GPT-5.6 superan en nueve puntos las cifras de V4-Flash en esas pruebas, de modo que el ahorro no borra la diferencia de rendimiento.

Tampoco ayudan los resultados en conocimiento. V4-Flash acierta el 37 % de las veces y registra una tasa de alucinación del 84 %, una combinación que obliga a leer el bajo coste junto al riesgo de respuestas incorrectas.

Para quien piense en automatizar grandes flujos de trabajo, esa mezcla tiene algo muy concreto. Pagar menos por consulta sirve de poco si luego hay que dedicar tiempo humano a revisar errores, una escena que ya asomaba en los límites de los LLM cuando el modelo parece seguro incluso al equivocarse.

También importa el momento elegido para mover ficha. DeepSeek lanzó R1 a comienzos de 2025 y ahora presenta V4-Flash mientras se prepara para una salida a bolsa.

Alibaba respondió un día después y recordó la velocidad de esta pelea

No hizo falta esperar mucho para medir la temperatura del sector. Alibaba presentó Qwen3.8-Max un día después del lanzamiento de V4-Flash, una réplica casi inmediata que encaja con una competición donde las comparaciones duran muy poco y el contexto cambia de semana en semana, como ya ocurrió con el ascenso de Qwen.

Queda otra pieza sobre la mesa. V4-Pro, el modelo de la misma familia orientado al razonamiento complejo, todavía no tiene fecha oficial, así que por ahora la fotografía de DeepSeek la define un sistema barato, amplio en contexto y limitado en acierto, justo cuando cada punto de rendimiento sigue teniendo un precio.

Sobre el autor
Redacción
Ver biografía