DeepSeek-V4-Flash-Vision-Exp añade visión por 0,87 dólares por millón de palabras y supera a Opus 4.8 en 3 pruebas

DeepSeek lanza DeepSeek-V4-Flash-Vision-Exp, su modelo multimodal experimental con imágenes y capturas, y afirma que iguala a V4-Flash en texto mientras baja el coste de uso.

25 de agosto de 2026 a las 17:34h
DeepSeek-V4-Flash-Vision-Exp añade visión por 0,87 dólares por millón de palabras y supera a Opus 4.8 en 3 pruebas
DeepSeek-V4-Flash-Vision-Exp añade visión por 0,87 dólares por millón de palabras y supera a Opus 4.8 en 3 pruebas

Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.

Mantente informado con las últimas noticias de actualidad.

Activar ahora

DeepSeek ha añadido ojos a uno de sus modelos más baratos.

La compañía ha lanzado DeepSeek-V4-Flash-Vision-Exp, una versión multimodal experimental de V4-Flash que interpreta imágenes y capturas de pantalla sin renunciar, al menos en su planteamiento, a las capacidades de texto que ya tenía la familia Flash. DeepSeek sostiene que el modelo iguala a DeepSeek-V4-Flash en tareas de texto, incluidos agentes, razonamiento y conocimiento del mundo.

Ahora la imagen entra en una ecuación dominada por el precio

Lo llamativo no es solo que vea. También importa cuánto cuesta hacerlo, porque el procesamiento de un millón de palabras se sitúa en 0,87 dólares, frente a los cerca de 50 dólares de Opus 4.8.

Además, las imágenes se cobran al precio del texto estándar. La API de archivos permite subir una imagen una sola vez y reutilizarla después, un detalle que cambia bastante la lógica de uso cuando una misma captura de pantalla sirve para varias consultas o para cadenas de trabajo más largas.

Ese enfoque encaja con una línea que DeepSeek ya venía explorando en la eficiencia de DeepSeek v4, donde el ahorro de cálculo y memoria aparecía como argumento central. Aquí esa idea aterriza en algo mucho más cotidiano, pagar menos por analizar una captura, un documento escaneado o la interfaz de una aplicación.

En las pruebas ganó terreno, aunque no dominó la tabla

DeepSeek-V4-Flash-Vision-Exp supera a Opus 4.8 de Anthropic en tres de once pruebas, DeepSWE, Agents' Last Exam y ZeroBench.

En las otras ocho queda por debajo, y la distancia llega a doce puntos en NL2Repo. Dicho de otro modo, no barre a su rival, pero sí coloca una cuña en benchmarks donde el trabajo con agentes y ciertas tareas de evaluación automática pesan más de lo que parecía hace unos meses.

También hay otro dato menos vistoso y quizá más útil. El modelo supera a la versión V4-Flash de solo texto en seis de las siete evaluaciones de texto, algo poco obvio en un sistema al que se le acaba de añadir visión y que, en teoría, podía haber pagado un peaje de rendimiento al ganar una modalidad nueva.

La apuesta sugiere que ver no tiene por qué salir más caro

Mientras muchos modelos multimodales convierten cada capacidad extra en una nueva capa de coste, DeepSeek intenta la maniobra contraria. Añade visión, mantiene el discurso de paridad en texto y coloca el precio en un nivel que obliga a mirar la comparativa dos veces.

De hecho, la propia familia Flash ya había dejado esa tensión entre coste y rendimiento en las pruebas de V4-Flash, donde el ahorro resultaba evidente aunque no siempre venía acompañado por los mejores resultados. Con Vision-Exp la escena se repite de otra forma, porque la pregunta ya no es solo cuánto acierta, sino cuánto cuesta incorporar imágenes a tareas que hasta ahora exigían modelos mucho más caros.

Ya está integrado en la plataforma de API y el entorno para agentes ha subido a la versión 0.1.1.

Ahí aparece la contradicción más interesante. Gana a Opus 4.8 solo en tres de once pruebas, pero procesa un millón de palabras por 0,87 dólares frente a una referencia cercana a 50 dólares, una distancia lo bastante grande como para que muchas comparaciones dejen de medirse solo en puntos de benchmark.

Sobre el autor
Redacción
Ver biografía