Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.
Mantente informado con las últimas noticias de actualidad.
A finales de julio, DeepSeek movió una pieza que apunta justo al cuello de botella más incómodo de la IA actual. DeepSeek-V4-Flash-0731 es el modelo más reciente de la serie DeepSeek-V4 y nace con una idea muy concreta, bajar costes de cálculo y memoria cuando el contexto se alarga sin perder capacidades.
El ahorro no depende solo de publicar los pesos
Ahí está la parte menos visible del debate. En mayo, Liang Wenfeng, cofundador de DeepSeek, dejó claro que abrir los pesos no basta para copiar el coste real de inferencia, una discusión que ya aparecía en los precios por millón de tokens.
"La publicación de los pesos no permite automáticamente a los proveedores externos igualar el costo de inferencia de DeepSeek. Alcanzar el mismo costo por token requiere numerosas optimizaciones que pocas empresas tienen la capacidad de implementar" - Liang Wenfeng, cofundador de DeepSeek
La frase importa porque desplaza la atención desde el modelo como objeto hacia el modelo como sistema. No cuenta solo lo que el software sabe hacer, también pesa cómo gestiona memoria, cómo recorre contextos largos y cuánto tarda en responder cuando cada milisegundo empieza a notarse.
DeepSeek-V4-Flash-0731 busca reducir cálculo y memoria en contextos de largo plazo.
Menos memoria, menos latencia y la misma capacidad
Cuando un laboratorio promete mantener capacidades mientras recorta coste, en realidad está tocando varias capas a la vez. Intenta que el modelo necesite menos recursos para trabajar con textos extensos y, al mismo tiempo, explora arquitecturas con menor latencia, un equilibrio que recuerda a la tensión entre latencia y calidad que acompaña a cualquier despliegue serio.
Dicho de otra forma, el problema no consiste solo en contestar bien. También consiste en contestar a tiempo y sin disparar la factura de infraestructura cuando la conversación, el documento o la tarea dejan de caber en un contexto corto.
El cuello de botella aparece cuando el contexto crece
Los contextos largos obligan a reservar más memoria y a sostener más operaciones durante la inferencia. Por eso una mejora en este terreno no se mide solo en rendimiento bruto, sino en la posibilidad de servir tareas extensas con menos presión sobre el hardware.
DeepSeek sitúa ahí el centro de gravedad de esta versión. La novedad no pasa por anunciar una capacidad aislada, sino por intentar que esa capacidad salga más barata y llegue con menos demora, una combinación que en IA suele decidir qué modelos resultan viables fuera del laboratorio.
Y ese es el dato que deja más tensión que triunfalismo. Si igualar el coste por token exige numerosas optimizaciones que pocas empresas pueden implementar, entonces la distancia real entre disponer de unos pesos y reproducir un servicio competitivo sigue siendo bastante mayor de lo que sugiere el escaparate del código abierto.