NVIDIA lanza NeMo Switchyard y promete hasta un 74% menos de costes al decidir qué modelo de IA responde

NeMo Switchyard es un router de código abierto que deriva cada petición al agente más adecuado según tokens y latencia, con ahorro de hasta el 74% y una penalización de unos 700 milisegundos.

22 de agosto de 2026 a las 09:33h
NVIDIA lanza NeMo Switchyard y promete hasta un 74% menos de costes al decidir qué modelo de IA responde
NVIDIA lanza NeMo Switchyard y promete hasta un 74% menos de costes al decidir qué modelo de IA responde

Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.

Mantente informado con las últimas noticias de actualidad.

Activar ahora

La batalla por abaratar la inteligencia artificial ya no pasa solo por entrenar mejores modelos. NVIDIA ha presentado NeMo Switchyard, un router de código abierto que decide qué agente debe atender cada tarea para recortar la factura sin tocar directamente el modelo que responde.

La promesa tiene una cifra muy concreta y difícil de ignorar. NeMo Switchyard puede reducir hasta un 74% los costes al escoger el modelo más adecuado según el consumo de tokens y la latencia.

El sistema reparte cada petición según coste y tiempo

No actúa como un modelo nuevo, sino como un proxy que recibe la solicitud y la deriva al agente que mejor encaja en ese momento. Ahí está la clave, porque no todas las consultas necesitan la misma potencia ni justifican pagar siempre la opción más cara.

Esa lógica recuerda a un gestor de tráfico que abre una u otra vía según la carga de coches, pero aquí lo que pesa son los tokens y los milisegundos. El sistema acepta solicitudes de modelos de OpenAI, Anthropic y Responses API, de modo que encaja en entornos donde ya conviven varios proveedores, algo que también aparece en plataformas que unifican modelos.

Hay un peaje.

El enrutamiento añade una latencia de unos 700 milisegundos. Para tareas largas o costosas, ese retraso puede compensar si a cambio baja el gasto, pero en trabajos breves la cuenta cambia de inmediato.

Reducir la factura obliga a aceptar una pequeña renuncia

NVIDIA sostiene que ese ahorro llega con una pérdida de precisión del 6% frente a propuestas como RouteLLM, LiteLLM y OpenRouter. La comparación dibuja un equilibrio conocido en la industria, porque gastar menos casi nunca sale gratis y aquí el precio no solo se mide en dinero, también en calidad de respuesta.

LangChain lo ha dicho con claridad al poner el foco en el tipo de carga de trabajo. La firma considera que la herramienta no encaja bien en tareas cortas ni en entornos sensibles a la latencia.

El problema ya no es solo qué modelo usas

Durante mucho tiempo la conversación giró alrededor de cuál era el modelo más capaz. Ahora empieza a importar tanto o más quién decide cuándo merece la pena usarlo, una discusión que conecta con el coste creciente de los agentes.

Si una consulta simple acaba en un modelo sobredimensionado, la eficiencia se rompe antes de que llegue la respuesta. NeMo Switchyard entra justo en ese punto incómodo donde la inteligencia artificial deja de ser solo una cuestión de capacidad y pasa a ser una cuestión de asignación.

El dato más incómodo sigue siendo el mismo. Ahorrar hasta un 74% resulta atractivo, pero hacerlo con 700 milisegundos extra deja claro que en inteligencia artificial el coste nunca viaja solo.

Sobre el autor
Redacción
Ver biografía