NVIDIA no quiere perder la carrera de la inteligencia artificial por haberse muerto de éxito, y es que en efecto, la tecnología funciona y su potencia es inimaginable, aunque van en consonancia con unos costes difíciles de contener en todo tipo de ámbitos: hardware, espacio para centros de datos, recursos naturales, energía y así un largo etcétera.De hecho, es que el gigante capitaneado por Jensen Huang se ha puesto manos a la obra para eliminar costes de algún modo en cuando al uso de la IA o al menos rebajarlos al mínimo posible, presentándonos su nuevo NeMo Switchyard que promete reducir hasta un 74% los costes eligiendo siempre el modelo más adecuado para cada tarea o cada solicitud que pidamos mediante prompts.La idea es sencilla y además NeMo Switchyard es de código abierto, convirtiéndose en una especie de router que elige entre los modelos de IA encaminando de forma inteligente las peticiones hacia el agente más conveniente y más asequible que sea capaz de gestionarlas. Dice NVIDIA que su opción frente a RouteLLM, LiteLLM u OpenRouter permite además reducir los costes asumiendo una pérdida de precisión de sólo un 6%, cifras a las que no se acercan ni de lejos ninguno de los actuales desarrollos de este tipo. NeMo Switchyard es un router modelo de código abierto que decide qué agente es más adecuado para una tarea¿Qué es NeMo Switchyard y por qué debería interesarnos?Pues en realidad, lo que NVIDIA nos ha presentado no es algo nuevo sino una especie de aplicación o conjunto de modelos, algo intermedio denominado un router modelo de código abierto, o algo así como un proxy que puede decidir por tipo de solicitudes, por turnos o por otros criterios qué agente o modelo se encargará de una tarea concreta.Esto permite maximizar la eficiencia trasladando siempre las peticiones al modelo o agente más adecuado, empujando sobre todo los modelos de frontera que puedan realizar las tareas más simples de un modo más asequible y más rápido.NeMo Switchyard hace lo mismo que otras opciones ya conocidas de la industria, aunque lo hace auspiciado por NVIDIA y aceptando solicitudes de los modelos más reputados del mercado, incluyendo OpenAI, Anthropic y Responses API, entre otros, traduciendo entre ellas y documentando el modelo seleccionado con sus justificaciones.Esto hace que sea esencialmente transparente, desde su código abierto hasta su funcionalidad, que hace posible identificar patrones de decisión en base al uso de tokens, latencias, etcétera. Así funciona NeMo Switchyard: tú pides a la IA y sus algoritmos deciden quién te respondeY si es tan bueno un modelo de juez, ¿por qué no se utilizan siempre?Como es obvio, estos modelos de proxy capaces de aplicar algoritmos de enrutamiento para decidir entre agentes aplican también un consumo en procesado que debería sumarse al total, añadiendo además una latencia y un factor de error que en el caso de NVIDIA serían de 700 milisegundos más o menos y del 6% en cuanto a pérdida de precisión en los resultados.Cuanto más se optimice el router modelo más ahorro habrá en el cómputo final, por supuesto, así que NeMo Switchyard se sitúa en posición de vanguardia tratándose de un desarrollo de una de las compañías pioneras en la industria de la IA.NVIDIA lo tiene claro, está impulsando una solución ya empaquetada y de código abierto, que por tanto es adaptable a todo tipo de empresas y usos, ofreciendo un conjunto de integraciones en un mercado bastante fragmentado que hará posible enrutar el trabajo a modelos más eficientes.En todo caso, NeMo Switchyard no es para todos porque en el caso de las cargas de trabajo sean cortas o sensibles a la latencia, por ejemplo, su utilización no sería ya demasiado adecuada, tal y como comentaba LangChain. Además, está la posible inferencia que NVIDIA pueda introducir moviendo peticiones a sus modelos auspiciados o a hardware propietario suyo.