英伟达为什么要做模型路由?
模型路由是我一直很关注的方向。之前介绍过OpenRouter的双层路由体系。最近,英伟达也加入进来,发布了开源模型路由工具NeMo Switchyard。 一个卖GPU的,为啥搞起模型路由? 他们的生意逻辑其实很简单、很朴实: 进入Agentic AI阶段之后,任务的复杂性大大提升,执行成本也随之上升。 如果能降低AI使用成本,就能让企业部署更多Agent。…
105-英伟达为什么要做模型路由?
模型路由是我一直很关注的方向。之前介绍过OpenRouter的双层路由体系。最近,英伟达也加入进来,发布了开源模型路由工具NeMo Switchyard。
一个卖GPU的,为啥搞起模型路由?
他们的生意逻辑其实很简单、很朴实:
- 进入Agentic AI阶段之后,任务的复杂性大大提升,执行成本也随之上升。
- 如果能降低AI使用成本,就能让企业部署更多Agent。
- 更多Agent产生更多推理请求。
- 更多推理请求就需要更多计算、网络和服务器。
- 那么,英伟达最终自然能卖出更多GPU和整套AI基础设施。
所以,如何用最低的成本,可靠地完成一个高价值任务,这就是NeMo Switchyard这些模型路由要解决的问题。
这个时候,你可能会问:API成本不是持续下降吗?执行成本怎么就上升了?
这个逻辑只适用于Chatbot阶段:用户提问,模型回答,一次输入,一次输出,简单。
但现在的情况是:AI不再只是回答一个问题,而是要自主完成一连串步骤。
比如让AI完成一个编程任务。它可能需要先阅读项目文件,再搜索相关代码,接着设计修改方案、生成代码、运行测试,最后根据报错继续调整。
即使单次调用越来越便宜,只要调用次数、上下文规模和重试次数增长得更快,完成整个任务的成本仍然会上升。
所以,当Agent必须执行这么多步骤时,降低成本最直接的办法就是:
没必要把所有任务都交给最强、最贵的模型。简单的任务交给便宜的模型去做,足矣。
NeMo Switchyard就是这么干的。它支持多种路由方式:
最简单的方法是根据请求内容判断任务难度。简单问题交给小模型,复杂问题交给强模型。
另一种方法是按照Agent的工作阶段分配模型。比如,规划阶段使用强模型,执行阶段使用快速模型,遇到测试失败或工具报错时再升级。
它还支持“先便宜、后升级”的策略。系统先让成本较低的模型尝试,再让另一个模型判断答案是否可靠。如果质量不够,就重新调用更强的模型。
那么,效果如何?
在LangChain的测试中,只有7%的请求被发送给前沿模型,成本下降74%,但准确率也下降了6个百分点。
这说明,模型路由确实可以大幅节省成本,不过具体效果仍然取决于任务类型和路由策略。可行性验证之后,接下来比拼的,就是谁能把成本、速度和准确率平衡得更好。
理解了整套逻辑之后,咱们回到开头的问题。
英伟达做模型路由,并不是跨界,而是在继续扩张自己的边界。
Chatbot时代,行业比的是谁的模型更强。Agent时代,问题逐渐变成:如何让多个模型分工合作,以最低成本完成整个任务。
当竞争从“单个模型”转向“模型系统”,路由层就会成为新的基础设施。
英伟达不想只做最底层的GPU供应商。它希望从CUDA、推理引擎一路向上,进入模型和应用之间的调度层。
它不需要押注哪一个模型最终胜出。只要所有模型都在不断产生Token,只要越来越多的Agent需要计算,英伟达就能继续卖它的GPU、网络和整套AI基础设施。
所以,NeMo Switchyard真正代表的,不只是一次开源工具发布。
它代表英伟达正在从“卖算力”,走向“定义算力应该如何被使用”。