十个模型,谁来接单:AI 调度台的秘密
Bao, Tian, Zhang, Chen, Ma, Shi · OrcaRouter · arXiv:2605.30736 · 2026
你每次向 AI 提问,问题背后其实站着一排模型:有的聪明但贵,有的便宜但笨,价格能差上百倍。把每条请求派给谁?派贵的,钱包出血;派便宜的,答案拉胯。这个「派单问题」有个学名叫 LLM 路由(Routing)——它决定了一家 AI 产品是赚钱还是烧钱。这篇论文造了一台会自己学习的调度台,用一美元的均价冲上了公开擂台的第二名。「上下文老虎机」「岭回归」「UCB」这些词你一个都不用记:接下来你会亲手派单、亲手发奖金、亲手把它调上榜。
先当一天调度员
你的调度台上现在排着 6 条真实画风的请求,从「翻译一段话」到「修 Rust 死锁」。你手里有两个模型:旗舰(几乎全能,一单 30 元)和快手(简单活利索,一单 1 元)。
调度员的三种本能,挨个点一遍,看账单和成绩:
把一条请求变成一枚指纹
路由器不读懂题——读懂太慢太贵,它只提取「体检指标」。就像你不用听完整场演讲也能判断「这是学术报告还是脱口秀」:看着装、看语速、看有没有 PPT。点下面三条请求,看同一套指标怎么给出完全不同的读数:
注意条形的此起彼伏:正则那条「代码痕迹」蹿高,证明题的「数学密度」拉满,闲聊则是「口语化」一枝独秀。论文用了两层指纹:40 维手工指标(长度、任务类型线索、格式要求、预算信号……)加上一枚 384 维的语义指纹——用一个 2200 万参数的小模型(all-MiniLM-L6-v2)把整句话压成一串数字,图里最底下那条彩色码就是它。合起来 424 个数字,毫秒级算完。路由器看到的不是问题,是指纹。
然而光认出「这是道数学题」还不够——派给谁才算「派对了」?这事没有看上去那么显然。
什么叫「派对了」
直觉说:答对就是派对了。但老板不这么算账。论文给每一次派单打的分是一条明码标价的公式:
报酬 = 质量 − 0.4×成本 − 0.3×延迟 − 罚款
质量满分 1 分,成本和延迟按比例扣,超时限流再罚。关键在那个 0.4——成本的权重。拖动滑块改变「老板对成本的在意程度」,看三次派单的得分怎么重新洗牌:
把权重拖到 0:旗舰答对得分最高——反正不要钱,当然全用最好的。拖回论文默认的 0.4:「快手答对」反超「旗舰答对」——同样是对,便宜地答对更值钱。拖到 1.0:连「快手答错」都快追上「旗舰答对」了,这就过头了。路由器优化的从来不是正确率,是这条被成本和延迟扣过分的报酬。后面所有的「学习」,学的都是预测这个数。
然而谁来做这个预测?论文的做法有点像一家猎头公司。
每个模型配一位专属评估师
调度台为每个候选模型雇一位「评估师」。评估师不看模型,只看指纹:接过第二节那 424 个数字,对照自己从历史派单里学到的口味,报一个数——「这种指纹的活儿,我家模型大概能挣多少报酬」。十个评估师各报各的,调度台把单子派给报价最高的那家。还是那三条请求,点一点,看四位评估师怎么报价:
看正则那题:四家的质量都不差,但性价比王和快手的报价高——因为它们便宜,扣分少。换到证明题:便宜模型的预测质量崩了,旗舰虽贵,报酬反而最高。这套「每人一个线性打分器」在论文里叫岭回归(ridge regression),白话就是:每位评估师是一张 424 个权重的口味表,指纹进来,加权一乘,报价出去。快、便宜、可解释。
然而有一个人这套流程罩不住:新来的。
新人问题:不确定性奖金
假设池子里刚加进一个新模型,历史记录几乎为零。它的评估师只能耸肩:「大概 0.5 吧?上下浮动很大。」如果调度台永远只选报价最高的老熟人,新人永远接不到单,你也就永远不知道它是不是个宝藏——说不定它又便宜又强。
论文的解法叫 UCB(Upper Confidence Bound),白话是「不确定性奖金」:报价 = 预测值 + α×拿不准的程度。越没被试过的选手,奖金越高。拖动 α,看新人的命运和整张调度台的收成:
α=0:新人一单接不到,右边的收成曲线卡在「老熟人水平」——你把一个可能的宝藏永远埋了。α 拉满:调度台变成了抽奖机,什么单都敢给新人,平均收成反而掉下来。甜区在中间——论文的默认值恰好是 α=1.0。探索是要花学费的,但一分学费不交,就永远在用昨天的认知派今天的单。这套「边派单边学习、只从被选中那一家的结果里学」的机制,学名叫上下文老虎机(contextual bandit)——每次只拉一根杆,只看到那根杆的结果。
然而老虎机有个天生的软肋:开局那几千单,它两眼一抹黑。这正是这篇论文最有意思的发现。
裸奔的老虎机,打不过无脑基线
先押一注。擂台上有个最无脑的对手:把所有请求全部派给性价比王(DeepSeek-chat),一个模型包圆,不路由、不学习,均价每千单 0.1 美元。你觉得一台从零开始边干边学的智能调度台,最终能打过它吗?
组装时刻:把它调上榜
三个零件都在你手里了:报酬的成本权重(第三节)、探索系数 α(第五节)、预习开关(第六节)。现在这台调度台交给你,拧到擂台第二名的位置,再试试右下角那道陷阱挑战:
调的过程你大概已经体会到三件事:预习开关是最大的一格提升(约 +2 分);α 的甜区在 1.0 附近,两头都掉分;成本权重偏离 0.4 太远,正确率或账单总有一头会失控。还有那道陷阱挑战——不开预习,你怎么拧都到不了 70.31。这不是沙盒的恶意,这就是论文的核心结论。最后抬头看那条够不到的虚线:oracle(每道题都上帝视角选中最优模型)有 80.72 分。第二名和上帝之间还差 8.6 分——路由这门生意,天花板还高得很。
调度台的软肋,和它守着的大门
先坦白它的软肋。把同一道题换个说法再问一遍,这台调度台可能就换了一个模型来接——鲁棒性测试只有 22.62 分,是全套指标里最难看的一项。原因你在第四节亲眼见过:评估师们的报价常常只差 0.02,指纹稍微一抖,冠军就易主。作者加了个「差距太小就不换人」的稳定器,把反复横跳从 16.7% 压到 2.4%,但改写敏感这个病根还在。诚实地说:它已经能上生产,但还谈不上稳如老狗。
再看它守着的大门。回想你这一路:你亲手派过 6 张单,见过「看一眼再派」如何三分之一的价钱拿满分;你看过一条请求被压成 424 个数字的指纹;你把成本权重从 0 拧到 1,看着「答对」和「派对」分道扬镳;你给新人发过不确定性奖金,也见过裸奔的老虎机输给无脑基线、靠预习翻盘。这五个动作拼起来,就是 AI 产品的「经济层」:模型决定能力的上限,路由决定成本的下限。训练侧的规模法则管「造多大的脑子」,而每一次推理花多少钱、值不值,正在变成路由器的战争——这篇论文只有四页,但它把一间生产车间的完整配方摊开给你看了。
杠精清单:你可能正想反驳的四件事
「才第二名,吹什么?」——榜单名次随时会变,这篇的价值在于配方全公开:特征怎么做、报酬怎么定、预习数据怎么去重(他们剔掉了 1135 条和考题过于相似的练习题,防止「背答案」)。可复现比名次值钱。
「预习数据过时了怎么办?模型池天天在变。」——上线后的持续学习模式就是为此准备的:新模型进池,评估师从零攒记录,α 的奖金机制会自动多给它派单。但作者也承认,在线适应的样本效率(要交多少学费才学会)仍是未解问题。
「同义改写就换人,这也能叫生产级?」——作者自己把 22.62 分写进了论文。稳定器治的是「反复横跳」,治不了「改写敏感」。这是当前所有轻量路由器的通病:指纹快,代价是指纹浅。
「为什么不干脆用一个大模型来当路由器?」——路由决策发生在每一条请求之前,它自己必须近乎免费:40 维手工特征 + 一个 2200 万参数的小编码器,毫秒级、千分之一价。用大模型路由大模型,等于打车费没省下,先付了一笔更贵的调度费。