Model Routing Scheme

端云协同模型路由方案

在保证 Agent 任务输出质量的前提下,通过动态分流和缓存感知,最大化降低模型推理成本,实现“降本不降质”。

路由推荐
简单任务走本地/云端小模型(C0/C1),难题走旗舰大模型(C2/C3),仅在缓存边界(首轮/压缩后/场景切换)重路由

核心方案维度

本方案通过 四个技术维度 逐步演进,最终合并收敛为 方案 C(两级接力推荐方案):用维度 3 的规则守住缓存闸门,用维度 4 的 DeleGate 在闸门内做最优模型选择。

维度 1 · 方案 A

1.7B SFT 分类器

在服务端部署 1.7B 极小模型,通过 SFT 微调,给用户 Query 打上 L1-L8 难度标签并进行映射分流。

91.09%
6-level 分类准确率
维度 2 · 方案 B

LightGBM + ONNX

纯本地运行,不消耗 Token,零网络延迟。基于 4 层路由栈与 Harness 状态进行毫秒级快速分流。

0.185
实测极差(全场最稳)
维度 3 · 方案 C (闸门)

缓存边界切 (推荐)

决定“什么时候允许切”。仅在首轮、压缩后、场景切换三个零成本窗口重路由,守住 3.8x 缓存成本降幅。

3.8x
输入成本降幅
维度 4 · 方案 C (选择) 探索中

DeleGate 智能委派

决定“窗口内切给谁”。Frontier 强模型做 Controller 拆解任务,轻量 Selector 委派给最便宜的 Worker。支持基于任务难度直接映射到对应模型。

1-2
Ask-back 纠错上限
方案 C 融合机制:演进 + 合并

方案 C 并不是简单地在 A 和 B 之间做二选一,而是将 方案 A 的强语义理解能力方案 B 的毫秒级零延迟判定 有机合并,并补上了两者都缺失的 缓存(Cache)感知保护 机制。

融合第 1 步 维度 3:定规则(守住缓存闸门)

解决“什么时候允许换模型”。如果每轮都切,会彻底打散 Prompt Cache,导致成本暴涨。维度 3 规定:默认不切,只在首轮、压缩后、场景切换这三个本就要丢弃 Cache 的“零成本窗口”才允许重路由。

融合第 2 步 维度 4:学选择(委派最优 Worker) 探索中

解决“在允许的窗口里切给谁”。在维度 3 允许切换的窗口内,由 DeleGate 可学习 Selector 进行智能委派。简单任务用本地快判定(方案 B)直接分流,复杂任务用云端分类器(方案 A)进行深度评估。支持基于任务难度直接映射到对应模型,实现两级接力。

切换预算帽

单会话 ≤3 次(紧急升配豁免)。严格限制切换频次,防止网络开销与模型抖动。

迟滞区间(防抖动)

升级 +2 档 / 降级 -3 档。采用非对称迟滞区间,防止模型在临界点频繁来回切换。

上下文自适应

<8K 跨 1 档即切;8K-32K 跨 2 档;>32K 仅允许在场景切换时重路由。

默认动作「不动」

路由的默认动作是「不动」,而不是「重新评估」。非必要不切换,最大化复用已有缓存。

业界前沿实践(友商对比)

深度调研业界顶级科技公司的模型路由方案,吸取其在缓存感知、多级分流以及高可用架构上的工程智慧,为 WB 的演进提供高价值参考。

Cursor Router

会话级与缓存感知路由

三大模式:Intelligence、Balance、Cost 调节优化。
缓存经济学:训练与生产测量都将模型切换视为缓存未命中,防止频繁切换抵消节省效果。
在线 A/B 测试:以用户满意度(AFC)和代码保留率(Keep Rate)作为 Reward。

Microsoft Foundry

轻量级 ML 智能 Selector

三大模式:Balanced(1-2% 质量差)、Cost(5-6% 质量差)、Quality。
ML 预测器:使用极轻量的 ML 模型在毫秒级内预测最佳模型。
硬性限制:有效上下文受限于池中最小模型的窗口,需动态过滤低上下文模型。

Alibaba Cloud PAI

物理层前缀缓存调度

前缀缓存调度prefix-cache 策略将相同上下文请求发往已缓存其 KV Cache 的物理 GPU 实例。
Prefill-Decode 分离pd-split 静态分离计算与访存密集型实例。
静默降级:Scheduler 故障时,Gateway 自动静默降级为轮询(Round-Robin)策略。

Anthropic / Claude

三层路由与缓存硬门槛

预分类器:先通过极便宜的 Haiku 进行 simple/standard/complex 预分类,失败则退化为正则匹配。
缓存硬门槛:不同模型有严格的最小缓存 Token 门槛(512 - 4096 tokens),低于门槛则静默不缓存且不报错。

Tencent WorkBuddy

多 Agent 标签路由

标签解耦:引入 lite(端侧开源)、default(云端中等)、craft(云端旗舰)三档成本标签,解耦 Agent 逻辑。
延迟容忍路由:IM 后台异步执行,对首包时延不敏感,可采用更激进的 Batch 计费或多模型会诊(Ensemble)策略。

三条路线定位与取舍对照

对比维度 方案 A(大模型打标) 方案 B(本地 Router) 方案 C(合并推荐)
定位 现有主力,语义强但贵、有延迟 本地快、零成本、防抖动 演进终局:规则闸门 + 委派学习
路由器角色 1.7B 小模型(需云端推理) LightGBM / ONNX(端侧本地) 本地快判定 + 云端难判定
核心判据 语义难度 L1 - L8 Harness State 四层栈 维度 3 定规则,维度 4 学选择
判定时延 280 - 725 ms 毫秒级 取决于走哪一层(快判定毫秒级)
缓存(Cache)保护 无保护,易打散 Prompt Cache 有保护(600s 内禁止降级) 极佳(仅在零成本窗口切换)
实测均分 / 极差 0.409 / 0.220 0.397 / 0.185 ——(合并后待测,理论最优)

关键实测:双方案端到端对抗

评估模式 任务完成率 整体均分(Relevance/Correctness等) 极差(越小越稳定) 成本表现
Level 映射(大模型方案) 10 / 10 0.409 0.220 中等(判定本身产生 Token 消耗与时延)
Router(非大模型方案) 10 / 10 0.397 (与大模型无统计显著差异) 0.185 极佳(本地运行,零判定成本)
Baseline - GLM 5.2 (全旗舰) 10 / 10 0.385 0.191 极高(无路由,全量旗舰模型计费)
Baseline - Flash (全轻量) 10 / 10 0.355 0.275 极低,但质量明显下降且最不稳定

落地规划路线(P0 - P4)

阶段 核心动作 风险评估 独立收益
P0 · 可观测与基线 日志管道建设、采集 `cache_read_tokens`、构建成本基线看板、制定标注规范 零风险 看清现状,唯一能回答“路由值不值得做”的一步
P1 · 闸门与护栏 L0 安全前置、L4 服务路由(同模型多供应商切换)、护栏机制、影子模式 极低风险 服务路由带来高可用与单价优化,建立安全边界
P2 · 分级路由上线 接入维度 1 分类器、仅在零成本窗口切、引入 600s 禁降窗口与用户抱怨升级 中风险 成本降幅开始兑现,质量不劣于全旗舰基线
P3 · 本地化+场景兜底 方案 B 本地分类器管简单判定、两级判定机制、场景级 Sub-agent 静态档位 中风险 路由决策时延降至 50ms 以内,决策本身变免费
P4 · DeleGate 学习化 Wrangler 接口协议、离线预训练 Encoder Selector、轨迹级群组 RL 闭环 高风险 选择质量从静态配置升级为可学习,支持模型池热替换

学术前沿与系统工程(文献与架构调研)

深度调研学术界顶会论文与工业界物理层调度架构,为 WB 方案在“缓存保护、智能体步骤级决策、模型池热插拔、数据自进化”上提供坚实的理论支撑与工程蓝图。

MTRouter (ACL 2026) 多轮成本路由

多轮长程会话下的成本感知路由

⚠️ 面临问题:传统路由无法感知多轮会话状态演进,频繁切换模型导致 KV Cache 频繁失效,产生高额缓存未命中成本。
🛠️ 核心方法:将多轮历史与候选模型特征编码为联合嵌入(Joint Embeddings),训练离线价值评估器预测任务推进概率,在预算约束下动态规划。
📈 落地收益:ScienceWorld 成本降 58.7% 且得分超全旗舰;系统自发涌现“极少切换模型”倾向,自然保护物理缓存。
ACRouter (ArXiv 2026) C-A-F 闭环

代码任务下的 C-A-F 闭环路由

⚠️ 面临问题:传统路由仅依赖静态 Prompt 文本,缺少模型在真实环境中的执行反馈,存在严重“信息赤字”。
🛠️ 核心方法:Orchestrator 委派任务,Verifier 在沙箱中运行测试并返回反馈,Memory 模块通过上下文老虎机(Bandit)算法积累经验。
📈 落地收益:流式任务中达到全场最低累计悔恨值,引入任务维度历史表现先验带来 15.3% 相对性能提升。
RouteLLM (ICLR 2025) 偏好数据分流

基于人类偏好数据的鲁棒单轮路由基石

⚠️ 面临问题:如何在强弱模型池中进行鲁棒分流,以最低的旗舰模型调用比例换取接近旗舰模型的体验。
🛠️ 核心方法:利用人类偏好数据(LMSYS Chatbot Arena 对战日志)训练轻量级分类器(如 Matrix Factorization, BERT),预测弱模型是否会输给强模型。
📈 落地收益:MT-Bench 上仅将 14%-26% 的高难请求发送给旗舰模型,即达到了其 95% 的回答质量,成本降低 85%。
FrugalGPT (TMLR 2024) 级联降本

大模型级联与阈值决策的经典范式

⚠️ 面临问题:不同 LLM 拥有不同的性价比,如何构建通用的级联链条,在保证回答质量的同时最大化降低成本。
🛠️ 核心方法:大模型级联(LLM Cascade),让便宜模型先尝试,其置信度低于设定阈值时,才升级(Escalation)到更贵的模型。
📈 落地收益:在多个公共数据集上实现 50%-98% 的成本削减,且在部分任务上由于级联纠错,最终质量超越单用最强模型。
HyDRA (ArXiv 2026) 配置解耦

异构 LLM 池的配置解耦与多维能力匹配

⚠️ 面临问题:传统路由器与特定模型身份深度绑定,一旦模型库更新,整个路由器就必须重新训练。
🛠️ 核心方法:ModernBERT 仅预测 Reasoning、Code、Debug、Tool 四维能力需求分数;模型能力画像写在外部 YAML 配置文件中;通过赤字匹配算法(Shortfall Matching)选择最便宜的模型。
📈 落地收益:SWE-bench Verified 成本降低 54.1% 且质量持平 Sonnet;模型池热插拔,零重训成本。
Agentic Routing (2026) 数据飞轮

基于 Harness 原生数据飞轮的步骤级路由

⚠️ 面临问题:传统路由只优化单轮成本-质量权衡,遗漏了智能体特有的执行状态、中间失败和反馈循环,且合成数据存在“自毒”问题。
🛠️ 核心方法:步骤级状态路由(Step-level Routing),将整个 Harness 状态作为输入;路由决策自然产生 Trace 记录,由真实环境客观标注(工具报错、测试通过),构建数据飞轮。
📈 落地收益:PinchBench 成本降 10.9 倍且质量不降;DRACO 上通过多模型集成超越全旗舰基线;实现无偏自进化。
vLLM / Google GKE / AWS SageMaker 系统工程前沿 · 物理层调度

KV Cache 亲和性物理路由基础设施

⚠️ 面临问题 逻辑层路由如果与底层的物理推理引擎脱节,会导致物理 GPU 上的 KV Cache 频繁失效(Cache Miss),单次 Turn 的输入计费从 0.1x 的缓存价暴涨至 1.0x 全价,彻底抵消路由省下的成本;同时,无感知的调度容易导致部分 GPU 实例显存溢出(OOM)。
🛠️ 核心方法
  • vLLM KvawareRouter:维护全局 LRU 缓存索引,计算请求最长公共前缀,优先分发至持有该前缀 KV Cache 的物理 GPU 实例。
  • Google GKE EPP:基于 Kubernetes Gateway API,实时读取物理 Pod 显存使用率,优先将请求打到 GPU 显存缓存最空闲的实例,防止 OOM。
  • AWS SageMaker HyperPod:L1 (CPU) + L2 (跨实例) 分层缓存,维护前缀树,确保长会话具有会话粘性(Session Affinity)。
📈 落地收益 首包延迟(TTFT)降低达 40%,大幅提升系统吞吐量,彻底解决物理层显存溢出与缓存失效问题。这为 WB 方案的 维度 3(缓存边界切) 提供了物理层一致性哈希调度的工程实现蓝图。