Model Routing Scheme

端云协同模型路由方案

在保证 Agent 任务输出质量的前提下,通过动态分流和缓存感知,最大化降低模型推理成本,实现“降本不降质”。

路由推荐
简单任务走本地/云端小模型(C0/C1),难题走旗舰大模型(C2/C3),仅在缓存边界(首轮/压缩后/场景切换)重路由

核心方案维度

本方案通过 四个技术维度 逐步演进,最终合并收敛为 方案 C(两级接力推荐方案):用维度 3 的规则守住缓存闸门,用维度 4 的 DeleGate 在闸门内做最优模型选择。

维度 1 · 方案 A

1.7B SFT 分类器

在服务端部署 1.7B 极小模型,通过 SFT 微调,给用户 Query 打上 L1-L8 难度标签并进行映射分流。

91.09%
6-level 分类准确率
维度 2 · 方案 B

LightGBM + ONNX

纯本地运行,不消耗 Token,零网络延迟。基于 4 层路由栈与 Harness 状态进行毫秒级快速分流。

0.185
实测极差(全场最稳)
维度 3 · 方案 C (闸门)

缓存边界切 (推荐)

决定“什么时候允许切”。仅在首轮、压缩后、场景切换三个零成本窗口重路由,守住 3.8x 缓存成本降幅。

3.8x
输入成本降幅
维度 4 · 方案 C (选择) 探索中

DeleGate 智能委派

决定“窗口内切给谁”。Frontier 强模型做 Controller 拆解任务,轻量 Selector 委派给最便宜的 Worker。支持基于任务难度直接映射到对应模型。

1-2
Ask-back 纠错上限
方案 C 融合机制:演进 + 合并

方案 C 并不是简单地在 A 和 B 之间做二选一,而是将 方案 A 的强语义理解能力方案 B 的毫秒级零延迟判定 有机合并,并补上了两者都缺失的 缓存(Cache)感知保护 机制。

融合第 1 步 维度 3:定规则(守住缓存闸门)

解决“什么时候允许换模型”。如果每轮都切,会彻底打散 Prompt Cache,导致成本暴涨。维度 3 规定:默认不切,只在首轮、压缩后、场景切换这三个本就要丢弃 Cache 的“零成本窗口”才允许重路由。

融合第 2 步 维度 4:学选择(委派最优 Worker) 探索中

解决“在允许的窗口里切给谁”。在维度 3 允许切换的窗口内,由 DeleGate 可学习 Selector 进行智能委派。简单任务用本地快判定(方案 B)直接分流,复杂任务用云端分类器(方案 A)进行深度评估。支持基于任务难度直接映射到对应模型,实现两级接力。

切换预算帽

单会话 ≤3 次(紧急升配豁免)。严格限制切换频次,防止网络开销与模型抖动。

迟滞区间(防抖动)

升级 +2 档 / 降级 -3 档。采用非对称迟滞区间,防止模型在临界点频繁来回切换。

上下文自适应

<8K 跨 1 档即切;8K-32K 跨 2 档;>32K 仅允许在场景切换时重路由。

默认动作「不动」

路由的默认动作是「不动」,而不是「重新评估」。非必要不切换,最大化复用已有缓存。

三条路线定位与取舍对照

对比维度 方案 A(大模型打标) 方案 B(本地 Router) 方案 C(合并推荐)
定位 现有主力,语义强但贵、有延迟 本地快、零成本、防抖动 演进终局:规则闸门 + 委派学习
路由器角色 1.7B 小模型(需云端推理) LightGBM / ONNX(端侧本地) 本地快判定 + 云端难判定
核心判据 语义难度 L1 - L8 Harness State 四层栈 维度 3 定规则,维度 4 学选择
判定时延 280 - 725 ms 毫秒级 取决于走哪一层(快判定毫秒级)
缓存(Cache)保护 无保护,易打散 Prompt Cache 有保护(600s 内禁止降级) 极佳(仅在零成本窗口切换)
实测均分 / 极差 0.409 / 0.220 0.397 / 0.185 ——(合并后待测,理论最优)

关键实测:双方案端到端对抗

评估模式 任务完成率 整体均分(Relevance/Correctness等) 极差(越小越稳定) 成本表现
Level 映射(大模型方案) 10 / 10 0.409 0.220 中等(判定本身产生 Token 消耗与时延)
Router(非大模型方案) 10 / 10 0.397 (与大模型无统计显著差异) 0.185 极佳(本地运行,零判定成本)
Baseline - GLM 5.2 (全旗舰) 10 / 10 0.385 0.191 极高(无路由,全量旗舰模型计费)
Baseline - Flash (全轻量) 10 / 10 0.355 0.275 极低,但质量明显下降且最不稳定

落地规划路线(P0 - P4)

阶段 核心动作 风险评估 独立收益
P0 · 可观测与基线 日志管道建设、采集 `cache_read_tokens`、构建成本基线看板、制定标注规范 零风险 看清现状,唯一能回答“路由值不值得做”的一步
P1 · 闸门与护栏 L0 安全前置、L4 服务路由(同模型多供应商切换)、护栏机制、影子模式 极低风险 服务路由带来高可用与单价优化,建立安全边界
P2 · 分级路由上线 接入维度 1 分类器、仅在零成本窗口切、引入 600s 禁降窗口与用户抱怨升级 中风险 成本降幅开始兑现,质量不劣于全旗舰基线
P3 · 本地化+场景兜底 方案 B 本地分类器管简单判定、两级判定机制、场景级 Sub-agent 静态档位 中风险 路由决策时延降至 50ms 以内,决策本身变免费
P4 · DeleGate 学习化 Wrangler 接口协议、离线预训练 Encoder Selector、轨迹级群组 RL 闭环 高风险 选择质量从静态配置升级为可学习,支持模型池热替换