在保证 Agent 任务输出质量的前提下,通过动态分流和缓存感知,最大化降低模型推理成本,实现“降本不降质”。
本方案通过 四个技术维度 逐步演进,最终合并收敛为 方案 C(两级接力推荐方案):用维度 3 的规则守住缓存闸门,用维度 4 的 DeleGate 在闸门内做最优模型选择。
在服务端部署 1.7B 极小模型,通过 SFT 微调,给用户 Query 打上 L1-L8 难度标签并进行映射分流。
纯本地运行,不消耗 Token,零网络延迟。基于 4 层路由栈与 Harness 状态进行毫秒级快速分流。
决定“什么时候允许切”。仅在首轮、压缩后、场景切换三个零成本窗口重路由,守住 3.8x 缓存成本降幅。
决定“窗口内切给谁”。Frontier 强模型做 Controller 拆解任务,轻量 Selector 委派给最便宜的 Worker。支持基于任务难度直接映射到对应模型。
方案 C 并不是简单地在 A 和 B 之间做二选一,而是将 方案 A 的强语义理解能力 与 方案 B 的毫秒级零延迟判定 有机合并,并补上了两者都缺失的 缓存(Cache)感知保护 机制。
解决“什么时候允许换模型”。如果每轮都切,会彻底打散 Prompt Cache,导致成本暴涨。维度 3 规定:默认不切,只在首轮、压缩后、场景切换这三个本就要丢弃 Cache 的“零成本窗口”才允许重路由。
解决“在允许的窗口里切给谁”。在维度 3 允许切换的窗口内,由 DeleGate 可学习 Selector 进行智能委派。简单任务用本地快判定(方案 B)直接分流,复杂任务用云端分类器(方案 A)进行深度评估。支持基于任务难度直接映射到对应模型,实现两级接力。
单会话 ≤3 次(紧急升配豁免)。严格限制切换频次,防止网络开销与模型抖动。
升级 +2 档 / 降级 -3 档。采用非对称迟滞区间,防止模型在临界点频繁来回切换。
<8K 跨 1 档即切;8K-32K 跨 2 档;>32K 仅允许在场景切换时重路由。
路由的默认动作是「不动」,而不是「重新评估」。非必要不切换,最大化复用已有缓存。
| 对比维度 | 方案 A(大模型打标) | 方案 B(本地 Router) | 方案 C(合并推荐) |
|---|---|---|---|
| 定位 | 现有主力,语义强但贵、有延迟 | 本地快、零成本、防抖动 | 演进终局:规则闸门 + 委派学习 |
| 路由器角色 | 1.7B 小模型(需云端推理) | LightGBM / ONNX(端侧本地) | 本地快判定 + 云端难判定 |
| 核心判据 | 语义难度 L1 - L8 | Harness State 四层栈 | 维度 3 定规则,维度 4 学选择 |
| 判定时延 | 280 - 725 ms | 毫秒级 | 取决于走哪一层(快判定毫秒级) |
| 缓存(Cache)保护 | 无保护,易打散 Prompt Cache | 有保护(600s 内禁止降级) | 极佳(仅在零成本窗口切换) |
| 实测均分 / 极差 | 0.409 / 0.220 | 0.397 / 0.185 | ——(合并后待测,理论最优) |
| 评估模式 | 任务完成率 | 整体均分(Relevance/Correctness等) | 极差(越小越稳定) | 成本表现 |
|---|---|---|---|---|
| Level 映射(大模型方案) | 10 / 10 | 0.409 | 0.220 | 中等(判定本身产生 Token 消耗与时延) |
| Router(非大模型方案) | 10 / 10 | 0.397 (与大模型无统计显著差异) | 0.185 | 极佳(本地运行,零判定成本) |
| Baseline - GLM 5.2 (全旗舰) | 10 / 10 | 0.385 | 0.191 | 极高(无路由,全量旗舰模型计费) |
| Baseline - Flash (全轻量) | 10 / 10 | 0.355 | 0.275 | 极低,但质量明显下降且最不稳定 |
| 阶段 | 核心动作 | 风险评估 | 独立收益 |
|---|---|---|---|
| P0 · 可观测与基线 | 日志管道建设、采集 `cache_read_tokens`、构建成本基线看板、制定标注规范 | 零风险 | 看清现状,唯一能回答“路由值不值得做”的一步 |
| P1 · 闸门与护栏 | L0 安全前置、L4 服务路由(同模型多供应商切换)、护栏机制、影子模式 | 极低风险 | 服务路由带来高可用与单价优化,建立安全边界 |
| P2 · 分级路由上线 | 接入维度 1 分类器、仅在零成本窗口切、引入 600s 禁降窗口与用户抱怨升级 | 中风险 | 成本降幅开始兑现,质量不劣于全旗舰基线 |
| P3 · 本地化+场景兜底 | 方案 B 本地分类器管简单判定、两级判定机制、场景级 Sub-agent 静态档位 | 中风险 | 路由决策时延降至 50ms 以内,决策本身变免费 |
| P4 · DeleGate 学习化 | Wrangler 接口协议、离线预训练 Encoder Selector、轨迹级群组 RL 闭环 | 高风险 | 选择质量从静态配置升级为可学习,支持模型池热替换 |