模型能力 × 任务匹配档案(公开知识层)
本文档是 SKILL.md 的按需参考,为个人配置
quota_aware_routing.lanes / tier_policy的填写提供判断方法。读取时机:初次搭建额度感知路由、评估某模型家族适合什么任务、决定某条 lane 的类型与 tier 定位时。本文档是纯知识文档:任何脚本(route_suggest.py / spawn-worker.sh)永不读取它,改动它对运行时零风险。
1. tier 定义(引用 01,不重复)
L0 / L1 / L2 与关键词路由的完整定义见 references/01-model-selection-matrix.md §1。速记:
- L0 轻量:单文件改动、i18n、翻译、配置调整("添加/补充/翻译/复制")
- L1 标准:多文件但边界清晰的功能与 bug 修复(默认档)
- L2 重型:架构重构、跨模块集成、首次探索陌生代码库("理解/分析/设计/拆分/重写/探索/调研")
- multimodal:任务含图片/截图/扫描件理解时,须选具备视觉能力的 provider
本档案只回答"哪个家族适合哪个档位",不重复分级规则本身。
2. 模型家族画像表
下表覆盖公开市场常见的六大家族。当期版本快照为 2026-08 撰写时的公开信息,各家族迭代很快,以你实际可用版本为准;家族级判断(强项/弱项)通常比版本号更稳定,跨版本参考价值更高。
| 家族 | 能力档位 | 强项 | 弱项 | 典型任务正例 | 典型任务反例 | 部署形态(中性) |
|---|---|---|---|---|---|---|
| GLM(智谱) | L1–L2 | 中文语感与公文/法律文本质量稳;Agent 工具调用与多步任务生态成熟;长上下文表现均衡;旗舰档可扛 L2 | 小杯版本深度推理上限有限;英文创意写作不是最强项 | 中文长文档分析、多步 Agent 任务、法律文书改写 | 超长链数学证明(建议留给推理特化家族) | 直连 API / 平台订阅 / 本地网关 |
| MiniMax(稀宇科技) | L0–L1(执行型) | 多模态视觉理解突出;按明确规格执行的任务完成度稳;语音/视频周边生态全 | 规划/设计类任务与长链自主决策不稳(路线没定好的活容易跑偏);重度开发(多文件架构级改动)不适合;型号分支多需按任务选对变体 | 视觉理解任务(截图/扫描件/图文)、路线已定的批量执行任务(格式化/改写/轻量流水线) | 架构设计、任务规划、需要自主探索决策的开发任务;按量计费时的极轻量批量(已购 token plan 是例外——包月窗口用满即赚,轻量批量恰是消耗额度的合理用途) | 直连 API / 平台订阅 |
| DeepSeek(深度求索) | L1–L2 | 推理/数学/算法特化;代码能力强;flash 变体轻快便宜;整体性价比高 | 以纯文本为主,视觉/多模态缺位或弱;官方高峰期限流风险 | 算法设计、逻辑推理、代码重构 | 任何需要看图的任务 | 直连 API / 平台订阅 / 本地网关 |
| Kimi(月之暗面) | L1 | 超长上下文(百万级)是招牌;长文档问答与信息提取稳;K2 系列起 Agent/代码能力可用 | 多模态覆盖有限;中文公文语感不如 GLM 系 | 超长合同/卷宗通读、跨文档检索式问答 | 高密度视觉任务 | 直连 API / 平台订阅 |
| Qwen(阿里通义) | L0–L2 | 全能水桶型;开源生态广、变体最全(Max 旗舰 / Plus 中档 / 轻量档 / VL 视觉);数学与 Agent 表现均衡 | 档位跨度大,选错型号会明显货不对板,必须按具体型号定位派单 | 几乎全谱系任务兜底;VL 变体做 multimodal | 无——风险主要在型号选错而非能力缺口 | 直连 API / 平台订阅 / 本地网关 |
| 豆包 Doubao(字节) | L0–L1 | 中文日常对话与文案流畅;图片生成与理解均衡;价格低,批量任务划算 | 复杂代码与深度推理相对弱;架构级任务不要派 | 批量轻任务、中文文案润色、日常摘要 | 架构重构、跨模块集成、算法证明 | 直连 API / 平台订阅 |
当期版本快照(2026-08,公开渠道口径):GLM 5.x 系(5.1 / 5.2 / 5.3 并存,5.3 为最新旗舰);MiniMax M2.x 系(M2.7 及 Code 变体,M3 已出);DeepSeek V4 系(flash 轻快档 + pro 标准档);Kimi K2.x 系(K2.7 含 Code 变体);Qwen3.x 系(3.7-Max/Plus 上一代,3.8-Max 新旗舰);豆包 2.x 系。再次强调:以上是撰写时快照,填配置前先看你账号里实际叫什么、可用什么。
3. lane 类型与派单哲学
个人配置把 provider 分组成若干 lane,每条 lane 是"同一种额度性质"的池子。两类:
3.1 fuel 型(窗口额度)
- 性质:按窗口(日/周/月)发放的配额,用完即停、到点重置。典型:平台订阅的窗口用量、按日赠送额度。
- 常态评分:
remaining_percent(余量百分比)为主分,resets_at(重置倒计时)临期且余量充足时加 urgency 权重——窗口快重置而额度还剩很多,是"不用就浪费"的消耗窗口。 - 判停线(
stop_line_percent,默认 15%):余量低于此线即停派,把残量留给突发救火,也避免贴线触发改派抖动。 - 数据过期语义:
resets_at已过 →pending_refresh(summary 是上个窗口的旧数据),评分不可信,退回静态序兜底。
3.2 reservoir 型(免费/积分额度)
- 性质:免费或积分制,额度看似取之不尽,但对并发与速率敏感——同时开多个会被限速甚至封禁。
- 派单哲学:scene 场景驱动、细水长流。只在
reservoir_scenes匹配的场景(如overnight_batch夜间批处理、archive_review存量复查、long_tail_cleanup长尾清理)入链,且concurrency_cap建议为 1——单开慢跑,不与其他 lane 抢并发。 - 健康信号:
health: ok / down。免费源不稳是常态,down 即整体让位,不重试硬顶。
一句话:fuel 算着用,reservoir 慢慢淌;场景不匹配时 reservoir 永远不抢 fuel 的活。
4. 如何用本档案填个人配置
对着 config/orchestration-personal.example.json 的 quota_aware_routing 段:
- 逐 provider 判断 tier 定位(照 §2 画像表):该家族/型号稳扛什么档位?能扛 L2 的 lane 才允许出现在
tier_policy.L2;只能做轻量的只进L0链。一个 lane 可同时出现在多个 tier 链,顺序即静态序(评分同分时的兜底次序)。 - 逐 lane 判断类型(照 §3):窗口额度 →
"type": "fuel";免费/积分且并发敏感 →"type": "reservoir"并设concurrency_cap: 1,同时把适用场景加进reservoir_scenes。 - providers 名字必须真实存在:填
config/<provider>.settings.json或 provider registry 里登记过的名字,route_suggest 输出的 provider 会被 spawn-worker 直接消费。 tier_policy.default填一条"任何时候都该活着"的保底 lane(通常是你最稳定、最常用的 fuel lane)——全链判停时回落到这里。- multimodal 链只放有视觉能力的家族(见 §2 反例列),否则看图任务会派给瞎子。
5. 硬边界
- 本文件是公开知识文档:零私有网关细节、零任何获取额度的违规手段记载。文中家族名(GLM / MiniMax / DeepSeek / Kimi / Qwen / 豆包)是公开市场的模型家族名,仅作能力判断参考。
- 程序永不读取本文件:
scripts/route_suggest.py只读个人配置与 summary JSON;spawn-worker.sh只消费 route_suggest 的输出。改本文档对运行时零风险,也不会影响任何路由决策。 - 本 skill 的代码与配置模板不承载任何具体模型选择;模型池快照只存在于你自己的 ignored 个人配置里(
config/orchestration-personal.json),改模型只改配置、不动 skill。