一、我的用量画像(成本核算基础)

基于实际开发数据实测(两轮 agent 开发统计):

指标

实测值

缓存命中率

97% ~ 98%

输出占比

约 0.2%(每 1 亿 token 仅输出 ~20 万)

单轮开发规模

输入 20M+ / 输出 ~45K

月消耗区间

5 ~ 20 亿 token

⚠️ 关键结论:这种“重缓存读、轻输出”的负载下,缓存读取单价是唯一决定成本的变量,输入/输出单价几乎不影响总成本。

有效成本公式($/百万 Token): 99.8% × (2%~3%×输入价 + 97%~98%×缓存读价) + 0.2% × 输出价


二、额度机制说明

OpenCode Go 的限制是双轨制

  1. 账户级三个滚动窗口(所有模型共享):

    • $12 / 5 小时(滚动)

    • $30 / 周

    • $60 / 月(真正的总预算

  2. 模型级月度封顶(价格表“使用额度”列):

    • 如 GLM-5.3 只有 $15/月,Hy3 有 $60/月

    • 用完某个模型的独立额度后,本月该模型锁定,但不影响其他模型继续消耗共享池余额

示例:第一周烧完 GLM-5.3 的 $15 → 该模型本月锁定,但仍可用剩余 $45 共享池跑 Hy3。

  • 实际单轮成本 $0.13~$0.31,$12/5h 和 $30/周窗口基本不会触发,只需管理月度 $60 池

  • 建议开启 Use balance(Zen 余额兜底),仅用于月末关键任务


三、模型分工与月度预算分配(总池 $60)

环节

模型

月预算

可支撑 Token

备注

架构设计 / 代码审核

GLM-5.2

$10

≈ 3300 万

额度 $60,比 GLM-5.3 宽裕 4 倍;审核+架构双职责适度扩容

日常开发主力

MiMo V2.5 Pro

$15

≈ 10.7 亿(49 轮)

额度封顶 $15

撞顶后降级开发

MiMo V2.5

从 Pro 预算划拨

≈ 49 亿/$60

比 Pro 便宜 2.3 倍

批量任务(Off-Peak)

DeepSeek V4 Flash

$8

≈ 5.4 亿

Off-Peak 单价减半

硬骨头模块

Kimi K2.7 Code

$9

≈ 4200 万

并发/内存/跨平台核心逻辑

文档 / 注释补全

MiMo V2.5

$10

≈ 13 亿

有效成本全场最低之一

机动储备

Hy3

$4

≈ 3.2 亿

搜索 Agent / 推理效率兜底

国产芯片 / 长时序 Agent 执行

LongCat-2.0

$5

≈ 1.6 亿

SWE-bench Pro 59.5 超 GPT-5.5;综合 Agent 能力接近一线闭源模型

合计 $60,理论容量 20 亿+,覆盖最大用量场景。

分层逻辑

层级

模型

定位

高价值(判断)

GLM-5.2、Kimi K2.7 Code(必要时 Kimi K3)

审核、架构、复杂模块

中间层(执行)

MiMo V2.5 Pro、DeepSeek V4 Flash、LongCat-2.0

日常开发、批量改造、国产芯片环境 / 长时序 Agent 任务

低价值(体力活)

MiMo V2.5、Hy3、Muse Spark

文档、注释、批量文字工作


四、模型能力对比

⚠️ 数据说明:以下跑分来自各厂商官方发布或第三方评测机构(Artificial Analysis、BenchLM、Vals AI 等)2026 年中下旬公开数据。不同厂商的评测条件(思考预算、工具调用、温度参数)存在差异,跨厂商的绝对数值不可直接横比,仅作能力定位参考。

4.1 核心基准对比

模型

架构/参数

上下文

Terminal-Bench

SWE-bench

智能体/工具调用

综合智力定位

GLM-5.3(未选用)

~700B MoE

1M

TB 2.1: 88.2;TB 3.0: 28.3

DeepSWE v1.1: 66.9;SWE-Marathon: 42.5;FrontierSWE: 78.1

CyberGym: 84.5(全榜第一);Toolathlon Verified: 73.0;AutomationBench: 48.2;Agents' Last Exam: 28.5;GDPVal-AA v2: 1769

前沿级(多榜超 Kimi K3、逼近 Fable 5)

GLM-5.2(审核)

744B MoE / 40B 激活

1M

TB 2.1: 81.0

SWE-bench Pro: 62.1;FrontierSWE: 74.4;SWE-Marathon: 13.0

MCP-Atlas: 77.0;Humanity's Last Exam (w/tools): 54.7;Agentic 能力弱于 DeepSeek V4 Flash

前沿开源级(曾为开源最强)

Kimi K3(未选用)

2.8T MoE / 16 专家激活

1M

TB 2.1: 88.3

FrontierSWE: 81.2;SWE-Marathon: 42.0;DeepSWE 榜第三

AA Intelligence Index: 57(#4/189);GDPVal-AA Elo: 1668;BrowseComp: 91.2

前沿级(AA 智力指数 57,仅次于 Fable 5 / Opus 4.8 / GPT-5.5 Sol)

Kimi K2.7 Code(硬骨头)

1T MoE / 32B 激活 / MLA

256K

TB 2.1: ~67%(Vals 第三方评测)

SWE-bench Verified: 76.8%~78.2%;SWE-bench Pro: ~58.6%(厂商未正式公布)

MCP Mark Verified: 81.1%;Kimi Code Bench v2 +21.8%;Program Bench +11%

开源编码旗舰(SWE-bench Verified 逼近 Claude Opus 4.8)

MiMo V2.5 Pro(开发主力)

1.02T MoE / 42B 激活

1M

TB 2.0: 68.4(排名 #3.4)

SWE-bench Pro: 73.7;SWE-bench Verified: 78.9

Coding Agent: 57.2;GDPVal-AA: 72.9;τ3-bench: 63.8;Claw-Eval (w/tools): 34.0

智能体推理 1581;SWE-bench Pro 73.7 持平 GPT-5.4

MiMo V2.5(文档)

310B MoE / 15B 激活

1M

TB 2.0: 65.8

SWE-bench Pro: 71.8

Coding Agent: 56.1;GDPVal-AA: 69.5;τ3-bench: 62.3

帕累托前沿的“性价比智能体”定位

DeepSeek V4 Flash(批量)

MoE(轻激活,~13B 激活)

~1M

TB 2.1: 82.7

DeepSWE: 54.4

Toolathlon Verified: 70.3;NL2Repo: 54.2;Cybergym: 76.7;AutomationBench: 25.1;Agent's Last Exam: 25.2

智能体多榜逼近 Opus 4.8,工具调用是其强项

Hy3(机动)

295B MoE / 21B 激活

256K

TB 2.1: 71.7(正式版);TB 2.0: 54.4(预览版)

SWE-bench Verified: 74.4%(预览版);SWE-bench Pro: 57.9(正式版);SWE-bench Multilingual: 75.8(正式版)

BrowseComp、WideSearch 等搜索 Agent 基准表现突出

“同尺寸最优”,媲美 2-5 倍参数旗舰

LongCat-2.0(执行)

1.6T MoE / 48B 激活

1M

TB 2.1: 70.8

SWE-bench Pro: 59.5(超 Gemini 3.1 Pro 54.2 & GPT-5.5 58.6);SWE-bench Multilingual: 77.3(持平 Opus 4.6 的 77.8)

通用 Agent 能力接近国际一线闭源模型

国产芯片全栈训练,编程 Agent 能力被低估

4.2 各模型卡片

GLM-5.2(架构审核)

  • 厂商:Z.ai(智谱),2026 年 6 月发布,MIT 开源

  • 架构亮点:IndexShare 稀疏注意力索引复用(1M 上下文下每 token FLOPs 降低 2.9 倍),MTP 推测解码接受长度 +20%

  • 擅长:长时序工程任务、1M 上下文稳定工作、多档思考强度(high/max)平衡延迟

  • 短板:智能体综合能力被后续发布的 DeepSeek V4 Flash(工具调用)和 GLM-5.3(编码)超越

Kimi K2.7 Code(硬骨头开发)

  • 厂商:Moonshot AI,2026 年 6 月发布,Modified MIT 开源

  • 架构亮点:1T 参数 MLA 注意力,384 专家选 8,160K 词表;思考 token 消耗较 K2.6 平均减少 30%(抑制推理过度思考)

  • 擅长:长时序编码(4000+ 工具调用序列、12 小时连续执行)、Rust/Go/Python 跨语言、前端/DevOps/性能优化

  • 短板:上下文 256K(同级竞品多为 1M);SWE-bench Verified 绝对值不是最强;未提交 DeepSWE 独立评测;第三方评测显示其在前沿模型对比中整体落后

MiMo V2.5 Pro(日常开发主力)

  • 厂商:小米,2026 年 4 月发布

  • 架构亮点:1.02T MoE / 42B 激活,混合注意力,1M 上下文

  • 擅长:SWE-bench Verified 78.9、SWE-bench Pro 73.7(持平 GPT-5.4);通用 Agent 推理 1581;GDPVal-AA 72.9

  • 短板:Claw-Eval 带工具 34.0(相对偏低);Terminal-Bench 2.0 得分 68.4,低于 DeepSeek V4 Flash 的 82.7

DeepSeek V4 Flash(批量任务)

  • 厂商:DeepSeek,2026 年 7 月发布

  • 架构亮点:轻激活 MoE(约 13B 激活),但 Agent 能力逼近 Opus 4.8

  • 擅长:Terminal Bench 2.1 82.7、Toolathlon Verified 70.3、NL2Repo 54.2、AutomationBench 25.1——工具调用和自动化任务是其强项

  • 短板:Peak 时段价格翻倍;绝对编码强度(DeepSWE 54.4)弱于 GLM-5.3 / V4 Pro

MiMo V2.5(文档注释)

  • 厂商:小米,2026 年 4 月发布

  • 架构亮点:310B / 15B 激活(全场最轻激活),混合滑窗注意力,原生视觉+音频,1M 上下文

  • 擅长:日常编码以约一半成本追平 Pro;SWE-bench Pro 71.8、Coding Agent 56.1、τ3-bench 62.3 均处于帕累托前沿

  • 短板:深度推理和复杂工程不及 Pro 及 GLM 系列

Hy3(机动储备)

  • 厂商:腾讯混元,2026 年 4 月 Preview、7 月正式版

  • 架构亮点:295B / 21B 激活 + 3.8B MTP 层,模型与推理框架深度协同优化(推理效率 +40%)

  • 擅长:同尺寸性价比(“媲美 2-5 倍参数旗舰”)、推理效率高、搜索 Agent 任务(BrowseComp、WideSearch)

  • 短板:SWE-bench Pro 57.9、Terminal-Bench 2.1 71.7,与 GLM-5.2 有明显差距——硬编码任务不适用

LongCat-2.0(中间层执行)

  • 厂商:美团,2026 年 6 月发布,MIT 许可

  • 架构亮点:1.6T / 48B 激活,LongCat 稀疏注意力,1M 上下文,35T token 预训练

  • 擅长:SWE-bench Pro 59.5(超越 Gemini 3.1 Pro 和 GPT-5.5)、SWE-bench Multilingual 77.3(持平 Opus 4.6 的 77.8)、Terminal-Bench 2.1 70.8;通用 Agent 能力接近国际一线闭源模型

  • 短板:实测编码能力弱于 GLM-5.2 和 DeepSeek V4 Flash,建议作为执行层补充而非主力;训练全程由国产芯片完成,生态兼容性需验证

GLM-5.3(未选用——仅供对比参考)

  • 厂商:Z.ai(智谱),2026 年 8 月发布

  • 架构亮点:基于 GLM-5.2 同款 700B 参数基座,纯后训练优化;引入 Effort Level 四档思考深度机制

  • 擅长:Terminal-Bench 2.1 88.2、CyberGym 84.5(全榜第一)、DeepSWE v1.1 66.9、GDPVal-AA v2 1769——编码与安全能力做到极致

  • 短板:与 GLM-5.2 单价完全相同,但额度仅 $15;安全评估完成前权重延迟开源

Kimi K3(未选用——仅供对比参考)

  • 厂商:Moonshot AI,2026 年 7 月发布

  • 架构亮点:2.8T 参数,896 专家选 16;Kimi Delta Attention(解码加速 6.3 倍);原生视觉理解能力

  • 擅长:Terminal-Bench 2.1 88.3、FrontierSWE 81.2、BrowseComp 91.2、AA Intelligence Index 57(#4/189)

  • 短板:输出 $15/M 全表最贵;输出速度约 62 token/s,低于同价位中位数 72.7;幻觉率高达 51%;$15 额度仅够 ~3600 万 token——对个人项目审核场景 ROI 过低

4.3 选型逻辑回扣

结合能力对比与本方案预算分配:

  • GLM-5.2 做审核:Terminal-Bench 81.0 + SWE-bench Pro 62.1,编码硬实力足以胜任架构把关;虽然 GLM-5.3(TB 2.1 88.2)更强,但 $15 额度对于审核环节的用量不划算

  • DeepSeek V4 Flash 做批量:Toolathlon 70.3 / AutomationBench 25.1 全面碾压 GLM-5.2,工具调用与自动化任务是其主场,正好匹配“大量读 + 少量写 + 工具链调用”的批处理画像

  • Kimi K2.7 Code 啃硬骨头:SWE-bench Verified 76.8%~78.2% 逼近 Claude Opus 4.8,长时序编码 + 思考 token 节省 30% 恰好匹配复杂模块的深度推理需求

  • MiMo Pro 当主力、V2.5 做文档:SWE-bench Verified 78.9、SWE-bench Pro 73.7(持平 GPT-5.4)已属前沿;V2.5 以约一半成本追平 Pro 的日常编码表现,能力梯度平缓适合降级链路

  • LongCat-2.0 作为 DeepSeek V4 Flash 的有效补充:SWE-bench Pro 59.5 超越 GPT-5.5(58.6)和 Gemini 3.1 Pro(54.2),SWE-bench Multilingual 77.3 持平 Claude Opus 4.6(77.8)。当 DeepSeek V4 Flash 额度耗尽或需要在国产芯片环境下运行长时序 Agent 任务时,LongCat-2.0 是理想的降级/替补选择

  • Kimi K3 / GLM-5.3 被排除的原因:K3 的 AA 智力指数 57 虽达 Opus 级,但输出 $15/M、幻觉率 51%、$15 额度只够 ~3600 万 token,对个人项目审核场景 ROI 过低;GLM-5.3 能力更强但额度仅 $15,在 GLM-5.2($60)已够用的前提下无升级必要


五、单轮成本参考表(按我的负载画像实测核算)

以“输入 21.8M / 输出 44.9K / 命中 98%”为基准:

模型

单轮成本

$60 池等价容量

有效成本 $/M

MiMo V2.5

$0.13

49 亿

0.0061

DeepSeek V4 Flash(Off-Peak)

$0.28

21.6 亿

0.0126

MiMo V2.5 Pro

$0.31

19.4 亿

0.014

Hy3

$0.84

7.2 亿

0.038

MiniMax M3

$1.47

4.1 亿

0.067

Kimi K2.7 Code

$4.65

1.3 亿

0.213


六、开发流程(优化版)

┌─────────────────────────────────────────────────┐
│ 第一阶段:需求与设计(免费资源)                  │
│  网页版免费 AI 优化需求文档 / 架构设计 / 原型设计   │
│  TraeWork(每日签到 200 积分,月底清零)            │
├─────────────────────────────────────────────────┤
│ 第二阶段:文档审核与细化                           │
│  ★ GLM-5.2 —— 审核需求/架构文档,查遗漏、细化功能点 │
├─────────────────────────────────────────────────┤
│ 第三阶段:开发                                    │
│  ★ 复杂模块(并发/内存/Qt架构/Android互操作)       │
│    → Kimi K2.7 Code                              │
│  ★ 日常功能开发 → MiMo V2.5 Pro(撞顶降级 V2.5)    │
│  ★ 批量大上下文任务 → DeepSeek V4 Flash(Off-Peak) │
│  ★ 国产芯片环境 / 长时序 Agent → LongCat-2.0       │
├─────────────────────────────────────────────────┤
│ 第四阶段:模块级审核(改进点:即时审,不攒到最后)    │
│  ★ GLM-5.2 —— 每个模块完成即审,错误趁热修          │
├─────────────────────────────────────────────────┤
│ 第五阶段:知识回流(改进点)                        │
│  ★ GLM-5.2 输出问题规则清单 → 存入个人开发平台规范   │
│  ★ 后续开发自动携带规范,提升低端模型质量            │
├─────────────────────────────────────────────────┤
│ 第六阶段:文档注释补全                             │
│  ★ MiMo V2.5 —— 纯体力活,最便宜模型               │
└─────────────────────────────────────────────────┘

流程改进要点(相比旧流程)

  1. 审核前置化:从“最后统一审核”改为“模块完成即审”——上下文还热着,返工成本低

  2. 知识回流机制:审核发现的问题(如 WPF 绑定泄漏、Qt 父子对象生命周期)沉淀为规则清单,一次高价值投入持续提升低端模型质量

  3. Off-Peak 批处理:DeepSeek 峰时(北京时间约 09:00–12:00、14:00–18:00)单价翻倍,批量任务全部安排在晚间/深夜跑


七、日常操作节奏

时段

活动

模型

白天(工作时段)

交互式开发、即时审核

MiMo Pro / GLM-5.2 / Kimi

晚间 / 深夜(Off-Peak)

全库分析、批量改造、文档注释

DeepSeek Flash / MiMo V2.5

按需

国产芯片环境 / 长时序 Agent

LongCat-2.0

每周

检查控制台三条进度条

月初

重置预算,按本规划分配


八、监控与降级预案

监控要点

  • 每周看一次月度池消耗速率(预期 ≈ $15/周)

  • GLM-5.2 超 $2.5/周 → 审核环节过重,下放部分给 Kimi K2.7

  • MiMo Pro 接近 $15 封顶 → 提前切换基础版 V2.5

  • DeepSeek V4 Flash 接近 $8 封顶 → 切换至 LongCat-2.0 或 MiMo V2.5

降级顺序(质量梯度平缓,成本反而更低)

开发环节:MiMo Pro → MiMo V2.5 → DeepSeek Flash(Off-Peak)
批量环节:DeepSeek Flash → LongCat-2.0 → MiMo V2.5 → Muse Spark
审核环节:GLM-5.2 → Kimi K2.7(复杂场景可短暂上 Kimi K3)
国产芯片/长时序:LongCat-2.0 → DeepSeek Flash

额度告急时

  • 开启 Use balance,Zen 余额只用于月末关键任务

  • 满负载月(20 亿)贴着容量上限,需优先保开发环节,压缩文档环节 token 量


九、待验证事项


一句话总结:97% 的 token 走缓存读 → 谁家缓存读便宜,谁就是为我设计的。贵模型只出现在“判断”环节(GLM-5.2 审核 + Kimi 啃硬骨头),所有“执行”环节压到 MiMo / DeepSeek / LongCat-2.0 上,$60 月池即可覆盖 5~20 亿 token 的全部需求。