OpenCode Go 套餐模型使用规划
一、我的用量画像(成本核算基础)
基于实际开发数据实测(两轮 agent 开发统计):
⚠️ 关键结论:这种“重缓存读、轻输出”的负载下,缓存读取单价是唯一决定成本的变量,输入/输出单价几乎不影响总成本。
有效成本公式($/百万 Token):
99.8% × (2%~3%×输入价 + 97%~98%×缓存读价) + 0.2% × 输出价
二、额度机制说明
OpenCode Go 的限制是双轨制:
账户级三个滚动窗口(所有模型共享):
$12 / 5 小时(滚动)
$30 / 周
$60 / 月(真正的总预算)
模型级月度封顶(价格表“使用额度”列):
如 GLM-5.3 只有 $15/月,Hy3 有 $60/月
用完某个模型的独立额度后,本月该模型锁定,但不影响其他模型继续消耗共享池余额
示例:第一周烧完 GLM-5.3 的 $15 → 该模型本月锁定,但仍可用剩余 $45 共享池跑 Hy3。
实际单轮成本 $0.13~$0.31,$12/5h 和 $30/周窗口基本不会触发,只需管理月度 $60 池
建议开启 Use balance(Zen 余额兜底),仅用于月末关键任务
三、模型分工与月度预算分配(总池 $60)
合计 $60,理论容量 20 亿+,覆盖最大用量场景。
分层逻辑
四、模型能力对比
⚠️ 数据说明:以下跑分来自各厂商官方发布或第三方评测机构(Artificial Analysis、BenchLM、Vals AI 等)2026 年中下旬公开数据。不同厂商的评测条件(思考预算、工具调用、温度参数)存在差异,跨厂商的绝对数值不可直接横比,仅作能力定位参考。
4.1 核心基准对比
4.2 各模型卡片
GLM-5.2(架构审核)
厂商:Z.ai(智谱),2026 年 6 月发布,MIT 开源
架构亮点:IndexShare 稀疏注意力索引复用(1M 上下文下每 token FLOPs 降低 2.9 倍),MTP 推测解码接受长度 +20%
擅长:长时序工程任务、1M 上下文稳定工作、多档思考强度(high/max)平衡延迟
短板:智能体综合能力被后续发布的 DeepSeek V4 Flash(工具调用)和 GLM-5.3(编码)超越
Kimi K2.7 Code(硬骨头开发)
厂商:Moonshot AI,2026 年 6 月发布,Modified MIT 开源
架构亮点:1T 参数 MLA 注意力,384 专家选 8,160K 词表;思考 token 消耗较 K2.6 平均减少 30%(抑制推理过度思考)
擅长:长时序编码(4000+ 工具调用序列、12 小时连续执行)、Rust/Go/Python 跨语言、前端/DevOps/性能优化
短板:上下文 256K(同级竞品多为 1M);SWE-bench Verified 绝对值不是最强;未提交 DeepSWE 独立评测;第三方评测显示其在前沿模型对比中整体落后
MiMo V2.5 Pro(日常开发主力)
厂商:小米,2026 年 4 月发布
架构亮点:1.02T MoE / 42B 激活,混合注意力,1M 上下文
擅长:SWE-bench Verified 78.9、SWE-bench Pro 73.7(持平 GPT-5.4);通用 Agent 推理 1581;GDPVal-AA 72.9
短板:Claw-Eval 带工具 34.0(相对偏低);Terminal-Bench 2.0 得分 68.4,低于 DeepSeek V4 Flash 的 82.7
DeepSeek V4 Flash(批量任务)
厂商:DeepSeek,2026 年 7 月发布
架构亮点:轻激活 MoE(约 13B 激活),但 Agent 能力逼近 Opus 4.8
擅长:Terminal Bench 2.1 82.7、Toolathlon Verified 70.3、NL2Repo 54.2、AutomationBench 25.1——工具调用和自动化任务是其强项
短板:Peak 时段价格翻倍;绝对编码强度(DeepSWE 54.4)弱于 GLM-5.3 / V4 Pro
MiMo V2.5(文档注释)
厂商:小米,2026 年 4 月发布
架构亮点:310B / 15B 激活(全场最轻激活),混合滑窗注意力,原生视觉+音频,1M 上下文
擅长:日常编码以约一半成本追平 Pro;SWE-bench Pro 71.8、Coding Agent 56.1、τ3-bench 62.3 均处于帕累托前沿
短板:深度推理和复杂工程不及 Pro 及 GLM 系列
Hy3(机动储备)
厂商:腾讯混元,2026 年 4 月 Preview、7 月正式版
架构亮点:295B / 21B 激活 + 3.8B MTP 层,模型与推理框架深度协同优化(推理效率 +40%)
擅长:同尺寸性价比(“媲美 2-5 倍参数旗舰”)、推理效率高、搜索 Agent 任务(BrowseComp、WideSearch)
短板:SWE-bench Pro 57.9、Terminal-Bench 2.1 71.7,与 GLM-5.2 有明显差距——硬编码任务不适用
LongCat-2.0(中间层执行)
厂商:美团,2026 年 6 月发布,MIT 许可
架构亮点:1.6T / 48B 激活,LongCat 稀疏注意力,1M 上下文,35T token 预训练
擅长:SWE-bench Pro 59.5(超越 Gemini 3.1 Pro 和 GPT-5.5)、SWE-bench Multilingual 77.3(持平 Opus 4.6 的 77.8)、Terminal-Bench 2.1 70.8;通用 Agent 能力接近国际一线闭源模型
短板:实测编码能力弱于 GLM-5.2 和 DeepSeek V4 Flash,建议作为执行层补充而非主力;训练全程由国产芯片完成,生态兼容性需验证
GLM-5.3(未选用——仅供对比参考)
厂商:Z.ai(智谱),2026 年 8 月发布
架构亮点:基于 GLM-5.2 同款 700B 参数基座,纯后训练优化;引入 Effort Level 四档思考深度机制
擅长:Terminal-Bench 2.1 88.2、CyberGym 84.5(全榜第一)、DeepSWE v1.1 66.9、GDPVal-AA v2 1769——编码与安全能力做到极致
短板:与 GLM-5.2 单价完全相同,但额度仅 $15;安全评估完成前权重延迟开源
Kimi K3(未选用——仅供对比参考)
厂商:Moonshot AI,2026 年 7 月发布
架构亮点:2.8T 参数,896 专家选 16;Kimi Delta Attention(解码加速 6.3 倍);原生视觉理解能力
擅长:Terminal-Bench 2.1 88.3、FrontierSWE 81.2、BrowseComp 91.2、AA Intelligence Index 57(#4/189)
短板:输出 $15/M 全表最贵;输出速度约 62 token/s,低于同价位中位数 72.7;幻觉率高达 51%;$15 额度仅够 ~3600 万 token——对个人项目审核场景 ROI 过低
4.3 选型逻辑回扣
结合能力对比与本方案预算分配:
GLM-5.2 做审核:Terminal-Bench 81.0 + SWE-bench Pro 62.1,编码硬实力足以胜任架构把关;虽然 GLM-5.3(TB 2.1 88.2)更强,但 $15 额度对于审核环节的用量不划算
DeepSeek V4 Flash 做批量:Toolathlon 70.3 / AutomationBench 25.1 全面碾压 GLM-5.2,工具调用与自动化任务是其主场,正好匹配“大量读 + 少量写 + 工具链调用”的批处理画像
Kimi K2.7 Code 啃硬骨头:SWE-bench Verified 76.8%~78.2% 逼近 Claude Opus 4.8,长时序编码 + 思考 token 节省 30% 恰好匹配复杂模块的深度推理需求
MiMo Pro 当主力、V2.5 做文档:SWE-bench Verified 78.9、SWE-bench Pro 73.7(持平 GPT-5.4)已属前沿;V2.5 以约一半成本追平 Pro 的日常编码表现,能力梯度平缓适合降级链路
LongCat-2.0 作为 DeepSeek V4 Flash 的有效补充:SWE-bench Pro 59.5 超越 GPT-5.5(58.6)和 Gemini 3.1 Pro(54.2),SWE-bench Multilingual 77.3 持平 Claude Opus 4.6(77.8)。当 DeepSeek V4 Flash 额度耗尽或需要在国产芯片环境下运行长时序 Agent 任务时,LongCat-2.0 是理想的降级/替补选择
Kimi K3 / GLM-5.3 被排除的原因:K3 的 AA 智力指数 57 虽达 Opus 级,但输出 $15/M、幻觉率 51%、$15 额度只够 ~3600 万 token,对个人项目审核场景 ROI 过低;GLM-5.3 能力更强但额度仅 $15,在 GLM-5.2($60)已够用的前提下无升级必要
五、单轮成本参考表(按我的负载画像实测核算)
以“输入 21.8M / 输出 44.9K / 命中 98%”为基准:
六、开发流程(优化版)
┌─────────────────────────────────────────────────┐
│ 第一阶段:需求与设计(免费资源) │
│ 网页版免费 AI 优化需求文档 / 架构设计 / 原型设计 │
│ TraeWork(每日签到 200 积分,月底清零) │
├─────────────────────────────────────────────────┤
│ 第二阶段:文档审核与细化 │
│ ★ GLM-5.2 —— 审核需求/架构文档,查遗漏、细化功能点 │
├─────────────────────────────────────────────────┤
│ 第三阶段:开发 │
│ ★ 复杂模块(并发/内存/Qt架构/Android互操作) │
│ → Kimi K2.7 Code │
│ ★ 日常功能开发 → MiMo V2.5 Pro(撞顶降级 V2.5) │
│ ★ 批量大上下文任务 → DeepSeek V4 Flash(Off-Peak) │
│ ★ 国产芯片环境 / 长时序 Agent → LongCat-2.0 │
├─────────────────────────────────────────────────┤
│ 第四阶段:模块级审核(改进点:即时审,不攒到最后) │
│ ★ GLM-5.2 —— 每个模块完成即审,错误趁热修 │
├─────────────────────────────────────────────────┤
│ 第五阶段:知识回流(改进点) │
│ ★ GLM-5.2 输出问题规则清单 → 存入个人开发平台规范 │
│ ★ 后续开发自动携带规范,提升低端模型质量 │
├─────────────────────────────────────────────────┤
│ 第六阶段:文档注释补全 │
│ ★ MiMo V2.5 —— 纯体力活,最便宜模型 │
└─────────────────────────────────────────────────┘流程改进要点(相比旧流程)
审核前置化:从“最后统一审核”改为“模块完成即审”——上下文还热着,返工成本低
知识回流机制:审核发现的问题(如 WPF 绑定泄漏、Qt 父子对象生命周期)沉淀为规则清单,一次高价值投入持续提升低端模型质量
Off-Peak 批处理:DeepSeek 峰时(北京时间约 09:00–12:00、14:00–18:00)单价翻倍,批量任务全部安排在晚间/深夜跑
七、日常操作节奏
八、监控与降级预案
监控要点
每周看一次月度池消耗速率(预期 ≈ $15/周)
GLM-5.2 超 $2.5/周 → 审核环节过重,下放部分给 Kimi K2.7
MiMo Pro 接近 $15 封顶 → 提前切换基础版 V2.5
DeepSeek V4 Flash 接近 $8 封顶 → 切换至 LongCat-2.0 或 MiMo V2.5
降级顺序(质量梯度平缓,成本反而更低)
开发环节:MiMo Pro → MiMo V2.5 → DeepSeek Flash(Off-Peak)
批量环节:DeepSeek Flash → LongCat-2.0 → MiMo V2.5 → Muse Spark
审核环节:GLM-5.2 → Kimi K2.7(复杂场景可短暂上 Kimi K3)
国产芯片/长时序:LongCat-2.0 → DeepSeek Flash额度告急时
开启 Use balance,Zen 余额只用于月末关键任务
满负载月(20 亿)贴着容量上限,需优先保开发环节,压缩文档环节 token 量
九、待验证事项
一句话总结:97% 的 token 走缓存读 → 谁家缓存读便宜,谁就是为我设计的。贵模型只出现在“判断”环节(GLM-5.2 审核 + Kimi 啃硬骨头),所有“执行”环节压到 MiMo / DeepSeek / LongCat-2.0 上,$60 月池即可覆盖 5~20 亿 token 的全部需求。
OpenCode Go 套餐模型使用规划
http://blog.larpx.cn/1787808842711
Comments