
TL;DR:Wagtail 核心团队成员 Thibaud Colas 在 2026 年 10 月 2 日回顾了“整月只用 GLM 5.3 Flash”的挑战:9 月约 20 亿 token 的总用量中,只有约一半来自目标模型,该部分费用为 68 美元。挑战没有严格完成,但不能据此断言便宜模型不能编程;68 美元也不是整月全部账单,模型选择失误、服务可用性和研究任务都影响了结果。
“一个月 68 美元”很容易让人联想到一套可以直接照搬的省钱方案。读完原文,会发现它更像一次把账本摊开的复盘:低价模型确实能承担工作,但任务能否顺利做完,还取决于模型之外的设置和服务。
其中一次昂贵的意外,来自原型开发时的模型选择失误;原文并没有给出误选模型的名称。
🎧 音频版(6 分 51 秒)| 🟢 Spotify 订阅 | 📖 偏好阅读?文字版就在下方 👇
先把账算清:68 美元覆盖的是哪部分
Colas 给自己设定的条件很明确:2026 年 9 月,只用 GLM 5.3 Flash 完成自己的智能体工作。最终,他报告整月用了约 20 亿 token,约 10 亿来自目标模型,另约 10 亿来自其他模型。
按“只用一个模型”的标准,挑战失败了。不过,这和“这个模型不能做编程任务”是两个不同结论。作者没有说自己一个月的工作全部无法完成,而是在解释为什么没能守住单模型限制。
原文中的几组数字,也不能混着读:
| 记录范围 | 作者报告的数字 | 不能从中推出什么 |
|---|---|---|
| GLM 5.3 Flash 的月度用量 | 约 10 亿 token,68 美元,能耗估计约 4 kWh | 不是全部模型的总月账单 |
| 一次选错模型的 MCP 服务器原型开发 | 约 4.5 亿 token,150 美元,能耗估计约 5 kWh | 不能当成目标 Flash 模型同量用法的价格 |
| 整个月全部模型 | 约 20 亿 token,能耗估计约 35 kWh | 不是全部 token 都来自 GLM 5.3 Flash |
这些用量和费用来自作者自己的记录。能耗属于他的估计口径,不是本文进行的独立电表测量或完整生命周期核算。不同任务、缓存、服务商和计费方式的结果也不能直接互换。
选错模型,原型开发几乎一夜花掉 150 美元
作者当时在开发 Wagtail 的实验性 MCP 服务器原型。他选错了模型,开发过程几乎在一夜之间消耗约 4.5 亿 token,花费 150 美元。
原文没有在这段明确写出误选模型的名称,也没有说错误来自系统默认值。因此,不能把这件事改写成“默认选中了某个指定的大模型”。这段被列为单模型挑战之外的额外用量,但具体配置过程没有展开。
作者估计,类似结果本来可能用五分之一的费用得到。这里应保留“估计”二字:这不是同任务、同条件下做完对照实验后证实的五倍差距。
这件事提醒我们,单价表解决不了全部成本问题。程序里的默认配置、持续运行时间、重试和总用量,都会进入账单。模型选错之后,没有预算或停止条件,错误就能一直累计。
对准备运行长任务的人,一个更容易落实的做法是:启动时显示真实模型与服务商,小规模试跑后再放大,并给持续任务设定用量和费用上限。这是从案例提炼的编辑建议,不是作者已经验证过的统一方案。
中途换模型,也可能是服务问题
作者选择 Flash,是看中了它的价格、上下文容量、视觉能力以及多个服务商可选。但他在使用中遇到服务可用性和性能问题,也希望比较欧洲数据中心中的开放模型服务,于是用到了 DeepSeek V4.1 Flash、Qwen3.8 Flash 等其他模型。
这里应把两件事分开:模型能否完成任务,以及某个服务入口在当时能否可靠响应。服务不稳定可能让一次工作被迫换模型,却不足以证明模型本身的编程能力普遍不行。
同样,原文提到的上下文容量是作者选择产品的理由,不是“所有大型项目都能一次放进去并正确处理”的保证。上下文够大,并不会自动消除遗漏、误解或返工。
这个月的记录覆盖的是一个人的工作、原型试验与研究活动,既不是随机抽样,也不是把所有变量固定后的跨模型测评。
研究任务本来就很难只用一个模型
“只用 Flash”适合用来检验日常工作中有多少任务可以交给低价模型,却未必适合模型研究。要比较服务、做 benchmark、测试路由机制,就需要调用不止一个模型。
作者的月度用量因此混合了两类活动:一类是完成当下的实际工作,另一类是探索怎样让智能体更好地工作。后者可能没有立刻交付一个产品功能,但仍会消耗 token 和费用。
若把两类预算全部混在一起,就容易误判:研究投入被当成生产成本,或单个低价模型的账单被当成整个系统的成本。
原文还预览了一个面向 Wagtail 任务的多模型比较。它说明作者在继续收集证据,但文章没有给出足够完整的方法与复现材料,不能把其中某项成功率外推成模型的通用编程准确率。本文不据此给模型排总榜。
便宜之后,可能反而用得更多
作者报告,这个月全部模型的能耗估计约为 35 kWh,之前约为 10 kWh。这个变化并不等于单位任务的能耗恶化,也不是“增长十倍”:总任务量、调用方式和模型组合都变了。
低单价降低了尝试的门槛,更多实验、原型和持续任务又可能把总用量推上去。最后该问的不是“每百万 token 便宜了多少”,而是“为了完成哪些工作,一共花了多少”。
token 很多,也不必然代表成果很多。评估系统时,需要把账单和可验收结果放在一起看:任务是否完成、哪些修改被保留、人工复核和返工花了多久。
下个月,先管理工作,再管理模型
作者计划在 10 月更好地记录本地用量、成本、能耗与工作结果,区分研发预算,并给智能体更明确的目标和角色。这些是他的后续计划,不是已经得到验证的收益。
从这次经历可以提炼出几个实用检查点:实际调用的是哪个模型?为何切换?什么条件下停止?结果由谁验收?实验成本与日常工作成本有没有分开?
便宜模型是否够用,最终还是要回到具体任务。这个案例没有给出统一的“行”或“不行”,但给出了一个有价值的边界:68 美元只说明目标模型那部分的费用;要判断一套 AI 编程工作方式是否划算,还得看全部调用和最后交付的东西。
原始资料与延伸阅读
本文由《听懂 AI》第 044 期 AI 访谈节目编辑整理,并非对 Thibaud Colas 的真人采访。用量、费用与能耗来自其 2026 年 9 月个人使用记录及估计,不能外推为所有开发者的收益或完整环境影响;预算与验收建议为编辑补充。正文已按原文纠正节目脚本中关于总费用、总能耗及误选模型名称的表述。
- 原始文章:One month on GLM 5.3 Flash,Thibaud Colas,Wagtail,2026 年 10 月 2 日。
- 社区讨论:Hacker News 对应条目。讨论不作为费用、能耗或模型性能数字的证据,本文结论以作者原文为依据。