GPT-6.1 Sol:接近旗舰,账单打折,真能放心换吗?

第 042 期节目封面:天平两侧分别放着模型能力与长长的成本账单

TL;DR:OpenAI 于 2026 年 9 月 29 日发布 GPT-6.1 Sol,称它在多项复杂任务上接近 GPT-6 Astra;Standard API 的短上下文输入、输出单价分别为每百万 token 2 美元和 10 美元,均是 Astra 的五分之一。Artificial Analysis 同日评测报告了接近旗舰的综合分数和更低任务成本,但推理档位、输出量、缓存命中与返工都会改变实际账单,换模型仍需要用自己的任务验证。

上图为本期节目封面,是能力与成本权衡的视觉示意,不是实测图表。

上一代 Sol 发布仅七天,新版就来了。对使用者来说,真正需要回答的问题是:它能否稳定完成原来交给旗舰的工作,省下的模型费会不会变成额外的审核与纠正时间?

本期结合 OpenAI 发布公告、官方 API 定价和 Artificial Analysis 评测来算这笔账。几张榜单能帮助挑选测试方向,最终结果还要回到你的代码、文档和工作流程。

🎬 视频版(B站) | 🎧 音频版(5 分 57 秒)| 🟢 Spotify 订阅 | 📖 偏好阅读?文字版就在下方 👇

“接近旗舰”具体接近什么

OpenAI 称,GPT-6.1 Sol 在 DeepSWE v1.1 真实代码库的软件工程任务上达到 Astra 的成绩,并在复杂 PDF 问答、多步骤业务流程和计算机操作测试中改善了能力。公告仍建议最困难的科学研究任务使用 Astra。

这是发布者在特定评测环境、工具和推理设置下得到的结果。它并不保证你的所有任务都与 Astra 同样可靠,生产产品的系统提示和工具配置也可能让输出不同。

Artificial Analysis 的 Intelligence Index v4.3.2 则给出另一组证据:GPT-6.1 Sol 比 GPT-6 Sol 高 4 分,距 Astra 低 1 分。其办公评测中,分析质量提高,呈现效果评分却略有下降。读材料、找问题和交付排版完善的成品,可能因此有不同体验。

五分之一的价格,应按什么条件算

截至 2026 年 10 月 2 日,官方 API 定价中的 Standard 短上下文价格如下,单位均为美元/百万 token。短上下文指一次请求输入不超过 272K token。

模型 输入 缓存输入读取 缓存写入 输出
GPT-6.1 Sol 2.00 0.10 2.50 10.00
GPT-6 Sol 2.00 0.20 2.50 10.00
GPT-6 Astra 10.00 1.00 12.50 50.00

“五分之一”准确对应 Sol 与 Astra 的标准输入、输出单价。相对上一代 Sol,新版这两项单价没有变化,变化明显的是缓存输入读取价。

还有容易漏掉的条件。GPT-6.1 Sol 的输入超过 272K token 时,Standard 长上下文输入、缓存读取、缓存写入和输出价分别为 4、0.20、5、15 美元/百万 token。Fast、Batch、Flex 和区域处理也有各自计费规则。项目若大量使用长上下文或其他处理档,不能照着短上下文价格估算全部请求。

缓存只便宜了命中的那部分

GPT-6.1 Sol 的缓存输入读取价为正常输入价的 5%,比上一代的 0.20 美元再低一半。对于反复读取相同项目说明、代码背景和固定规则的智能体,这可能显著影响输入成本。

但命中多少必须看实际用量。没有命中的输入、计费输出、适用的缓存写入和工具费用,仍要分别计算。也不能把“缓存价再降一半”理解成整个任务账单再打五折。

更实用的成本指标是每个验收通过任务的总支出:包含全部请求、重试和工具调用,再加上等待与人工纠正时间。便宜的单次调用如果需要来回修五次,整体未必更划算。

独立评测的任务成本,是另一把尺子

Artificial Analysis 报告,在 max 推理设置下,GPT-6.1 Sol 的 Intelligence Index 平均每任务成本为 0.72 美元,Astra 为 3.26 美元;上一代 Sol 为 1.05 美元。这是该机构按自己的任务集、配置与计价计算的结果,无法直接当作你项目的单次成本。

同一次评测中,xhigh 在 Coding Agent Index 上反而比 max 高 3 分;新版在综合指数测试中各推理设置的输出量又比上一代多约 10–30%。因此,提高推理强度不保证得分持续上升,降低任务成本也不意味着输出一定更短。

可以先把 xhigh 与 max 都放进自己的小样本测试,记录成功率、耗时和实际用量,观察高推理档是否带来足够收益。评测中的一个反常结果值得复查,却不是替所有人指定默认档位的理由。

7.7% 与 54% 为什么不能直接比较

OpenAI 报告,低推理设置下,含至少一处事实错误的回答比例从 11.4% 降到 7.7%。题目来自用户曾指出旧模型错误的去标识对话,官方明确说这是一组特意较难、不能代表典型使用的样本。

Artificial Analysis 的 54% 则来自 AA-Omniscience 知识评测,较上一代的 60% 有改善。它与官方事实错误率使用不同问题和统计口径,不能把差距解释为哪一方数字失实,也不能据此说日常一百条回答有五十四条错误。

对应用开发者,应该检查的是自己最在意的错误:是否引用不存在的资料、是否乱改约束、是否把缺失信息当成事实。综合分数只负责提供方向,具体失败仍需要在真实任务里观察。

API 降价与订阅额度分别核对

API 的 token 单价和 ChatGPT Work、Codex 的订阅或信用额度是不同计费表。API 单价下降,不能直接推出包月用户可做的任务增加;官方套餐和账号实际额度才决定个人可用量。

发布公告还预告了 Sol 的 Ultrafast 版本。本文核对的当前 API 定价与更新日志未确认该型号的 Ultrafast 已普遍可用,也没有据此给出速度或费用保证。有关未来速度档的预告,不计入本文 Standard 成本比较。

换模型前,可以选几件你熟悉且知道怎样验收的工作,用一致的要求比较:结果是否正确、实际花费多少、等待多久、纠正几次。把重复出现的错误留成测试样本,才容易判断新版究竟节省了成本,还是把成本转移到了你身上。

收看本期节目

音频:在线播放或下载 | 播客主页:听懂 AI

原始资料与延伸阅读

本文由《听懂 AI》第 042 期《GPT-6.1 Sol:接近旗舰,账单打折,真能放心换吗?》整理而成,核对日期为 2026 年 10 月 2 日。本期综合多份原始材料,节目采用脚本化双人对谈,并非采访 OpenAI 或 Artificial Analysis。厂商结果与独立机构结果分别归因;本文没有复跑评测。OpenAI Docs 的 API 定价与更新日志是编辑阶段补充,价格和可用性仍会变化。HN 仅作为社区观察。

  1. OpenAI:Introducing GPT-6.1 Sol——发布公告、测试结果与适用边界。
  2. Artificial Analysis:GPT-6.1 Sol replaces GPT-6 Sol after just 7 days——2026 年 9 月 29 日独立评测,含任务成本、推理档位与输出量比较。
  3. OpenAI Docs:API 定价——Standard、长上下文、缓存读写和其他处理档的价格。
  4. OpenAI Docs:API 更新日志——9 月 29 日型号发布与当前速度档记录。
  5. Hacker News 发布讨论——用户反馈可帮助寻找测试方向,不是满意度或故障率调查。