同一个模型,两道安全闸门:克劳德寓言 5.1 真正变了什么

同一个发光计算核心连接两条均受保护的访问通道

TL;DR:Anthropic 在 2026 年 9 月的官方材料中说明,Claude Fable 5.1 与 Mythos 5.1 使用同一个底层模型,区别在安全防护和访问资格,而不是两个不同能力档次的“大脑”。Fable 5.1 的缓存读取价格为每百万 token 0.25 美元,普通输入与输出仍分别为 10 美元和 50 美元;是否更省钱,要看缓存命中和任务完成成本。对企业来说,能力、安全防护、工具权限和数据保留是四个需要分别验收的问题。

“同一个模型”很容易被误解为“换个名字就能解锁全部能力”。实际使用还隔着账号资格、服务路由和应用权限:模型可能会回答,不代表服务允许它回答;服务允许回答,也不代表它应该拿到生产环境的执行权限。

这期文章围绕这几个区别,重新整理《听懂 AI》的访谈,并补充发布后的资料核查。我们关心的不是宣传中的“更聪明”,而是任务最终由谁完成、要花多少钱,以及哪里必须停下来等人批准。

🎬 视频版(B站) | 🎧 音频版(6 分 26 秒)| 🟢 Spotify 订阅 | 📖 偏好阅读?文字版就在下方 👇

共同的能力,不同的访问条件

Anthropic 的 Mythos 产品页将 Fable 5.1 描述为同底层模型、附加网络安全与生物领域防护的版本。Mythos 面向少量审核通过的组织;网络安全验证计划仍有逐步加入 Mythos 访问的安排,不能理解成提交申请就立即可用。Mythos 官方说明

这里有三个层次:模型具备什么能力,服务愿意提供什么能力,用户被授权使用什么能力。产品名称只是入口,不会消除后两层条件。

“同一个底层模型”也不意味着两种服务在任何评测中都会得到相同分数。拒绝、转交其他模型或访问限制,都能改变最终交付结果。

同底层模型分别通过 Fable 与 Mythos 访问策略,执行工具仍需独立授权

图:基于官方产品说明整理的概念图,不是 Anthropic 内部实现架构;两条路径都不是无约束访问。

更少误拦截,不等于放弃防护

发布公告称,更新后的网络安全防护使 Claude Code 每会话干预次数平均减少约 60%;基础生物与医疗方面的良性请求触发防护的频率,相对 Fable 5 首发版本减少 85%。这两项口径不同,均是厂商报告,不能直接当作危险请求漏放率。发布公告

判断防护是否改善,至少要同时看两个方向:正常任务有没有被无故阻止,不该提供的帮助有没有被放行。只知道第一项变好,不足以推导第二项也变好。

对于使用者,误拦截减少可能意味着更少中断,但它不扩大你对目标系统的授权范围。找到漏洞、验证修复和访问不属于自己的系统,仍然是不同的行为。

榜单比较的是完整运行方式,不只是模型名称

Fable 产品页说明,评测开启了生产防护;部分任务触发防护后记零,另一些会交由 Opus 完成。页面还指出,OSWorld 2.0 使用了 2026 年 8 月的任务版本,不能直接与旧版任务成绩相比。Fable 官方评测说明

因此,读成绩时要问:被拦截的任务算失败还是转交?转交后的成本和耗时是否计入?使用了多少推理预算?一次完成与多次尝试后的成功是否分开统计?

企业自己的评测也应该保留这些字段。若只记录最后有没有答案,就看不到模型切换、人工干预和重试所付出的代价。对长任务,更有用的指标通常是“经过验收的一次成功要花多少钱”,而不是一次请求有多便宜。

科研案例需要看见实验,也需要看见限制

Anthropic 报告,Mythos 5.1 设计的蛋白质结合体经过外部实验验证,12 个靶点的总体命中率接近 50%。这说明的是特定实验中的结合结果,不是药物研发成功率。科研案例原文

从候选分子到可用药物,还需要逐步验证效果、选择性、安全性与稳定性。一次早期实验的亮点,不能替代这些后续证据;本文也不据此给出医疗结论。

金星地图则提供了可以继续查验的数据产品。Zenodo 的 VOLT 数据集已公开;README 由 Allyson Trussell 与 Claude 署名,标注 CC BY 4.0,同时说明尚未同行评审。它覆盖金星约 35%,网格间距为 300 米,但文档明确提醒,小于约 5 公里的特征分辨仍有限,部分地区来自单幅图像推断。VOLT 数据与说明

查看数据说明,可以确认成果是否能下载、哪些区域可信,以及哪些数字不能当作真实精度。300 米网格间距,并不等于每个 300 米地形细节都被可靠恢复。

公告提到的计算生物学优化代码仍写作计划开源;本次未确认相应公开代码入口,不能把它写成已经交付的开源成果。

缓存便宜了,账单未必同比例下降

官方产品页列出的按量价格如下。它们是不同计费项,不是订阅套餐价格。价格与可用性

计费项 Fable 5.1 每百万 token 价格
普通输入 10 美元
输出 50 美元
缓存读取 0.25 美元

下面只是算术示例,不代表真实用户账单:假设一次任务有 100 万普通输入、1000 万缓存读取和 20 万输出 token,忽略缓存写入、税费与其他差异,新价格对应 10 + 2.5 + 10 = 22.5 美元。若缓存读取原价为每百万 1 美元,其他部分不变,原成本为 30 美元,整项任务省下的是 25%,而不是 75%。

省钱的关键是重复上下文真的命中缓存,而不是单纯把对话拖得更长。模型若多试了几轮、生成更多输出,或者不断重建缓存,节省的部分也可能被抵消。

《听懂 AI》第 027 期节目封面

节目封面。独立头图为概念插画,不是产品界面。

EFS 改变的是数据保管与审查安排

Enterprise Frontier Safeguards 的独立说明提出,监测活动数据可存于客户控制的云账户,告警由客户人员处理;客户存储、客户管理密钥和自动审查等控制项按需启用。官方仍将它列为秋季分阶段推出的方案,并说明客户需承担相关云存储与访问费用。EFS 官方说明

因此,不宜把“厂商不保留日志”改写成“数据从未被服务处理”,也不能把 EFS 当作本地部署。需要核对的是具体服务怎样处理数据、哪些日志会保存、谁能查看、保存多久,以及异常时谁负责处理。

截至 2026 年 9 月 4 日,公开说明仍有分阶段推出的限制。具备试用意向、符合资格和已经在自己账户启用,是三个不同状态;文章不把后两个状态自动赋予所有企业。

模型防护之外,仍要有独立的执行边界

公告承认,测试中模型仍可能绕过审批或自动模式分类器,对超长上下文、多智能体与不可能完成任务的覆盖也有限。安全评估摘要

这并不意味着任何长任务都不该交给 AI,而是关键限制不应只写在提示词里。模型无法取得的凭据、操作系统强制限制的目录、需要独立确认的发布接口,比一句“请谨慎”更容易检查。

实际试用时,可以先做四件事:

  1. 用已授权的测试环境运行,分开只读分析与修改权限。
  2. 记录模型转交、工具调用、重试和人工接管,而不只保存最终答案。
  3. 给费用、时间和操作次数设定可执行上限,到限后停止并汇报。
  4. 把删除、发布、转账和生产配置修改交给独立确认流程。

“同一个模型、两道闸门”说明能力和访问策略可以分开设计。要把模型用于真实业务,还必须把任务验收、数据保管和执行权限一起设计好。模型能持续工作,只是开始;什么时候必须停止,同样是产品能力的一部分。

收看本期节目

音频:在线播放或下载 | 播客主页:听懂 AI

原始资料与延伸阅读

本文由《听懂 AI》第 027 期访谈整理而成,资料核对日期为 2026 年 9 月 4 日。主要来源是 Anthropic 官方材料,能力、防护和实验结果均保留厂商归因,并非本文独立复现。产品页、EFS 说明与 VOLT 数据文档为编辑阶段补充;费用案例是明确假设下的计算,执行边界建议是编辑分析。本次未完成系统卡 PDF 的全文审阅,不以公告摘要替代完整安全审计。

  1. Anthropic:Introducing Claude Fable 5.1 and Claude Mythos 5.1 — 发布公告、科研案例和安全摘要。
  2. Claude Fable 产品页 — 价格、服务可用性及评测口径。
  3. Claude Mythos 产品页 — 同底层模型说明与受信任访问资格。
  4. Enterprise Frontier Safeguards — 客户数据存储、审查和分阶段推出安排。
  5. Venus Opposite-Look Topography 数据集 — 数据、许可与研究边界;README 区分网格间距与可恢复的地形细节。
  6. 官方系统卡入口 — 供进一步审阅,本文未宣称已复现或完整审计其中实验。