摘要 同一个底层模型,两套开放边界;输入输出单价不变,真正降价的是Agent反复读取的上下文。 黑粉科技 · 2026-09-02
🌓 名字像两款模型,底下其实是同一个脑子
今天早上我打开 Anthropic 的发布页,最先让我停下来的不是 52.6% 的科研跑分,而是官网写得非常直白的一句话:Claude Fable 5.1 和 Claude Mythos 5.1 是同一个模型,只是护栏等级不同。
Fable 5.1 面向 Claude API 客户和合作云平台;Mythos 5.1 只给可信访问计划里的机构与专业人员。一个负责把能力放到大众生产环境,另一个把网络安全和生命科学中的专业能力开放给经过审核的团队。这不是“大杯和超大杯”,更像同一台机器装了两套门禁。

这条设计决定了这次更新该怎么看。普通用户能拿到的不是“被阉割的另一个架构”,而是同一能力底座在公开环境里的安全版本;专业团队申请 Mythos,也不是交更多钱买会员,而是用组织身份、使用场景和审查责任换取更宽的专业边界。
当年企业软件常把同一套代码按许可证切成社区版和企业版,差别主要是功能开关。Anthropic 这次切的不是菜单,而是模型在高风险领域能走到哪一步。能力商品化与风险分级,第一次被摆在了同一张产品说明书上。
Fable 与 Mythos 的差别,不是哪个更聪明,而是谁能在什么场景里被允许使用这份聪明。

📊 跑分确实涨了,但别把官方成绩当成万能保票
先看最醒目的科研成绩。Terminal-Bench-Science 0.1 上,Fable 5.1 达到 52.6%,上代 Fable 5 是 24.7%,Opus 5 是 29.0%,GPT-5.6 Sol 是 22.4%。从数字看,不只是小修小补,而是把上代成绩翻了一倍多。
可这张图旁边还有一行容易被忽略的注释:每个模型的标准误差约为 ±3.5 至 4.5 个百分点,而且整套结果由 Anthropic 自己公布。它能证明这家公司在长时程科研任务上取得了明显进步,不能证明你的代码库、合同或财务表格也会按同样比例变好。

| 官方基准 | Fable 5.1 | Fable 5 | Opus 5 | 变化 |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 科研Agent跃升最大 |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% | Fable反超Opus |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 知识工作小幅领先 |
| AutomationBench | 31.4% | 17.1% | 26.9% | 业务自动化提升明显 |
| CursorBench 3.2 | 73.4% | 70.5% | 70.0% | 代码Agent稳步提升 |
来源:Anthropic 官方发布页。Mythos 5.1 在 Terminal-Bench 4.0 为 60.9%;官方解释差距主要来自网络安全护栏干预。
更重要的是提升集中在哪儿。官方列了六类:能跑数小时的多文件编程与迁移,从问题一路做到文档、活公式表格和幻灯片,多步研究与搜索,读取 PDF 密集图表的视觉能力,贯穿 1M 上下文的长文推理,以及失败后能恢复的电脑操作。多语言表现则与 Fable 5 大致持平。
这组变化指向同一件事:Anthropic 不只想让模型把一道题答对,而是让它在几十次工具调用后仍记得目标、能检查自己的产物、发现根因再继续干。早在代码模型只比补全准确率的阶段,谁多写对一行就能赢;现在真正拉开差距的,是任务跑到第三小时还会不会偏航。
💸 每百万 token 价格没降,为什么官方敢说最高省45%
Fable 5.1 的基础单价与 Fable 5 完全相同:输入每百万 token 10 美元,输出 50 美元。它也仍然比 Opus 5 的 5 美元输入、25 美元输出贵一倍。只看价目表,这次甚至算不上降价。
真正被砍的是缓存读取:从上代每百万 token 1 美元降到 0.25 美元,整整便宜 75%。长时程 Agent 每轮都会反复读系统指令、代码库摘要、工具定义和前面的会话记录,缓存命中越高,这一刀越有价值。
Anthropic 因此估算,典型按 token 计费的工作负载有效成本约降 25%,高度智能体任务最高约降 45%。

这也是为什么短问答用户不该把“最高省 45%”抄到自己账单上。一次提问、一次回答,缓存复用很少,最贵的输出 token 一分钱没降;只有代码 Agent、深度研究、文档流水线这类持续回看同一批上下文的任务,才有机会接近那个上限。
当年云计算把价格写成“每台机器每小时多少”,后来真正决定成本的却是预留实例、冷热存储、流量和空闲率。模型 API 正在重演这套剧本:挂牌单价只是门口菜单,完整任务成本还要算缓存、工具轮次、失败重试和运行时间。
谁赚了?Agent 平台、云厂商和长任务用户先受益,Anthropic 也能用更低的任务成本把高端模型塞进更多生产流程。谁亏了?大量一次性输出、缓存命中低的人基本吃不到红利。谁保持沉默?价目表不会主动告诉你,一个 Agent 因并行工具调用变少而多跑了几轮,可能把省下的缓存费又花回去。
🧰 开发者别只改模型ID,三处兼容性会直接报错
从 Fable 5 迁移到 5.1,看起来只需把模型 ID 改成 claude-fable-5-1,但官方文档列了三项破坏性变化。第一,tool_choice 里的强制 any 或指定工具不再支持,会返回 400;要改成自动选择,再配合严格工具模式或结构化输出。
第二,旧模型读不了 Fable 5.1 生成的 thinking blocks。路由器如果从 5.1 回退到早期模型,这些思考块会被丢弃。
第三,修改、重排或删除旧回合,甚至让同一个图片 URL 后来返回了不同字节,都可能让后续 thinking blocks 失效。自己维护消息数组的 Agent harness,必须把会话改成追加式。
- 需要强制 JSON:改用
tool_choice: auto+ strict tool use,或结构化输出 - 跨模型路由:监控 thinking block 被丢弃,别把静默转换当成完整上下文
- 长会话:旧消息尽量只追加不修改,临时提醒改用 turn-scoped system message
- 实时界面:Fable 5.1 的进度更新更少,需要显式开启
display: updates - 低 effort 检索:官方提醒它更容易凭记忆回答,需要新鲜信息时要明确要求搜索
还有两个会直接影响实际成本的行为差异:并行工具调用更不稳定,小改动也更容易整文件重写。前者增加轮次与延迟,后者增加输出 token。缓存更便宜不代表 harness 可以不优化;模型越强,编排层越不能躺平。
🧬 Mythos不是隐藏会员档,Anthropic在试一种分级开放
Fable 5.1 的网络安全护栏平均每个 Claude Code 会话少约 60% 干预,现在允许发现软件漏洞,但漏洞利用生成、渗透测试和基于二进制的漏洞扫描仍可能转交 Opus。生物学护栏对基础生物和医疗良性请求的误触发,相比 Fable 5 首发版本少了 85%。
Mythos 5.1 则通过 Cyber Verification Program 和 Life Sciences Verification Program 开放,Claude Security 也已由它驱动。
也就是说,Anthropic 没有把高风险能力简单关死,而是要求申请者可识别、场景可说明、责任可追踪。普通用户少被误伤,专业团队多拿能力,平台保留最后一道门。
Anthropic 为什么现在做这件事?一边是长任务能力已经强到能连续操作代码、浏览器和科研工具,旧护栏的误伤开始直接妨碍生产;另一边是云厂商和企业客户需要可审计、可分责的数据与安全合同。
把 Fable 全面铺开、把 Mythos 放进可信计划,既能抢 Agent 入口,也能把高风险能力的责任链留在商业体系内。
科研案例很抢眼:Mythos 5.1 在 12 个靶点上的蛋白结合体命中率接近 50%,官方称常见水平为 10%–15%;它还把七个开源生物模型最高加速 2.5 倍,估算 GPU 成本降低 30%–60%。Fable 5.1 则利用三十多年前的 NASA 雷达数据,把金星高程图细节从 10–20 公里推进到 2–3 公里。
这些案例值得重视,但仍是厂商挑选并组织的首发成果,不是独立实验室对通用科研能力的全面复现。早在自动驾驶演示第一次惊艳公众时,单条漂亮路线与全天候可靠驾驶就不是一回事;今天看 AI 科研也一样,发现线索、提出假设和形成可重复证据,是三道不同的门。
🧭 普通用户怎么选:别把最贵模型设成默认
Anthropic 自己的模型页反而很克制:多数工作负载先从 Opus 5 开始;只有高 effort 的 Opus 仍达不到要求,或者任务确实是长时程代码、研究与复杂知识工作时,再用 Fable 5.1。它的默认延迟被标为“较慢”,这也是强度的代价。
| 你的任务 | 建议选择 | 理由 |
|---|---|---|
| 普通问答、日常写作 | 先用 Opus 5 或更轻模型 | Fable 基础输出仍很贵,缓存优势有限 |
| 数小时代码迁移、根因分析 | 评测后用 Fable 5.1 | 长任务与缓存降价最匹配 |
| 多步研究、文档/表格/幻灯片 | Fable 5.1 值得重点测试 | 属于官方明确增强区 |
| 专业网络安全、生命科学研发 | 申请 Mythos 5.1 可信访问 | 不是公开会员档,需审核 |
| 64GB Mac 本地部署 | 不可行 | 没有开放权重,只能走云端 |
本篇为官方资料转述与分析,不含本机模型实测。实际选型应以自己的任务集、失败率、耗时和完整账单为准。
最后说清本地部署:**Fable 5.1 与 Mythos 5.1 没有开放权重,也没有 GGUF、MLX 或离线运行路线。**1M 上下文说的是云端服务规格,不是 64GB Mac 的本地容量。
能在 Claude、API、Bedrock、Google Cloud 或 Microsoft Foundry 调到,不等于能把模型下载回家。
所以这次更新真正值得记住的,不是“又一个最强模型”。它把三件过去分散的事绑到了一起:顶级能力用同一底座交付,高风险能力按身份和场景分级开放,长任务则靠缓存价格而不是基础单价降本。模型竞争已经从回答一次,走到了谁能更便宜、更稳地把整件事做完。
建议 一手来源 Anthropic 官方发布页: https://www.anthropic.com/claude-fable-and-mythos-5-1 Claude Platform 模型规格: https://platform.claude.com/docs/en/models/fable-5-1/overview 更新与迁移说明: https://platform.claude.com/docs/en/models/fable-5-1/whats-new-fable-5-1
摘要:同一模型、两套边界,价格没降但长任务真的可能更省 Fable 5.1 与 Mythos 5.1 共享底层模型:前者全面开放,后者只给可信访问项目。1M 上下文、128K 输出与 $10/$50 基础价格没有变化,但缓存读取降到 $0.25/MTok,使典型任务有效成本约降 25%,高度智能体任务最高约降 45%。它最适合长时程代码、研究与复杂知识工作;普通问答不必默认上最贵档,本地 Mac 也没有部署路线。
建议 黑粉科技 · 本地AI / 白嫖指南 / 我做的工具 / 新品速递 本篇依据 Anthropic 官方发布页与 Claude Platform 文档撰写;所有跑分和科研案例均按官方口径标注,未进行本机模型实测。
建议 我目前的4款自制软件 · 黑粉剪辑 HyphenCut(正式迭代)——Rust 重写的本地专业视频剪辑:达芬奇键位、AI 助理改真实工程,免费 https://github.com/HackerChi-Hub/HyphenCut-Releases/releases · 黑粉盒子 HyphenBox(初步构建 · 预览版)——免费大模型 API 雷达:持续复测可用性,本地统一接口,Key 只存本机 https://github.com/HackerChi-Hub/hyphenbox-release/releases · 方寸智匣 LocalBrain(正式迭代)——本地模型的多模态 MCP 工具箱:TTS / Whisper / 视频生成一站接入 https://github.com/HackerChi-Hub/localbrain-releases/releases · ScreenLex 光影词库(正式迭代)——看美剧顺手把生词背了,Mac/Windows 双平台,免费 https://github.com/HackerChi-Hub/screenlex-download/releases
黑粉科技 · 本地部署 / 免费白嫖 / 自制软件 https://hyphentech.top
