模型没降价,干长活却便宜了 45%:Claude Fable 5.1 在打什么算盘
当地时间 9 月 1 日,Anthropic 上线了新旗舰 Claude Fable 5.1,以及面向网络安全与生命科学机构的「受限版」Claude Mythos 5.1。按惯例,各家媒体先比跑分——科研自主性基准 Terminal-Bench-Science 从 24.7% 翻倍到 52.6%,确实唬人。但真正值得琢磨的,藏在价格表里:缓存读取价格从每百万 token 1 美元砍到 0.25 美元,降幅 75%。
跑分涨在哪,比涨多少更重要

只挑几个数看,Fable 5.1 的提升分布很有意思:科研类近乎翻倍,自动化工作流 AutomationBench 从 17.1% 涨到 31.4%;而编码类要温和得多,CursorBench 只是 70.5% → 73.4%。它几乎没有「均匀变强」,而是把力气集中在一个方向——让模型能连续数小时、跨多步骤地自己把活干完。
模型没降价,降的是「时薪」

Fable 5.1 的基础定价纹丝不动:输入每百万 token 10 美元、输出 50 美元。Anthropic 动的是缓存读取价格。长任务里,Agent 会反复读同一份系统提示词、代码库、工具定义——任务越长,缓存读取占账单的比重越高。把这一项从 1 美元打到 0.25 美元,官方测算典型负载成本降约 25%,高度 Agent 化任务最高降约 45%。
Cognition 已经用脚投票:把 Devin 里原本跑在 Opus 5 的流量切到 Fable 5.1,单任务成本从 5.84 美元降到 2.68 美元。Ramp 则让它在无人干预下连续跑了 38 个小时——先发现此前的实验结论受标签伪影污染,自行修正后,又开了 6 组并行实验跑了一整夜。跑分也许有水分,但「每小时干活的成本」很难造假。
同一颗大脑,两套护栏

Mythos 5.1 不是另一个模型。Anthropic 明确说它和 Fable 5.1「identical」,区别只在安全策略:Fable 面向所有用户,涉及网络安全、生命科学的高风险能力被额外收紧;Mythos 则放开限制,只给通过审核的机构。同一内核、两种出货方式,既守住安全叙事,又不浪费前沿能力——顺带演示了什么叫「可控的高价值」:用它设计蛋白质结合剂,12 个靶点命中率接近 50%,而行业常规水平只有 10%–15%。
掐着 IPO 的节点发布
这次发布的时间点很微妙。Anthropic 6 月已秘密递交 IPO 文件,外界普遍预期 9 月 7 日劳动节后公开招股书,最快 9 月底至 10 月初挂牌;私募估值 9650 亿美元,市场传闻的上市估值已摸到 2 万亿美元量级。赶在给华尔街交账之前,秀一把「最强编程模型 + 成本结构可控」,比任何新闻稿都有说服力。
前沿模型的竞争,正从「谁能考更高分」切换到「谁能用更低成本、长时间干复杂活」。跑分只是入场券,时薪才是护城河。
你觉得模型厂商下一步会卷什么——更长的连续任务,还是更便宜的长任务?评论区聊聊👇