降价75%!Anthropic发布号称"全球最强"的最新模型
2024年9月2日,AI企业Anthropic正式推出了旗下最新一代旗舰大语言模型——Claude Fable 5.1与Claude Mythos 5.1。该公司将这两款"同源双生"模型定位为"当前全球顶尖的代码开发与知识型工作模型"。其中,Fable 5.1对所有个人用户及企业客户全面可用,而Mythos 5.1则仅向通过资质审查的美国网络安全及生命科学相关机构定向开放。这已是Anthropic自6月推出Fable 5系列以来,短短三个月内的又一次旗舰迭代。

在多项关键评测中,Fable 5.1展现出跨代级的性能飞跃。尤其值得关注的是,用于评估AI独立开展科学研究能力的Terminal-Bench-Science0.1测试中,其得分由前代的24.7%一举攀升至52.6%。与此同时,Anthropic同步公布了缓存读取费用的大幅削减方案,并发布了一套全新的企业级前沿安全防护体系。
就定价而言,Fable 5.1的标准输入与输出费率未作调整,依旧维持每百万Token输入10美元、输出50美元的水平,与前代Fable 5一致。然而,缓存读取费用则由原先的每百万Token 1美元骤降至0.25美元,削减幅度达75%。
所谓缓存读取,是指模型调取此前已解析并留存之输入内容时所对应的计费环节。在典型的智能体工作流和超长对话场景中,反复命中缓存属于高频操作,因此此次降费对终端用户的实际支出影响远大于账面百分比所呈现的程度。
据Anthropic官方估算,在常规工作负载条件下,Fable 5.1的综合使用成本较Fable 5下降约25%;而在高度依赖智能体协作的任务中,成本缩减幅度最大可逼近45%。此外,该模型延续了100万Token的上下文容量以及12.8万Token的最大生成长度。
依据Anthropic官网披露的技术文档,Fable 5.1与Mythos 5.1本质上源自同一个基础架构,区别在于安全策略的配置差异。Fable 5.1作为对外发布的公开版本,搭载了更加严密的安全限制机制,可有效阻止模型在生物制造、网络攻防等高敏感双重用途场景中执行特定指令;Mythos 5.1则在上述领域放宽了安全阈值,其直接调用权限仅限于经"可信接入计划"认证的个人与组织,同时其能力也作为底层支撑服务于面向全部Claude企业客户的Claude Security产品线。
Anthropic指出,采取"单一模型底座、差异化安全策略"的双轨发布方式,目的在于既推进模型能力边界的拓展,又切实防范高风险场景中的潜在误用风险。
在具体跑分方面,最具代表性的Terminal-Bench-Science0.1测试中,Fable 5.1凭借52.6%的成绩,不仅大幅超越了前代Fable 5(24.7%)和OpenAI的GPT-5.6Sol(22.4%),甚至超过了自身定位更高的Opus 5(29.0%),实现了逾一倍的效能跨越。该项测试专门考察AI在命令行环境下独立完成科研课题的能力,被业界公认为衡量模型科研潜力的关键标尺。
**Fable 5.1在各主流基准测试中的具体表现:**

在反映终端编程水平的Terminal-Bench4.0评测中,Fable 5.1取得55.8%的分数,相比前代的42%有显著提升;安全约束相对宽松的Mythos 5.1则进一步达到60.9%。其余多项评测中,Fable 5.1亦全面占优:GDPval-AA v2知识工作评测斩获1853分,高于Opus 5的1824分;Automation Bench业务流程自动化评测录得31.4%,较前代17.1%几近翻番;Cursor Bench3.2.0智能体编程评测拿下73.4%;Humanity's Last Exam多学科推理评测在配备工具的前提下达到65%;OSWorld 2.0计算机操控评测在严苛评判标准下获得41.7%——以上各项均刷新了历史纪录。
**Fable 5与Fable 5.1执行相同任务的开销对比:**

需要特别提及的是,即便将Fable 5.1置于低档或中档推理强度档位,其产出质量已能匹敌乃至超越前代Fable 5拉满至高推理强度时的水准。官方数据表明,在绝大多数任务上,Fable 5.1以Low或Medium档位运行即可达到或优于Fable 5 High档位的水平,而单轮任务的消耗则明显减少。
Anthropic在其官方网站的介绍页面中,以较大篇幅呈现了两款模型在真实科研场景中的应用案例。在蛋白质工程方向,Mythos 5.1借助开源蛋白质设计与结构预测工具生成候选结合分子,随后委托两家外部实验室进行湿实验验证:在3个目标蛋白上,其亲和力达到了Adaptyv Bio竞赛最优解的10倍;在12个靶点中,有效结合分子的命中率接近50%,而行业内通常水平仅为10%至15%。
**Fable 5.1在天文数据处理方面的应用实例:**

天文计算领域方面,Fable 5.1利用NASA麦哲伦探测器三十余年前采集的雷达回波数据训练深度神经网络,重新绘制了金星约三分之一半球的高分辨率地形图,空间分辨率由原来的10至20公里细化至2至3公里,高程测量精度最高改善25%,最终成果以Creative Commons协议向公众开放。在GPU算子优化层面,Mythos 5.1为7个开源深度学习框架编写了专用GPU核函数并对中间张量实施缓存,推理吞吐最高提升2.5倍,全基因组测序分析的GPU算力开销预计可减少30%至60%。
当然,纸面跑分与实际落地体验之间仍存在差距。不同模型在不同任务类型与应用语境下各具长短,Fable 5.1虽在代码生成与科学计算方面优势显著,但在创意文本创作、多模态语义理解等其他维度上的真实表现,仍有赖于广大用户的广泛实践来加以检验。