Claude 5.1 刚刚发布!全球最强模型来了
chaincatcher原文关注AI的机器之心
刚刚,Anthropic 推出了下一代模型 Claude Fable 5.1 和 Claude Mythos 5.1。
Anthropic 声称,Claude Fable 5.1 是目前最强大的公开可用模型之一,专为复杂推理、长时任务和智能体工作流而设计。Claude Mythos 5.1 则代表了他们对更高能力边界的探索。
需要注意的是,虽然两者共享相同的基础模型能力,但针对不同的使用场景采取了不同的安全措施。
Fable 5.1 面向普通用户、开发者和企业开放,而 Mythos 5.1 则面向经过审查的高风险领域合作伙伴,保持更严格的访问控制。
换句话说,一个负责进入现实世界任务,另一个则被保留在更严格控制的环境中。这也可能是 Anthropic 对 AI 产品未来形态的探索:最强的模型未必以相同形式提供给所有人。
官方声明指出,这两个模型代表了 Claude 系列能力的重大进步,并展示了他们在增强模型能力的同时如何持续推进安全部署。 
作为“表面最强”的模型,Fable 5.1 的表现依然令人印象深刻。官方数据显示,Fable 5.1 在多项基准测试中超越了前代旗舰 Fable 5。 
然而,能力更强,价格却下降了。Anthropic 表示,Fable 5.1 保持相同的基础价格,而缓存读取成本相比 Fable 5 降低了 75%。在实际使用中,这使典型工作负载的模型总体成本降低约 25%;对于高度智能体化的工作负载,成本最多可降低 45%。 
看来,即使是最强大的模型也在关注性价比。
让我们仔细看看。
低档位追平上一代,Fable 5.1 主打“性价比”
Anthropic 这次想强调的不是简单地刷新排行榜,而是:Fable 5.1 能够以更低的推理成本完成以前需要 Fable 5 高档位才能完成的任务。
根据官方测试,Fable 5.1 在中低推理强度下已经达到接近甚至超越 Fable 5 的性能。Claude Code 默认使用高推理强度,而 Claude Cowork 和 Claude .ai 默认使用中等强度,用户可以根据任务复杂度在速度、成本和效果之间进行调整。
具体来说,Fable 5.1 在科研智能体基准 Terminal - Bench - Science 0.1 中取得了 52.6% 的分数,比 Fable 5 的 24.7% 翻了一倍多;在 Terminal - Bench 4.0 中,Fable 5.1 达到 55.8%,而能力更强的 Mythos 5.1 进一步达到 60.9%。
在知识工作、计算机操作和业务流程测试中,新模型也表现出提升。AutomationBench 分数从 Fable 5 的 17.1% 提高到 31.4%,CursorBench 3.2.0 从 70.5% 提高到 73.4%。 
在多项基准测试中,Fable 5.1 的分数超过了 Fable 5,其中科研智能体和业务工作流能力的提升最为显著。 
在 Terminal - Bench 4.0 测试中,Fable 5.1 和 Mythos 5.1 在不同推理强度下均超越了上一代 Mythos 5。 
在 Terminal - Bench - Science 0.1 测试中,Fable 5.1 最高取得 52.6% 的分数,是 Fable 5 的两倍多。
Anthropic 认为,Fable 5.1 的一个重要变化是更愿意追踪问题的根本原因,使其更适合执行持续数小时甚至数十小时的复杂任务。
投资公司 Millennium 在测试中发现,一段内部代码大约每运行一百万次就会崩溃一次。这个问题困扰了工程团队四五年,其他模型都未能找出原因。Fable 5.1 通过反汇编外部供应商的库并比对核心转储文件,将问题定位到第三方程序库中的一个错误。
Ramp 还让 Fable 5.1 连续运行了 38 小时。在发现原始机器学习结果受到标注错误影响后,该模型自主纠正了问题,并同时启动了六组实验,最终编制出新的结果和后续建议。
从写代码到做科研
在这次发布中,Anthropic 用了很大篇幅讨论 Fable 5.1 和 Mythos 5.1 在科学研究中的表现。
在蛋白质设计实验中,研究人员让 Mythos 5.1 调用开源蛋白质设计和折叠工具,然后将生成的设计发送给两家外部机构进行实验验证。
对于三个目标蛋白质,Mythos 5.1 设计的配体结合亲和力达到了 Adaptyv Bio 相关蛋白质设计竞赛中最佳方案的十倍。面对十二个目标蛋白质时,该模型的有效配体命中率接近 50%,而 Anthropic 提供的行业普遍水平为 10% 至 15%。
Fable 5.1 还利用 NASA 麦哲伦号航天器 30 多年前收集的雷达图像,为金星表面约三分之一的区域生成了新的高分辨率高程图。 
NASA 麦哲伦号航天器拍摄的金星雷达图像,中心是一座直径约 15 公里的小型盾状火山。
原始地图只能呈现 10 至 20 公里尺度的细节,而新地图将分辨率提高到 2 至 3 公里,高度测量精度提升高达 25%。Anthropic 计划以知识共享许可公开发布该地图,用于 NASA 的 VERITAS 和欧洲航天局的 EnVision 等未来任务。
在计算生物学领域,Mythos 5.1 通过编写自定义 GPU 内核和缓存中间结果,将七个开源蛋白质和基因组深度学习模型的运行速度提高了最多 2.5 倍,同时保持输出结果一致。在某些全基因组分析任务中,预计可将 GPU 成本降低 30% 至 60%。 
优化七个开源蛋白质和基因组模型后,Mythos 5.1 的推理速度提高了 1.4 至 2.5 倍。
Anthropic 旨在通过这些案例展示,模型正在从整理信息和编写代码,发展到提出解决方案、运行工具并交付可实验验证的研究成果。
缓存价格下降 75%,智能体任务最多便宜 45%。
除了性能,价格是 Fable 5.1 最直接的变化。
Fable 5.1 的输入和输出价格未作调整,仍分别为每百万 token 10 美元和 50 美元,但缓存读取价格降低了 75%,降至每百万 token 0.25 美元。
缓存读取是指模型重用已处理的上下文。在普通问答中其占比可能有限,但在需要反复读取代码库、历史对话和工具结果的智能体任务中,缓存往往构成主要成本。
根据 Anthropic 基于 2026 年 8 月实际使用数据的计算,使用 Fable 5.1 运行典型任务的总体成本比 Fable 5 低约 25%;对于上下文更长、工具调用更频繁的复杂智能体任务,成本降幅最高可达约 45%。 
缓存读取价格降低后,Fable 5.1 典型任务成本降低约 25%,高度智能体化任务成本最多降低约 45%。
Fable 5.1 现已在 Claude .ai、Claude Code 和 Claude API 上可用,并通过 AWS、Google Cloud 和 Microsoft Azure 提供。开发者可以通过 claude - fable -5-1 调用新模型。
强化反蒸馏机制
Fable 5.1 和 Mythos 5.1 实际上使用相同的底层模型,主要区别在于安全限制。
Fable 5.1 完全向普通用户和企业开放;Mythos 5.1 的网络安全和生命科学限制更宽松,目前仅向经过审查的个人和机构提供。
在网络安全领域,Fable 5.1 已经可以帮助用户发现软件漏洞,但仍不能直接生成漏洞利用程序。渗透测试、漏洞利用生成和基于二进制文件的漏洞扫描等双重用途任务,可能仍需交由限制更严格的模型处理。
调整后,新版网络安全保护机制相比 Fable 5 减少了约 60% 的误报。生物安全机制在基础生物学和医学问题上的误报率也降低了 85%,而与生命科学研究相关的高级能力主要通过 Mythos 5.1 审查计划开放。
Anthropic 还推出了企业前沿保护措施。企业可以将数据存储在其控制的云基础设施中,由企业负责默认的人工审查,从而实现近乎“零数据保留”的隐私效果,同时保留安全监控能力。该机制计划从今年秋季开始分阶段推出。
针对大规模模型蒸馏,Fable 5.1 也增加了新的限制。当日之后创建的 API 账户将无法在多轮对话中手动修改之前的上下文,同时保留 Claude 的历史思维记录。Anthropic 表示,这一变化主要是为了阻断一种公开已知的能力提取方法。
此外,为满足欧盟《人工智能法案》的要求,Fable 5.1 的文本输出将包含隐形水印。Anthropic 还开始小规模测试检测 API,初步向监管机构、媒体、事实核查组织和研究机构开放。
最后,网友们说得对,早起的鸟儿先用上 5.1。 
以上内容仅用作资讯或教育之目的,不构成与BTCC相关的任何投资建议。BTCC竭力但不能保证上述全部内容的真实性、准确性和原创性。