【Anthropic】发布Claude五代模型Fable5与Mythos5,编程能力大幅领先,科研突破显著

人工智能巨头Anthropic于2026年6月10日正式发布了备受期待的第五代Claude系列,包括面向通用市场的Claude Fable5和专注于特定专业领域(目前预览版已关闭)的Claude Mythos5。两款模型均基于相同的基础模型构建,但在安全配置和应用场景上有所侧重。(编译自AIbase基地报道)

作为通用模型,Claude Fable5在几乎所有主要基准测试中均取得最高分,尤其擅长处理长期和复杂任务。在评估解决真实GitHub任务能力的SWE-Bench Pro测试中,Fable5得分高达80.3%,远超Claude Opus4.8的69.2%和GPT5.5的58.6%。在更严格的生产级编码基准测试FrontierCode中,Fable5得分29.3%,大幅领先GPT5.5的5.7%。

Fable5的实际效率显著。支付巨头Stripe表示,Fable5将一个原需五个月的项目缩短至几天;在一个包含5000万行Ruby代码的代码库中,它仅用一天就完成了整个团队原需两个多月的迁移工作。在知识工作和视觉方面,Fable5在金融分析(Hebbia基准测试)和图表解读中表现出色,IMC交易集团称该模型几乎通过了其所有交易分析评估。视觉上,它能从复杂科学插图中准确提取数据,并仅凭游戏截图独立完成游戏《宝可梦 火红》,无需此前模型所需的辅助框架。

与Fable5的保守安全措施不同,Claude Mythos5移除了网络安全等领域的限制,专门提供给特定合作伙伴和美国政府(通过“玻璃翅膀项目”倡议)。在无辅助盲测中,Mythos5能自主选择结合位点、运行生物信息学工具并自我纠正错误,在14个蛋白质靶点中成功生成9个有效候选药物,药物设计速度提升10倍。

Mythos5是首个能提出科学假设的大型语言模型(LLM)。盲测对比显示,科学家在约80%的案例中更倾向于Mythos5的分子生物学假设(例如,其提出的大肠杆菌蛋白质新机制已独立验证)。在自主基因组研究中,Mythos5连续工作一周,整合了138种动物的单细胞数据并训练出自己的机器学习模型,其性能超越了《科学》杂志发表的模型,且体积小100倍。在ExploitBench网络安全基准测试中,Mythos5得分从预览版的69%升至78%(Opus4.8仅为40%),被誉为“全球最强网络安全模型”。

强大的性能伴随着成本的急剧增加。Fable5和Mythos5的定价为每百万输入令牌(MTok)10美元,每百万输出令牌50美元,几乎是Claude Opus4.8的两倍。在Claude.ai的订阅计划中,新模型将按双倍使用率计费。

为控制Mythos级别模型可能带来的网络攻击或生物武器等潜在风险,Anthropic在Fable5中集成了创新的分类器降级机制:如果系统检测到与网络安全、生物学、化学或“精炼(模型能力提取)”相关的危险触发词,它会自动将请求路由到较弱的Claude Opus4.8模型(影响不到5%的会话),并在界面上通知用户。对于旨在构建尖端大型模型(如预训练过程或分布式训练设计)的提示,系统不会直接阻止,而是通过提示修改、定向向量或参数高效微调(PEFT)等方式巧妙限制其输出效果。

在超过1000小时的外部测试中,测试人员未能找到通用的越狱方法,Fable5攻击任务的成功率为零。为应对新型攻击,Anthropic还增加了30天的数据保留期。

目前,Claude Fable5已通过Claude API和企业按量付费计划提供。它正逐步部署到Claude.ai的订阅计划(Pro、Max、Team等)中:即日起至2026年6月22日,订阅用户可免费体验Fable5;从2026年6月23日起,使用该模型将消耗使用积分。