C
发布于 2026/09/03 · 阅读 4

Claude Fable 5 和 Mythos 5 发布:最强通用模型亮相

  • #AI
  • #Claude
  • #Anthropic
  • #大模型
  • #人工智能
Claude Fable 5 和 Mythos 5 发布:最强通用模型亮相

公告

Claude Fable 5 和 Claude Mythos 5

2026年6月9日,我们正式推出 Claude Fable 5:一款经过安全处理、可安全用于一般用途的 Mythos 级1模型。

Fable 5 的能力超越了以往任何一款我们公开发布的模型。在几乎所有测试的 AI 能力基准测试中,它都达到了最先进的水平,在软件工程、知识工作、视觉、科学研究等领域表现出色。任务越长越复杂,Fable 5 相比其他模型的领先优势就越大。

发布如此强大的模型伴随着风险。如果没有安全防护,Fable 5 在网络安全等领域的强大能力可能被滥用,造成严重后果。因此,我们为模型配备了安全防护措施:当涉及某些主题的查询时,模型将改由我们的次强模型 Claude Opus 4.8 来回答。为了既安全又快速地发布,我们谨慎地调优了这些防护——它们有时会误伤无害请求,但平均而言,触发率低于5%的会话。随着未来几个月更强大模型的到来,我们将尽快改进防护并减少误报。

对于一小部分网络安全防御者和基础设施提供商,我们还推出了 Claude Mythos 5。它拥有与 Fable 5 相同的基础模型,但在某些领域解除了安全限制2。Mythos 5 将首先通过 Project Glasswing 与美国政府合作部署,作为 Claude Mythos Preview 的升级版。它拥有全球最强的网络安全能力。不久,我们计划通过更广泛的信任访问计划扩大 Mythos 5 的访问范围。

像 Fable 5 和 Mythos 5 这样的模型,其能力有可能为世界带来深远的益处。我们在 Project Glasswing 中已经看到了初步成果,模型帮助网络安全防御者保护了关键软件。在生命科学研究中,模型提出了新颖的假设并加速了新疗法的开发。

Fable 5 和 Mythos 5 的定价为每百万输入 token 10美元,每百万输出 token 50美元——不到 Claude Mythos Preview 价格的一半。今天的联合发布是我们迈向目标的一步:尽可能快速、安全地将先进 AI 能力带给更多用户。

评估 Claude Fable 5 和 Claude Mythos 5

下表比较了 Fable 5 和 Mythos 5 与其他领先模型的能力。Fable 5 和 Mythos 5 可以比之前的任何 Claude 模型更长时间地自主工作。下面我们讨论这些技能如何应用于软件工程,并涵盖模型在知识工作、视觉、记忆和生命科学研究方面的改进。

软件工程

在早期测试中,Stripe 报告称 Fable 5 将数月工程压缩至数天。在一个 5000 万行 Ruby 代码库中,该模型在一天内完成了代码库迁移,如果手动完成,整个团队需要两个多月的时间。Fable 5 也比过去的 Claude 模型更节省 token:在 Cognition 的 FrontierCode 评估中(测试模型能否在满足高质量生产代码库标准的同时通过困难编码任务),Fable 5 在中等努力下仍能获得最高分,领先于所有前沿模型。

知识工作

Fable 5 在复杂分析任务上表现强劲。在 Hebbia 的高级推理金融基准测试中,Fable 5 取得了所有模型中的最高分,在基于文档的推理、图表解读和问题解决方面均有大幅提升。IMC 指出,Fable 5 在其交易分析评估中几乎全面通过,包括事实查找、概念推理、根本原因分析和期望值分析。

视觉

Fable 5 是视觉任务的新 SOTA 模型。它可以从详细科学图表中提取精确数字,并能执行复杂的视觉任务,例如仅凭截图重建 Web 应用的源代码。它需要的脚手架也更少:例如,之前的 Claude 模型即使配备额外辅助工具也难以玩好《宝可梦 火红》,但 Fable 5 仅凭一个极简的纯视觉工具就通关了。

一段延时摄影:Claude 仅使用原始游戏截图从开始到结束游玩《宝可梦 火红》——没有地图、导航辅助或额外游戏状态信息。早期的 Claude 模型需要复杂的辅助工具才能玩《宝可梦》;Claude Fable 5 仅凭视觉就完成了游戏。

记忆与长上下文

Fable 5 能在跨越数百万 token 的长时间任务中保持专注,并通过自身笔记改进输出。当我们让模型玩牌组构建游戏《杀戮尖塔》时,给予其基于文件的持久性记忆,其性能提升是 Opus 4.8 的三倍;Fable 也以三倍于 Opus 的频率到达游戏最终幕。

示例演示

  • 日食模拟:Claude Fable 5 构建了太阳系模拟,从物理学第一原理推导行星轨道运动,并用它预测日食。
  • Factorio 自主游玩:Claude Fable 5 自主游玩工程师们喜爱的工厂建造游戏 Factorio,自行制定策略并建造自动化工厂。
  • VibeCAD:Claude Fable 5 在浏览器 CAD 编辑器中设计了一个完整的 3D 可打印模型。该编辑器本身也是由 Fable 5 创建的,包括内置的 AI 副驾驶来进行建模。
  • 古典电子混音流体模拟:Claude Fable 5 编写了一个流体模拟,其中运动与古典音乐电子混音的节拍同步——而这首混音也是 Claude Fable 5 用代码制作的,它从未听过音乐。

药物设计

使用 Mythos 5,我们的内部蛋白质设计专家将药物设计过程的某些方面加速了约十倍。在一个示例中,他们发现 Mythos 5 配合蛋白质设计和生物信息学工具,无需人类协助,即可与熟练的人类操作员匹敌甚至超越。在此过程中,模型执行了科学家通常完成的所有任务:选择结合位点、选择并运行蛋白质设计工具、以及在过程中从失败中恢复。这项研究中的 14 个蛋白质靶点中有 9 个(如下所示)产出了我们正在积极研究的强候选药物分子。

由 Mythos 5 设计的蛋白质复合体。靶点包括免疫检查点、生长因子和受体信号转导、神经退行性疾病、肌肉疾病以及更困难的结构靶点。

分子生物学中的新假设

Mythos 5 是我们第一个能够持续产生新颖、令人信服的科学假设的模型。在与 Opus 级模型的盲测对比中,我们的科学家约 80% 的时间更倾向于 Mythos 的分子生物学假设,并且已将其中几个推进到实验评估阶段。此外,一个关于大肠杆菌蛋白新机制的 Mythos 假设,已被独立研究同一问题的实验室在研究中证实。

基因组学新研究

Mythos 5 在超过一周的自主工作中进行了新颖的基因组学研究。它整合了涵盖 138 个动物物种的数百万细胞单细胞数据,并设计并训练了一个自定义机器学习模型,用于识别即使在远缘生物中执行相同角色的细胞。仅在高层次人类输入下,Mythos 5 训练的模型超越了最近发表在《科学》杂志上的模型——尽管大小只有其百分之一。我们计划在未来几个月内发布这些结果。

对齐性

在我们的自动对齐评估中,我们发现 Mythos 5 的不对齐行为水平(包括模型采取的不对齐行动,如欺骗,以及用户在滥用时与模型的合作)较低,与 Opus 4.8 相似。由于它们共享相同的基础模型,Fable 5 的对齐水平将类似。评估的完整描述以及一整套其他安全和能力测试,可在模型的系统卡片中找到。

自动对齐评估中不对齐行为的总体水平。详情见系统卡第 6.2.3.1 节。

早期用户反馈

获得早期访问权限的客户对 Fable 5 进行了自己的测试。以下摘录他们的话:

  • Claude Fable 5 是 CursorBench 上的 SOTA 模型。它开启了一类以前模型无法触及的长期规划问题。
  • 对于 GitHub 服务的开发者来说,Claude Fable 5 是真正的进步。在我们的早期测试中,它处理复杂、长期的编码任务时,自主性和可靠性超越了以往的基准。但最让我们兴奋的是它所指引的方向:开发者可以将越来越雄心勃勃的工作交给智能体,并信任其在软件生命周期中的结果。
  • 这是我们测试过的所有 Claude 模型中最强的结果。Claude Fable 5 在智能体编程和原型设计上迈出了清晰的一步。
  • Claude Fable 5 的推理能力明显超越了 Opus 4.8。它达到了高级研究科学家水平——选择方向、分配资源、摒弃错误信念,并产生基于第一原理的新颖输出。
  • Claude Fable 5 理解构建者的意图,而不仅仅是他们输入的文字。一年前需要上百次提示的应用,现在它一次性完成。当客户真正遇到瓶颈时,我们求助于它,以便快速帮助他们突破,完成他们想要构建的东西。
  • Claude Fable 5 给人的感觉有本质不同。在盲测中,我们的律师发现其红线建议每次都匹配或超越我们当前的模型。
  • 在最高努力级别下,Claude Fable 5 会反思并验证自己的工作。对我们来说,这就是实现高度自主操作的关键——额外的思考成本是值得的。
  • 与之前的模型相比,Claude Fable 5 能用更少的轮次实现更强的工程能力——能够处理员工每天在 Claude Code 中运行的多智能体工作流。
  • Claude Fable 5 是我们测试过的最强的金融优先模型,在通用金融和推理方面均表现出色。这是一个显著的进步。
  • Claude Fable 5 是第一个在核心分析基准测试(复杂、长期分析任务)中突破 90% 的模型——比 Opus 提高了 10 个百分点。在最难的问题上,它展现出强大的判断力和对细微差别的关注。
  • 在我们测试的前沿物理研究中,Claude Fable 5 是最强的模型,且仅使用了三分之一的推理 token。在 36 小时内它几乎达到了 GPT-5.5 四天后的水平。
  • 在端到端 Vibe-Coding 基准 ViBench 上,Claude Fable 5 是我们测试过的最高性能模型——几乎饱和了我们的基础用例,用更少的 token 和更少的时间构建应用。
  • Claude Fable 5 在我们日常电子表格套件上,无论努力程度如何都优于 Opus 4.8——并且轮次更少,运行完成速度提高 25-30%。

Claude Fable 5 的新安全防护

Mythos 级模型已经达到了存在显著风险的门槛。四月,我们启动了 Project Glasswing,将第一款 Mythos 级模型(Claude Mythos Preview)仅发布给有限的网络安全防御者和关键软件基础设施提供商。当时我们表示,只要我们开发出足够强大以可靠防止滥用的新安全防护,就希望最终向所有用户发布 Mythos 级能力。

在过去的几个月里,我们一直在改进这些防护,现在它们已经足够强大,可以进行广泛发布。由于我们将安全放在首位,我们特意谨慎地调整了防护,它们仍然比理想状态更严格——例如,有时无害的请求会触发我们的分类器。我们承认这会让一些用户感到沮丧,我们的目标是在发布后通过更新和优化防护来减少误报。

下面我们将逐一讨论 Fable 5 的新安全防护。我们更广泛的安全防护套件将在系统卡中讨论和评估。

4 阅读0 评论0 点赞

评论

登录 / 注册即可发布评论!
暂无评论,成为第一个发表评论的用户吧。