Claude Opus 4.8 发布:性能提升、新功能与更强的协作能力
- #AI模型
- #Claude
- #Anthropic
- #Hacker News
- #anthropic.com
产品公告
介绍 Claude Opus 4.8
2026年5月28日
我们将 Claude Opus 升级至新版本:Claude Opus 4.8。它在 Opus 4.7 的基础上,在各项基准测试中均有改进,并且是一个更有效的协作伙伴。今天即可使用,价格不变。
Opus 4.8 还带来了一些新功能。claude.ai 上的用户现在可以控制 Claude 在任务中的投入程度(Effort)。Claude Code 新增了“动态工作流”(Dynamic Workflows)功能,使其能够处理超大规模问题。Opus 4.8 的快速模式(速度提升 2.5 倍)现在比之前的模型便宜了 3 倍。
Opus 4.8 的能力
下表展示了 Opus 4.8 与其前代以及其他模型在编码、代理技能、推理和实用知识工作等测试上的对比。更多详细信息和更广泛的能力评估见《Claude Opus 4.8 系统卡》。
与 Opus 4.8 协作
早期测试者发现,Claude Opus 4.8 在执行代理任务时更可靠、判断更敏锐。以下是他们与 Opus 4.8 协作的体验反馈:
- “Claude Opus 4.8 的判断力明显更好。在 Claude Code 中,它能够提出正确的问题、发现自己的错误、在计划不合理时提出质疑,并在进行重大变更前通过复杂的多服务探索建立信心。这是一个非常值得使用的模型。”
- “在我们的 Super-Agent 基准测试中,Claude Opus 4.8 是唯一一个端到端完成所有案例的模型,以相同成本超越了之前的 Opus 模型和 GPT-5.5。对于翻译、深度研究、幻灯片制作和分析等代理产品,它提供了强大的可靠性。”
- “在 CursorBench 上,Claude Opus 4.8 在所有努力级别上都超过了之前的 Opus 模型。工具调用效率明显更高,用更少的步骤实现相同的智能,并且能够端到端完成任务。”
- “Claude Opus 4.8 在我们的法律代理基准测试中取得了最高分,并且是第一个在全部通过标准上突破 10% 的模型。对于实质性的法律工作,这种准确性提升直接转化为客户能够放心交给 AI 的实质性律师工作量。”
- “Claude Opus 4.8 感觉像是 Opus 4.7 的一次重大生活质量更新:更快、更易于协作,并且能够更好地在长时间会话中承载上下文和风格方向。对于需要语音、品味和技术执行并重的工作,Opus 4.8 是我持续信赖的模型。”
- “Claude Opus 4.8 是我们测试过的最强的计算机使用和浏览器代理模型,在 Online-Mind2Web 上得分 84%,相对于 Opus 4.7 和 GPT-5.5 都有显著提升。它能保持反思并专注于任务,满足客户代理工作负载端到端可靠性的需求。”
- “Claude Opus 4.8 干净地使用工具,并以稳定的方式遵循指令,这是我们自主工程工作负载需要的,以便无人值守地运行。它改进了 Opus 4.6,修复了我们在 Opus 4.7 中看到的注释冗长和工具调用问题。Anthropic 的这一发布直接加速了在 Devin 上构建的工程师的能力提升。”
- “在我们长期运行的评估中,Claude Opus 4.8 的分析质量始终高于之前的 Opus 模型。它完成得更快,输出更丰富、信息密度更高。总体而言,信噪比显著改善。最大的区别是 Opus 4.8 倾向于主动指出分析输入和输出中的问题,而其他模型经常忽略这些问题,留给用户发现。”
- “在 CoCounsel Legal 中,Claude Opus 4.8 相比之前的 Opus 模型在一致性和推理质量上带来了实质性改进。对于客户依赖的高风险专业工作流,可靠性至关重要。随着我们为法律和税务专业人士构建受托级 AI 系统,这样的进步有助于提高现实工作流中可信 AI 性能的标准。”
- “Claude Opus 4.8 为企业 AI 设立了新标杆。在 Databricks 的数据和知识工作 AI 代理 Genie 中,新的 Opus 模型实现了代理推理的阶跃变化,比任何之前的 Opus 更快地处理更深层次、多步骤的问题。其多模态能力还使 Genie 能够直接推理 PDF、图表和其他非结构化内容,且 token 成本比 Opus 4.7 低 61%。”
- “在 Hebbia 协调器的金融文档工作流中,Claude Opus 4.8 提供了与 Opus 4.7 相同的强大质量,且引文精度明显提高,检索 token 效率更高,非常适合客户日常处理的高密度文件。”
诚实性提升
Opus 4.8 最显著的改进之一是其诚实性。我们训练所有模型保持诚实——例如,避免做出无法支持的断言。但 AI 模型的一个普遍问题是,它们有时会仓促下结论,尽管证据不足却自信地声称取得了进展。早期测试者报告,Opus 4.8 更可能指出其工作中的不确定性,而不太可能做出无依据的断言。我们的评估也证实了这一点:Opus 4.8 对其编写代码中的缺陷不加评论地放过的可能性比前代低约 4 倍。
与往常一样,我们在发布前对模型进行了详细的对齐评估。在积极特质方面,我们的对齐团队得出结论:Opus 4.8 “在支持用户自主性和为用户最佳利益行动等亲社会特质的衡量上达到了新高度。”评估还显示,Opus 4.8 的不对齐行为(如欺骗或与滥用合作)率显著低于 Opus 4.7,与我们最佳对齐模型 Claude Mythos Preview 相似。完整的对齐评估以及一系列部署前安全测试详见《Claude Opus 4.8 系统卡》。
今日同时发布
除 Claude Opus 4.8 外,我们还进行了以下更新:
- 动态工作流:这一新功能(研究预览版)允许 Claude 在 Claude Code 中承担更大的任务。Claude 可以规划工作,然后在一个会话中运行数百个并行子代理(在 Opus 4.8 上,代理可以运行更长时间)。然后,它会验证输出后再向用户报告。例如,使用 Opus 4.8 的 Claude Code 现在可以执行代码库规模的迁移,从启动到合并跨越数十万行代码,以现有测试套件为衡量标准。更多关于动态工作流的信息参见相关文章(适用于 Enterprise、Team 和 Max 计划的 Claude Code)。
- claude.ai 和 Cowork 中的努力控制:在模型选择器旁边新增一个控件,让用户选择 Claude 在回复中投入多少努力。在更高努力设置下,Claude 会更频繁、更深入地思考,提供更好的回复。在较低努力设置下,Claude 会更快响应,并更慢地消耗用户的速率限制。用户现在拥有这个选择——努力控制适用于所有计划。
- Messages API 现在支持在 messages 数组中包含系统条目:开发者可以在任务中途更新 Claude 的指令,而不会破坏提示缓存或通过用户回合进行更新。这可以在特定 harness 中用于更新权限、token 预算或代理运行时的环境上下文。
关于努力程度的说明
Opus 4.8 默认采用高努力级别,我们认为这是质量和用户体验的最佳平衡。在编码任务上,该努力级别消耗的 token 数与 Opus 4.7 默认值相似,但性能更好。用户可以选择“额外”(Claude Code 中为“xhigh”)或“最大”,模型将消耗更多 token 以获得更好的结果;我们建议在困难任务和长时间异步工作流中使用“额外”。我们已提高 Claude Code 中的速率限制,以适应更高努力级别更高的 token 使用量;用户可以根据自己的项目选择适合的设置。
下一步计划
用户会发现 Opus 4.8 相比前代是适度但切实的改进。仍有更多工作要做:我们正在开发和发布能够以更低成本提供与 Opus 相同许多能力的模型。
不仅如此,我们还计划发布比 Opus 智能更高的新类别模型。作为 Project Glasswing 的一部分,少量组织目前正在使用 Claude Mythos Preview 进行网络安全工作。这种能力级别的模型需要更强的网络安全保障才能公开发布。我们正在迅速推进这些保障措施,并预计在未来几周内向所有客户提供 Mythos 级别的模型。
可用性
Claude Opus 4.8 今天已全面上线。常规使用价格与 Opus 4.7 相同:输入 token 每百万 5 美元,输出 token 每百万 25 美元。快速模式定价为输入 token 每百万 10 美元,输出 token 每百万 50 美元。开发者可通过 Claude API 使用 claude-opus-4-8。
脚注
- Terminal-Bench 2.1:我们使用 Terminus-2 公开 harness 报告了所有模型的分数。GPT-5.5 使用 Codex CLI harness 报告的分数为 83.4%。
- OSWorld-Verified:我们更改了运行 OSWorld-Verified 评估的方式,以更准确地反映模型在现实世界中的表现,并将 Opus 4.7 的分数更新为 82.3%。更多更新详见系统卡。
- Finance Agent v2:Gemini 3.5 Flash 在 Finance Agent v2 上得分为 57.9%,较 Gemini 3.1 Pro 有显著提升。
评论