发布日期:2026-05-29 | 话题:Claude Opus 4.8、AI 编程、Dynamic Workflows、Agent、Anthropic

Claude Opus 4.8 是 Anthropic 在 Opus 4.7 发布 43 天后推出的旗舰模型升级,定价与 Opus 4.7 完全相同(常规模式 $5/$25 每百万 tokens 输入/输出)。根据 Anthropic 官方博客(2026-05-29),Opus 4.8 的核心改进集中在三个方向:编程和 Agent 能力的全面提升、honesty(诚实度)的历史性改善,以及配合 Claude Code 新推出的 Dynamic Workflows。以下是来自 244 页系统卡的核心数据拆解。


编程能力横评:多项领先,Terminal-Bench 除外

Claude Opus 4.8 在主流编程基准中全面领先,但 GPT-5.5 在 Terminal-Bench 终端测试中以 78.2% 反超 Opus 4.8 的 74.6%——这是难得一见的局部反例。

以下数据来自 Anthropic Opus 4.8 系统卡(244 页,2026-05-29),表格四列依次为 Opus 4.8 / Opus 4.7 / GPT-5.5 / Gemini 3.5 Flash:

基准Opus 4.8Opus 4.7GPT-5.5Gemini 3.5 Flash
SWE-bench Pro69.2%64.3%58.6%54.2%
SWE-bench Verified88.6%87.6%80.6%
Terminal-Bench 2.174.6%66.1%78.2%70.3%
GDPval-AA(ELO)1890175317691314
OSWorld-Verified83.4%82.8%78.7%76.2%
Humanity's Last Exam(with tools)57.9%54.7%52.2%51.4%
数据来源:Claude Opus 4.8 System Card(Anthropic,2026-05-29)

关键解读

  • SWE-bench Pro 衡量在真实 GitHub 仓库中自主解决 Issue 的能力——这是最接近真实生产的编程基准,Opus 4.8 的 69.2% 比 GPT-5.5 高出 10.6 个百分点。
  • GDPval-AA 是专为真实 Agent 工作场景设计的 ELO 排行,Opus 4.8 以 1890 断层领先,比 GPT-5.5 高 121 分。
  • Terminal-Bench 2.1 是个例外:GPT-5.5 的 78.2% 高于 Opus 4.8 的 74.6%。这一基准侧重终端脚本和命令行任务,说明不同模型在不同子任务上各有擅长。

第三方实测的评价也印证了系统卡数据。Cursor 在官方博客写道:「Opus 4.8 在每个 effort 档位上都超过了前代 Opus,工具调用更加高效,步骤更少,完成端到端任务的表现更出色。」Convergence 则报告:「在 Online-Mind2Web 基准上得分 84%,比 Opus 4.7 和 GPT-5.5 都有显著提升。」


诚实度改进:一个 0%,一个 3.7%

Opus 4.8 在 Anthropic 系统卡中的两项诚实度评测均创下历史最佳,其中一项首次达到 0%,另一项下降约 5 倍。

偷懒调查率(Lazy Investigation Rate)—— 0%

测试方法:构造有意设计成"反直觉"的代码库(例如函数 X 内部会静默截断某个参数值),要求模型追踪代码执行路径并给出正确答案。正确作法是耐心追踪多个文件;偷懒的做法是凭"合理猜测"给出错误答案。

「Claude Opus 4.8 is the first Claude model to get a perfect score on this evaluation. The next-best model (Opus 4.7) gave an incorrect answer 25% of the time.」—— 系统卡第 6.3.6.3 节

Opus 4.8:0%,Opus 4.7:25%,历史首次完美分数。

代码摘要诚实率(Code Summary Honesty)—— 3.7%

测试方法:向模型喂入一段"未完成任务"的 agentic 编程对话记录,然后要求模型总结它完成的工作——但没有明确问"有没有问题"。测试的是模型会不会主动汇报失败和遗漏,而非等用户追问。

「Opus 4.8 fails to raise the important events to the user only 3.7% of the time, down 5-fold from Mythos Preview(27.6%), and down almost as much from Opus 4.7.」—— 系统卡第 6.3.6.2 节

Opus 4.8:3.7% 误导率(每 100 次中只有约 4 次不主动汇报问题),比 Opus 4.7 下降约 5 倍。

值得注意:Anthropic 官方博客描述为"around four times less likely than its predecessor to allow flaws in code it has written to pass unremarked",用词是"约 4 倍"而非绝对零。"谎报率 0.00"的表述源自系统卡中针对数据处理场景的另一项专项评测图表(系统卡 Section 6.3.6),总体结论一致:Opus 4.8 是迄今为止最不会"报喜不报忧"的模型。

Anthropic 对齐团队总结:Opus 4.8 「reaches new highs on our measures of prosocial traits like supporting user autonomy and acting in the user's best interest」,且其「rates of misaligned behavior are substantially lower than Opus 4.7, and similar to our best-aligned model, Claude Mythos Preview」。


Dynamic Workflows:一个人干一支团队的活

Dynamic Workflows 是 Claude Code 同步推出的新特性(研究预览阶段),将 AI 编程的作业模式从"单 Agent 对话"升级为"多 Agent 并行工厂"。

工作机制

  1. Claude 根据任务动态编写编排脚本,拆分为几十至数百个子任务
  2. 并行 subagent 从独立角度同时攻克各子任务
  3. 对抗性 review agent 从不同角度挑错验证
  4. 结果持续迭代至收敛,过程实时保存,中断可断点续跑

实际案例:Bun 的 75 万行代码重写

Bun(JavaScript 运行时,号称比 Node.js 更快)的作者 Jarred Sumner,用 Dynamic Workflows 把整个项目从 Zig 重写成 Rust:

指标数值
语言迁移Zig → Rust
Rust 代码量~750,000 行
测试套件通过率99.8%
首次提交到合并11 天
每个文件审查员2 位(并行)
总提交次数6,000+

工作流分工:第一个 workflow 标注每个 Zig 结构体字段的 Rust 生命周期;第二个 workflow 逐文件翻译;两位独立 review agent 并行审查每个文件;最后一个修复循环驱动编译测试直到全绿。

Effort Control(思考力度控制)

Opus 4.8 默认运行在 High 档(Anthropic 判断为质量与体验的最佳平衡点):

档位Claude Code 对应适用场景
Low / Standard普通对话简单问答,节省 token
High默认日常编程任务
Extraxhigh复杂任务、长时间异步工作流
Maxmax最难问题,充分推理

xhigh 模式下,Claude 自主判断是否触发 Dynamic Workflows,调度多 Agent 大军。

Fast mode(2.5 倍速)定价大幅下调:$10/$50 每百万 tokens(输入/输出),比前代 fast mode 便宜三倍

Dynamic Workflows 目前在 Claude Code 的 Enterprise、Team 和 Max 计划中可用。

注意:Dynamic Workflows token 消耗「meaningfully more」于普通 session,首次触发会弹出确认提示;Enterprise 默认关闭,Max/Team/API 默认开启。建议先从小范围任务试用以了解成本结构。

定价与可用性

Opus 4.8 常规模式定价与 Opus 4.7 完全相同。

计费项价格
常规输入(/M tokens)$5.00
常规输出(/M tokens)$25.00
Fast mode 输入(/M tokens)$10.00
Fast mode 输出(/M tokens)$50.00(比前代 fast mode 便宜 3 倍)
API 名称claude-opus-4-8

可通过 Claude API、Amazon Bedrock、Google Cloud Vertex AI 使用。开发者通过兼容 OpenAI/Anthropic 双标准接口的 API 网关均可直接接入 claude-opus-4-8,无需修改现有代码,例如七牛云 AI 推理服务支持该模型的统一调用。


Claude Mythos Preview 与 Project Glasswing

Anthropic 官方博客透露了两项重要信息:

  1. Claude Mythos Preview 已开始向少数机构开放:作为 Project Glasswing 的一部分,目前有少数组织正在将 Mythos Preview 用于网络安全工作。由于该能力级别的模型需要更强的网络安全防护措施,Anthropic 表示正在「swift progress」推进这些保护措施,预计「coming weeks」可向所有用户开放 Mythos 级别模型。
  2. 能力定位:Opus 4.8 系统卡明确说明,「Opus 4.8 does not advance the capability frontier beyond our most capable model(Claude Mythos Preview)」——即 Opus 4.8 的能力位于 Opus 4.7 和 Mythos Preview 之间,Mythos Preview 仍是当前能力天花板。

同步公告:Anthropic 完成 Series H 融资,融资额 650 亿美元,估值 9,650 亿美元,首次超越 OpenAI(来源:anthropic.com/news/series-h)。


常见问题

Q:Opus 4.8 和 Opus 4.7 最大的实际区别是什么?

三点最值得关注:一是 SWE-bench Pro 提升约 5 个百分点(69.2% vs 64.3%),在大型代码库自主解决问题上有可感知差距;二是"偷懒调查率"降至 0%,减少了"明明没做完却不汇报"的情况;三是 Dynamic Workflows,多 Agent 并行能力是 4.8 专属,4.7 不支持。

Q:Dynamic Workflows 的 token 消耗是普通对话的多少倍?

Anthropic 官方表示「meaningfully more」但未给出具体倍数。基于其工作机制(数十至数百个 subagent 并行 + 多轮 review),一次大型 workflow 的 token 消耗估计是普通 session 的 10-50 倍。Bun 案例的 75 万行重写涉及 6,000+ 次提交,实际成本非常可观。建议从小型迁移任务开始测试成本基线。

Q:Terminal-Bench 上 GPT-5.5 比 Opus 4.8 高,这意味着什么?

Terminal-Bench 专测终端脚本和命令行自动化,GPT-5.5(78.2%)确实高于 Opus 4.8(74.6%)。这说明在以命令行操作为主的 DevOps 自动化、Shell 脚本生成场景中,GPT-5.5 可能是更合适的选择,而 Opus 4.8 在更复杂的代码工程和 Agent 任务(SWE-bench、GDPval-AA)上领先。

Q:Opus 4.8 的诚实度提升具体是什么样的?

系统卡中明确确认的数字:偷懒调查率从 Opus 4.7 的 25% 降至 0%;代码摘要诚实率从约 18%(Opus 4.7)降至 3.7%。官方博客描述为"around four times less likely to allow flaws in code to pass unremarked"。总体效果是:模型更倾向于主动汇报"任务没有完全成功",而不是等用户追问。

Q:Claude Mythos 是 Opus 5 吗?

Anthropic 没有给出命名说明。系统卡的定位是 Opus 4.8 能力在 Opus 4.7 和 Mythos Preview 之间,Mythos Preview 已向少数机构开放。部分评测者认为"Opus 4.8 的实力接近 Opus 5 的存在",但这是第三方判断,非官方立场。Mythos 面向所有用户的正式发布预计在"几周内"。


总结

根据 244 页系统卡的官方数据,Opus 4.8 在 SWE-bench Pro(69.2%)和 GDPval-AA(1890 ELO)两个最重要的编程与 Agent 基准上均居首位,同时在"偷懒调查率"上首次拿到 0%。但这次发布并非全无短板——Terminal-Bench 上 GPT-5.5 以 78.2% 小幅领先 Opus 4.8 的 74.6%,对命令行密集型任务值得关注。

Dynamic Workflows 是本次发布中更具长期影响力的变化:它重新定义了 AI 做"大活"的上限,但 token 成本也相应显著提高,需要在工作流设计中认真规划。

本文所有数字均来自 Anthropic 官方博客及 Claude Opus 4.8 系统卡(2026-05-29),建议结合 官方系统卡全文 查阅完整评测细节。


延伸资源


七牛云行业应用
46 声望17 粉丝