YouMind
登录

Opus 4.8:价格不变,性能翻倍

@shmidtqq
英语2026年5月30日
1.2M
215
18
33
516

TL;DR

Anthropic 推出的 Opus 4.8 带来了显著的运行升级,包括工作量控制和动态工作流。虽然基准测试显示提升幅度适中,但其真正的价值在于优化复杂编码任务中的 Token 使用率和响应速度。

相同价格。大多数人只会换模型,而忽略其他所有变化。

shmidt - inline image

与 Opus 4.8 一同发布的,Anthropic 还带来了三个比基准测试数字更能改变你在 Claude Code 中工作方式的功能:精力控制、动态工作流和更便宜的快速模式。正确配置这些功能的用户能获得更好的结果并花费更少。以下是详细解析。

最重要的一个数字

不是编码能力上的 69.2%。而是 4.8 在自己编写的代码中遗漏错误的可能性降低了约 4 倍。

老款模型喜欢自信地说"完成,bug 已修复",但证据不足。Anthropic 在"诚实"上下了功夫:4.8 更频繁地放慢速度,并在不确定的地方进行标记,而不是生成看似正确但会静默破坏边缘情况的代码。在长时间会话中,这种效应会累积。一个在第 15 轮承认不确定性的模型,能为你节省在第 40 轮时数小时的调试时间。

变化一览:简短版

编码能力。

SWE-bench Verified:87.6% → 88.6%(接近上限)。

SWE-bench Pro(更难,受污染更少):64.3% → 69.2%,领先 GPT-5.5 超过 10 个百分点。

这是编码方面的核心数据。

终端能力。

Terminal-Bench 2.1:66.1% → 74.6%(+8.5),但 GPT-5.5 仍领先(78.2%)。七个基准测试中唯一 4.8 失利的一项。

知识工作。

GDPval-AA:1890 Elo 分 vs GPT-5.5 的 1769 分。整个表格中差距最大的一项。

计算机使用。

OSWorld-Verified:83.4%(部分提升来自更新的测试工具,Anthropic 已公开说明)。

科学能力。

GPQA Diamond:93.6%,基本持平(两个模型都超过 93%,这是天花板饱和,并非退步)。

shmidt - inline image

Anthropic 自己称这次发布是"适度但切实的改进"。基准测试成绩是加分项。下面的操作变更才是真正的重头戏。

功能 1:精力控制(最被低估的功能)

Opus 4.8 默认设为"高"精力。但现在你可以决定它投入多少思考来完成任务。可以把它看作推理的手动变速箱。

在 claude.ai 和 Cowork 中,滑块位于模型选择器旁边,有五个级别:低、中、高(默认)、额外、最大,外加一个独立的思考开关。在 Claude Code 中,级别相同但名称略有不同,并且有一个自动模式:

注意:claude.ai 中的"额外"和 Claude Code 中的 xhigh 是同一个级别,只是不同界面上标签不同。

shmidt - inline image

为了避免混淆,直接说重点。不同精力级别没有单独的附加费用。每个级别的费率相同:每 1M 输入 token 5 美元,每 1M 输出 token 25 美元。区别不在于每 token 的价格,而在于模型消耗的 token 数量。低级回答简短,思考很少;最高级思考时间长,消耗的 token 多出好几倍。所以"最高级更贵"是因为 token 总量,而不是费率。

同一任务相对成本的粗略指南(数字仅为示意,帮助理解):

一个实际的费用例子。假设一个"高"精力回答花费约 0.05 美元。同样的请求在"低"精力下大约花费约 0.005 美元,而在"最高级"下很容易达到约 0.20-0.40 美元。如果你 60% 的提示都是小问题(比如"这个函数返回什么?"),将它们从"高"降到"低",每日花费就能削减数倍,而在关键之处不会损失质量。

为什么这对账单影响最大。大多数人会让所有任务保持"高"(或者为了"保险"直接调到"最高级"),并且从不碰那个滑块。而根据任务分配精力的用户,在获得相同结果的同时花费明显更少。这是本次发布中最被低估的功能。

功能 2:快速模式(便宜 3 倍)

快速模式以 2.5 倍速度运行 Opus,质量相同,而且现在比以前便宜 3 倍。

在 Claude Code 中用 /fast 切换(活跃会话会显示 ↯ 图标)。API 访问目前需申请(waitlist 在 claude.com/fast-mode)。

快速模式适用于:大型多文件重构、根据规格生成代码、编写文档、生成测试。任何速度优于深度的场景。标准模式适用于:复杂调试、架构决策、安全审查。任何思考质量优于速度的场景。

功能 3:动态工作流(最重要的功能)

Claude Code 现在会为你的任务编写一个 JavaScript 编排脚本,并在后台运行它,同时你的会话保持响应。计划存在于代码中,而非模型的上下文中,因此只有最终答案会返回给你的会话。

需要了解的信息,来自官方文档:

  • 最多 16 个并发子 Agent,每次运行硬性上限为 1,000 个。
  • 可恢复:如果你的笔记本断电或关闭终端,运行会从停止的地方继续。
  • 需要 Claude Code v2.1.154+。研究预览版。
  • 在 Max、Team、Enterprise 套餐上默认开启。在 Pro 套餐上,需要在 /config 中开启(并先切换到 Opus 4.8)。
  • 子 Agent 在 acceptEdits 模式下运行,并继承你的工具白名单。

通过 /effort ultracode(Claude Code 设置:xhigh 加上自动工作流编排)触发,或者只需用语言描述一个大型任务:

shmidt - inline image

适用于:跨 200+ 个文件的迁移、全代码库安全审计、项目级测试生成、大型重构、跨多个仓库的研究。不适用于:简单的 Bug 修复、单文件编辑、快速问题。大材小用。

关于成本。工作流消耗的 Token 比普通会话多得多。官方控制花费的方法是限定任务范围:先对一个文件夹进行审计,看看它会产生多少个子 Agent,然后据此校准大规模运行。

要完全禁用工作流:

Claude Code 配置示例(入门模板)

环境变量(放在 ~/.zshrc 或 ~/.bashrc 中):

然后是实用的部分:一个具有安全权限的 settings.json。它允许模型读取和编辑代码、运行测试和提交,但硬性阻止危险操作:读取 .env 和 SSH 密钥、rm -rf、sudo 和 git push。Agent 可以自由工作,但不会破坏任何东西或泄露任何东西。

shmidt - inline image

可直接粘贴的 settings.json 文件在我的 Telegram 频道中(此处格式太大,无法清晰阅读):t.me/+JmDeelv5UCwwMTcy

shmidt - inline image

每日命令速查表

安装 Opus 4.8:三种方式

A. 浏览器或应用。在 claude.ai 上,从模型列表中选择 Claude Opus 4.8 并设置精力滑块。无需安装。

B. API。模型 ID claude-opus-4-8。价格 $5/$25 每 1M。上下文最多 1M(Microsoft Foundry 上 200k),最多 128k 输出。不支持的固定预算扩展思考:使用自适应思考(thinking: {type: "adaptive"})和 effort 参数。

C. Claude Code(终端)。原生安装器现在是推荐方法(npm 是旧版):

然后运行 claude,通过浏览器登录,并使用 /model 选择 Opus 4.8。

迁移检查清单:从 4.7 到 4.8

  • 将模型 ID 更改为 claude-opus-4-8
  • 用相同的提示词在 4.7 和 4.8 上运行 10-20 个你的真实任务
  • 比较:完成率、步骤数、Token 数、测试通过率
  • 检查针对 4.7 行为调优的提示词
  • 按任务类型分配精力级别
  • 在速度重要的地方测试快速模式
  • 将 Claude Code 更新到 v2.1.154+(用于工作流)
  • 一周后重新检查 API 账单

速查卡:所有信息一览

模型:claude-opus-4-8 · 发布时间 2026-05-28

价格:$5 / $25 每 1M · 快速模式 $10 / $50

上下文:最多 1M · 最多 128k 输出

关键数据:SWE-bench Pro 64.3% → 69.2%(领先 GPT-5.5 超 10%)· SWE-bench Verified 88.6% · 遗漏 Bug 减少 4 倍 · GDPval-AA 1890 Elo

新增功能:精力控制 · 快速模式便宜 3 倍 · 动态工作流(16 并发 / 每次运行 1,000 个)

感谢阅读。如果你想从这篇文章中带走什么,那就是:"根据任务分配精力"。

我关于 Claude 和 AI 编码的其他笔记都在这里:t.me/+JmDeelv5UCwwMTcy。

那里见。

@shmidtqq。

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章