YouMind
ログイン

Opus 4.8 : 同じ価格で 、 2 倍の価値を

@shmidtqq
英語2026年5月30日
1.2M
215
18
33
516

TL;DR

Anthropic の Opus 4.8 は 、 エフォートコントロールや動的ワークフローなど 、 運用面で大幅なアップグレードを実現しました 。 ベンチマーク上の向上は控えめですが 、 真の価値は複雑なコーディングタスクにおけるトークン使用量と速度の最適化にあります 。

同じ価格。ほとんどの人はモデルを入れ替えるだけで、他のすべてを見逃してしまうでしょう。

shmidt - inline image

Opus 4.8 のリリースに伴い、Anthropic はベンチマーク数値以上に Claude Code での作業方法を変える 3 つの機能を提供しました。それは、努力制御、動的ワークフロー、そして安価な高速モードです。これらを適切に設定できた人は、より良い結果を得られ、コストも抑えられます。以下がその詳細です。

最も重要な数字

コーディングの 69.2% ではありません。重要なのは、4.8 は自身が書いたコードの欠陥を見逃す確率が約 4 分の 1 であることです。

古いモデルは、根拠が薄いまま「完了、バグ修正済み」と自信満々に言う傾向がありました。Anthropic は正直さを重視しました。4.8 はより頻繁にスピードを落とし、確信が持てない箇所を明示するようになりました。これは、もっともらしいコードを生成しても静かにエッジケースを壊すようなことを防ぐためです。長いセッションでは、この効果が積み重なります。15 ターン目に不確実性を認めるモデルは、40 ターン目での数時間のデバッグを節約してくれます。

変更点:概要

コーディング。

SWE-bench Verified: 87.6% → 88.6%(天井に近づいています)。

SWE-bench Pro(より難しく、汚染が少ない): 64.3% → 69.2%、GPT-5.5 より 10 ポイント以上リードしています。

これがコーディングにおける注目の数値です。

ターミナル。

Terminal-Bench 2.1: 66.1% → 74.6%(+8.5)ですが、GPT-5.5 が依然としてリードしています(78.2%)。7 つのベンチマークの中で、4.8 が負けた唯一のものです。

知識作業。

GDPval-AA: 1890 Elo vs GPT-5.5 の 1769。全テーブルの中で最も大きな差です。

コンピュータ操作。

OSWorld-Verified: 83.4%(この向上の一部は更新されたハーネスによるもので、Anthropic はそれを明らかにしています)。

科学。

GPQA Diamond: 93.6%、ほぼ横ばいです(両モデルとも 93% を超えており、これは飽和状態であり、後退ではありません)。

shmidt - inline image

Anthropic 自身も、このリリースを「控えめながらも確かな改善」と表現しています。ベンチマークはプラス要素です。以下の運用上の変更こそが、本当のストーリーです。

機能 1. 努力制御(最も過小評価されているもの)

Opus 4.8 はデフォルトで High 努力に設定されています。しかし、今ではタスクにどれだけの思考を割り当てるかを自分で決められます。これは、考えるためのマニュアルトランスミッションのようなものです。

claude.ai と Cowork では、スライダーがモデル選択の隣にあり、Low、Medium、High(デフォルト)、Extra、Max の 5 段階と、別の Thinking トグルがあります。Claude Code では、同じレベルに少し異なる名前が付いており、自動モードがあります:

注:「Extra」は claude.ai では Extra、Claude Code では xhigh と、名前が異なるだけで同じレベルです。

shmidt - inline image

混乱を避けるため、重要な点を。努力レベルごとに別途追加料金は発生しません。すべてのレベルで料金は同じです。入力トークン 100 万あたり $5、出力トークン 100 万あたり $25 です。違いはトークン単価ではなく、モデルが消費するトークン数です。Low は簡潔に答え、ほとんど考えません。Max は長く考え、数倍のトークンを消費します。つまり、Max が「より高価」なのは、レートのためではなく、ボリュームのためです。

同じタスクにおける相対的なコストの大まかな目安(直感的に理解するための例示的な数値):

具体的なコスト例。High の回答が約 $0.05 だとします。同じリクエストを Low で行うと約 $0.005 で済み、Max では簡単に約 $0.20~0.40 に達する可能性があります。プロンプトの 60% が小さな質問(「この関数は何を返すの?」)の場合、それらを High から Low に変更するだけで、毎日のコストを数分の一に削減でき、重要な部分では品質に影響を与えません。

これが最も請求額に影響する理由。ほとんどの人はすべてを High のままにするか、あるいは「安全のために」Max に上げて、スライダーを一切触らないでしょう。タスクごとに努力を振り分ける人は、同じ結果を著しく低いコストで得られます。これこそが、このリリースで最も過小評価されている機能です。

機能 2. 高速モード(3 倍安い)

高速モードは Opus を同じ品質で 2.5 倍の速度で実行し、以前より 3 倍安くなりました。

Claude Code で /fast と入力してトグルします(アクティブなセッションには ↯ アイコンが表示されます)。API アクセスは現在、順次提供中です(claude.com/fast-mode でウェイティングリストに登録)。

高速モードが適している場面:大規模な複数ファイルのリファクタリング、仕様書からのコード生成、ドキュメント作成、テスト生成。スピードが深さに勝る場面です。標準モードは以下に適しています:複雑なデバッグ、アーキテクチャの決定、セキュリティレビュー。思考の質がスピードに勝る場面です。

機能 3. 動的ワークフロー(大物)

Claude Code は、タスクのための JavaScript オーケストレーションスクリプトを作成し、セッションが応答性を保ったままバックグラウンドで実行します。計画はモデルのコンテキストではなくコード内に存在するため、最終的な回答のみがセッションに返されます。

公式ドキュメントからの重要なポイント:

  • 最大 16 のサブエージェントを同時実行可能、実行あたりの上限は 1,000。
  • 再開可能:ラップトップの電源が切れたり、ターミナルを閉じたりしても、中断したところから再開されます。
  • Claude Code v2.1.154+ が必要。リサーチプレビューです。
  • Max、Team、Enterprise ではデフォルトでオン。Pro では /config でオンにします(最初に Opus 4.8 に切り替えてください)。
  • サブエージェントは acceptEdits モードで実行され、ツールの許可リストを継承します。

/effort ultracode と入力してトリガーするか(Claude Code の設定:xhigh と自動ワークフローオーケストレーション)、または大きなタスクを言葉で説明するだけでも起動します:

shmidt - inline image

適している場面:200 以上のファイルにわたる移行、コードベース全体のセキュリティ監査、プロジェクト全体のテスト生成、大規模なリファクタリング、複数のリポジトリにわたる調査。適していない場面:単純なバグ修正、単一ファイルの編集、簡単な質問。大げさすぎます。

コストについて。ワークフローは通常のセッションよりもかなり多くのトークンを消費します。コストを抑える公式の方法は、タスクの範囲を限定することです。まず 1 つのフォルダで監査を実行し、生成されるサブエージェントの数を確認してから、本番実行を調整します。

ワークフローを完全に無効にするには:

Claude Code 設定例(スターターテンプレート)

環境変数(~/.zshrc または ~/.bashrc 内):

次に、安全なパーミッションを設定した settings.json が便利です。これにより、モデルがコードの読み取り、編集、テストの実行、コミットを行うことは許可しますが、危険な操作(.env や SSH キーの読み取り、rm -rf、sudo、git push)はハードブロックします。エージェントは自由に作業できますが、何かを壊したり漏洩したりすることはできません。

shmidt - inline image

すぐに使える settings.json ファイルは私の Telegram チャンネルにあります(フォーマットが大きく、ここで綺麗に読むには適していません):t.me/+JmDeelv5UCwwMTcy

shmidt - inline image

日常コマンドチートシート

Opus 4.8 のインストール:3 つの方法

A. ブラウザまたはアプリ。claude.ai でモデルリストから Claude Opus 4.8 を選択し、努力スライダーを設定します。インストールは不要です。

B. API。モデル ID は claude-opus-4-8。価格は 100 万トークンあたり $5/$25。コンテキストは最大 100 万(Microsoft Foundry では 20 万)、出力は最大 12 万 8 千。固定予算の拡張思考はサポートされていません。適応的思考(thinking: {type: "adaptive"})と努力パラメータを使用してください。

C. Claude Code(ターミナル)。ネイティブインストーラが現在推奨される方法です(npm はレガシー):

その後、claude を実行し、ブラウザでサインインして、/model で Opus 4.8 を選択します。

移行チェックリスト:4.7 から 4.8

  • モデル ID を claude-opus-4-8 に変更
  • 実際のタスクを 10~20 件、4.7 と 4.8 で同一のプロンプトを使用して実行
  • 比較:完了率、ステップ数、トークン数、テスト合格率
  • 4.7 の動作に合わせて調整されたプロンプトを確認
  • タスクタイプごとに努力レベルを割り当て
  • スピードが重要な場面で高速モードをテスト
  • Claude Code を v2.1.154+ に更新(ワークフロー用)
  • 1 週間後に API 請求額を再確認

セーブカード:すべてを 1 か所に

モデル: claude-opus-4-8 · リリース日: 2026-05-28

価格: $5 / $25(100 万トークンあたり) · 高速モード: $10 / $50

コンテキスト: 最大 100 万 · 出力: 最大 12 万 8 千

主要指標: SWE-bench Pro 64.3% → 69.2%(GPT-5.5 比 +10) · SWE-bench Verified 88.6% · バグ見逃し 4 分の 1 · GDPval-AA 1890 Elo

新機能: 努力制御 · 高速モード 3 倍安 · 動的ワークフロー(16 同時実行 / 実行あたり 1,000)

お読みいただきありがとうございます。1 つだけ覚えるなら、「タスクごとに努力を振り分ける」ことです。

Claude とバイブコーディングに関するその他のメモはこちらにあります:t.me/+JmDeelv5UCwwMTcy。

またお会いしましょう。

@shmidtqq。

ワンクリック保存

YouMindでバイラル記事をAI深読み

ソースを保存し、的を絞った質問をし、主張を要約して、バイラル記事を再利用できるノートに変えます。すべてを1つのAIワークスペースで行えます。

YouMindを探索
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る