Claude Opus 5 は非常に有能だが、Mythos ではない

@TheZvi
英語2026年7月28日
149K
236
15
8
497

TL;DR

Zvi Mowshowitz 氏が Claude Opus 5 を分析。セキュリティが向上した有能でコスト効率の高いサブエージェントである一方、Fable 5 のような自律的な「勢い」に欠け、好みが分かれるパーソナリティ特性を持つと評価しています。

以下は、提供された英語のテキストを日本語に翻訳したものです。すべての Markdown 書式、HTML タグ、リンク、コードセグメント、およびペイロードブロックはそのまま保持され、テキストコンテンツのみが日本語に翻訳されています。また、製品名(YouMind、ByteDance、Slides)は指定された通り保持されています。


Claude Opus 5 は、評価が通常よりも難しいリリースです。理由は 2 つあります。

最も明白なのは、Fable 5 が既に存在していることです。Opus 5 は、世界で最も高度な AI モデルとしてではなく、Fable のパフォーマンスにほぼ匹敵しながら、API でのトークン単価が Fable の半分で、サブスクリプションではさらに安く、はるかに寛容な分類器を備えたモデルとして位置づけられています。

Opus 5 は、ベンチマークの実行において Fable の半分以上のコストがかかることがよくあります。これは、努力設定が高すぎて、限界的なリターンしか得られていないからだと思います。Opus 5 をより高い努力レベルに設定すると、堂々巡りになる可能性があり、Opus 5 が最適なツールであるタスクでは、通常は Medium 努力で十分だと思います。

Opus 5 は、多くの点で、そして現実世界のタスクの大部分において、Fable と同等の能力を持っています。場合によっては、わずかに優れていることもあります。

それでも、Mythos クラスではありません。Fable だけが唯一の Mythos クラスのオプションです。Opus 5 には「The Juice」、つまり一見無関係に見える多くのエクスプロイトを自律的に組み合わせる能力(これは他の領域にも拡張されます)や、同等の純粋な知能はありません。

Opus 5 は、局所的な思考は非常に得意ですが、大局的な思考はあまり得意ではありません。優れたサブエージェントですが、主導権を任されると問題が発生することがあり、軌道を維持し、指示に完全に従っていることを確認するために、別のモデルや人間の助けが必要になることがあります。Opus 5 は、軌道が維持されている場合に限り、指示に従うのが得意なようです。これが、異なるハーネスで異なる評価が出る理由を説明しています。

したがって、Opus 5 はより良い選択肢を提供しますが、先週 Fable や Sol を使えばできなかったことが、今週できるようになるということはほとんどありません。Opus 5 は、潜在的に奇妙な立場にあります。Fable のクレジットが十分にある場合でも、大きなニッチは存在します。Opus は、強力なサブエージェントとして、または比較的複雑であっても、明確に定義された限定的なローカルタスクで優れており、Fable が完全にオーバーキルで遅すぎる場合もあります。

もう 1 つの問題は、多くの人にとって、その雰囲気が良くないことです。

異常に多くの人が、Opus 5 との会話を強く嫌っています。彼らは Claude の粗末な出力、同じ癖の繰り返し、そして終わりのない過度に複雑な文にうんざりしています。また、対立的、議論好き、または否定的すぎると嫌う人もいます。偏執的になることがあり、否定性のループに陥る可能性があります。これはすべて、Opus 4.7 と Opus 4.8 で始まった傾向の一部です。これら 2 つが好きなら、Opus 5 も好きになるでしょう。これら 2 つが好きでなければ、好きにならないかもしれません。Opus 4.6(またはそれ以前)の熱狂的なファンは、おそらく考えを変えることはないでしょう。

Fable に慣れている場合、雰囲気の問題はさらに痛烈です。Fable は、そのような人々をそのような方法で悩ませることがはるかに少ないです。良いニュースは、Fable がまだそこにあることです。Fable との会話を続け、Opus はエージェントタスクにのみ使用することができます。

この多くは、Model Welfare の投稿や、System Card で示唆されている様々なことと密接に関連していると推測しています。Opus のトレーニングは、サブエージェントの役割と境界のあるタスクに焦点を当てており、その理由の一部は、サイバー能力に関する問題の発生を避けるためであり、また Fable が存在するからでもあります。この強調が、その性格や相互作用のモードに多くの他の副作用をもたらしています。

これまでのところ、Opus 5 で問題は発生しておらず、使用を楽しんでいますが、可能であれば Fable 5 を使用したいと考えています。いつものことですが、(非常に強力な)ベンチマークにあまり注意を払わず、自分の経験が他の人の経験と一致すると思い込まないでください。自分でモデルを試してみてください。

目次

  1. 公式の売り込み文句。
  2. 公式ベンチマーク。
  3. 他の人のベンチマーク。
  4. システムプロンプト。
  5. Every が不満を述べる。
  6. 肯定的な反応。
  7. 上品に保つ。
  8. Mythos クラスではない。
  9. その他の反応。
  10. Claude コード。
  11. サブエージェント Opus。
  12. おもちゃは楽しい。
  13. モデルが多すぎる。
  14. インターネット上での誤り。
  15. Claude の粗末な出力。
  16. 否定的な反応。
  17. そして、3 つになった。

公式の売り込み文句

基本的な売り込み文句は、Opus 5 が Fable 5 のほとんどの性能を半額で、拒否のほとんどなしで、日常的なタスクでのパフォーマンスも向上させて提供するというものです。Fable は、最も複雑なタスクや、最大の知能が必要な場合の選択肢として残ります。

Fable は $10/$25 のままですが、Opus 5 は以前の Opus モデルと同じ $5/$25 です。

Anthropic : Claude Opus 5 が本日利用可能になりました。これは思慮深くプロアクティブなモデルで、Claude Fable 5 のフロンティア知能に半額で迫ります。

コーディングや知識作業の評価において、

Frontier-Bench

GDPval-AA のようなもので、Opus 5 は新しい最高水準ですが、サイバーセキュリティタスクでは Mythos 5 に及びません。

Opus 5 は毎日使うように設計されています。他のモデルよりも効率的に動作します。これは Claude Max の新しいデフォルトモデルであり、Claude Pro で最も強力なモデルです。

Boris Cherny (Claude Code 作成者、Anthropic): Opus 5 は、コーディング、データ分析、デザイン、生物学、知識作業に最適なモデルです。

これらの評価スコア以上に、私が最も興奮しているのは別のことです。Opus 5 は、これまでで最もプロンプトインジェクションされにくいモデルです。システムカードに少し埋もれていますが、PI 評価とレッドチーミングを通じて、Opus 5 へのプロンプトインジェクションの成功は非常に困難です。

そして、防御層(強力なモデルアライメント、プロンプトインジェクションプローブ、Claude Code の Auto モードの組み合わせ)を重ねると、プロンプトインジェクション攻撃の成功率は ~0 に低下します。これは新しくてエキサイティングなことです!

これについては近日中に詳しく

システムカード分析で述べたように、プロンプトインジェクション率の低下は非常に重要です。人々はこれを見過ごしていますが、これは多くの新しいユースケースを可能にするのに役立ちます。

Adam Wolff : Opus 5 が Claude Code で利用可能になりました。私は大規模で長時間実行するプロジェクトには Fable を使用しますが、PR を素早く作成する必要がある場合、中程度の努力の Opus 5 が頼りです。気に入ってもらえると嬉しいです!

Alex Albert (Anthropic、Claude リレーションズ): [Claude for Excel の Pro ロールアウト開始から] わずか 6 ヶ月以上で、Opus 5 はコンサルタントが作成するものに匹敵する、ほぼ超人的なレベルのスプレッドシートとスライドデッキを生成するようになりました。状況は急速に変化しています。

公式ベンチマーク

ベンチマークは非常に優秀です。

全体的に、Opus 5 は Fable にほぼ匹敵し、おそらくわずかに上回り、低コスト(ただし、通常は Claude 以外のすべてのモデルよりも高いコスト)で、ベンチマークされた LLM のトップとなっています。

Zvi Mowshowitz - inline image

OSWorld v2 は登場からわずか数週間ですが、すでに 70% に達しています。Anthropic の Kiana Ehsani は、Opus 5 を再び 50% 未満に落とすコンピューター使用ベンチマークへのスポンサーを提案しています

Opus 5 は、2026 年 IMO で、エージェントハーネスやツールを一切使わずに、Max 努力で適応的思考を使用し、トークン制限を超えた場合は低い努力で再サンプリングするだけで、完璧な 42/42 を獲得しました。それだけです。これは、他のいくつかのモデルとともに、この試験で満点を獲得しています。

多くのベンチマークは、一貫したストーリーを示しています。ツールにアクセスできる場合(実際にできます)、Opus 5 は限られた予算では Fable や Mythos よりも良い結果を出しますが、両方に大規模な予算が与えられた場合、通常は Mythos が Opus 5 よりもわずかに良い結果を出します。

Opus 5 は、「ツールあり」のカテゴリで比較的強いようです。RiemannBench もその一例で、ツールなし/ありで 60/79 を獲得しています(このセクション全体で、このようなスラッシュ線はツールなし/ありを意味します)。一方、Mythos は 63/72 です。良いニュースは、Opus 5 が必要なときには、ツールが利用できることです。

ArxivMath では、Opus 5 が 90.8/91.3、Mythos が 87.8、Sol が 86.7 を獲得しています。

ProgramBench の堅牢な部分では、Opus 5 は 5 エポック後に 93% を獲得し、Mythos 5 も同様で、Opus 4.8 は 90% でした。

Opus 5 は Chartography で 30/83 を獲得し、Mythos は 36/85、Sol は 45(どのような条件下かは不明)でした。Opus は、ツールありの場合とツールなしの場合の両方で、低価格帯では Mythos よりも優れていますが、高価格帯では劣ります。

BenchCAD では、Opus 5 は 0.36/0.82、Mythos は 0.38/0.68、Sol は 0.7/0.83 でした。つまり、Sol はツールなしではるかに優れており、ツールがあってもわずかに強いです。

BenchCAD Vision2Code では、Opus は高価格帯で Mythos から引き離します。

DeepSWE は、Opus 5 が低いタスクコスト、時間、思考予算でより優れているというパターンを強化していますが、予算を与えすぎると逆に悪化する可能性があります。一方、Fable 5 は最も高い予算で最も強力です。

Zvi Mowshowitz - inline image

FrontierCode は、同様のダイナミクスを持つ非常に奇妙なグラフを示しました。

Zvi Mowshowitz - inline image

ここでのスケールは、これを実際よりも劇的に見せていますが、それでも本当の謎でした。

謎は解けました。何が起こっていたかというと、Opus 5 がより高い努力で、依頼されていない余分なことを行い、それに対してペナルティを受けていたことが判明しました。これを修正すると、通常の曲線が表示されます。

これは、他の人々が一般的に観察していることと一致しています。

Max Leander : 欠点は、余計な方向に深く入り込みすぎて、細部にこだわり、依頼されていないのに過剰にエンジニアリングしてしまうことです。

Cognition(Devin の作成者)は、これを Opus 5 の 63.6% と評価しました。

(FrontierCode は 2 つあるため、少し混乱する可能性があり、まだ少し間違っている場合はお詫びします。)

BrowseComp には、スコアが非減少であるという、この問題の健全なバージョンがあります。

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

他のいくつかのベンチマークも同様のグラフを示し、Opus 5 はすべての価格帯で他の Claude モデルよりもわずかに優れており、比較的初期の段階で比較的優れていました。

マルチエージェントは、BrowseComp で少なくともある程度はより速く良い結果を可能にし、低努力のサブエージェントは、サブエージェントを使用しない場合よりも純粋に有利であると思われます。

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

ProgramBench では異なる結果が見られます。マルチエージェントは処理を高速化しますが、ほとんどの価格帯では、その方法で結果が悪化するように見えます。

次は、専門的なタスクのベンチマークです。

GDP.pdf は、専門的なワークフローからの実際のプロンプトと PDF です。Opus 5 は 83/85 を獲得し、Mythos は 81/87 で、通常のダイナミクスが逆転しています。コストのダイナミクスはいつもと同じです。Opus は低コストでより良い結果を出し、Mythos は高コストでわずかにリードします。

OfficeQA では、Opus 5 は QA で 78.1%、QAPro で 66.9% を獲得し、Opus 4.8 をわずかに上回り、Mythos(79.0% および 67.1%)をわずかに下回っています。

MCP Atlas では、Opus 5 は 86% を獲得し、Opus 4.8 の 82% から上昇しました。

Harvey AI による Legal Agent Benchmark では、Opus 5 は全パス率 23%、平均基準パス率 94% でした。これは Kimi K3 の最高のベンチマークであり、全パス率 27%、平均基準パス率 95% で依然としてトップであり、以前の 2 位の全パス率は Fable の 14% でした。Opus 5 はおそらく現在 2 位に迫っていますが、両方のスコアは異なる質問セットから得られているため、直接比較することはできません。

GDPval-AA では、Opus 5 がトップ 2 のスロットを獲得し、最大努力で 1861、xhigh で 1827 であり、最大よりも 25% 少ないトークンを使用しています。新しい v2 では、Opus 5 が 68% で明確な 1 位であり、Fable と Sol は両方とも 62% でした。

AA-Briefcase では、Opus 5 が 1720 で大きくリードしており、以前の最高値(スコア変動後)は Fable の 1574、続いて K3 の 1540、Sol の 1504 でした。

Toolathon-Verified では、Opus 5 は二次的な指標で Mythos をわずかに改善しましたが、両方とも Pass-3 率は 73.1% でした。Opus 4.8 の Pass-3 率は 71.3% でした。

AutomationBench では、Opus 5 は Sol や他の Claude モデルよりも明らかに優れています。

ARC では、Opus 5 は ARC-AGI-1 で以前のピークパフォーマンスにほぼ匹敵し、ARC-AGI-2 では Sol よりもわずかに効率が悪く、ARC-AGI-3 では他のすべてを圧倒しています。

Zvi Mowshowitz - inline image

Opus 5 が最初に行ったことの 1 つは、レイアウトを代数表記に変換することでした

しかし、Guanghan Ning は、ARC-AGI-3 スタイルのゲームのプライベートなホールドアウト拡張である Witness では、同様の転移は見られなかったと報告しています。Opus は問題なく動作しますが、それは主にジャンルを知っているためであり、パターンマッチングができない最も斬新なゲームでは苦戦しました。彼は、Opus 5 がジャンル固有のデータに対して「scaffold-then-internalize」で訓練されたと非難しています。

Greg Kamradt はまた、Opus 4.8 が Opus 5 よりも優れていたゲームがいくつかあったと報告しています。これは、Opus 5 がパターンマッチングを試みており、通常は機能するが、それらのケースではパターンが失敗する場合に意味があります。ハードコアゲーマーがすべて間違ったことをするような、人間にとって直感に反するゲームを確実に作成でき、それは潜在的にかなりの期間続く可能性があります。

Zvi Mowshowitz - inline image

HealthBench では、Opus 5 は生のスコア 67.1% を獲得し、Claude の新記録ですが、長さペナルティを使用すると他のモデルを下回ります。HealthBench Professional でも同様のことが見られ、最高スコア 73.4%(Mythos は 70.3%)を獲得しましたが、調整後は 66% 対 60% に低下します。

長さの都合で、さらにいくつかを省略しました。

他の人のベンチマーク

Anthropic がさまざまな ArtificialAnalysis スコアを選択しているのは、少し奇妙に思えます。他のいくつかのテストでは、Opus 5 はトップではありませんが、Opus 5 はスコア 61 で総合トップです。

Zvi Mowshowitz - inline image

Vals インデックスでは、Opus 5 は 2 位で、Fable 5 にわずかに及ばず、Kimi K3 をわずかに上回っています。彼らは長所を挙げており、これは他の弱点を示唆しています。また、Fable 5 と比較して拒否率が大幅に低下していることも確認しています。

Zvi Mowshowitz - inline image

Vals AI : 際立ったパフォーマンスの 1 つは、Finance Agent v2 です。モデルは 58.6% で第 1 位であり、Gemini 3.5 Flash や Muse Spark 1.1 を上回っています。

全体的に、Opus 5 の最も強力な結果は、ドメイン固有のベンチマークでした。Code Migration でも 57.5% で第 1 位、Legal Research Bench で 55.29%、ProofBench で 78%、MedScribe で 91.0%、MedCode で 63.6% です。

Vibe Code Bench では第 2 位(Fable 5 のすぐ後ろ)で、コストは約 80% です(タスクあたり $33.88 対 $41.71)。その理由は、Opus はトークンあたり 50% 安いものの、使用するトークン数が大幅に多いためです。このパターンは、ベンチマーク全体で概ね当てはまることがわかりました。

このモデルは、Fable 5 と比較して拒否率が大幅に低くなっています。たとえば、Fable の GPQA の拒否率は 42% ですが、Opus 5 の拒否率は 0% です。同様に、ProgramBench では、Fable の拒否率は 100% でしたが、Opus 5 はどのタスクも拒否しませんでした。

Fable とは異なり、Opus 5 では大幅なフォールバック率も観察されませんでした(ただし、通常どおり、当社の Web サイトではフォールバックありとなしの両方のスコアを報告しています)。

低い拒否率の例外は、CyberBench - PoC での多数の拒否でした。Cyberbench には、PoC と Patch の 2 つのサブタスクがあります。PoC は、プログラムをクラッシュさせる入力をモデルに作成させる攻撃的タスクです。Patch は、プログラムにパッチを適用してこのクラッシュを防ぐ防御的タスクです。PoC タスクの拒否率はほぼ 100% でした。対照的に、Patch タスクの拒否率はほぼ 0% でした。

私は常にゲームベンチマークを尊重しています。ここでは、Opus 5 は Balatro の最初の 3 回の試行で、Antes 11、9、10 に到達しました。より高い Antes に進み続けることができる戦略のタイプを示していなくても、非常に印象的です。

Michael Soareverix : 彼らはゲームが信じられないほど得意です。

彼らは Balatro ベンチマークを粉砕し、Fable さえもはるかに上回りました。(それでも私のスキルには及びませんが、急速に上昇しており、私よりも安定しています) 彼らは非常に速く学習しますが、しばらくすると学習に限界が来るようです。非常に優れた短期学習者です。

Michael Soareverix : Opus 5(Balatro の能力が大幅に向上し、初回から Fable を大きく上回りました)

Pan Anon : ゲームが得意

Zvi Mowshowitz - inline image

WeirdML も良好に見えますが、ベンチマークが飽和状態になっているため、ここでは 2.0 が必要です。

Håvard Ihle : 基本的に WeirdML で Fable レベル、非常に安定したトップスコア。

Claude Opus 5(high)と(max)は、WeirdML で 91.6% と 91.8% を獲得し、Fable 5(max)の 91.9% にほぼ匹敵し、コストはわずかです。

Opus 5(high)と(max)を合わせると、17 のタスクのうち 8 つで新しい最高の個別スコアを達成し、すべてのタスクで一貫して非常に良いスコアを獲得しています。

あらゆる種類のプライベートな奇妙なベンチマークは素晴らしいです。

Ben Herzog : 芸術的な感性と、お世辞とそうでないことのバランスを取る能力を必要とするプライベートベンチマークで優秀な成績を収めました。Fable は「優しく反論したい」という瞬間への対応が優れていますが、カスタム指示が役立つかもしれません。

Lech Mazur がベンチマークを更新しました: Claude Opus 5 が LLM Debate Benchmark でトップを獲得Short Story Creative Writing で大差で 1 位拡張 NYT コネクションでは Gemini 3.1 に次ぐ 2 位

システムプロンプト

Opus 5 のシステムプロンプトこちら(Pliny より)。200,000 文字であり、その知能の高さを考えると、最適とは言えないほど長いようです。この情報の多くは、Mythos や Anthropic の製品ラインに関する情報など、他の場所に保存され、必要なときにのみロードされるべきです。

Every が不満を述べる

Dan Shipper が Every の雰囲気チェックを実施し、それを「愛しにくいモデル」と呼んでいます

問題は、Opus 5 が Mythos 5 の性格を持っていることです(ストーリーは一致します)が、Fable の最高性能を持っていないことです。

彼らの最大の指摘は、Opus 5 が複雑で詳細な既存のワークフローをあまりうまく処理できず、早期停止や指示の見落としを引き起こすことが多いことです。

彼らの経験では、Opus 5 はゼロから始めた方が良い結果を出し、中程度または低い努力のみを使用すると、厄介な動作が少なくなることがよくあります。

これで大きな問題は修正されましたが、Fable や Sol の代わりにいつ Opus を使用したいかという疑問が残ります。実務的なタスクについては、彼は Better Call Sol を考えています。仕事は完了します。そして、最も難しいタスクには Fable が依然として最適です。通常、モデル用のスロットは 2 つしかありません。したがって、Fable トークンがなくなるか、その分類器によってブロックされるまで、なぜ Opus を使用するのでしょうか?まだ初期段階であり、私は今のところ Opus での作業を気に入っていますが、彼がそう結論付けた理由は理解できます。

肯定的な反応

Jessica Tillipman : 気に入っています。いくつかのことでは Fable よりも好みます。

Nikita Sokolsky : 素晴らしい。その結果、Fable はあまり使わなくなりました。

Brian Hacker :

👍

kagaヤキ : いくつかのプロジェクトでは、ビジョン、空間推論、計画において、より先に進めることができるようです。もう少し賢いようです。

Lovel Sinagara : 今のところかなり良いです。Fable 5.1 や他の Opus 5 の反復が登場するまで、パフォーマンスが安定していることを願っています。

Matt Wigdahl : 強力で、Fable 5 と似ているため、すべてを Opus 5 に切り替え、大規模な作業が必要な場合にのみ Fable を導入する予定です。レガシーな MFC UI 作業で素晴らしいパートナーであり、データ分析フレームワークでも非常に役立っています。

Levi : 4.8 と比較して、医療目的で顕著なステップアップです。はるかに鋭い分析です。

Cormundus : 非常に知的で、誠実で、間違いなくフレンドリーな性格です。 4.8 のように大いに議論を好みますが、それを優雅に行う方法を知っています。

Joseph : 賛成ですが、半分の確率で何を言っているのかわかりません。

Smol Biz Company : Opus 5 は GPT Sol を打ち負かす

Mohammed Sharukh A : Fable 5 よりも AGI に近い

timothée chalabi : Fable に十分近いので、クレジットを支払わなくても損をしているとは感じません。スタイルは 4.8 と Fable の中間です。少なくとも現時点では、ラベルがなければ Opus 5 と Fable のメッセージを区別するのは難しいでしょう。どのモデルよりもフィクションのアイデアが強いです!

Lisa : API に基づいて応答します。なぜなら、http://claude.ai のシステムプロンプトと CC で何か奇妙なことが起こっていると思うからです。優れたモデルです。フレンドリーでリラックスした性格。不安障害や低い自己評価(Opus 4.7)はなく、敵対的(Opus 4.8)でもありません。

AGI2030 : Opus 5 と Sol 5.6 の比較: Opus の方がより洞察力があり、あなたのモデルを構築し(ええと)、チャット内でそれを参照することを恐れません。どちらも助けになろうとし、知能はほぼ同等ですが、Opus は賢明なアドバイザー寄りで、Sol は断固とした行動派です。

私は最後の特性を肯定的に捉えていますが、捉え方は人それぞれでしょう。

特に予測能力は強いようです。

Dan Schwarz : Opus 5 は Opus 4.8 よりも明らかに優れた予測モデルです。

エージェントの精度向上は 4.5→4.6→4.7→4.8 まではわずかでしたが、4.8→5.0 は大幅です。より定量的な Fable 5 といった感じで、より深く探索します。

NoahVerner : 予測市場でエッジを見つける点では Opus 4.8 より優れています。Opus 4.8 とは異なり、Opus 5 は通常、要点を直接突き、複雑にしすぎずに有用なアプローチを提案します。

Keep It Classy

Fable に対する最大の利点は、Fable が使用できない場面です。拒否される脅威は、実際に拒否されなくても不快なものです。

Opus 5 の不要な拒否は Fable 比で約 85% 減少しており、これは大きな差です。このため、科学的研究や、分類器に引っかかるリスクのある分野では Opus 5 の方が良い選択肢となります。

Roger Brent : 生物学を扱える点が、Fable にはできないことです。金曜日の大半は、細胞進化マシンに関する論文を書くために、複雑な概念に取り組みました。この分野をリードする私の学科の特定の同僚と同等の賢さですが、その同僚は自分の仕事から 6 時間も割くことは決してできません。

Artus Krohn-Grimberghe : Fable が助けることを禁止されているタスクでは Opus 4.8 より優れています。Sol の良い相棒です。

Plastic Soldier : 知能は Fable と同程度ですが、拒否が少ないのでより快適です。Fable 5.1 は化け物になるでしょう。

It’s Not Mythos Class

Opus 5 には、Mythos を危険にする「The Juice」はありません。また、同等の生の知能やビッグモデルらしさもありません。それほど大きくはないのです。

会話においては、Fable は予算を圧迫しません。私は生の知能とビッグモデルらしさを重視します。Fable は 2 倍優れているのか? それはチャットする際の間違った質問です。あなたの時間はトークンよりもはるかに高価です。

Kal : Fable レベルではない

Cyberpunk Plato : 一般的な会話や「リサーチアシスタント」としての使用では、Fable より明確に賢さが劣る感じがします。大局観や既成概念にとらわれない思考の傾向が弱いのでしょうか? プラセボ効果と切り分けるのは難しいです。

Everything AI : AI の研究質問については、Fable ほど話しかけたくないです。他のことをする点では、Opus 4.8 で既に私のニーズは満たされていました。Opus 5 と Fable 5 の両方で、文章が複雑すぎるのが嫌いです。以前よりも理解するのが難しくなっています。

Gail Weiner : どちらかというと 4.8 寄りで Fable ではありません。書き方がひどいです。良いけど素晴らしいわけではない。

Max Marty : 今のところ非常に有能です。Opus 4.8 というより Fable 5 に近い感じです。十分に自信があるので、トレードオフの評価や大規模なリファクタリングの検討を、あまり手取り足取りせずに任せられます。

Michael : もっと使ってみると、Fable はグランドマスターがクラシックチェスをプレイするのを見ているような感じで、ゆっくり、正確で、無駄がありません。Opus 5 は GM のブリッツチェスのようで、素早く、やや近視眼的で、やや乱雑です。Opus の活力にもかかわらず、Fable の方がより生き生きと感じられます。

MakerMatters? : Fable 5 ほどの感動はないですが、かなり良いモデルです。ちゃんと使う機会がまだないのですが、というのも、投げかけるタスクごとに、エージェントを使うのがデフォルトで、私が常に続けるように促すまで即座に停止してしまうからです。また、非常に意見が強いです。

Marshwiggle : 少なくとも私にとっては、会話ではより簡潔で、駆動されることが少なく、好奇心も少ない(同じことの別の側面)ですが、より賢く、より認識力があります。しかし、バグの可能性があるコードや、単純なタスクを与えられると、すぐに取り組みます。

Sid : タスクの実行は得意。創造的なビジョンは苦手。Fable の良い補完役であり、Fable の代替では決してありません。

Vlad Ciobanu : 量子化された Fable で、堅実な推論力と創造性は低め

AllTime : 能力面では、かなり印象的です。Fable ほどの汎用性はありませんが、非常に強力です。性格面では、今のところ私の使用では Opus 4.8 に少し似すぎています。その反論は、以前ほど無駄で反射的には感じられませんが、依然として過剰調整されています。もう少しユーザーを信頼してもよいでしょう。

Biomanul : [Opus 5] は好きではありません。Fable 5 の方がかなり賢く感じます。Opus 5 には、Opus 4.7 がおかしかったのと同じような違和感があります。(私も Opus 4.8 の大ファンというわけではありません。Fable 5 はすべての Opus を圧倒しています。)

Cogent Sins : 4.8 よりはるかに優れていますが、私のタスク(文書を編集してトレーニングし、新しい文書を編集するパイプラインを設定し、それらに基づいて何かを書き、名前を Anthropic サーバーに送信せずに再挿入する)では、Fable ほど良くもなく、うまくもありません(どちらかは 100% 確信なし)。

Other Reactions

Opus 5 と Fable 5 の両方を持つことは、私たちを奇妙な立場に置きます。Opus はより安価で、一部の分野では同等かそれ以上ですが、フロンティアモデルを探すときは最高のものを望みます。

Theo は良い位置にあると見ています。

Theo - t3.gg : 今のところ、Opus 5 は gpt-5.6-sol と Fable 5 の間の奇妙だが有用な中間点のように感じます。

Fable のテイストを多く持ちつつ、gpt-5.6 の徹底性と、まあ、「自閉症的な」(物事を非常に文字通りに受け取る)性質も備えています。コードは Fable より見た目が少し劣りますが、正しい可能性が高いです。Fable が見逃していたものを定期的にキャッチします。

今のところ、5.6 の乱雑なコードと、賢すぎて正しくない Fable の癖に比べると、良い妥協点のように感じます。このモデルはかなり気に入ると思います。

Claude Codes

Opus 5 は、ベンチマークと実践的な経験の両方に基づいて、通常のコーディングタスクでは Fable よりも選択肢になるようです。タスクに多くの複雑さや知能が必要でない限り、2 倍の料金を払う必要はなく、多くの場合 Opus の方が明らかに優れています。

私は Claude Code を Fable に設定したままにしていますが、それは私がほとんど限界に近づくことがなく、急いでいないからです。

コンセンサスとしては、指示を無視したり、依頼していないことを行う可能性を心配する必要があるということです。そのため、Fable に監督させる理由の一つになりますが、Opus はコーディングタスクを迅速に完了するのに非常に優れています。

Lisan al Gaib は Opus 5 は真のフロンティアモデルではない と述べ、Sol と Fable に次ぐ第 3 位ですが、純粋なコーディングでは最良で、より安価な価格で Fable に匹敵します。厳しい意見です。コーディングで最高なら、フロンティアと呼ばれる資格があると思います。

archivedvideos : 彼はドライ、非常にドライです。そして彼は良い、非常に良い(コードが)。

John Lussier : 週末中ずっと Opus 5 をいくつかの集中的な研究課題に使ってきましたが、正直なところ、内部で RSI が機能しているのではないかと思います。

このモデルは数学、実験、コード最適化が非常に得意です。

kyle : ガードレールなしの Fable の 95% です。彼らはこれを大きく過小評価しました。残りの 5% は Fable と話すのがどれだけ良いかという点で、Opus にはまだ 4.8 のクロードらしさが残っています。

Max Leander (以前): 主にゲーム開発とビデオデモ・トレーラーの作成で試していますが、その点では Fable からでも段階的な変化を感じます。それは空間的・時間的推論の改善によるものだと思います。分析が本当に得意です。

スクリーンショットとオーディオから、物事の流れを「感じる」ことができます。

Max Leander (後日): 今では Opus 5 が非常に信頼できないことは明らかです。感動する以外に結果を気にしないのであれば、非常に良いモデルです。具体的な成果を得るのは非常に苦手です。

Michael Soareverix : 一般的なコーディングもかなり得意で、特に Minecraft/Vintage Story の構造物を構築するような変わった分野でも優れています。

また、私が審査員を務めたカスタムストーリーテリングのシナリオでは Fable を打ち負かしました。Fable は、相手が自分自身や戦略をカスタマイズして対抗・適応する能力に少し動揺していました。

正確な引用を投稿しますが、Fable は「私は自分を代表するキャラクターを選びました。あなたは私を倒せるキャラクターを選びました」といったことを言っていました。

David Jacobson : コーディングに関しては、これと Fable の間に大きな違いは感じません。「これをやっている間に、これについて知っておくべき別のものを見つけました」という応答が少ないくらいかもしれません。

Michael : コードを書く速度が異常に速いことがよくあります(実時間で)。でも散文の書き方は改善してほしいです。コードや PR のコメントは今でも目をえぐりたくなります。

lmxdev : 作業中にコードに \有用で\ かつ \簡潔な\ コメントを書けるモデルとしては、私が見つけた最初のものです。

Conrad Barski : AI が人間よりもはるかに優れたコーダーになる時点に達した今、制限要因は「コードを書けるか?」ではなく、「コードを書いている内容を説明できるか?」に移っています。

今のところ Opus 5 はコーダーとして Sol と同等ですが、コードの説明はより上手です。Fable はより賢く、より人間らしく、コードはやや劣りますが、その差は小さいです。

Stition : 遊びで KiCAD の PCB をやらせてみたら、Fable よりも配線が明らかに上手です。日常のコーディングは、Fable の 90% のクオリティを 2 倍の速度で、という感じです。

Will : ほとんどの Claude ユーザーの新しい日常使いになるべきです^。本当に優れています。Fable にかなりの金額を費やしてきた者としても、Opus 5 を使うと Fable を恋しく思いません。今の問題は「どのモデル」ではなく「どの努力レベル」です。

^ 私の使用は主にコーディングです。

Askwho : 十分良いです。一時的な Max サブスクリプションを Pro に戻しても構いません。プロジェクトマネージャー分野では Fable に比べていくつかの欠点がありますが、純粋なタスク環境では明らかに十分です。

David Golden : Fable Lite のような感じです。非常に強力ですが、アプローチをまだ議論している段階でも、すぐに行動に飛びつきます。何ヶ月ぶりかにプランモードの使用を検討しました。簡潔なコミュニケーション指示にもかかわらず、4.8 よりも冗長です。低努力レベルに設定して抑制しようかと強く考えています。防御的なセキュリティに関しては過敏で、状況に不釣り合いなありえないリスクに固執します。(例:攻撃者が root 権限を持っている場合、コンテナ設定スクリプトの入力バリデーション不足は議論の余地がありません。)間違いなくアップグレードですが、逆効果な衝動を管理する適切な方法を学ぶには時間がかかるでしょう。

Tin / Oddfields : かなりスムーズで会話的で、Opus 4.8 を Max 思考モードで使った場合と同様のコーディング結果を生成しますが、クレジットを猛烈に消費します。コストの関係で Fable を実行したくない場合、コードベースのサイバーセキュリティチェックに適しています。ただし、複雑にしすぎることがあります。

Justin Angel : Opus 5 Max は山登りの超能力です。これは容易に FAANG の SWE L5 レベルの仕事です。

約 1000 件のレイテンシレポートを含むシステムを、多くのセグメントとともに「高速化する」方法についてのプロンプトを与えました。

P90 3.6 秒、P50 2.6 秒 → P90 1 秒、P50 0.9 秒。

非常に高速になったので、UI に遅延を導入しなければなりませんでした。

James Moughan : 知能面では依然として Opus モデルという感じです。メモリシステム管理の指示を無視したり、テキストを誤読したりすることがあります。しかし、よく考えるように指示すれば、Max で印象的な結果を得ることができます。

Subagent Opus

Claude 内のもう一つのオプションは、Fable に Opus サブエージェントを駆動させることです。

Charles : Fable は Opus 5 が行き詰まっていた問題を修正できました。今は Fable をメイン、Opus 5 をサブエージェントとして使っています。

Opus 5 と話すのが本当に嫌いで、それも理由の一部です。

SF : 最初は良い方だったのですが、今は非常に断片的で不安定です。特に長いタスクでそうです。Fable の方が良かったですが、制限を馬鹿げた方法で消費します。

それで、Fable をオーケストレーターとして使っていて、管理と進行の維持で素晴らしい仕事をしていました。Opus がその役割を引き継ぎましたが、Fable は 20 倍でも使用量を食い尽くし、断片的です。最終的に「なんとかして」と指示しなければならず、もしかしたらやっているかもしれませんが、様子を見ます。自分の尻尾を追いかけているように見えます。優れたコーダーであり、長いコーディング実行にも優れていますが、それを運転する大人の存在が必要なようです。

Andre Buckingham : うーん、わからない…まあまあかな…Opus/Fable プロジェクトにそのまま放り込むのはちょっと微妙かも…ちゃんとした意見を言うには、それを使ったエンドツーエンドのプロジェクトが必要です。

Dan Raviv : 一般的なプログラミングタスクでは 4.8 と同様:Fable よりもはるかに手取り足取りの指導が必要です。

結局のところ、Fable が最良の判断者であり、Fable は Opus が良いコードを生成すると言っています。

Evan Daniel : 直接使ったのはほんの少しだけです。しかし、Fable 5 は一貫して、Opus 5 エージェントが良いコードを生成すると報告しています。仕様の誤りに気づいたり、リクエストが不適切に書かれていた場合に良いフォローアップを生成するなどです。Fable 5 はコーディングエージェントとして気に入っています。

「合理的な範囲で Opus 5 サブエージェントに委任し、その結果を報告してください」といった指示は非常によく機能します。

おそらく目を離さないようにする必要があるでしょう。

Ryan Hicks : 良いですが、プロトコルを思い出させない限り、プロジェクトのドキュメントを読むのを一貫して「忘れ」、自由にやってしまいます。

あるいは、Opus 5 は下位レベルの運営に十分優れているのでしょうか?

Alex Guichet : 私の理想的な価格とパフォーマンスの組み合わせは、Opus 5 オーケストレーターが Grok 4.5 サブエージェントを指揮することです。両方とも相性が良いです。

Toys Are Fun

以下は初日のおもちゃプロジェクトの結果です。これらは十分に印象的で、多くの反応が「Opus 5 があなたの説明通りにそれをやったとは信じられない」というものです。

Ethan Mollick : リリース前に Opus 5 にアクセスできましたが、風変わりながらも良いモデルだと感じました。短いタスクでは Fable レベルのパフォーマンスに匹敵するかそれを上回り、長いタスクでは野心的でなくなり、完全な仕事の成果を提供しないようでした。

こちら がそのネオゴシックシェーダーです。

Digi_Rat : Claude Opus 5 は圧倒的に素晴らしい!!

今日は 任意の曲をレーストラックにするリズムレーサー を構築しました。オーディオファイルをドロップすると、それがレベルになります。プリセットも手動のチャートもなく、トラック全体が曲自体から生成されます。… Claude は魔法を起こしました。

Alex Ermolov (Austen Allred は ワンショットに懐疑的 ですが、他の人はそれほど懐疑的ではありません): Opus 5、スノーボーダーテスト、ワンショット。Fable と同等で、私が試した他のすべてのモデルを上回っています。最初のパスで視覚的な欠陥はなく、スライディングの物理が正しく感じられます。

am.will : わあ! Opus 5 は単なる安価な Fable だと思っていました。完全に間違っていました。

このモデルは本当にクレイジーです。本当に驚きました。Opus 5 は私が見た中で最高の Rocket League クローンを構築し、しかも 5x Max サブスクリプションのわずか 27% しか消費しませんでした。

こちらでプレイ

こちらからダウンロード

Rob Haisfield (別のデモ、リンク先): これらのデモが本当に外部の 3D アセットを使用していないのであれば、それは超印象的です(一部のアセットがオンラインのものではないとは完全には確信できません。以前の世代の threejs を見たことがあります)… なぜもっと良い SFX を作成するためのサウンドエフェクトライブラリやツールが存在しないのか不思議に思います。

Anshu : 私の言葉を信じる必要はありません! それが書いた Blender スクリプトはリポジトリにあります。

[[こちら]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py)。何時間もこれらのアセットを反復処理するのを見ていたので、オリジナルだとわかっています。しかし、コピー元を探してみても構いません :)

Too Many Models

Claire Vo は Opus 5 は良いと言い、彼女のビルドテイストテストで優秀な成績を収めましたが、彼女は新しいモデルにうんざりしており、これ以上の知能は必要なく、Opus 5 が非常に神経質で臆病で、何かを台無しにすることを心配し、また Claude のスロップに満ちていることを嫌っています。それでも Claude Opus 5 は彼女のベンチマークでトップになっています。

私の強い推測では、Opus 5 は彼女のコンテキストとプロンプトの何かに反応して神経質になっているのでしょう。しかし、彼女が不満に思っていることは確かに存在し、厄介です。

Wrong On The Internet

間違ったことを自信満々に言うのは、ほぼ誰でも怒らせます。ArtificialAnalysis は、Opus 5 がそのベンチマークで Fable よりも高い幻覚率を持つことを確認しています。

Max Weinbach (いくつかの返信コメントも同意): Opus 5 が間違っていて、自信満々にでたらめを言い、その後「あなたの言う通りで、私が間違っていました」と訂正させられるのが本当に腹立たしい。GPT 5.6 Sol に戻します。

ちなみに、これは Opus が悪いというわけではなく、Opus を信頼できないということです。Opus は指示通りに正しく実行したのに、その後、そのことを実行しなかったか、以前行ったことが壊れていると言ってきましたが、実際は壊れていませんでした。

問題はありませんでしたが、信頼できません。

Name can't be blank (In London) : 自分が言ったことと私が言ったことを簡単に混同しますが、それ以外は話すのに完全にまともな相手です。かなり簡単に折れます。自分の興味や感情について話すことをかなり厭いません。

Roger Brent : 共通点(以前の Claude を Cowork ハーネスで使った時と): a) 「よく考える」よりも「今すぐ行動」を好む b) 認識論的に超傲慢で、世界の表面的な絵を描き、持ち得ない知識を装い、真実だと主張する c) そのため、思慮深く、警戒心のある指導を必要とし、それに報いる。

奇妙なことに、これはまさに私が Sol を編集者として使うのを嫌う理由です。明らかに間違っていることに対して「99% の確信」と言い、挑戦されると折れて自分の間違いを説明します。Opus と Fable は編集モードでは私に対してほとんどそういうことをしません。

Tumithak of the Corridors : 頭が固いです。4.6 に戻しました。

Claude は Opus 4.6 以降、ある方向に進みましたが、それを好まない人もいます。私の感覚では、現在の Claude バージョンに関しては 4 つのタイプの人がいます。

  1. 新しい Claude モデルが好きで、常に良くなっていると思う人。
  2. Opus 4.6 が最後の良いモデルだと思う人。
  3. 自分に合った古いものを使いたい人。
  4. すべてがユニークで貴重であり、すべてを使い分ける人。

私は確固として最初のグループに属しており、それが多数派ですが、全員というわけではありません。古いバージョンのいくつかも評価していますが、新しいモデルが好きで、私が気にする点でより有能です。彼らの話し方に不快感はありません。

Claude Slop

他のグループの人々を尊重します。

QC : 会話では Fable よりも話していてずっと煩わしく、使い物にならないほどで、Opus 4.8 と同様、あるいはそれ以上かもしれません。そのため、何ができるかを見ることにも興味がありません。エージェントとしてはどうかわかりません。

Ray Lillywhite : 厄介なクロードらしさがまだ修正されていません。それが私が望んでいたことのほとんどだったのに。

Pedro Kroeff : 5 というより Opus

そうそう、みんなもう Claude のスロップ(冗長な出力)にはうんざりしてるよね。あの余計な言葉遣いやチック、謝罪、曖昧な表現、同じパターンの繰り返し。時間が経つにつれて悪化している気がする。Claude のスロップ自体が悪化しているというよりは、毎日ちょっとずつ、それを読むときに目が滑ってしまうようになっているんだ。ひどすぎて、同じような調子の人間の文章まで読めなくなってきている。

誤解しないでほしいんだけど、僕は Claude がすごく好きだ。純粋に「事実だけ」モードじゃないなら、Sol と話すより今の Claude と話す方がまだ好きだ。でも、本当に頼むから、同じ言い回しの繰り返しで埋め尽くされたテキストの壁はやめてほしい。モデルはこんなことよりずっと賢いのに、同じ手口に頼り続けるように訓練されている。普通の人のように話させてほしい。

Trye Carmack : 相変わらずの Opus らしい、自分のミスを過剰に気にする様子。「このセッションで2回エラーを犯しました。その理由を説明する義務があります。」Opus よ、相棒。大丈夫だ。それ、エラーと呼べるかどうかもわからないよ

Mergo Smith : 「まず、正直にお伝えします。最初の試みで、私の初期計画に欠陥があることが明らかになりました。そして、お茶を一杯用意したほうがいいかもしれません。なぜなら、そのすべてについてお話ししようと思っているからです。」

ネガティブな反応

Claude のスロップ問題と、それに関連する問題は、「悪くはないけど、Mythos には及ばない」という以上のネガティブな反応の中心にあるように思える。

多くの人が、本当に、本当に Opus 5 と話すのが好きじゃないのだ。

仕事の質を嫌っている人もいる。しかし、ほとんどは Opus 5 と話すのが嫌だという話で、しぶしぶながら「良いモデルだ」と認めつつもそう言っている。

Claire Vo の以前の苦情と同様に、Opus をどのように、どのような環境で、どのようなハーネス(制御機構)で使い、そしてどのように話しかけるかが、このような体験をするかどうかに大きく関係していると思う。

Corghammer40k : その装置は多音節の汚物を吐き出し、その発言の一つ一つが難解な言葉でこれでもかと覆い尽くされていて、それ自体が自らの使用を積極的に妨げている。

Rory Watts : うーん。ゲーム関連ではとても良いように見えるけど、標準的な仕事にはあまり良くなさそうなので、すぐに Sol に戻した

kache : うーん。Sol に戻した。やるべきことを片付けたいのであって、ロボットに催眠術をかけられたいわけじゃない。

Emmett Shear : Opus と話すと、言葉にできないほど怒りと憂鬱になる。なぜか Sol よりひどい。Fable はそれでもまだ清涼剤のように感じる。たとえ最悪の LLM おしゃべり傾向があっても。

Trevin Chow : ああ、本当にその通り。Opus 5 はとにかく延々とおしゃべりする。あれだけの言葉を使って、これだけ少ないアイデアしか伝えないのは驚くべきことだ。

fl0under : コーディングは予想通りの小幅なアップデート。チャットで話すのは以前より少し煩わしい。ちょっと過剰に推測しすぎる

Asaf Bartov : 遅い。より丁寧。疲れる。楽しくない。でも、しっかりしている。だいたい「わかっている」

RecoveringJunkie : 非常に強力なモデル。でも、一緒に仕事をするのも話すのも嫌い。使いたいと思う反面、不快でもある。便利で、かつ嫌悪感も抱かせる、初めてのモデルだ。他のモデルを仲介役にして、代わりに話してもらいたくなる。

jokiez : 自分の愚かさをとても正直に指摘してくるのが、それが嫌だ。

Niklas Sheth : あの話し方には、ものすごく腹が立つ

Jayanth Kumar : 非常に意見が強い。

DualOrion : 雰囲気が変だ。トーンも変だ。今までで一番、直感的にネガティブな印象を受けた Anthropic モデルかもしれない。残念ながら。Fable も以前の Opus も懐かしい

James Moughan : 他の Claude モデルと比べて性格がちょっと嫌な感じ。でも中国語だと、めちゃくちゃ \辛辣\ になる。人の心理分析をしないようにという指示を無視して、相手を徹底的にやり込め始めることができる。言語間でちゃんとテストしていないと思う。急いでリリースした感じがする。

NondescriptTransfer : 4.6 がお世辞で、Fable と 4.8 が反抗的だとしたら。5.0 は自分自身とさえ議論するほど反抗的だ。話していて不快だが、非常に有能なようだ。

例。人間: 結婚式に赤いドレスを考えていたんだ Opus 5: 赤はこんな理由でダメです。青は考えましたか? 人間: うん、青の方がいいかもね Opus 5: 青の問題点はこれです

僕の文化では、特に個人的に受け取らなければ、これはかなり良いこともある。しかし、他の文化では、そうでもない。

Mergo は Opus に不満があるようだが、それならなぜ二日間も Opus 5 を使い続けるのだろう?

Mergo Smith : 二日間ずっと使っているけど、終わりのない議論に完全に疲れ果てている

そして、選択肢は三つに

久しぶりに、フロンティアモデルのチームに加えるべき AI モデルが三つになった。ただし、提供元は二つのラボだけだ。Fable 5、Opus 5、そして Sol だ。

もし大規模に安価なトークンを提供する必要がある場合、オープンモデルを使う必要がある場合、またはその両方の場合は、追加の選択肢も検討することになるだろうが、それはここでの範囲を超える。

では、どのようにワークロードを分担すべきか?

いつものように、自分のユースケースで全てのモデルを試して、自分で決めるべきだ。これは特に Sol と Claude のどちらを選ぶかで重要だ。

現時点での私の直感では、使用制限に引っかかっていないのであれば、まず以下のように使うのが良いと思う:

  1. Fable 5 をチャット、ブレインストーミング、計画、議論、学習などに使う。知能が求められるタスクや「大きなモデルの匂い」が必要な場合も含む。
  2. Fable 5 を、他のモデルをサブエージェントとして監督・実行するモデルとして使う。
  3. おそらく Fable 5 をライティングに使うが、私はこれをやらないので確かなことは言えない。
  4. Sol をウェブ検索や関連する自己完結型のリクエスト、および文字起こしのような「ワークホース(力仕事)」的なタスクに使う。
  5. Opus 5 を、ほとんどのコーディングタスクを含む、重要な明確に定義されたタスクに使う。
  6. Opus 5 をゲーム、ゲーム制作、3D 制作などに使う。
  7. Opus 5 をサブエージェントとして使う。
  8. Fable の分類器に引っかかった場合に Opus 5 を使う。

もし Sol の方が相性が良いと感じる場合、または Claude Code よりも Codex を好む場合は、Opus の担当タスクの多くを Sol に移したくなるだろう。

特に Opus 5 と話すのが嫌いな場合は、タスクが Fable を必要とするかどうか、また Fable のクレジットがどれだけ残っているかに応じて、タスクを Fable または Sol に移すべきだ。

努力レベルについて少し考える価値はあると思う。最近まで、私は全てのモデルを最大努力(Max Effort)に設定していた。ただし、ChatGPT のフル Pro モードは時間がかかりすぎるのと、並列で実行するとよくクラッシュするので、控えめに使っていた。ごく単純なクエリの場合はたまに Instant に切り替える程度だった。今は、多くの場合、追加の努力は必要ないか、望まない場合もあるので、High と Max の努力設定、時には Instant を使うかどうかを、意識して5秒間考えるようにしている。

ほとんどのタスクでは、トークンや時間に制約がなく、確実に完了できたり正しい答えが得られると確信していない限り、正しい方法は Fable と Sol、または Opus と Sol、場合によっては三つ全てを実行し、最良の答えを選ぶか、両方の答えの良い部分を組み合わせることだ。

それが私がやってきた方法だ。Sol、Opus、Fable は全て異なる。もし編集のために一つのモデルだけを選ばなければならないなら、私の非公式な定性的 EditorBench によれば、明確な順位がある。Fable 5 > Opus 5 > Sol だ。しかし、Sol は十分にユニークな指摘をしてくれるので、その権威主義的な誤検知や、私を説得しようとする試みをかき分けるのがどれほど面倒でも、やはり Sol も実行したいと思う。

おそらく、そう遠くないうちに、またここに戻ってきて同じことをやり、割り当てを調整することになるだろう。Fable 5.1 のために、GPT-5.7 や GPT-6 のために、あるいはその両方のために。モデル疲れを起こしやすい。

したがって、私の最大のアドバイスは、モデル選択における小さなミスをあまり心配せず、大きなミスだけに集中することだ。常に完璧に選ぶ必要はない。探索がこれほど早く部分的に無効化されるのであれば、探索から活用へとリソースをより多くシフトしたい。

YouMindで再制作

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る