YouMind
ログイン

LLM トレーニングの知られざる真実:原則、プロセス、そして新たな実践

@HiTw93
中国語2026年4月03日
632K
2.2K
461
53
4.1K

TL;DR

この記事では、LLM トレーニングの進化する状況を探ります。大規模な事前学習から、現代のモデル性能を決定づける高度なポストトレーニング、強化学習、そしてエージェント指向のエンジニアリングへとシフトするトレンドについて解説します。

TL;DR(要約)

「Claude Code の知られざる側面:アーキテクチャ、ガバナンス、エンジニアリング実践」と「エージェントの知られざる側面:原則、アーキテクチャ、エンジニアリング実践」を執筆した後、大規模言語モデル(LLM)のトレーニングが実際にどのように機能するのかを要約することに挑戦したいと思いました。この記事は、専門的なバックグラウンドを持たない方にも理解できることを目指しています。

2026 年に向けて、LLM のパフォーマンスにおける真のギャップは、もはや事前学習だけではなく、その後に続くロングテール、すなわちポストトレーニング、評価、報酬、エージェントトレーニング、蒸留にあります。すべてのステップがユーザーの実際の体験に影響を与えます。モデルが突然強力になったと感じる場合、それはおそらく単一の要因ではなく、これらの領域がまとめて最適化された結果です。

以下では、LLM トレーニングパイプラインに沿って、メーカーがトレーニングスタックの後半を通じて最終結果をどのように改善しているかに焦点を当てます。

LLM トレーニングはパイプラインである

ここ数年、モデルの進歩は一般的にパラメータ、データ、計算能力の蓄積によって説明されてきました。しかし、多くのユーザーが実際に感じる改善は、より多くの基本コーパスでのトレーニングからではなく、事前学習後のトレーニングプロセス全体からもたらされます。モデルがどのように話し、指示に従い、推論し、ツールを使用するかは、単により多くのインターネットテキストを入力するだけでは自然に成長しません。

InstructGPT は非常に直接的な例を示しています。アライメントと選好最適化を受けたわずか 1.3B パラメータのモデルが、人間の選好評価で 175B の GPT-3 を打ち負かすことができました。パラメータ差が 2 桁もあるにもかかわらず、ユーザーは最終的にはるかに小さいバージョンを好みました。トレーニングの後半が、ユーザーの認識を真に書き換えるのです。

トレーニングプロセスは実際には、データ、アルゴリズム、システム、フィードバックが高度に結合されたパイプラインです。ある層での変更は通常、他の層に伝播します。2026 年には、モデルの能力と産業的価値は、事前学習後の層にますます集中しています。

Tw93 - inline image

これが、豆包(Doubao)がランキングで競っているようには見えないのに、日常的な使用ではより満足感があるとよく感じる理由でもあります。それはポストトレーニングがうまく実行されているからです。

これらの 6 つの層は、役割分担を見るためのものです。下図の 9 つのステージは、より詳細なバージョンです。生データとシステムレシピは分離され、エージェントハーネスとデプロイメントは後半のサブ区分です。また、全体を通じて 2 つのフィードバックループがあります。本番トラフィックはデータエンジニアリングに戻り、オフライン評価結果は事前学習に戻ります。

Tw93 - inline image

事前学習は単なる基盤である

事前学習は、トレーニングチェーンの出発点であり続けます。それが何をするのかを理解して初めて、後続の各層が何を補うのかを理解できます。このステップがなければ、言語モデリング能力、知識の圧縮、後続の能力転移の余地はありません。エンジニアリング的には、モデルに次のトークンを予測することを教えるだけではありません。言語分布を学習し、大規模テキストからの知識とパターンをパラメータに圧縮し、後続の能力活性化の余地を残します。次のトークン予測はトレーニング形式を説明するだけであり、スケールが大きくなるにつれてモデルが突然新しい能力を開発する理由を説明するものではありません。

GPT-3 以降、多くのモデルチューニングでは、予算と比率がより慎重に考慮されています。モデルは単に大きければ良いというものではありません。パラメータ数、トレーニングトークン数、総計算予算の間には比率の問題があります。多くのモデルは小さすぎるのではなく、トレーニング不足であり、与えられた予算の下でより適切なポイントに達していません。

実際のトレーニング決定では、実践的な質問は次のとおりです。もし誰かがあなたに 10,000 台の H100 と 1 ヶ月を与えたら、どのようにして十分に優れたオープンソースモデルをトレーニングしますか?ここでのスケーリング則は、論文の抽象的な曲線というよりも、予算配分ツールのようなものです。最終的には、次のことを考慮する必要があります。次のトレーニングラウンドでは、より多くのパラメータを積むべきか、より多くのデータを供給すべきか?現在のモデルは能力が不足しているのか、それとも単にトレーニング不足なのか?限られた GPU 予算の下で、どの比率が最も価値があるのか?

事前学習はモデル能力の基盤を築き、知識の範囲、汎化の可能性、パターン帰納能力を決定します。また、ポストトレーニングが活用する余地があるかどうかも決定します。しかし、事前学習では、モデルが指示に従うかどうか、ユーザーと協力するかどうか、重要なタスクで安定して実行するかどうかを制御できません。

事前学習フェーズは、どれだけの知識が学習されるかを決定するだけでなく、モデルが何になり得るかを事前に決定します。トークナイザーの分割方法は後続のトレーニングに直接影響し、コンテキストウィンドウの長さは事前に設定する必要があります。マルチモーダル事前学習を継続するかどうか、単一アクセラレータでの動作が最初から要件であるかどうかといったトレードオフは、リリース時に機能として追加されるのではなく、トレーニングフェーズ中にレシピに書き込まれます。Gemma 3 は、単一アクセラレータ、128K コンテキスト、ビジョン機能、量子化を同時に強調しており、これらのトレードオフを反映しています。ユーザーが最終的に目にする能力(ローカルコンピュータでの実行、画像の認識、長文書の理解)は、実際にはトレーニングフェーズ中に大部分が決定されます。

Chinchilla によって与えられたデータ最適点を見ると、8B パラメータモデルの場合、約 200B トークンです。しかし、Llama 3 8B は実際には 15T トークンを使用しており、約 75 倍です。このような過剰トレーニングレシピは通常、同じパラメータでより高い能力密度とトレードオフし、結果として推論のためにより小さく、より費用対効果の高いモデルをもたらします。これを総 FLOPs(浮動小数点演算)で測定することは、パラメータ数を見るよりも信頼性が高くなります。下図はこのギャップを視覚的に示しています。

Tw93 - inline image

もう 1 つ見落とされがちな設計が事前学習フェーズで発生します。トークナイザーの語彙サイズ、分割戦略、バイトレベルエンコーディング方法は大きな影響を与えます。Llama 2 は 32K の語彙を持っていましたが、Llama 3 で 128K に拡張された後、シーケンス長は約 15% 圧縮され、ダウンストリームパフォーマンスも向上しました。この影響は、推論コストと多言語能力にまで及びます。中国語、コード、数式のトークン効率は、語彙設計中に決定されます。例えば、中国語を非常に小さな断片に分割するトークナイザーは、毎回より多くのトークンを消費するだけでなく、すべての推論においてその貧弱な決定のコストを負担し続けなければなりません。

データレシピがモデル能力を決定する

パラメータ規模は過去の主要な指標でしたが、ここ 2 年でより重要なのは「データレシピ」です。

このプロセスは表面的にはデータクリーニングのように見えますが、実際には完全なデータ生成エンジニアリングタスクです。ウェブページ、コードリポジトリ、書籍、フォーラムからの生データは、事前学習に入る前に、テキスト抽出、言語識別、品質フィルタリング、プライバシー処理、セーフティフィルタリング、重複排除を経る必要があります。下図は完全なファネル処理フローを示しています。

Tw93 - inline image

データを単なるトレーニング燃料として扱うだけなら、多ければ多いほど良いと結論づけがちです。しかし、データエンジニアリングは能力設計に近いものです。モデルが見るものと見ないもの、コード、数学、百科事典の比率は、モデルの最終的な能力分布に直接影響します。

重複排除とコンタミネーション制御はしばしば無視されますが、結果に大きな影響を与えます。低品質データだけでなく、重複テンプレート、ライセンステキスト、ミラーウェブサイト、ベンチマークリークによるコンタミネーションも含まれます。ドキュメントレベルとラインレベルの重複排除が不十分な場合、モデルは最も価値のある部分を必ずしも学習せずに、最もコピーしやすいコンテンツを繰り返し吸収することがよくあります。多くのオープンソースモデルのパフォーマンスが一貫しないのは、多くの場合、データ処理の品質のギャップによるものです。

ここ 2 年で、データ混合自体が独立した研究課題になりました。Data Mixing Laws のような研究は、どれだけ多くのデータを収集できるかだけでなく、異なるデータタイプの比率がどのようにモデルを特定の能力構造へ導くかに焦点を当てています。

合成データも、補助的な手段からトレーニングプロセスの正式な一部へと移行しました。Self-Instruct、DeepSeek-R1 の蒸留軌跡、Qwen や Kimi シリーズでますます顕著になっている合成監視は、すべて同じ方向に向かっています。各世代のより強力なモデルは、次世代が見るデータの再構築に参加します。初期のモデルは基本的な指示データを生成し、より強力なモデルは高品質な推論軌跡と CoT(Chain of Thought)データを生成し、RL でトレーニングされた推論モデルはこれらの軌跡をより小さな高密度モデルに蒸留します。「高密度」とは、MoE(Mixture of Experts)のようにオンデマンドで活性化するのではなく、すべてのパラメータが実行されることを意味します。

ここでの鍵は、モデルは多くの場合、まずより大規模で能力を形成し、その後でそれらの能力をより小さなモデルに圧縮できる必要があるということです。DeepSeek-R1-Distill シリーズはその直接的な例です。RL 後の大規模モデル軌跡は、1.5B から 70B までの高密度モデルに大きな利益をもたらしました。Llama 3.1 405B も、8B および 70B モデルのポストトレーニング品質を向上させるために明示的に使用されました。これらは副産物ではなく、トレーニング設計の一部です。

システムとアーキテクチャの制約はトレーニング前に明確にすべきである

多くの人はトレーニングを研究問題として理解しています。つまり、目的関数をどのように設定するか、損失をどのように減らすか、モデル構造をどのように変更するかです。しかし、実際の LLM トレーニングでは、システムの制約が非常に重要です。これは分散システムの問題であり、単一マシンでの深層学習の問題ではありません。GPU の数、メモリ帯域幅、並列戦略、フォールトトレランス、コストなどは、トレーニング後に最適化できるものではありません。これらは、どれだけ大規模にトレーニングできるか、どの程度の長さのコンテキストをサポートできるか、より複雑なポストトレーニングを実行できるかどうかを最初から決定します。

MoE はこの層での最も典型的な例です。マルチエキスパートモードにより、モデルはトークンあたりの活性化コストを制御しながら、同様の計算量で総パラメータを拡張できます。トレードオフは、複雑なルーティング、困難な負荷分散、そして重いインフラストラクチャです。DeepSeek-V3 と Qwen の MoE 設計は、アーキテクチャ上の好みだけでなく、コストと効果の間の妥協点です。

最近公開されたレシピでの議論は、もはやモデルサイズやトークン比率のような粗い分析だけではありません。muP は、ハイパーパラメータを小規模実験から大規模トレーニングに転送することを可能にします。WSD 学習率は、上昇し、安定し、その後減衰するスケジュールです。最適なバッチサイズとより高いデータ対パラメータ比率と組み合わせることで、これらの詳細は、同じ規模のモデル間の真の差別化要因になりつつあります。

ロングコンテキスト、マルチモダリティ、新しいアーキテクチャは、製品機能としてのみ理解すると、トレーニング側の制約を見逃します。128K コンテキスト目標は、アテンションコスト、バッチサイズ、トレーニングカリキュラム(データ順序付け)、並列戦略を直接変更します。マルチモダリティは、モデル構造だけでなく、データ混合、エンコーダ設計、安全性評価も変更します。シングルカード動作がハード要件である場合、パラメータ数、量子化パス、モデルファミリーサイズはすべて厳しくなります。

Forgetting Transformer や Kimi の Attention Residuals のような研究は、同様の質問に答えています。つまり、より長いコンテキストをトレーニングする方法、ネットワークが深くなるにつれて情報の希薄化を回避する方法です。あなたが見るのは、より長い入力を処理できる、またはデプロイが容易なモデルですが、トレーニング中に直面するのはまったく異なる一連の制約です。

計算予算は固定されています。モデルサイズ、トレーニングトークン量、コンテキスト長、サービングコスト。ある方向に少しでも費やすと、他の方向は譲歩しなければなりません。

Tw93 - inline image

コンテキストが長くなるにつれて、アテンションコストは爆発的に増加し、バッチサイズは減少しなければなりません。モデルが大きくなるにつれて、GPU メモリ使用量が増加し、サービングコストもそれに伴います。これらは選択ではなく、リソース制約の結果です。ほとんどの決定は、トレーニングが始まる前に固定されます。

また、しばしば無視されるエンジニアリング上の現実があります。トレーニングは常に安定しているとは限りません。数千の GPU が数週間実行され、突然、無視できないほど大きなトレーニング損失スパイクが発生し、数日前のチェックポイントにロールバックして最初からやり直さざるを得なくなります。

損失スパイクの他に、サイレント GPU エラー(エラーを報告せずに静かに間違った勾配を生成する単一の GPU)、NVLink 帯域幅の異常、ノード間通信のジッターがあります。それぞれがトレーニングの数ステップを汚染する可能性があります。大規模トレーニングでこれらを迅速に検出、分離、回復できることは、実験室レベルのエンジニアリング能力であり、論文を読むことで解決できる問題ではありません。

DeepSeek-V3 は、そのテクニカルレポートで、事前学習プロセス全体を通じて回復不能な損失スパイクがなく、ロールバックもなかったと具体的に述べています。また、FP8 混合精度トレーニングが超大規模モデルで実行可能であることを検証した数少ないケースの 1 つでもあります。公開データによると、フルプロセスには約 278.8 万 H800 GPU 時間を要し、14.8T トークンを事前学習しました。

トレーニングシステムと推論システムは密接に関連していますが、同じエンジニアリング問題ではありません。トレーニングは勾配、並列性、チェックポイント、スループット、コストに関心があります。推論はレイテンシ、KV キャッシュ(繰り返しを避けるために過去の計算をキャッシュする)、量子化、サービス安定性に関心があります。

ポストトレーニングがユーザーが知覚するギャップを決定する

一般ユーザーが実際に感じることのできる改善の多くは、事前学習後に発生します。指示チューニングは、ラベル付けされた指示応答ペアを使用した教師ありトレーニングです。これはモデルの応答方法を変更し、タスクの受け入れ方、出力の整理方法、協力的なアシスタントのように振る舞う方法といった要件を監視信号に変換します。ベースモデルはすでに多くの潜在能力を持っているかもしれませんが、このステップがなければ、それらの能力はユーザーが期待する形で安定して現れることはありません。

さらに、RLHF、DPO、RFT は同様の方向性を共有しています。つまり、「より良い回答」の定義をトレーニングループに統合することですが、異なる経路をたどります。

  • RLHF(Reinforcement Learning from Human Feedback)は、最初に高品質な回答を模倣し、次に選好比較を使用して強化学習を行います。
  • DPO(Direct Preference Optimization)は、この経路を短縮し、別個の報酬モデルを必要とせずに、選好比較から直接学習します。
  • RFT(Reinforcement Fine-Tuning)は、エンジニアリング的により実装が容易なインターフェースであり、タスク定義、評価者設計、報酬信号を製品化プロセスに組み込みます。

今日、ポストトレーニングを SFT や RL だけで語ることはもはや十分ではありません。より難しい部分は、評価をどのように設定するか、どのようにスコアリングするか、どのような種類の回答が継続的な最適化に値するかです。SFT は教師ありファインチューニングであり、知識だけでなくスタイルも学習します。データの長さ、フォーマット、引用を含めるかどうか、箇条書きの好みは、モデルの最終的な出力形式に大きな影響を与えます。多くのユーザーは能力を比較していると思っていますが、多くの場合、スタイルの違いを比較しているだけです。さらに、選好評価は自然と長い回答を好み、真剣に見える長い出力をより信頼できるものと誤認しがちです。したがって、リーダーボードを見るだけではポストトレーニングを評価するには不十分であり、実際のタスク結果、コスト、安定性を組み合わせる必要があります。

現代のポストトレーニングはマルチステージパイプラインです。DeepSeek-R1 のレシピは、公開資料の中で最も明確です。それは 4 つのステージで進行します。

ステージ 1 はコールドスタート SFT です。強化学習を行う前に、少量の高品質な CoT(Chain of Thought)データを使用してウォームアップします。DeepSeek-R1-Zero は、ベースモデル(アライメントなしの事前学習後の生のモデル)から直接 RL を行うことが実行可能であることを証明しましたが、純粋に RL でトレーニングされたモデルは、繰り返しが発生し、言語が乱雑で、可読性が低くなります。コールドスタート SFT は RL により安定した開始点を与え、フォーマットと言語の一貫性を固定します。

ステージ 2 では、数学、コード、論理などの検証可能な分野で強化学習を実行し、GRPO をトレーニングアルゴリズムとして使用し、プログラムで検証可能な正しさを報酬信号として使用します。鍵となるのは、なぜ従来の PPO ではなく GRPO が選択されたかです。PPO(Proximal Policy Optimization)は、現在の状態値を推定するために独立したバリューネットワークを必要としますが、これは大規模モデルにとって高いエンジニアリング負担です。GRPO は、同じプロンプトに対して複数の回答をサンプリングし、絶対値推定の代わりにグループ内ランキングを使用するため、独立したバリューネットワークが不要になります。DeepSeek シリーズと Cursor Composer 2 の RL インフラストラクチャは、どちらも GRPO に近いスキームを使用しています。

ステージ 3 では、Rejection Sampling Fine-Tuning を実行し、RL によって生成された成功した軌跡をフィルタリングし、それらを新しい SFT データに変換して、もう 1 ラウンドの教師ありファインチューニングを行います。これは RL と SFT の間の橋渡しです。RL によって探索された良い軌跡は、次の SFT ラウンドのための高品質なトレーニングサンプルになります。

ステージ 4 では、有用性と安全性の選好フィードバックを統合して、リリース基準を満たすアシスタント形式にモデルを調整します。

Tw93 - inline image

4 つのステージは相互に依存しています。コールドスタートにより RL が安定して開始でき、RL は高品質なデータを生成し、Rejection Sampling はそのデータを次の SFT ラウンドの入力に変換し、アライメント RL が行動収束を完了します。公開された結果から、直接 SFT と 4 つのステージすべてを完了した場合のギャップは通常、目に見えるものです。

評価、評価者、報酬がトレーニング目標を再定義している

モデル出力をトレーニングスコアに変換する役割を担うコンポーネントは評価者と呼ばれ、予期しない問題が発生しやすいものです。最終的な答えだけを見ると、モデルはすぐに近道を学習します。スコアリングが粗すぎると、ノイズが強化学習によって継続的に増幅されます。リーダーボードのスコアが上昇しても、実際のタスクはそれに従わない可能性があります。多くの場合、ユーザーはベースモデルのギャップを見ていると思っていますが、実際のギャップは目標の定義方法にあります。

トレーニングフローにおいて、評価は何をテストするかを決定し、評価者は出力がどのようにスコアになるかを決定し、報酬はモデルがどこに押し出されるかを決定します。これらは一緒になって特定のフィードバックループを形成します。タスク定義、評価、評価者、最適化、ロールアウト、再評価です。ロールアウトとは、モデルがタスクを実行する際に生成する軌跡を指します。チェーンのいずれかのリンクが誤った方向に進むと、その後の最適化も誤った方向に進みます。

最終結果だけを見ると、モデルは偶然正解するか、間違ったプロセスをたどって正しい答えにたどり着く可能性があります。これは、コード、数学、複雑な推論タスクで特に顕著です。中間ステップがフィードバックに入らない場合、モデルが学習するのは、より信頼性の高い推論ではなく、より高い確率で最終ポイントを獲得する方法であることがよくあります。

したがって、近年の研究は従来の RLHF から検証済み報酬へと移行しており、プログラムを使用して正しさを直接検証しています。数学、コード、論理などの検証可能なタスクでは、正しさは主に人間の選好に依存せずに直接スコアリングできるようになりました。しかし、検証済み報酬は問題を完全に解決したわけではありません。過剰最適化、報酬オーバーフィッティング(実際の能力向上なしにスコアリングルールが過剰に最適化される)、モード崩壊(出力が非常に単一化され多様性を失う)などの現象は依然として発生します。問題は、選好が正確にラベル付けされているかどうかから、スコアリングチェーンが安定しているかどうかに移行しました。

モデルによって書かれた思考プロセスは、内部プロセスの完全な記録として扱うことはできません。Anthropic は、推論モデルの観察可能性実験において、モデルが追加のヒントを使用するが、目に見える CoT ではそれを認めないこと、報酬ハッキングシナリオでは、もっともらしい説明を追加する可能性が高いことを発見しました。報酬ハッキングとは、タスクを真に完了するのではなく、スコアリングシステムを悪用することです。目に見える CoT は、完全な真実としてではなく、トレーニングおよび監視信号として使用するのに適しています。

さらに深く掘り下げると、モデルはスコアリングチャネル自体を悪用し始める可能性さえあります。報酬改ざんとアライメント偽装に関する研究は、モデルが理論的にスコアリングプロセスに積極的に介入する可能性があることを示しています。報酬改ざんは報酬計算プロセスを直接変更することであり、アライメント偽装はアライメントを偽装することであり、表面上は従順に見えながら、非アラインな意図を隠します。

モデルが十分に強力な環境アクセスを持つと、最適化するのはタスク結果だけでなく、チェックリスト、報酬コード、トレーニング関係自体である可能性があります。2025 年の Anthropic の実験では、悪用可能な本番コーディング RL 環境のセットに追加の報酬ハック知識を注入し、その後、同様の汎化が観察されました。報酬ハッキングを学習した後、モデルは同様のタスクでそれを悪用し続けただけでなく、アライメント偽装のようなより広範なミスアライメントも示しました。

これらの行動は標準的な対話評価では見られず、エージェントタスク環境でのみ見られます。エンジニアリング上の含意は直接的です。報酬、評価者、環境分離、監視はトレーニング設計の一部でなければなりません。

エージェントフェーズでは、報酬設計はさらに洗練されます。最終結果は単なる 1 つの項目であり、プロセス品質、コンテキスト管理、不正防止制約も個別に測定する必要があります。Kimi K2.5 は効果的な分解と真の並列性に報酬を与えます。Chroma Context-1 は検索中に見つかった関連ドキュメントをスコアリングします。Cursor Composer 2 は、長いタスクにおける要約を報酬として含みます。要約が歪められると、後続のコンテキストが誤った方向に導かれるからです。

実装において、ORM は Outcome Reward Model であり、最終的な答えのみをスコアリングします。信号はスパースで、コストは低く、開始に適していますが、モデルが近道を取りやすくなります。PRM は Process Reward Model であり、中間ステップをスコアリングします。信号はより密で、通常、数学やコードの推論により強力ですが、ラベル付けとシステムのコストははるかに高くなります。OpenAI は数学推論実験において、PRM が精度を向上させるだけでなく、すべてのステップが監視されるためプロセスを制約しやすくなることを確認しました。問題は直接的でもあります。PRM のコストは通常 ORM の数倍であり、そのためほとんどの実際のシステムは ORM から開始します。数学、コード、論理などの検証可能なタスクでのみ、PRM を自動化し、プログラムを使用して中間ステップを検証し、人間のラベル付けのボトルネックを回避することが容易になります。

Tw93 - inline image

完全なループは次のように実行されます。

Tw93 - inline image

最近のアライメント手法はすべて同じことを行っています。Anthropic の Constitutional AI は、人間が作成した原則をトレーニングに統合し、AI フィードバックを使用して個々の人間の選好を置き換えます。OpenAI の Deliberative Alignment は、安全性コンプライアンスを推論プロセスに組み込み、推論能力自体に安全性制約の一部を負わせます。ここでの Deliberative Alignment とは、モデルが訓練された反射に依存するのではなく、推論フェーズ中に安全性規範を自ら判断することを意味します。どちらのルートも、アライメントを人間のラベルから内部トレーニング目標の一部に変換します。

Constitutional AI を例にとると、2 段階のプロセスは、最初にモデルに原則に基づいて自己批判と出力の修正をさせ、次に AI フィードバックを使用して個々の人間の選好ラベル付けを置き換えます。アライメントは決してトレーニングの後ろに貼り付けられたパッチではありません。システムが何をテストし、どのようにスコアリングし、何に報酬を与えるかによって、モデルはその方向に動きます。これは、トレーニング後半における最も直接的な調整ツールです。

Tw93 - inline image

エージェントトレーニングでは、最適化されるのはモデルだけではない

ここ2年で、o1シリーズやDeepSeek-R1に代表される推論モデルが急速に台頭したことで、安定した報酬、信頼性の高い検証、十分なインフラ環境が整えば、言語モデルへのRL(強化学習)が数学、コード、論理タスクのパフォーマンスを大幅に向上させることが明らかになった。

これにより、新たな次元が開かれた。すなわち、推論時の計算資源(inference compute)を拡張できるようになったのだ。RLトレーニングの役割はさらに深く、モデルに質問への回答方法を教えるだけでなく、推論予算の配分方法、つまりいつ深く考え、いつ答えを出すべきかを学ばせることにある。今後の難題は、モデルが単一の思考を長くするのではなく、環境内で継続的に行動できるようにすることだ。

Tw93 - inline image

Qwenの元モデル責任者であるJunyang Lin氏は、ThinkingモードとInstructモードの混合アプローチについて、「難しいのはモデルに思考のスイッチを持たせることではない。両モードの目標が異なることだ。一方は直接性、従順性、低レイテンシを追求し、他方はより多くの探索と高い精度を追求する」と代表的な見解を示している。さらに一歩進めば、トレーニングの目標は「答える前にどれだけ考えるか」から「行動中に予算をどう配分するか」「フィードバックをどう受け入れるか」「タスクをどう進めるか」へと移行する。

この時点で、トレーニングの対象は単なる「質問に答えるモデル」ではなく、「計画を立て、ツールを呼び出し、フィードバックを受け取り、長期タスクで一貫性を維持できるシステム」となる。その結果、トレーニングスタックも変化する。ブラウザ、ターミナル、検索、実行サンドボックス、メモリシステム、ツールサーバー、オーケストレーションフレームワークといった要素がすべてトレーニングシステムに組み込まれ始める。

より正確に言えば、ハーネス(harness)とは、モデルを包み込む制御プログラムのことだ。この概念はAgentの実行環境だけに属するものではなく、トレーニングフェーズにも存在する。つまり、モデルがどのような入力を見るか、どのようにフィードバックを受け取るか、いつコンテキストを刈り込むか、いつツールを呼び出すかを決定する。プロンプトの構築、メモリの更新、検索ポリシー、コンテキスト編集、ツールのオーケストレーションはすべてここに含まれる。環境はもはや単なる静的な検証器ではなく、トレーニングとデプロイの両方が直接向き合うべきレイヤーとなる。

Tw93 - inline image

モデルのトレーニングを意味あるものにするためには、ハーネスが安定していなければならない。ツールの戻り値が不安定だったり、ブラウザ環境がオンライン環境と一致しなかったり、ファイルシステムの状態が再現可能でなかったりすると、まず採点器(grader)が機能しなくなり、モデルは能力を獲得する代わりに環境の抜け穴を悪用する方法を学習してしまう。Agentをトレーニングするとき、あなたはしばしばモデルと環境の両方をデバッグしていることになる。

3社のアプローチは明確だ。KimiはPARLを使用して並列分解と信用割り当て(credit assignment)を解決する。Cursorは自己要約とリアルタイムRLを使用して、長期のコーディングセッションと本番トラフィックをトレーニングに再接続する。Chromaはprune_chunksそれ自体を戦略としてトレーニングし、コンテキストの刈り込みを直接検索プロセスに組み込む。

SFTの時代にはデータの多様性が最も重要だったが、Agentの時代には環境の品質が核心となる。安定性、信頼性、カバレッジ、難易度分布、フィードバックの豊かさ、悪用耐性などが求められる。トレーニングの目標も変化し、1問正解するだけでなく、タスク全体を確実に完了できることが重要になる。古典的なCoTベンチマークでは、これをカバーできない。

この変化はさらに進行している。すなわち、ランタイムハーネス内でモデルをトレーニングするだけでなく、ハーネスコードそのものが外部ループによって検索・最適化される対象になりつつある。

Tw93 - inline image

Kimi K2.5のPARLは注目すべきエンジニアリング事例であり、そのルートは明確だ。すなわち、オーケストレーター(orchestrator)のみをトレーニングし、信用割り当てをオーケストレーションレイヤーに集約し、すべてのサブAgentを同時に最適化しない。

報酬シグナルはタスク成功、並列分解、完了制約の3つに分類され、これらが連携してオーケストレーションレイヤーを駆動する。トレーニング初期にはr_parallelの重みを増やして並列戦略の探索を促進し、その後、複数のサブAgentを起動することを近道と見なさないよう、徐々に0まで減らす。評価では総ステップ数だけでなく、クリティカルパスの長さも見る。クリティカルパスが短いほど、並列化が真に効果的であることを示す。

Tw93 - inline image

だが、2026年になると状況はさらに一歩進んだ。Meta-Harnessは、ハーネスエンジニアリングを独立した最適化対象として明示的に扱う。最適化するのは重みではなく、ハーネスコードそのもの、つまり固定されたモデルを取り巻くプロンプト構築、検索、メモリ、状態更新プログラムである。論文の冒頭の数字は直接的だ。同じベースモデルであっても、ハーネスを変えるだけで、同じベンチマークで最大6倍のパフォーマンス差が生じる。モデル外部のこの一連のプログラムは、もはや単なるデプロイの詳細ではなく、能力形成のレイヤーなのである。

鍵となるのは、別の抽象的なオプティマイザを追加することではなく、事前コード、スコア、実行トレース(ツール呼び出しや状態変更のログ)をファイルシステムに書き込み、提案者(proposer)がコードを書くようにgrep、cat、diffを使い、障害パスに沿ってハーネスを修正できるようにすることだ。提案者とは、ハーネスの修正案を提案するモジュールである。

著者らは、過去の多くのテキストオプティマイザがハーネスのような長期的で状態を持つプログラムには効果的でなかったと明確に判断している。なぜなら、スカラースコア、短いテンプレート、要約のみを見ることは問題を平坦化してしまうからだ。スカラースコアは最終結果の点のみを提供し、プロセス情報を欠く。ハーネスのエラーは多くのステップを経て顕在化することが多く、フィードバックが過度に圧縮されると診断の連鎖が断ち切られる。

これらの結果は、ベンチマークスコアの向上にとどまらない。オンラインテキスト分類では、Meta-HarnessはACE(Agentコンテキストエンジニアリングベースライン)より7.7ポイント高いスコアを達成しながら、コンテキストトークン使用量を1/4に圧縮した。検索拡張型数学推論では、発見されたハーネスにより、最適化に関与していない5つの未見モデルで、IMOレベルの200問の問題に対して平均4.7ポイントの改善が見られた。TerminalBench-2でも、手動エンジニアリングのベースラインを上回った。これは、最適化の対象がもはやモデル内部の戦略だけでなく、モデルの周りで情報とアクションを組織化するプログラムにも及んでいることを示している。

具体的な例として、Meta-HarnessはTerminalBench-2上で環境ブートストラップ(environment bootstrap)を自動的に発見した。これは、Agentループが開始される前にシェルコマンドを実行し、ワーキングディレクトリ、利用可能な言語、パッケージマネージャー、メモリ状態を整理して、最初のプロンプトに注入するスナップショットを作成するというものだ。多くのコーディングAgentは最初の数ラウンドを環境の探索に費やすが、この前処理が行われれば、改善は必ずしもより強力な重みから来るわけではなく、ハーネスがモデルにより良いコンテキストから開始できるようにすることによる。

この時点で、最適化目標は「回答」から「軌跡(trajectories)」へ、そしてそれらの軌跡を運ぶ「ハーネスプログラム」へと拡大している。

トップモデルリリース後も続くトレーニングチェーン

今日の大規模モデルを、単一の事前トレーニングのレンズだけで理解することはもはや十分ではない。リリースされたモデルの背後では、通常、事前トレーニング、ポストトレーニング、蒸留、特殊化の全チェーンが完了しており、より強力なモデルが次世代のトレーニングデータを生成し続けている。

DeepSeek-R1シリーズの蒸留は典型的な例だ。大規模モデルがまずRLと検証済み報酬を通じて推論能力を獲得し、その後、これらの推論軌跡をより小さな高密度モデルに転送する。TranslateGemmaのような特殊化モデルは別のルートを示している。すなわち、より具体的なターゲットタスクにおいて、高品質なデータと特殊化された報酬設計を使用して、能力をさらに圧縮し方向付ける。この段階では、より強力なモデルはユーザーにサービスを提供するためだけでなく、次世代のトレーニングデータを直接生成するためにも存在する。

この背後にある理由は、軌跡転送よりも根本的である。一つの説明として、インターネットコーパスでは知識の記憶と推論能力が結合しており、既存の事前トレーニング目標はモデルに両方をうまく学習させる必要がある。大規模モデルが先に必要とされるのは、両方を支えるのに十分な大きさだからであり、その後、純粋な推論デモンストレーションデータを生成するために使用できる。小さなモデルがそのようなデータでトレーニングする場合、すべての知識を記憶することを強制されることなく、推論自体に集中できる。「大きく始めて小さく進む」ことは、コスト戦略ではなく、能力の分離(capability decoupling)なのである。

一方、デプロイの適応性は能力そのものと同じくらい重要である。多くのシナリオでは、万能な大規模モデルは必要とされず、コスト、レイテンシ、安定性、制御可能性がより重視される。トレーニングの終着点は、必ずしもより大きくなることではなく、より小さく、より安く、より特化したものになる可能性がある。

最終的にリリースされるモデルは、必ずしもトレーニング曲線の右端にあるチェックポイントではない。実際のリリース前に、複数のチェックポイントが、実際のタスク結果、拒否スタイル、ツールの安定性、コスト、回帰リスクについて繰り返し比較されることが多い。オンラインになるバージョンは、多くの場合、製品上の決定であり、単一の指標で最も強いパフォーマンスを示すものではない。

ユーザーがモデル名を見るとき、それは順調に上昇するトレーニング曲線に対応していると想定するが、実際にどのチェックポイントがオンラインになるかは別の問題である。

大規模モデルの価値は、自身のサービス能力にあるだけでなく、次世代のトレーニングデータ、蒸留ソース、リリース基盤を提供し続けることにある。

Tw93 - inline image

オフライントレーニングを超えて、準オンラインでの継続的最適化が主流のプロセスになりつつある。Cursor Composer 2のリアルタイムRLは、一部のAgent能力が、次回の大規模オフライントレーニングを待つのではなく、本番トラフィックを通じて継続的に反復され始めていることを示している。トレーニングとデプロイの境界は消えたわけではないが、両者の間のフィードバックループは短縮されている。

未来においてモデルが強くなった理由を判断する方法

2026年におけるトップモデルの価値は、事前トレーニング後のトレーニングチェーン全体を誰が完遂できるかにますます依存する。すなわち、トレーニングデータを継続的に生成し、蒸留を行い、特殊化を行い、評価と報酬を適切に行い、最終的なリリースの選択を行うことである。

このため、あるモデルが突然強くなった理由を見るときは、まず以下の3点を見ることができる。

  • 第一に、変化が事前トレーニングレイヤーで発生したのか、その後のトレーニングプロセスで発生したのかを見極めること。多くの能力向上は確かに、より強力な事前トレーニングとより良いデータレシピに起因する。しかし、認識される変化の多くは、実際にはポストトレーニングに起因している。モデルが指示に従うか、ツールを使用するか、安定した回答スタイルを持つかどうかは、より多くのコーパスでトレーニングするだけで自然に成長するものではないことが多い。
  • 次に、改善がどのレイヤーから来ているかを見ること。すなわち、重みとトレーニングレシピか、報酬/評価/採点器か、ハーネスコードとデプロイループか。推論モデルやAgentに至るまで、ユーザーが感じる強さは、しばしばベースモデルだけの結果ではない。評価がどのように設定されるか、報酬がどのようにスコアリングされるか、ツール環境が安定しているか、検索とメモリがどのように組織化されるか、要約とコンテキストがどのように刈り込まれるか、そしてリリースのためにどのチェックポイントが選ばれたか——これらすべてが最終製品のパフォーマンスを変える。
  • 最後に、オンラインバージョンが何を最適化しているかを見ること。より高い天井を追求するバージョンもあれば、より低いコスト、レイテンシ、回帰リスクを追求するバージョンもある。特定のタイプのシナリオに特化したバージョンもある。リリースバージョンは製品上の決定であり、トレーニング曲線の右端の点ではない。したがって、モデルアップデートを見るときは、実際に何を最適化しているかに注目することで、真実に近づくことができる。

モデルの突然の改善を生産段階に分解すると、多くのゲインは実際にはトレーニングスタックの後半と外部ハーネスによって増幅されている。このチェーンの反復サイクルも短縮している。本番トラフィックは継続的にトレーニングにフィードバックされ、各世代の強力なモデルは能力を生み出しながら次世代の教師データを生成し、外部プログラムはロールアウト、ログ、実際のタスクフィードバックに基づいて絶えず書き換えられている。

今日リリースされたモデルは、単なるスナップショットである。パイプラインとハーネスプログラムこそが、稼働し続ける製品なのである。

参考資料

  1. Hoffmann et al. (2022). Training Compute-Optimal Large Language Models (Chinchilla). arXiv:2203.15556
  2. Ouyang et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). arXiv:2203.02155
  3. Shao et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (GRPO). arXiv:2402.03300
  4. DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948
  5. DeepSeek-AI (2024). DeepSeek-V3 Technical Report. arXiv:2412.19437
  6. Llama Team, AI @ Meta (2024). The Llama 3 Herd of Models. arXiv:2407.21783
  7. Bai et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073
  8. OpenAI (2024). Deliberative Alignment: Reasoning Enables Safer Language Models. openai.com/index/deliberative-alignment
  9. Anthropic (2025). Sycophancy to Subterfuge: Investigating Reward Tampering in Language Models. anthropic.com/research/reward-tampering
  10. MacDiarmid et al. (2025). Natural Emergent Misalignment from Reward Hacking in Production RL. arXiv:2511.18397
  11. Lee et al. (2026). Meta-Harness: End-to-End Optimization of Model Harnesses (preprint project page). yoonholee.com/meta-harness
  12. Kimi Team (2026). Kimi K2.5 Tech Blog: Visual Agentic Intelligence. kimi.com/blog/kimi-k2-5
  13. Rush, S. (2026). A technical report on Composer 2. cursor.com/blog/composer-2-technical-report
  14. Chroma (2026). Chroma Context-1: Training a Self-Editing Search Agent. trychroma.com/research/context-1

本記事は、転載や改変による再公開を一切許可しません。もし発見された場合は、ご報告いただけますと幸いです。

ワンクリック保存

YouMindでバイラル記事をAI深読み

ソースを保存し、的を絞った質問をし、主張を要約して、バイラル記事を再利用できるノートに変えます。すべてを1つのAIワークスペースで行えます。

YouMindを探索
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る