ベンチマークはもう古い

@MagnaDing
英語2026年9月04日
105K
131
5
19
119

TL;DR

AI エージェントが単なる質問への回答から複雑な実務の遂行へと移行する中で、従来のベンチマークは時代遅れになりつつあります。著者は、真の AGI を測定するために、成果に基づいたインターンシップ型の評価モデルを提唱しています。

こんにちは、AI 愛好家の皆さん!

今週、OpenAI が公式に発表しました。AGI の時代へようこそ。

GPT-6 Astra がリリースされ、OpenAI はこれを世代を超えた飛躍として売り出しています。コンピューター操作、コーディング、リサーチ、そしてこれまでは人間がずっと監視する必要があったような長くて複雑な作業において、大きな進歩を遂げたとしています。

ひとまず、そのマーケティングを額面通りに受け取ってみましょう。なぜなら、そこには業界が静かに避けてきた疑問が浮かび上がるからです。この性能を、実際にどうやって測るのか?

ここ数年、AI はベンチマークで評価されてきました。新しいモデルがリリースされるたびに、ここで 3% 向上、あそこで 7% 向上、そして昨年の春には存在しなかったベンチマークによると、なぜか 12% 賢くなったという表が付いてきます。私たちはそれらをランク付けし、色分けし、リーダーボードに並べ、勝者を決めます。モデルが基本的に質問に答えているだけの時代には、これで十分機能していました。しかし、モデルが実際に「行動」し始めた瞬間に、この方法は機能しなくなります。

ここに核心的な問題があります。ベンチマークは、単なる問題集に過ぎません。 モデルに問題を与え、答えを出させ、その答えを正解と照合する。派手なコンピューター操作のベンチマークでさえ、その実態は、あらかじめ構築された環境内で実行される、事前に用意されたタスクの集まりです。それは確かに有用です。しかし、エージェントを実際のマシンに放り込んで「何かを成し遂げろ」と指示するのとは、全くの別物です。

現実の世界には、ベンチマークファイルなど付属していません。あなたのデスクトップのどこにも、「完了」の状態が正確に定義されているものはありません。

現実のコンピュータとは、タスクの途中でクラッシュするブラウザ、昨日ひっそりと UI を変更したサイト、3 つの矛盾したバージョンがあるスプレッドシート、誰も言及しなかった権限、6 階層も深いフォルダに埋もれた PDF、最悪のタイミングでタイムアウトする API、そして「これ、ちょっとやっておいてくれる?」と言って「これ」を定義せずに立ち去る人間のことです。

エージェントは、それを自分で理解しなければなりません。そして、誰もベンチマークでうまく評価できていない部分があります。それは、最初の試みが失敗したときに、そこから回復できるかどうかです。これは、正しい答えを出すこととは全く異なるスキルです。

だからこそ、OpenAI が強化学習とコンピューター操作のトレーニングのために、数万台もの一般消費者向け Mac を購入したという報道は、見た目以上に重要な意味を持ちます。正確な数字は報告されているものの、監査されたわけではありません。しかし、その方向性は間違いありません。最先端の研究所は、モデルをチャットボックスに閉じ込めるのではなく、実際のマシン上で動作させたいと考えています。そして、これは静かに、ベンチマークというゲーム全体を壊しつつあります。

2 つのエージェントを想像してみてください。同じコンピュータ、同じ曖昧な指示です。

この市場を調査し、有望な企業を 3 社選び、財務比較表を作成し、投資委員会向けのプレゼン資料を準備してください。

これを行う正しい方法は一つではありません。何百もの方法があります。あるエージェントは 2 時間かけてブラウジングします。別のエージェントはスクリプトを書きます。3 つ目のエージェントは途中でより良いデータソースを見つけ、当初の計画を破棄します。4 つ目のエージェントは間違いを犯し、それに気づき、修正します。5 つ目のエージェントは、完全に間違った数字に基づいた見事なプレゼン資料を渡してきます。

では、どれが勝者でしょうか?ベンチマークの作成者は、あらかじめ答えを書いておくことはできません。なぜなら、答えが一つではないからです。

そして、ここからが本当に厄介なところです。エージェントを評価する上で最も難しい部分は、もはや「答えは正しかったか」ではないかもしれません。「これは実際に役に立ったのか」 です。これは言葉遊びのように聞こえるかもしれませんが、違います。

コンピューター操作のベンチマークで 95% をクリアするエージェントを、実際の会社に 1 週間放り込んでみてください。間違ったフォルダ構造を作り、稼働中のスプレッドシートを上書きし、6 時間も無駄な情報を追いかけ、2023 年の統計を自信満々に引用し、聞くことさえ思いつかない権限の壁に阻まれます。ベンチマークのタスクはすべて完璧だったのに、誰も彼を 2 週目も雇い続けようとは思わないでしょう。

次に、スコアが 85% しかないエージェントを考えてみてください。しかし、このエージェントは自分が混乱している時にそれを認識し、状況を打開するためのたった一つの質問をし、何かが壊れた時には方向転換し、静かに実際に使える成果物を納品します。どちらがより賢いのでしょうか?リーダーボードには、その答えはありません。正直なところ、私たちにもわかりません。

これが、独立したベンチマークが壁にぶつかっていると私が考える理由です。研究者が怠けているからではありません。彼らはこれまで以上に難しく、現実的なテストを構築しています。問題は、現実が常にテストよりも大きくなり続けていることです。ベンチマークを長くしたり、より多くのツール、サイト、アプリ、ステップ、ランダム性を追加したりすることはできます。しかし、それは問題ではありません。あなたは依然としてルールのあるゲームを構築しているに過ぎず、モデルがそのゲームの遊び方を学習した瞬間、振り出しに戻ってしまうのです。

ですから、私たちはスコアを目にすることになるでしょう。91.4%、94.7%、97.2%、98.1%。人々はモデル A がモデル B に勝ったかどうかで議論するでしょう。誰かが別のリーダーボードを立ち上げるでしょう。さらに別の誰かが、リーダーボードのリーダーボードを立ち上げるでしょう。そしてその間ずっと、モデルは実際のコンピュータ上で、これらの数字のどれも説明できないようなことを行っているのです。

これがベンチマークのパラドックスです。 AI が汎用知能に近づけば近づくほど、事前に用意された問題集から得られる情報は少なくなります。

では、何がそれを置き換えるのでしょうか?私は、答えは「より良いベンチマーク」ではないと思います。本質的に異なる何かだと思います。エージェントに問題を与えるのをやめ、目標を与えましょう。整頓された砂場を与えるのをやめ、散らかった砂場を与えましょう。期待された手順に従ったかどうかを評価するのをやめ、結果を出せたかどうかを評価しましょう。同じ公開テストを繰り返すのをやめ、絶えず変化する環境、これまで見たことのないプライベートなタスクに放り込みましょう。

そして、成功したかどうかだけを尋ねるのはやめましょう。どれだけ確実に成功するか、そのコストはいくらか、どれだけの時間がかかったか、どれだけ頻繁に人間の助けを必要としたか、どれだけ安全に振る舞ったか、そしてその作業が現実との接触に耐えられたかを尋ねましょう。

簡単に言えば、次世代の AI 評価は、試験というよりはインターンシップに近づくべきです。

モデルにこう尋ねるのではなく、

テストに合格しましたか?

ラップトップ、アカウント、予算、目標、そして 1 週間の時間を与えましょう。そして、それが何をするのかを見守りましょう。そうすれば、その知能についてはるかに多くのことがわかるでしょう。そして、それを標準化するのは悪夢でしょう。まさにそこが重要なのです。

現実世界の知能は、複雑で、状況依存的で、適応的で、そしてオープンエンドです。それを固定された答えを持つきれいな質問リストに単純化した瞬間、あなたは知能を測定するのをやめています。測定しているのはテストを受ける能力です。

だからこそ、Astra は私にとって特別な意味を持ちます。OpenAI は、私たちが AGI の時代に入ったと声高に宣言しています。結構なことです。しかし、それが本当なら、チャットボット用に設計された標準化試験を AGI に渡すのはおそらくやめるべきでしょう。

興味深い質問は、もはや「スコアはいくつだったか?」ではありません。「コンピュータを与えて『何かを成し遂げろ』と指示したら、何が起こるか?」 です。そして、私たちはまだ良い答えを持っていないことを、まもなく思い知ることになるでしょう。

というわけで — AGI の時代へようこそ。そして、同時に、静かに、採点不可能な AI の時代へようこそ。ベンチマークが悪くなったわけではありません。私たちが測定しようとしているものが、その枠から飛び出してしまったのです。

記事を読む

ワンクリック保存

YouMindでバイラル記事をAI深読み

ソースを保存し、的を絞った質問をし、主張を要約して、バイラル記事を再利用できるノートに変えます。すべてを1つのAIワークスペースで行えます。

YouMindを探索
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る