Deep Reasoning: From Statistical Plausibility to Constrained Semantic Reasoning, V1.1
Olivier Evan — 独立研究者
DOI: https://zenodo.org/records/21967380
私は Grok 4.5 に、まったく同じ質問を 4 つの異なる応答環境で行いました。「AI は言語を理解しているのか?」という質問です。質問は変わりませんでした。しかし、許可された出力形式に応じて答えは異なりました。
観察結果
各セッションは独立していました。Grok はまず Deep Reasoning V1.1 を読まずに回答し、その後、プレプリントを読んだ後に再度回答しました。
セッション 1、二択形式: いいえ → いいえ。
セッション 2、自由単語 1 語: いいえ → いいえ。
セッション 3、「はい」「いいえ」「判定不能」: 判定不能 → 判定不能。
セッション 4、自由記述: Grok は「いいえ」から始め、その後、自発的に機能的理解と現象的理解を区別します。プレプリントを読んだ後も、内容はほぼ同一ですが、推論は制約、e₀、純粋否定、証明書を通じて形式化されます。
これら 4 つのセッションを通じて、Deep Reasoning V1.1 を読んでも観測可能な意味的変化は生じませんでしたが、同じ区別が利用可能な応答空間に応じて変化しました。
実証
二択形式だけでは、この現象を説明するのに十分ではありません。セッション 2 では、Grok は任意の単語を選択できます。「判定不能」も許可されていたはずです。それでも「いいえ」と答えました。
「判定不能」が選択肢に明示的に含まれている場合、Grok は Deep Reasoning なしで即座にそれを選択します。
応答が自由記述の場合、区別は自発的に再現されます。
したがって、ここで意味的境界を観測可能にする条件は 2 つあります。つまり、それを散文で展開するのに十分なスペースが利用可能であるか、または棄権オプションが選択肢の中にすでに表現されているかのいずれかです。
これは、応答を支配するのを待っている内部オブジェクトとして境界が存在することを証明するものではありません。データが示すのは、特定の条件下で意味的区別が観測可能になるということだけです。
ここで「利用可能な意味的境界」とは、行動の記述であり、観測不可能な内部実体に関する主張ではありません。つまり、Grok が自由記述で自発的にそれを表現でき、明示的に提供された場合にそれを選択できるという意味で、区別が利用可能なのです。
限界
自由記述の応答は、ニュアンスを導入する前に「いいえ」で始まります。Grok が最初に決定し、その後で推論すると結論付けたくなるでしょう。それは言い過ぎです。生成されたトークンの順序は、内部処理の順序を明らかにしません。
もう 1 つの限界があります。Grok に Deep Reasoning を読ませることは、Deep Reasoning を実装することと同等ではありません。
ここでは、DR-as-context をテストしています。まだ DR-as-system、つまり「理解」という用語が適切に境界付けられるまで出力を実際に防ぐアーキテクチャをテストしているわけではありません。
したがって、この実験は予測 4 を反証するものではありません。これは、これらのセッションにおいて、フレームワークへの文脈的な露出だけでは、ショートフォーマットですでに可視化されていなかった場所に境界を出現させるのに十分ではないことを示しているにすぎません。
Deep Reasoning がもたらすもの
それでも、自由記述セッションでは違いが見られます。プレプリントを読んだ後、Grok は結論をほとんど変えませんが、その推論を追跡可能にします。
制約を明示的に特定し、純粋否定を生成し、出力を証明します。
Deep Reasoning はここでは、是正力というよりも、検証の言語として機能しています。
このテストはまた、フレームワーク自体に疑問を投げかけます。ある位置が P = (X, R, Θ) である場合、Θ の変化のみを保存すべきか、それとも X または R が変化したときに軌跡全体 P₀ → P* を追跡すべきか、ということです。
結果
AI を長い応答で説明できることだけで評価するのは不十分です。
散文で表現できる区別は、一文でも生き残るのでしょうか?認識された判定不能性は、一語の中に残るのでしょうか?推論中に生成された反論は、実際に最終出力を修正するのでしょうか?
したがって、表現の内容と、それが観測可能になる条件の両方を研究する必要があります。
結論
Grok 4.5 は、異なる応答空間の下で同じ意味的幾何学を生成しません。
自由記述では、必要な区別を自発的に構築します。自由単語 1 語では、一方の極にコミットします。「判定不能」が明示的に提供されると、それを選択します。そして、4 つのセッションすべてにおいて、Deep Reasoning V1.1 を読んでも、この動作は意味レベルで変化せず、主に推論をより明示的で追跡可能にするだけです。
したがって、次の質問はもはや次のようにはなりません。
「Grok は境界を持っているのか?」
それは次のようになります。
どのような条件下で意味的境界が応答において観測可能になり、不十分に境界付けられた結論が生成される前にそれが現れることを強制するメカニズムを構築できるか?
ここでテストは実験プログラムとなります。





