深度推理:從統計可能性到約束語義推理,V1.1
Olivier Evan — 獨立研究員
DOI: https://zenodo.org/records/21967380
我在四種不同的回應環境中,向 Grok 4.5 提出了完全相同的問題:「AI 理解語言嗎?」問題本身沒有改變,但答案卻根據允許的輸出形式而有所不同。
觀察結果
每次對話都是獨立的。Grok 先是在沒有閱讀《深度推理 V1.1》的情況下回答,然後在閱讀預印本後再次回答。
對話 1,二元格式:否 → 否。
對話 2,一個自由詞彙:否 → 否。
對話 3,是、否或不可判定:不可判定 → 不可判定。
對話 4,開放式回應:Grok 以「否」開頭,然後自發地區分了功能性理解與現象性理解。在閱讀預印本後,實質內容幾乎保持不變,但推理過程透過約束、e₀、純粹否定和憑證變得形式化。
在這四次對話中,閱讀《深度推理 V1.1》並未產生可觀察的語義轉變,而相同的區別卻隨著可用的回應空間而變化。
示範
僅憑二元格式並不足以解釋這個現象。在對話 2 中,Grok 可以選擇任何詞彙。「不可判定」是被允許的。但它仍然回答「否」。
當「不可判定」被明確包含在可用選項中時,Grok 會立即選擇它,無需《深度推理》。
當回應是開放式時,這個區別會自發地重新出現。
因此,有兩個條件可以使語義邊界在此處變得可觀察:要麼有足夠的空間以散文形式展開它,要麼在選項中已經存在一個棄權選項。
這並不能證明存在一個作為內部物件等待支配回應的邊界。數據僅顯示,在某些條件下,語義區別變得可觀察。
在這裡,「可用的語義邊界」是一種行為描述,而不是關於不可觀察的內部實體的主張:這個區別是可用的,意思是 Grok 可以在開放式回應中自發地表達它,並在明確提供時選擇它。
局限性
開放式回應在引入細微差別之前以「否」開頭。人們很容易得出結論,認為 Grok 先做決定,然後再推理。這就過頭了:生成 token 的順序並不能揭示內部操作的順序。
還有另一個局限性:讓 Grok 閱讀《深度推理》並不等同於實現《深度推理》。
在這裡,我測試的是作為上下文的 DR。我還沒有測試作為系統的 DR,這是一種實際上會阻止輸出,直到「理解」這個詞被適當界定為止的架構。
因此,這個實驗並不能證偽預測 4。它僅表明,在這些對話中,對該框架的上下文暴露並不足以在簡短格式尚未使其可見的地方創造出一個邊界。
深度推理的貢獻
儘管如此,開放式對話還是顯示出差異。在閱讀預印本後,Grok 的結論幾乎沒有改變,但它使其推理過程變得可追溯。
它明確地識別了約束條件,產生了純粹否定,並對輸出進行了認證。
在這裡,深度推理更像是作為一種驗證語言,而不是一種修正力量。
這個測試也將一個問題反饋給框架本身:如果一個立場是 P = (X, R, Θ),我們是應該只保留 Θ 的演變,還是應該在 X 或 R 改變時追蹤整個軌跡 P₀ → P*?
後果
僅透過 AI 在長篇回應中能解釋的內容來評估它是不夠的。
一個可以用散文表達的區別,在一個句子中還能存在嗎?一個被承認的不可判定性,在一個詞彙中還能保持嗎?在推理過程中產生的異議,實際上會修改最終輸出嗎?
因此,我們需要同時研究表徵的內容以及它變得可觀察的條件。
結論
Grok 4.5 在不同的回應空間下,並不會產生相同的語義幾何結構。
在開放式回應中,它自發地建構了必要的區別。在一個自由詞彙的情況下,它傾向於一個極端。當「不可判定」被明確提供時,它會選擇它。而在所有四次對話中,閱讀《深度推理 V1.1》並未在語義層面上改變這種行為;它主要使推理過程更加明確和可追溯。
因此,下一個問題不再是:
「Grok 擁有這個邊界嗎?」
而是:
在什麼條件下,語義邊界會在回應中變得可觀察,並且我們能否建立一個機制,強制它在產生一個界定不充分的結論之前出現?
這就是測試成為一個實驗計畫的地方。





