深度推理:从统计可能性到约束语义推理,V1.1
Olivier Evan — 独立研究员
DOI: https://zenodo.org/records/21967380
我在四种不同的回答环境中向 Grok 4.5 提出了完全相同的问题:“AI 理解语言吗?”问题本身没有改变。然而,答案却因允许的输出形式而异。
观察结果
每次会话都是独立的。Grok 在未阅读《深度推理 V1.1》的情况下先回答了问题,然后在阅读预印本后再次回答。
会话 1,二元格式:否 → 否。
会话 2,一个自由词:否 → 否。
会话 3,是、否或不可判定:不可判定 → 不可判定。
会话 4,开放式回答:Grok 以“否”开头,然后自发地区分了功能性理解与现象性理解。阅读预印本后,实质内容几乎保持不变,但推理过程通过约束、e₀、纯否定和证书变得形式化。
在这四次会话中,阅读《深度推理 V1.1》没有产生可观察到的语义转变,而同样的区分却随着可用的回答空间而变化。
演示
仅凭二元格式不足以解释这一现象。在会话 2 中,Grok 可以选择任何词。“不可判定”也是允许的。但它仍然回答“否”。
当“不可判定”被明确列为可用选项时,Grok 立即选择了它,无需深度推理。
当回答是开放式时,这种区分会自发地再次出现。
因此,有两个条件使得语义边界在此处可被观察到:要么有足够的空间以散文形式展开它,要么在选项中已经存在一个弃权选项。
这并不能证明存在一个边界作为内部对象等待支配回答。数据仅表明,在某些条件下,语义区分变得可被观察到。
在这里,“可用语义边界”是一种行为描述,而不是关于不可观察的内部实体的主张:这种区分是可用的,因为 Grok 可以在开放式回答中自发地表达它,并在被明确提供时选择它。
局限性
开放式回答以“否”开头,然后才引入细微差别。人们很容易得出结论,认为 Grok 先做出决定,然后再进行推理。这有点过头了:生成 token 的顺序并不能揭示内部操作的顺序。
还有另一个局限性:让 Grok 阅读《深度推理》并不等同于实现深度推理。
在这里,我测试的是作为上下文的 DR。我还没有测试作为系统的 DR,即一种实际上会阻止输出,直到“理解”一词被适当界定的架构。
因此,该实验并不能证伪预测 4。它只表明,在这些会话中,对框架的上下文暴露不足以让边界出现在简短格式尚未使其可见的地方。
深度推理带来的新内容
然而,开放式会话确实显示出了差异。阅读预印本后,Grok 的结论几乎没有改变,但它的推理过程变得可追溯。
它明确地识别了约束,产生了纯否定,并对输出进行了认证。
深度推理在这里更多地扮演着验证语言的角色,而不是纠正力量。
该测试还向框架本身提出了一个问题:如果一个立场是 P = (X, R, Θ),我们是应该只保留 Θ 的演变,还是应该在 X 或 R 发生变化时追踪整个轨迹 P₀ → P*?
后果
仅凭 AI 在长篇回答中能解释的内容来评估它是不够的。
一个可以用散文表达的区分,在句子中还能存在吗?一个被承认的不可判定性,在单个词中还能保持吗?在推理过程中产生的反对意见,是否真的修改了最终输出?
因此,我们需要同时研究表征的内容以及它变得可被观察的条件。
结论
Grok 4.5 在不同的回答空间下不会产生相同的语义几何结构。
在开放式回答中,它自发地构建了必要的区分。使用一个自由词时,它偏向于一个极端。当“不可判定”被明确提供时,它选择了它。而在所有四次会话中,阅读《深度推理 V1.1》并没有在语义层面改变这种行为;它主要使推理过程更加明确和可追溯。
因此,下一个问题不再是:
“Grok 拥有这个边界吗?”
而是:
在什么条件下,语义边界在回答中变得可被观察,并且我们能否构建一个机制,强制它在产生一个界定不充分的结论之前出现?
这就是测试变成一个实验项目的地方。





