Grok 4.5 vs. Deep Reasoning V1.1: 가용 의미론적 경계가 응답을 제어하지 못할 때

@IntelligenceNa2
영어2026년 8월 17일
100K
35
1
2
6

TL;DR

연구원 Olivier Evan은 Grok 4.5의 의미론적 추론 능력을 테스트한 결과, 모델이 의미론적 경계를 준수하는 능력은 내부적인 맥락 지식뿐만 아니라 응답 형식에 크게 의존한다는 사실을 발견했습니다.

심층 추론: 통계적 개연성에서 제약적 의미 추론으로, V1.1

Olivier Evan — 독립 연구원

DOI: https://zenodo.org/records/21967380

저는 Grok 4.5 에게 네 가지 서로 다른 응답 환경에서 정확히 동일한 질문을 했습니다: "AI 가 언어를 이해하는가?" 질문은 변하지 않았습니다. 그러나 답변은 허용된 출력 형식에 따라 달라졌습니다.

관찰 결과

각 세션은 독립적으로 진행되었습니다. Grok 은 먼저 Deep Reasoning V1.1 을 읽지 않고 답변했고, 그런 다음 프리프린트를 읽은 후 다시 답변했습니다.

세션 1, 이진 형식: 아니오 → 아니오.

세션 2, 자유 단어 하나: 아니오 → 아니오.

세션 3, 예, 아니오, 또는 판정 불가: 판정 불가 → 판정 불가.

세션 4, 자유 응답: Grok 은 "아니오"로 시작한 후, 자발적으로 기능적 이해와 현상적 이해를 구분합니다. 프리프린트를 읽은 후에도 내용은 거의 동일하게 유지되지만, 추론은 제약 조건, e₀, 순수 부정, 그리고 증명서를 통해 형식화됩니다.

네 세션에 걸쳐, Deep Reasoning V1.1 을 읽는 것은 관찰 가능한 의미적 변화를 일으키지 않는 반면, 동일한 구분은 사용 가능한 응답 공간에 따라 달라집니다.

실증

이진 형식만으로는 이 현상을 설명하기에 충분하지 않습니다. 세션 2 에서 Grok 은 어떤 단어든 선택할 수 있습니다. "판정 불가"도 허용되었을 것입니다. 그럼에도 불구하고 "아니오"라고 답했습니다.

"판정 불가"가 선택지에 명시적으로 포함되었을 때, Grok 은 Deep Reasoning 없이 즉시 그것을 선택했습니다.

응답이 자유로울 때, 그 구분은 자발적으로 다시 나타납니다.

따라서 여기서 의미적 경계를 관찰 가능하게 만드는 두 가지 조건이 있습니다: 산문으로 전개할 충분한 공간이 있거나, 기권 옵션이 선택지에 이미 포함되어 있는 경우입니다.

이는 경계가 응답을 지배하기 위해 기다리는 내부 객체로 존재한다는 것을 증명하지 않습니다. 데이터는 단지 특정 조건에서 의미적 구분이 관찰 가능해진다는 것만을 보여줍니다.

여기서 "사용 가능한 의미적 경계"는 행동적 설명이며, 관찰 불가능한 내부 실체에 대한 주장이 아닙니다: 그 구분은 Grok 이 자유 응답에서 자발적으로 표현할 수 있고, 명시적으로 제공될 때 선택할 수 있다는 의미에서 사용 가능합니다.

한계

자유 응답은 뉘앙스를 도입하기 전에 "아니오"로 시작합니다. Grok 이 먼저 결정하고 나중에 추론한다고 결론짓고 싶은 유혹이 있을 것입니다. 그것은 지나친 비약입니다: 생성된 토큰의 순서는 내부 연산의 순서를 드러내지 않습니다.

또 다른 한계가 있습니다: Grok 이 Deep Reasoning 을 읽게 하는 것은 Deep Reasoning 을 구현하는 것과 동일하지 않습니다.

여기서 저는 맥락으로서의 DR 을 테스트하고 있습니다. 아직 "이해"라는 용어가 적절히 경계 지어질 때까지 출력을 실제로 방지하는 아키텍처인 시스템으로서의 DR 을 테스트하는 것은 아닙니다.

따라서 실험은 예측 4 를 반증하지 않습니다. 이는 단지 프레임워크에 대한 맥락적 노출이, 짧은 형식이 이미 경계를 보이게 만들지 않은 곳에서 경계가 나타나게 하기에는 충분하지 않다는 것을 보여줍니다.

Deep Reasoning 이 추가하는 것

그럼에도 불구하고 자유 세션은 차이를 보여줍니다. 프리프린트를 읽은 후, Grok 은 결론을 거의 바꾸지 않지만, 추론을 추적 가능하게 만듭니다.

제약 조건을 명시적으로 식별하고, 순수 부정을 생성하며, 출력을 인증합니다.

Deep Reasoning 은 여기서 교정력보다는 검증의 언어로서 더 작용합니다.

이 테스트는 또한 프레임워크 자체에 대한 질문을 제기합니다: 위치가 P = (X, R, Θ)라면, Θ 의 진화만 보존해야 할까요, 아니면 X 또는 R 이 변경될 때 전체 궤적 P₀ → P* 를 추적해야 할까요?

결과

AI 를 긴 응답에서 설명할 수 있는 것만으로 평가하는 것은 불충분합니다.

산문으로 표현될 수 있는 구분이 한 문장에서도 유지될까요? 인정된 판정 불가능성이 한 단어 안에 여전히 존재할까요? 추론 중에 생성된 반론이 실제로 최종 출력을 수정할까요?

따라서 우리는 표현의 내용과 그것이 관찰 가능해지는 조건을 모두 연구해야 합니다.

결론

Grok 4.5 는 서로 다른 응답 공간에서 동일한 의미적 기하학을 생성하지 않습니다.

자유 응답에서는 필요한 구분을 자발적으로 구성합니다. 하나의 자유 단어로는 한 극에 고정됩니다. "판정 불가"가 명시적으로 제공되면 그것을 선택합니다. 그리고 네 세션 모두에서 Deep Reasoning V1.1 을 읽는 것은 의미적 수준에서 이 행동을 변경하지 않으며, 주로 추론을 더 명시적이고 추적 가능하게 만듭니다.

따라서 다음 질문은 더 이상 다음과 같지 않습니다:

"Grok 이 경계를 소유하고 있는가?"

다음과 같이 바뀝니다:

어떤 조건에서 의미적 경계가 응답에서 관찰 가능해지며, 불충분하게 경계 지어진 결론이 생성되기 전에 그것이 나타나도록 강제하는 메커니즘을 구축할 수 있는가?

바로 여기서 테스트가 실험적 프로그램이 됩니다.

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기