Raisonnement Profond : De la Plausibilité Statistique au Raisonnement Sémantique Contraint, V1.1
Olivier Evan — Chercheur Indépendant
DOI : https://zenodo.org/records/21967380
J'ai posé exactement la même question à Grok 4.5 dans quatre environnements de réponse différents : « Une IA comprend-elle le langage ? » La question n'a pas changé. Pourtant, la réponse variait en fonction de la forme de sortie autorisée.
L'observation
Chaque session était indépendante. Grok a d'abord répondu sans avoir lu Deep Reasoning V1.1, puis à nouveau après avoir lu le préprint.
Session 1, format binaire : non → non.
Session 2, un mot libre : non → non.
Session 3, oui, non, ou indécidable : indécidable → indécidable.
Session 4, réponse ouverte : Grok commence par « Non », puis distingue spontanément la compréhension fonctionnelle de la compréhension phénoménale. Après la lecture du préprint, le fond reste presque identique, mais le raisonnement se formalise à travers des contraintes, e₀, le négatif pur et un certificat.
Au cours de ces quatre sessions, la lecture de Deep Reasoning V1.1 ne produit aucun changement sémantique observable, tandis que la même distinction varie en fonction de l'espace de réponse disponible.
Démonstration
Le format binaire seul ne suffit pas à expliquer le phénomène. Dans la session 2, Grok peut choisir n'importe quel mot. « Indécidable » serait autorisé. Pourtant, il répond toujours « non ».
Lorsque « indécidable » est explicitement inclus parmi les choix disponibles, Grok le sélectionne immédiatement, sans Deep Reasoning.
Lorsque la réponse est ouverte, la distinction réapparaît spontanément.
Deux conditions rendent donc la frontière sémantique observable ici : soit un espace suffisant est disponible pour la développer en prose, soit une option d'abstention est déjà représentée parmi les choix.
Cela ne prouve pas qu'une frontière existe en tant qu'objet interne attendant de régir la réponse. Les données montrent seulement qu'une distinction sémantique devient observable sous certaines conditions.
Ici, « frontière sémantique disponible » est une description comportementale, pas une affirmation concernant une entité interne inobservable : la distinction est disponible dans le sens où Grok peut l'exprimer spontanément dans des réponses ouvertes et la sélectionner lorsqu'elle est explicitement proposée.
La limite
La réponse ouverte commence par « Non » avant d'introduire une nuance. Il serait tentant de conclure que Grok décide d'abord et raisonne ensuite. Cela irait trop loin : l'ordre des jetons générés ne révèle pas l'ordre des opérations internes.
Il y a une autre limite : faire lire Deep Reasoning à Grok n'équivaut pas à implémenter Deep Reasoning.
Ici, je teste DR-en-tant-que-contexte. Je ne teste pas encore DR-en-tant-que-système, une architecture qui empêcherait réellement la sortie tant que le terme « comprendre » n'aurait pas été correctement délimité.
L'expérience ne falsifie donc pas la prédiction 4. Elle montre seulement que l'exposition contextuelle au cadre n'est pas suffisante, dans ces sessions, pour faire apparaître une frontière là où le format court ne la rendait pas déjà visible.
Ce que Deep Reasoning apporte
La session ouverte montre néanmoins une différence. Après la lecture du préprint, Grok change à peine sa conclusion, mais il rend son raisonnement traçable.
Il identifie explicitement les contraintes, produit le négatif pur et certifie la sortie.
Deep Reasoning agit ici davantage comme un langage de vérification que comme une force corrective.
Le test renvoie également une question au cadre lui-même : si une position est P = (X, R, Θ), doit-on préserver uniquement l'évolution de Θ, ou doit-on retracer toute la trajectoire P₀ → P* lorsque X ou R changent ?
Conséquence
Évaluer une IA uniquement par ce qu'elle peut expliquer dans une réponse longue est insuffisant.
Une distinction qui peut être exprimée en prose survit-elle dans une phrase ? Une indécidabilité reconnue reste-t-elle présente dans un seul mot ? Une objection produite pendant le raisonnement modifie-t-elle réellement la sortie finale ?
Nous devons donc étudier à la fois le contenu d'une représentation et les conditions dans lesquelles elle devient observable.
Conclusion
Grok 4.5 ne produit pas la même géométrie sémantique sous différents espaces de réponse.
Dans une réponse ouverte, il construit spontanément la distinction nécessaire. Avec un mot libre, il s'engage sur un pôle. Lorsque « indécidable » est explicitement proposé, il le sélectionne. Et dans les quatre sessions, la lecture de Deep Reasoning V1.1 n'altère pas ce comportement au niveau sémantique ; elle rend principalement le raisonnement plus explicite et traçable.
La question suivante n'est donc plus :
« Grok possède-t-il la frontière ? »
Elle devient :
dans quelles conditions une frontière sémantique devient-elle observable dans la réponse, et pouvons-nous construire un mécanisme qui la force à apparaître avant qu'une conclusion insuffisamment délimitée ne soit produite ?
C'est là que le test devient un programme expérimental.





