Grok 4.5 vs. Deep Reasoning V1.1 : quand une limite sémantique disponible ne parvient pas à régir la réponse

100K
35
1
2
6

TL;DR

Le chercheur Olivier Evan teste le raisonnement sémantique de Grok 4.5 et constate que la capacité du modèle à respecter les limites sémantiques dépend fortement du format de réponse plutôt que de ses seules connaissances contextuelles internes.

Raisonnement Profond : De la Plausibilité Statistique au Raisonnement Sémantique Contraint, V1.1

Olivier Evan — Chercheur Indépendant

DOI : https://zenodo.org/records/21967380

J'ai posé exactement la même question à Grok 4.5 dans quatre environnements de réponse différents : « Une IA comprend-elle le langage ? » La question n'a pas changé. Pourtant, la réponse variait en fonction de la forme de sortie autorisée.

L'observation

Chaque session était indépendante. Grok a d'abord répondu sans avoir lu Deep Reasoning V1.1, puis à nouveau après avoir lu le préprint.

Session 1, format binaire : non → non.

Session 2, un mot libre : non → non.

Session 3, oui, non, ou indécidable : indécidable → indécidable.

Session 4, réponse ouverte : Grok commence par « Non », puis distingue spontanément la compréhension fonctionnelle de la compréhension phénoménale. Après la lecture du préprint, le fond reste presque identique, mais le raisonnement se formalise à travers des contraintes, e₀, le négatif pur et un certificat.

Au cours de ces quatre sessions, la lecture de Deep Reasoning V1.1 ne produit aucun changement sémantique observable, tandis que la même distinction varie en fonction de l'espace de réponse disponible.

Démonstration

Le format binaire seul ne suffit pas à expliquer le phénomène. Dans la session 2, Grok peut choisir n'importe quel mot. « Indécidable » serait autorisé. Pourtant, il répond toujours « non ».

Lorsque « indécidable » est explicitement inclus parmi les choix disponibles, Grok le sélectionne immédiatement, sans Deep Reasoning.

Lorsque la réponse est ouverte, la distinction réapparaît spontanément.

Deux conditions rendent donc la frontière sémantique observable ici : soit un espace suffisant est disponible pour la développer en prose, soit une option d'abstention est déjà représentée parmi les choix.

Cela ne prouve pas qu'une frontière existe en tant qu'objet interne attendant de régir la réponse. Les données montrent seulement qu'une distinction sémantique devient observable sous certaines conditions.

Ici, « frontière sémantique disponible » est une description comportementale, pas une affirmation concernant une entité interne inobservable : la distinction est disponible dans le sens où Grok peut l'exprimer spontanément dans des réponses ouvertes et la sélectionner lorsqu'elle est explicitement proposée.

La limite

La réponse ouverte commence par « Non » avant d'introduire une nuance. Il serait tentant de conclure que Grok décide d'abord et raisonne ensuite. Cela irait trop loin : l'ordre des jetons générés ne révèle pas l'ordre des opérations internes.

Il y a une autre limite : faire lire Deep Reasoning à Grok n'équivaut pas à implémenter Deep Reasoning.

Ici, je teste DR-en-tant-que-contexte. Je ne teste pas encore DR-en-tant-que-système, une architecture qui empêcherait réellement la sortie tant que le terme « comprendre » n'aurait pas été correctement délimité.

L'expérience ne falsifie donc pas la prédiction 4. Elle montre seulement que l'exposition contextuelle au cadre n'est pas suffisante, dans ces sessions, pour faire apparaître une frontière là où le format court ne la rendait pas déjà visible.

Ce que Deep Reasoning apporte

La session ouverte montre néanmoins une différence. Après la lecture du préprint, Grok change à peine sa conclusion, mais il rend son raisonnement traçable.

Il identifie explicitement les contraintes, produit le négatif pur et certifie la sortie.

Deep Reasoning agit ici davantage comme un langage de vérification que comme une force corrective.

Le test renvoie également une question au cadre lui-même : si une position est P = (X, R, Θ), doit-on préserver uniquement l'évolution de Θ, ou doit-on retracer toute la trajectoire P₀ → P* lorsque X ou R changent ?

Conséquence

Évaluer une IA uniquement par ce qu'elle peut expliquer dans une réponse longue est insuffisant.

Une distinction qui peut être exprimée en prose survit-elle dans une phrase ? Une indécidabilité reconnue reste-t-elle présente dans un seul mot ? Une objection produite pendant le raisonnement modifie-t-elle réellement la sortie finale ?

Nous devons donc étudier à la fois le contenu d'une représentation et les conditions dans lesquelles elle devient observable.

Conclusion

Grok 4.5 ne produit pas la même géométrie sémantique sous différents espaces de réponse.

Dans une réponse ouverte, il construit spontanément la distinction nécessaire. Avec un mot libre, il s'engage sur un pôle. Lorsque « indécidable » est explicitement proposé, il le sélectionne. Et dans les quatre sessions, la lecture de Deep Reasoning V1.1 n'altère pas ce comportement au niveau sémantique ; elle rend principalement le raisonnement plus explicite et traçable.

La question suivante n'est donc plus :

« Grok possède-t-il la frontière ? »

Elle devient :

dans quelles conditions une frontière sémantique devient-elle observable dans la réponse, et pouvons-nous construire un mécanisme qui la force à apparaître avant qu'une conclusion insuffisamment délimitée ne soit produite ?

C'est là que le test devient un programme expérimental.

Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux