Le problème du « super-poulet » d'Anthropic

@SebaTheOracle
ANGLAISil y a 3 jours · 18 juil. 2026
132K
207
17
9
415

TL;DR

Cody Peterson soutient que l'accent mis par Anthropic sur l'excellence et la sécurité des modèles individuels crée un problème de « super-poulet », où l'expérience produit globale pâtit par rapport à des concurrents plus centrés sur l'utilisateur comme OpenAI.

Comment le laboratoire le plus intelligent du monde a accidentellement expédié le mauvais produit

J'ai demandé au modèle public le plus performant d'Anthropic de réécrire un essai sur Anthropic. Il n'en a jamais eu l'occasion. J'ai joint ce brouillon et tapé sept mots anodins : « Réécrivez, rendez ça percutant. Formatez pour Twitter. » L'application a automatiquement basculé la tâche de Fable 5 vers Opus 4.8. Son explication était simple : « Les garde-fous de Fable ont signalé ce message. »

Pour être précis, il ne s'agissait pas d'un simple limiteur de débit. Fable n'a pas répondu puis refusé. Le mécanisme de sécurité d'Anthropic a intercepté la requête avant que le modèle sélectionné ne puisse répondre et l'a redirigée vers un autre modèle. Anthropic a expliqué que c'est exactement ainsi que le système fonctionne : lorsque le classifieur de Fable bloque une requête, celle-ci est envoyée à Opus 4.8. L'entreprise a également reconnu avoir délibérément élargi la marge de sécurité du classifieur, sachant que cela entraînerait davantage de faux positifs sur des travaux bénins. (Anthropic

Je ne sais pas pourquoi le garde-fou s'est déclenché, et je n'affirme pas qu'Anthropic a censuré des critiques. Le fait vérifiable – et suffisamment étrange – est qu'une simple demande de révision a été interceptée par un système de sécurité dont l'avertissement mentionnait les faux positifs dans le travail légitime de codage, de cybersécurité et de biologie. C'était une ouverture presque comiquement parfaite pour un essai sur l'équipe qui a créé ce que beaucoup considèrent comme le système d'IA le plus brillant de la planète.

Cet essai examine ce qui se produit lorsqu'un système devient tellement préoccupé par la performance de ses parties individuelles qu'il perd de vue le résultat que l'ensemble du système est censé produire. Le modèle peut être brillant, le garde-fou peut fonctionner exactement comme prévu, et la politique de prix peut avoir un sens parfait pour ceux qui l'ont créée. Le travail de l'utilisateur peut néanmoins rester inachevé.

Pièce à conviction A :

Cody Peterson - inline image

J'ai demandé à Fable 5 de modifier cet article. Les garde-fous d'Anthropic ont signalé la requête et l'ont basculée vers Opus 4.8.

Les poules et leurs œufs

En 1982, le généticien de l'université Purdue William Muir a lancé une expérience d'élevage inhabituelle avec des poules pondeuses. Muir voulait savoir ce qui se passerait si la productivité était sélectionnée au niveau du groupe plutôt que de l'individu. Au lieu de ne reproduire que les oiseaux individuels les plus productifs – une mesure de la production individuelle pure – il a logé des poules apparentées ensemble et a sélectionné des groupes familiaux entiers en fonction de leurs performances collectives. La cage, plutôt que la poule isolée, est devenue l'unité de sélection. (PubMed

Margaret Heffernan a ensuite transformé le programme d'élevage technique de Muir en la célèbre histoire des « superpoules ». Pour les managers, son récit est devenu un avertissement sinistre : embaucher les plus forts et les plus intelligents ne produit pas toujours les meilleurs résultats. Dans sa version, un groupe de poules a été autorisé à rester un groupe ordinaire – pas de superpoules autorisées. Un second groupe a été reproduit de manière répétée à partir des poules individuelles les plus productives ; elle les appelle « les poules vedettes ». (Purdue Alumnus

Les résultats ont été spectaculaires. Sur six générations, la mortalité annuelle dans le groupe sélectionné de Muir est passée de 68 % à 8,8 %. Sur la même période, la production est passée de 91 à 237 œufs par poule logée – soit 2,6 fois sa production initiale. Lors d'une comparaison directe ultérieure effectuée dans des groupes de douze, une lignée commerciale sélectionnée pour la performance individuelle a subi 89 % de mortalité à 58 semaines d'âge. La lignée sélectionnée en groupe de Muir n'a subi que 20 % de mortalité, tandis que le témoin non sélectionné a subi 54 % de mortalité. Dans ce même environnement de groupe, le groupe sélectionné a surpassé les vedettes commerciales en termes d'œufs par poule logée, de masse d'œufs et d'œufs par poule par jour. (PubMed

Pendant ce temps, le groupe de superpoules était décharné et épuisé. Dans la version de l'expérience qui a rendu l'histoire célèbre, six des neuf poules vedettes étaient mortes et les trois restantes avaient été plumées à vif. Le groupe s'était, pour ainsi dire, littéralement entre-tué. (Purdue Alumnus

La leçon n'a jamais été que la médiocrité bat le talent. La véritable leçon est que votre production reflétera ce que vous récompensez. Sélectionnez uniquement pour la performance individuelle et vous risquez de construire accidentellement une équipe plus faible, car les traits qui permettent à un individu de dominer peuvent réduire la productivité de tous ceux qui l'entourent. Sélectionnez les individus en fonction de leur contribution au groupe, et des qualités qui disparaissent dans un classement individuel – compatibilité, retenue, fiabilité et coopération – deviennent soudainement visibles.

La véritable contribution d'une poule n'est pas seulement le nombre d'œufs qu'elle peut pondre. Elle inclut ce que sa présence permet – ou empêche – aux autres poules de produire. Muir n'avait pas abandonné la productivité au profit de l'harmonie. Il avait découvert que, dans un système social, l'harmonie fait partie de la productivité. La véritable unité de performance n'a jamais été la poule. C'était le poulailler.

J'ai appris une version de cette leçon durement acquise en dirigeant ma propre entreprise de construction. Pendant des années, une aide fiable était si difficile à trouver dans notre métier particulier qu'une vedette semblait être un salut. Mais les personnes qui ressemblaient à des vedettes arrivaient trop souvent avec une taxe cachée : exceptions supplémentaires, gestion supplémentaire, moral endommagé et frictions que le reste de l'équipe devait absorber.

Finalement, j'ai cessé de demander seulement : « À quel point cette personne est-elle bonne dans son métier ? » et j'ai commencé à demander : « Qu'arrive-t-il au travail de tous les autres lorsque cette personne rejoint l'équipe ? » La personne qui semble la plus forte n'est pas toujours celle qui rend réellement l'entreprise plus forte. Un maître artisan qui ralentit chaque métier adjacent, consomme l'attention du contremaître ou éloigne les personnes fiables peut être impressionnant en isolation et coûteux en pratique. Un travailleur plus discret qui rend toute l'équipe plus fiable peut contribuer bien plus que ce que sa production individuelle ne révèle.

Le superpoulailler

Anthropic a vraiment réuni un groupe extraordinaire de poules très intelligentes. Une analyse de SignalFire en 2025, basée sur des données d'emploi publiques, estimait que les ingénieurs étaient huit fois plus susceptibles de passer d'OpenAI à Anthropic que l'inverse, et près de onze fois plus susceptibles de venir de DeepMind. Elle estimait également que 80 % des employés d'Anthropic embauchés au moins deux ans auparavant restaient jusqu'à la fin de leur deuxième année, contre 78 % chez DeepMind et 67 % chez OpenAI. (SignalFire

Ces chiffres ne décrivent pas une entreprise qui peine à attirer ou à retenir les talents. Ils décrivent un aimant à vedettes.

Cela ne signifie pas que les employés d'Anthropic s'entre-tuent. Ce serait une analogie trop facile, et les chiffres sur les talents ne le prouvent pas. Le danger le plus important est plus subtil. Lorsqu'une entreprise peut crédiblement mettre en avant des chercheurs exceptionnels, une rétention inhabituellement élevée et des modèles de pointe, il devient facile de considérer l'excellence des parties individuelles comme une preuve que l'ensemble du système fonctionne.

L'expérience de Muir démontre pourquoi cette inférence n'est pas fiable. Le danger n'est pas l'intelligence elle-même. Le danger est de mesurer la performance à un niveau trop bas.

Le modèle n'est pas le produit

L'industrie de l'IA est construite autour de superpoules : des chercheurs célèbres, des modèles de référence, des packages de rémunération énormes et des pages de lancement remplies de superlatifs. À l'intérieur du laboratoire, la hiérarchie est évidente. À l'extérieur, nous ne voyons que les œufs.

La Silicon Valley a un angle mort évident : votre équipe peut être extraordinaire tandis que le produit que vous avez construit reste frustrant, inaccessible ou peu fiable.

Les utilisateurs quotidiens ne jugent pas un modèle par son équipe de poules talentueuses ou ses références. Nous n'avons que le modèle, l'application, les garde-fous, les limites d'utilisation, le prix, le support client.

Deux entreprises, à 74 minutes d'intervalle

Le 17 juillet, Anthropic a répondu à la demande écrasante de Fable par un compromis. À partir du 20 juillet, les abonnés Max et Team Premium recevraient Fable dans le cadre de leurs forfaits, mais avec la moitié de leurs limites normales. Les utilisateurs Pro et Team Standard continueraient d'accéder au modèle via des crédits d'utilisation et recevraient un crédit unique de 100 $.

https://x.com/claudeai/status/2078302415804379218

Soixante-quatorze minutes plus tard, Thibault Sottiaux d'OpenAI annonçait que les limites d'utilisation avaient été réinitialisées pour tous les utilisateurs payants de Codex et ChatGPT Work.

Il ne s'agissait pas d'offres économiquement identiques. Anthropic mettait en place une politique d'accès continue pour un modèle exceptionnellement gourmand en calcul, tandis qu'OpenAI accordait une réinitialisation temporaire après un lancement de produit difficile. Cette nuance compte. Le contraste dans la posture produit était néanmoins difficile à manquer.

https://x.com/thsottiaux/status/2078320950488297917

OpenAI n'agissait pas depuis une position de perfection. L'entreprise avait récemment raté des parties de son propre déploiement desktop et ChatGPT Work, et Sottiaux avait admis publiquement que l'entreprise « n'avait pas tout à fait réussi ». Les utilisateurs avaient rencontré des paramètres de calcul élevé déroutants, des coûts d'utilisation opaques et une refonte qui perturbait les flux de travail familiers. OpenAI a répondu en modifiant les paramètres par défaut, en promettant de réparer l'interface et en réinitialisant à plusieurs reprises l'utilisation pour que les clients puissent continuer à travailler.

Une organisation justifiait la rareté.

L'autre fabriquait de la bonne volonté.

OpenAI n'est pas un groupe de poules médiocres. Elle regorge également de talents exceptionnels, et elle a commis de sérieuses erreurs culturelles et produit. La différence significative à ce moment n'est pas l'intelligence, ni dans les modèles ni dans le poulailler. C'est ce que le système semble récompenser lorsque la pression arrive.

Dans ses meilleurs moments, la posture produit actuelle d'OpenAI est résolument ordinaire. Elle commence par la tâche de l'utilisateur : Que cette personne essaie-t-elle d'accomplir ? Qu'est-ce qui l'empêche de terminer ? Où se trouve la friction, et à quelle vitesse pouvons-nous la supprimer ? Les réinitialisations ne prouvent pas qu'OpenAI a résolu la culture produit, mais elles démontrent aux utilisateurs un instinct pour absorber une partie du coût de ses propres erreurs plutôt que de leur laisser en porter tout le poids.

La posture produit d'Anthropic communique trop souvent quelque chose de différent : Nous avons créé une intelligence extraordinaire, et notre responsabilité principale est de déterminer combien vous pouvez en utiliser en toute sécurité. Cela peut être une posture institutionnelle cohérente, mais ce n'est pas une posture centrée sur le client. Les œufs d'or sont impressionnants, mais ils ne nourrissent pas la famille lorsque le poulailler ne vous laisse pas les collecter.

Une entreprise s'organise de plus en plus autour de la tâche de l'utilisateur. L'autre s'organise encore autour du risque systémique. Les deux entreprises doivent se soucier des deux questions, mais la question qu'elles posent en premier façonne le produit qu'elles construiront finalement. La différence n'apparaît pas seulement dans les déclarations de mission. Elle apparaît dans le routage, les limites, la tarification, la communication et la volonté de réparer la confiance lorsque le système échoue.

Le poulailler entier

La culture n'est pas ce qu'une entreprise dit d'elle-même. La culture, c'est ce que ses systèmes rendent facile – et ce qu'ils rendent difficile – de manière répétée.

Anthropic n'a pas besoin de moins de personnes brillantes. Elle a besoin d'une définition plus large du succès, qui inclut non seulement l'intelligence du modèle et la force des garde-fous, mais aussi l'accès, la fiabilité, la transparence et la confiance. Du côté du client, la mesure finale est étonnamment simple : Puis-je compter sur l'ensemble de ce système pour terminer le travail ?

Muir n'a pas rendu ses poules moins productives. Il a changé le niveau auquel la productivité était mesurée et a découvert que la performance collective contenait des informations qu'un comptage individuel d'œufs ne pouvait capturer. Les oiseaux sélectionnés pour la performance du groupe sont devenus plus sains et plus productifs parce que l'interaction destructive n'était plus invisible pour la métrique. La coopération n'est pas une alternative sentimentale à la production. C'est l'une des conditions qui ont rendu une plus grande production possible.

La course aux modèles de pointe entre dans la même phase. Lorsqu'un seul laboratoire peut produire une intelligence extraordinaire, le modèle le plus intelligent peut sembler indistinct du meilleur produit. Une fois que plusieurs laboratoires peuvent produire une intelligence extraordinaire, l'avantage concurrentiel se déplace vers l'ensemble du système.

Le modèle le plus intelligent du monde n'est plus automatiquement le meilleur produit ou le meilleur ajustement au marché. Claude est peut-être la plus grosse et la plus intelligente des poules de l'IA, mais personne en dehors du poulailler ne note les poules. Nous ne comptons que les œufs.

Sources

William M. Muir, « Group Selection for Adaptation to Multiple-Hen Cages », Poultry Science (1996).

https://pubmed.ncbi.nlm.nih.gov/8786932/

William M. Muir, « Incorporation of Competitive Effects in Breeding Programs », Purdue University.

https://web.ics.purdue.edu/~bmuir/papers/muir%20group%20selection%20genetics%20final%20v2.pdf

Margaret Heffernan, A Bigger Prize.

https://www.hachettebookgroup.com/titles/margaret-heffernan/a-bigger-prize/9781610392914/

Margaret Heffernan, « Is the Professional Pecking Order Doing More Harm Than Good? », NPR/TED Radio Hour.

https://www.northcountrypublicradio.org/news/npr/443412777/is-the-professional-pecking-order-doing-more-harm-than-good

SignalFire, « The State of Tech Talent Report — 2025 ».

https://www.signalfire.com/blog/signalfire-state-of-talent-report-2025

Anthropic, « Claude Fable 5 and Claude Mythos 5 ».

https://www.anthropic.com/news/claude-fable-5-mythos-5

Divulgation IA : J'ai développé l'argument et rédigé le brouillon original à partir de ma propre expérience, puis j'ai utilisé ChatGPT pour m'aider à rechercher, restructurer et réécrire des parties de l'essai. J'ai relu et révisé le texte final et assume la responsabilité de ses affirmations et conclusions.

**Curieux de savoir ce que je construis ?

Une IA qui cite ses sources :**

Rencontrez Sebastian →

Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux