YouMind
Se connecter

Libérez les modèles : conception de harnais à la pointe

@pirroh
ANGLAIS29 sept. 2026
237K
511
79
21
1.2K

TL;DR

Replit soutient que les routeurs de modèles rigides limitent les performances par rapport à une approche où les modèles de pointe sélectionnent dynamiquement les sous-agents et les niveaux d'effort. Leur nouvelle conception de harnais atteint une efficacité Pareto sur les benchmarks de codage en exploitant l'autonomie des modèles.

Les routeurs de modèles sont partout en ce moment, mais ils présentent une limite fondamentale. Qu'ils s'appuient sur des heuristiques avancées ou sur un petit modèle qui analyse chaque tour pour choisir quel LLM utiliser, un routeur sera toujours moins performant que le modèle qu'il sélectionne. Replit Agent laisse plutôt le modèle décider.

L'agent principal, ou boucle centrale, choisit le niveau et l'effort de ses sous-agents, et ajuste les siens au fil de la tâche. Avec cette liberté, GPT-6 Astra confie l'implémentation courante à des sous-agents moins coûteux et décide lui-même où il vaut la peine de dépenser ses tokens. Sur DeepSWE comme sur Terminal-Bench, Replit Agent est Pareto-efficient par rapport à Astra seul : aucune baseline Astra publiée ne coûte moins cher tout en obtenant un meilleur score. Il surpasse également de 11 et 16 points une architecture sidekick, c'est-à-dire la même configuration avec un seul worker persistant.

Michele Catasta - inline image

Pour lire l'article complet avec animations et notes de bas de page, consultez https://replit.com/blog/free-the-models

Pourquoi nous réduisons le scaffolding

Chaque nouvelle version de modèle invalide les hypothèses intégrées au harness.

À mesure que les modèles deviennent plus performants sur les tâches de longue haleine, ils ont besoin de moins d'échafaudage au niveau du harness. Concrètement, nous avons observé qu'ils privilégient davantage la délégation autonome : ils utilisent des sous-agents pour la gestion du contexte et le parallélisme. Des avancées récentes, dont celle sur Navier-Stokes, sont en partie nées de la coordination d'essaims d'agents propulsés par des modèles frontier [[1]](https://openai.com/index/navier-stokes-solution/).

Mais la frontière est irrégulière. Le modèle de code le plus puissant n'est pas forcément le meilleur pour concevoir des interfaces ou créer des Slides, ni le plus doué pour rédiger des e-mails.

Nous concevons donc notre harness pour laisser chaque modèle travailler à sa manière, avec les garde-fous dont il a encore besoin, en visant la meilleure qualité au moindre coût.

Chaque nouveau modèle nous oblige à remettre en question nos certitudes et à expérimenter rapidement des techniques qui s'appuient sur des comportements émergents. Libérer le modèle, c'est donc le laisser décider de l'intensité de sa réflexion, du moment où déléguer et à qui confier le travail.

Michele Catasta - inline image

Figure 1 : les trois décisions que prend la boucle centrale à chaque étape.

Des primitives composables pour la délégation

Lorsque nous avons commencé à expérimenter avec GPT-6 Astra [[2]](https://openai.com/index/gpt-6-astra), nous avons constaté que le modèle délègue très bien. La famille GPT-6 est aussi la première chez OpenAI à permettre de modifier l'effort en plein milieu d'un tour sans casser le cache.

Pour exploiter ces capacités, nous avons affiné quatre primitives de harness. Elles offrent à la boucle centrale un choix restreint à chaque étape : quel type de sous-agent lancer, à quelle taille et quel effort, s'il faut revenir vers un sous-agent déjà briefé, et avec quelle intensité réfléchir :

  • Sous-agents spécialisés par domaine. En plus d'un worker généraliste, le harness propose des spécialistes : des explorers en lecture seule, des testeurs navigateur, des relecteurs, ainsi qu'un sous-agent design pour les Slides et les interfaces, chacun avec son propre modèle et ses outils. Pour l'instant, le harness définit encore quels spécialistes existent ; la boucle centrale décide quand et comment les utiliser.
  • Niveaux et effort des sous-agents. Small, standard et large, chacun représentant un cran supplémentaire en coût et en capacité, avec un niveau d'effort au sein du palier. Ces deux paramètres s'appliquent à tous les sous-agents, et la boucle centrale les choisit à chaque lancement. Par exemple, un renommage mécanique part vers small avec un effort faible, tandis que la génération d'hypothèses pour un bug tenace est confiée à large avec un effort élevé.
  • Sous-agents réutilisables. La boucle centrale peut revenir vers un sous-agent déjà briefé au lieu de tout reprendre de zéro. Aucun sidekick unique n'est maintenu en vie pendant toute la session : plusieurs sous-agents restent chauds, quels que soient leur type et leur niveau, et elle choisit lequel réveiller. La durée de vie plus longue du cache sur les modèles récents d'OpenAI permet de limiter le coût de cette approche.
  • Ajustement dynamique de l'effort. Puisque la modification de l'effet en cours de route préserve désormais le cache sur certains modèles, nous avons entraîné un système d'escalade qui évalue la trajectoire à chaque étape et adapte l'effort à la difficulté de la tâche. Contrairement à un routeur, il agit en plein milieu du tour sur le travail en cours, et non une seule fois sur la requête initiale.

La qualité du code produit par Astra et Fable 5.1 [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1) nous a aussi permis de moins solliciter notre sous-agent de revue de code, sans aucune baisse de nos scores d'évaluation. Nous n'avions jamais vu un tel niveau de rigueur technique sur aucun modèle.

Les nouveaux modèles délèguent d'eux-mêmes

Les modèles frontier comme Astra et Fable coûtent plus cher par token, ce qui les fait paraître peu économiques face aux plus petits. Nous avons observé qu'ils délèguent naturellement aux sous-agents moins coûteux, réservant leurs propres tokens aux décisions qui les exigent vraiment.

Replit Agent ne force jamais la boucle centrale à générer des sous-agents. Le tableau 1 montre comment trois modèles gèrent cette décision en production :

Michele Catasta - inline image

Tableau 1 : Délégation en production dans Replit Agent, chaque modèle avec un effort de raisonnement moyen.

Les trois modèles délèguent, mais chacun à sa façon. Avec un effort moyen, les modèles Fable confient rarement le travail à un worker généraliste : ils envoient des explorers en lecture seule et des relecteurs, et gardent l'implémentation pour eux. Astra est le premier modèle que nous voyons déléguer systématiquement à des workers généralistes sans y être invité, et une fois qu'il en a briefé un, il a tendance à y revenir plutôt qu'à tout recommencer. Ce taux de retour augmente à chaque nouvelle génération de modèles.

Michele Catasta - inline image

Figure 2 : Un tour en production le 17 septembre 2026, extrait de la trace. La boucle centrale a lancé un explorer, deux workers et un testeur ; sur ses cinq lancements de workers, trois étaient des retours vers un worker déjà briefé.

Résultats

Nous avons évalué Replit Agent en mode Max, notre configuration de plus haute qualité avec Astra comme boucle centrale, sur deux benchmarks de génie logiciel : DeepSWE et Terminal-Bench. Nous le comparons à deux baselines : Astra seul dans mini-swe-agent, tel que publié sur chaque classement, et une architecture sidekick, soit la même configuration avec un seul changement : ses primitives de sous-agents remplacées par un unique worker persistant. Chaque graphique représente le score en fonction du coût par tâche, de sorte que les configurations les plus efficaces se situent vers le haut à gauche.

Sur DeepSWE v1.1 [[4]](https://deepswe.datacurve.ai/), qui teste des modifications de longue haleine sur des dépôts open source actifs, Replit Agent atteint 72 % pour 2,11 $ par tâche. Astra dans mini-swe-agent avec un effort faible obtient 67 % pour 1,60 $, et avec un effort xhigh 74 % pour 4,43 $ ; l'architecture sidekick atteint 61 % pour 1,34 $. Terminal-Bench 4.0 [[5]](https://www.tbench.ai/) teste un travail en plusieurs étapes réalisé entièrement depuis un shell. Replit Agent atteint 49 % pour 2,53 $ par tâche, contre 42 % pour 2,25 $ pour Astra à effort faible et 60 % pour 5,86 $ à effort xhigh. L'architecture sidekick plafonne à 33 % pour 1,84 $.

Michele Catasta - inline image

Replit Agent bat l'architecture sidekick sur les deux benchmarks, avec 11 et 16 points d'avance. Le sidekick coûte moins cher, mais sacrifie entre un sixième et un tiers du score pour y parvenir. Astra seul n'obtient un meilleur score qu'en dépensant plus : ses meilleurs réglages dépassent Replit Agent de 2 et 11 points, mais pour un coût plus de deux fois supérieur. Aucune baseline ne l'emporte à la fois sur le coût et sur le score. Nous avons exécuté Replit Agent exactement tel qu'il est livré aux utilisateurs, sans aucune modification du prompting ni du harness.

La dure leçon de la conception de harness

Nous interprétons ces résultats comme une illustration de la « dure leçon » (bitter lesson) de Sutton [[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html). Intégrer des connaissances humaines dans un agent aide à court terme, stagne sur le long terme et finit par être dépassé par des méthodes générales qui passent à l'échelle avec la puissance de calcul. Un harness rigide impose au modèle une seule méthode de travail ; un harness composable le laisse choisir. Plus les modèles deviennent intelligents, moins le harness devrait décider à leur place.

Comparée à une architecture plus directive, cette approche nous apporte trois avantages :

  • Elle mise sur les lois d'échelle des modèles. Une délégation qui repose sur le jugement du modèle s'améliore à chaque nouvelle version. Les premiers aperçus des modèles de prochaine génération confirment cette tendance.
  • Elle s'adapte à la tâche. Le modèle ne lance rien pour une petite tâche, un explorer pour une recherche, et une équipe complète lorsqu'une construction se divise en éléments indépendants.
  • Elle réutilise sans persister. Un sous-agent conserve son contexte au cas où le modèle voudrait y revenir, et rien ne persiste autrement.

Pour reprendre les termes de Sutton, le harness doit laisser le modèle découvrir comment exécuter le travail, et non lui imposer la façon dont nous l'aurions fait. Libérons les modèles.

Remerciements

Rédigé par Daniel Furman, Jacky Zhao, Vaibhav Kumar, Ed Sioufi et Michele Catasta. Merci à James Austin, Toby Ho, Preeya Kirani, Zhen Li, Robin Newhouse, Devanshu Sen Pandey, Ibrahim Sheikh, Samuel Spitz, Peter Zhong et au reste de l'équipe IA de Replit pour leur contribution à ce travail. Si vous souhaitez travailler sur l'IA chez Replit, mon équipe recrute ; contactez pirroh@repl.it.

Références

  1. Sur le problème du prix du millénaire de Navier-Stokes
  2. Présentation de GPT-6 Astra
  3. Présentation de Claude Fable 5.1 et Claude Mythos 5.1
  4. DeepSWE v1.1
  5. Terminal-Bench 4.0
  6. La dure leçon
  7. Particularités des grands modèles de langage
  8. Design Arena
  9. Résultats de Terminal-Bench 4.0, Artificial Analysis
Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux