Meta fait atteindre à un modèle de 8 milliards de paramètres le niveau de Claude Opus 4.5
Des chercheurs de Meta AI et de l'université de l'Illinois à Urbana-Champaign ont entraîné le modèle ouvert Qwen3-8B avec une nouvelle méthode de renforcement, EvoHarness-RL. Sur ALFWorld, un benchmark de tâches séquentielles à plusieurs étapes, il atteint 96,9% de réussite, devant les 96,4% de Claude Opus 4.5, soit 49 points de plus que sa base ReAct.

Des chercheurs de Meta AI et de l'université de l'Illinois à Urbana-Champaign (UIUC) ont présenté EvoHarness-RL, une méthode d'entraînement par renforcement pour les agents d'intelligence artificielle. Selon un article publié le 29 août par AI Times, l'équipe a appliqué cette méthode à Qwen3-8B, un modèle ouvert de seulement 8 milliards de paramètres, pour atteindre 96,9% de réussite sur ALFWorld, un benchmark de tâches séquentielles à plusieurs étapes. Ce résultat dépasse les 96,4% obtenus par le modèle phare d'Anthropic, Claude Opus 4.5, avec la méthode ReAct classique, et représente un bond de 49,0 points par rapport à la version de base de Qwen3-8B en ReAct (47,9%). Le média américain VentureBeat a couvert la même recherche séparément le 28 août, rapportant que GPT-4.1 et GPT-5, d'OpenAI, avaient eux aussi progressé de 22,1 et 25,7 points respectivement lorsque la méthode leur était appliquée uniquement au moment de l'inférence, sans réentraînement.
BPE : diviser l'état d'un agent en croyance, progression et expérience
Au cœur d'EvoHarness-RL se trouve une abstraction d'état que les chercheurs appellent BPE — Belief, Progress, Experience (croyance, progression, expérience). La croyance désigne ce que l'agent sait actuellement de son environnement, la progression les sous-objectifs accomplis et le travail restant, et l'expérience les compétences, les échecs passés et les priorités de recherche accumulés au fil des tâches précédentes. Pour gérer ces trois états, l'agent ne dispose que de quatre méta-actions : suivre (vérifier l'état actuel), valider (consigner la progression), rappeler (retrouver une expérience passée) et noter (enregistrer une information nouvelle). Les chercheurs expliquent que là où les systèmes de mémoire externe et d'usage d'outils suivaient jusqu'ici des règles fixées à l'avance par des humains, BPE entraîne l'agent à décider lui-même quand noter quelque chose et quand rappeler une expérience passée.
Deux étapes d'entraînement : ajustement supervisé, puis apprentissage par renforcement
L'entraînement se déroule en deux temps. Lors du premier, l'ajustement fin supervisé (SFT), Qwen3-8B apprend d'abord la signification de BPE et l'usage des quatre méta-actions. Lors du second, l'équipe applique une méthode qu'elle appelle « optimisation de politique relative de groupe sensible au coût » (cost-aware GRPO), qui entraîne le modèle à juger lui-même si le recours au harnais contribue réellement à la réussite de la tâche. Selon VentureBeat, la co-autrice Xuying Ning explique que « le harnais optimal change souvent selon le modèle » et qu'« une mémoire qui ne fait qu'ajouter suppose que davantage de contexte est toujours utile, ce qui n'est pas nécessairement vrai ». Lorsque les chercheurs ont retiré la composante Expérience lors d'un test d'ablation, le taux de réussite moyen est tombé à 48,6% — la chute la plus marquée des trois composantes.
- ReAct de base : 47,9%
- BPE appliqué seulement à l'inférence (sans réentraînement) : 56,4%
- Avec ajustement supervisé (SFT) : 68,6%
- Avec SFT et apprentissage par renforcement (EvoHarness-RL, résultat final) : 96,9%
- Claude Opus 4.5 — 96,4% en ReAct de base, 98,5% avec BPE (+2,1 points)
- GPT-4.1 — de 47,9% à 70,0% avec BPE à l'inférence (+22,1 points)
- GPT-5 — de 60,7% à 85,0% avec BPE à l'inférence (+25,7 points)
- Systèmes comparés — SkillRL 89,9%, SkillOS 80,2%
Le modèle tient aussi en terrain inconnu, avec un phénomène de « recuit du harnais »
Les chercheurs ont aussi testé le modèle sur de nouvelles tâches ALFWorld jamais vues pendant l'entraînement. Qwen3-8B de base plafonne à 50,0% ; l'ajout de BPE à l'inférence seule le fait monter à 77,6% ; et la version entièrement entraînée avec EvoHarness-RL atteint 86,6%. Pendant l'entraînement, les chercheurs ont observé un phénomène qu'ils nomment « recuit du harnais » (harness annealing) : au début, l'agent sollicitait le harnais externe à presque chaque étape, mais à mesure que l'entraînement progressait, les schémas de tâches répétées se sont internalisés, le recours au harnais a chuté fortement, et son usage s'est stabilisé autour d'un appel par épisode en moyenne. La mémoire d'expérience a évolué de la même façon : elle accumule d'abord rapidement des compétences variées et des erreurs, puis consolide les informations redondantes et élimine les compétences peu utiles, de sorte qu'elle ne conserve que l'essentiel plutôt que de s'accumuler sans limite. Dans un exemple cité par les chercheurs, un agent cherchant une bouilloire a constaté que son souvenir de l'emplacement du plan de travail ne correspondait plus à l'environnement réel, et s'est corrigé lui-même en notant que l'information précédente était erronée.
Du développement logiciel à la conformité financière
Les chercheurs estiment que cette architecture dépasse les environnements de jeu et s'applique à des tâches réelles. En développement logiciel, la croyance correspondrait à l'état actuel d'une base de code et de ses composants, la progression aux tâches, tests et dépendances accomplis, et l'expérience aux corrections passées et aux cas d'erreur. Dans la finance et la conformité, la croyance couvrirait les règles applicables et les pièces justificatives, la progression les contrôles effectués et les exceptions en suspens, et l'expérience les problèmes récurrents et la façon dont ils ont été traités par le passé. Grâce à ce que l'équipe appelle des « adaptateurs d'environnement », chaque organisation peut conserver ses propres outils internes et sa gestion d'état tout en ajoutant BPE comme une couche de coordination apprenable, sans remplacer les outils déjà en place. La recherche a été publiée sur le serveur de prépublication arXiv (arXiv:2608.05446v1).
Ce résultat intéresse directement les entreprises françaises qui développent des agents IA. Jusqu'ici, traiter de façon fiable des tâches complexes à plusieurs étapes semblait imposer de payer l'accès à un modèle frontière coûteux, chez Anthropic ou OpenAI. La démonstration qu'un modèle ouvert de 8 milliards de paramètres, correctement outillé en mémoire et en gestion d'outils, peut égaler ces modèles ouvre la voie à des déploiements moins coûteux, y compris hébergés sur une infrastructure propre plutôt que via une API tierce. Le résultat reste toutefois circonscrit à un seul benchmark, ALFWorld, et devra être confirmé sur des cas d'usage réels avant d'en tirer des conclusions définitives pour la production.
Sources
- 메타, 80억 소형 AI로 '클로드 오퍼스 4.5'급 성능 구현…'에보하네스-RL' 공개AI타임스 · 29 août 2026
- Meta researchers taught an 8B AI model to match Claude Opus 4.5 — without the frontier price tagVentureBeat · 28 août 2026



