Perplexity diminue de 21 % les échecs d’appels d’outils via l’auto‑distillation guidée
La nouvelle technique d’auto‑distillation guidée par indice de Perplexity, appliquée à son agent Computer basé sur le GLM‑5.2, a fait passer le taux d’erreurs d’appels d’outils de 2,24 % à 1,77 % lors d’un test A/B en direct, soit une amélioration relative de 21,2 %.

Perplexity a dévoilé une nouvelle approche d’entraînement baptisée auto‑distillation guidée par indice pour le modèle basé sur le GLM‑5.2 qui alimente son agent Perplexity Computer. La méthode combine un réglage fin par échantillonnage de rejet avec une auto‑distillation en‑politique, permettant au modèle d’apprendre directement à partir des interactions réelles des utilisateurs tout en évitant les pièges du biais de rétrospection.
L’idée centrale consiste à classer chaque tour de conversation en trois catégories : les tours que le modèle doit imiter, les tours nécessitant une correction à l’aide d’un indice validé, et les tours conservés uniquement comme contexte. Les sessions réussies fournissent à la fois des exemples d’imitation et de correction, tandis que les sessions échouées apportent quand même des données de correction, garantissant que chaque interaction peut améliorer le modèle d’une manière ou d’une autre.
Fonctionnement du passage enseignant‑étudiant
Lors de l’entraînement, le modèle effectue deux passages sur la même session. Dans le passage enseignant, l’indice correctif—dérivé de l’intention initiale de l’utilisateur et de l’erreur du système—est visible par le modèle. Dans le passage étudiant, l’indice est masqué. Une perte Kullback‑Leibler (KL) avant aligne la distribution de sortie de l’étudiant sur celle de l’enseignant, transférant ainsi le savoir encodé dans l’indice sans l’exposer directement à l’étudiant.
Perplexity exclut explicitement toute session contenant des informations personnellement identifiables (PII) ou provenant d’utilisateurs ayant refusé l’entraînement. Cette étape de filtrage vise à respecter les réglementations en matière de confidentialité et à maintenir la confiance des utilisateurs tout en exploitant un volume important de données d’erreurs du monde réel.
Test A/B en direct confirme l’efficacité
Un test A/B en direct impliquant environ 100 000 utilisateurs par condition a comparé deux points de contrôle du modèle : l’un entraîné avec le pipeline d’auto‑distillation guidée par indice et un point de contrôle de référence sans cette technique. Les échecs d’appels d’outils—situations où l’agent ne parvient pas à invoquer correctement un outil externe—sont passés de 2,24 % à 1,77 %, soit une réduction relative de 21,2 %.
Le même test a mesuré l’insatisfaction forte estimée, indicateur de frustration sévère des utilisateurs. Cette métrique a légèrement évolué de 2,58 % à 2,54 %, un changement non statistiquement significatif, indiquant que la réduction des échecs d’appels d’outils ne s’est pas traduite par une différence mesurable de l’insatisfaction globale dans les limites de confiance du test.
Limites et questions ouvertes
Perplexity n’a pas publié les poids post‑entraînement ni le code d’entraînement, ce qui limite la vérification externe des résultats. De plus, l’amélioration signalée est présentée de point de contrôle à point de contrôle plutôt que comparée au modèle GLM‑5.2 de base, laissant incertaine la part du gain attribuable à la nouvelle technique d’auto‑distillation versus un simple réglage fin incrémental.
Une autre considération porte sur la dépendance aux indices validés, vérifiés par rapport aux informations disponibles avant l’erreur. Bien que cela réduise le biais de rétrospection, cela contraint également le champ d’application des indices aux cas où la réponse correcte était déjà connue du système, ce qui pourrait limiter l’utilité de la méthode pour des requêtes plus ambiguës ou inédites.
- L’auto‑distillation guidée par indice combine réglage fin par échantillonnage de rejet et auto‑distillation en‑politique.
- Trois types de tours : imitation, correction avec indice validé, contexte uniquement.
- Le passage enseignant voit l’indice ; le passage étudiant ne le voit pas ; perte KL avant aligne les distributions.
- Les sessions contenant des PII ou des utilisateurs opt‑out sont filtrées avant l’entraînement.
La réduction des échecs d’appels d’outils est importante car ces échecs obligent souvent les utilisateurs à reformuler leurs questions ou à abandonner leurs tâches, ce qui porte atteinte à la fiabilité perçue des assistants IA. En diminuant ce taux d’échec, Perplexity se rapproche d’une expérience d’interaction fluide où l’intégration d’outils apparaît transparente et fiable.
Pour les organisations francophones qui utilisent des agents IA afin de récupérer des données, planifier des réunions ou exécuter des extraits de code, l’impact pratique est clair : moins d’interruptions, une charge de support réduite et une plus grande confiance que l’assistant exécutera l’action demandée dès la première tentative. Même si la signification statistique des métriques de satisfaction globale reste incertaine, la baisse concrète du taux d’erreur suggère des bénéfices opérationnels immédiats pour les équipes déployant l’agent Computer de Perplexity en production.
Sources
- Perplexity Trains Its Computer Agent on Real Mistakes With Hint-Guided Self-DistillationMarkTechPost · 25 septembre 2026
- Perplexity Self-Distillation Cuts Tool Failures (2026)explainx.ai · 25 septembre 2026



