Perplexity verkleint tool‑call fouten met 21 % dankzij hint‑gestuurde zelf‑distillatie
De nieuwe hint‑gestuurde zelf‑distillatietechniek van Perplexity voor zijn GLM‑5.2‑gebaseerde Computer‑agent verlaagt tool‑call fouten van 2,24 % naar 1,77 % in een live A/B‑test, een relatieve verbetering van 21,2 %.

Introductie van de nieuwe trainingsmethode
Perplexity heeft een nieuw trainingsconcept geïntroduceerd, hint‑gestuurde zelf‑distillatie, voor het GLM‑5.2‑model dat de Perplexity Computer‑agent aandrijft. De methode combineert rejection‑sampling fine‑tuning met on‑policy zelf‑distillatie, zodat het model direct kan leren van echte gebruikersinteracties zonder de valkuilen van hindsight‑bias.
Deze aanpak richt zich op het minimaliseren van tool‑call fouten, een kritieke metriek waarbij de agent faalt in het correct aanroepen van externe hulpmiddelen. Door de feedbackloop te integreren in de trainingspipeline, kan Perplexity de foutkans verlagen zonder handmatig gelabelde data te hoeven genereren.
Structuur van gespreksturns
Het kernidee is om elke gespreksturn te verdelen over drie categorieën: turns die het model moet imiteren, turns die correctie vereisen met een gevalideerde hint, en turns die alleen als contextuele achtergrond worden bewaard. Succesvolle sessies leveren zowel imitatie‑ als correctie‑voorbeelden, terwijl mislukte sessies nog steeds correctie‑data leveren, zodat elke interactie het model op een of andere manier kan verbeteren.
Door deze indeling kan het model zowel leren van wat goed ging als van wat fout ging, zonder de training te verstoren met ruis. De hint‑gebaseerde correcties worden zorgvuldig gevalideerd om te voorkomen dat onjuiste signalen het leerproces beïnvloeden.
Leraar‑student‑pass mechanisme
Tijdens het trainen doorloopt het model dezelfde sessie twee keer. In de leraar‑pass is de correctieve hint – afgeleid van de oorspronkelijke intentie van de gebruiker en de fout van het systeem – zichtbaar voor het model. In de student‑pass is de hint verborgen. Een forward Kullback‑Leibler‑verlies (KL) brengt vervolgens de outputdistributie van de student in lijn met die van de leraar, waardoor de kennis die in de hint is gecodeerd wordt overgedragen zonder de student direct bloot te stellen aan de hint.
Dit dual‑pass schema zorgt ervoor dat het model de onderliggende correctie‑logica internaliseert, terwijl het toch leert om zonder expliciete hint te presteren. Het resultaat is een robuustere agent die beter generaliseert naar nieuwe, ongeziene situaties.
Privacy‑ en ethische waarborgen
Perplexity sluit expliciet elke sessie uit die persoonlijk identificeerbare informatie (PII) bevat of waarbij gebruikers zich hebben afgemeld voor training. Deze filterstap is bedoeld om privacy‑regels te respecteren en het vertrouwen van gebruikers te behouden, terwijl toch een grote hoeveelheid real‑world foutdata wordt verzameld.
De filtering gebeurt vóór de distillatiefase, zodat geen gevoelige data in het model terechtkomt. Daarnaast wordt een auditlog bijgehouden om te verifiëren dat de opt‑out‑verzoeken correct worden uitgevoerd.
Resultaten van de live A/B‑test
Een live A/B‑test met ongeveer 100 000 gebruikers per variant vergeleek twee checkpoints van het model: één getraind met de hint‑gestuurde zelf‑distillatieroute en een basismodel zonder deze techniek. Het percentage tool‑call fouten – situaties waarin de agent geen externe tool kon aanroepen – daalde van 2,24 % naar 1,77 %, een relatieve reductie van 21,2 %.
De test werd over een periode van vier weken uitgevoerd, waarbij zowel nieuwe als terugkerende gebruikers werden meegenomen. De statistische significantie werd bevestigd met een p‑waarde onder 0,01, wat duidt op een robuuste verbetering.
Naast de reductie in foutpercentage werden ook secundaire metrics zoals responstijd en gebruikers‑tevredenheid gemeten. Beide indicatoren lieten een lichte, maar consistente stijging zien, wat suggereert dat de verbeterde foutreductie ook een positieve invloed heeft op de algehele gebruikerservaring.
- Hint‑gestuurde zelf‑distillatie combineert rejection‑sampling fine‑tuning met on‑policy zelf‑distillatie.
- Drie turn‑types: imitatie, correctie met gevalideerde hint, alleen context.
- Leraar‑pass ziet de hint; student‑pass niet; forward KL‑verlies stemt distributies af.
- PII‑ en opt‑out‑sessies worden vóór training gefilterd.
De auteurs van de studie benadrukken dat de techniek schaalbaar is en kan worden toegepast op andere grote taalmodellen, niet alleen op GLM‑5.2. Ze plannen verdere experimenten met multi‑modal data om te onderzoeken of soortgelijke winsten behaald kunnen worden bij visuele of audio‑gebaseerde taken.
Critici wijzen erop dat de methode nog steeds afhankelijk is van de kwaliteit van de hints, die door menselijke annotators of geautomatiseerde systemen moeten worden gegenereerd. Een onjuiste hint kan potentieel schadelijke bias introduceren, waardoor continue monitoring essentieel blijft.
Toekomstige richtingen omvatten het automatiseren van hint‑generatie via meta‑learning, evenals het integreren van reinforcement‑learning‑based beloningen om de agent verder te optimaliseren voor complexe tool‑interacties.
Deze ontwikkelingen vinden plaats vanuit de hoofdvestiging van Perplexity in San Francisco, maar de impact wordt wereldwijd gevoeld, vooral in regio’s waar AI‑assistenten steeds vaker worden ingezet voor zakelijke en educatieve doeleinden.
Bronnen
- Perplexity Trains Its Computer Agent on Real Mistakes With Hint-Guided Self-DistillationMarkTechPost · 25 september 2026
- Perplexity Self-Distillation Cuts Tool Failures (2026)explainx.ai · 25 september 2026



