Perplexity reduz falhas de chamadas a ferramentas em 21 % com auto‑destilação guiada por dicas
A nova técnica de auto‑destilação guiada por dicas da Perplexity para o agente Computer, baseado no GLM‑5.2, diminuiu os erros de chamadas a ferramentas de 2,24 % para 1,77 % num teste A/B ao vivo, um ganho relativo de 21,2 %.

A Perplexity revelou uma nova abordagem de treino, denominada auto‑destilação guiada por dicas, para o modelo baseado no GLM‑5.2 que alimenta o seu agente Perplexity Computer. O método combina ajuste fino por amostragem de rejeição com auto‑destilação em‑policy, permitindo que o modelo aprenda directamente a partir das interacções reais dos utilizadores, ao mesmo tempo que evita os problemas de viés retrospectivo.
A ideia central consiste em separar cada troca de conversa em três categorias: turnos que o modelo deve imitar, turnos que requerem correção através de uma dica validada, e turnos que são mantidos apenas como contexto de fundo. Sessões bem‑sucedidas fornecem exemplos de imitação e correção, enquanto sessões falhadas ainda contribuem com dados de correção, garantindo que toda a interação possa melhorar o modelo de alguma forma.
Como funciona a passagem Professor‑Aluno
Durante o treino, o modelo executa duas passagens sobre a mesma sessão. Na passagem do professor, a dica corretiva — derivada da intenção original do utilizador e do erro do sistema — está visível ao modelo. Na passagem do aluno, a dica permanece oculta. Uma perda de Kullback‑Leibler (KL) avançada alinha a distribuição de saída do aluno com a do professor, transferindo efetivamente o conhecimento codificado na dica sem expor directamente o aluno a ela.
A Perplexity exclui explicitamente qualquer sessão que contenha informações de identificação pessoal (PII) ou que envolva utilizadores que tenham optado por não participar no treino. Esta filtragem visa respeitar as normas de privacidade e manter a confiança dos utilizadores, ao mesmo tempo que recolhe um grande volume de dados reais de erros.
Teste A/B ao vivo valida a abordagem
Um teste A/B ao vivo envolvendo aproximadamente 100 000 utilizadores por condição comparou dois checkpoints do modelo: um treinado com a pipeline de auto‑destilação guiada por dicas e um checkpoint de referência sem essa técnica. As falhas de chamadas a ferramentas — situações em que o agente não conseguiu invocar com sucesso uma ferramenta externa — diminuíram de 2,24 % para 1,77 %, uma redução relativa de 21,2 %.
O mesmo teste mediu a insatisfação forte estimada, um proxy para frustração severa do utilizador. A métrica mudou marginalmente de 2,58 % para 2,54 %, uma variação que não foi estatisticamente significativa, indicando que a redução nas falhas de chamadas a ferramentas não se traduziu numa diferença mensurável na insatisfação geral dentro dos limites de confiança do teste.
Limitações e questões em aberto
A Perplexity não divulgou os pesos pós‑treino nem o código de treino, limitando a verificação externa dos resultados. Além disso, a melhoria reportada é entre checkpoints, e não uma comparação com o modelo original GLM‑5.2, deixando em aberto quanto do ganho provém da nova técnica de destilação versus ajustes finos incrementais.
Outra consideração é a dependência de dicas validadas que são verificadas contra informações disponíveis antes do erro ocorrer. Embora isso reduza o viés retrospectivo, também restringe o âmbito das dicas a situações onde a resposta correta já era conhecida pelo sistema, potencialmente limitando a aplicabilidade do método a consultas mais ambíguas ou inéditas.
- A auto‑destilação guiada por dicas combina ajuste fino por amostragem de rejeição com auto‑destilação em‑policy.
- Três tipos de turno: imitação, correção com dica validada, apenas contexto.
- A passagem do professor vê a dica; a do aluno não a vê; a perda KL avançada alinha as distribuições.
- Sessões com PII ou opt‑out são filtradas antes do treino.
A redução nas falhas de chamadas a ferramentas é importante porque essas falhas costumam obrigar os utilizadores a reformular perguntas ou abandonar tarefas, minando a perceção de fiabilidade dos assistentes de IA. Ao diminuir a taxa de falhas, a Perplexity aproxima‑se de uma experiência de interação fluida, em que a integração de ferramentas parece transparente e confiável.
Para organizações portuguesas que dependem de agentes de IA para recuperar dados, agendar reuniões ou executar fragmentos de código, o impacto prático é claro: menos interrupções, menor carga de suporte e maior confiança de que o assistente concluirá a ação solicitada na primeira tentativa. Embora a significância estatística das métricas de satisfação mais amplas permaneça incerta, a queda concreta nas taxas de erro sugere benefícios operacionais imediatos para equipas que implementam o agente Perplexity Computer em ambientes de produção.
Fontes
- Perplexity Trains Its Computer Agent on Real Mistakes With Hint-Guided Self-DistillationMarkTechPost · 25 de setembro de 2026
- Perplexity Self-Distillation Cuts Tool Failures (2026)explainx.ai · 25 de setembro de 2026



