Perplexity reduz falhas de chamadas de ferramenta em 21% com auto‑destilação guiada por dicas
A nova técnica de auto‑destilação guiada por dicas da Perplexity para seu agente Computer baseado no GLM‑5.2 diminui erros de chamadas de ferramenta de 2,24% para 1,77% em teste A/B ao vivo, um ganho relativo de 21,2%.

A Perplexity revelou uma abordagem de treinamento inovadora chamada auto‑destilação guiada por dicas para o modelo baseado no GLM‑5.2 que alimenta seu agente Perplexity Computer. O método combina ajuste fino por amostragem de rejeição com auto‑destilação em‑política, permitindo que o modelo aprenda diretamente com interações reais de usuários, evitando os problemas de viés de retrospectiva.
A ideia central é separar cada turno de conversa em três categorias: turnos que o modelo deve imitar, turnos que requerem correção usando uma dica validada e turnos que são mantidos apenas como contexto de fundo. Sessões bem‑sucedidas fornecem exemplos de imitação e correção, enquanto sessões falhas ainda contribuem com dados de correção, garantindo que toda interação possa melhorar o modelo de alguma forma.
Como funciona a passagem Professor‑Aluno
Durante o treinamento, o modelo executa duas passagens sobre a mesma sessão. Na passagem do professor, a dica corretiva — derivada da intenção original do usuário e do erro do sistema — está visível para o modelo. Na passagem do aluno, a dica fica oculta. Uma perda de Kullback‑Leibler (KL) direta então alinha a distribuição de saída do aluno com a do professor, transferindo efetivamente o conhecimento codificado na dica sem expor o aluno a ela diretamente.
A Perplexity exclui explicitamente qualquer sessão que contenha informações pessoalmente identificáveis (PII) ou que envolva usuários que optaram por não participar do treinamento. Essa filtragem visa respeitar as regulamentações de privacidade e manter a confiança dos usuários, ao mesmo tempo em que coleta um grande volume de dados reais de erro.
Teste A/B ao vivo valida a abordagem
Um teste A/B ao vivo envolvendo cerca de 100 000 usuários por condição comparou dois checkpoints do modelo: um treinado com o pipeline de auto‑destilação guiada por dicas e um checkpoint de referência sem ele. Falhas de chamadas de ferramenta — situações em que o agente não conseguiu invocar uma ferramenta externa — caíram de 2,24% para 1,77%, uma redução relativa de 21,2%.
O mesmo teste mediu a insatisfação forte estimada, um proxy para frustração severa do usuário. A métrica mudou marginalmente de 2,58% para 2,54%, mudança que não foi estatisticamente significativa, indicando que a redução nas falhas de chamadas de ferramenta não se traduziu em diferença mensurável na insatisfação geral dentro dos limites de confiança do teste.
Limitações e questões em aberto
A Perplexity não divulgou os pesos pós‑treinamento nem o código de treinamento, limitando a verificação externa dos resultados. Além disso, a melhoria relatada é de checkpoint‑para‑checkpoint, e não uma comparação com o modelo original, padrão GLM‑5.2, deixando em aberto quanto do ganho provém da nova técnica de destilação versus ajuste fino incremental.
Outra consideração é a dependência de dicas validadas que são verificadas contra informações disponíveis antes do erro ocorrer. Embora isso reduza o viés de retrospectiva, também restringe o escopo das dicas a situações em que a resposta correta já era conhecida pelo sistema, potencialmente limitando a aplicabilidade do método a consultas mais ambíguas ou inéditas.
- Auto‑destilação guiada por dicas combina ajuste fino por amostragem de rejeição com auto‑destilação em‑política.
- Três tipos de turno: imitação, correção com dica validada, somente contexto.
- Passagem do professor vê a dica; passagem do aluno não vê; perda KL direta alinha as distribuições.
- Sessões com PII ou opt‑out são filtradas antes do treinamento.
A redução nas falhas de chamadas de ferramenta é importante porque essas falhas costumam forçar os usuários a reformular perguntas ou abandonar tarefas, corroendo a confiabilidade percebida dos assistentes de IA. Ao diminuir a taxa de falhas, a Perplexity se aproxima de uma experiência de interação fluida, onde a integração de ferramentas parece transparente e confiável.
Para organizações brasileiras que utilizam agentes de IA para buscar dados, agendar reuniões ou executar trechos de código, o impacto prático é claro: menos interrupções, menor carga de suporte e maior confiança de que o assistente concluirá a ação solicitada na primeira tentativa. Embora a significância estatística das métricas de satisfação geral ainda seja incerta, a queda concreta nas taxas de erro sugere benefícios operacionais imediatos para equipes que implantam o agente Perplexity Computer em ambientes de produção.
Fontes
- Perplexity Trains Its Computer Agent on Real Mistakes With Hint-Guided Self-DistillationMarkTechPost · 25 de setembro de 2026
- Perplexity Self-Distillation Cuts Tool Failures (2026)explainx.ai · 25 de setembro de 2026



