Perplexity 通过提示引导的自蒸馏将工具调用错误降低 21%
Perplexity 为其基于 GLM‑5.2 的 Computer 代理推出提示引导的自蒸馏技术,在实时 A/B 测试中将工具调用错误率从 2.24% 降至 1.77%,实现 21.2% 的相对改进。

Perplexity 推出了一种新颖的训练方法,称为提示引导的自蒸馏,针对驱动其 Perplexity Computer 代理的 GLM‑5.2 模型。该方法将拒绝抽样微调与在策略自蒸馏相结合,使模型能够直接从真实用户交互中学习,同时避免事后偏差的陷阱。
核心思路是将每一次对话分为三类:模型应模仿的回合、需要使用已验证提示进行纠正的回合,以及仅保留为上下文背景的回合。成功的会话同时提供模仿和纠正示例,失败的会话仍贡献纠正数据,确保每一次交互都能以某种方式提升模型。
教师‑学生传递机制
在训练期间,模型会对同一会话进行两次遍历。教师遍历中,纠正提示——源自用户原始意图和系统错误——对模型可见;学生遍历中,提示被隐藏。随后使用前向 Kullback‑Leibler(KL)损失将学生的输出分布与教师的对齐,实现提示中蕴含知识的转移,而不让学生直接接触提示本身。
Perplexity 明确排除任何包含个人可识别信息(PII)或来自已选择退出训练用户的会话。此过滤步骤旨在遵守隐私法规并维护用户信任,同时仍能收集大量真实世界的错误数据。
实时 A/B 测试验证效果
一次实时 A/B 测试中,每个条件约有 10 万用户,比较了两个模型检查点:一个使用提示引导的自蒸馏管道训练,另一个为未使用该管道的基线检查点。工具调用失败——即代理未能成功调用外部工具的情形——从 2.24% 降至 1.77%,相对下降 21.2%。
同一测试还衡量了“强烈不满意度”,作为用户极度沮丧的代理指标。该指标从 2.58% 略降至 2.54%,差异未达统计显著,表明工具调用错误的下降在本次测试的置信区间内未转化为整体用户不满意度的可测量变化。
局限性与未解之谜
Perplexity 未公开后训练权重或训练代码,限制了外部对结果的验证。此外,报告的改进是检查点之间的比较,而非相对于原始、标准的 GLM‑5.2 模型的对比,因而仍不清楚收益有多少来源于新蒸馏技术,多少来源于增量微调。
另一个考虑因素是对已验证提示的依赖,这些提示需在错误发生前即可在系统中检索到信息。虽然这降低了事后偏差,却也将提示的适用范围限制在系统已知正确答案的情形,可能削弱该方法在更模糊或全新查询上的适用性。
- 提示引导的自蒸馏将拒绝抽样微调与在策略自蒸馏相结合。
- 三种回合类型:模仿、使用已验证提示纠正、仅作背景。
- 教师遍历看到提示,学生遍历不见,前向 KL 损失对齐分布。
- 在训练前过滤掉包含 PII 或用户已选择退出的会话。
工具调用错误的降低意义重大,因为此类错误常迫使用户重新表述问题或放弃任务,削弱对 AI 助手可靠性的感知。通过降低错误率,Perplexity 更接近于让工具集成变得透明且可靠的无缝交互体验。
对于使用 AI 代理进行数据检索、会议安排或代码片段执行的中文企业而言,实际影响十分明显:中断更少、支持成本更低,且更有信心助手能一次性完成请求。尽管更广泛的满意度指标的统计显著性仍不确定,但错误率的实际下降已为在生产环境中部署 Perplexity Computer 代理的团队带来直接的运营收益。
信息来源
- Perplexity Trains Its Computer Agent on Real Mistakes With Hint-Guided Self-DistillationMarkTechPost · 2026年9月25日
- Perplexity Self-Distillation Cuts Tool Failures (2026)explainx.ai · 2026年9月25日



