Perplexity、ヒント指向自己蒸留でツール呼び出し失敗を21%削減
PerplexityのGLM‑5.2ベースのコンピュータエージェントに導入されたヒント指向自己蒸留手法が、ライブA/Bテストでツール呼び出しエラーを2.24%から1.77%へと低減し、相対的に21.2%の改善を実現した。

Perplexityは、同社のコンピュータエージェントを支えるGLM‑5.2ベースのモデル向けに「ヒント指向自己蒸留」と呼ばれる新しい学習手法を発表した。この手法はリジェクションサンプリングによるファインチューニングとオンポリシー自己蒸留を組み合わせ、実際のユーザー対話から直接学習しつつ、後知恵バイアスの落とし穴を回避できる。
基本的な考え方は、会話の各ターンを「模倣すべきターン」「検証済みヒントで修正すべきターン」「背景情報として保持するだけのターン」の3つに分類することだ。成功したセッションは模倣例と修正例の両方を提供し、失敗したセッションでも修正データが得られるため、すべての対話が何らかの形でモデル改善に寄与する。
教師‑生徒パスの仕組み
学習時には同一セッションに対して2回のパスを実行する。教師パスでは、ユーザーの意図とシステムエラーから導かれた修正ヒントがモデルに見える状態で処理され、学生パスではヒントが隠されたまま処理される。前方KL損失を用いて学生側の出力分布を教師側に合わせることで、ヒントに含まれる知識を直接見せずに転移させる。
Perplexityは、個人を特定できる情報(PII)や学習からのオプトアウトを選択したユーザーのセッションを明示的に除外している。このフィルタリングはプライバシー規制への遵守とユーザー信頼の維持を目的としつつ、実世界のエラーデータを大量に収集できるようにするための措置である。
ライブA/Bテストでの検証結果
約10万人のユーザーを条件ごとに割り当てたライブA/Bテストで、ヒント指向自己蒸留パイプラインで学習したチェックポイントと、従来通りのベースラインチェックポイントを比較した。ツール呼び出し失敗率は2.24%から1.77%へと低下し、相対的に21.2%の削減が確認された。
同テストでは、強い不満足度(深刻なユーザー不快感の代替指標)も測定されたが、2.58%から2.54%への変化は統計的に有意ではなく、ツール失敗率の低下が全体的な不満足度に顕著な影響を与えていないことが示唆された。
制限事項と未解決の課題
Perplexityは学習後の重みやコードを公開しておらず、外部からの結果検証が制限されている。また、報告された改善はチェックポイント間の比較であり、元の標準GLM‑5.2モデルとの直接比較ではないため、自己蒸留手法自体の効果とインクリメンタルなファインチューニングの寄与割合は不明のままである。
さらに、検証済みヒントはエラー発生前にシステムが既に正解を把握しているケースに限定されるため、後知恵バイアスは減少するものの、曖昧あるいは新規性の高いクエリへの適用範囲が制限される可能性がある。
- ヒント指向自己蒸留はリジェクションサンプリングとオンポリシー自己蒸留を組み合わせる。
- 3つのターン種別:模倣、検証済みヒントで修正、背景のみ。
- 教師パスはヒントを表示、学生パスは非表示、前方KL損失で分布を整合。
- PIIやオプトアウトセッションは学習前に除外。
ツール呼び出し失敗の削減は、ユーザーが質問を言い換えたりタスクを放棄したりするケースを減らすため、AIアシスタントの信頼性向上に直結する。失敗率が低下することで、Perplexityはツール統合がシームレスで信頼できる体験に近づいたと言える。
日本の企業で、データ取得や会議スケジューリング、コードスニペット実行といった業務にAIエージェントを活用している組織にとっては、ツール呼び出しの中断が減少することでサポートコストが削減され、業務効率が向上するという直接的なメリットが期待できる。満足度指標全体の統計的有意性は不明だが、エラー率の具体的な低下は実運用環境での即時効果を示唆している。
出典
- Perplexity Trains Its Computer Agent on Real Mistakes With Hint-Guided Self-DistillationMarkTechPost · 2026年9月25日
- Perplexity Self-Distillation Cuts Tool Failures (2026)explainx.ai · 2026年9月25日



