Perplexity、回答だけでなく根拠も検索できる文脈埋め込みモデルを公開
Perplexityは2026年9月30日、新しい埋め込みモデルと、それに付随するベンチマークを発表しました。標準的な検索評価が見落としがちな課題、すなわち質問に答える単一の「正解パッセージ」だけでなく、その回答を裏付け検証するために必要な周辺情報を見つけ出すことを狙ったものです。
詳細
- 新モデル: 「pplx-embed-v2-context-9b-preview」は90億パラメータの埋め込みモデルで、2048次元の埋め込みを生成する。1024次元版やint8版のオプションも用意されている
- 訓練手法: クエリに応じた文脈圧縮モデルを教師として用い、トークン単位の関連度スコアを算出した上でチャンク単位のスコアに集約。これにより埋め込みモデルは、単に最も一致するパッセージだけでなく、それを裏付ける文脈にも価値を置くよう学習する
- 新ベンチマーク「Context-bench」: 21分野にまたがる38,894件の文書から成る2,099件のクエリで構成され、240万件以上の文単位チャンクをもとに構築。文書の曖昧性解消、回答検索、根拠検索の3つを評価する
- 報告された結果(Context-bench、K=10): 回答再現率45.5%、根拠再現率40.6%、全根拠再現率31.1%。Perplexityが比較対象として挙げるVoyage Context 4より、回答再現率が14.4ポイント高い
- ベンチマークの健全性確保: Context-bench自体はturbopufferが非公開で保持しており、将来のモデルがテストセットで学習してしまう「汚染」を防ぐため、あえて公開していない
- 提供状況: モデルのプレビュー版はHugging Face上で公開されている
その後
今回の発表は、Perplexityが検索・エージェント製品の基盤として、サードパーティの埋め込みモデルに頼るのではなく、自社開発の検索関連研究を積み重ねてきた流れに沿うものです。単一パッセージとの一致ではなく根拠の再現率を最適化対象とすることで、Perplexityは検索拡張生成(RAG)システムに共通する弱点、すなわち「一見正しく見えるが、ユーザー(あるいは別のモデル)が元情報と照らし合わせて検証しづらい回答」という課題に取り組んでいます。これは、引用可能で検証可能な回答を中核的な価値とするPerplexityの検索エンジンにとって、直接的に重要な意味を持ちます。