OpenAI、GPT-6のプロンプトキャッシュを改善——最大90%のコスト削減と新しい診断機能
OpenAIはGPT-6モデルのプロンプトキャッシュを改善し、デフォルトでのヒット率向上、新しい診断ツール、そして長時間稼働する永続的エージェント向けのきめ細かな開発者向け制御機能を追加しました。
詳細
- ヒット率の向上: 30分以内に再利用された共有プレフィックスに対してキャッシュ割引が適用されるようになり、デフォルトで入力トークンの最大90%のコスト削減を実現
- 新しい診断機能: ヒット率とトークン構成を示す「Prompt Caching Dashboard」を導入。直近のレスポンスとリクエストを比較し、キャッシュミスが発生した理由を説明する診断ツールも追加
- 明示的なキャッシュブレークポイント: プロンプトのどの部分をリクエスト間で再利用すべきかを開発者が明示的に指定可能に
- 会話途中での柔軟性:
configuration_updateを通じて、キャッシュを無効化することなく会話の途中で推論強度を調整できるように - ツール管理: ツール定義を安定させたまま
allowed_toolsで利用可能なツールを制御することで、再構築を強制することなくキャッシュを維持できる - キャッシュのプリウォーミング: アプリケーション起動時にコンテキストを事前準備することで、ユーザー向けのレイテンシを削減できる
その後
今回の改善は、GPT-6 SolやLunaが想定しているのと同じワークロード——大量かつコストに敏感な、長時間稼働するエージェント的タスク——を対象としています。開発者はデフォルトのヒューリスティクスに頼るだけでなく、キャッシュの挙動をより精密に制御できるようになりました。