- 2026/09/23 09:10 掲載
米OpenAIがGPT-6のプロンプトキャッシュを刷新、推論コストを36%減らした事例も
プロンプトキャッシュは、AIへの指示文のうち毎回同じ部分の計算結果を使い回す仕組みである。GPT-6は数時間に及ぶ作業をこなす前提で設計されており、その裏側ではAPIへの要求が何度も繰り返される。同じ指示やツール定義、前の対話の文脈が毎回送られるため、そこを再利用できれば無駄が大きく減るというわけだ。
今回の刷新では、再利用が認められる時間が30分以内に広がった。条件を満たしたキャッシュ済み入力トークンには最大90%の割引が適用される。設定を変えなくても、ヒット率は既定で高まるとしている。
開発者向けのツールも増えた。新設の「Prompt Caching Dashboard」では、入力のうちどれだけがキャッシュから供給されたかを追える。想定外のキャッシュミスが起きた際は診断ツールを使い、モデルやツール、設定、入力のどの変更が再利用を妨げたのかを特定できる。影響を受けたトークン数の推定値も示す。
細かな制御も可能になった。明示的な「キャッシュブレークポイント」により、指示文のどこまでを再利用するかを開発者が選べる。加えてGPT-6では、推論の深さを応答ごとに変えてもキャッシュは壊れない。起動時に共通の指示や参照資料を先読みする「プリウォーミング」も加わった。
効果はすでに出ているようだ。GitHub Copilotは数十億回規模の要求で、新規に処理し直す必要のあるトークンの割合を従来比50%超削減。同社のマリオ・ロドリゲス チーフプロダクトオフィサーは「より効率的な推論基盤と、開発者にとっての初回応答の高速化につながった」と述べている。
AIエージェント「Manus」では1週間足らずでヒット率が約85%から90%超へ改善した。Wordsmithは評価環境でのヒット率が83%から91%に上がり、キャッシュ書き込みが約3分の2減って推論コストが36%下がったという。Strawberry Browserもコストを20%圧縮した。
OpenAIは同じ9月22日に新モデル「GPT-6 Sol」「Luna」も発表しており、API価格は前世代から半減している。値下げと運用効率の改善を重ねる姿勢は、生成AIの競争軸が性能一辺倒からコストへ移りつつあることを映す。
AI・生成AIのおすすめコンテンツ
PR
PR
PR