OpenAI が GPT-5.6 Sol に自分自身を最適化させた — サービングコスト20%減
デプロイ済みの GPT-5.6 Sol を「自分自身の実行効率を上げる」作業に適用した結果を OpenAI 公式が公開した。本番 GPU カーネルの改善でサービングコストが20%下がり、投機的デコーディング(speculative decoding)の改善でトークン生成効率が15%以上向上した。@OpenAIDevs も同日、Codex で GPT-5.6 Sol を使って自社インフラとパフォーマンスを最適化したと報告している。
キーポイント
- 本番 GPU カーネルの改善でサービングコスト20%減
- 投機的デコーディングの改善でトークン生成効率が15%以上向上
- OpenAI は「これらの最適化はスタック全体で複利に効き、コスト×知能カーブのあらゆる地点で最も高性能なモデルを解放する」と位置づけ
- Codex 側でも同じ手法で自社インフラとパフォーマンスを最適化したと @OpenAIDevs が報告
- 「自己改善」が研究テーマではなく本番の原価低減として報告されたのが今回の新しさ
- ⚠️ 改善率はいずれも OpenAI 自身の測定で第三者検証なし。値下げに直結するかは非言及