How enabling two settings tripled our scores on the ARC-AGI-3 benchmark は、GPT-5.6 Sol の ARC-AGI-3 成績が API 設定によって大きく変わったことを示しています。
OpenAI は、reasoning の保持と compaction を有効にすると、公開タスクでのスコアが 13.3% から 38.3% に上がり、出力トークンも約 6 分の 1 に減ったと説明しています。
これは単に「設定を変えたらスコアが上がった」という話ではありません。AI エージェントの評価では、モデル本体だけでなく、記憶をどう残すか、長い履歴をどう圧縮するか、ツール実行のたびに何を渡すかが、能力の一部として効いてくるという話です。
ARC-AGI-3 は、未知の 2D パズルゲームを探索し、ルールを推測しながら解くベンチマークです。この種類のタスクでは、1手ごとの賢さよりも、試行錯誤の蓄積が重要になります。過去の推論が毎回捨てられれば、モデルは同じゲームを何度も最初から理解し直すことになります。履歴が単純に切り捨てられれば、序盤で得た発見も消えます。
ここで示唆的なのは、性能改善の中心が新しいモデル開発ではなく、運用時の文脈管理にあった点です。実務でエージェントを使う場合も、モデル選定だけで成果は決まりません。調査、コード修正、テスト、長い対話をまたぐ業務では、過去の判断や失敗を保持できる設計が、そのまま品質と効率に反映されます。
評価を見る側にも注意が必要です。あるベンチマークの数字が低いとき、それはモデルが弱いことを意味する場合もありますが、評価ハーネスが実運用の条件を再現していないだけかもしれません。逆に、現場で成果を出したい開発者にとっては、Responses API、reasoning の保持、compaction のような設定は、細かな最適化ではなく、エージェントを継続的に働かせるための基盤になります。
AI エージェントの実力は、単発の応答能力から、長い作業をどう記憶し、圧縮し、次の判断へつなげるかへ移りつつあります。これからの評価と導入判断では、「どのモデルか」だけでなく、「どの実行環境で測った能力か」を見る必要があります。
関連記事
- Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident
- Looking back on Microsoft’s FY26: From AI experimentation to Frontier Transformation
- Disrupting supply chain attacks on npm and GitHub Actions
参考文献
コメント