- 2026/08/23 20:00 掲載
NVIDIA「エージェント時代は、モデルの性能よりもハーネス設計が重要」
エージェント基盤「AVO」でOpus5が汎用テスト満点を記録
AVOの内部で推論を担う中核モデルにはAnthropicの大規模言語モデルであるClaude Opus 5が採用されている。ARC Prizeの計測によると、Claude Opus 5単体での同テストのスコアは約30パーセントにとどまる。NVIDIAはモデル自体には手を加えず、モデルに情報を渡し、記憶を管理し、エラーからの回復を支援する周辺システムの設計を最適化することで、スコアを100パーセントまで向上させた。
AVOのアーキテクチャは元々GPU上で動作するCUDAカーネルの自律的な最適化を目的として開発された。NVIDIAの検証では7日間の連続稼働により同社の標準ライブラリを上回る性能のプログラムを生成する実績を残している。この専門的なタスクのために設計された骨格をルールの事前説明がないARC-AGI-3の環境にそのまま転用し、満点を達成したことで、システムの汎用性が実証された形となる。
同じClaude Opus 5をベースとした先行のエージェントシステムであるVISTAと比較しても、AVOの行動効率の高さが確認されている。VISTAが全183レベルをクリアするのに7542回のアクションを要したのに対し、AVOは6624回のアクションで完了しており、約12パーセント少ない行動数で結果を出した。
NVIDIAはエージェントの構成やメモリ管理手法が異なるため厳密な比較実験ではないと補足している。今回の満点は一般に公開されているデータセットに限定された結果であり、非公開の評価セットにおける汎用的な能力を証明するものではない。
今回のNVIDIAの発表は、AIが複雑なタスクを遂行する能力が、言語モデル単体の知能だけでなく、記憶管理や軌道修正を行うハーネス設計に強く依存している事実を示している。
AI・生成AIのおすすめコンテンツ
AI・生成AIの関連コンテンツ
PR
PR
PR