• 2026/08/23 20:00 掲載

NVIDIA「エージェント時代は、モデルの性能よりもハーネス設計が重要」

エージェント基盤「AVO」でOpus5が汎用テスト満点を記録

1
会員(無料)になると、いいね!でマイページに保存できます。
NVIDIAは2026年8月21日、自律型エージェントシステム「AVO」が汎用人工知能の評価指標「ARC-AGI-3」のベンチマークで満点を達成したと発表した。基盤モデルとしてAnthropicのClaude Opus 5を採用しており、モデル単体では約30パーセントにとどまるスコアを、周辺システムの設計によって100パーセントまで引き上げた。AIエージェントのハーネス設計がモデルの性能を引き上げた事例であり、エージェント時代には、「AIの足回り」が重要となることを示している。
 NVIDIAが発表した自律型エージェントシステムAVOは、未知の環境における推論能力を測るベンチマークテストであるARC-AGI-3の公開セットにおいて、全25環境と183レベルを完全にクリアし、評価指標のRHAEで100.00の満点を記録した。

 AVOの内部で推論を担う中核モデルにはAnthropicの大規模言語モデルであるClaude Opus 5が採用されている。ARC Prizeの計測によると、Claude Opus 5単体での同テストのスコアは約30パーセントにとどまる。NVIDIAはモデル自体には手を加えず、モデルに情報を渡し、記憶を管理し、エラーからの回復を支援する周辺システムの設計を最適化することで、スコアを100パーセントまで向上させた。

 AVOのアーキテクチャは元々GPU上で動作するCUDAカーネルの自律的な最適化を目的として開発された。NVIDIAの検証では7日間の連続稼働により同社の標準ライブラリを上回る性能のプログラムを生成する実績を残している。この専門的なタスクのために設計された骨格をルールの事前説明がないARC-AGI-3の環境にそのまま転用し、満点を達成したことで、システムの汎用性が実証された形となる。

画像
【図版付き記事はこちら】NVIDIAが示したAI新常識:エージェント時代はモデルの性能より「ハーネス設計」が重要(画像:ビジネス+IT)
 同じClaude Opus 5をベースとした先行のエージェントシステムであるVISTAと比較しても、AVOの行動効率の高さが確認されている。VISTAが全183レベルをクリアするのに7542回のアクションを要したのに対し、AVOは6624回のアクションで完了しており、約12パーセント少ない行動数で結果を出した。

NVIDIAはエージェントの構成やメモリ管理手法が異なるため厳密な比較実験ではないと補足している。今回の満点は一般に公開されているデータセットに限定された結果であり、非公開の評価セットにおける汎用的な能力を証明するものではない。

 今回のNVIDIAの発表は、AIが複雑なタスクを遂行する能力が、言語モデル単体の知能だけでなく、記憶管理や軌道修正を行うハーネス設計に強く依存している事実を示している。

Googleで見つけやすく

評価する

いいね!でぜひ著者を応援してください

  • 1

会員(無料)になると、いいね!でマイページに保存できます。

共有する

  • 0

  • 0

  • 0

  • 0

  • 0

関連タグ タグをフォローすると最新情報が表示されます
あなたの投稿

    PR

    PR

    PR

処理に失敗しました

投稿したコメントを
削除しますか?

あなたの投稿コメント編集

通報

このコメントについて、
問題の詳細をお知らせください。

ビジネス+ITルール違反についてはこちらをご覧ください。

通報

報告が完了しました

コメントを投稿することにより自身の基本情報
本メディアサイトに公開されます

基本情報公開時のサンプル画像
報告が完了しました

」さんのブロックを解除しますか?

ブロックを解除するとお互いにフォローすることができるようになります。

ブロック

さんはあなたをフォローしたりあなたのコメントにいいねできなくなります。また、さんからの通知は表示されなくなります。

さんをブロックしますか?

ブロック

ブロックが完了しました

ブロック解除

ブロック解除が完了しました

機能制限のお知らせ

現在、コメントの違反報告があったため一部機能が利用できなくなっています。

そのため、この機能はご利用いただけません。
詳しくはこちらにお問い合わせください。

ユーザーをフォローすることにより自身の基本情報
お相手に公開されます

基本情報公開時のサンプル画像