- 会員限定
- 2026/10/10 18:30 掲載
中国系MirroS-Lab、AIが学ぶ「コードで書く世界」AgentGartenを発表、4ラウンドで習得
仕組みの柱は、世界の中身を決める部分と、見た目を描く部分の分離だ。物理やルールを担うシミュレーターやゲームエンジンが世界の状態を保持し、プログラムで定めたルールを実行する。共通のインターフェース経由で受け取った構造化条件から、ニューラルレンダラーが視覚的な観測を生成する。新しい世界はコードとして書けば、同じレンダラーで描けるという。
レンダラーは、事前学習済みの動画モデルを深度や表面の向きといった幾何条件に適応させて作った。蒸留には新手法「Adversarial Forcing」を使う。履歴の入力処理を微分可能にして、後段の予測の損失が過去の観測の符号化を更新できるようにし、実データによる敵対的な教師で画質を高めた。あわせて実時間の推論向けに最適化したと説明している。
エージェントは、視覚的な観測だけで世界を知覚して操作する。各ラウンドの経験は「プレイブック」にまとめられ、後続のエージェントが引き継いで改良する。プロジェクトページには、犬との遊び、一車線の橋の譲り合い、牧羊、採石場での積み込み、かくれんぼの5つの世界が示されている。
対話型の世界モデルをめぐっては、米Runwayが9月にコード不要の「Solaris」を発表している。
GitHubでコードが公開された。ライセンスはApache-2.0で、ニューラルレンダラーの学習コードとストリーミング推論コードを含む。
では、強化学習が数百万ステップを要するとされる学習を4ラウンドで達成したという主張は、どこまで額面どおりに受け取れるのか。鍵を握るのは、OpenAIの有名な「かくれんぼ」実験との比較と、5つの世界の成績の推移、そして開示されていない数字だ。
・OpenAIの「かくれんぼ」実験と並べた学習量の比較と、その但し書き
・5つの世界の成績表、ラウンドを重ねても伸びなかった世界の中身
・「実時間」をうたうレンダラーが明かしていない数字と、認める限界
今すぐビジネス+IT会員に
ご登録ください。
すべて無料!今日から使える、
仕事に役立つ情報満載!
-
ここでしか見られない
2万本超のオリジナル記事・動画・資料が見放題!
-
完全無料
登録料・月額料なし、完全無料で使い放題!
-
トレンドを聞いて学ぶ
年間1000本超の厳選セミナーに参加し放題!
-
興味関心のみ厳選
トピック(タグ)をフォローして自動収集!
AI・生成AIのおすすめコンテンツ
AI・生成AIの関連コンテンツ
PR
PR
PR