- 会員限定
- 2026/10/10 01:31 掲載
ロシア発Kandinsky Lab、音声と映像を同時生成する動画AI「Kandinsky 6.0 Video」公開
モデルはパラメーター数3Bの「Lite」と29Bの「Pro」の2種類。いずれも5秒のクリップを生成し、44kHzの音声とリップシンク(口の動きと発話の同期)を付ける。テキストから音声つき動画を作る方式と、画像から作る方式の両方に対応する。
構造は、映像と音声の2つの流れを持つ「デュアルストリームCrossDiT」。従来の「Kandinsky 5.0 Video」で事前学習した映像側に、新たに学習した音声側を双方向のクロスアテンションでつなぎ、時間と意味を合わせる。学習は、音声側の単独事前学習、音声と映像の同時学習、SFT(教師あり微調整)、強化学習(RL)による後学習、蒸留の順で進めた。
出力は、組み込みの超解像モデルでフルHD(1920×1080)に引き上げる。超解像モデルは1.4Bで、×2、×2.25、×4の拡大に対応する。こちらもMITライセンスでコードと重みを公開した。
評価について論文は、人手による比較でProがKandinsky 5.0 Video Proを明確に上回り、音声と映像を同時に作る主要モデルと互角だと説明している。著者の一人はHugging Faceの論文ページで、RL後学習によりProの音声認識誤り率(WER)が47%下がったと書いた。LTX 2.5との人手比較では、視覚品質、動きの自然さ、プロンプトへの追従、総合でProが好まれ、音声品質では統計的に有意な差が出たという。
モデルはHugging FaceにDiffusers形式で置かれ、LiteとProそれぞれに通常版、蒸留版、事前学習版が並ぶ。動作にはNVIDIA GPUとPython 3.13または3.14が必要。
音声つきの動画生成では、オープンな重みの公開が続く。ビジネス+ITが取り上げた「MiniMax H3」も、8月に重みが公開され、台詞や効果音、音楽を同時に生成する。
では、パラメーター数で約10倍の差があるProとLiteは、実際の生成時間ではどこまで開くのか。答えは、公式リポジトリが載せる実測値と、超解像モデルの処理時間にある。
・パラメーター約10倍のProは、Liteより何倍遅いのか
・蒸留版と超解像、現実的な動かし方
・VABenchで「最良」と主張、数字はどこまで見えるのか
今すぐビジネス+IT会員に
ご登録ください。
すべて無料!今日から使える、
仕事に役立つ情報満載!
-
ここでしか見られない
2万本超のオリジナル記事・動画・資料が見放題!
-
完全無料
登録料・月額料なし、完全無料で使い放題!
-
トレンドを聞いて学ぶ
年間1000本超の厳選セミナーに参加し放題!
-
興味関心のみ厳選
トピック(タグ)をフォローして自動収集!
AI・生成AIのおすすめコンテンツ
AI・生成AIの関連コンテンツ
PR
PR
PR