IEEEのカンファレンスで発表されました。Video LDMニューラルネットワークは、テキストによる説明をもとに、最大4秒の短い動画を生成することができます。
このAIモデルは、「木を燃やす」といった短いフレーズから「エレキギターを弾くテディベア」といった複雑なクエリまで理解し、最大解像度2048×1280ピクセル、フレームレート24fpsの動画を生成する。新しいAIモデルは、Stable Diffusionニューラルネットワークをベースにしています。
このモデルは合計で41億個のパラメータを持ち、そのうち27億個は動画を使って学習させたものです。現在、Video LDMはアクセスが制限された研究作品という位置づけです。NVIDIAは、ニューラルネットワークの公開バージョンの時期については明らかにしていない。
ニューラルネットワークの詳細な例は、NVIDIAの公式サイトの関連セクションで見ることができます。
2023-04-20 06:10:05
著者: Vitalii Babkin
ソース URL