Alibaba「Wan 2.5」登場:音声つき・口の動きも合った動画を文章や画像から生成
30秒でわかる
- AlibabaのTongyi Labが動画生成AI「Wan 2.5」を公開
- 文章や画像から、セリフ・口の動きが合った音声つきの動画をまとめて生成できる。別録りや手作業での音合わせが不要
- 長さは最長10秒ほど、画質は480p/720p/1080pに対応。まずはクラウド(Alibaba Cloud)経由での提供
何が変わった
AlibabaのTongyi Labが、動画を作るAIWan 2.5 ↗を出しました。いちばんの特徴は、映像と音声(セリフ・効果音)を1回でまとめて作り、口の動きと声を合わせられることです。これまで動画と音を別々に用意して合わせていた作業が、文章か画像を1つ渡すだけで済むようになりました。ざっくり言うと「プロンプトを入れると、声つきで口も合った短い動画がそのまま出てくる」というものです。動画の長さは最長10秒ほど、画質は480p/720p/1080p(フルHD)から選べます。提供はまずAlibaba Cloud(同社のクラウド)経由で、外部の各種サービス経由でも使えるようになっています。中国語のプロンプトにも対応します。料金や日本からの使い勝手、商用利用の条件は公式で確認してください。
誰に関係する
AIで短い動画を作りたい人、セリフつきの動画を手軽に作りたい人、動画生成を自分のサービスに組み込みたい開発者に関係します。当面はクラウド経由での提供が中心です。