Alibaba「Wan 2.5」登場:音声つき・口の動きも合った動画を文章や画像から生成

30秒でわかる

  • AlibabaのTongyi Labが動画生成AI「Wan 2.5」を公開
  • 文章や画像から、セリフ・口の動きが合った音声つきの動画をまとめて生成できる。別録りや手作業での音合わせが不要
  • 長さは最長10秒ほど、画質は480p/720p/1080pに対応。まずはクラウド(Alibaba Cloud)経由での提供

何が変わった

AlibabaのTongyi Labが、動画を作るAIWan 2.5 ↗を出しました。いちばんの特徴は、映像と音声(セリフ・効果音)を1回でまとめて作り、口の動きと声を合わせられることです。これまで動画と音を別々に用意して合わせていた作業が、文章か画像を1つ渡すだけで済むようになりました。ざっくり言うと「プロンプトを入れると、声つきで口も合った短い動画がそのまま出てくる」というものです。動画の長さは最長10秒ほど、画質は480p/720p/1080p(フルHD)から選べます。提供はまずAlibaba Cloud(同社のクラウド)経由で、外部の各種サービス経由でも使えるようになっています。中国語のプロンプトにも対応します。料金や日本からの使い勝手、商用利用の条件は公式で確認してください。

誰に関係する

AIで短い動画を作りたい人、セリフつきの動画を手軽に作りたい人、動画生成を自分のサービスに組み込みたい開発者に関係します。当面はクラウド経由での提供が中心です。

公式情報

Wan公式サイト(Alibaba / Tongyi Lab) ↗