素人が作る実写っぽいミュージックビデオの作り方 その1

素人が作る実写っぽいミュージックビデオの作り方 その1

結構長くなりそうなので、何回かに分けて書きます。
続きは以下からどうぞ

素人が作る実写っぽいミュージックビデオの作り方 その2

今回作成したミュージックビデオです。

音楽以外はローカルで作成しました。
クラウドサービスは、結構サービス料金がかかりますが、GPUの購入価格と比較すると、どちらが高くなるかは、使用頻度なんかで変わるかと思います。
一点、ローカルで有利なので、試行錯誤を行いやすい事でしょうか?

ローカル環境の紹介と大雑把な制作の流れ、クラウドとの比較なんかをしていきたいと思います。
今回の実際に作成した過程や、ローカル環境での細かい作り方等は次回行いたいと思います。

まず作成環境

動画生成
AMD Ryzen AI 9 HX 370 / Radeon 890M
RTX5070TI
動画生成ツールは「ComfyUI」を使用
AIは「WAN2.2」と「humo」を使用しました。
音楽はSUNOを使用しました。
音楽作成はSUNO Ver4.5+が最新だったので、Ver4.5+です。
元々の女性はQwenImageを使用しました。

動画は比較的生成に時間のかからない「720*480」の解像度で作成して、後に動画編集してからアップスケールする感じです。

「WAN2.2」も「humo」もちゃんと音を指定すれば、日本語の歌詞でもリップシンクしてくれるので、歌うシーンそのものは作りやすいです。
問題は、同時に出せる時間が短いので、それを切り貼りして1曲分に仕上げています。

まず前提条件として、最初から用意されているテンプレートを使用しています。
高速化とか色々複雑なワークフローを使っている人もいますが、テンプレートも高速化等のアップデートが行われているので、それだけでもある程度の物は作成できると思います。
「WAN2.2」は、14秒まで作成可能
「humo」はベースは3秒で5秒までは作成可能

この短い時間しか作成できないので、これをうまく組み合わせるしか無い事になります。
「WAN2.2」で14秒毎のリップシンク動画を作成します。

今回の音楽は3分18秒 = 198秒となります。
動画作成時音楽ファイルを指定すると、その先頭から14秒作ってくれるので、音楽ファイルを15分割して、作成する必要があります。
なので、歌のWAVファイルを15分割して、15回生成すると最後までの映像が完成します。

ここから実際の作成例です

まず、没映像ですが、3秒で作成するとワンフレーズ入らないので難しいです。
カメラワークもリップシンクもいい感じなんですが、突然切れてしまうので使いにくい映像になっています。

0:00
/0:03

次に14秒生成できる「WAN2.2」を使ってベースとなる動画の作成例です。
14秒毎に区切ったWAVファイルが15個できるので、これを一旦全部作成して、これをベースの映像にしようと考えました。
ベースなので、オーソドックスな物にしました。

作成した最初の14秒が以下になります。

0:00
/0:14

実際の動画では最初の7秒ぐらいまで別の映像を使用してから、この映像に切り替えています。
結局AIで生成する場合、何度も生成して、できがいい物を使う事になるので、ベースを作っておいて、そこにできが良い映像を重ねていくといった手法で作成しています。

また、間奏の時に色々な映像を入れたいと思ったので、いくつかの生成AIを試してみました。
その時に、かなり珍映像が作成されので、紹介したいと思います。

プロンプトは同じで、4種類のAI生成サービスをテストしました

以下がプロンプトです

女性がフリスビーを投げて、フリスビーが画面外へ飛んで行き、戻ってくるフリスビーを女性が一回転してかっこよくフリスビーをキャッチする

テストした生成AIのサービスは以下になります。

Runway Gen-3

Runway Gen-3は、特にAIを活用した動画生成と編集に強みを持つツールです。Gen-3 Alpha Turboモデルでは、5〜10秒のクリップを1分以内に生成可能で、高速な処理が特徴です。

Kling 1.6

リアルな映像やクリエイティブな動画を生成することが可能です。
自然な動きや細かいディテールの再現に優れ、商用利用にも適しています。

Veo3

非常に高性能なモデルとして知られています。リアルな映像生成や複雑なシーン描写が可能です。
オブジェクト除去、カメラやモーション制御、効果音や環境音の追加などが可能です。

それでは、それぞれのモデルの実行結果です。

Runway Gen-3

0:00
/0:10

残念感半端ないです。人種も変わった感じになっていますし、手に変な物を持っています。
謎な補完が多いですね。

Kling 1.6

0:00
/0:10

一番それっぽくなった例です。
フリスビーがよく分からない事になっていますが、一回転しているし、何かを投げているので、できるだけ再現しようとしているのが分かります。

Veo3

0:00
/0:08

オプション盛々で音も付けました。
動きは悪くないし、映像も綺麗なんですが、人物が変わっちゃってますし、投げたフリスビーのへなちょこぶりもなんとも・・・・
この辺は、人種指定とかをしないとダメなのかもしれません。

まとめ

それぞれの、AIで同じプロンプトで作成してみましたが、全体的に酷い事になっていると思います。
どうしたら良くなるのかや、プロンプトのテクニックは、やはりAIに聞くのが一番なんですが、そうは言っても試行錯誤が必要で、何度も生成できる方が有利なので、長尺の動画生成を行うにはローカルで試行錯誤しながら生成するのが良いかなと思ったりします。
もちろんお金が潤沢なら、クラウドサービスを使いまくって生成する方が、面倒くさいセッティングやPCを置く場所とか気にしなくても良いので、メリットはあります。

今回は動画生成の入り口的な話でしたが、次は実際に作成した時の過程を紹介したいと思います。

おまけ

今回MVで使用したローカル生成AIでも同じプロンプトで作成したので最後に紹介です

Wan2.2

0:00
/0:05

いつもより余計に回っておりますw

humo

今度は「humo」で何度か作成した結果、一番できがいいのと残念なの2種類です。

できがいい奴

0:00
/0:05

人物はほぼ維持されていて、フリスビーは疑惑はありますが投げています

今度はできの悪い奴

0:00
/0:03

ダイナミックでいい映像になっているのですが、人物が全然違う人になっていたり、髪型も違うので、思うようにいきませんでした。

という訳で、次回、大雑把に制作過程を説明していきたいと思います。

第2回へ続く
素人が作る実写っぽいミュージックビデオの作り方 その2

Read more

比較的最近の気になったニュース2026年1月21日

比較的最近の気になったニュース2026年1月21日

まるで成長していない。「USB4」になっても呼び名が混乱している件。Gen 2とか相変わらず分かりにくいまま 本当にUSB企画は分かりにくいというか、使う人の事を考えていないですよね。 USB3の時に規格がぶれまくって、整理するかと思いきや、 USB4になって、何も変わらずグダグダって・・・ なぜ『ボーダーブレイク』は国際的成功の好機を逃してしまったのか―結局日本限定でしか遊べなかった、理想的な「海外ゲーマー向け」作品【オリーさんのロボゲーコラム】 お財布ブレイクでも有名なボーダーブレイクは確かに世界的な人気作品になっても良さそうなゲームルールとデザインだと思うのですが、惜しい作品だと思います。 その辺の経緯や問題などをまとめられていて、非常に読み応えがあったので、興味がある方は是非読んでみてください。 “積みゲー”がタワーとして可視化できるツール「ツミナビ」が無料公開中。Steamアカウントと連携すると、所有しているゲームのリスト化やゲーマータイプ診断、傾向の分析などをおこなってくれる 紹介記事では10本ぐらいのアカウントで試しているようなので、ゲームの所持数が影響

最近気になった記事2026年01月14日

最近気になった記事2026年01月14日

GPT-5.2とGemini3の画像作成で大きな違いが出るのはなぜか GPTとGeminiの設計思想の違いを解説しています。 両方の特徴を理解して使い分ければ、欲しい情報や回答を得やすいって事だと思います。 記事では、以下のように GPT-5.2が考えるAIとして設計 と書かれており、考えをまとめたり問題点を洗い出すなど、何かをする前の準備段階で有効に使えそうで、 Gemini3は次のように書かれていて、 Gemini3は、業務で使われる成果物を作ることを強く意識した設計 最終的にまとめる時や、資料となる画像や具体的な書類を作成するのに向いている感じですね。 記事には以下のように書かれており、 GPT-5.2は、思考から表現へ進みます。Gemini3は、成果物から構成を逆算 GPT-5.2は優秀な戦略コンサルタントです。Gemini3は優秀な資料作成担当 アプローチが真逆なのが面白いですね。 だからこそ、使うタイミングや使い方が大事だと分かります。 更に、 日本語の文字化け問題は、すべての言語で同じように起きているわけではありません。 と書かれていて、そ

あけおめ動画を色々なAI動画生成で作ってみた

あけおめ動画を色々なAI動画生成で作ってみた

最近色々と忙しくて更新をサボっていましたが、久々の更新が「あけおめ」ですみません。 生成サービスで違いがあるので、その辺も含めてお楽しみください。 まずプロンプトですが、 全体的に日本のアニメ調にしてください。 日本の正月の挨拶用動画を作成してください。 画面上部に日本語で「あけましておめでとう」と毛筆で書いているように表示してください 画面下部にデフォルメしたリスを表示して正面へ向かって手を振ってください 画面左右に門松を配置してください 画面の左下に「AIS」と表記してください 正月の背景は日本っぽい風景にしてください といったプロンプトで作成していきます。 日本語の文字生成はsoraしか再現できないので、 画面上部に日本語で「あけましておめでとう」と毛筆で書いているように表示してください このプロンプトを削除して、文字以外で生成します。 必要なら後から動画編集ソフトで、文字を入れればいいかなと思います。 それでは、各動画生成AIで作成した動画を見ていきます。 最初はwan2.2で作成 ローカルで作成できるため、制限が無いので、数を作成しています。 一挙に3本

自分のSTEAMリプレイ2025の話

自分のSTEAMリプレイ2025の話

もう、今年もは終わりに近づいてきたので、2025年に遊んだSteamのゲームを振り返ってみたいと思います。 aisのSTEAMリプレイ2025 https://s.team/y25/jhcqwnq?l=japanese 公開に設定しているので、気になる方は見てみてください。 Steamのゲームを遊びたいと思いつつ、いまいち遊べていない感じがしていましたが、遊んでいるゲーム数も減っているので、コードレッドですw 動画の編集が意外と時間かかっているので、ここを少し省略したいなとか、「Super Mining Mechs」の動画編集が地味に時間かかっているのですが、無事最終回を迎えたので、少し楽になるかなと思います。 「Super Mining Mechs」プレイリスト プレイしたゲーム数が15本減っているみたいです。 去年も一昨年と比べて、かなり減っていたので、やばいですw 本数を沢山やればいいってもんじゃ無いですが、ゲームを遊んでいる時間も減っているので、じかんをつくれる男になろうと思いますw ほぼ半減で、実績の減りが凄いですw ゲームによって違うので、一概には言えませんが、や