評判の動画生成AIの「ConmfyUI」で「Wan2.2」省メモリー版を使ってみた

評判の動画生成AIの「ConmfyUI」で「Wan2.2」省メモリー版を使ってみた

「ConmfyUI」の標準的テンプレートを使用してみましたが、「RTX5070 Ti 16GB」だととりあえず動きますが、動作のサイズや時間でメモリー不足になってしまします。
また、調節も色々難しくて、動画のサイズで生成中に止まったり、なかなか思うように生成できません。
昨日の記事でも載せましたが、初期状態で何もいじらずに、動画を作成した時の内容です。

0:00
/0:05

5秒だけですが凄いですよね。
水滴の動きまでちゃんと表現できています。
時間を延ばそうと色々と設定を変えたり、プロンプトを変えてみましたが、時間を延ばすとメモリーが足りなくなります。

そんな時、
ComfyUIでWan2.2をLoRAを使って軽量化し、RTX3060で動かす

こんな記事が流れてきました。
少ないメモリーで動かす試みです。
これを適用すれば、メモリー不足が緩和されて、動画サイズや時間を伸ばしてもうまく動きそうです。
ネタ元は「reddit」の書き込みだそうで、こちらを参照しつつ試しました。

reddit
元記事

「reddit」でワークフローがダウンロードできるので、これを使わせてもらいます。
必要なものは

モデルが以下の2種類

wan2.2_t2v_high_noise_14B_Q5_K_M.gguf
wan2.2_t2v_low_noise_14B_Q5_K_M.gguf

LoRA:

Wan21_T2V_14B_MoviiGen_lora_rank32_fp16.safetensors

「ComfyUI\models\diffusion_models」へコピーします。

書かれていませんが、まっさらな状態で利用する場合、以下のファイルも必要になります。

LoRA:

Wan21_T2V_14B_lightx2v_cfg_step_distill_lora_rank32.safetensors

以下のサイトで落とせます。
https://huggingface.co/joerose/Wan21_T2V_14B_lightx2v_cfg_step_distill_lora_rank32/tree/main

入れる先はこちらです。
「ComfyUI\models\loras」

これで、動作しました。
いろいろ試しましたが、画像のサイズを大きくすると途中で止まるケースもあり、このモデルはサイズで色々ありそうです。
個人的に安定したのは、「420*720」の縦長でした。
色々情報を見ていると、学習データがスマホの縦長が多かったから、縦長の方が得意だろうみたいな話でした。
納得できる話ではありますが、横長の動画を作りにくいのは、ちょっと困りますね。(作ってみましたが作れない事は無いですね)

実際に作ってみた動画です
コーヒーを飲むメイドさん

0:00
/0:05

踊るメイドさん

0:00
/0:15

なぜかめっちゃ雪が降ってます。
15秒と長めにしたら、80分程度の時間がかかりました。
雪に関しては、プロンプトには含めていないので、謎ですw
むしろプロンプトに天気や気候の情報を入れれば良かったかもです。

今度はアニメ絵です。

0:00
/0:05

このクオリティーで5秒5分かからないって・・・これまた凄いですよね。サイズは480*720ですけど。
テキストから作成できるので、詳しくテキストで描写すれば、かなり忠実に作成してくれます。

女の子ばかりじゃ無くて、こんなのも

0:00
/0:05

ビルの解体爆破をやろうと思ったら・・・・

なかなかうまくいかない物ですw
もう少し実験して、成果があったらまた書きます。

最後に失敗した解体現場をお送りしますw

0:00
/0:05

Read more

画像フォーマットに関する記事を見て色々と深掘りしてみた

画像フォーマットに関する記事を見て色々と深掘りしてみた

画像フォーマットの正体とWebPの「予測マジック」を理解する 次世代画像フォーマットAVIFを触ってみた 割と最近の画像圧縮フォーマットについてです。 「webp」は比較的見るようになったフォーマットですが、従来は画像のサイズが小さいのはJPGで、透明色が使えて画質を維持するのがPNGって感じで、使い分けられていると思います。 しかし、JPGは古いフォーマットで圧縮アルゴリズムも古い上に、透明色が使えないなど改良の余地が多々あるので、「JPEG 2000」というフォーマットも作成されました。 「JPEG 2000」は技術的には従来のJPEGを大幅に上回る優秀なフォーマットにもかかわらず、処理負荷の高さや互換性の問題から一般消費者向けには普及しませんでした。 今となっては、それ程負荷は高くないのですが、開発された当時(2000年代前半)のPCのスペックを考えると厳しかったと思われます。 2001年のPCスペックを調べてみました。 Intel Pentium III 256MBから512MBのRAM 20GBから80GB Windows 98やWindows 2000が主流 この

suno5.5の実力を過去バージョンと比較(比較曲多めでお送りします)

suno5.5の実力を過去バージョンと比較(比較曲多めでお送りします)

suno5.5を使ってみましたが、なんか音の厚みが増して日本語の再現度も上がって、歌唱クオリティが一ランク上がったように感じるほどです。 とりあえずバージョンの歴史から V2 (2023年秋):  最大生成時間は1分20秒でした V3 (2024年春):  生成時間が2分に更新されました V3.5 (2024年夏): 曲の構造が改善され、初回生成の最大時間が4分に、延長                       (Extend)は1回につき最大2分まで可能になりました V4 (2024年11月): ボーカル品質が向上し、初回生成の最大時間は4分です。また、「Extend(延長)」「Cover(カバー)」「Persona(ペルソナ)」機能が追加されました V4.5 (2025年5月): 初回生成の最大時間が8分に延長され、プロンプトへの忠実度やスタイルのマッシュアップ機能が向上しました V4.5+ (2025年7月): 「Add Vocals(ボーカル追加)」や「Add Instrumental(インスト追加)」などの制作ツールが更新されました V5 (2025年9月):  オーディ

「NANObanana」があれば、LINEスタンプいらなくね?

「NANObanana」があれば、LINEスタンプいらなくね?

LINEスタンプはすぐに返せて便利なんですが、返したいスタンプを探すのが結構手間になってきています。 スタンプをそれ程沢山持っている訳じゃないんですが、30弱程度あります。 それだけでも、確かこんなのあったなとか、軽い感じのお礼スタンプどれがいいかなとか、選ぶのに時間がかかると、手軽に返せるスタンプの意味がありません。 そこで「NANObanana」です。画像に日本語も入れてもらえるので、スタンプが必要な時に、その場にあったスタンプを作ってしまえばいい!! と言う事で、やってみました。 スタンプのプロンプトは、うまい人がいると思うので、そこを突き詰めたい人はその手の記事を参考にしてください。 今回は、お手軽にその場でスタンプを作って、友人とかに利用するってお話です。 とは言え、イメージ通りの結果は欲しいので、何を注意すればそれっぽく作れるのかは少し実験してみたいと思います。 まずはAIに素直に聞いてみる。AIの事はAIに聞くのが一番です。 次の事に注意しろと教えてもらえます。 キャラクター設定: どのキャラクターを使いたいかを明確に指定します。 セリフや感情表現: どのようなセ

「Claude Code」 関連記事まとめ

「Claude Code」 関連記事まとめ

日々「Claude Code」を使用していますが、新しいツールや「Claude Code」自信もバージョンアップしているため、私自身もアップデートしていかないと、いつの間にか置いて行かれて非効率な使い方をしていたなんて事になりかねません。 と言う訳で、個人的に参考になったり、読んでいて面白かった記事をピックアップしました。 良ければ参考にしてください。 簡単コピペでClaude Codeに144種類のエージェントチームを作成 ── agency-agentsという40Kスター超のAIエージェント集を使いこなす 「Claude Code」は、エージェント次第で生成するコードの質が変わってきます。 まだ使ってはいませんが、使って見ようと思ってます。 効果的なCLAUDE.mdの書き方 「Claude Code」は「CLAUDE.md」の書き方次第でも違いが出るので、この辺も見ておくといいかも内容です。「Claude Code」を使う上での基本ですね。 【2026年版】Claude Codeを最強にするプラグイン・MCP・ツール総まとめ これも結構参考になると思います。 はやり廃りがあ