動画生成
はじめに Diffusers 0.40.0 で追加された Wan-Animate-2 で動画生成を行ってみました。 参照画像と参照動画から新たな動画を作りました。 SDNQで4bit量子化をしています。 環境 Ubuntu 26.04 on WSL2 事前準備 Ubuntuに以下をインストールする必要がありまし…
はじめに 前回(T2VA)の続きです。今回はRef2VAにチャレンジしました。 参照画像と参照動画を元に動画作成しています。 環境 Ubuntu 26.04 on WSL2 Ubuntu 24.04を使った過去の記事はこちらです。 事前準備 Ubuntuに以下をインストールする必要がありました…
使用したPC こちらのPCを使っています。 Windows 11 Home Core i7-12700H GeForce RTX 3080 Laptop VRAM 16GB RAM: 32GB SSD: 1TB NVMe SSD 環境 Ubuntu 26.04 on WSL2 Ubuntu 24.04を使った過去の記事はこちらです。 事前準備 Ubuntuに以下をインストールす…
はじめに 以前こちらの記事でDiffusersからMiniMax-H3を使いました。 今回はDiffSynth-Stuidioから使ってみました。 環境 Ubuntu 24.04 on WSL2 CUDA Toolkitのインストール こちらに従いCUDA Toolkit 13.0 Update 3をインストールしました。 インストール後…
はじめに transformerとtext_encoderをSDNQ(SD.Next Quantization)で4bit量子化しました。 torchao、bitsandbytesでもやってみましたが、4bit量子化は実行できても実際にモデルを実行する時にgroup_offloadingのところで躓いてうまくできませんでした。 環境…
はじめに touch-sp.hatenablog.com 前回の続きです。Two-stage distilled generationでは縦、横それぞれ倍の動画が作成されます。 latent_upsampleのダウンロード uvx hf download Lightricks/LTX-2.5-Diffusers \ --local-dir LTX-2.5-Diffusers \ --includ…
はじめに touch-sp.hatenablog.com 前回はモデルをロードするたびに量子化を行っていました。それでは無駄が多いので量子化したモデルを保存して再利用することにしました。 量子化 text_encoderの量子化と保存 import torch from transformers import Gemma…
環境 Ubuntu 24.04 on WSL2 Python環境構築 uvを使用しています。pyproject.tomlを載せておきます。 [project] name = "ltx" version = "0.1.0" description = "Add your description here" readme = "README.md" requires-python = ">=3.13" dependencies =…
環境 Ubuntu 24.04 on WSL2 Python環境構築 uvを使用しています。pyproject.tomlを載せておきます。 [project] name = "ltx" version = "0.1.0" description = "Add your description here" readme = "README.md" requires-python = ">=3.13" dependencies =…
使用したPC こちらのPCを使っています。 Windows 11 Home Core i7-12700H GeForce RTX 3080 Laptop VRAM 16GB RAM: 32GB SSD: 1TB NVMe SSD 環境 Ubuntu 24.04 on WSL2 事前準備 Ubuntuに以下をインストールする必要がありました。 sudo apt install -y buil…
結果 結果はGoogle Bloggerに載せています。 support-touchsp.blogspot.com RTX 4090を使って25分ほど掛かっています。 GPU 0 - Used memory: 23.90/23.99 GB time: 1492.29 sec Pythonスクリプト import torch from diffusers import WanPipeline, Autoenco…
はじめに「LTX-Video 0.9.7 Distilled」を使って動画作成(Text2Video)を行ってみました。Version 0.9.1の記事はこちらです。 touch-sp.hatenablog.com Version 0.9.5の記事はこちらです。 touch-sp.hatenablog.com PC環境 Windows 11 RTX 3080 Laptop (VRA…
はじめに「FramePack」は少ないVRAMで高品質な長尺動画生成を可能にする技術のようです。Lvmin Zhangという人を中心として開発されたようですが、この方はかなり実績ある人のようです。「ControlNet」や「Fooocus」や「Stable Diffusion WebUI Forge」を開発…
はじめにVersion 0.9.1の記事はこちらです。 touch-sp.hatenablog.com 今回はVersion 0.9.5を使います。PC環境 Windows 11 RTX 4090 (VRAM 24GB) CUDA 12.4 Python 3.12Python環境構築 pip install torch==2.6.0+cu124 --index-url https://download.pytorch…
PC環境 Windows 11 CUDA 12.4 Python 3.12Python環境構築 pip install torch==2.6.0+cu124 --index-url https://download.pytorch.org/whl/cu124 pip install diffusers transformers pip install ftfy imageio-ffmpeg imageioPythonスクリプト import torch…
はじめに前回の続きです。 touch-sp.hatenablog.com 作成時間を短縮するために行程を分割してみました。 分割するとCPU offloadをしなくて済むのではないかという発想です。Pythonスクリプト import torch from diffusers import ConsisIDPipeline from diff…
はじめにConsisIDは人間のアイデンティティを保つことを目的として開発された動画生成モデルです。IP-Adapter FaceIDの動画版みたいなものと勝手に認識しています。 touch-sp.hatenablog.com 使用したPC プロセッサ Intel(R) Core(TM) i7-14700K 実装 RAM 96…
はじめに CogVideoXの記事を以前書きました。Diffusersを使うとその時とほとんど同じスクリプトで「Mochi 1 Preview」も実行可能です。 touch-sp.hatenablog.com 使用したPC OS Windows 11 プロセッサ Core(TM) i7-14700K 実装 RAM 96.0 GB GPU RTX 4090 (VR…
はじめにこちらを使わせて頂きました。 note.com 使用したPC OS Windows 11 プロセッサ Intel(R) Core(TM) i7-12700H 実装 RAM 32.0 GB GPU RTX 3080 Laptop (VRAM 16GB)CUDA 11.8 Python 3.12Python環境構築 pip install torch==2.5.1+cu118 torchvision==0…
はじめに CogVideoXに関しては以前も記事を書いています。 touch-sp.hatenablog.com touch-sp.hatenablog.com 今回は「CogVideoX1.5-5B」でText2Videoを行いました。使用したPC2つのPCで実行しました。PC1(デスクトップ) OS Windows 11 プロセッサ Core(T…
はじめにVersion 0.9.0の記事はこちらです。 touch-sp.hatenablog.com 今回はVersion 0.9.1を使います。PC環境 Windows 11 RTX 4090 (VRAM 24GB) CUDA 12.4 Python 3.12Python環境構築 pip install torch==2.5.1+cu124 --index-url https://download.pytorch…
PC環境 Windows 11 RTX 4090 (VRAM 24GB) CUDA 12.4 Python 3.12Python環境構築 pip install torch==2.5.1+cu124 --index-url https://download.pytorch.org/whl/cu124 pip install git+https://github.com/huggingface/diffusers pip install transformers …
PC環境 Windows 11 CUDA 12.4 Python 3.12Python環境構築 pip install torch==2.5.1+cu124 --index-url https://download.pytorch.org/whl/cu124 pip install git+https://github.com/huggingface/diffusers pip install transformers accelerate sentencepi…
はじめに前回の続きです。 touch-sp.hatenablog.com 動作可能な環境をいろいろさぐってみました。動作環境と環境構築Python 3.10 + CUDA 12.4 Windows 11 CUDA 12.4 Python 3.10pip install torch==2.4.1 torchvision==0.19.1 torchaudio==2.4.1 xformers --…
はじめに「Hallo2」は顔画像と音声ファイルからしゃべっている動画を作成するモデルです。「リップシンク」モデルと表現されることもあります。以前「SadTalker」というのを使ったことがあります。それと同じようなことができます。 touch-sp.hatenablog.com…
PC環境 Windows 11 CUDA 12.4 Python 3.12Python環境構築 pip install torch==2.5.1 --index-url https://download.pytorch.org/whl/cu124 pip install git+https://github.com/huggingface/diffusers pip install transformers accelerate sentencepiece im…
はじめに以前「Text2Video」を行いました。 touch-sp.hatenablog.com 今回は「Image2Video」を行いました。PC環境 Windows 11 RTX 4090 (VRAM 24GB) CUDA 11.8 Python 3.12Python環境構築 pip install torch==2.4.1+cu118 --index-url https://download.pyto…
Python環境構築 pip install torch==2.4.0+cu118 --index-url https://download.pytorch.org/whl/cu118 pip install git+https://github.com/huggingface/diffusers pip install git+https://github.com/huggingface/accelerate pip install transformers se…
はじめに前回の続きです。 touch-sp.hatenablog.com 変更点・Multi-IP-Adapterに対応しました。 (ただし、まだIP-AdapterのMulti-imagesには対応できていません)・モーション動画の作成をChampの方法(Blender使用)で行いました。 github.com 目的1つの動…
はじめに最近Diffusers Community Pipeline内にある「pipeline_animatediff_controlnet.py」のバグが修正されました。 github.com それに伴い過去の記事を少し書き直してみました。 touch-sp.hatenablog.com 変更点・FreeUを追加した ・「os」→「pathlib」に…