ローカルAIモデルの選び方|画像生成・動画生成はVRAM何GBで動く?【2026年版】
「ローカルLLM」に続いて、画像生成や動画生成もPCの中で動かしたい、という相談が増えています。ただ、AIモデルは種類ごとに必要なGPUメモリ(VRAM)がまったく違い、動画生成にいたっては公式の推奨がゲーミングPCの枠を超えるものも珍しくありません。
結論から言うと、文章(LLM)と画像生成はVRAM 12〜16GBのゲーミングPCで実用的に動きます。動画生成は16GBでも「小型モデルを低解像度で試せる」段階で、720Pクラスの本格生成は24GB以上のVRAMを前提にした公式案内が多くなります。
この記事のVRAM数値は、各モデルの公式リポジトリ・公式発表に記載された値です。使用するツール(ComfyUIなど)、量子化の有無、解像度・フレーム数によって必要量は変わります。生成にかかる時間は環境差が大きいため、この記事では公式に明記された値以外は示していません。
この記事のポイント
- ローカルAIは「文章」「画像」「動画」で必要なVRAMが段違い。動画がいちばん重い
- 画像生成はStable Diffusion 3.5 Mediumが公式値9.9GBで、12〜16GBのGPUが選びやすい
- 動画生成はWan2.1 1.3B(約8.2GB・480P)なら試せるが、720Pの公式推奨は24GB以上
- モデルによって商用利用の条件が違う。仕事で使うならライセンスも先に確認する
結論:文章と画像は16GBで実用、動画は別格
ローカルで動かすAIモデルは、大きく「文章を生成するLLM」「画像を生成するモデル」「動画を生成するモデル」の3つに分かれます。どれもGPUのVRAMに載せて処理する点は同じですが、必要な容量は種類ごとに大きく違います。
LLMは量子化されたモデルなら8GBでも8Bクラスが載り、16GBあれば20Bクラスまで試せます。画像生成は、代表的なStable Diffusion 3.5 Mediumが公式値で9.9GBなので、12〜16GBのGPUが現実的です。動画生成は、小型のWan2.1 1.3Bが約8.2GBで480P動画を作れる一方、720Pクラスの公式推奨は24GB、大型モデルでは45〜80GBと、ゲーミングPC向けGPU(8〜16GB)の範囲を超えます。
「文章と画像は16GBで実用、動画は16GBでも入門まで」。これが2026年9月時点の目安です。
ローカルAIは3種類。重さがまったく違う
| 種類 | 代表的なモデル | VRAMの目安 | ゲーミングPCでの現実 |
|---|---|---|---|
| 文章(LLM) | Qwen3、Gemma 3、gpt-oss | 8GBで8B、12GBで14B、16GBで20Bクラス | 8GBから実用。16GBで余裕 |
| 画像生成 | Stable Diffusion 3.5 / SDXL / FLUX.1 | SD3.5 Mediumは公式値9.9GB(テキストエンコーダー除く) | 12〜16GBで実用。8GBは工夫が必要 |
| 動画生成 | Wan2.1 / Wan2.2 / LTX-Video / HunyuanVideo | 小型で約8.2GB(480P)、720Pは24GB以上、大型は45〜80GB | 16GBでも小型モデルの入門まで |
同じ「AI」でも、動画生成は画像を何十枚も連続で作るような処理になるため、モデル本体に加えて中間データの保持にも大量のVRAMを使います。文章や画像と同じ感覚でGPUを選ぶと、動画だけは「起動すらできない」ということが起こります。
画像生成モデルとVRAMの目安
画像生成は、ローカルAIの中でいちばん情報が充実している分野です。主要な3系統について、公式に示されている要件とライセンスを整理しました。
| モデル | 規模 | VRAM(公式記載) | ライセンス |
|---|---|---|---|
| Stable Diffusion 3.5 Medium | 25億パラメーター | 9.9GB(テキストエンコーダー除く)。0.25〜2メガピクセルの生成に対応 | Community License:非商用は無料、年商100万ドル未満なら商用も無料 |
| Stable Diffusion XL 1.0 | SDXL base | 数値の記載なし。VRAMが足りない場合はCPUオフロードで動作可と案内 | CreativeML Open RAIL++-M |
| FLUX.1 [schnell] | — | 公式READMEに数値の記載なし | Apache 2.0(商用可) |
| FLUX.1 [dev]系 | — | 公式READMEに数値の記載なし | Non-Commercial License(商用は別途ライセンス) |
目安はVRAM 12GB以上、余裕を見るなら16GB
Stability AIはSD3.5 Mediumを「一般的な消費者向けGPUで動くよう設計した」と説明しており、公式値の9.9GBはテキストエンコーダーを含みません。実際にはWindowsの画面表示や、生成ツール自体のメモリも同じVRAMを使うため、12GBが実用の入口、16GBなら高解像度や複数モデルの併用にも余裕が持てます。8GBのGPUでも、容量を減らした配布形式やCPUオフロードで動く場合はありますが、生成に時間がかかったり、解像度を落とす必要が出たりします。
画像生成はNVIDIA前提の情報が多い
画像生成ツールの多くはNVIDIAのCUDAを前提に開発され、ドキュメントやコミュニティの情報もNVIDIA向けが先に出ます。Radeonでも動かす方法はありますが、手順が増えることが多いため、画像生成を主目的にするならGeForceのほうが情報を探しやすくなります。
動画生成モデルとVRAMの目安
動画生成は、公式の要件そのものがゲーミングPCの範囲を超えることが多い分野です。数値をそのまま並べると、必要なVRAMの幅がよく分かります。
| モデル | 解像度の目安 | VRAM(公式記載) | ライセンス |
|---|---|---|---|
| Wan2.1 T2V-1.3B | 480P(832×480) | 8.19GB。RTX 4090で5秒動画を約4分(公式値)。オフロード設定で不足を回避 | Apache 2.0 |
| Wan2.2 TI2V-5B | 720P(1280×704) | RTX 4090(24GB)で動作。オフロードとdtype変換の設定が前提 | Apache 2.0 |
| Wan2.2 14B系 | 480P / 720P | 80GB以上のGPUを推奨 | Apache 2.0 |
| LTX-Video 2B | — | 低VRAM向けと案内。具体的な数値の記載なし(13B版は大容量が必要) | LTXV Open Weights License(年商1,000万ドル以上は有償の商用ライセンス) |
| HunyuanVideo | 544×960 / 720×1280 | 45GB(544×960)、60GB(720×1280、129フレーム)。FP8版で約10GB減 | Tencent Hunyuan Community License |
16GBのGPUで現実的なのは「小型モデル・低解像度」
公式値を見ると、VRAM 16GBのゲーミングPCで無理なく動くのは、Wan2.1の1.3B(約8.2GB)やLTX-Videoの2Bのような小型モデルです。解像度は480Pクラス、長さは数秒が中心になります。720Pの公式推奨はWan2.2 5BでもRTX 4090(24GB)で、HunyuanVideoは45〜60GB。16GBのGPUに「本格的な動画生成」を期待すると、ほぼ確実にVRAM不足で止まります。
コミュニティでは量子化や分割読み込みで16GB以下に収めた派生版も公開されていますが、公式のサポート対象ではなく、手順も日々変わります。動画生成を主目的にするなら、VRAM 24GB以上のGPUか、クラウドの動画生成サービスとの併用を前提に考えるのが現実的です。
時間もVRAMと同じくらい効く
Wan2.1の公式説明では、RTX 4090でも5秒の480P動画に約4分かかるとされています。ゲーミングPC向けのGPUではさらに時間がかかることが見込まれます。「動くかどうか」だけでなく、「1本作るのに何分待てるか」も、動画生成では現実的な判断材料になります。
文章(LLM)は別記事で。要点だけ整理
文章生成のローカルLLMについては、ローカルLLMはゲーミングPCで動く?決め手はGPUのVRAMで、モデル容量とVRAMの対応を詳しく解説しています。ここでは要点だけをまとめます。
- Ollamaの既定版(量子化済み)なら、VRAM 8GBで8Bクラス、12GBで14Bクラス、16GBで20Bクラス(gpt-oss-20b=14GB)が目安
- モデル容量に1〜3GBの余裕を足してVRAMを見積もる
- OllamaはNVIDIAとAMD Radeonの両方に公式対応
3種類のなかではもっとも軽く、Radeonでも公式ツールが対応している点で、いちばん始めやすいのがLLMです。
TITANのGPU別に「できること」を整理
TITAN GamingのH17シリーズで選べるGPUを、VRAMと「3種類のローカルAIでどこまでできるか」で整理しました。VRAMはNVIDIA・AMDの公式仕様、価格は2026年9月27日に商品ページで確認した最安構成(メモリ16GB・SSD 512GB)です。
| GPU | VRAM | 文章(LLM) | 画像生成 | 動画生成 | H17の最安構成 |
|---|---|---|---|---|---|
| RTX 5060 | 8GB | 8Bクラスまで | 軽量な配布形式で入門 | 小型モデルもオフロード前提 | ¥153,000 |
| RTX 5070 | 12GB | 14Bクラスまで | SD3.5 Mediumが公式値内 | Wan2.1 1.3Bなど小型・480P | ¥263,000 |
| RTX 5060 Ti 16GB | 16GB | 20Bクラスまで | 実用。高解像度にも余裕 | 小型・480Pの入門まで | ¥242,000 |
| RTX 5070 Ti | 16GB | 20Bクラスまで | 実用。5060 Tiより高速 | 小型・480Pの入門まで(より短時間) | ¥397,000 |
| RTX 5080 | 16GB | 20Bクラスまで | 実用。シリーズ最速 | 小型・480Pの入門まで(より短時間) | ¥474,000 |
| RX 9060 XT 16GB | 16GB | 20Bクラスまで(Ollama公式対応) | NVIDIA向けの情報が中心。対応確認が必要 | 同左 | ¥176,000 |
| RX 9070 XT | 16GB | 20Bクラスまで(Ollama公式対応) | NVIDIA向けの情報が中心。対応確認が必要 | 同左 | ¥244,000 |
表のとおり、H17シリーズで選べるGPUはVRAM 16GBが上限です。動画生成の「720P本格生成」に必要な24GB以上は、この価格帯のゲーミングPCの範囲外になります。3種類すべてに手を出したい場合でも、まず「文章と画像を快適に、動画は入門として」と割り切ると、16GBのGPUで満足しやすくなります。
用途別の構成例
ローカルAIの用途別に、H17シリーズから3構成を選びました。価格は2026年9月27日確認の最安構成です。

文章と画像生成を手頃に:H17 RTX 5060 Ti 16GB
¥242,000(税込)
- CPU:Ryzen 5 5500
- GPU:RTX 5060 Ti(VRAM 16GB)
- メモリ:16GB DDR4
- SSD:512GB NVMe
- SD3.5 Mediumの公式値9.9GBに余裕。LLMは20Bクラスまで

ゲームも画像生成も速く:H17 RTX 5070
¥263,000(税込)
- CPU:Ryzen 5 5500
- GPU:RTX 5070(VRAM 12GB)
- メモリ:16GB DDR4
- SSD:512GB NVMe
- 画像生成の公式値内。ゲーム性能は5060 Tiより上。LLMは14Bクラスまで

動画生成の入門まで視野に:H17 RTX 5070 Ti
¥397,000(税込)
- CPU:Ryzen 5 5500
- GPU:RTX 5070 Ti(VRAM 16GB)
- メモリ:16GB DDR4
- SSD:512GB NVMe
- VRAMは16GBのまま、処理性能で小型動画モデルの待ち時間を短縮
価格・在庫・構成は変更される場合があります。オプションを変更したあとの総額は商品ページで確認してください。
メモリとSSDは多めに
画像・動画生成では、モデルの読み込みや中間データにメインメモリも使います。VRAMからあふれた分をCPU側に逃がす「オフロード」設定は、メインメモリが多いほど効きます。生成AIを中心に使うなら、メモリ32GBを搭載したモデルも検討してください。SSDも、画像生成モデル1つで数GB〜十数GB、動画生成モデルはそれ以上になるため、1TB以上を選ぶと安心です。
ライセンスと商用利用の注意
ローカルAIのモデルは「無料でダウンロードできる」ものが多い一方、商用利用の条件はモデルごとに違います。個人で楽しむだけなら気にする場面は少ないですが、仕事の制作物やSNSの収益化に使うなら、先に確認しておくと安心です。
- Apache 2.0(Wan2.1 / Wan2.2 / FLUX.1 schnell):商用利用を含めて広く使える
- Stability AI Community License(SD3.5):非商用は無料。年商100万ドル未満なら商用も無料、それ以上は企業向けライセンスが必要
- FLUX.1 dev系:非商用ライセンス。商用利用は別途ライセンス契約
- LTXV Open Weights License(LTX-Video):年商1,000万ドル以上の事業者は有償の商用ライセンスが必要。用途制限あり
ライセンスは改訂されることがあります。実際に使う前に、配布元の最新の条文を確認してください。
購入前チェック
- 「文章」「画像」「動画」のどれを主目的にするか決める
- 使いたいモデルの公式VRAM要件を確認する(動画は24GB以上の案内が多い)
- 公式値に、画面表示やツール分として2〜4GBの余裕を足す
- GPUのVRAM容量を商品名と公式仕様で確認する(RTX 5060 Tiは8GB版と16GB版がある)
- 画像・動画生成ツールがそのGPU(特にRadeon)に対応しているか確認する
- メモリは16GBか32GBか、SSDは512GBか1TB以上かを用途から決める
- 仕事で使うなら、モデルのライセンスで商用利用の条件を確認する
よくある質問
VRAM 8GBのGPUでも画像生成はできますか?
容量を減らした配布形式やCPUオフロードを使えば動く場合があります。ただしSD3.5 Mediumの公式値は9.9GB(テキストエンコーダー除く)なので、快適に使うなら12GB以上が目安です。
VRAM 16GBのGPUで動画生成はできますか?
Wan2.1 1.3B(公式値8.19GB・480P)のような小型モデルなら試せます。720Pクラスの公式推奨は24GB以上なので、16GBでは「入門まで」と考えてください。
Radeonでも画像・動画生成はできますか?
Ollama(LLM)はRadeonに公式対応しています。画像・動画生成ツールはNVIDIA向けの情報が中心で、Radeonで動かす場合は手順が増えることが多いため、使いたいツールの公式ドキュメントで対応状況を確認してください。
RTX 5070(12GB)とRTX 5060 Ti 16GB、画像生成ならどちらですか?
どちらもSD3.5 Mediumの公式値内です。高解像度や複数モデルの併用を重視するならVRAMが多い5060 Ti 16GB、ゲーム性能や生成の速さを重視するなら5070が向いています。
生成したものを仕事で使えますか?
モデルのライセンス次第です。Apache 2.0のモデルは広く使えますが、SD3.5やLTX-Videoは事業規模に応じた条件があり、FLUX.1 dev系は非商用です。配布元の最新の条文を確認してください。
まとめ:主目的を決めてからVRAMを選ぶ
ローカルAIは「文章」「画像」「動画」で必要なVRAMがまったく違います。文章と画像は12〜16GBのゲーミングPCで実用的に動き、動画は16GBでも小型モデルの入門までが現実です。まず主目的を決め、使いたいモデルの公式要件に余裕を足してGPUを選ぶのが失敗しない順番です。
用途に合う構成に迷ったら、TITANの構成診断で「生成AI・ローカルAI」を選ぶと、GPUメモリとメモリ容量を重視した候補を確認できます。
参考情報
- Stability AI:Introducing Stable Diffusion 3.5(Medium 9.9GB・ライセンス)(2026年9月27日確認)
- Stability AI:Stable Diffusion XL 1.0 モデルカード(2026年9月27日確認)
- Black Forest Labs:FLUX(GitHub、ライセンス一覧)(2026年9月27日確認)
- Wan-Video:Wan2.1(GitHub、T2V-1.3B 8.19GB)(2026年9月27日確認)
- Wan-Video:Wan2.2(GitHub、TI2V-5B・14B要件)(2026年9月27日確認)
- Lightricks:LTX-Video(GitHub)(2026年9月27日確認)
- Lightricks:LTXV Open Weights License 0.X(2026年9月27日確認)
- Tencent:HunyuanVideo(GitHub、VRAM要件)(2026年9月27日確認)
- Ollama:GPU対応(NVIDIA・AMD Radeon)(2026年9月27日確認)
- NVIDIA:GeForce RTX 5060ファミリー仕様(2026年9月27日確認)
- NVIDIA:GeForce RTX 5070ファミリー仕様(2026年9月27日確認)
- NVIDIA:GeForce RTX 5080仕様(2026年9月27日確認)
- AMD:Radeon RX 9060 XT仕様(2026年9月27日確認)
- AMD:Radeon RX 9070 XT仕様(2026年9月27日確認)
- TITAN Gaming各商品ページ(価格・構成、2026年9月27日確認)