最適なローカルAI画像生成ツールは、どのように作業したいかによって変わります。Atomic Chatはローカルチャットと画像生成を組み合わせ、ComfyUIは詳細なノードワークフローを操作でき、Krita AI Diffusionは制作中の作品内で使えます。Draw ThingsはAppleデバイス向けに作られています。
アプリはインターフェースと編集ツールを提供します。画像モデルは、出力の多くの部分と必要なメモリ量を決定します。このガイドでは両方を比較し、7つのモデル構成をRTX 5090上のstable-diffusion.cppで、1024 × 1024の解像度でベンチマーク測定しました。
おすすめローカルAI画像生成ツールの早見表
| アプリ | 対応プラットフォーム | 習得の難易度 | モデルとワークフロー | 編集 | API | ライセンス | 価格 |
|---|---|---|---|---|---|---|---|
| Atomic Chat | macOS, Windows, Linux | 低い | 厳選されたstable-diffusion.cppカタログ | モデルに応じてCreate、Transform、Reference、Editに対応 | OpenAI互換のローカルエンドポイント | エンジン:MIT | 無料ダウンロード |
| ComfyUI | Windows, macOS, Linux | 高い | 幅広いモデルエコシステム、カスタムノード | ワークフローによる | あり | GPL-3.0 | 無料 |
| InvokeAI | Windows, macOS, Linux | 中程度 | ガイドに沿った生成とキャンバスでの作業 | キャンバスとマスキングツール | あり | Apache-2.0 | 無料 |
| SwarmUI | Windows、Linux。macOSではコミュニティによる導入方法あり | 中程度 | 複数のローカルバックエンド | あり | あり | MIT | 無料 |
| Krita AI Diffusion | Windows, macOS, Linux | 中程度 | Kritaプラグインによるワークフロー | レイヤー、マスク、領域ごとの作業 | 汎用APIなし | GPL-3.0 | 無料 |
| Stability Matrix | Windows, macOS, Linux | 低い〜中程度 | 複数のローカルアプリに対応したランチャー | 起動するアプリによる | 起動するアプリによる | AGPL-3.0 | 無料 |
| Draw Things | macOS, iOS, iPadOS | 低い | Apple Siliconを重視したアプリ | 画像ワークフローとインペインティング | ローカルAPIとスクリプト | コミュニティリポジトリ:GPL-3.0 | 無料 |
| Fooocus, A1111, Forge | 主にWindowsとLinux | 低い〜中程度 | 確立されたStable Diffusionエコシステム | あり | ツールによる | GPL-3.0 / AGPL-3.0 | 無料 |
ツール選びは最終的には個人の好みによるため、選定に一貫性を持たせるために3つの基準を使いました。テキストから画像への生成や画像から画像への変換といった主要なワークフローへの対応、活発なコミュニティ、継続的な開発です。
DiffusionBeeは引き続き利用できますが、公開リポジトリへの最後のプッシュは2024年10月でした。新しい環境向けに選ぶ前に、現在のモデル対応状況を確認してください。
おすすめのローカルAI画像生成アプリ
Atomic Chat
Atomic Chatは、ローカルAIモデルを実行するためのデスクトップアプリです。ローカルチャットと画像生成を1つのアプリにまとめ、stable-diffusion.cppエンジンを通じて画像モデルを実行します。
アプリは、各画像モデルに必要なエンジン、モデルの重み、VAE、テキストエンコーダーをダウンロードして管理します。
現在のカタログは、モデルに応じてCreate、Transform、Reference、Editに対応しています。サイドバーに表示されるほかのワークフローのラベルについては、これらのカタログモデルは対応していません。
- Createは、プロンプトから新しい画像を生成します
- Transformは、プロンプトを使って既存の画像を変更します
- Referenceは、画像を視覚的な入力として使用します
- Editは、画像の指定した部分に変更を加えます。
Atomic Chatは、チャットモデルと画像モデルを同時にメモリに収められない場合、チャットモデルをアンロードします。これにより、同じアプリ内でローカルチャットと画像生成のメモリ利用を調整します。
Atomic Chatは、http://localhost:1337/v1/images/generations でOpenAI互換の画像生成エンドポイントも公開しています。このエンドポイントは、Imagesセクションで現在読み込まれている画像モデルを使用し、画像をbase64(response_format b64_json)で返します。
これにより、セルフホストのAI画像生成ツールを自分のアプリから利用したり、別のインターフェースに接続したり、OpenAIの画像APIに対応するAIシステムに組み込んだりできます。
オフラインでのチャットと画像生成に使える、使いやすく多機能なローカルAIアプリが必要なら、Atomic Chatを選びましょう。
ComfyUI
ComfyUIは、視覚的なノードグラフを中心に構築されたオープンソースのAI画像生成ツールです。モデル、テキストエンコーダー、プロンプト、サンプラー、VAE、元画像、制御入力、出力のノードを接続して使います。Blenderのノードに似ていますが、ほかのユーザーが作成したワークフローをJSONで保存したり、アップロードしたりすることもできます。
アプリには、モデルライブラリ、ワークフローテンプレート、待機中のジョブを管理するキュー、ローカルAPIも含まれています。
チェックポイント、拡散モデル、VAE、テキストエンコーダー、LoRA、ControlNet、アダプター、アップスケーラー、カスタムノードに対応しています。ComfyUIは、生成、編集、マスキング、合成、バッチ処理を組み合わせたワークフローに対応しています。
ただし、ノードベースのインターフェースの習得には時間がかかり、一般的な画像生成アプリに比べて習得の難易度はかなり高くなります。
ComfyUIのインターフェース。出典:ComfyUIの公式GitHubリポジトリ。
パイプラインのすべての段階を直接制御しながら、詳細な画像生成ワークフローを構築、保存、再利用したいなら、ComfyUIを選びましょう。
InvokeAI
InvokeAIは、画像生成と編集のためのローカルクリエイティブスタジオです。洗練されたブラウザベースのインターフェースに、デスクトップランチャーとUnified Canvasを組み合わせ、Figmaのように自由に配置できるワークスペースで複数の画像を扱えます。再利用可能なワークフローとローカルAPIにも対応しており、対話的な編集だけでなく、繰り返し実行する制作パイプラインにも役立ちます。
InvokeAIのインターフェース。出典:InvokeAIの公式ウェブサイト。
キャンバスを中心とした編集ワークフローを備える、専用のローカル画像ワークスペースが必要なら、InvokeAIを選びましょう。
SwarmUI
SwarmUIは、複数のバックエンドに対応したローカル画像生成インターフェースです。一般的なプロンプトと設定の画面に、ComfyUI形式のワークフロー表示などの高度なツールを組み合わせています。1台のコンピューターで実行することも、複数のGPUにまたがる処理を調整することもできるため、上級ユーザーや共有のローカル環境にも適しています。
SwarmUIのインターフェース。出典:SwarmUIの公式GitHubリポジトリ。
標準的な操作機能とComfyUIワークフローへのアクセスを両方備えた、多機能なローカル生成インターフェースが必要なら、SwarmUIを選びましょう。
Krita AI Diffusion
Krita AI Diffusionは、KritaにローカルAI画像生成を追加するプラグインです。Kritaのレイヤー、選択範囲、マスク、ベクター図形、ブラシ描画と連携するため、生成画像と手作業による編集を同じドキュメント内で扱えます。
テキストからの画像生成、インペインティング、アップスケーリング、領域別プロンプト、ControlNet入力、参照画像、ライブペインティングに対応しています。Krita AI Diffusionは、プラグインからインストールと設定ができるローカルのComfyUIバックエンドを通じて動作します。実際にはローカルAI画像エディターとして機能し、選択範囲内での生成、シーンの拡張、小さな領域の調整、スケッチや線画を入力として使うことができます。
Krita AI Diffusionのインターフェース。出典:Krita AI Diffusionの公式GitHubリポジトリ。
すでにKritaで作業していて、ローカルAI生成、インペインティング、制御入力を使いたいなら、Krita AI Diffusionを選びましょう。
Stability Matrix
Stability Matrixは、ローカル画像生成ソフトウェアを管理するデスクトップツールです。ComfyUI、AUTOMATIC1111、Forge、Fooocus、InvokeAI、SwarmUIなどのアプリをインストール、更新、起動できます。対応アプリは、チェックポイント、LoRA、VAE用の同じモデルディレクトリを共有できます。
パッケージ、モデルのダウンロード、ローカル環境を1か所で管理します。ワークフローの各部分を別々のツールが担うために日常的にツールを切り替えている場合も、その構成を1か所からはるかに簡単に管理できるようになります。
Stability Matrixのインターフェース。出典:Stability Matrixの公式GitHubリポジトリ。
1つのデスクトップツールから複数のローカルAI画像アプリをインストール、管理、比較したいなら、Stability Matrixを選びましょう。
Draw Things
Draw ThingsはmacOS、iOS、iPadOSで動作します。ローカル生成に対応し、マスキング、インペインティング、アップスケーリング、ControlNet、LoRA、画像ギャラリーを備えています。ローカルAPIサーバーとスクリプト機能も提供しています。
Apple SiliconとMetalを中心に設計されているため、Macのハードウェアに十分に最適化されています。また、macOSでインストールして使い始めるのが最も簡単な選択肢の1つです。
Draw Thingsのインターフェース。出典:Mac App StoreのDraw Things。
Macを使っていて、幅広い編集機能を備えたネイティブのローカル画像生成アプリが必要なら、Draw Thingsを選びましょう。
そのほかの注目ツール
Fooocus、AUTOMATIC1111 WebUI、Forgeは、Stable Diffusionエコシステムで早くから人気を集めたローカルWebインターフェースです。ただし、これらのプロジェクトは以前ほど活発にメンテナンスされていないため、2026年の第一候補にはしません。
それぞれが提供する機能を簡単に説明します。
- Fooocusは3つの中で最もシンプルで、プロンプトによる手軽な画像生成に重点を置いています。
- AUTOMATIC1111 WebUIは、豊富な拡張機能ライブラリと馴染みのあるtxt2imgおよびimg2imgワークフローにより、エコシステム内での基準となりました。
- Forgeは、パフォーマンスを重視したAUTOMATIC1111のフォークで、リソース管理の改善と、より実験的なモデルや機能への対応を追加しています。
Fooocusのインターフェース。出典:Fooocusの公式GitHubリポジトリ。
ローカル画像生成におすすめのオープンモデル
これらの重みが公開されている画像モデルは、自分のコンピューターで実行できます。必要なメモリ量、編集モード、ライセンス条件はそれぞれ異なります。モデルの商用利用を認めるものもあれば、別途許可が必要なものもあります。
モデルの表にあるQ4_K_MとQ4_Kのラベルは、ローカルエンジンで使用するGGUFの量子化形式を示しています。
| モデル | 推奨モデル + エンコーダー | Atomic Chatでのモード | ライセンス | 主な検討用途・条件 |
|---|---|---|---|---|
| Z-Image Turbo | 4.7 + 2.6 GiB | Create | Apache-2.0 | 初めてのローカル利用でダウンロード容量を抑えたい場合 |
| FLUX.2 Klein 4B | 2.4 + 7.8 GiB | Create, Transform | Apache-2.0 | 画像変換 |
| FLUX.1 schnell | 6.4 + 9.7 GiB | Create | Apache-2.0 | FLUXでのプロンプトからの画像生成ワークフロー |
| FLUX.1 Krea Dev | 6.5 + 9.7 GiB | Create | FLUX.1 dev、非商用 | モデルの利用に制限あり。出力には別の条件が適用 |
| Krea 2 Turbo | 6.7 + 2.6 GiB | Create | Krea 2 Community License | 売上高が基準額未満の場合の商用利用 |
| Qwen-Image | 12.2 + 4.6 GiB | Create | Apache-2.0 | 文字を重視した画像 |
| Qwen-Image-2.1 | 3.9 + 6.4 GiB | Create, Reference, Edit | Qwen Research、非商用 | 参照画像に基づく編集 |
テスト方法と結果
テストはstable-diffusion.cpp master-883-137f740で実施し、CUDAバックエンドを使用してflash attentionとdirect convolutionを有効にしました。各モデルについて、生成開始から最終画像のレンダリングまでの時間と、常駐時およびピーク時のVRAM使用量を測定しました。常駐時は画像生成の合間にモデルが保持するメモリ量、ピーク時はレンダリング中の最大使用量で、100 msごとにサンプリングしています。この記事のメモリ量はすべてGiB(1,024 MiB)で表記しています。nvidia-smiはメモリ量をMiBで報告し、グラフィックスカードの容量はメーカーが箱に記載するGBで表記しています。
結果は以下のとおりです。
| モデル | ステップ数 | ウォームアップ後の秒数/画像 | 常駐時のVRAM使用量 | ピーク時のVRAM使用量 |
|---|---|---|---|---|
| FLUX.2 Klein 4B | 4 | 1.76 s | 9.4 GiB | 15.9 GiB |
| FLUX.1 schnell | 4 | 2.80 s | 16.7 GiB | 23.2 GiB |
| Z-Image Turbo | 8 | 3.81 s | 8.1 GiB | 14.6 GiB |
| Krea 2 Turbo | 8 | 5.71 s | 9.9 GiB | 17.2 GiB |
| FLUX.1 Krea Dev | 20 | 11.42 s | 16.8 GiB | 23.3 GiB |
| Qwen-Image | 20 | 25.47 s | 17.0 GiB | 24.4 GiB |
| Qwen-Image-2.1 | 40 | 38.98 s | 9.7 GiB | 19.3 GiB |
各モデルをRTX 5090上のstable-diffusion.cppビルド内で実行し、1024 × 1024の画像を生成しました。Atomic Chatの推奨量子化と、ステップ数、CFG、サンプラー、ガイダンスのカタログ既定値を使用し、シード値は42に固定しました。これらの時間は、ステップ数の違いも含めた推奨構成同士の比較であり、アプリ間の速度を測定したものではありません。作例の3つのカテゴリは、写真、画像内の文字、イラストです。
Z-Image Turbo
Z-Image Turboは、Tongyi-MAIのテキストから画像を生成するモデルです。この比較の中で最もメモリ使用量が少ない構成です。モデルの公式配布元。
Z-Image Turbo、Q4_K_M、シード値42、1024 × 1024。
| モデル構成 | 値 |
|---|---|
| モデルと補助ファイル | 4.7 GiB + 2.6 GiB |
| Atomic Chatの構成 | Q4_K_Mモデル、Qwen3-4B Q4_K_Mエンコーダー、FLUX VAE |
| 読み込まれた重み | 7.2 GiB |
| デフォルト | 8ステップ |
| ライセンス | Apache-2.0 |
| RTX 5090ベンチマーク、1024 × 1024 | 結果 |
|---|---|
| ウォームアップ後の画像1枚あたりの時間 | 3.81 s |
| 常駐時のVRAM使用量 | 8.1 GiB |
| ピーク時のVRAM使用量 | 14.6 GiB |
Z-Image Turboは、FLUX.1モデルより小さいテキストエンコーダーを使用します。常駐時のVRAM使用量は8.1 GiBで、生成中のピーク使用量は14.6 GiBまで増加しました。
FLUX.2 Klein 4B
FLUX.2 Klein 4Bは、Black Forest Labsの4Bパラメータの画像モデルです。モデルの公式配布元。
FLUX.2 Klein 4B、Q4_K_M、4ステップ、シード値42、1024 × 1024。
| モデル構成 | 値 |
|---|---|
| モデルと補助ファイル | 2.4 GiB + 7.8 GiB |
| Atomic Chatの構成 | Q4_K_Mモデル、bf16 Qwen3-4Bエンコーダー、FLUX.2 VAE |
| 読み込まれた重み | 10.1 GiB |
| デフォルト | 4ステップ |
| ライセンス | Apache-2.0 |
Klein 4Bは、今回の測定で最も高速なモデルでした。デフォルトが4ステップであることが速度面での大きな利点となり、Transformに対応することでCreate専用モデルより用途が広がります。1024 × 1024のレンダリング中に、ピーク時のVRAM使用量は15.9 GiBに達しました。
| RTX 5090ベンチマーク、1024 × 1024 | 結果 |
|---|---|
| ウォームアップ後の画像1枚あたりの時間 | 1.76 s |
| 常駐時のVRAM使用量 | 9.4 GiB |
| ピーク時のVRAM使用量 | 15.9 GiB |
FLUX.1 schnell
FLUX.1 schnellは、Black Forest Labsの高速なFLUX.1モデルで、テキストからの画像生成専用です。モデルの公式配布元。
FLUX.1 schnell、Q4_K_M、4ステップ、シード値42、1024 × 1024。
| モデル構成 | 値 |
|---|---|
| モデルと補助ファイル | 6.4 GiB + 9.7 GiB |
| Atomic Chatの構成 | Q4_K_Mモデル、fp16 T5-XXL、CLIP-L、FLUX VAE |
| 読み込まれた重み | 15.7 GiB |
| デフォルト | 4ステップ |
| ライセンス | Apache-2.0 |
Schnellは画像1枚あたり2.80秒かかり、Klein 4Bの1.76秒より長くなりました。ピーク使用量が23.2 GiBのため、24 GBクラスのカードでは余裕がほとんどありません。実際の空きメモリを確認するか、オフロードを使用してください。
| RTX 5090ベンチマーク、1024 × 1024 | 結果 |
|---|---|
| ウォームアップ後の画像1枚あたりの時間 | 2.80 s |
| 常駐時のVRAM使用量 | 16.7 GiB |
| ピーク時のVRAM使用量 | 23.2 GiB |
FLUX.1 Krea Dev
FLUX.1 Krea Devは、非商用のFLUX.1 devの条件で公開された、テキストから画像を生成するFLUX.1モデルです。ライセンスでは、モデルを商用目的で実行することと、生成された出力を利用することを区別しています。モデルの公式配布元。
FLUX.1 Krea Dev、Q4_K_M、20ステップ、シード値42、1024 × 1024。
| モデル構成 | 値 |
|---|---|
| モデルと補助ファイル | 6.5 GiB + 9.7 GiB |
| Atomic Chatの構成 | Q4_K_Mモデル、fp16 T5-XXL、CLIP-L、FLUX VAE |
| 読み込まれた重み | 15.7 GiB |
| デフォルト | 20ステップ、ガイダンス3.5 |
| ライセンス | FLUX.1 dev、非商用 |
Krea Devは20ステップを使用するのに対し、schnellは4ステップのため、これは異なるデフォルト構成を測定したものです。作例には、その結果として生じる見た目の違いが示されています。
ピーク時のVRAM使用量は23.3 GiBで、schnellに近い値です。この設定では、24 GBクラスのカードにほとんど余裕はありません。FLUX.1 devの条件はモデルの利用を制限する一方、出力の商用利用については、定められた条件の下で別途認めています。
| RTX 5090ベンチマーク、1024 × 1024 | 結果 |
|---|---|
| ウォームアップ後の画像1枚あたりの時間 | 11.42 s |
| 常駐時のVRAM使用量 | 16.8 GiB |
| ピーク時のVRAM使用量 | 23.3 GiB |
Krea 2 Turbo
Krea 2 Turboは、Krea 2 Community Licenseの下で配布されるCreateモードのモデルです。モデルの公式配布元。
Krea 2 Turbo、Q4_K_M、8ステップ、シード値42、1024 × 1024。
| モデル構成 | 値 |
|---|---|
| モデルと補助ファイル | 6.7 GiB + 2.6 GiB |
| Atomic Chatの構成 | Q4_K_Mモデル、Qwen3-VL-4B Q4_K_Mエンコーダー、Wan 2.1 VAE |
| 読み込まれた重み | 9.3 GiB |
| デフォルト | 8ステップ |
| ライセンス | Krea 2 Community License |
Krea 2 Turboのピーク時のメモリ使用量は、どちらのFLUX.1モデルよりも少なく、画像1枚あたりの時間は5.71秒で、デフォルト設定のKrea Devの約半分でした。見た目の違いは上の作例で比較してください。
Krea 2 Turboは、直近12か月の関連会社を含む合計年間売上高が100万米ドル未満の場合、ライセンスのその他の条件に従うことを前提に、Community Licenseの下で商用利用を認めています。
| RTX 5090ベンチマーク、1024 × 1024 | 結果 |
|---|---|
| ウォームアップ後の画像1枚あたりの時間 | 5.71 s |
| 常駐時のVRAM使用量 | 9.9 GiB |
| ピーク時のVRAM使用量 | 17.2 GiB |
Qwen-Image
Qwen-Imageは、構図内に文字を含む画像の生成向けに設計された、QwenのCreateモードの画像モデルです。モデルの公式配布元。
Qwen-Image、Q4_K_M、20ステップ、シード値42、1024 × 1024。
| モデル構成 | 値 |
|---|---|
| モデルと補助ファイル | 12.2 GiB + 4.6 GiB |
| Atomic Chatの構成 | Q4_K_Mモデル、Qwen2.5-VL-7B Q4_K_Mエンコーダー、Qwen VAE |
| 読み込まれた重み | 16.4 GiB |
| デフォルト | 20ステップ、CFG 2.5、フローシフト3 |
| ライセンス | Apache-2.0 |
Qwen-Imageは、この比較の中で最も大きいモデル構成です。ピーク使用量の24.4 GiBは、公称24 GBのカードが報告する容量をわずかに超えるため、32 GBのカードまたはCPUオフロードが必要です。テストでは指定された文字を正しく描画できたため、ポスター、ラベル、パッケージのコンセプト案など、文字を多く含む画像に適しています。
| RTX 5090ベンチマーク、1024 × 1024 | 結果 |
|---|---|
| ウォームアップ後の画像1枚あたりの時間 | 25.47 s |
| 常駐時のVRAM使用量 | 17.0 GiB |
| ピーク時のVRAM使用量 | 24.4 GiB |
Qwen-Image-2.1
Qwen-Image-2.1は、テキストからの画像生成、参照画像に基づく生成、指示に基づく編集に対応する7Bモデルです。モデルは最大10枚の参照画像に対応し、Atomic Chatでは元画像に加えて3枚の参照画像を指定できます。モデルの公式配布元。
Qwen-Image-2.1、Q4_K、40ステップ、シード値42、1024 × 1024、Createモード。
| モデル構成 | 値 |
|---|---|
| モデルと補助ファイル | 3.9 GiB + 6.4 GiB |
| Atomic Chatの構成 | Q4_Kモデル、Qwen3-VL-8B Q4_K_Mエンコーダー、Qwen 2.1 VAE |
| 読み込まれた重み | Createモードで8.7 GiB |
| デフォルト | 40ステップ、CFG 6.0 |
| ライセンス | Qwen Research、非商用 |
Qwen-Image-2.1は、デフォルトの40ステップでは生成時間が最も長くなりましたが、ピーク時のメモリ使用量はQwen-Imageより少なくなりました。写真、文字、イラストの作例を上に示しています。見た目の好みは主観的なものです。
| RTX 5090ベンチマーク、1024 × 1024 | 結果 |
|---|---|
| ウォームアップ後の画像1枚あたりの時間 | 38.98 s |
| 常駐時のVRAM使用量 | 9.7 GiB |
| ピーク時のVRAM使用量 | 19.3 GiB |
| 描画された文字 | 「MORNING LIGHT」を1行で表示 |
ローカルAI画像生成のハードウェア要件
テストした1024 × 1024の構成では、Z-Image Turboを使い始める目安は16 GBクラスのGPUです。より大きいモデルには、さらに多くのメモリかオフロードが必要です。各モデルで測定されたピーク使用量を、ドライバーが報告する空きメモリと比較してください。デスクトップアプリやほかのワークロードもメモリを消費します。
以下のNVIDIAカードが、これらのワークロードの候補になります。この記事でベンチマーク測定したのはRTX 5090のみです。
- NVIDIA GeForce RTX 5090(32 GB)
- RTX 4090(24 GB)
- RTX 3090(24 GB)もよい選択肢になります。
NVIDIA GeForce RTX 5080のような16 GBのカードでも動作しますが、実行できるモデルの制約は大きくなります。
Macでは、以下のような構成が適しています。
- M5 Pro搭載MacBook Pro:24 GB以上の統合メモリ
- M5 Max搭載MacBook Pro:36 GB、48 GB、64 GB、または128 GBの統合メモリ
- Mac Studio
Macでは、統合メモリをmacOSやほかのアプリと共有します。以下のCUDAでのピーク値は構成を検討するための参考値であり、Apple Siliconで測定した必要メモリ量ではありません。実行環境、オフロード、画像解像度によってメモリ使用量は変わります。
- 24 GBのMacは、macOS用の余裕を確保しつつ、Z-Image TurboやFLUX.2 Klein 4Bを試すための出発点になります。
- 32 GBのMacでは、Krea 2 TurboやQwen-Image-2.1を試すための余裕が増えます。FLUX.1モデルでは、ほかのメモリ使用状況によってオフロードが必要になる場合があります。
- 36 GB以上のMacでは、このリストにあるモデルに、より多くのメモリを割り当てられます。これらの構成は今回テストしていません。
注:今回のベンチマークでは、Macでの生成速度は測定していません。
より低ビットの量子化、CPUオフロード、その他のメモリ節約手法を使えば、16 GB未満のメモリでもこれらのモデルを実行できる場合がありますが、16 GBを出発点とするほうがはるかに実用的です。
以下の表は、RTX 5090での測定結果に基づく構成検討の目安です。すべてのGPUや実行環境で同じメモリ使用量になることを確認したものではありません。
| メモリ | 測定されたピーク値に基づく構成の目安 |
|---|---|
| 16 GB | Z-Image Turboのピーク使用量は14.6 GiBでした。Klein 4Bは15.9 GiBに達し、余裕はほとんどありません。 |
| 20 GB | Z-Image Turbo、FLUX.2 Klein 4B、Krea 2 Turbo |
| 24 GB | Z-Image Turbo、Klein 4B、Krea 2 Turbo、Qwen-Image-2.1のピーク使用量は20 GiB未満でした。FLUX.1は23.2〜23.3 GiBに達しました。ほかのメモリ使用分を見込むか、オフロードを利用してください。 |
| 32 GB | テストした設定では、測定されたピーク値はすべて25 GiB未満でした。 |
Atomic Chatでローカル画像生成を行う方法
Atomic Chatは、ローカルでのFLUXやQwen-Imageの推論にも使われるC++エンジン、stable-diffusion.cppを通じて画像モデルを実行します。ダウンロードとセットアップはアプリが処理します。
- Atomic Chatをインストールし、Imagesを開きます。
- 案内が表示されたら、stable-diffusion.cppエンジンをインストールします。サイズは約100 MBで、モデルのダウンロードとは別です。
- モデルとエンコーダーのファイルが、ストレージとメモリの容量に収まるカタログモデルを選びます。
- Downloadを選択し、モデルファイルのダウンロードを待ってからRunを選択します。テキストエンコーダーを含めると、1つのモデルは約7〜17 GiBで、共有ファイルは1回だけダウンロードされます。
- 被写体、構図、照明、ビジュアルスタイル、必要な文字など、具体的なプロンプトを書きます。Generateを選択して画像を生成します。試行ごとに変更する変数は1つにします。
よくある質問
ローカルでAI画像を生成できますか?
はい。モデルをダウンロードし、完全にローカルで動作するワークフローを選択すれば、自分のコンピューターでオフライン生成できます。クラウドバックエンドやAPIノードは、外部サービスにデータを送信します。
画像を生成できるローカルAIモデルには何がありますか?
Z-Image Turbo、FLUX.2 Klein 4B、FLUX.1 schnell、FLUX.1 Krea Dev、Krea 2 Turbo、Qwen-Image、Qwen-Image-2.1などがあります。
オフラインのAI画像生成ツールは無料ですか?
掲載したアプリのほとんどは無料でダウンロードでき、ローカル生成には画像ごとのAPI料金はかかりません。モデルのライセンスはそれぞれ異なります。FLUX.1 Krea Devはモデルの利用を制限していますが、出力の商用利用は規定の条件の下で別途認めています。Qwen-Image-2.1は、別途ライセンスを取得しない限り、研究または評価用です。Krea 2 Turboには売上高の基準額があります。
2026年に最適なローカルAI画像生成ツールはどれですか?
- より幅広い機能を持つオフラインAIアプリの一部として、使いやすいローカルAI画像生成ツールが必要なら、Atomic Chatが最適です。
- ノードベースの詳細なカスタマイズが必要なら、ComfyUIが最適です。
- すでにKritaで作業していて、レイヤーや選択範囲の中で生成したいなら、Krita AI Diffusionが最適です。
- Macユーザーなら、Draw Thingsが最適です。
VRAMはどのくらい必要ですか?
テストした設定では、Z-Image Turboのピーク使用量は14.6 GiBでした。24 GBクラスのカードなら、Klein 4B、Krea 2 Turbo、Qwen-Image-2.1を動かす余裕が増えます。FLUX.1のピーク使用量はこのクラスのカードの容量に近く、Qwen-Imageはそれを超えます。空きメモリが足りない場合は、より多くのメモリを確保するか、オフロードを使用してください。

















