ブログ

/

ガイド

/

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカル画像生成アプリと7つのモデル構成を、RTX 5090での測定結果と3つのビジュアルスタイルの作例で比較します。

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】
Alex Shapiro
Alex Shapiro
Calendar icon

September 25, 2026

目次

最適なローカルAI画像生成ツールは、どのように作業したいかによって変わります。Atomic Chatはローカルチャットと画像生成を組み合わせ、ComfyUIは詳細なノードワークフローを操作でき、Krita AI Diffusionは制作中の作品内で使えます。Draw ThingsはAppleデバイス向けに作られています。

アプリはインターフェースと編集ツールを提供します。画像モデルは、出力の多くの部分と必要なメモリ量を決定します。このガイドでは両方を比較し、7つのモデル構成をRTX 5090上のstable-diffusion.cppで、1024 × 1024の解像度でベンチマーク測定しました。

おすすめローカルAI画像生成ツールの早見表

アプリ対応プラットフォーム習得の難易度モデルとワークフロー編集APIライセンス価格
Atomic ChatmacOS, Windows, Linux低い厳選されたstable-diffusion.cppカタログモデルに応じてCreate、Transform、Reference、Editに対応OpenAI互換のローカルエンドポイントエンジン:MIT無料ダウンロード
ComfyUIWindows, macOS, Linux高い幅広いモデルエコシステム、カスタムノードワークフローによるありGPL-3.0無料
InvokeAIWindows, macOS, Linux中程度ガイドに沿った生成とキャンバスでの作業キャンバスとマスキングツールありApache-2.0無料
SwarmUIWindows、Linux。macOSではコミュニティによる導入方法あり中程度複数のローカルバックエンドありありMIT無料
Krita AI DiffusionWindows, macOS, Linux中程度Kritaプラグインによるワークフローレイヤー、マスク、領域ごとの作業汎用APIなしGPL-3.0無料
Stability MatrixWindows, macOS, Linux低い〜中程度複数のローカルアプリに対応したランチャー起動するアプリによる起動するアプリによるAGPL-3.0無料
Draw ThingsmacOS, iOS, iPadOS低いApple Siliconを重視したアプリ画像ワークフローとインペインティングローカルAPIとスクリプトコミュニティリポジトリ:GPL-3.0無料
Fooocus, A1111, Forge主にWindowsとLinux低い〜中程度確立されたStable DiffusionエコシステムありツールによるGPL-3.0 / AGPL-3.0無料

ツール選びは最終的には個人の好みによるため、選定に一貫性を持たせるために3つの基準を使いました。テキストから画像への生成や画像から画像への変換といった主要なワークフローへの対応、活発なコミュニティ、継続的な開発です。

DiffusionBeeは引き続き利用できますが、公開リポジトリへの最後のプッシュは2024年10月でした。新しい環境向けに選ぶ前に、現在のモデル対応状況を確認してください。

おすすめのローカルAI画像生成アプリ

Atomic Chat

Atomic Chatは、ローカルAIモデルを実行するためのデスクトップアプリです。ローカルチャットと画像生成を1つのアプリにまとめ、stable-diffusion.cppエンジンを通じて画像モデルを実行します。

アプリは、各画像モデルに必要なエンジン、モデルの重み、VAE、テキストエンコーダーをダウンロードして管理します。

Qwen-Image Q4_K_M、解像度1024 × 1024、20ステップに設定されたAtomic ChatのCreate images画面。
Atomic Chatでの画像生成:Qwen-Image Q4_K_M、1024 × 1024、20ステップ。このアプリのデモは、RTX 5090のベンチマークとは別のものです。

現在のカタログは、モデルに応じてCreate、Transform、Reference、Editに対応しています。サイドバーに表示されるほかのワークフローのラベルについては、これらのカタログモデルは対応していません。

  • Createは、プロンプトから新しい画像を生成します
  • Transformは、プロンプトを使って既存の画像を変更します
  • Referenceは、画像を視覚的な入力として使用します
  • Editは、画像の指定した部分に変更を加えます。
画像ワークフローが表示されたAtomic ChatのImagesサイドバー。利用できる機能は、読み込まれたモデルによって異なります。
Atomic ChatのImagesセクション。利用できるワークフローは、読み込まれたモデルによって異なります。

Atomic Chatは、チャットモデルと画像モデルを同時にメモリに収められない場合、チャットモデルをアンロードします。これにより、同じアプリ内でローカルチャットと画像生成のメモリ利用を調整します。

Atomic Chatは、http://localhost:1337/v1/images/generations でOpenAI互換の画像生成エンドポイントも公開しています。このエンドポイントは、Imagesセクションで現在読み込まれている画像モデルを使用し、画像をbase64(response_format b64_json)で返します。

これにより、セルフホストのAI画像生成ツールを自分のアプリから利用したり、別のインターフェースに接続したり、OpenAIの画像APIに対応するAIシステムに組み込んだりできます。

オフラインでのチャットと画像生成に使える、使いやすく多機能なローカルAIアプリが必要なら、Atomic Chatを選びましょう。

ComfyUI

ComfyUIは、視覚的なノードグラフを中心に構築されたオープンソースのAI画像生成ツールです。モデル、テキストエンコーダー、プロンプト、サンプラー、VAE、元画像、制御入力、出力のノードを接続して使います。Blenderのノードに似ていますが、ほかのユーザーが作成したワークフローをJSONで保存したり、アップロードしたりすることもできます。

アプリには、モデルライブラリ、ワークフローテンプレート、待機中のジョブを管理するキュー、ローカルAPIも含まれています。

チェックポイント、拡散モデル、VAE、テキストエンコーダー、LoRA、ControlNet、アダプター、アップスケーラー、カスタムノードに対応しています。ComfyUIは、生成、編集、マスキング、合成、バッチ処理を組み合わせたワークフローに対応しています。

ただし、ノードベースのインターフェースの習得には時間がかかり、一般的な画像生成アプリに比べて習得の難易度はかなり高くなります。

ComfyUIのインターフェース

ComfyUIのインターフェース。出典:ComfyUIの公式GitHubリポジトリ。

パイプラインのすべての段階を直接制御しながら、詳細な画像生成ワークフローを構築、保存、再利用したいなら、ComfyUIを選びましょう。

InvokeAI

InvokeAIは、画像生成と編集のためのローカルクリエイティブスタジオです。洗練されたブラウザベースのインターフェースに、デスクトップランチャーとUnified Canvasを組み合わせ、Figmaのように自由に配置できるワークスペースで複数の画像を扱えます。再利用可能なワークフローとローカルAPIにも対応しており、対話的な編集だけでなく、繰り返し実行する制作パイプラインにも役立ちます。

InvokeAIのインターフェース

InvokeAIのインターフェース。出典:InvokeAIの公式ウェブサイト。

キャンバスを中心とした編集ワークフローを備える、専用のローカル画像ワークスペースが必要なら、InvokeAIを選びましょう。

SwarmUI

SwarmUIは、複数のバックエンドに対応したローカル画像生成インターフェースです。一般的なプロンプトと設定の画面に、ComfyUI形式のワークフロー表示などの高度なツールを組み合わせています。1台のコンピューターで実行することも、複数のGPUにまたがる処理を調整することもできるため、上級ユーザーや共有のローカル環境にも適しています。

SwarmUIのインターフェース

SwarmUIのインターフェース。出典:SwarmUIの公式GitHubリポジトリ。

標準的な操作機能とComfyUIワークフローへのアクセスを両方備えた、多機能なローカル生成インターフェースが必要なら、SwarmUIを選びましょう。

Krita AI Diffusion

Krita AI Diffusionは、KritaにローカルAI画像生成を追加するプラグインです。Kritaのレイヤー、選択範囲、マスク、ベクター図形、ブラシ描画と連携するため、生成画像と手作業による編集を同じドキュメント内で扱えます。

テキストからの画像生成、インペインティング、アップスケーリング、領域別プロンプト、ControlNet入力、参照画像、ライブペインティングに対応しています。Krita AI Diffusionは、プラグインからインストールと設定ができるローカルのComfyUIバックエンドを通じて動作します。実際にはローカルAI画像エディターとして機能し、選択範囲内での生成、シーンの拡張、小さな領域の調整、スケッチや線画を入力として使うことができます。

Krita AI Diffusionのインターフェース

Krita AI Diffusionのインターフェース。出典:Krita AI Diffusionの公式GitHubリポジトリ。

すでにKritaで作業していて、ローカルAI生成、インペインティング、制御入力を使いたいなら、Krita AI Diffusionを選びましょう。

Stability Matrix

Stability Matrixは、ローカル画像生成ソフトウェアを管理するデスクトップツールです。ComfyUI、AUTOMATIC1111、Forge、Fooocus、InvokeAI、SwarmUIなどのアプリをインストール、更新、起動できます。対応アプリは、チェックポイント、LoRA、VAE用の同じモデルディレクトリを共有できます。

パッケージ、モデルのダウンロード、ローカル環境を1か所で管理します。ワークフローの各部分を別々のツールが担うために日常的にツールを切り替えている場合も、その構成を1か所からはるかに簡単に管理できるようになります。

Stability Matrixのインターフェース

Stability Matrixのインターフェース。出典:Stability Matrixの公式GitHubリポジトリ。

1つのデスクトップツールから複数のローカルAI画像アプリをインストール、管理、比較したいなら、Stability Matrixを選びましょう。

Draw Things

Draw ThingsはmacOS、iOS、iPadOSで動作します。ローカル生成に対応し、マスキング、インペインティング、アップスケーリング、ControlNet、LoRA、画像ギャラリーを備えています。ローカルAPIサーバーとスクリプト機能も提供しています。

Apple SiliconとMetalを中心に設計されているため、Macのハードウェアに十分に最適化されています。また、macOSでインストールして使い始めるのが最も簡単な選択肢の1つです。

Draw Thingsのインターフェース

Draw Thingsのインターフェース。出典:Mac App StoreのDraw Things。

Macを使っていて、幅広い編集機能を備えたネイティブのローカル画像生成アプリが必要なら、Draw Thingsを選びましょう。

そのほかの注目ツール

Fooocus、AUTOMATIC1111 WebUI、Forgeは、Stable Diffusionエコシステムで早くから人気を集めたローカルWebインターフェースです。ただし、これらのプロジェクトは以前ほど活発にメンテナンスされていないため、2026年の第一候補にはしません。

それぞれが提供する機能を簡単に説明します。

  • Fooocusは3つの中で最もシンプルで、プロンプトによる手軽な画像生成に重点を置いています。
  • AUTOMATIC1111 WebUIは、豊富な拡張機能ライブラリと馴染みのあるtxt2imgおよびimg2imgワークフローにより、エコシステム内での基準となりました。
  • Forgeは、パフォーマンスを重視したAUTOMATIC1111のフォークで、リソース管理の改善と、より実験的なモデルや機能への対応を追加しています。
Fooocusのインターフェース

Fooocusのインターフェース。出典:Fooocusの公式GitHubリポジトリ。

ローカル画像生成におすすめのオープンモデル

プロンプトからテキストエンコーダー、画像モデル、VAEデコーダーを経て画像に至る、ローカル画像生成のパイプライン。
アプリがワークフローを制御し、ローカルエンジンがモデルの各コンポーネントを実行します。

これらの重みが公開されている画像モデルは、自分のコンピューターで実行できます。必要なメモリ量、編集モード、ライセンス条件はそれぞれ異なります。モデルの商用利用を認めるものもあれば、別途許可が必要なものもあります。

モデルの表にあるQ4_K_MとQ4_Kのラベルは、ローカルエンジンで使用するGGUFの量子化形式を示しています。

モデル推奨モデル + エンコーダーAtomic Chatでのモードライセンス主な検討用途・条件
Z-Image Turbo4.7 + 2.6 GiBCreateApache-2.0初めてのローカル利用でダウンロード容量を抑えたい場合
FLUX.2 Klein 4B2.4 + 7.8 GiBCreate, TransformApache-2.0画像変換
FLUX.1 schnell6.4 + 9.7 GiBCreateApache-2.0FLUXでのプロンプトからの画像生成ワークフロー
FLUX.1 Krea Dev6.5 + 9.7 GiBCreateFLUX.1 dev、非商用モデルの利用に制限あり。出力には別の条件が適用
Krea 2 Turbo6.7 + 2.6 GiBCreateKrea 2 Community License売上高が基準額未満の場合の商用利用
Qwen-Image12.2 + 4.6 GiBCreateApache-2.0文字を重視した画像
Qwen-Image-2.13.9 + 6.4 GiBCreate, Reference, EditQwen Research、非商用参照画像に基づく編集

テスト方法と結果

テストはstable-diffusion.cpp master-883-137f740で実施し、CUDAバックエンドを使用してflash attentionとdirect convolutionを有効にしました。各モデルについて、生成開始から最終画像のレンダリングまでの時間と、常駐時およびピーク時のVRAM使用量を測定しました。常駐時は画像生成の合間にモデルが保持するメモリ量、ピーク時はレンダリング中の最大使用量で、100 msごとにサンプリングしています。この記事のメモリ量はすべてGiB(1,024 MiB)で表記しています。nvidia-smiはメモリ量をMiBで報告し、グラフィックスカードの容量はメーカーが箱に記載するGBで表記しています。

結果は以下のとおりです。

モデルステップ数ウォームアップ後の秒数/画像常駐時のVRAM使用量ピーク時のVRAM使用量
FLUX.2 Klein 4B41.76 s9.4 GiB15.9 GiB
FLUX.1 schnell42.80 s16.7 GiB23.2 GiB
Z-Image Turbo83.81 s8.1 GiB14.6 GiB
Krea 2 Turbo85.71 s9.9 GiB17.2 GiB
FLUX.1 Krea Dev2011.42 s16.8 GiB23.3 GiB
Qwen-Image2025.47 s17.0 GiB24.4 GiB
Qwen-Image-2.14038.98 s9.7 GiB19.3 GiB

各モデルをRTX 5090上のstable-diffusion.cppビルド内で実行し、1024 × 1024の画像を生成しました。Atomic Chatの推奨量子化と、ステップ数、CFG、サンプラー、ガイダンスのカタログ既定値を使用し、シード値は42に固定しました。これらの時間は、ステップ数の違いも含めた推奨構成同士の比較であり、アプリ間の速度を測定したものではありません。作例の3つのカテゴリは、写真、画像内の文字、イラストです。

Z-Image Turbo

Z-Image Turboは、Tongyi-MAIのテキストから画像を生成するモデルです。この比較の中で最もメモリ使用量が少ない構成です。モデルの公式配布元。

記事のテストでz image turboを使って生成した3つの画像例。

Z-Image Turbo、Q4_K_M、シード値42、1024 × 1024。

モデル構成値
モデルと補助ファイル4.7 GiB + 2.6 GiB
Atomic Chatの構成Q4_K_Mモデル、Qwen3-4B Q4_K_Mエンコーダー、FLUX VAE
読み込まれた重み7.2 GiB
デフォルト8ステップ
ライセンスApache-2.0
RTX 5090ベンチマーク、1024 × 1024結果
ウォームアップ後の画像1枚あたりの時間3.81 s
常駐時のVRAM使用量8.1 GiB
ピーク時のVRAM使用量14.6 GiB

Z-Image Turboは、FLUX.1モデルより小さいテキストエンコーダーを使用します。常駐時のVRAM使用量は8.1 GiBで、生成中のピーク使用量は14.6 GiBまで増加しました。

FLUX.2 Klein 4B

FLUX.2 Klein 4Bは、Black Forest Labsの4Bパラメータの画像モデルです。モデルの公式配布元。

記事のテストでflux2 klein 4bを使って生成した3つの画像例。

FLUX.2 Klein 4B、Q4_K_M、4ステップ、シード値42、1024 × 1024。

モデル構成値
モデルと補助ファイル2.4 GiB + 7.8 GiB
Atomic Chatの構成Q4_K_Mモデル、bf16 Qwen3-4Bエンコーダー、FLUX.2 VAE
読み込まれた重み10.1 GiB
デフォルト4ステップ
ライセンスApache-2.0

Klein 4Bは、今回の測定で最も高速なモデルでした。デフォルトが4ステップであることが速度面での大きな利点となり、Transformに対応することでCreate専用モデルより用途が広がります。1024 × 1024のレンダリング中に、ピーク時のVRAM使用量は15.9 GiBに達しました。

RTX 5090ベンチマーク、1024 × 1024結果
ウォームアップ後の画像1枚あたりの時間1.76 s
常駐時のVRAM使用量9.4 GiB
ピーク時のVRAM使用量15.9 GiB

FLUX.1 schnell

FLUX.1 schnellは、Black Forest Labsの高速なFLUX.1モデルで、テキストからの画像生成専用です。モデルの公式配布元。

記事のテストでflux1 schnellを使って生成した3つの画像例。

FLUX.1 schnell、Q4_K_M、4ステップ、シード値42、1024 × 1024。

モデル構成値
モデルと補助ファイル6.4 GiB + 9.7 GiB
Atomic Chatの構成Q4_K_Mモデル、fp16 T5-XXL、CLIP-L、FLUX VAE
読み込まれた重み15.7 GiB
デフォルト4ステップ
ライセンスApache-2.0

Schnellは画像1枚あたり2.80秒かかり、Klein 4Bの1.76秒より長くなりました。ピーク使用量が23.2 GiBのため、24 GBクラスのカードでは余裕がほとんどありません。実際の空きメモリを確認するか、オフロードを使用してください。

RTX 5090ベンチマーク、1024 × 1024結果
ウォームアップ後の画像1枚あたりの時間2.80 s
常駐時のVRAM使用量16.7 GiB
ピーク時のVRAM使用量23.2 GiB

FLUX.1 Krea Dev

FLUX.1 Krea Devは、非商用のFLUX.1 devの条件で公開された、テキストから画像を生成するFLUX.1モデルです。ライセンスでは、モデルを商用目的で実行することと、生成された出力を利用することを区別しています。モデルの公式配布元。

記事のテストでflux1 krea devを使って生成した3つの画像例。

FLUX.1 Krea Dev、Q4_K_M、20ステップ、シード値42、1024 × 1024。

モデル構成値
モデルと補助ファイル6.5 GiB + 9.7 GiB
Atomic Chatの構成Q4_K_Mモデル、fp16 T5-XXL、CLIP-L、FLUX VAE
読み込まれた重み15.7 GiB
デフォルト20ステップ、ガイダンス3.5
ライセンスFLUX.1 dev、非商用

Krea Devは20ステップを使用するのに対し、schnellは4ステップのため、これは異なるデフォルト構成を測定したものです。作例には、その結果として生じる見た目の違いが示されています。

ピーク時のVRAM使用量は23.3 GiBで、schnellに近い値です。この設定では、24 GBクラスのカードにほとんど余裕はありません。FLUX.1 devの条件はモデルの利用を制限する一方、出力の商用利用については、定められた条件の下で別途認めています。

RTX 5090ベンチマーク、1024 × 1024結果
ウォームアップ後の画像1枚あたりの時間11.42 s
常駐時のVRAM使用量16.8 GiB
ピーク時のVRAM使用量23.3 GiB

Krea 2 Turbo

Krea 2 Turboは、Krea 2 Community Licenseの下で配布されるCreateモードのモデルです。モデルの公式配布元。

記事のテストでkrea 2 turboを使って生成した3つの画像例。

Krea 2 Turbo、Q4_K_M、8ステップ、シード値42、1024 × 1024。

モデル構成値
モデルと補助ファイル6.7 GiB + 2.6 GiB
Atomic Chatの構成Q4_K_Mモデル、Qwen3-VL-4B Q4_K_Mエンコーダー、Wan 2.1 VAE
読み込まれた重み9.3 GiB
デフォルト8ステップ
ライセンスKrea 2 Community License

Krea 2 Turboのピーク時のメモリ使用量は、どちらのFLUX.1モデルよりも少なく、画像1枚あたりの時間は5.71秒で、デフォルト設定のKrea Devの約半分でした。見た目の違いは上の作例で比較してください。

Krea 2 Turboは、直近12か月の関連会社を含む合計年間売上高が100万米ドル未満の場合、ライセンスのその他の条件に従うことを前提に、Community Licenseの下で商用利用を認めています。

RTX 5090ベンチマーク、1024 × 1024結果
ウォームアップ後の画像1枚あたりの時間5.71 s
常駐時のVRAM使用量9.9 GiB
ピーク時のVRAM使用量17.2 GiB

Qwen-Image

Qwen-Imageは、構図内に文字を含む画像の生成向けに設計された、QwenのCreateモードの画像モデルです。モデルの公式配布元。

記事のテストでqwen imageを使って生成した3つの画像例。

Qwen-Image、Q4_K_M、20ステップ、シード値42、1024 × 1024。

モデル構成値
モデルと補助ファイル12.2 GiB + 4.6 GiB
Atomic Chatの構成Q4_K_Mモデル、Qwen2.5-VL-7B Q4_K_Mエンコーダー、Qwen VAE
読み込まれた重み16.4 GiB
デフォルト20ステップ、CFG 2.5、フローシフト3
ライセンスApache-2.0

Qwen-Imageは、この比較の中で最も大きいモデル構成です。ピーク使用量の24.4 GiBは、公称24 GBのカードが報告する容量をわずかに超えるため、32 GBのカードまたはCPUオフロードが必要です。テストでは指定された文字を正しく描画できたため、ポスター、ラベル、パッケージのコンセプト案など、文字を多く含む画像に適しています。

RTX 5090ベンチマーク、1024 × 1024結果
ウォームアップ後の画像1枚あたりの時間25.47 s
常駐時のVRAM使用量17.0 GiB
ピーク時のVRAM使用量24.4 GiB

Qwen-Image-2.1

Qwen-Image-2.1は、テキストからの画像生成、参照画像に基づく生成、指示に基づく編集に対応する7Bモデルです。モデルは最大10枚の参照画像に対応し、Atomic Chatでは元画像に加えて3枚の参照画像を指定できます。モデルの公式配布元。

記事のテストでqwen image 2 1を使って生成した3つの画像例。

Qwen-Image-2.1、Q4_K、40ステップ、シード値42、1024 × 1024、Createモード。

モデル構成値
モデルと補助ファイル3.9 GiB + 6.4 GiB
Atomic Chatの構成Q4_Kモデル、Qwen3-VL-8B Q4_K_Mエンコーダー、Qwen 2.1 VAE
読み込まれた重みCreateモードで8.7 GiB
デフォルト40ステップ、CFG 6.0
ライセンスQwen Research、非商用

Qwen-Image-2.1は、デフォルトの40ステップでは生成時間が最も長くなりましたが、ピーク時のメモリ使用量はQwen-Imageより少なくなりました。写真、文字、イラストの作例を上に示しています。見た目の好みは主観的なものです。

RTX 5090ベンチマーク、1024 × 1024結果
ウォームアップ後の画像1枚あたりの時間38.98 s
常駐時のVRAM使用量9.7 GiB
ピーク時のVRAM使用量19.3 GiB
描画された文字「MORNING LIGHT」を1行で表示

ローカルAI画像生成のハードウェア要件

テストした1024 × 1024の構成では、Z-Image Turboを使い始める目安は16 GBクラスのGPUです。より大きいモデルには、さらに多くのメモリかオフロードが必要です。各モデルで測定されたピーク使用量を、ドライバーが報告する空きメモリと比較してください。デスクトップアプリやほかのワークロードもメモリを消費します。

以下のNVIDIAカードが、これらのワークロードの候補になります。この記事でベンチマーク測定したのはRTX 5090のみです。

  • NVIDIA GeForce RTX 5090(32 GB)
  • RTX 4090(24 GB)
  • RTX 3090(24 GB)もよい選択肢になります。

NVIDIA GeForce RTX 5080のような16 GBのカードでも動作しますが、実行できるモデルの制約は大きくなります。

Macでは、以下のような構成が適しています。

  • M5 Pro搭載MacBook Pro:24 GB以上の統合メモリ
  • M5 Max搭載MacBook Pro:36 GB、48 GB、64 GB、または128 GBの統合メモリ
  • Mac Studio

Macでは、統合メモリをmacOSやほかのアプリと共有します。以下のCUDAでのピーク値は構成を検討するための参考値であり、Apple Siliconで測定した必要メモリ量ではありません。実行環境、オフロード、画像解像度によってメモリ使用量は変わります。

  • 24 GBのMacは、macOS用の余裕を確保しつつ、Z-Image TurboやFLUX.2 Klein 4Bを試すための出発点になります。
  • 32 GBのMacでは、Krea 2 TurboやQwen-Image-2.1を試すための余裕が増えます。FLUX.1モデルでは、ほかのメモリ使用状況によってオフロードが必要になる場合があります。
  • 36 GB以上のMacでは、このリストにあるモデルに、より多くのメモリを割り当てられます。これらの構成は今回テストしていません。

注:今回のベンチマークでは、Macでの生成速度は測定していません。

より低ビットの量子化、CPUオフロード、その他のメモリ節約手法を使えば、16 GB未満のメモリでもこれらのモデルを実行できる場合がありますが、16 GBを出発点とするほうがはるかに実用的です。

以下の表は、RTX 5090での測定結果に基づく構成検討の目安です。すべてのGPUや実行環境で同じメモリ使用量になることを確認したものではありません。

メモリ測定されたピーク値に基づく構成の目安
16 GBZ-Image Turboのピーク使用量は14.6 GiBでした。Klein 4Bは15.9 GiBに達し、余裕はほとんどありません。
20 GBZ-Image Turbo、FLUX.2 Klein 4B、Krea 2 Turbo
24 GBZ-Image Turbo、Klein 4B、Krea 2 Turbo、Qwen-Image-2.1のピーク使用量は20 GiB未満でした。FLUX.1は23.2〜23.3 GiBに達しました。ほかのメモリ使用分を見込むか、オフロードを利用してください。
32 GBテストした設定では、測定されたピーク値はすべて25 GiB未満でした。

Atomic Chatでローカル画像生成を行う方法

Atomic Chatは、ローカルでのFLUXやQwen-Imageの推論にも使われるC++エンジン、stable-diffusion.cppを通じて画像モデルを実行します。ダウンロードとセットアップはアプリが処理します。

  1. Atomic Chatをインストールし、Imagesを開きます。
  2. 案内が表示されたら、stable-diffusion.cppエンジンをインストールします。サイズは約100 MBで、モデルのダウンロードとは別です。
  3. モデルとエンコーダーのファイルが、ストレージとメモリの容量に収まるカタログモデルを選びます。
  4. Downloadを選択し、モデルファイルのダウンロードを待ってからRunを選択します。テキストエンコーダーを含めると、1つのモデルは約7〜17 GiBで、共有ファイルは1回だけダウンロードされます。
  5. 被写体、構図、照明、ビジュアルスタイル、必要な文字など、具体的なプロンプトを書きます。Generateを選択して画像を生成します。試行ごとに変更する変数は1つにします。

よくある質問

ローカルでAI画像を生成できますか?

はい。モデルをダウンロードし、完全にローカルで動作するワークフローを選択すれば、自分のコンピューターでオフライン生成できます。クラウドバックエンドやAPIノードは、外部サービスにデータを送信します。

画像を生成できるローカルAIモデルには何がありますか?

Z-Image Turbo、FLUX.2 Klein 4B、FLUX.1 schnell、FLUX.1 Krea Dev、Krea 2 Turbo、Qwen-Image、Qwen-Image-2.1などがあります。

オフラインのAI画像生成ツールは無料ですか?

掲載したアプリのほとんどは無料でダウンロードでき、ローカル生成には画像ごとのAPI料金はかかりません。モデルのライセンスはそれぞれ異なります。FLUX.1 Krea Devはモデルの利用を制限していますが、出力の商用利用は規定の条件の下で別途認めています。Qwen-Image-2.1は、別途ライセンスを取得しない限り、研究または評価用です。Krea 2 Turboには売上高の基準額があります。

2026年に最適なローカルAI画像生成ツールはどれですか?

  • より幅広い機能を持つオフラインAIアプリの一部として、使いやすいローカルAI画像生成ツールが必要なら、Atomic Chatが最適です。
  • ノードベースの詳細なカスタマイズが必要なら、ComfyUIが最適です。
  • すでにKritaで作業していて、レイヤーや選択範囲の中で生成したいなら、Krita AI Diffusionが最適です。
  • Macユーザーなら、Draw Thingsが最適です。

VRAMはどのくらい必要ですか?

テストした設定では、Z-Image Turboのピーク使用量は14.6 GiBでした。24 GBクラスのカードなら、Klein 4B、Krea 2 Turbo、Qwen-Image-2.1を動かす余裕が増えます。FLUX.1のピーク使用量はこのクラスのカードの容量に近く、Qwen-Imageはそれを超えます。空きメモリが足りない場合は、より多くのメモリを確保するか、オフロードを使用してください。

12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで使うローカルLLMを比較。モデルの選び方、量子化形式、メモリ使用量を確認し、PCのスペックに合うモデルを探せます。

9/30/26

15分

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5をOpus、Fable、GPT-6 Astraと比較し、お使いのハードウェアに合うローカルのQwen、Ornith、Bonsaiモデルを選びましょう。

9/29/26

13分

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できるのでしょうか?その仕組みを学び、JevとLayaのTetris比較デモを見て、独立したローカルの代替モデルとしてLayaをセットアップしましょう。

9/25/26

12分

MiMo-V2.6 9Bをローカルで実行する方法:GGUF、必要スペック、ベンチマーク

MiMo-V2.6 9Bをローカルで実行する方法:GGUF、必要スペック、ベンチマーク

MiMo-V2.6 9Bをローカルで実行するために、GGUFファイルを比較し、RAMとVRAMの容量を見積もり、llama.cppを設定します。ベンチマークとAtomic Chatの互換性も紹介します。

9/25/26

15分