このガイドでは、次の内容を解説します。
- Qwen3.8 Flash Nextとは何か、Qwen 3.8 27BやQwen 3.8 Maxとどう違うのか
- 実行に必要なハードウェア
- Atomic Chatまたはllama.cppでQwen3.8 Flash Nextをローカル実行する方法
0.8B以上のQwenの全ラインアップを知りたい場合は、Qwenモデルをローカルで実行する方法のガイドをご覧ください。この記事では、Qwen3.8 Flash Nextのみを扱います。
64 GBのMacでは、AD-3.84bpw-IQ4_XS-M64から始めてください。80 GBまたは96 GBのMacでは、AD-4.27bpw-Q4_K_M-M64を使用します。24 GBのGPUでも、96 GB以上のシステムRAMがあれば同じビルドを実行できます。
Qwen3.8 Flash Nextとは?
Qwen3.8 Flash Nextは、AlibabaのQwenチームが開発したオープンウェイトのMixture-of-Expertsモデルであり、Qwen4の基盤となるアーキテクチャの初期プレビューです。Alibabaは、Qwen 3.8 27Bの公開から12日後の2026年8月26日に重みを公開しました。AlibabaのAPIでホストされているQwen3.8-Flashは、同じモデルをサービスとして提供するバージョンで、Flash Nextはダウンロードするチェックポイントです。
Qwen3.8 Flash Nextの主な仕様:
| 仕様 | Qwen3.8 Flash Next |
|---|---|
| 総パラメータ数 | 125Bに加え、51Bのn-gram埋め込みと4BのMTPヘッド |
| トークンごとの有効パラメータ数 | 6B |
| アーキテクチャ | MoE、ハイブリッドアテンション(Gated DeltaNet + Qwen Sparse Attention) |
| エキスパート | ルーティング対象512個、トークンごとに10個が有効、加えて共有エキスパート1個 |
| 層数 | 48 |
| コンテキスト長 | 標準で262,144トークン、1Mまで拡張可能 |
| モダリティ | テキスト、画像、動画の入力 |
| 推論 | 思考モードはデフォルトでオン、推論強度はxhigh、medium、lowの3段階、オフへの切り替えも可能 |
| 複数トークン予測 | 対応、ヘッドをチェックポイントに同梱 |
| リリース日 | 2026年8月26日 |
| ライセンス | Qwen Community License 1.0 |
Flash Nextは、125Bのパラメータのうちトークンごとに6Bを有効にするため、生成トークンあたりの計算量は、はるかに小さいデンスモデルに近くなりますが、メモリには依然としてファイル全体を保持する必要があります。ただし、ダウンロードするモデルは125Bより大きく、リポジトリには約180Bのパラメータがあると記載されています。追加の55Bは、n-gram埋め込みのルックアップテーブルと4BのMulti-Token Predictionヘッドです。このテーブルには、頻出する2トークンおよび3トークンの並びに対して事前に用意された表現が格納されています。読み出しにはほとんど計算が不要で、Qwenはエキスパートの重みよりもオフロードしやすいと説明しています。ハードウェアのセクションで、具体的な数値を示します。
Multi-Token Predictionヘッドにより、モデルは1回の順伝播で複数のトークン候補を生成できます。これは、投機的デコーディングの基盤となる仕組みと同じです。
現在、Qwen 3.8のラインアップには4つの異なるモデルがあり、混同しやすくなっています。
- Qwen 3.8 Maxは、有効パラメータ数95B、総パラメータ数2.4TのMoEフラッグシップモデルで、Alibaba Cloud APIを通じて提供されます。
- Qwen3.8-2.4T-A95Bは、Maxのダウンロード可能なバージョンです。テキスト専用で、すべてのリクエストで推論を行います。パラメータ数が2.4兆あるため、サービスとして稼働させるには、Kimi K3と同じクラスのハードウェアである、複数GPUを備えたデータセンターのクラスターが必要です。
- Qwen 3.8 27Bは、24 GBのGPUまたは32 GBのMacに収まるデンス型の視覚言語モデルです。詳しくは、別のガイドQwen 3.8 27Bをローカルで実行する方法で解説しています。
- Qwen3.8 Flash Nextは、このガイドで扱う新アーキテクチャのMoEモデルです。ゲーミングGPUには大きすぎますが、64 GBのMacBookから128 GBのワークステーションまで、無理なく収まります。
Qwen3.8 Flash Nextのベンチマーク
以下の表では、Flash Nextを同系列のデンスモデル、同クラスのローカルモデル、そして最先端モデルの比較基準としてClaude Opus 4.6 Maxと並べています。各オープンモデルのスコアは、それぞれの開発元が公表したものです。Opusの数値は、Qwenがリリース時の表に掲載した測定結果です。
| ベンチマーク | Qwen3.8 Flash Next | Qwen 3.8 27B | DeepSeek V4 Flash | Laguna S 2.1 | Claude Opus 4.6 Max |
|---|---|---|---|---|---|
パラメータ数 | 125B MoE(有効6B) | 27Bデンスモデル | 284B MoE(有効13B) | 118B MoE(有効8B) | APIモデル |
4ビットGGUFのサイズ | 92.9 GB | 17.1 GB | ~155 GB | ~73 GB | - |
DeepSWE 1.1 エージェントによるコーディング | 58.7 | 42.2 | 54.4 | 40.4 | - |
Toolathlon Verified 長期タスクでのツール利用 | 73.5 | 67.1 | 70.3 | 49.7 | - |
SWE-bench Pro 高難度のソフトウェアエンジニアリング | 62.5 | 61.7 | - | 59.4 | 53.4 |
SWE-bench Multilingual 複数言語でのソフトウェアエンジニアリング | 81.0 | 73.8 | - | 78.5 | 77.5 |
NL2Repo-Bench リポジトリ単位のコーディング | 48.1 | 42.3 | 54.2 | - | 47.6 |
Terminal Bench 2.1 ターミナルエージェント | - | 73.0 | 82.7 | 70.2 | 78.2 |
Qwen自身がリリース時に公開した表でも、Flash Nextは、両モデルのスコアが報告されている9つの言語ベンチマークのうち8つでClaude Opus 4.6 Maxを上回っています。今やOpusレベルのモデルが64 GBのMacBookで動作します。
各研究機関は独自の評価環境を使用しているため、列間の小さな差はあまり意味を持ちません。ハイフンは、開発元が最新ビルドについてその数値を公開していないことを示します。DeepSeekは0731のモデルカードでエージェント系ベンチマークのみを報告しており、Lagunaの59.4というスコアには、公開データセットでのSWE-Bench Proというラベルが付いています。Opusのハイフンは、Qwenが測定しなかった項目です。DeepSeekとLagunaのGGUFサイズはunslothの4ビットビルドのもので、27Bのサイズは当社のAD-Q4_K_Mのものです。
直接の競合はDeepSeek V4 Flashです。1か月前にリリースされた、有効パラメータ数13B、総パラメータ数284BのMoEであり、Qwen自身のモデルカードでも比較対象になっています。上の表では、DeepSeekがTerminal Bench 2.1とNL2Repo-Benchで優位を保ち、それ以外の項目ではFlash Nextがリードしています。また、Flash Nextはすべての品質段階でダウンロードサイズが小さく、4ビットではDeepSeekの155 GBに対して92.9 GBで、そのうちメモリに常駐させる必要があるのは54.5 GBだけです。
Flash Nextには、オープンモデルのラインアップ内に直接の前身となるモデルがありません。Qwen4ファミリーの基盤となるアーキテクチャを先行公開するもので、Qwenは、Qwen4の登場前にコミュニティが変更点を検討できるよう、意図的に早期リリースしたと説明しています。モデルカードでは、ホスト型のQwen3.7-Plusと比較して、学習コストは約9分の1だったと主張しています。24 GBのグラフィックカードを搭載したマシンであれば、ローカルでのコーディングには引き続きデンスモデルの27Bが有力な選択肢です。十分なメモリがあれば、Flash Nextのほうが優れたモデルです。
Qwen3.8 Flash Next GGUF:当社で量子化しました
当社はQwenの元のBF16重みからAtomicChat Qwen3.8 Flash Next GGUFリポジトリのビルドを作成し、すべてのビルドを量子化前の参照モデルと比較して測定しました。リポジトリには84.9 GBから110.5 GBまでの3つのビルドと、すべてのビルドで共有する別ファイルのビジョンプロジェクターが含まれています。ADという接頭辞はAtomic Dynamicを意味し、各名称に含まれる数値は、そのビルドで測定した重みあたりのビット数です。エキスパート、n-gramテーブル、アテンション層ではビット幅が異なるため、名称には実際の平均値を使用しています。すべてのビルドは、1つのシャードにn-gramテーブルだけが入るように分割されており、これによってテーブルをSSDに置いたままにできます。
| ファイル | メモリ上 | SSD上 | 合計 | KLダイバージェンス | Top-1一致率 |
|---|---|---|---|---|---|
| AD-3.84bpw-IQ4_XS-M64 | 45.8 GB | 39.1 GB | 84.9 GB | 0.2277 | 82.68% |
| AD-4.27bpw-Q4_K_M-M64 | 54.5 GB | 38.4 GB | 92.9 GB | 0.0842 | 89.49% |
| AD-5.00bpw-Q5_K_M-M64 | 56.1 GB | 54.4 GB | 110.5 GB | 0.0837 | 89.55% |
表の見方:KLダイバージェンスは、量子化モデルの出力分布と元の重みでの出力分布の隔たりを測定する指標です。低いほどよく、ゼロは同一であることを意味します。Top-1一致率は、量子化モデルが参照モデルと同じ次のトークンを選ぶ位置の割合です。「メモリ上」は、実際にRAMまたはVRAMに常駐させる必要がある部分で、ファイルの残りはSSDからページインされます。単一の総合指標としては、Top-1一致率を使用してください。
選ぶべきビルドはAD-4.27bpw-Q4_K_M-M64です。5.00bpwビルドと測定誤差の範囲で一致し、サイズは17.6 GB小さくなっています。3.84bpwビルドは64 GBのマシン向けで、当社の動画でもこのビルドを使用しています。
表の数値はすべて当社で測定しました。参照モデルには元のBF16重みを使用し、キャリブレーション用コーパスは公開されています。生のログも測定結果のリポジトリにあるため、どの数値もご自身で確認できます。手順の全容はモデルカードに掲載しています。
サイズをそろえた当社GGUFの比較
unslothのビルドをダウンロードし、当社のビルドと同じ評価ハーネスを使い、同じBF16参照モデルと比較して測定しました。
| ファイル | 合計 | KLダイバージェンス |
|---|---|---|
| AD-4.27bpw-Q4_K_M-M64 | 92.9 GB | 0.0842 |
| UD-Q2_K_XL | 78.9 GB | 0.1530 |
| AD-3.84bpw-IQ4_XS-M64 | 84.9 GB | 0.2277 |
| UD-IQ1_M | 74.5 GB | 0.2217 |
上位のAtomicChatビルドは、最も近いunslothのファイルと比べてディスク使用量が14 GB多い一方、ダイバージェンスはほぼ半分です。下位のビルド同士は、互いの誤差範囲内に収まっています。実用上の違いはメモリへの常駐量です。unslothのビルドはn-gramテーブルを重みのシャード内に保持するため、ファイル全体をメモリに常駐させる必要があります。一方、当社のビルドはテーブルをSSDからページインするため、92.9 GBのビルドで必要な高速メモリは54.5 GBです。
Qwen3.8 Flash Nextのハードウェア要件
Qwen3.8 Flash Nextで確認すべきシステム要件はメモリです。BF16チェックポイントは354 GBあるため、ワークステーションで実行可能にするのが量子化です。当社のビルドのサイズは84.9 GBから110.5 GBです。また、そのすべてをメモリに常駐させる必要はありません。モデルはトークンごとに、n-gramテーブルから約2.7 KBを読み出します。これは決定論的ハッシュで選ばれる16行で、順伝播ごとに1回読み出されます。毎秒36トークンでは、ランダム読み出しは毎秒約3 MBとなり、どのNVMeドライブでも持続できる速度のごく一部にすぎません。テーブルをSSDに置けば、最小ビルドに必要な高速メモリは45.8 GBです。以下の表は、使用可能なRAMとVRAMの合計、またはApple Siliconの統合メモリを示しています。
| 使用可能なメモリ | 推奨ビルド | 必要な高速メモリ | 残りの容量で対応できる範囲 |
|---|---|---|---|
| 64 GB | AD-3.84bpw-IQ4_XS-M64、テーブルはSSD上 | 45.8 GB | 中程度のコンテキスト長 |
| 80 GB | AD-4.27bpw-Q4_K_M-M64、テーブルはSSD上 | 54.5 GB | 標準の最大コンテキスト長 |
| 128 GB | AD-5.00bpw-Q5_K_M-M64、全体をメモリに常駐 | 110.5 GB | 標準の最大コンテキスト長でも余裕あり |
| 48 GB以下 | なし | - | テーブルをSSDに置いても、収まるビルドはありません |
注:下位の2つのビルドでは、メモリに余裕があればAD-4.27bpwを選んでください。高速メモリは8.7 GB多く必要ですが、誤ったトークンを選ぶ頻度は半分になります。
コンテキスト長によってメモリはどれだけ増える?
上記の数値は、モデルの重みだけを対象としています。それに加えて、エンジンはKVキャッシュを確保します。会話が長くなるほど、モデルがメモリ内に保持するコンテキストが増え、その分だけ必要なメモリ容量も増えます。大きな文書やコードベースを会話に貼り付ける場合も同じです。
Qwen4アーキテクチャでは、この負担が小さく抑えられています。48層のうち36層はGated DeltaNetを使用し、会話が長くなっても増大しない固定サイズの状態を保持します。残りの12層のQwen Sparse Attention層は、それぞれ2つのKVヘッドだけを保持します。アテンションキャッシュはトークンあたり約25 KBとなり、デンスモデルの27Bが保持する量の10分の1です。
| コンテキスト長 | アテンションキャッシュ |
|---|---|
| 8K(一般的なチャット) | ~0.2 GB |
| 32K(長い文書) | ~0.8 GB |
| 128K(大規模なコードベース) | ~3.2 GB |
| 262K(標準の最大コンテキスト長) | ~6.5 GB |
デンスモデルの27Bでは、同じコンテキスト長に約67 GBのキャッシュが必要です。一方、このモデルでは、上の表のどのメモリ容量でも重みと一緒に収まります。
Qwen3.8 Flash Nextを実行できるハードウェアは?
- 統合メモリ128 GBのMac(M4/M5 Max、Mac Studio)および128 GBの小型ワークステーション(NVIDIA DGX Spark、AMD Strix Halo):AD-5.00bpw-Q5_K_M-M64を全体ごとメモリに載せ、最大262Kのコンテキスト長で実行できます。Macでは、macOSがGPUメモリを統合メモリの約75パーセントに制限しているため、まずデフォルトのGPUメモリ上限を引き上げてください。GGUFビルドはMetal経由でネイティブに動作します。形式の選択で迷っている場合は、GGUFとMLXの比較ガイドをご覧ください。
- 96 GBのGPU(RTX PRO 6000):AD-4.27bpw-Q4_K_M-M64をすべてVRAMに載せて実行できます。または、n-gramテーブルをシステムRAMに置いてAD-5.00bpwを実行できます。
- 64 GBのMacBook Pro(M4/M5 Max):n-gramテーブルをSSDからページインすることで、AD-3.84bpw-IQ4_XS-M64を実行できます。高速メモリ使用量は45.8 GB、生成速度は毎秒36トークンです。まずsysctl iogpu.wired_limit_mbでGPUメモリ上限を引き上げてください。当社の動画では、この構成を使用しています。
- 96 GB以上のシステムRAMを備えた24 GBのGPU(RTX 3090 / 4090):エキスパートをシステムRAMに保持し、アテンション層をGPUに置くことで、AD-4.27bpw-Q4_K_M-M64を実行できます。トークンごとにシステムRAMから読み出されるのは有効な6Bのパラメータだけなので、生成速度は実用的な範囲に保たれます。
- スマートフォン:実行できません。スマートフォンで動作するモデルが必要な場合は、Qwenガイドで紹介しているQwenファミリーの小型モデルを使用してください。
実測スループット
64 GBのMacBook Pro M5 Maxで、n-gramテーブルをSSDからページインしながら、AD-3.84bpw-IQ4_XS-M64を測定しました。
| 指標 | 結果 |
|---|---|
| プロンプト処理(pp512) | 517.9 t/s |
| 生成(tg128) | 36.0 t/s |
| 高速メモリ上 | 45.8 GB |
| SSDからページイン | 39.1 GB |
177Bのチェックポイントが、ノートパソコンで毎秒36トークンを生成します。
Atomic ChatでQwen3.8 Flash Nextをローカル実行する方法
Atomic Chatは、当社が開発した無料のオープンソースのローカルAIアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
こちらは、64 GBのMacBook上でAtomic Chatを使ってQwen3.8 Flash Nextを実行している様子です。
ステップ1:Atomic Chatをインストールする
atomic.chatからAtomic Chatをダウンロードし、お使いのプラットフォーム向けのビルドをインストールします。
- macOS:ユニバーサル.dmg(IntelとApple Silicon)、macOS 13.6以降
- Windows:x64向けの.exeインストーラー
- Linux:root権限が不要な、x86_64向けの自己完結型.AppImage
- iOS:App Storeから
- Android:Google Playから
Linuxでは、chmod +xでAppImageに実行権限を付け、そのまま実行します。初回起動時にアプリがFUSEについて確認を求めた場合は、DebianまたはUbuntuではsudo apt install fuse libfuse2、Fedoraではsudo dnf install fuse fuse-libsでインストールしてください。
ステップ2:Qwen3.8 Flash Next GGUFを探す
Modelsタブを開き、次の名前を検索します。
AtomicChat/Qwen3.8-Flash-Next-GGUF
カタログはHugging Faceと連携しているため、ほかの公開者によるビルドも公開されると表示されます。AtomicChatが公開した検索結果を選び、Download Optionsの選択メニューを展開して、利用可能な量子化ビルドを表示します。
注:重みが公開される前から、Hugging Faceには偽のQwen3.8-Flash-Nextリポジトリが存在していました。中にはファイルが1つもない空の「GGUF」や「MLX」リポジトリもありました。アプリのカタログ以外からダウンロードする場合は、取得するものを確認する方法について「トラブルシューティング」セクションをご覧ください。
ステップ3:メモリに合う量子化ビルドを選ぶ
上のハードウェア表を参照してください。一般的な構成では、次のように選びます。
- 64 GBのMac:AD-3.84bpw-IQ4_XS-M64をダウンロードします。
- 80 GBまたは96 GB:AD-4.27bpw-Q4_K_M-M64をダウンロードします。
- 128 GB以上:AD-5.00bpw-Q5_K_M-M64をダウンロードします。
選択メニューでは、各ビルドがADという接頭辞を省いた短いタグで表示され、2つの名前を組み合わせたビルドは、小さいほうのタグで表示されます。選択メニューに表示されるサイズは、当社の表にあるファイルサイズと少し異なります。同じ名前の行が2つある場合は、サイズで判断してください。コンテキスト用の余裕を残したうえで収まる、最も大きい量子化ビルドを選びます。量子化の名前の意味がわからない場合は、GGUFとは何か、量子化はどのように機能するのかを解説したガイドをご覧ください。
ステップ4:コンテキスト、思考モード、サンプリングを設定する
このモデルは262Kのコンテキスト長を宣言しており、このアーキテクチャではキャッシュの負担が小さく、最大コンテキスト長でも約6.5 GBです。その分の余裕を残してビルドが収まるなら、最初から最大値に設定できます。そうでなければ、チャットでは8,192トークン、コードや文書の作業では32,768トークンから始めてください。
コンテキスト長の設定はチャット画面ではなく、モデル自体の設定にあります。Settings → Model Providers → Llama.cppを開き、モデル一覧でFlash Nextのビルドを探して、その行の歯車アイコンをクリックします。そこで、次の項目を設定してください。
- Context Size:8192、32768、または目的のコンテキスト長に設定します。0を指定するとGGUFから最大値を読み取り、このモデルでは最大の262Kになります。
- Auto Increase Context Size:デフォルトでオンです。会話がコンテキストの上限に達するとコンテキスト長を拡張するため、ぎりぎり収まっていたビルドがメモリ上限を超える可能性があります。メモリ上限に近い状態で使用する場合は、オフにしてください。
- GPU Layers:-1ですべての層をオフロードします。ファイル全体がVRAMまたは統合メモリに収まる場合に使用してください。
- Keep all Experts in CPUとNumber of MoE weights in the CPU:MoEのオフロードを制御する項目です。エキスパートの重みをGPUから移すことで、VRAMより大きい量子化ビルドも読み込めます。生成は遅くなると考えてください。トークンごとに、GPUがシステムRAMからのエキスパート重みの読み出しを待つためです。
Context SizeまたはGPU Layersを変更するとモデルが再起動するため、長い会話を始める前に設定してください。
思考モードはデフォルトでオンになっており、推論強度はxhigh、medium、lowの3段階です。完全にオフにすることもでき、チャット内の電球アイコンでオンとオフを切り替えます。Atomic Chatでは、推論出力の表示と非表示も切り替えられます。
サンプリングは別のパネルで設定します。チャット上部のモデル名の横にあるスライダーアイコンをクリックしてください。思考モードでは、Qwenはtemperature 1.0、top_p 0.95、top_k 20を推奨しています。思考モードをオフにした場合は、0.7と0.80です。これらの設定はモデルではなく、チャット用プロファイルであるアシスタントに保存されるため、モデルを切り替えても変わりません。
ステップ5:ローカルでチャットする
ダウンロードが完了すると、Atomic Chatがモデルを読み込み、内蔵チャットで開きます。
Flash Nextはネイティブの視覚言語モデルなので、チャットに画像を添付して、その内容について質問できます。画像、重み、プロンプトはすべて、お使いのマシン内にとどまります。
Atomic Chatは、http://localhost:1337/v1でOpenAI互換のAPIサーバーも提供します。Claude CodeやClineのようなコーディングエージェントを含め、OpenAI APIに対応するツールであれば、クラウドモデルの代わりにローカルモデルをそのまま利用できます。
llama.cppでQwen3.8 Flash Nextを実行する方法
次のような要件がある場合は、llama.cppから直接モデルを実行するほうが適しているかもしれません。
- フラグを明示的に指定できるOpenAI互換のローカルエンドポイント
- GPUオフロードの精密な制御
- 再現可能なサーバー構成
Qwen4アーキテクチャは、llama.cppに新しく加わったものです。Gated DeltaNetは以前のQwenモデルから引き継がれており、スパースアテンションのインデクサーとn-gramテーブルは、このリリースに伴って導入されました。
ステップ1:最新のllama.cppをビルドする
NVIDIA CUDAの場合:
git clone https://github.com/ggml-org/llama.cpp cd llama.cpp cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j --target llama-cli llama-server
Apple Siliconでは、Metalがデフォルトで有効になっています。
cmake -B build -DCMAKE_BUILD_TYPE=Release cmake --build build -j --target llama-cli llama-server
ステップ2:モデルを実行する
リポジトリから、メモリ容量に合ったビルドをダウンロードします。Macでは、起動のたびに1回GPUメモリ上限を引き上げてから、llama-cliに最初のシャードを指定してください。
sudo sysctl iogpu.wired_limit_mb=57344
./build/bin/llama-cli \ -m Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64-00001-of-00033.gguf \ -ngl 99 -c 32768 --jinja -fit off
mmapはオンのままにしてください。これによってn-gramテーブルをページング可能にするため、--load-mode noneは指定しません。--override-tensorも指定しないでください。テーブルは自動的にホスト側に配置されます。また、-fit offを指定してください。llama.cppの自動パラメータ調整は、このアーキテクチャのサイズを誤って見積もり、メモリ割り当てに失敗します。モデルのチャットテンプレートが適用されるよう、必ず--jinjaを指定してください。
ステップ3:ローカルのOpenAI互換APIを提供する
llama-cliをllama-serverに置き換えます。
./build/bin/llama-server \ -m Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64-00001-of-00033.gguf \ --alias qwen3.8-flash-next \ -ngl 99 -c 32768 --jinja -fit off \ --host 127.0.0.1 --port 8080
次のコマンドでテストします。
curl http://127.0.0.1:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{ "model": "qwen3.8-flash-next", "messages": [ { "role": "user", "content": "Explain what an n-gram embedding table does." } ] }'ネットワーク内のほかのマシンからアクセスする必要がない限り、サーバーを127.0.0.1にバインドしてください。
llama.cppで画像認識を実行する
画像入力には、すべての量子化ビルドで共有するビジョンプロジェクターという追加ファイルが1つ必要です。リポジトリからmmproj-Qwen3.8-Flash-Next-F16.ggufを一度ダウンロードし、選んだビルドと一緒に指定してください。
llama-mtmd-cli \ -m Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64-00001-of-00033.gguf \ --mmproj mmproj-Qwen3.8-Flash-Next-F16.gguf \ --image your-photo.jpg \ -ngl 99 -c 32768 -b 512 --image-min-tokens 1024 --jinja -fit off \ -p "What is in this image?"
--image-min-tokens 1024はそのまま指定してください。このファミリーには、少なくともこれだけの画像トークンが必要です。当社の64 GBのテストマシンでは、テーブルをSSDに置いた状態で画像認識が動作し、モデルが写真の中の手書き文字を書き起こしました。
OllamaまたはLM Studioで実行する
Ollamaは、Apple Silicon向けに105 GBのMLXタグを公開しています。
ollama run qwen3.8-flash-next:125b-mlx
Q4_K_M GGUFタグは120 GBです。
ollama run qwen3.8-flash-next:125b-a6b-q4_K_M
LM Studioは、独自のQ4_K_M GGUFを119 GBで公開しています。次のコマンドを実行して、GGUFカタログを検索してください。
lms get Qwen3.8-Flash-Next --gguf --always-show-all-results
検索結果からlmstudio-community/Qwen3.8-Flash-Next-GGUFを選びます。64 GBのMacでは、n-gramテーブルをSSDに置いたままにできるよう、Atomic Chatまたはllama.cppを通じてAtomic Dynamic GGUFを使用します。
トラブルシューティング
ダウンロードしたGGUFが本物のモデルではない
重みが公開される前に、Hugging Face上のプレースホルダーのリポジトリがQwen3.8-Flash-Nextという名前を名乗っていました。中にはファイルが1つもない「abliterated」や「jailbreak」の派生版もありました。見慣れないリポジトリからダウンロードする前に、公開者が公式のQwen組織、または知っている量子化の提供者であること、モデルカードが存在すること、ファイル一覧に妥当なサイズのGGUFシャードが実際に含まれていることを確認してください。125Bモデルを4ビットに量子化しても、400 MBになることはありません。
llama.cppがモデルのアーキテクチャを不明と表示する
これらのファイルを読み込むには、llama.cppがqwen4_expに対応している必要があります。AtomicChatのGGUFを実行する前に、llama.cppを更新してください。LM Studioでは、SettingsからGGUFランタイムを更新します。Ollamaのユーザーは、上記の公開済みFlash Nextタグを実行できます。
最初のデコードがkIOGPUCommandBufferCallbackErrorOutOfMemoryで停止する
Apple Siliconでこのエラーが発生した場合、n-gramテーブルがGPUメモリに固定されたことを意味します。テーブルが通常の重みと同じGGUFシャードに入っている場合や、固定メモリの上限をデフォルトのままにしている場合に発生します。当社のビルドではテーブルを専用のシャードに分けているため、対処すべきなのは上限です。sudo sysctl iogpu.wired_limit_mb=57344を実行し、-fit offを指定してください。
モデルは読み込めるが生成が非常に遅い
ファイルは収まるのに、トークンごとに数秒かかる場合があります。これは通常、モデルの一部が適切でないメモリに配置されたことを意味します。エキスパートの重みがディスクにスワップアウトされているか、GPU Layersが0のためすべてがCPU上に置かれている可能性があります。空きRAMとVRAMの合計が、量子化ビルドの表の「メモリ上」の値を数GBの余裕をもって満たしていることを確認し、GPU Layersを-1に設定してください。また、OSに重みをスワップさせるのではなく、n-gramテーブルをページング可能なままにできるよう、mmapをオンにしておきます。
思考モードをオフにできない
モデルはenable_thinking: falseによる思考モードの無効化に対応していますが、この切り替えはチャットテンプレートが設定を渡す場合にしか機能しません。また、Qwenの新しいリリースでは、このテンプレート処理が正常に動作しなくなったことが何度もあります。思考モードをオフにしてもモデルが推論を続ける場合は、まずllama.cppを更新し、リポジトリのREADMEを確認してください。そこで動作するフラグを説明しています。
長いコンテキストでメモリ不足になる
重みは収まるのに、長い会話でモデルがクラッシュする場合があります。これは、KVキャッシュがメモリの余裕を超えて増大したか、Auto Increase Context Sizeがコンテキスト長を自動的に引き上げたためです。このモデルのキャッシュ自体はトークンあたり約25 KBと小さいため、通常は後者が原因です。上限に近い場合は、Context Sizeを明示的に設定し、Auto Increaseをオフにしてください。
よくある質問
お使いのハードウェアでQwen3.8 Flash Nextを実行する際によく寄せられる質問です。
Qwen3.8 Flash Nextに必要なRAMはどれくらい?
推奨のAD-4.27bpwビルドでは、n-gramテーブルをSSDからページインする場合、約54.5 GBの高速メモリが必要です。そのため、実用上の最小構成は64 GBのマシンで、128 GBあれば最大のビルドをすべてメモリに保持できます。BF16リリース自体は354 GBあり、ここでは量子化の有無が、データセンターを必要とするか、ノートパソコンで済むかの違いになります。
RTX 4090でQwen3.8 Flash Nextを実行できる?
いいえ、グラフィックカード単体では実行できません。24 GBのVRAMには、125Bモデルのどのビルドも収まりません。96 GB以上のシステムRAMを併用すれば実行できます。アテンション層をGPUに置き、エキスパートの重みをRAMに移してください。トークンごとに有効になるのは6Bのパラメータだけなので、オフロードによる性能低下は、同じ規模のデンスモデルよりもはるかに小さくなります。
MacでQwen3.8 Flash Nextを実行できる?
はい、64 GB以上の統合メモリがあれば実行できます。64 GBのM5 Maxでは、n-gramテーブルをSSDからページインしながら、AD-3.84bpw-IQ4_XS-M64を毎秒36トークンで実行できます。まずsysctl iogpu.wired_limit_mbでGPUメモリ上限を引き上げてください。80 GB以上ならAD-4.27bpwを選び、128 GB以上ならAD-5.00bpwビルドをすべてメモリに常駐させられます。GGUFビルドはMetal経由でネイティブに動作します。
Qwen3.8 Flash NextはQwen 4と同じ?
いいえ。Qwenは、これをQwen4の基盤となるアーキテクチャの実験的プレビューと説明しています。Qwen4ファミリーがその上に構築される前に、コミュニティが同じ構成要素を検討できるよう、先行して公開したものです。現在ダウンロードできるのは、新しいアーキテクチャ上に構築されたQwen 3.8世代のモデルです。
Qwen3.8 Flash NextはOllamaやLM Studioで動作する?
はい。Ollamaは105 GBのMLXタグと120 GBのQ4_K_M GGUFタグを公開しています。LM Studioは119 GBのQ4_K_M GGUFを公開しています。64 GBのMacでは、Atomic Chatまたはllama.cppを通じてAtomic Dynamicの分割ビルドを使用します。
Qwen3.8 Flash NextとQwen 3.8 27Bの違いは?
違いは、サイズ、アーキテクチャ、必要なハードウェアです。27Bは24 GBのGPUに収まるデンスモデルです。Flash Nextは125BのMoEで、n-gramテーブルをSSDからページインする場合、64 GB以上のメモリで動作します。モデルカードの言語ベンチマークでは、Flash Nextがすべての項目で上回っており、特にエージェント系の作業で差が大きく、DeepSWEは58.7対42.2、JobBenchは55.7対33.4です。24 GBのグラフィックカードを搭載したマシンなら27Bを実行してください。ワークステーション級のメモリがあれば、Flash Nextのほうが優れたモデルです。
Qwen3.8 Flash NextはDeepSeek V4 Flashと比べてどう?
両モデルは、大規模MoEクラスで最も近い組み合わせです。DeepSeek V4 Flashは総パラメータ数284B、有効パラメータ数13Bで、Flash Nextは125B、有効6Bです。Qwenのリリース時の表では、共通する9項目のうち8項目でFlash Nextがリードし、NL2Repo-BenchではDeepSeekが優位を保っています。Flash Nextはすべての品質段階でダウンロードサイズが小さく、4ビットではDeepSeekの155 GBに対して92.9 GBです。メモリに常駐させる必要があるのはそのうち54.5 GBだけなので、DeepSeekのモデルが収まらないマシンでも動作します。DeepSeekのモデルについては、DeepSeek V4 Flashガイドで解説しています。
51Bのn-gram埋め込みパラメータとは?
トークンのペアと3つ組のルックアップテーブルで、モデルがネットワークの初期段階で1回読み出します。行を参照する処理は、それらを行列乗算に通すよりもはるかに低コストです。これにより、チェックポイントに格納するパラメータ数を180Bまで増やしながら、トークンごとに有効にするパラメータを6Bだけに抑えています。テーブルに高速メモリは不要です。モデルがトークンごとに読み出すのは約2.7 KBなので、SSDから問題なくページインできます。これが、64 GBのMacBookでの実行を可能にしています。
Qwen3.8 Flash Nextはローカルでの画像認識に対応している?
はい。Flash Nextは、画像と動画の入力を受け付けるネイティブの視覚言語モデルで、視覚エンコーダーはチェックポイントに含まれています。Atomic Chatでは、チャットに画像を添付して質問でき、マシンの外にデータが出ることはありません。llama.cppでは、画像入力にGGUFリポジトリのmmprojファイルを使用します。
思考モードをオフにできる?
はい。思考モードはデフォルトでオンになっており、推論強度はxhigh、medium、lowの3段階です。enable_thinking: falseで完全にオフにできます。思考モードをオフにした場合、Qwenはtemperature 0.7とtop_p 0.80を推奨しています。Atomic Chatでは、チャット内の電球アイコンで切り替えます。
Qwen3.8 Flash Nextは無料で商用利用できる?
はい、ほとんどの製品で可能です。Qwen Community License 1.0は、商用利用、改変、再配布を許可しています。ただし、例外が2つあります。月間アクティブユーザー数が1億人を超える、または月間収益が2,000万ドルを超える製品は、インターフェースにモデル名を表示する必要があります。また、このモデルを使ってモデルをサービスとして提供するAPIや、コーディングまたはオフィス業務のアシスタント製品を構築するには、Qwenから別途ライセンスを取得する必要があります。27Bとは異なり、このリリースはApache 2.0を使用していません。
まとめ
64 GB以上のメモリを搭載したマシンがあれば、Qwen3.8 Flash Nextを実行できるようになりました。Atomic ChatからAD-4.27bpw-Q4_K_M-M64を、64 GBのマシンではAD-3.84bpw-IQ4_XS-M64をダウンロードし、n-gramテーブルをSSDに置いたままにしてください。llama.cppを使う方法では、同じファイルをローカルのOpenAI互換API経由で提供できます。
要点:
- Qwen3.8 Flash Nextは、トークンごとに6Bのパラメータを有効にする125BのMoEで、Qwen4アーキテクチャを採用した最初のオープンモデルです。
- 重みは2026年8月26日に、ほとんどの製品で商用利用を許可するQwen Community License 1.0の下で公開されました。
- 当社のGGUFビルドは84.9 GBから110.5 GBで、51Bのn-gramテーブルをSSDからページインします。最小ビルドが高速メモリに保持するのは45.8 GBです。
- 64 GBのMacBook Proでの実測では、生成速度は毎秒36トークンで、画像認識も動作しました。
- このアーキテクチャでは、長いコンテキストの負担が小さく、262Kのコンテキスト全体でもキャッシュは約6.5 GBです。

