Qwen3.8-Flash-Nextとは?
Qwen3.8-Flash-Nextは、AlibabaのQwenチームが新しいアーキテクチャで初めて公開したオープンウェイトモデルで、公開日は2026年8月24日です。Qwenは、Qwen4の基盤となるアーキテクチャの実験的なプレビューと説明しているため、完成した製品シリーズではなく、今後の方向性を示すものとして捉えてください。テキスト、画像、動画を入力できます。パラメータ数は、1つの数値だけでは表せません。言語モデルは125Bで、トークンごとに6Bがアクティブになり、これに51Bのn-gram埋め込みと4Bのマルチトークン予測ヘッドが加わります。すべての重み区分を合計すると、safetensorsファイルには約180Bのパラメータが含まれています。
| 仕様 | Qwen3.8-Flash-Next |
|---|---|
| 言語モデルのパラメータ数 | 合計125B、アクティブ6B |
| n-gram埋め込み | 51B、第2層で20,000,000件のバイグラムとトライグラムをインデックス化 |
| マルチトークン予測 | 4B、1層、複数ステップで学習 |
| 全重み区分の合計 | 公開されたsafetensors内で約180B |
| アーキテクチャ | ハイブリッド構成、Gated DeltaNetとQwen Sparse Attentionの組み合わせ、Gated Residual |
| 層数 | 48 |
| エキスパート | 512、そのうちルーティングで選ばれる10個と共有の1個がアクティブ |
| コンテキスト長 | 262,144トークン、1,000,000まで拡張可能 |
| モダリティ | テキスト、画像、動画の入力 |
| モデルタイプ | qwen4_exp |
| 公開日 | 2026年8月24日 |
| ライセンス | Qwen Community License 1.0 |
層の構成は、MoEに出力を渡すGated DeltaNetブロック3個の後に、MoEに出力を渡すQwen Sparse Attentionブロック1個を置くパターンを12回繰り返します。QSAは個々のトークンではなくマイクロブロックを選択し、その上限は512ブロック、または2048トークンです。Qwenによると、この仕組みが長いコンテキストでのレイテンシ削減につながります。もう1つの特徴的な要素がn-gram埋め込みです。Qwenは埋め込みを通じてパラメータ数を増やしています。埋め込みは必要な計算量が少なく、Qwenの説明ではMoEの重みよりもオフロードしやすいためです。
Qwen3.8-Flash-Nextのベンチマーク
Qwenはリリースに合わせて、言語と視覚言語の2つの表を公開しました。以下は言語の評価項目で、Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash、Claude-Opus-4.6 (Max)と比較しています。
| ベンチマーク | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash | Opus 4.6 |
|---|---|---|---|---|---|
SWE-bench Pro 高難度のソフトウェア開発 | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
SWE-bench Multilingual 多言語でのソフトウェア開発 | 81.0 | 73.8 | 75.8 | - | 77.5 |
NL2Repo-Bench リポジトリ単位のコーディング | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
Toolathlon Verified 長期的なツール利用 | 73.5 | 67.1 | 50.6 | 70.3 | - |
IFBench 指示への追従 | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
GPQA Diamond 専門的な科学知識 | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
HLE 専門的な問題 | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
これら7項目のうち5項目で首位です。首位を逃した2項目も挙げておきます。リポジトリ単位のコード生成ではDeepSeek-V4-Flashが54.2対48.1で上回り、HLEではClaude-Opus-4.6 (Max)が40.0対35.9で上回っています。別の視覚評価表でも同様の傾向が見られ、AndroidWorldとRealWorldQAで首位ですが、複数の項目ではClaudeの数値が公開されていません。
Qwen3.8-Flash-Nextのハードウェア要件
システム要件で確認すべきなのはメモリです。Qwenはリリース情報のどこにも想定ハードウェアを示していないため、以下ではHugging Faceのファイル一覧から測定した、公開済みの重み一式のディスク上のサイズを目安として示します。量子化されたGGUFビルドは、いずれのサイズよりも小さくなります。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。
| 精度 | 提供元 | ディスク上のサイズ |
|---|---|---|
| BF16 | Qwen/Qwen3.8-Flash-Next、公式 | 360.0 GB |
| FP8 | Qwen/Qwen3.8-Flash-Next-FP8、公式 | 185.5 GB |
| NVFP4 | RadixArk/Qwen3.8-Flash-Next-NVFP4、コミュニティ | 135.2 GB |
これらの数値は重みだけのサイズなので、コンテキスト長262,144トークンではKVキャッシュ用のメモリを追加で見込んでください。YaRNで1,000,000トークンに近づける場合は、さらに多くのメモリが必要です。Qwenはリリース情報のどこにもアクセラレータ数や最小構成を示していません。一方で、パラメータ数のうち51Bを占めるn-gram埋め込みは、MoEの重みよりもオフロードしやすいと説明しています。Qwenはこれを、メモリに制約のあるアクセラレータでパラメータ数を増やす方法として提示しているため、メモリに常駐させる必要がある量は、選ぶサービングスタックによって変わります。
Atomic ChatでQwen3.8-Flash-Nextを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム用のAtomic Chatをダウンロードして起動します。
- モデルブラウザーでQwen3.8-Flash-Nextを検索し、Download Optionsを開きます。
- 利用可能なメモリに収まるビルドを選び、チャットを開始します。
GGUFビルドは、私たち自身がAtomicChat/Qwen3.8-Flash-Next-GGUFとして公開しています。元のsafetensorsをGPUマシン上でサービングしたい場合、QwenはSGLang、vLLM、TokenSpeed、KTransformersを挙げており、最初の3つにはクックブックも提供しています。ほかのラインアップについては、ローカルで実行できるQwenモデルの一覧をご覧ください。
Qwen3.8-Flash-Nextのライセンス
重みはQwen Community License 1.0で公開されています。Hugging Faceでは、標準的なオープンソースライセンスの識別子ではなくotherと記載されており、全文の条件はリポジトリ内のLICENSEファイルにあります。商用のものを開発する前に、そのファイルを読んでください。
