Qwen3.8-Flash-Next

更新
05.10.2026
思考
ツール利用
画像認識
推論
コード生成
多言語

Qwen3.8-Flash-Nextは125Bのパラメータを持ち、そのうち6Bがアクティブになります。さらに51Bのn-gram埋め込みを備えています。Qwen4アーキテクチャの実験的なプレビューです。

基本情報

  • ライセンス: Qwen Community License 1.0
  • パラメータ数: 合計125Bのうち6Bがアクティブ。これに51Bのn-gram埋め込みと4BのMTPが加わり、ディスク上では約180B
  • コンテキスト長: 262,144トークン、1,000,000まで拡張可能
  • モダリティ: テキスト、画像、動画の入力
  • 最小ハードウェア要件: Qwenは未公表。公開済みの重みで最小なのは、135.2 GBのコミュニティ版NVFP4ビルド

Qwen3.8-Flash-Nextとは?

Qwen3.8-Flash-Nextは、AlibabaのQwenチームが新しいアーキテクチャで初めて公開したオープンウェイトモデルで、公開日は2026年8月24日です。Qwenは、Qwen4の基盤となるアーキテクチャの実験的なプレビューと説明しているため、完成した製品シリーズではなく、今後の方向性を示すものとして捉えてください。テキスト、画像、動画を入力できます。パラメータ数は、1つの数値だけでは表せません。言語モデルは125Bで、トークンごとに6Bがアクティブになり、これに51Bのn-gram埋め込みと4Bのマルチトークン予測ヘッドが加わります。すべての重み区分を合計すると、safetensorsファイルには約180Bのパラメータが含まれています。

仕様Qwen3.8-Flash-Next
言語モデルのパラメータ数合計125B、アクティブ6B
n-gram埋め込み51B、第2層で20,000,000件のバイグラムとトライグラムをインデックス化
マルチトークン予測4B、1層、複数ステップで学習
全重み区分の合計公開されたsafetensors内で約180B
アーキテクチャハイブリッド構成、Gated DeltaNetとQwen Sparse Attentionの組み合わせ、Gated Residual
層数48
エキスパート512、そのうちルーティングで選ばれる10個と共有の1個がアクティブ
コンテキスト長262,144トークン、1,000,000まで拡張可能
モダリティテキスト、画像、動画の入力
モデルタイプqwen4_exp
公開日2026年8月24日
ライセンスQwen Community License 1.0

層の構成は、MoEに出力を渡すGated DeltaNetブロック3個の後に、MoEに出力を渡すQwen Sparse Attentionブロック1個を置くパターンを12回繰り返します。QSAは個々のトークンではなくマイクロブロックを選択し、その上限は512ブロック、または2048トークンです。Qwenによると、この仕組みが長いコンテキストでのレイテンシ削減につながります。もう1つの特徴的な要素がn-gram埋め込みです。Qwenは埋め込みを通じてパラメータ数を増やしています。埋め込みは必要な計算量が少なく、Qwenの説明ではMoEの重みよりもオフロードしやすいためです。

Qwen3.8-Flash-Nextのベンチマーク

Qwenはリリースに合わせて、言語と視覚言語の2つの表を公開しました。以下は言語の評価項目で、Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash、Claude-Opus-4.6 (Max)と比較しています。

ベンチマークQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek-V4-FlashOpus 4.6
SWE-bench Pro
高難度のソフトウェア開発
62.561.755.856.053.4
SWE-bench Multilingual
多言語でのソフトウェア開発
81.073.875.8-77.5
NL2Repo-Bench
リポジトリ単位のコーディング
48.142.341.154.247.6
Toolathlon Verified
長期的なツール利用
73.567.150.670.3-
IFBench
指示への追従
81.379.579.179.262.5
GPQA Diamond
専門的な科学知識
91.789.290.390.891.3
HLE
専門的な問題
35.930.834.733.840.0

これら7項目のうち5項目で首位です。首位を逃した2項目も挙げておきます。リポジトリ単位のコード生成ではDeepSeek-V4-Flashが54.2対48.1で上回り、HLEではClaude-Opus-4.6 (Max)が40.0対35.9で上回っています。別の視覚評価表でも同様の傾向が見られ、AndroidWorldとRealWorldQAで首位ですが、複数の項目ではClaudeの数値が公開されていません。

Qwen3.8-Flash-Nextのハードウェア要件

システム要件で確認すべきなのはメモリです。Qwenはリリース情報のどこにも想定ハードウェアを示していないため、以下ではHugging Faceのファイル一覧から測定した、公開済みの重み一式のディスク上のサイズを目安として示します。量子化されたGGUFビルドは、いずれのサイズよりも小さくなります。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。

精度提供元ディスク上のサイズ
BF16Qwen/Qwen3.8-Flash-Next、公式360.0 GB
FP8Qwen/Qwen3.8-Flash-Next-FP8、公式185.5 GB
NVFP4RadixArk/Qwen3.8-Flash-Next-NVFP4、コミュニティ135.2 GB

これらの数値は重みだけのサイズなので、コンテキスト長262,144トークンではKVキャッシュ用のメモリを追加で見込んでください。YaRNで1,000,000トークンに近づける場合は、さらに多くのメモリが必要です。Qwenはリリース情報のどこにもアクセラレータ数や最小構成を示していません。一方で、パラメータ数のうち51Bを占めるn-gram埋め込みは、MoEの重みよりもオフロードしやすいと説明しています。Qwenはこれを、メモリに制約のあるアクセラレータでパラメータ数を増やす方法として提示しているため、メモリに常駐させる必要がある量は、選ぶサービングスタックによって変わります。

Atomic ChatでQwen3.8-Flash-Nextを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム用のAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでQwen3.8-Flash-Nextを検索し、Download Optionsを開きます。
  3. 利用可能なメモリに収まるビルドを選び、チャットを開始します。

GGUFビルドは、私たち自身がAtomicChat/Qwen3.8-Flash-Next-GGUFとして公開しています。元のsafetensorsをGPUマシン上でサービングしたい場合、QwenはSGLang、vLLM、TokenSpeed、KTransformersを挙げており、最初の3つにはクックブックも提供しています。ほかのラインアップについては、ローカルで実行できるQwenモデルの一覧をご覧ください。

Qwen3.8-Flash-Nextのライセンス

重みはQwen Community License 1.0で公開されています。Hugging Faceでは、標準的なオープンソースライセンスの識別子ではなくotherと記載されており、全文の条件はリポジトリ内のLICENSEファイルにあります。商用のものを開発する前に、そのファイルを読んでください。

Hugging Faceからモデルをダウンロード

huggingface-cli download Qwen/Qwen3.8-Flash-Next
# 公式FP8重み。360 GBではなく185.5 GB:
huggingface-cli download Qwen/Qwen3.8-Flash-Next-FP8
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3.8-Flash-Next",
    "messages": [{"role": "user", "content": "Plan a refactor of this service."}],
    "temperature": 1.0,
    "top_p": 0.95
  }'
# GGUFビルドはまだないため、vLLMまたはSGLangでsafetensorsを使用して推論を提供します。
# Qwenはデプロイ用の選択肢としてSGLang、vLLM、TokenSpeed、KTransformersを挙げています。
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")
res = client.chat.completions.create(
    model="Qwen/Qwen3.8-Flash-Next",
    messages=[{"role": "user", "content": "Explain Qwen Sparse Attention."}],
    temperature=1.0,
    top_p=0.95,
)
print(res.choices[0].message.content)
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen3.8-Flash-Next",
  messages: [{ role: "user", content: "Draft a migration plan for a Postgres upgrade." }],
  temperature: 1.0,
  top_p: 0.95,
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen3.8-Flash-Nextは、Qwen4の基盤となるアーキテクチャの実験的なプレビューで、Qwenチームが2026年8月24日に公開しました。言語モデルは125Bのパラメータを持ち、トークンごとに6Bがアクティブになります。これに51Bのn-gram埋め込みパラメータと4BのMTPが加わり、safetensorsのインデックスでは合計179,999,981,459パラメータと報告されています。すべての重み区分を合わせて約180Bです。視覚エンコーダーを備えた因果言語モデルなので、テキストに加えて画像と動画も入力でき、Hugging Faceではimage-text-to-textのタグが付いています。標準のコンテキスト長は262,144トークンで、YaRNを使うと1,000,000トークンまで拡張できます。

はい。このモデルのGGUFビルドをAtomicChat/Qwen3.8-Flash-Next-GGUFとして公開しており、Atomic Chatでダウンロードして自分のマシン上で実行できるため、プロンプトとファイルはデバイス内に留まります。元のsafetensorsを自分でサービングしたい場合、QwenはvLLM、SGLang、TokenSpeed、KTransformersを挙げています。重み一式のサイズはBF16が360.0 GB、公式FP8リポジトリが185.5 GB、コミュニティのRadixArk NVFP4リポジトリが135.2 GBです。モデルカードの注記によると、Hugging Face Transformersでもこのリポジトリを読み込めます。

Qwenはアクセラレータ数や最小構成を示していないため、リリース情報で公開されているリポジトリごとのファイルサイズを目安にしてください。BF16版は131個のsafetensorsシャードで360.0 GB、公式FP8版は131個のシャードで185.5 GB、コミュニティ版NVFP4ビルドは206個のシャードで135.2 GBです。これらは重みだけのサイズなので、標準のコンテキスト長262,144トークンではKVキャッシュ用のメモリを追加で見込んでください。YaRNで1,000,000トークンに近づける場合は、さらに多くのメモリが必要です。またQwenは、パラメータ数のうち51Bを占めるn-gram埋め込みはMoEの重みよりもオフロードしやすいと説明し、メモリに制約のあるアクセラレータでパラメータ数を増やす方法として提示しています。そのため、すべての重みをアクセラレータのメモリに置く必要はありません。モデルカードでは、本番環境や高スループットが求められるワークロード向けに、SGLang、KTransformers、vLLMなどの専用サービングエンジンを推奨しています。

重みはオープンウェイトとして公開されており、Hugging Faceからダウンロードできますが、ライセンスはApache 2.0ではありません。リポジトリではlicense: other、license_nameはqwen-community-1.0と指定されており、実際の条件についてはリポジトリ内のLICENSEファイルを参照するよう案内されています。ここでは条件を再掲していないため、そのLICENSEファイルを自分で読み、商用利用を含め、ご自身の用途に照らして確認してください。自分でホストしたくない場合は、Qwen CloudがQwen3.8-Flashを提供しています。これはQwen3.8-Flash-Nextを基にした公式版で、デフォルトのコンテキスト長は1M、ツールも内蔵しています。

Qwen Sparse Attention、略してQSAは、ハイブリッド設計のうちアテンションを担う部分です。Gated DeltaNetとGated Attentionの組み合わせを、Gated DeltaNetとQSAの組み合わせに作り替えています。QSAは個々のトークンを選択する代わりにマイクロブロック単位で動作し、長いコンテキストでのレイテンシを削減します。このモデルのQSAは、ヘッド次元256、回転次元64で、24個のクエリヘッドと2個のKVヘッドを使います。MQAインデクサーはヘッド次元128で、4個のクエリヘッドと1個の共有キーヘッドを備え、処理対象の上限は512ブロック、または2048トークンです。QSAは48層の構成に組み込まれており、Gated DeltaNetとMoEを組み合わせたブロック3個の後に、QSAとMoEを組み合わせたブロック1個を置く構成を12回繰り返します。エキスパートは512個で、そのうちルーティングで選ばれる10個と共有の1個がアクティブになります。ほかに名前が挙げられている要素は、4つの分岐とボトルネックランク320を持つGated Residual、第2層で20,000,000件のバイグラムとトライグラムのエントリをインデックス化するn-gram埋め込み、1層のMTPヘッドです。