Qwen3.8-2.4T-A95B

更新
05.10.2026
思考
ツール利用
推論
コード生成
多言語
ウェブ検索

Qwen3.8-2.4T-A95Bは、Qwen 3.8 Maxのダウンロード可能なバージョンです。総パラメータ数2.4T、アクティブパラメータ数95BのMoEで、コンテキスト長は256Kです。

基本情報

  • ライセンス: Qwen3.8-Maxライセンス
  • パラメータ数: 合計2.4T、トークンごとに95Bがアクティブ
  • コンテキスト長: 262,144トークン
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: 1-bit量子化で約400 GBのメモリ、実用上はマルチGPUノード

Qwen3.8-2.4T-A95Bとは?

Qwen3.8-2.4T-A95Bは、AlibabaのQwen 3.8シリーズのフラッグシップであるQwen 3.8 Maxのダウンロード可能なバージョンです。Alibabaは2026年8月3日にMaxを発表し、8月12日にこの重みを公開しました。スパースな混合エキスパートモデルで、総パラメータ数は2.4T、そのうちトークンごとに95Bがアクティブになります。

仕様Qwen3.8-2.4T-A95B
総パラメータ数2.4T
アクティブパラメータ数トークンごとに95B、512個のエキスパートのうち10個
アーキテクチャスパースMoE、ハイブリッドアテンション(Gated DeltaNet + Gated Attention)
層数92
コンテキスト長262,144トークン
モダリティテキスト入力、テキスト出力
推論すべてのリクエストで推論を行います
リリース日2026年8月12日
ライセンスQwen3.8-Maxライセンス

この規模のモデルをサービングできるのは、スパースルーティングによるものです。トークンごとに動作するのは512個のエキスパートのうち10個だけなので、トークンあたりの計算量は95Bモデルに近い水準にとどまります。ただし、重みはすべてメモリに保持する必要があります。このメモリ要件のため、このモデルに適しているのはワークステーションではなく、マルチGPUノードです。自宅で実行するなら、同じシリーズのデンスモデルQwen3.8-27Bが適しています。

Qwen3.8-2.4T-A95Bのベンチマーク

Alibabaがこのリポジトリで公開している数値は、この重みのサービス提供版であるQwen 3.8 Maxで測定されたスコアです。前世代モデルと、最先端のAPIモデル3種との比較を示しています。

ベンチマークQwen3.8-MaxQwen3.7-MaxClaude Opus 4.8Fable 5GPT 5.6 Sol (max)
Terminal Bench 2.1
ターミナル操作エージェント
86.674.584.684.688.8
SWE-bench Pro
より難度の高いソフトウェア開発
67.760.669.280.064.6
DeepSWE 1.1
エージェントによるコーディング
56.621.659.070.073.0
GPQA Diamond
専門レベルの科学
92.692.492.092.694.1
Humanity's Last Exam
専門的な設問
43.641.445.753.347.2
Toolathlon Verified
長期タスクでのツール利用
72.549.776.277.974.9
WideSearch
広範な調査
81.975.272.981.2-
IFBench
指示への追従
82.879.162.263.572.7

Maxは、ここに示したすべての項目で前世代モデルを上回り、指示への追従と広範なウェブ調査では単独首位です。エージェントによるコーディングではFable 5とGPT 5.6 Solに後れを取っています。この差はAlibabaがリリースごとに縮めているもので、すでに解消したと主張しているわけではありません。

Qwen3.8-2.4T-A95Bのハードウェア要件

システム要件で確認すべきなのはメモリ容量で、この規模では数百ギガバイト単位になります。この重みを実行できる一般消費者向けの構成はありません。このモデル向けに公開されている最小のGGUFビルドでも397 GBあります。

メモリ選ぶビルドファイルサイズ
400 GBUD-Q1_0397 GB
512 GBUD-IQ1_S508 GB
768 GBUD-IQ2_XS731 GB
1 TB以上UD-IQ3_XXS956 GB

必要なハードウェアはKimi K3と同じクラスです。レンタルのマルチGPUノードか、非常に大容量のユニファイドメモリを搭載したマシンを使い、vLLMまたはSGLangでサービングします。自分のマシンでQwen 3.8を使いたい場合は、代わりに27Bを実行してください。

Atomic ChatでQwen 3.8を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでQwen3.8を検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

量子化の一覧表とllama.cppのコマンドを含む詳しい手順は、Qwen 3.8をローカルで実行するガイドに掲載しています。

Atomic Chatは、お使いのマシンに収まるモデルをダウンロードして実行します。多くの方にとっては27Bが該当します。ローカルで実行できるQwenモデルの全ラインアップもご覧ください。

Qwen3.8-2.4T-A95Bのライセンス

この重みは、ほかのQwenシリーズで採用されているApache 2.0ではなく、Alibaba独自のQwen3.8-Maxライセンスで提供されています。利用条件は標準的なオープンソースライセンスではなくAlibabaが定めているため、商用環境に導入する前に、必ずモデルリポジトリ内のライセンスファイルを読んでください。

Hugging Faceからモデルをダウンロード

huggingface-cli download Qwen/Qwen3.8-2.4T-A95B
# 1-bit GGUF, still 397 GB on disk:
huggingface-cli download unsloth/Qwen3.8-2.4T-A95B-GGUF --include "UD-Q1_0/*"
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen3.8-2.4T-A95B",
    "messages": [{"role": "user", "content": "Plan a migration from Postgres 14 to 17."}]
  }'
# 2.4T weights need a multi-GPU node; serve them with vLLM rather than plain transformers.
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")
res = client.chat.completions.create(
    model="Qwen3.8-2.4T-A95B",
    messages=[{"role": "user", "content": "Explain MoE routing to a backend engineer."}],
)
print(res.choices[0].message.content)
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "Qwen3.8-2.4T-A95B",
  messages: [{ role: "user", content: "Draft a release checklist for a Rust CLI." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

AlibabaのQwen 3.8シリーズのフラッグシップモデルであるQwen 3.8 Maxの重み公開版です。アーキテクチャはスパースな混合エキスパートモデルで、総パラメータ数は2.4T、トークンごとに95Bがアクティブになります。コンテキスト長は262,144トークンです。

いいえ。公開されている最小のGGUFビルドが397 GBあるため、マルチGPUサーバーか、非常に大容量のユニファイドメモリを搭載したマシンが必要です。デスクトップやノートPCでローカル実行する場合は、同じシリーズのQwen3.8-27Bを使ってください。

Qwen 3.8 Maxは、Alibaba Cloud API経由で提供されているモデルです。Qwen3.8-2.4T-A95Bは、同じモデルをダウンロード可能な重みとして公開したものです。そのため、リポジトリに掲載されているベンチマークの数値はMaxで測定されています。

重みは無料でダウンロードできますが、ライセンスはApache 2.0ではありません。AlibabaのQwen3.8-Maxライセンスで提供されているため、商用環境に導入する前に、ライセンスファイルで許可されている利用方法を確認してください。

設定では、ネイティブのコンテキスト長が262,144トークンに設定されています。この規模のモデルでその長さのコンテキストを保持するには、重みに加えて大容量のKVキャッシュが必要になるため、両方を見込んでメモリ容量を計画してください。