Qwen3.8-2.4T-A95Bとは?
Qwen3.8-2.4T-A95Bは、AlibabaのQwen 3.8シリーズのフラッグシップであるQwen 3.8 Maxのダウンロード可能なバージョンです。Alibabaは2026年8月3日にMaxを発表し、8月12日にこの重みを公開しました。スパースな混合エキスパートモデルで、総パラメータ数は2.4T、そのうちトークンごとに95Bがアクティブになります。
| 仕様 | Qwen3.8-2.4T-A95B |
|---|---|
| 総パラメータ数 | 2.4T |
| アクティブパラメータ数 | トークンごとに95B、512個のエキスパートのうち10個 |
| アーキテクチャ | スパースMoE、ハイブリッドアテンション(Gated DeltaNet + Gated Attention) |
| 層数 | 92 |
| コンテキスト長 | 262,144トークン |
| モダリティ | テキスト入力、テキスト出力 |
| 推論 | すべてのリクエストで推論を行います |
| リリース日 | 2026年8月12日 |
| ライセンス | Qwen3.8-Maxライセンス |
この規模のモデルをサービングできるのは、スパースルーティングによるものです。トークンごとに動作するのは512個のエキスパートのうち10個だけなので、トークンあたりの計算量は95Bモデルに近い水準にとどまります。ただし、重みはすべてメモリに保持する必要があります。このメモリ要件のため、このモデルに適しているのはワークステーションではなく、マルチGPUノードです。自宅で実行するなら、同じシリーズのデンスモデルQwen3.8-27Bが適しています。
Qwen3.8-2.4T-A95Bのベンチマーク
Alibabaがこのリポジトリで公開している数値は、この重みのサービス提供版であるQwen 3.8 Maxで測定されたスコアです。前世代モデルと、最先端のAPIモデル3種との比較を示しています。
| ベンチマーク | Qwen3.8-Max | Qwen3.7-Max | Claude Opus 4.8 | Fable 5 | GPT 5.6 Sol (max) |
|---|---|---|---|---|---|
Terminal Bench 2.1 ターミナル操作エージェント | 86.6 | 74.5 | 84.6 | 84.6 | 88.8 |
SWE-bench Pro より難度の高いソフトウェア開発 | 67.7 | 60.6 | 69.2 | 80.0 | 64.6 |
DeepSWE 1.1 エージェントによるコーディング | 56.6 | 21.6 | 59.0 | 70.0 | 73.0 |
GPQA Diamond 専門レベルの科学 | 92.6 | 92.4 | 92.0 | 92.6 | 94.1 |
Humanity's Last Exam 専門的な設問 | 43.6 | 41.4 | 45.7 | 53.3 | 47.2 |
Toolathlon Verified 長期タスクでのツール利用 | 72.5 | 49.7 | 76.2 | 77.9 | 74.9 |
WideSearch 広範な調査 | 81.9 | 75.2 | 72.9 | 81.2 | - |
IFBench 指示への追従 | 82.8 | 79.1 | 62.2 | 63.5 | 72.7 |
Maxは、ここに示したすべての項目で前世代モデルを上回り、指示への追従と広範なウェブ調査では単独首位です。エージェントによるコーディングではFable 5とGPT 5.6 Solに後れを取っています。この差はAlibabaがリリースごとに縮めているもので、すでに解消したと主張しているわけではありません。
Qwen3.8-2.4T-A95Bのハードウェア要件
システム要件で確認すべきなのはメモリ容量で、この規模では数百ギガバイト単位になります。この重みを実行できる一般消費者向けの構成はありません。このモデル向けに公開されている最小のGGUFビルドでも397 GBあります。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 400 GB | UD-Q1_0 | 397 GB |
| 512 GB | UD-IQ1_S | 508 GB |
| 768 GB | UD-IQ2_XS | 731 GB |
| 1 TB以上 | UD-IQ3_XXS | 956 GB |
必要なハードウェアはKimi K3と同じクラスです。レンタルのマルチGPUノードか、非常に大容量のユニファイドメモリを搭載したマシンを使い、vLLMまたはSGLangでサービングします。自分のマシンでQwen 3.8を使いたい場合は、代わりに27Bを実行してください。
Atomic ChatでQwen 3.8を実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでQwen3.8を検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
量子化の一覧表とllama.cppのコマンドを含む詳しい手順は、Qwen 3.8をローカルで実行するガイドに掲載しています。
Atomic Chatは、お使いのマシンに収まるモデルをダウンロードして実行します。多くの方にとっては27Bが該当します。ローカルで実行できるQwenモデルの全ラインアップもご覧ください。
Qwen3.8-2.4T-A95Bのライセンス
この重みは、ほかのQwenシリーズで採用されているApache 2.0ではなく、Alibaba独自のQwen3.8-Maxライセンスで提供されています。利用条件は標準的なオープンソースライセンスではなくAlibabaが定めているため、商用環境に導入する前に、必ずモデルリポジトリ内のライセンスファイルを読んでください。
