Qwen3.8-27B

更新
05.10.2026
思考
ツール利用
画像認識
推論
コード生成
多言語

Qwen3.8-27Bは、コンテキスト長256Kのマルチモーダルな27.8Bデンスモデルです。4-bit量子化なら24 GBのGPUに収まります。Atomic Chatでローカル実行できます。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ: 27.8Bのデンスモデル、64層、ハイブリッドアテンション
  • コンテキスト長: 262,144トークン
  • モダリティ: テキスト、画像、動画の入力
  • 最小ハードウェア要件: AD-IQ2_Sでは12 GBのVRAM、AD-Q4_K_Mでは24 GB

Qwen3.8-27Bとは?

Qwen3.8-27Bは、AlibabaのQwenチームが開発したマルチモーダルな27.8Bデンスモデルで、Qwen 3.8としてリリースされた3モデルの中で最小です。また、24 GBのGPUを搭載したデスクトップや、32 GBのユニファイドメモリを搭載したMacBookなど、一般的なマシンで動くのも、この3モデルの中では唯一です。Alibabaは2026年8月14日に、Apache 2.0のもとで重みを公開しました。

仕様Qwen3.8-27B
総パラメータ数27.8B
アーキテクチャデンスモデル、ハイブリッドアテンション(Gated DeltaNet + Gated Attention)
層数64
コンテキスト長262,144トークン
モダリティテキスト、画像、動画の入力
推論思考モードはデフォルトで有効、推論強度を選択可能、無効化も可能
マルチトークン予測対応、チェックポイントに予測ヘッドを同梱
リリース日2026年8月14日
ライセンスApache 2.0

64層のうち48層はGated DeltaNetを使用しています。これは、会話がどれだけ長くなってもメモリ使用量が変わらないアテンションの一種です。通常のKVキャッシュを保持するのは、残りの16層だけです。KVキャッシュは通常、トークンが増えるたびに大きくなる部分です。そのため、長いチャットや大きな文書でも、一般的な27Bモデルよりはるかに少ないメモリで処理できます。また、このモデルはマルチトークン予測の学習も行っているため、1回の順伝播で複数の候補トークンを生成できます。これは、投機的デコーディングを支えるのと同じ仕組みです。

Qwen3.8-27Bのベンチマーク

モデルカードに掲載されたAlibabaのリリース時の数値では、27Bを前世代のQwen3.6-27B、Qwen3.7-Plus、Muse Glimmer 30B、Claude Opus 4.6 Maxと比較しています。

ベンチマークQwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer 30BClaude Opus 4.6 Max
Terminal Bench 2.1
ターミナル操作エージェント
73.063.464.051.778.2
SWE-bench Pro
高難度のソフトウェア開発
61.753.557.651.253.4
LiveCodeBench v6
競技プログラミング
90.383.989.6-88.8
GPQA Diamond
専門的な科学知識
89.287.890.383.591.3
Humanity's Last Exam
専門分野の問題
30.824.034.722.040.0
OSWorld-Verified
コンピューター操作
84.363.973.365.972.7
SWE-MM
マルチモーダルなソフトウェア開発
38.625.730.0-27.1

27Bは、7つのベンチマークのうち4つでClaude Opus 4.6 Maxを上回っています。Opusに匹敵するモデルが、今や24 GBのGPUカード1枚で動きます。

Qwen3.8-27Bのハードウェア要件

システム要件で確認すべきなのはメモリ容量です。私たちは元の重みからモデルを量子化し、そのビルドをAtomicChat/Qwen3.8-27B-GGUFとして公開しました。

メモリ選ぶビルドファイルサイズ
12 GBAD-IQ2_S11.1 GB
16 GBAD-IQ3_S13.8 GB
24 GBAD-Q4_K_M17.1 GB
32 GBAD-Q5_K_M20.2 GB
48 GB以上AD-Q6_K25.0 GB

隣り合うファイルのサイズ差は1〜2 GB程度なので、2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。特に14 GB未満では品質の低下が最も急なため、この選択が重要です。GGUF形式に馴染みがなければ、まずGGUFとは何かをお読みください。ほかにどのモデルがメモリに収まるかは、16 GBのMacに最適なローカルLLMをご覧ください。

Atomic ChatでQwen3.8-27Bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザーでQwen3.8-27Bを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

量子化ビルドの一覧表とllama.cppのコマンドを含む詳しい手順は、私たちのQwen 3.8 27Bをローカルで実行するためのガイドをご覧ください。

ほかのラインアップについては、ローカルで実行できるQwenモデルの全一覧、または兆単位のパラメータ数を持つ同系列モデルQwen3.8-2.4T-A95Bをご覧ください。

Qwen3.8-27Bのライセンス

Qwen3.8-27BはApache 2.0のもとで公開されています。商用利用、改変、再配布がロイヤリティなしで認められているため、このモデルを使った製品を開発し、自分のハードウェア上で使用料なしで実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download Qwen/Qwen3.8-27B
# 4-bit GGUF build from our own quant run:
huggingface-cli download AtomicChat/Qwen3.8-27B-GGUF Qwen3.8-27B-AD-Q4_K_M.gguf
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen3.8-27B",
    "messages": [{"role": "user", "content": "Refactor this function and explain the change."}],
    "temperature": 0.6,
    "top_p": 0.95
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "Qwen/Qwen3.8-27B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto")

messages = [{"role": "user", "content": "Summarise this repository layout."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
print(tokenizer.decode(model.generate(**inputs, max_new_tokens=1024)[0]))
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "Qwen3.8-27B",
  messages: [{ role: "user", content: "Write a Python function that parses a GGUF header." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen3.8-27Bは、AlibabaのQwenチームが開発し、2026年8月14日にリリースした、パラメータ数27.8Bのマルチモーダルなデンスモデルです。テキスト、画像、動画を読み取り、262,144トークンのコンテキスト長を備え、Apache 2.0のもとで公開されているため、APIキーなしでAtomic Chat上でローカル実行できます。

私たちのAD-Q4_K_Mビルドは17.1 GBなので、RTX 4090などの24 GBのGPUカードなら余裕を持って実行できます。16 GBでは13.8 GBのAD-IQ3_Sが収まり、12 GBのマシンでも11.1 GBのAD-IQ2_Sを実行できます。Macでも、ほぼ同じ容量のユニファイドメモリが必要です。

はい。重みはApache 2.0のもとで公開されており、ロイヤリティや使用料なしで商用利用できます。一度ダウンロードすれば、自分のハードウェア上で実行できます。

はい。重みをディスクに保存すれば、モデルは完全に自分のマシン上で動作します。Atomic Chatではプロンプト、コード、ファイルがデバイスの外に出ることは一切ないため、機密性が求められる作業や、外部ネットワークから隔離された環境での作業に適しています。

Qwen 3.8 Maxは、パラメータ数2.4TのMoEフラッグシップモデルです。Alibaba Cloud APIを通じて提供され、Qwen3.8-2.4T-A95Bとしてダウンロードもできます。実行にはデータセンターのクラスターが必要です。27Bは、同時にリリースされたデンスモデルの視覚言語モデルで、一般消費者向けGPU1枚で動く唯一のモデルです。