Qwen3-8B

更新
05.10.2026
思考
ツール利用
推論
コード生成
多言語

AlibabaのQwen3シリーズに属する8.2Bのデンスモデルです。思考モードの切り替えに対応し、高い推論能力とコーディング能力を備え、100以上の言語をサポートします。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 8.2B(埋め込みを除くと6.95B)
  • コンテキスト長: 標準で32,768、YaRN使用時は131,072
  • モダリティ: テキストの入力と出力
  • 最小ハードウェア要件: メモリ8 GB(Q4_K_M、5.03 GB)

Qwen3-8Bとは?

Qwen3-8Bは、AlibabaのQwenチームが開発したパラメータ数8.2Bの因果言語モデルで、Qwen3世代の一部として2025年4月に公開されました。最大の特徴は、回答前に段階的に推論する思考モードと、高速な一般対話向けの非思考モードを、単一のモデル内で切り替えられることです。Q4_K_Mビルドは5.03 GBなので、メモリ8 GBのマシンに収まります。

仕様Qwen3-8B
総パラメータ数8.2B(埋め込みを除くと6.95B)
層数36
アテンションGQA、クエリ用32ヘッド、KV用8ヘッド
コンテキスト長標準で32,768トークン、YaRN使用時は131,072トークン
モダリティテキストの入力と出力
推論思考モードはデフォルトで有効、ターンごとに切り替え可能
言語100以上の言語と方言
公開日2025年4月
ライセンスApache 2.0

思考モードはデフォルトで有効になっており、最終回答の前に推論内容をthinkブロックで囲みます。ハードスイッチで完全に無効化することも、プロンプトに/thinkまたは/no_thinkを追加してターンごとに切り替えることもできます。モデルは会話内の最新の指示に従います。Qwenはモードごとに異なるサンプリング設定を推奨しており、思考モードではtemperature 0.6とtop-p 0.95、非思考モードではtemperature 0.7とtop-p 0.8を使用します。また、際限のない繰り返しを引き起こす可能性があるため、貪欲デコーディングを避けるよう警告しています。Top-k 20とmin-p 0は両方のモードに適用され、Qwenはほとんどのクエリで出力長を32,768トークンにすることを推奨しています。

Qwen3-8Bが得意なこと

Qwenはモデルカード自体にはベンチマーク表を掲載していませんが、具体的な性能を主張しています。開発チームの報告によると、Qwen3-8Bは思考モードで数学、コード生成、常識に基づく論理的推論において以前のQwQを上回り、非思考モードでは同じタスクでQwen2.5の指示チューニング済みモデル群を上回ります。ツール呼び出しも重点分野として明示されています。モデルカードではQwen-Agentフレームワークを推奨しており、MCP設定ファイルでツールを定義できます。また、Qwenは複雑なエージェントタスクにおけるこのモデルの性能を、オープンソースモデルの中でトップクラスと説明しています。

このモデルは100を超える言語と方言をサポートし、多言語での指示追従と翻訳に対応しています。事後学習では、創作、ロールプレイ、複数ターンの対話も対象としています。標準のコンテキスト長は32,768トークンです。QwenはYaRNによる拡張で最大131,072トークンまで検証していますが、静的なYaRNは短いテキストで品質を低下させる可能性があるため、実際に長い入力が必要な場合にのみ有効にするよう勧めています。メモリに余裕があれば、同じファミリーで次に大きいモデルはQwen3-14Bです。

Qwen3-8Bのハードウェア要件

システム要件で確認すべきなのはメモリです。Qwenは独自の公式GGUFビルドをQwen/Qwen3-8B-GGUFとして公開しており、以下のファイルサイズはそのリポジトリにある実際のサイズです。

メモリ選ぶビルドファイルサイズ
8 GBQ4_K_M5.03 GB
12 GBQ6_K6.73 GB
16 GB以上Q8_08.71 GB

Q5_0(5.72 GB)とQ5_K_M(5.85 GB)はその中間に位置するため、両方のビルドがメモリに収まる場合は、大きい方を選んでください。GGUF形式に馴染みがなければ、まずGGUFとは何かをお読みください。同じメモリ容量で動かせるほかのモデルについては、メモリ16 GBのMacに最適なローカルLLMをご覧ください。

Atomic ChatでQwen3-8Bを動かす方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでQwen3-8Bを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

同じファミリーのほかのモデルについては、ローカルで動かせるQwenモデルの一覧をご覧ください。

Qwen3-8Bのライセンス

Qwen3-8BはApache 2.0で公開されており、リポジトリにライセンスファイルが含まれています。このライセンスではロイヤリティなしで商用利用、改変、再配布が認められているため、モデルを基にした製品を提供し、自分のハードウェアで使用料なしで動かせます。

Hugging Faceからモデルをダウンロード

pip install -U "transformers>=4.51.0"
huggingface-cli download Qwen/Qwen3-8B
# またはOllamaを使用:
ollama run qwen3:8b
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3-8B",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen3-8B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")
messages = [{"role": "user", "content": "Give me a short intro to LLMs."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True, enable_thinking=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=2048)
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "sk-local" });
const res = await client.chat.completions.create({
  model: "Qwen/Qwen3-8B",
  messages: [{ role: "user", content: "Hello!" }]
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen3-8Bは、AlibabaのQwenチームが開発したパラメータ数8.2Bのデンスモデルで、Qwen3世代の一部として公開された言語モデルです。チャット、推論、エージェントとしてのツール使用に向けて事後学習を行った因果言語モデルです。特徴の1つはデュアルモード設計で、同じチェックポイント内で、数学、コーディング、論理向けの思考モードと、高速な一般対話向けの非思考モードを切り替えられます。

4-bit量子化(Q4_K_M)ではモデルの重みが約5 GBを占めるため、VRAMが8 GBのGPUであれば、標準的なコンテキスト長で快適に動かせます。Q8には約9 GBが必要です。CPUのみの推論は、システムRAMが16 GBあればQ4_K_Mで動作しますが、スループットは毎秒数トークンに低下します。YaRNでコンテキスト長を128K近くまで拡張すると、これらの数値に加えて、KVキャッシュ用に数GBのメモリが必要になります。

Qwen3-8Bの標準のコンテキスト長は32,768トークンです。YaRNのropeスケーリングを使用すると、長文書や長いコンテキストを扱うタスク向けに131,072トークン(128K)まで拡張できます。Qwenチームは、32K未満の入力では品質がわずかに低下する可能性があり、KVキャッシュのメモリ使用量も増えるため、実際に長いコンテキストが必要な場合にのみYaRNを有効にすることを推奨しています。

はい。Qwen3-8BはApache 2.0ライセンスで公開されており、ロイヤリティを支払うことなく、無料での利用、改変、再配布、商用導入が認められています。重みはHugging Faceで一般公開されているため、モデルをダウンロードして自分のハードウェアで動かせます。Apache 2.0では、再配布時にライセンスと著作権表示を保持する必要があります。

Qwen3-8Bは100を超える言語と方言をサポートし、多言語での高い指示追従能力と翻訳能力を備えています。ヨーロッパ、アジア、中東の主要言語を幅広くカバーしており、英語と中国語にとどまらず、さまざまな言語間のチャットや翻訳タスクに使用できます。