Qwen3-32B

更新
05.10.2026
ツール利用
思考
推論
コード生成
多言語

Qwen3-32Bは、AlibabaのQwenチームが開発した、パラメータ数32.8BのApache 2.0モデルです。思考モードを切り替えられ、100以上の言語に対応しています。Q4_K_Mは24 GBのGPUに収まります。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 32.8B(埋め込みを除くと31.2B)
  • コンテキスト長: 標準で32,768、YaRN使用時は131,072
  • モダリティ: テキスト入力、テキスト出力
  • 最低ハードウェア要件: メモリ24 GB(Q4_K_M、19.76 GB)

Qwen3-32Bとは?

Qwen3-32Bは、AlibabaのQwenチームが開発した、パラメータ数32.8Bの言語モデルです。重みが公開されているQwen3世代のモデルの1つです。最大の特徴は、切り替え可能な思考モードです。同じチェックポイントで、数学、コード、論理の問題を深く検討したいときは回答前に段階的に推論し、日常的なチャットではすぐに回答します。Alibabaは2025年4月にApache 2.0で重みを公開しました。公式のQ4_K_Mビルドは、24 GBのGPU 1枚に収まります。

仕様Qwen3-32B
総パラメータ数32.8B(埋め込みを除くと31.2B)
種類事前学習と事後学習を実施した因果言語モデル
層数64
アテンションGQA、クエリ用64ヘッド、KV用8ヘッド
コンテキスト長標準で32,768トークン、YaRN使用時は131,072トークン
思考モードセッション単位およびターン単位で切り替え可能
言語100以上の言語と方言
公開時期2025年4月
ライセンスApache 2.0

思考モードは2つのレベルで切り替えられます。チャットテンプレートでは、enable_thinkingフラグでセッション全体の推論を有効または無効にします。さらに、任意のメッセージの末尾に/thinkまたは/no_thinkを付けると、そのターンのモードを切り替えられます。複数ターンの会話では、モデルは直近の指示に従います。Qwenはモードごとに異なるサンプリング設定を推奨しています。思考モードではtemperatureを0.6、top-pを0.95に設定し、非思考モードではtemperatureを0.7、top-pを0.8に設定します。また、際限のない繰り返しを引き起こす可能性があるため、貪欲デコーディングを避けるよう注意しています。標準のコンテキスト長は32,768トークンです。QwenはYaRNによる拡張で最大131,072トークンまで検証していますが、静的なYaRNは短いテキストで品質を低下させる可能性があるため、実際に長い入力を処理するときだけ有効にするよう勧めています。

Qwen3-32Bが得意なこと

Qwen自身のモデルカードでは、この世代について4つの主張を掲げています。推論:数学、コード生成、常識に基づく論理的推論において、思考モードでは以前のQwQを、非思考モードではQwen2.5-Instructモデルを上回るとしています。アラインメント:創作、ロールプレイ、複数ターンの対話、指示への追従で、人間の好みにより合った応答を生成するとしています。エージェント:両モードで正確なツール呼び出しが可能で、複雑なエージェントタスクでは、Qwenがオープンソースモデルの中でトップクラスとする性能を発揮するとしています。モデルカードではQwen-Agentフレームワークを推奨しています。このフレームワークにはツール呼び出し用のテンプレートとパーサーが付属し、MCP設定ファイルからツール定義を直接読み込みます。言語:100以上の言語と方言に対応し、多言語での指示への追従と翻訳を、明確な学習目標として挙げています。

モデルカードには、実用上の注意点が2つあります。複数ターンの会話では、履歴に思考内容を含めず、最終回答だけを残す必要があります。公式チャットテンプレートは、すでにこの処理に対応しています。また、難しい数学やコーディングの問題では、モデルに十分な思考の余地を与えることをQwenは勧めています。出力に使えるトークン数は、ほとんどの質問で32,768トークン、最も難しい質問では最大38,912トークンとしています。

Qwen3-32Bのハードウェア要件

システム要件で確認すべきなのはメモリです。Qwenは公式GGUFビルドをQwen/Qwen3-32B-GGUFで公開しています。実際のファイルサイズは次のとおりです。

メモリ選ぶビルドファイルサイズ
24 GBQ4_K_M19.76 GB
32 GBQ5_K_M23.21 GB
48 GBQ6_K26.88 GB
64 GB以上Q8_034.82 GB

2つのビルドがどちらもメモリに収まる場合は、大きい方を選び、コンテキスト用にファイルサイズに加えて数GBの余裕を確保してください。公式リポジトリの最小ビルドはQ4_K_Mなので、ここでは24 GBが実用上の下限です。メモリがそれより少ない場合は、同じシリーズの小型モデルQwen3-14Bを検討してください。GGUF形式を初めて扱う場合は、まずGGUFとは何かをご覧ください。

Atomic ChatでQwen3-32Bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでQwen3-32Bを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

ほかのラインアップについては、同じシリーズのより軽量なQwen3-30B-A3Bを含む、ローカルで実行できるQwenモデルの一覧をご覧ください。

Qwen3-32Bのライセンス

Qwen3-32BはApache 2.0で公開されています。このライセンスではロイヤリティなしで商用利用、改変、再配布が認められているため、モデルをファインチューニングし、製品に組み込んで提供し、自分のハードウェアで利用料なしに実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download Qwen/Qwen3-32B
from transformers import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen3-32B")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen3-32Bは、Alibaba Cloudのモデル開発チームであるQwenが開発した、パラメータ数32.8Bの大規模言語モデル(デンスモデル)です。128Kのコンテキスト長とハイブリッド思考モードに対応しており、難しい問題では明示的に推論を行い、通常のチャットでは直接回答します。重みはApache 2.0で公開されているため、自分でダウンロードして実行できます。

4ビットに量子化したビルド(Q4_K_M)に必要なVRAMはおよそ16-19GBなので、RTX 3090やRTX 4090のような24GBのGPUに収まります。8ビットのビルドには約32GB、FP16のフル精度では約65GBが必要です。128Kのコンテキスト長をすべて使うと、重みの分に加えてメモリが必要になるため、24GBのGPUではコンテキスト長を制限する必要がある場合があります。

はい。モデルの重みはApache 2.0ライセンスで公開されており、無料でダウンロードして利用できます。ライセンスと帰属表示を保持すれば、商用利用、改変、再配布も認められています。

はい。重みのダウンロードが完了すれば、Qwen3-32Bはインターネット接続なしで、すべての処理を自分のハードウェア上で実行できます。Atomic Chatでは、すべてのプロンプトと応答がデバイス内に留まり、外部サーバーには何も送信されません。

最終回答の前に思考過程を生成する思考モードにより、推論と数学を得意としています。コード生成やデバッグもこなし、エージェントのワークフロー向けにツール呼び出しと関数呼び出しをサポートし、100以上の言語に対応しています。128Kのコンテキスト長により、長い文書や大規模なコードベースを一度に入力できます。