Qwen3-32Bとは?
Qwen3-32Bは、AlibabaのQwenチームが開発した、パラメータ数32.8Bの言語モデルです。重みが公開されているQwen3世代のモデルの1つです。最大の特徴は、切り替え可能な思考モードです。同じチェックポイントで、数学、コード、論理の問題を深く検討したいときは回答前に段階的に推論し、日常的なチャットではすぐに回答します。Alibabaは2025年4月にApache 2.0で重みを公開しました。公式のQ4_K_Mビルドは、24 GBのGPU 1枚に収まります。
| 仕様 | Qwen3-32B |
|---|---|
| 総パラメータ数 | 32.8B(埋め込みを除くと31.2B) |
| 種類 | 事前学習と事後学習を実施した因果言語モデル |
| 層数 | 64 |
| アテンション | GQA、クエリ用64ヘッド、KV用8ヘッド |
| コンテキスト長 | 標準で32,768トークン、YaRN使用時は131,072トークン |
| 思考モード | セッション単位およびターン単位で切り替え可能 |
| 言語 | 100以上の言語と方言 |
| 公開時期 | 2025年4月 |
| ライセンス | Apache 2.0 |
思考モードは2つのレベルで切り替えられます。チャットテンプレートでは、enable_thinkingフラグでセッション全体の推論を有効または無効にします。さらに、任意のメッセージの末尾に/thinkまたは/no_thinkを付けると、そのターンのモードを切り替えられます。複数ターンの会話では、モデルは直近の指示に従います。Qwenはモードごとに異なるサンプリング設定を推奨しています。思考モードではtemperatureを0.6、top-pを0.95に設定し、非思考モードではtemperatureを0.7、top-pを0.8に設定します。また、際限のない繰り返しを引き起こす可能性があるため、貪欲デコーディングを避けるよう注意しています。標準のコンテキスト長は32,768トークンです。QwenはYaRNによる拡張で最大131,072トークンまで検証していますが、静的なYaRNは短いテキストで品質を低下させる可能性があるため、実際に長い入力を処理するときだけ有効にするよう勧めています。
Qwen3-32Bが得意なこと
Qwen自身のモデルカードでは、この世代について4つの主張を掲げています。推論:数学、コード生成、常識に基づく論理的推論において、思考モードでは以前のQwQを、非思考モードではQwen2.5-Instructモデルを上回るとしています。アラインメント:創作、ロールプレイ、複数ターンの対話、指示への追従で、人間の好みにより合った応答を生成するとしています。エージェント:両モードで正確なツール呼び出しが可能で、複雑なエージェントタスクでは、Qwenがオープンソースモデルの中でトップクラスとする性能を発揮するとしています。モデルカードではQwen-Agentフレームワークを推奨しています。このフレームワークにはツール呼び出し用のテンプレートとパーサーが付属し、MCP設定ファイルからツール定義を直接読み込みます。言語:100以上の言語と方言に対応し、多言語での指示への追従と翻訳を、明確な学習目標として挙げています。
モデルカードには、実用上の注意点が2つあります。複数ターンの会話では、履歴に思考内容を含めず、最終回答だけを残す必要があります。公式チャットテンプレートは、すでにこの処理に対応しています。また、難しい数学やコーディングの問題では、モデルに十分な思考の余地を与えることをQwenは勧めています。出力に使えるトークン数は、ほとんどの質問で32,768トークン、最も難しい質問では最大38,912トークンとしています。
Qwen3-32Bのハードウェア要件
システム要件で確認すべきなのはメモリです。Qwenは公式GGUFビルドをQwen/Qwen3-32B-GGUFで公開しています。実際のファイルサイズは次のとおりです。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 24 GB | Q4_K_M | 19.76 GB |
| 32 GB | Q5_K_M | 23.21 GB |
| 48 GB | Q6_K | 26.88 GB |
| 64 GB以上 | Q8_0 | 34.82 GB |
2つのビルドがどちらもメモリに収まる場合は、大きい方を選び、コンテキスト用にファイルサイズに加えて数GBの余裕を確保してください。公式リポジトリの最小ビルドはQ4_K_Mなので、ここでは24 GBが実用上の下限です。メモリがそれより少ない場合は、同じシリーズの小型モデルQwen3-14Bを検討してください。GGUF形式を初めて扱う場合は、まずGGUFとは何かをご覧ください。
Atomic ChatでQwen3-32Bを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでQwen3-32Bを検索し、Download Optionsを開きます。
- お使いのメモリ容量に収まるビルドを選び、チャットを開始します。
ほかのラインアップについては、同じシリーズのより軽量なQwen3-30B-A3Bを含む、ローカルで実行できるQwenモデルの一覧をご覧ください。
Qwen3-32Bのライセンス
Qwen3-32BはApache 2.0で公開されています。このライセンスではロイヤリティなしで商用利用、改変、再配布が認められているため、モデルをファインチューニングし、製品に組み込んで提供し、自分のハードウェアで利用料なしに実行できます。
