Qwen3-14B

更新
04.10.2026
ツール利用
思考
推論
コード生成
多言語

Qwen3-14Bは、Qwenチームが開発した14.8Bパラメータのデンスモデルです。切り替え可能な思考モードと、YaRNによる131Kのコンテキスト長を備えています。Q4_K_Mビルドのサイズは9.00 GBです。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 14.8B(埋め込みを除くと13.2B)
  • コンテキスト長: 標準で32,768トークン、YaRN使用時は131,072トークン
  • モダリティ: テキストの入力と出力
  • 最小ハードウェア要件: 9.00 GBのQ4_K_M GGUFビルドに必要なメモリ

Qwen3-14Bとは?

Qwen3-14Bは、AlibabaのQwenチームが開発した14.8Bパラメータのデンスモデルです。デンスモデルと混合エキスパートモデルを並行して提供するQwen3世代に属します。最大の特徴は、思考モードの切り替えです。同じチェックポイントで、難しい問題には段階的な推論を行い、通常のチャットには素早く直接回答します。この2つの動作はメッセージごとに切り替えられます。Hugging Faceでのリポジトリのダウンロード数は2,000,000回を超え、重みはApache 2.0で公開されています。

仕様Qwen3-14B
総パラメータ数14.8B(埋め込みを除くと13.2B)
アーキテクチャ因果言語モデル(デンスモデル)
層数40
アテンションGQA、クエリヘッド40個、KVヘッド8個
コンテキスト長標準で32,768トークン、YaRN使用時は131,072トークン
モダリティテキストの入力と出力
推論思考モードはデフォルトで有効、/thinkと/no_thinkでターンごとに切り替え可能
リリース日2025年4月
ライセンスApache 2.0

思考モードでは、最終回答の前にモデルの推論過程がthinkブロックに格納されます。チャットテンプレートで完全に無効化することも、メッセージの末尾に/thinkまたは/no_thinkを付けてターンごとに制御することもできます。モデルは会話内の最新の指示に従います。Qwenはモードごとに異なるサンプリング設定も推奨しています。思考モードが有効な場合はtemperature 0.6とtop-p 0.95、無効な場合はtemperature 0.7とtop-p 0.8です。また、無限に繰り返し続ける原因になり得るため、貪欲デコーディングは一切使わないよう推奨しています。

Qwen3-14Bが得意なこと

Qwenはモデルカード自体にベンチマーク表を掲載していないため、ここでは開発元の説明を紹介します。中心となる主張は推論能力です。思考モードのQwen3は、数学、コード生成、常識に基づく論理的推論で従来の推論モデルQwQを上回り、思考モードを無効にした場合も、同じ分野でQwen2.5の指示チューニング済みモデルを上回るとしています。チームは、人間の好みに合わせた応答も特徴として挙げています。具体的には、創作、ロールプレイ、複数ターンの対話、指示への追従です。

実用面では、開発元が挙げるほかの2つの特徴も重要です。Qwen3はエージェント用途を想定して設計されています。どちらのモードでも外部ツールを呼び出せます。モデルカードには、ツール呼び出し用のテンプレートとパーサーを処理するQwen-Agentフレームワークを通じて、MCPサーバーに接続する例が示されています。また、100以上の言語と方言に対応し、多言語での指示への追従と翻訳を強みとして挙げています。

Qwen3-14Bのハードウェア要件

システム要件で確認すべきなのはメモリです。QwenはQwen/Qwen3-14B-GGUFで公式のGGUFビルドを公開しています。実際のファイルサイズは次のとおりです。

メモリ選ぶビルドファイルサイズ
12 GBQ4_K_M9.00 GB
16 GBQ5_K_M10.51 GB
24 GBQ6_K12.12 GB
32 GB以上Q8_015.70 GB

隣り合うビルドのサイズ差は小さいため、両方ともメモリに収まるなら大きい方を選びます。コンテキストには、ファイルサイズに加えてメモリが必要です。標準のコンテキスト長は32,768トークンで、131,072トークンのモードにはYaRNによるropeスケーリングが必要です。llama.cppでは、サーバーフラグまたは再生成したGGUFで有効にします。この形式に初めて触れる場合は、まずGGUFとは何かをご覧ください。16 GBのMacではQ5_K_Mビルドを実行できます。16 GBのMacに最適なローカルLLMでは、同じクラスのハードウェアで動くほかのモデルも紹介しています。

Atomic ChatでQwen3-14Bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでQwen3-14Bを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを始めます。

同じファミリーのほかのモデルについては、ローカルで実行できるQwenモデルの一覧をご覧ください。同時にリリースされた姉妹モデルQwen3-30B-A3Bも含まれています。

Qwen3-14Bのライセンス

Qwen3-14BはApache 2.0で公開されています。このライセンスでは、ロイヤリティなしで商用利用、改変、再配布が認められています。そのため、このモデルを基にした製品を提供でき、自分のハードウェア上で利用料なしで実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download Qwen/Qwen3-14B
from transformers import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen3-14B")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Qwen3-14Bは、Qwen(AlibabaのAIチーム)が開発した14.8Bパラメータのデンスモデルで、2025年にリリースされたQwen3シリーズの言語モデルです。推論、数学、コード、ツール呼び出し、100を超える言語に対応し、難しい問題向けの思考モードと、通常のチャット向けの高速なモードを切り替えられます。Atomic Chatでは、自分のハードウェア上でローカルに実行できます。

Q4_K_Mの量子化ビルドは、コンテキスト長が8Kの場合、約10から11 GBのVRAMを必要とするため、RTX 4070のような12 GBのGPUで余裕を持って実行できます。Q8ビルドはフル精度に近い品質で約18 GBを使用し、量子化していないFP16では約35 GBが必要です。上限の128Kに向けてコンテキスト長を増やすとメモリ使用量も増えるため、KVキャッシュ用の余裕を確保してください。

はい。Qwen3-14BはApache-2.0ライセンスで公開されているため、ライセンス料なしで重みを無料でダウンロードして利用できます。元のライセンスと帰属表示を保持することを条件に、改変、再配布、商用利用も認められています。

はい。Atomic Chatで重みをダウンロードすれば、モデルは完全にデバイス上で動作し、インターネット接続は必要ありません。すべてのプロンプトはローカルで処理されるため、テキストはお使いのマシン内に留まり、外部サーバーには何も送信されません。

思考モードを使ったローカルでの推論や数学、コードの作成とデバッグ、外部ツールや関数を呼び出すエージェント型のタスクに適しています。100を超える言語に対応しているため、クラウドサービスを使わず、プライバシーを保った翻訳や指示への追従にも役立ちます。