ブログ

/

ガイド

/

Qwen 3.8 27Bをローカルで実行する方法:GGUF、必要スペック、ベンチマーク

Qwen 3.8 27Bをローカルで実行する方法:GGUF、必要スペック、ベンチマーク

Qwen 3.8 27Bは、Alibabaの新しいQwen 3.8ファミリーの中で、実際にローカルで動かせるモデルです。27Bのデンス型マルチモーダルモデルで、4ビット量子化なら24 GBのGPUや32 GBのMacに収まります。このガイドでは、当社のAtomic Dynamic GGUFビルド、各ビルドに必要なメモリ、Atomic Chatとllama.cppそれぞれの具体的な設定方法を紹介します。

Qwen 3.8 27Bをローカルで実行する方法:GGUF、必要スペック、ベンチマーク
Andrew Dyuzhov
Andrew Dyuzhov
Calendar icon

August 17, 2026

目次

このガイドでは、次の内容を解説します。

  • Qwen 3.8 27Bとは何か、Qwen 3.8 Maxとどう違うか
  • 実行に必要なハードウェア
  • Atomic Chatまたはllama.cppでQwen 3.8 27Bをローカル実行する方法

0.8Bから始まるQwen全体のラインアップについては、Qwenモデルをローカル実行するガイドをご覧ください。この記事ではQwen 3.8 27Bのみを扱います。

Qwen 3.8 27Bとは?

Qwen 3.8 27Bは、AlibabaのQwenチームが開発したオープンウェイトのデンス型言語モデルで、Qwen 3.8 Maxより小型のモデルです。Alibabaは2026年8月3日にMaxを発表し、両モデルの重みを公開すると告知しました。2.4TパラメータのMaxの重みは8月12日、27Bの重みは8月14日に公開されました。

その後、回答の拒否動作を取り除いた重みの改変版が複数公開されています。これらのビルドについては、Qwen 3.8 27Bの無検閲版をローカル実行するガイドをご覧ください。

Qwen 3.8 27Bの主な仕様:

仕様Qwen 3.8 27B
総パラメータ数27B
アーキテクチャデンス型、ハイブリッドアテンション(Gated DeltaNet + Gated Attention)
層数64
コンテキストウィンドウネイティブ262,144トークン、1Mまで拡張可能
モダリティテキスト、画像、動画の入力
推論デフォルトでxhighの思考が有効。mediumとlowも選択でき、無効化も可能
複数トークン予測(Multi-Token Prediction)対応。予測ヘッドをチェックポイントに同梱
リリース日2026年8月14日
ライセンスApache 2.0

27Bはマルチモーダルモデルであり、テキストとともに画像や動画を処理できます。また、Qwen3.6 27Bのハイブリッドアテンション設計を継承しています。64層のうち48層では、会話がどれだけ長くなってもメモリ使用量が一定のGated DeltaNetを使います。通常はトークンごとに増えるKVキャッシュを保持するのは、残りの16層だけです。そのため、一般的な27Bモデルよりも、長いチャットや大きな文書に必要なメモリを大幅に抑えられます。3.8のconfig.jsonからも、この構成が変わらず引き継がれていることを確認できます。具体的な数値はハードウェアの節で紹介します。

複数トークン予測の学習も行われており、1回の順伝播で複数のトークン候補を生成できます。これは投機的デコーディングと同じ仕組みです。予測ヘッドはチェックポイントに含まれ、llama.cppでは--spec-type draft-mtpで実行します。

Qwen 3.8のリリースには、混同しやすい三つの異なるモデルがあります。

  • Qwen 3.8 Maxは、総パラメータ2.4T、アクティブパラメータ95BのMoEフラッグシップモデルです。Alibaba Cloud APIで提供され、現在、Artificial AnalysisのIntelligence Indexでオープンウェイトモデルの首位にあります。
  • Qwen3.8-2.4T-A95Bは、8月12日に公開されたMaxのダウンロード可能な版です。テキスト専用で、すべてのリクエストで推論します。パラメータ数は2.4兆で、提供には複数GPUを備えたデータセンターのクラスターが必要です。Kimi K3と同じクラスのハードウェアです。
  • Qwen 3.8 27Bは、このガイドで扱うデンス型の視覚言語モデルです。三つの中で唯一、24 GBのGPUを搭載したデスクトップや、32 GBのユニファイドメモリを搭載したMacBookといった一般的なマシンで動きます。

Qwen 3.8 27Bのベンチマーク

Alibabaがモデルカードで公開したリリース時の数値では、27BをQwen3.6 27B、Muse Glimmer 30B、Claude Opus 4.6 Maxと比較しています。

Qwen 3.8 27BQwen3.6 27BMuse Glimmer 30BClaude Opus 4.6 Max
Terminal Bench 2.1
エージェントによるターミナル操作タスク
73.063.451.778.2
SWE-bench Pro
実際のソフトウェア開発、難度の高い問題群
61.753.551.253.4
LiveCodeBench v6
競技プログラミング
90.383.9-88.8
GPQA Diamond
専門家レベルの科学の問題
89.287.883.591.3
Humanity's Last Exam
あらゆる分野の専門家レベルの問題
30.824.022.040.0
OSWorld-Verified
エージェントによるコンピューター操作タスク
84.363.965.972.7
SWE-MM
マルチモーダルのソフトウェア開発
38.625.7-27.1

27Bは七つのベンチマークのうち四つでClaude Opus 4.6 Maxを上回ります。Opusレベルのモデルが、24 GBのカード1枚で動くようになりました。

同じクラスのローカルモデルについて、それぞれのベンダーが測定したスコアを示します。

Qwen 3.8 27BMuse Glimmer 30BNemotron 3.5 LightningQwen3.6 35B A3BGemma 4 31B
パラメータ数
27B デンス型30B デンス型30B MoE (A3B)35B MoE (A3B)31B デンス型
4ビットGGUFのサイズ
約17 GB<20 GB約18 GB約20 GB約18 GB
MMLU-Pro
学術分野全般の知識と推論
--81.985.285.2
GPQA Diamond
専門家レベルの科学の問題
89.283.575.486.084.3
AIME 2026
高度な数学的推論
-94.7-92.789.2
SWE-bench Verified
実際のソフトウェア開発タスク
-76.051.673.4-
Humanity's Last Exam
あらゆる分野の専門家レベルの問題
30.822.011.721.419.5

この二つ目の表のスコアはすべて、各ベンダーのモデルカードやリリース記事から引用しています。各組織の評価環境は異なるため、列間の小さな差には大きな意味はありません。ハイフンは、その数値がベンダーから公開されていないことを示します。また、Qwen3.6 35Bのカードでは、GPQA Diamondではなく単にGPQAと記載されています。

直接の競合はMuse Glimmer 30Bです。Metaがオープンウェイトに復帰した際のモデルで、同じ週に公開され、サイズもほぼ同じデンス型の視覚言語モデルです。リリース時の数値では、27BがGPQA Diamond(89.2対83.5)とHumanity's Last Exam(30.8対22.0)で上回る一方、上の表で公開されているSWE-bench Verifiedの最高スコアはGlimmerです。

27Bを判断する上で、より参考になるのは直接の前世代モデルです。Qwenが公開した結果では、Qwen3.6 27BはMMLU-Proで86.2%、SWE-bench Verifiedで77.2%を記録しています。4月のリリース以来、24 GBのカードに収まるローカルコーディング向けデンス型モデルの中でも、特に高性能なモデルの一つでした。3.8はパラメータ数と各次元を変えずに置き換えるため、ハードウェアの必要量も同じです。

Qwen 3.8 27B GGUF:当社で量子化しました

当社はQwenの元のBF16重みからAtomicChat Qwen 3.8 27B GGUFリポジトリを作成し、各ビルドを量子化前の基準モデルと比較測定しました。リポジトリには8.5-28.9 GBの16ビルドと、すべてのビルドで共有する別ファイルの画像プロジェクターがあります。複数トークン予測ヘッドは各ファイルに含まれているため、追加のダウンロードは不要です。ADはAtomic Dynamicの略で、AD-Q5_K_M-Q4_K_Mのように二つの名前がある場合は、大きい二つのテンソル群に適用した量子化を示します。両者が同じなら、名前は一つにまとめられます。

ファイルサイズKLダイバージェンスTop-1一致率
Q8_028.9 GB0.0006498.92%
AD-Q6_K25.0 GB0.0010798.67%
AD-Q6_K-Q5_K23.1 GB0.0025297.94%
AD-Q5_K_M20.2 GB0.0041997.34%
AD-Q5_K_M-Q4_K_M18.6 GB0.0073096.43%
AD-Q4_K_M17.1 GB0.0112695.59%
AD-IQ4_XS16.5 GB0.0124895.39%
AD-IQ4_XS-IQ3_S14.4 GB0.0266093.15%
AD-IQ3_S13.8 GB0.0324792.41%
AD-IQ3_S-IQ3_XXS13.0 GB0.0433791.33%
AD-IQ3_XXS12.1 GB0.0697289.13%
AD-IQ2_S11.1 GB0.0983287.18%
AD-IQ2_S-IQ2_XS10.2 GB0.1380784.77%
AD-IQ2_XS9.9 GB0.1617083.48%
AD-IQ2_XXS9.0 GB0.2566379.44%
AD-IQ1_M8.5 GB0.3421276.34%

表の読み方:KLダイバージェンスは、量子化版と元の重みの出力分布の差を表します。低いほどよく、ゼロなら同一です。Top-1一致率は、量子化版が基準モデルと同じ次のトークンを選ぶ位置の割合です。一つの指標で全体を見たい場合は、Top-1一致率を使ってください。次の節では、どのファイルがハードウェアに合うかを説明します。

表の数値はすべて当社で測定しました。基準は元のBF16重みで、キャリブレーション用コーパスも公開しています。生のログは測定結果のリポジトリにあるため、どの数値も確認できます。手順の全体はモデルカードに掲載しています。

同じサイズで比較した当社GGUFの性能

unsloth、ggml-org、lmstudio-communityのビルドをダウンロードし、当社のビルドと同じ測定環境、同じBF16の基準モデルで評価しました。

サイズ当社のビルド同サイズで最良の他社ビルド
20.2 GBAD-Q5_K_M, 0.00419unsloth UD-Q5_K_XL, 0.00437
25.0対25.9 GBAD-Q6_K, 0.00107unsloth UD-Q6_K_XL、0.00110(0.9 GB大きい)
16.5対16.1 GBAD-IQ4_XS, 0.01248unsloth Q4_K_S, 0.01707
12.1対11.9 GBAD-IQ3_XXS, 0.06972unsloth UD-IQ3_XXS, 0.07330

表のすべてのサイズで、AtomicChatのビルドのほうがKLダイバージェンスは低くなっています。

このモデルでは三つの配布元がQ4_K_Mというファイルを提供していますが、同じファイルではありません。

配布元サイズKLダイバージェンス
lmstudio-community16.8 GB0.02094
ggml-org19.0 GB0.01470
AtomicChat AD-Q4_K_M17.1 GB0.01126

量子化名が示すのは、配布元が指定した量子化の方式だけです。同じラベルでも各配布元が独自に構成を選ぶため、一つの名前に三つの異なるサイズが存在します。ビルドを選ぶ際は、ファイルサイズと測定された品質を基準にしてください。

Qwen 3.8 27Bのハードウェア要件

Qwen 3.8 27Bで確認すべきシステム要件はメモリです。下の表は、使用可能なRAMとVRAMの合計、またはApple Siliconのユニファイドメモリとして必要な容量を示しています。

使用可能なメモリ推奨GGUF量子化版ファイルサイズ確保できる余裕
12 GBAD-IQ2_S11.1 GB短いコンテキストのみ。または一部の層をCPUに移す
16 GBAD-IQ3_S13.8 GB約8Kのコンテキスト
24 GBAD-Q5_K_M-Q4_K_M18.6 GB約16Kのコンテキスト
32 GBAD-Q6_K25.0 GB約24Kのコンテキスト
48 GB以上Q8_028.9 GBコンテキスト長はKVキャッシュに使える残りのメモリ次第

注意:隣り合う二つのファイルで迷ったら、大きいほうを選んでください。1-2GB多く使いますが、誤ったトークンを選ぶ頻度が明らかに減ります。特に品質が急激に落ちる14 GB未満では、その差が大きくなります。

コンテキストウィンドウでメモリはどれだけ増えるか?

上の数値はモデルの重みだけを対象としています。その上に、エンジンがKVキャッシュを確保します。チャットが長くなるほどモデルがメモリに保持するコンテキストも増え、必要な容量も増えます。大きな文書やコードベースを会話に貼り付ける場合も同じです。

通常のデンス型Transformerでは、64層すべてが各トークンのアテンションデータを保存します。このモデルでは、64層中48層が固定サイズの状態を持つGated DeltaNetを使い、16層のGated AttentionもKVヘッドは4個だけです。当社ビルドでの測定では、1トークン当たり256 KBのアテンションキャッシュを保持します。同じ構成の標準的なTransformerの約4分の1です。

コンテキスト長アテンションキャッシュ
8K(一般的なチャット)約2 GB
32K(長い文書)約8 GB
128K(大規模なコードベース)約33 GB
262K(ネイティブの最大コンテキスト)約67 GB

262Kのウィンドウ全体を使うにはサーバー向けハードウェアが必要です。キャッシュだけで約67 GBとなり、モデルファイルの2倍を超えるためです。

Qwen 3.8 27Bを実行できるハードウェアは?

  • RTX 3090 / RTX 4090(VRAM 24 GB):AD-Q5_K_M-Q4_K_MをすべてVRAMに載せ、約16Kのコンテキスト用の余裕を残せます。
  • RTX 5090(VRAM 32 GB):AD-Q6_KをすべてVRAMに載せ、約24Kのコンテキストで実行できます。この量子化では、モデルの動作は元のモデルに近くなります。
  • 16 GBのGPU(RTX 4060 Ti、RTX 5060 Ti):AD-IQ3_Sと約8Kのコンテキストが収まります。または、4ビット版の数層をシステムRAMに移して実行できます。27Bはデンス型なので、最近紹介したMoEモデルよりもオフロードの負担が大きくなります。生成の各ステップで、GPUが低速なシステムRAM上の層の処理を待つためです。VRAMに完全に収まる小さな量子化版のほうが、通常はよい選択です。
  • MacBook Pro(ユニファイドメモリ24 GB):AD-IQ3_Sを8Kのコンテキストで実行できます。macOSはデフォルトでGPUから使えるメモリをユニファイドメモリの約75%に制限するため、24 GBのMacでモデルが使えるのは約18 GBです。
  • MacBook Pro M4/M5 Max、Mac Studio(36-64 GB):Q5やQ6を余裕を持って実行でき、48 GB以上ならQ8_0も使えます。Apple SiliconではGGUFビルドはMetalを通じてネイティブに動作します。形式を選ぶ場合は、GGUFとMLXの比較をご覧ください。
  • スマートフォン:実行できません。スマートフォンで動くモデルが必要なら、Qwenガイドで紹介しているQwenファミリーの小型モデルを使ってください。

実測スループット

2枚のRTX 5090にすべての層を載せ、AD-Q4_K_Mを測定しました。

コンテキストプロンプト処理生成
8K363 t/s77 t/s
32K5,244 t/s72 t/s

コンテキストが8Kから32Kに増えても、生成速度は毎秒72-77トークンを維持します。24 GBのカード1枚では、これより低い数値になります。

Atomic ChatでQwen 3.8 27Bをローカル実行する方法

Atomic Chatは、私たちが開発した無料のオープンソースのローカルAIアプリです。Hugging Faceのモデルブラウザーを備え、分割GGUFのダウンロードを管理し、llama.cppを手動でビルドすることなくチャット画面を利用できます。

Atomic ChatでQwen 3.8 27Bを実行する手順は次のとおりです。

ステップ1:Atomic Chatをインストールする

atomic.chatからAtomic Chatをダウンロードし、プラットフォームに合うビルドをインストールします。

  • macOS:ユニバーサル.dmg(IntelとApple Silicon)、macOS 13.6以降
  • Windows:x64向け.exeインストーラー
  • Linux:root権限が不要なx86_64向け単体.AppImage
  • iOS:App Storeから入手
  • Android:Google Playから入手

Linuxでは、chmod +xでAppImageに実行権限を付け、直接実行します。初回起動時にFUSEが必要と表示された場合は、DebianやUbuntuではsudo apt install fuse libfuse2、Fedoraではsudo dnf install fuse fuse-libsでインストールしてください。

macOS、Windows、Linuxのデスクトップ版と、iOS、Android版が並ぶAtomic Chatのダウンロード欄

ステップ2:当社のQwen 3.8 27B GGUFを探す

Modelsタブを開き、次を検索します。

AtomicChat/Qwen3.8-27B-GGUF

カタログはHugging Faceと連携しているため、ほかの配布元のビルドも公開されると表示されます。AtomicChatが公開した結果を選び、Download Optionsを開いて、利用できる量子化版を表示します。

AtomicChatが公開したQwen3.8-27B-GGUFリポジトリ、27.3Bパラメータ、256Kのコンテキストが表示されたAtomic Chatのモデル検索結果

注意:重みが公開される前から、Hugging Faceには偽のQwen3.8-27Bリポジトリが存在していました。アプリのカタログ以外からダウンロードする場合は、「トラブルシューティング」でファイルの確認方法を参照してください。

ステップ3:メモリに合う量子化版を選ぶ

上のハードウェア表を使ってください。一般的な構成では、次を選びます。

  • 24 GBのGPU:AD-Q5_K_M-Q4_K_Mをダウンロードします。
  • 32 GB:AD-Q6_Kをダウンロードします。
  • 48 GB以上:Q8_0をダウンロードします。

選択欄では、各ビルドはAD接頭辞なしの短いタグで表示されます。AD-Q5_K_M-Q4_K_Mのように二つの名前がある場合は、小さいほうのタグで表示されます。24 GBのカードなら、18.2 GBのQ4_K_Mの行を選びます。選択欄のサイズは、表に記載したファイルサイズと少し異なります。同じ名前の行が二つある場合は、サイズを基準にしてください。コンテキスト用の余裕を残して収まる中で、最も大きい量子化版を選びます。量子化名の意味が分からない場合は、GGUFと量子化の仕組みを説明するガイドをご覧ください。

Atomic Dynamicの量子化版と各サイズが並ぶAtomic ChatのDownload Options選択欄

ステップ4:コンテキスト、思考、サンプリングを設定する

モデルのコンテキストウィンドウは262Kですが、最大値に設定するとKVキャッシュが最初に確保されます。チャットでは8,192トークン、コードや文書の作業では32,768トークンから始め、作業に必要な場合だけ増やしてください。

コンテキストサイズはチャット画面ではなく、モデル自体の設定にあります。Settings → Model Providers → Llama.cppを開き、モデル一覧でQwen 3.8のビルドを探して、その行の歯車アイコンをクリックします。次の三つを設定してください。

  • Context Size:8192または32768に設定します。0にするとGGUFから最大値が読み込まれ、このモデルでは262Kのウィンドウ全体が使われます。
  • Auto Increase Context Size:デフォルトで有効です。会話の余裕がなくなるとコンテキストを拡張するため、ぎりぎり収まっていたビルドがメモリ上限を超えることがあります。上限近くで使う場合は無効にしてください。
  • GPU Layers:-1ですべての層をGPUに載せます。VRAMに収まるデンス型モデルでは、この設定が適しています。

Context SizeやGPU Layersを変更するとモデルが再起動するため、長い会話を始める前に設定してください。

思考はデフォルトでxhighが有効で、mediumやlowも使えます。完全に無効化することもでき、チャット内の電球アイコンで切り替えます。Atomic Chatでは、推論の出力を表示するか隠すかも選べます。

サンプリングは別のパネルにあります。チャット上部のモデル名の横にあるスライダーアイコンをクリックしてください。思考モードでは、Qwenはtemperature 1.0、top_p 0.95、top_k 20を推奨しています。思考を無効にした場合は0.7と0.80です。これらの設定はモデルではなくアシスタント、つまりチャットのプロファイルに保存されるため、モデルを切り替えても変わりません。

Auto Increase Context Size、Context Size、GPU Layersが表示されたAtomic Chatのモデル設定パネル

ステップ5:ローカルでチャットする

ダウンロードが完了すると、Atomic Chatがモデルを読み込み、内蔵チャットで開きます。

27Bはネイティブの視覚言語モデルなので、チャットに画像を添付して質問できます。画像、重み、プロンプトは自分のマシン内にとどまります。

Atomic Chatは、http://localhost:1337/v1でOpenAI互換APIサーバーも提供します。Claude CodeやClineなどのコーディングエージェントを含め、OpenAI APIに対応するツールなら、クラウドモデルの代わりにローカルモデルをそのまま使えます。

llama.cppでQwen 3.8 27Bを実行する方法

次のような要件がある場合は、llama.cppから直接モデルを実行する方法が向いています。

  • フラグを明示して設定するOpenAI互換ローカルエンドポイント
  • GPUオフロードの厳密な制御
  • 再現可能なサーバー構成

27BはQwen3.6と同じGated DeltaNetのハイブリッド設計を使っています。上流のllama.cppは2026年2月からこれに対応しているため、リリース当日のGGUFも、最新ビルドならパッチなしで動作します。

ステップ1:最新のllama.cppをビルドする

NVIDIA CUDAの場合:

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON
cmake --build build -j --target llama-cli llama-server

Apple Siliconでは、Metalがデフォルトで有効です。

cmake -B build -DCMAKE_BUILD_TYPE=Release
cmake --build build -j --target llama-cli llama-server

ステップ2:モデルを実行する

次のコマンドは、Hugging FaceからAD-Q4_K_Mをダウンロードし、すべての層をGPUに載せ、Qwenが推奨するサンプリングを適用して、コンテキストを8Kに制限します。

./build/bin/llama-cli \
  -hf AtomicChat/Qwen3.8-27B-GGUF:AD-Q4_K_M \
  --jinja \
  --temp 1.0 --top-p 0.95 --top-k 20 \
  -ngl 99 \
  -c 8192

システムのメモリ容量が異なる場合は、AD-Q4_K_Mを別の量子化名に置き換えてください。

ステップ3:ローカルのOpenAI互換APIを公開する

llama-cliをllama-serverに置き換えます。

./build/bin/llama-server \
  -hf AtomicChat/Qwen3.8-27B-GGUF:AD-Q4_K_M \
  --alias qwen3.8-27b \
  --jinja \
  --temp 1.0 --top-p 0.95 --top-k 20 \
  -ngl 99 \
  -c 8192 \
  --host 127.0.0.1 --port 8080

次でテストします。

curl http://127.0.0.1:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{ "model": "qwen3.8-27b", "messages": [ { "role": "user", "content": "Summarize what Gated DeltaNet changes about attention." } ] }'

ネットワーク内のほかのマシンからアクセスする必要がなければ、サーバーは127.0.0.1にバインドしてください。

llama.cppで画像入力を使う

画像入力には、すべての量子化版で共有する画像プロジェクターという追加ファイルが一つ必要です。リポジトリからmmproj-Qwen3.8-27B-F16.ggufを一度ダウンロードし、選んだ量子化版と一緒に指定してください。

llama-mtmd-cli \
  -m Qwen3.8-27B-AD-Q4_K_M.gguf \
  --mmproj mmproj-Qwen3.8-27B-F16.gguf \
  --image your-photo.jpg --image-min-tokens 1024 \
  -ngl 99 -c 8192 \
  -p "What is in this image?"

--image-min-tokens 1024は維持してください。llama.cppは、このファミリーには少なくともこの数の画像トークンが必要だと警告します。下回ると、位置に関する処理が不安定になります。画像理解は量子化してもよく保たれています。AD-IQ3_S以上のすべてのファイルは、当社の手書き文字テストを改行まで含めて正確に書き起こしました。

OllamaやLM Studioで実行する

どちらのアプリも内部でllama.cppを使っており、リリース当日から対応しています。ollama pull qwen3.8:27bが動作し、LM StudioのカタログにはGGUFとMLXのビルドが掲載されています。AtomicChatのGGUFビルドも両アプリで読み込めます。

トラブルシューティング

ダウンロードしたGGUFが本物のモデルではない

重みが公開される前から、Hugging FaceにはQwen3.8-27Bを名乗るプレースホルダーのリポジトリがありました。知らないリポジトリからダウンロードする前に、配布元が公式のQwen組織か、知っている量子化の提供者であること、モデルカードがあること、ファイル一覧に妥当なサイズのGGUF分割ファイルが実際に存在することを確認してください。4ビットの27Bモデルが400 MBに収まることはありません。

思考モードをオフにできない

モデルはenable_thinking: falseによる思考の無効化に対応していますが、チャットテンプレートがこの設定を渡さないと機能しません。新しいQwenのリリースで、このテンプレート処理が動かなくなったことは一度ではありません。思考をオフにしてもモデルが推論を続ける場合は、まずllama.cppを更新し、リポジトリのREADMEを確認してください。動作するフラグをそこで説明しています。

画像のエンコード中にllama.cppが警告を表示する

find_slot: non-consecutive token positionや、未使用のblk.64テンソルについての行が出るのは想定内です。前者は、このファミリーが画像パッチの位置を、単一の連番ではなく多次元の位置エンコーディングで表すためです。後者は、通常の順伝播では実行しない予測ヘッドです。

長いコンテキストでメモリが不足する

重みは収まっていても、会話が長くなるとモデルがクラッシュすることがあります。KVキャッシュが空きメモリを超えて増えたためです。Context Sizeは0ではなく明示的な値にし、上限近くではAuto Increase Context Sizeを無効にしてください。さらに余裕が必要なら、量子化版を一段小さいものにします。キャッシュは1トークン当たり256 KBなので、1GB空けるごとに約4Kのコンテキストを追加できます。

よくある質問

Qwen 3.8 27Bを自分のハードウェアで実行する際によくある質問です。

Qwen 3.8 27BにはどのくらいのVRAMが必要ですか?

4ビットのファイルは約17 GBです。一般的な量子化版でコンテキスト用の余裕を確保するには、24 GBのGPUが実用上の最小構成になります。Apple Siliconでは、macOSがGPUメモリをユニファイドメモリの約75%に制限するため、24 GBのMacでは3ビット版を使います。32 GB以上なら、コンテキスト用の余裕を残して4ビット版を実行できます。

VRAM 16GBでQwen 3.8 27Bを実行できますか?

はい。ただし、トレードオフがあります。AD-IQ3_S(13.8 GB)は16 GBに約8Kのコンテキストとともに収まり、元のモデルに対するTop-1一致率は92.41%です。4ビット版では一部をCPU側に移す必要があり、デンス型モデルではトークンごとに速度が低下します。12 GBでは、AD-IQ2_Sを短いコンテキストに限って実行できます。

MacでQwen 3.8 27Bを実行できますか?

はい。ユニファイドメモリ24 GBのMacならAD-IQ3_Sを8Kのコンテキストで実行でき、36-64 GBのMacならQ5やQ6をMetal経由でネイティブに実行できます。48 GB以上ならQ8_0も使えます。16 GBのMacでは実用的なコンテキスト用の容量が足りません。そのハードウェアについては、16GBのMacにおすすめのローカルLLMをご覧ください。

Qwen 3.8 27Bはもうリリースされていますか?

はい。Qwen 3.8 27Bのリリース日は2026年8月14日です。Alibabaは8月3日にファミリーを発表し、Hugging Faceの公式Qwen組織で重みを公開しました。当社のGGUFビルドはAtomicChat/Qwen3.8-27B-GGUFリポジトリとAtomic Chatのカタログにあります。

Qwen 3.8 27BとQwen 3.8 Maxの違いは何ですか?

違いはサイズとモダリティです。Qwen 3.8 Maxは2.4TパラメータのMoEモデルで、公開された重みはテキスト専用かつ常に推論します。2.4兆パラメータを提供するにはデータセンター向けハードウェアが必要です。Qwen 3.8 27Bは画像や動画を入力できるデンス型の視覚言語モデルで、24 GBのGPU1枚に収まります。

Qwen 3.8 27BはQwen3.6 27Bより高性能ですか?

Alibabaのリリース時の数値では、はい。SWE-bench Proは53.5から61.7、Terminal Bench 2.1は63.4から73.0、OSWorld-Verifiedは63.9から84.3に上がっています。両モデルのサイズと各次元は同じため、ハードウェアの必要量もそのまま引き継がれます。現在Qwen3.6 27Bが動いているマシンには、3.8のビルドも収まります。

Qwen 3.8 27BはMuse Glimmer 30Bと比べてどうですか?

現在のローカルモデルでは、最も近い組み合わせです。同じ週に公開された約30Bのデンス型視覚言語モデルで、どちらも4ビットなら24 GBのカードに収まります。27BはGPQA Diamond(89.2対83.5)とHumanity's Last Exam(30.8対22.0)で上回ります。Glimmerの公開値で特に高いのはSWE-bench Verifiedの76.0で、Qwenのカードにはこのベンチマークの結果がありません。どちらもApache 2.0で提供されています。

Qwen 3.8 27Bはローカルで画像理解に対応していますか?

はい。Qwen 3.8 27Bは、画像と動画の入力に対応したネイティブの視覚言語モデルです。Atomic Chatではチャットに画像を添付して質問でき、データはマシンの外に出ません。llama.cppでもリリース初日から画像入力が使え、すべてのGGUF配布元が量子化版とともにmmprojファイルを提供しています。llama.cppでは動画入力には対応していません。

Qwen 3.8 27BはOllamaやLM Studioで動きますか?

はい。リリース当日から、Ollamaではollama pull qwen3.8:27bが使え、LM StudioではGGUFとMLXのビルドがカタログにあります。両アプリとも、AtomicChatリポジトリを指定すれば当社のファイルも利用できます。

思考モードをオフにできますか?

はい。思考はデフォルトでxhighで動作し、mediumとlowも選べます。enable_thinking: falseで完全に無効化できます。思考を無効にした場合、Qwenはtemperature 0.7とtop_p 0.80を推奨しています。Atomic Chatでは、チャットの電球アイコンで切り替えます。

Qwen 3.8 27Bは無料で商用利用できますか?

はい。Qwen 3.8 27BはApache 2.0ライセンスで提供され、商用利用、改変、再配布が認められています。商用利用にしきい値を設けた独自のQwenライセンスが適用されるのはQwen 3.8 Maxの公開重みだけで、27Bには適用されません。

まとめ

24 GBのGPUまたは32 GBのユニファイドメモリがあるなら、Qwen 3.8ファミリーでローカル実行に選ぶモデルはQwen 3.8 27Bです。Atomic ChatからAD-Q5_K_M-Q4_K_Mをダウンロードし、8Kのコンテキストから始めて、作業に応じて増やしてください。llama.cppでも同じファイルを使い、ローカルのOpenAI互換APIとして提供できます。

要点:

  • Qwen 3.8 27Bは、ハイブリッドアテンション、ネイティブ262Kのコンテキストウィンドウ、複数トークン予測を備えた27Bのデンス型マルチモーダルモデルです。
  • Alibabaは2026年8月3日にQwen 3.8ファミリーを発表しました。27Bの重みは8月14日にApache 2.0で公開されました。
  • 当社のGGUFビルドは8.5-28.9 GBです。24 GBのカードにはAD-Q5_K_M-Q4_K_Mを選んでください。
  • 長いコンテキストには、ファイルに加えてメモリが必要です。8Kで約2 GB、32Kで約8 GBが増えます。
  • 隣り合う量子化版では、追加の1GBを使っても大きいほうを選ぶ価値があります。14 GBを下回ると誤差が特に速く増えます。
12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで使うローカルLLMを比較。モデルの選び方、量子化形式、メモリ使用量を確認し、PCのスペックに合うモデルを探せます。

9/30/26

15分

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5をOpus、Fable、GPT-6 Astraと比較し、お使いのハードウェアに合うローカルのQwen、Ornith、Bonsaiモデルを選びましょう。

9/29/26

13分

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できるのでしょうか?その仕組みを学び、JevとLayaのTetris比較デモを見て、独立したローカルの代替モデルとしてLayaをセットアップしましょう。

9/25/26

12分

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルAI画像生成ツールを比較し、7つのモデルをRTX 5090でベンチマーク測定しました。生成画像の例、生成速度、メモリ使用量、ライセンスの制限を確認できます。

9/25/26

14分