Muse-Glimmer-30B

更新
04.10.2026
思考
ツール利用
画像認識
推論
コード生成
多言語
ウェブ検索

Muse Glimmer 30Bは、一般向けハードウェア用に開発されたMetaのエージェントモデルです。視覚エンコーダーを備えた30Bのデンスモデルで、24 GBのカードに収まるように量子化されています。

基本情報

  • ライセンス: Apache 2.0
  • パラメーター数: 29.6Bのデンスモデル、52層、1.8Bの視覚エンコーダーを含む
  • コンテキスト長: 131,072トークン
  • モダリティ: テキストと画像を入力
  • 最小ハードウェア要件: AD-IQ3_Mでは16 GBのVRAM、AD-Q4_K_Mでは24 GB

Muse-Glimmer-30Bとは?

Muse Glimmer 30Bは、Meta Superintelligence Labのエージェントモデルです。Muse Sparkから蒸留され、2026年8月にApache 2.0で公開されました。Metaは、一般向けハードウェア上で自律的なエージェント処理を行うためにこのモデルを開発しました。そのため、設計の対象はレンタルするクラスターではなく、自分で所有するマシンです。

仕様Muse Glimmer 30B
総パラメーター数視覚エンコーダーを含めて29.6B
アーキテクチャ知覚エンコーダーを備えたデンス型因果Transformer
層数52
アテンション四層ごとに三層で2,048トークンのスライディングウィンドウを使用
知覚エンコーダーViT-G/14、約1.8Bパラメーター
コンテキスト長131,072トークン
モダリティテキストと画像を入力、テキストを出力
投機的デコーディングモデルにDFlashドラフターを同梱
公開日2026年8月
ライセンスApache 2.0

このアテンション構成によってKVキャッシュを小さく抑え、重みとともに視覚エンコーダーとDFlashドラフターを24 GBの枠内に収めています。Metaの報告によると、独自の4ビット圧縮による精度低下は、15のベンチマークの平均でフル精度に対して0.2%です。

Muse Glimmer 30Bのベンチマーク

モデルカードに掲載されたMetaの公開時の数値では、推論強度が高いモードのGlimmerと、思考モードのGemma 4 31BおよびQwen3.6-27Bを比較しています。

ベンチマークMuse Glimmer 30BGemma 4 31BQwen3.6-27B
MCP Atlas
MCPツール
75.554.262.5
DeepSearch QA
詳細調査
74.661.771.1
SWE-Bench Pro
高難度のソフトウェア開発
51.236.950.2
SWE-Bench Verified
ソフトウェア開発
76.066.677.2
TerminalBench 2.1
ターミナル操作エージェント
51.743.460.7
AIME 2026
数学競技
94.789.294.1
GPQA Diamond
専門レベルの科学
83.585.784.2
OSWorld-Verified
コンピューター操作
65.958.575.6

Glimmerはツール使用、ウェブ調査、数学で優位に立ちますが、ターミナル操作とコンピューター操作のタスクではQwen3.6-27Bに劣ります。訴求点は、視覚エンコーダーとドラフターを読み込んだ状態で24 GBのカードに収まる30Bのエージェントであることで、すべての項目で勝つモデルであることではありません。

Muse Glimmer 30Bのハードウェア要件

システム要件で確認すべきなのはメモリです。私たちは元の重みからモデルを量子化し、各ビルドをAtomicChat/Muse-Glimmer-30B-GGUFとして公開しました。

メモリ選ぶビルドファイルサイズ
16 GBAD-IQ3_M14.9 GB
24 GBAD-Q4_K_M19.1 GB
32 GBAD-Q5_K_M22.7 GB
48 GB以上AD-Q6_K28.3 GB

画像を入力する場合は、これに加えて視覚プロジェクターを読み込みます。投機的デコーディングを使う場合は、DFlashドラフター用の余裕も確保してください。隣り合うファイルのサイズ差は一、二ギガバイトなので、二つのビルドがどちらもメモリに収まる場合は、大きいほうを選んでください。

Atomic ChatでMuse Glimmer 30Bを実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでMuse-Glimmer-30Bを検索し、Download Optionsを開きます。
  3. お使いのメモリに収まるビルドを選び、チャットを開始します。

起動後に実際のツールと接続するには、私たちのAIエージェントをローカルで実行するためのガイドに従うか、MCPコネクターでお使いのアプリに接続してください。

この規模で最も近い競合はOrnith-1.5-35B-A3Bです。コーディングではGlimmerを上回りますが、MCPツールのルーティングでは下回ります。より幅広い選択肢については、コーディングに最適なローカルLLMをご覧ください。

Muse-Glimmer-30Bのライセンス

Muse Glimmer 30BはApache 2.0で公開されており、ロイヤリティなしで商用利用、改変、再配布が認められています。これはMetaが公開するモデルとしては異例に寛容なライセンスで、同梱の知覚エンコーダーとDFlashドラフターにも適用されます。

Hugging Faceからモデルをダウンロード

huggingface-cli download meta-models/Muse-Glimmer-30B
# Atomic ChatのGGUFビルド:
huggingface-cli download AtomicChat/Muse-Glimmer-30B-GGUF Muse-Glimmer-30B-AD-Q4_K_M.gguf
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Muse-Glimmer-30B",
    "messages": [{"role": "user", "content": "Read this screenshot and file the bug."}]
  }'
from transformers import AutoProcessor, AutoModelForImageTextToText

model_id = "meta-models/Muse-Glimmer-30B"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(model_id, torch_dtype="auto", device_map="auto")

messages = [{"role": "user", "content": [{"type": "text", "text": "What does this chart show?"}]}]
inputs = processor.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
print(processor.decode(model.generate(**inputs, max_new_tokens=1024)[0]))
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "Muse-Glimmer-30B",
  messages: [{ role: "user", content: "Call the weather tool and summarise the result." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Muse Glimmer 30Bは、Meta Superintelligence Labによる、視覚エンコーダーを内蔵した29.6Bのデンスモデルです。Muse Sparkから蒸留され、2026年8月にApache 2.0で公開されました。ツール呼び出し、複数段階の推論、ツールが失敗した際の復旧といったエージェント処理のために開発されています。

私たちのAD-Q4_K_Mビルドは19.1 GBなので、24 GBのカードでは視覚プロジェクター用の余裕を残して実行できます。AD-IQ3_Mは14.9 GBで16 GBに収まり、28.3 GBのAD-Q6_Kは参照モデルに近いビルドです。

はい。Apache 2.0で提供されているため、商用利用、改変、再配布が無料で認められています。

はい。約1.8BパラメーターのViT-G/14知覚エンコーダーを搭載し、テキストと画像が交互に混在する入力を受け付けます。これにより、エージェントはテキストだけでなく、スクリーンショットやグラフも読み取れます。

DFlashは、1回の処理で16トークンのブロックを提案する小型の補助モデルです。その後、メインモデルがそのブロックを並列に検証します。出力を同一に保ったまま、毎秒のトークン数を増やします。