SmolLM3-3B

更新
05.10.2026
推論
多言語
ツール利用
思考

Hugging Faceによる完全にオープンな3B推論モデル。2つの思考モード、6言語のネイティブ対応、ツール呼び出し、128Kのコンテキスト長を備えています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 3.08B
  • コンテキスト長: 64Kで学習、YaRNで最大128Kトークン
  • モダリティ: テキストのみ
  • 最小ハードウェア要件: メモリ2 GB(UD-IQ2_M GGUF、1.15 GB)

SmolLM3-3Bとは?

SmolLM3-3Bは、小型モデルの可能性を広げるためにHugging Faceが開発した、パラメータ数3Bの言語モデルです。推論には2つのモードがあります。デフォルトで有効な拡張思考では、回答の前に思考過程を出力します。/no_thinkフラグで無効にすると、すばやく直接回答します。また、他のリリースではあまり見られないほど徹底してオープンです。重みに加え、公開されている学習データの構成や学習設定を含む、学習の詳細がすべて公開されています。Hugging Faceは2025年7月8日にApache 2.0で公開しました。このサイズならほぼどのマシンでも動作し、専用GPUは必要ありません。

仕様SmolLM3-3B
総パラメータ数3.08B
アーキテクチャデコーダー専用Transformer、GQAとNoPE(比率3:1)
事前学習11.2Tトークン、ウェブ・コード・数学・推論の段階的な学習カリキュラム
コンテキスト長64Kで学習、YaRNで最大128Kトークン
対応言語英語、フランス語、スペイン語、ドイツ語、イタリア語、ポルトガル語
推論2つのモード、デフォルトで思考が有効、/thinkと/no_thinkフラグ
ツール呼び出しXML形式のツール呼び出し、またはPython形式のコードによる呼び出し
公開日2025年7月8日
ライセンスApache 2.0

推論能力は事後学習によって得られています。140Bの推論トークンによる中間学習を行い、その後、教師ありファインチューニングとAnchored Preference Optimizationによるアラインメントを実施しています。ツール呼び出しは、XMLタグ内のJSONデータ、またはコードスニペット内のPython形式の関数呼び出しという2つの形式に対応しています。6言語をネイティブにサポートしています。アラビア語、中国語、ロシア語のデータも学習していますが、それぞれのトークン数は少ないため、補助的な対応と考えてください。配布時の設定ではコンテキスト長の上限は65,536トークンで、YaRNによるropeスケーリングで128Kまで拡張できます。Hugging Faceはサンプリング設定としてtemperature 0.6とtop_p 0.95を推奨し、ローカル推論用としてllama.cpp、ONNX、MLX、MLC、ExecuTorchを挙げています。

SmolLM3-3Bのベンチマーク

モデルカードに掲載されたHugging Faceの公開時の数値では、拡張思考を無効にしたSmolLM3-3Bを、Qwen2.5-3B、Llama3.1-3B、Qwen3-1.7B、Qwen3-4Bと比較しています。

ベンチマークSmolLM3-3BQwen2.5-3BLlama3.1-3BQwen3-1.7BQwen3-4B
AIME 2025
数学競技
9.32.90.38.017.1
GSM-Plus
数学問題
72.874.159.268.382.1
LiveCodeBench v4
競技プログラミング
15.210.53.415.024.9
GPQA Diamond
専門的な科学知識
35.732.229.431.844.4
IFEval
指示追従
76.765.671.674.068.9
Global MMLU
多言語知識
53.550.5446.849.565.1

より大きなQwen3-4Bが、ほとんどの項目で首位に立っています。3Bクラス内では状況が異なります。SmolLM3-3Bは指示追従で単独首位となり、AIME、LiveCodeBench、GPQA Diamondでもリードしています。一方、GSM-PlusではQwen2.5-3Bがわずかに上回っています。拡張思考を有効にすると数学と科学のスコアが大きく伸び、AIME 2025は9.3から36.7に、GPQA Diamondは35.7から41.7に上昇します。

SmolLM3-3Bのハードウェア要件

システム要件で確認すべきなのはメモリです。パラメータ数3Bなら、ほぼどの性能クラスでも要件を満たします。以下のビルドとファイルサイズは、unsloth/SmolLM3-3B-GGUFリポジトリに基づいています。

メモリ推奨ビルドファイルサイズ
2 GBUD-IQ2_M1.15 GB
4 GBQ4_K_M1.92 GB
8 GBQ8_03.28 GB
16 GB以上BF166.16 GB

隣り合うファイルのサイズ差は数百メガバイトなので、2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。フル精度のBF16ファイルでもわずか6.16 GBなので、ほとんどのマシンでは低ビット量子化版を使う必要がありません。この形式に馴染みがなければ、まずGGUFとは何かを確認してください。

Atomic ChatでSmolLM3-3Bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでSmolLM3-3Bを検索し、Download Optionsを開きます。
  3. お使いのメモリに収まるビルドを選び、チャットを開始します。

同じファミリーの他のモデルについては、ローカルで実行できるすべてのSmolLMモデル、またはポケットサイズの兄弟モデルSmolLM2-135M-Instructをご覧ください。

SmolLM3-3Bのライセンス

SmolLM3-3BはApache 2.0で公開されています。ロイヤリティなしで商用利用、改変、再配布が認められているため、このモデルを基に製品を開発し、利用料なしで自分のハードウェア上で実行できます。Hugging Faceは、一般的な注意事項も添えています。出力は不正確だったり偏りを含んだりする可能性があるため、確実な情報源としてではなく、補助ツールとして扱ってください。

Hugging Faceからモデルをダウンロード

pip install -U "transformers>=4.53.0"
huggingface-cli download HuggingFaceTB/SmolLM3-3B
# OpenAI互換サーバー:
vllm serve HuggingFaceTB/SmolLM3-3B --enable-auto-tool-choice --tool-call-parser=hermes
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d {
    "model": "HuggingFaceTB/SmolLM3-3B",
    "messages": [{"role": "user", "content": "Give me a brief explanation of gravity."}],
    "temperature": 0.6,
    "top_p": 0.95,
    "chat_template_kwargs": {"enable_thinking": false}
  }
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "HuggingFaceTB/SmolLM3-3B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)
messages = [{"role": "user", "content": "Explain gravity simply."}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
out = model.generate(**inputs, max_new_tokens=512, temperature=0.6, top_p=0.95)
print(tokenizer.decode(out[0]))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "EMPTY" });
const res = await client.chat.completions.create({
  model: "HuggingFaceTB/SmolLM3-3B",
  messages: [{ role: "user", content: "Explain gravity simply." }],
  temperature: 0.6,
  top_p: 0.95,
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

SmolLM3-3Bは、Hugging Faceが2025年に公開した、パラメータ数3Bのデコーダー専用言語モデルです。指示チューニング済みのモデルで、2つのモードによる推論、6言語のネイティブ対応、最大128Kトークンのコンテキスト処理を備えています。

はい。SmolLM3-3BはApache 2.0ライセンスで公開されており、商用利用、改変、再配布が認められています。Hugging Faceはデータの構成や学習設定を含む学習の詳細もすべて公開しているため、完全にオープンなモデルです。

パラメータ数3BのSmolLM3-3Bは、4ビット量子化ならVRAMが約8 GBのGPUで動作し、フル精度のbf16での推論は約6-8 GBに収まります。量子化済みのGGUFビルドは、llama.cppまたはMLXを介してCPUやApple Siliconでも動作するため、一般向けのノートPCでも利用できます。

SmolLM3-3Bはコンテキスト長64Kで学習されており、YaRNによる外挿で128Kトークンまで拡張できます。配布されているconfig.jsonでは、デフォルトで65,536トークンに設定されています。YaRNのrope_scaling設定を追加すると、より長いコンテキスト長を有効にできます。

どちらも思考モードを備えた小型の推論モデルです。Qwen3-4Bはより大きく、AIMEやGPQAなど、ほとんどのベンチマークで高いスコアを記録しています。一方、SmolLM3-3Bはより小さく、学習データが公開された完全にオープンなモデルで、指示追従ではリードしています(思考なしモードでIFEval 76.7)。SmolLM3は6言語をネイティブにサポートしていますが、Qwen3はより幅広い言語に対応しています。