SmolLM3-3Bとは?
SmolLM3-3Bは、小型モデルの可能性を広げるためにHugging Faceが開発した、パラメータ数3Bの言語モデルです。推論には2つのモードがあります。デフォルトで有効な拡張思考では、回答の前に思考過程を出力します。/no_thinkフラグで無効にすると、すばやく直接回答します。また、他のリリースではあまり見られないほど徹底してオープンです。重みに加え、公開されている学習データの構成や学習設定を含む、学習の詳細がすべて公開されています。Hugging Faceは2025年7月8日にApache 2.0で公開しました。このサイズならほぼどのマシンでも動作し、専用GPUは必要ありません。
| 仕様 | SmolLM3-3B |
|---|---|
| 総パラメータ数 | 3.08B |
| アーキテクチャ | デコーダー専用Transformer、GQAとNoPE(比率3:1) |
| 事前学習 | 11.2Tトークン、ウェブ・コード・数学・推論の段階的な学習カリキュラム |
| コンテキスト長 | 64Kで学習、YaRNで最大128Kトークン |
| 対応言語 | 英語、フランス語、スペイン語、ドイツ語、イタリア語、ポルトガル語 |
| 推論 | 2つのモード、デフォルトで思考が有効、/thinkと/no_thinkフラグ |
| ツール呼び出し | XML形式のツール呼び出し、またはPython形式のコードによる呼び出し |
| 公開日 | 2025年7月8日 |
| ライセンス | Apache 2.0 |
推論能力は事後学習によって得られています。140Bの推論トークンによる中間学習を行い、その後、教師ありファインチューニングとAnchored Preference Optimizationによるアラインメントを実施しています。ツール呼び出しは、XMLタグ内のJSONデータ、またはコードスニペット内のPython形式の関数呼び出しという2つの形式に対応しています。6言語をネイティブにサポートしています。アラビア語、中国語、ロシア語のデータも学習していますが、それぞれのトークン数は少ないため、補助的な対応と考えてください。配布時の設定ではコンテキスト長の上限は65,536トークンで、YaRNによるropeスケーリングで128Kまで拡張できます。Hugging Faceはサンプリング設定としてtemperature 0.6とtop_p 0.95を推奨し、ローカル推論用としてllama.cpp、ONNX、MLX、MLC、ExecuTorchを挙げています。
SmolLM3-3Bのベンチマーク
モデルカードに掲載されたHugging Faceの公開時の数値では、拡張思考を無効にしたSmolLM3-3Bを、Qwen2.5-3B、Llama3.1-3B、Qwen3-1.7B、Qwen3-4Bと比較しています。
| ベンチマーク | SmolLM3-3B | Qwen2.5-3B | Llama3.1-3B | Qwen3-1.7B | Qwen3-4B |
|---|---|---|---|---|---|
AIME 2025 数学競技 | 9.3 | 2.9 | 0.3 | 8.0 | 17.1 |
GSM-Plus 数学問題 | 72.8 | 74.1 | 59.2 | 68.3 | 82.1 |
LiveCodeBench v4 競技プログラミング | 15.2 | 10.5 | 3.4 | 15.0 | 24.9 |
GPQA Diamond 専門的な科学知識 | 35.7 | 32.2 | 29.4 | 31.8 | 44.4 |
IFEval 指示追従 | 76.7 | 65.6 | 71.6 | 74.0 | 68.9 |
Global MMLU 多言語知識 | 53.5 | 50.54 | 46.8 | 49.5 | 65.1 |
より大きなQwen3-4Bが、ほとんどの項目で首位に立っています。3Bクラス内では状況が異なります。SmolLM3-3Bは指示追従で単独首位となり、AIME、LiveCodeBench、GPQA Diamondでもリードしています。一方、GSM-PlusではQwen2.5-3Bがわずかに上回っています。拡張思考を有効にすると数学と科学のスコアが大きく伸び、AIME 2025は9.3から36.7に、GPQA Diamondは35.7から41.7に上昇します。
SmolLM3-3Bのハードウェア要件
システム要件で確認すべきなのはメモリです。パラメータ数3Bなら、ほぼどの性能クラスでも要件を満たします。以下のビルドとファイルサイズは、unsloth/SmolLM3-3B-GGUFリポジトリに基づいています。
| メモリ | 推奨ビルド | ファイルサイズ |
|---|---|---|
| 2 GB | UD-IQ2_M | 1.15 GB |
| 4 GB | Q4_K_M | 1.92 GB |
| 8 GB | Q8_0 | 3.28 GB |
| 16 GB以上 | BF16 | 6.16 GB |
隣り合うファイルのサイズ差は数百メガバイトなので、2つのビルドがどちらもメモリに収まるなら、大きい方を選んでください。フル精度のBF16ファイルでもわずか6.16 GBなので、ほとんどのマシンでは低ビット量子化版を使う必要がありません。この形式に馴染みがなければ、まずGGUFとは何かを確認してください。
Atomic ChatでSmolLM3-3Bを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでSmolLM3-3Bを検索し、Download Optionsを開きます。
- お使いのメモリに収まるビルドを選び、チャットを開始します。
同じファミリーの他のモデルについては、ローカルで実行できるすべてのSmolLMモデル、またはポケットサイズの兄弟モデルSmolLM2-135M-Instructをご覧ください。
SmolLM3-3Bのライセンス
SmolLM3-3BはApache 2.0で公開されています。ロイヤリティなしで商用利用、改変、再配布が認められているため、このモデルを基に製品を開発し、利用料なしで自分のハードウェア上で実行できます。Hugging Faceは、一般的な注意事項も添えています。出力は不正確だったり偏りを含んだりする可能性があるため、確実な情報源としてではなく、補助ツールとして扱ってください。
