SmolLM2-135M-Instruct

更新
05.10.2026
推論

Hugging FaceのSmolLM2ファミリーに属する、135Mパラメータの指示チューニング済みLLMです。CPUやデバイス上で動作する小ささです。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 135M
  • コンテキスト長: モデルカードに記載なし
  • モダリティ: テキストのみ、英語
  • 最小ハードウェア要件: CPUで動作。F16 GGUFは0.27 GB

SmolLM2-135M-Instructとは?

SmolLM2-135M-Instructは、135M、360M、1.7Bパラメータのモデルを擁するHugging FaceのSmolLM2ファミリーで最小のモデルです。コンパクトなTransformerデコーダーで、Hugging Faceはデバイス上で動作するほど軽量だと説明しています。モデルカードでは、このリリースにsafetensors、onnx、transformers.jsのタグが付いています。クイックスタートでは、Pythonのtransformers、デバイス指定フラグをcpuにして実行するTRLのチャットCLI、Hubから同じチェックポイントを取得するJavaScriptのTransformers.jsパイプラインという3つの導入方法を紹介しています。GGUFは別系統です。提供元のREADMEには記載がなく、後述の量子化ファイルはサードパーティーのリポジトリunsloth/SmolLM2-135M-Instruct-GGUFにあるもので、F16ビルドは0.27 GBです。Hugging Faceは2024年10月31日にApache 2.0で重みを公開しました。その背景にあるデータ中心の学習手法は、SmolLM2の論文arXiv 2502.02737にまとめられています。

仕様SmolLM2-135M-Instruct
総パラメータ数135M (134,515,008)
アーキテクチャTransformerデコーダー
ベースモデルSmolLM2-135M
ファミリーのモデルサイズ135M, 360M, 1.7B
モダリティテキストのみ
対応言語英語
事前学習トークン数2T
事前学習データFineWeb-Edu、DCLM、The Stackに加え、チームが選別し、フィルタリングしたデータセット
学習時の数値精度bfloat16
学習用ハードウェアH100 GPU 64基
学習フレームワークnanotron
事後学習smol-smoltalkでSFTを実施後、UltraFeedbackでDPOを実施
公開形式safetensors, ONNX
論文arXiv 2502.02737
公開日2024年10月31日
ライセンスApache 2.0

この指示チューニング済みモデルは、SmolLM2-135Mのベースチェックポイントを出発点とし、公開データセットと選別されたデータセットを組み合わせて教師ありファインチューニングを行い、その後UltraFeedbackで直接選好最適化(DPO)を行っています。Hugging Faceによると、Argillaが開発したSynth-APIGen-v0.1などのデータセットにより、文章の書き換え、要約、関数呼び出しにも対応していますが、この3つのうち関数呼び出しに対応するのは1.7Bのみです。Hugging FaceはSFTデータセットをHuggingFaceTB/smol-smoltalkとして、ファインチューニングのコードをalignment-handbookのレシピとして公開しています。選好学習の段階では、HuggingFaceH4/ultrafeedback_binarizedとして公開されている、二値化されたUltraFeedbackを使用しています。このモデルは主に英語を理解し、生成します。Hugging Faceは限界も明示しています。出力は必ずしも事実に即しているとは限らず、論理的に一貫していない場合や、学習データに含まれるバイアスを反映する場合があります。そのため、補助ツールとして扱い、重要な内容は検証してください。

SmolLM2-135M-Instructのベンチマーク

Hugging Faceがlightevalで評価し、モデルカードに公開した数値では、この指示チューニング済みモデルを前世代のSmolLM-135M-Instructと比較しています。各行に別途記載がない限り、すべてゼロショット評価です。

ベンチマークSmolLM2-135M-InstructSmolLM-135M-Instruct
IFEval
指示追従
29.917.2
MT-Bench
会話品質
19.816.8
HellaSwag
常識推論
40.938.9
ARC (Average)
科学の設問
37.333.9
PIQA
物理的な推論
66.364.0
MMLU (cloze)
学術知識
29.328.3
BBH (3-shot)
高難度の推論
28.225.2
GSM8K (5-shot)
学校レベルの数学
1.41.4

SmolLM2は、両モデルが1.4を記録したGSM8Kを除くすべての項目で上回っており、差が最も大きいのは29.9対17.2のIFEvalです。率直に解釈すると、このモデルは短く範囲が明確な指示に前世代よりはるかによく従いますが、135Mパラメータでは数学能力は実質的にありません。

同じモデルカードには、SmolLM2-135M-8kと表記された事前学習済みのベースチェックポイントとSmolLM-135Mの比較も掲載されています。HellaSwagは42.1対41.2、ARCの平均は43.9対42.4、MMLUの穴埋め形式は31.5対30.2、CommonsenseQAは33.9対32.7、OpenBookQAは34.6対34.0、GSM8Kは1.4対1.0、PIQAは68.4で同点、Winograndeは51.3で同点、TriviaQAは4.1対4.3で、旧モデルが上回る唯一の項目です。Hugging Faceは、このファミリーをデバイス上で動作する軽量さを維持しながら幅広いタスクを解決するモデル群と位置づけ、SmolLM1からの進歩として指示追従、知識、推論を挙げています。2つの表はその説明を裏づけています。最も明確な改善が見られるのはIFEvalとARCで、数学ではありません。

SmolLM2-135M-Instructのハードウェア要件

確認すべきシステム要件はメモリですが、このモデルではほとんど問題になりません。どのビルドも0.3 GB未満で、以下のGGUFファイルはサードパーティーのリポジトリunsloth/SmolLM2-135M-Instruct-GGUFのものです。

メモリ選ぶビルドファイルサイズ
512 MBSmolLM2-135M-Instruct-Q2_K0.09 GB
768 MBSmolLM2-135M-Instruct-Q4_K_M0.11 GB
1 GBSmolLM2-135M-Instruct-Q5_K_M0.11 GB
2 GBSmolLM2-135M-Instruct-Q8_00.14 GB
4 GB以上SmolLM2-135M-Instruct-F160.27 GB

2つのビルドがどちらもメモリに収まる場合は、大きいほうを選んでください。Q2_KからF16までの全ビルドのサイズ差は0.18 GBに収まり、Q3_K_MはQ2_Kと同じ0.09 GB、Q6_KはQ8_0と同じ0.14 GBです。

Atomic ChatでSmolLM2-135M-Instructを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでSmolLM2-135M-Instructを検索し、Download Optionsを開きます。
  3. 利用可能なメモリに収まるビルドを選び、チャットを開始します。

ラインアップのほかのモデルについては、ローカルで実行できるすべてのSmolLMモデルや、より大きなSmolLM3-3Bを参照してください。ファイル形式になじみがない方は、GGUFとは何かを説明する入門記事もご覧ください。

SmolLM2-135M-Instructのライセンス

SmolLM2-135M-InstructはApache 2.0で公開されており、ロイヤリティなしで商用利用、改変、再配布が認められています。Hugging FaceはSFTデータセットとファインチューニングのコードも公開しているため、独自のデータでモデルを再学習または適応させ、その成果物を提供できます。SmolLM2の論文arXiv 2502.02737には、その背景にあるデータ中心の学習手法が記載されています。

Hugging Faceからモデルをダウンロード

pip install -U transformers
huggingface-cli download HuggingFaceTB/SmolLM2-135M-Instruct
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "HuggingFaceTB/SmolLM2-135M-Instruct",
    "messages": [{"role": "user", "content": "Summarize this paragraph."}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer
checkpoint = "HuggingFaceTB/SmolLM2-135M-Instruct"
tokenizer = AutoTokenizer.from_pretrained(checkpoint)
model = AutoModelForCausalLM.from_pretrained(checkpoint)
messages = [{"role": "user", "content": "What is gravity?"}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
out = model.generate(inputs, max_new_tokens=50)
print(tokenizer.decode(out[0]))
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "HuggingFaceTB/SmolLM2-135M-Instruct",
  messages: [{ role: "user", content: "Rewrite this sentence more formally." }]
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

SmolLM2-135M-Instructは、Hugging FaceのSmolLM2ファミリーに属する135Mパラメータの指示チューニング済み言語モデルです。Llama型のTransformerデコーダーアーキテクチャを採用し、教師ありファインチューニングとUltraFeedbackでの直接選好最適化(DPO)によってファインチューニングされています。SmolLM2の3つのサイズ(135M、360M、1.7B)の中で最小で、デバイス上でのチャットやテキスト処理を対象としています。

SmolLM2-135M-Instructはパラメータ数が135Mにとどまり、デフォルトの数値精度でのメモリ使用量も約720 MBのため、専用GPUがなくてもCPUやリソースの限られたデバイスで無理なく動作します。CPUで推論できますが、トークン生成はGPUより遅くなります。数 GBのRAMがあれば十分です。量子化されたGGUFビルドではさらに小さくなり、ノートPC、スマートフォン、エッジハードウェアに適しています。

はい。SmolLM2-135M-InstructはApache 2.0ライセンスで公開されており、ライセンスと通知文を保持する限り、商用利用、私的利用、改変、再配布を無料で行えます。重みはHugging Faceから誰でもダウンロードでき、Hugging Faceは学習手法とSFTデータセットも公開しています。

SmolLM2-135M-Instructのコンテキスト長は8Kトークンです。事前学習中にデータの混合比率とRoPEの基底値を調整することで、当初の2Kから拡張されています。このモデルは主に英語を理解し、生成します。幅広い多言語利用に向けて学習されていないため、ほかの言語では品質が大幅に低下します。

プライバシーやオフライン動作を重視する、基本的なチャット、指示追従、文章の書き換え、要約といった軽量なデバイス上のタスクに適しています。IFEvalとMT-BenchのスコアはSmolLM-135M-Instructから大きく改善していますが、135Mパラメータでは事実に関する知識や数学に弱く(GSM8Kは約1.4)、出力を検証し、自由度の高い推論ではなく、範囲を限定した単純なタスクに用途を絞ってください。関数呼び出しを利用できるのは、より大きな1.7B版のみです。