SmolLM2-135M-Instructとは?
SmolLM2-135M-Instructは、135M、360M、1.7Bパラメータのモデルを擁するHugging FaceのSmolLM2ファミリーで最小のモデルです。コンパクトなTransformerデコーダーで、Hugging Faceはデバイス上で動作するほど軽量だと説明しています。モデルカードでは、このリリースにsafetensors、onnx、transformers.jsのタグが付いています。クイックスタートでは、Pythonのtransformers、デバイス指定フラグをcpuにして実行するTRLのチャットCLI、Hubから同じチェックポイントを取得するJavaScriptのTransformers.jsパイプラインという3つの導入方法を紹介しています。GGUFは別系統です。提供元のREADMEには記載がなく、後述の量子化ファイルはサードパーティーのリポジトリunsloth/SmolLM2-135M-Instruct-GGUFにあるもので、F16ビルドは0.27 GBです。Hugging Faceは2024年10月31日にApache 2.0で重みを公開しました。その背景にあるデータ中心の学習手法は、SmolLM2の論文arXiv 2502.02737にまとめられています。
| 仕様 | SmolLM2-135M-Instruct |
|---|---|
| 総パラメータ数 | 135M (134,515,008) |
| アーキテクチャ | Transformerデコーダー |
| ベースモデル | SmolLM2-135M |
| ファミリーのモデルサイズ | 135M, 360M, 1.7B |
| モダリティ | テキストのみ |
| 対応言語 | 英語 |
| 事前学習トークン数 | 2T |
| 事前学習データ | FineWeb-Edu、DCLM、The Stackに加え、チームが選別し、フィルタリングしたデータセット |
| 学習時の数値精度 | bfloat16 |
| 学習用ハードウェア | H100 GPU 64基 |
| 学習フレームワーク | nanotron |
| 事後学習 | smol-smoltalkでSFTを実施後、UltraFeedbackでDPOを実施 |
| 公開形式 | safetensors, ONNX |
| 論文 | arXiv 2502.02737 |
| 公開日 | 2024年10月31日 |
| ライセンス | Apache 2.0 |
この指示チューニング済みモデルは、SmolLM2-135Mのベースチェックポイントを出発点とし、公開データセットと選別されたデータセットを組み合わせて教師ありファインチューニングを行い、その後UltraFeedbackで直接選好最適化(DPO)を行っています。Hugging Faceによると、Argillaが開発したSynth-APIGen-v0.1などのデータセットにより、文章の書き換え、要約、関数呼び出しにも対応していますが、この3つのうち関数呼び出しに対応するのは1.7Bのみです。Hugging FaceはSFTデータセットをHuggingFaceTB/smol-smoltalkとして、ファインチューニングのコードをalignment-handbookのレシピとして公開しています。選好学習の段階では、HuggingFaceH4/ultrafeedback_binarizedとして公開されている、二値化されたUltraFeedbackを使用しています。このモデルは主に英語を理解し、生成します。Hugging Faceは限界も明示しています。出力は必ずしも事実に即しているとは限らず、論理的に一貫していない場合や、学習データに含まれるバイアスを反映する場合があります。そのため、補助ツールとして扱い、重要な内容は検証してください。
SmolLM2-135M-Instructのベンチマーク
Hugging Faceがlightevalで評価し、モデルカードに公開した数値では、この指示チューニング済みモデルを前世代のSmolLM-135M-Instructと比較しています。各行に別途記載がない限り、すべてゼロショット評価です。
| ベンチマーク | SmolLM2-135M-Instruct | SmolLM-135M-Instruct |
|---|---|---|
IFEval 指示追従 | 29.9 | 17.2 |
MT-Bench 会話品質 | 19.8 | 16.8 |
HellaSwag 常識推論 | 40.9 | 38.9 |
ARC (Average) 科学の設問 | 37.3 | 33.9 |
PIQA 物理的な推論 | 66.3 | 64.0 |
MMLU (cloze) 学術知識 | 29.3 | 28.3 |
BBH (3-shot) 高難度の推論 | 28.2 | 25.2 |
GSM8K (5-shot) 学校レベルの数学 | 1.4 | 1.4 |
SmolLM2は、両モデルが1.4を記録したGSM8Kを除くすべての項目で上回っており、差が最も大きいのは29.9対17.2のIFEvalです。率直に解釈すると、このモデルは短く範囲が明確な指示に前世代よりはるかによく従いますが、135Mパラメータでは数学能力は実質的にありません。
同じモデルカードには、SmolLM2-135M-8kと表記された事前学習済みのベースチェックポイントとSmolLM-135Mの比較も掲載されています。HellaSwagは42.1対41.2、ARCの平均は43.9対42.4、MMLUの穴埋め形式は31.5対30.2、CommonsenseQAは33.9対32.7、OpenBookQAは34.6対34.0、GSM8Kは1.4対1.0、PIQAは68.4で同点、Winograndeは51.3で同点、TriviaQAは4.1対4.3で、旧モデルが上回る唯一の項目です。Hugging Faceは、このファミリーをデバイス上で動作する軽量さを維持しながら幅広いタスクを解決するモデル群と位置づけ、SmolLM1からの進歩として指示追従、知識、推論を挙げています。2つの表はその説明を裏づけています。最も明確な改善が見られるのはIFEvalとARCで、数学ではありません。
SmolLM2-135M-Instructのハードウェア要件
確認すべきシステム要件はメモリですが、このモデルではほとんど問題になりません。どのビルドも0.3 GB未満で、以下のGGUFファイルはサードパーティーのリポジトリunsloth/SmolLM2-135M-Instruct-GGUFのものです。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 512 MB | SmolLM2-135M-Instruct-Q2_K | 0.09 GB |
| 768 MB | SmolLM2-135M-Instruct-Q4_K_M | 0.11 GB |
| 1 GB | SmolLM2-135M-Instruct-Q5_K_M | 0.11 GB |
| 2 GB | SmolLM2-135M-Instruct-Q8_0 | 0.14 GB |
| 4 GB以上 | SmolLM2-135M-Instruct-F16 | 0.27 GB |
2つのビルドがどちらもメモリに収まる場合は、大きいほうを選んでください。Q2_KからF16までの全ビルドのサイズ差は0.18 GBに収まり、Q3_K_MはQ2_Kと同じ0.09 GB、Q6_KはQ8_0と同じ0.14 GBです。
Atomic ChatでSmolLM2-135M-Instructを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでSmolLM2-135M-Instructを検索し、Download Optionsを開きます。
- 利用可能なメモリに収まるビルドを選び、チャットを開始します。
ラインアップのほかのモデルについては、ローカルで実行できるすべてのSmolLMモデルや、より大きなSmolLM3-3Bを参照してください。ファイル形式になじみがない方は、GGUFとは何かを説明する入門記事もご覧ください。
SmolLM2-135M-Instructのライセンス
SmolLM2-135M-InstructはApache 2.0で公開されており、ロイヤリティなしで商用利用、改変、再配布が認められています。Hugging FaceはSFTデータセットとファインチューニングのコードも公開しているため、独自のデータでモデルを再学習または適応させ、その成果物を提供できます。SmolLM2の論文arXiv 2502.02737には、その背景にあるデータ中心の学習手法が記載されています。
