VibeThinker-3Bとは?
VibeThinker-3Bは、WeiboAIがQwen2.5-Coder-3Bをファインチューニングした3.1Bパラメータの推論モデルです。目的は、答えを検証できる問題で多段階の推論を行うことに絞られています。具体的な対象は、数学コンテスト、競技プログラミング、STEMです。WeiboAIは2026年6月12日にMITライセンスで重みを公開しました。ローカルで実行する利点は、そのサイズにあります。4ビットGGUFのファイルサイズは1.93 GBで、モデルは約4 GBのメモリに収まるため、ほぼどのノートPCでも対応できます。
| 仕様 | VibeThinker-3B |
|---|---|
| 総パラメータ数 | 3.1B (3,085,938,688) |
| ベースモデル | Qwen2.5-Coder-3B |
| モダリティ | テキスト入力、テキスト出力(英語) |
| 推論トークン予算 | クイックスタートのデフォルトは新規生成102,400トークン。最難関の問題には60Kから100Kを推奨 |
| 事後学習 | Spectrum-to-Signal Principle:二段階のSFT、複数分野のRL、自己蒸留、指示追従のRL |
| ツール呼び出し | ツール呼び出し向けの学習なし。提供元はエージェント用途を推奨していません |
| 推奨サンプリング設定 | temperature 1.0、top_p 0.95 |
| 公開日 | 2026年6月12日 |
| ライセンス | MIT |
3Bモデルが最先端モデルと肩を並べる理由は、学習方法にあります。WeiboAIのSpectrum-to-Signal Principleパイプラインでは、まず複数の有効な解法を意図的に維持する二段階のカリキュラムSFTを行います。次に、64Kのコンテキストウィンドウ内で、数学、コード、STEMを対象に、検証可能な報酬を用いた強化学習を行います。その後、最も優れたRLの推論軌跡を単一の生徒モデルに蒸留し直し、最後に指示追従のRLを行います。著者らは、この手法の根底にある仮説をParametric Compression-Coverage Hypothesisと呼んでいます。検証可能な推論は少数のパラメータにうまく圧縮できますが、広範な世界知識はそうではないという仮説です。著者らはこのトレードオフの両面を明示し、分野を限定しないタスクには、より大きな汎用モデルを推奨しています。モデルカードにも明確な注意書きがあります。このモデルはツール呼び出しやエージェントのデータでは学習されていないため、関数呼び出しや自律型コーディングエージェントではなく、LeetCode形式の問題に使用してください。
VibeThinker-3Bのベンチマーク
これらの数値は、WeiboAI自身がモデルカードで公開したものです。注目は、IMOレベルの400問で構成されるIMO-AnswerBenchです。このベンチマークでは、3Bモデルが自身の数百倍の規模を持つモデルに並ぶ範囲のスコアを記録しています。
| ベンチマーク | VibeThinker-3B | DeepSeek V3.2 | GLM-5 | Kimi K2.5 |
|---|---|---|---|---|
IMO-AnswerBench 数学オリンピック | 76.4 | 78.3 | 82.5 | 81.8 |
IMO-AnswerBench with CLR 検証済み推論 | 80.6 | 78.3 | 82.5 | 81.8 |
LeetCode contests 競技プログラミング | 96.1% | - | - | - |
最初の二行は、パラメータ数を踏まえて読んでください。DeepSeek V3.2は671B、GLM-5は744B、Kimi K2.5は1Tで、3Bモデルの素のスコア76.4は、依然として三つすべてを下回ります。答えを検証できるタスクに向けたWeiboAIのテスト時スケーリング手法、Claim-Level Reliability Assessmentを使うと、同じベンチマークのスコアは80.6に上がります。これはDeepSeek V3.2を上回りますが、GLM-5とKimi K2.5には届きません。LeetCodeの行は比較ではありません。2026年4月25日から5月31日までの未見の週次および隔週コンテストで、128問中123問に初回の試行で合格した結果です。WeiboAIは、これに並べて競合モデルの数値を公開していません。モデルカードはAIME、HMMT、LiveCodeBenchの結果にも言及していますが、数値の表は公開していません。
VibeThinker-3Bのハードウェア要件
確認すべきシステム要件はメモリです。以下のGGUFビルドとファイルサイズは、コミュニティリポジトリprithivMLmods/VibeThinker-3B-GGUFに基づいています。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 4 GB | Q4_K_M | 1.93 GB |
| 6 GB | Q5_K_M | 2.22 GB |
| 8 GB | Q6_K | 2.54 GB |
| 12 GB | Q8_0 | 3.29 GB |
| 16 GB以上 | BF16 | 6.18 GB |
隣り合うファイルのサイズ差は数百メガバイトなので、両方のビルドがメモリに収まるなら、大きい方を選んでください。ファイル自体のサイズに加えて、メモリに余裕を残してください。WeiboAIは最難関の問題で60Kから100Kのトークン上限を推奨しており、それほど長い推論過程には、重みに加えてKVキャッシュが必要です。この形式になじみがなければ、まずGGUFとは何かを確認してください。
Atomic ChatでVibeThinker-3Bを実行する方法
Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
- モデルブラウザーでVibeThinker-3Bを検索し、Download Optionsを開きます。
- お使いのメモリに収まるビルドを選び、チャットを開始します。
同じファミリーのほかのモデルについては、ローカルで実行できるVibeThinkerモデルの一覧をご覧ください。また、別の小型推論モデルであるQwen3-4B Thinking 2507と比較することもできます。
VibeThinker-3Bのライセンス
VibeThinker-3BはMITライセンスで公開されています。商用利用、改変、ファインチューニング、再配布が認められており、唯一の義務は著作権表示とライセンス表示を保持することです。そのため、このモデルを基に開発し、利用料なしで製品に組み込んで提供できます。
