VibeThinker-3B

更新
05.10.2026
思考
推論
コード生成

VibeThinker-3BはWeiboAIの3.1B推論モデルです。IMO-AnswerBenchでは671Bから1Tのモデルに並ぶ範囲の76.4を記録し、未見のLeetCodeコンテストでは96.1%を達成しています。

基本情報

  • ライセンス: MIT
  • パラメータ数: 3.1B
  • コンテキスト長: RL学習時のウィンドウは64K。クイックスタートでは最大102,400トークンを生成
  • モダリティ: テキスト入力、テキスト出力(英語)
  • 最小ハードウェア要件: 1.93 GBのQ4_K_M GGUFに対して約4 GBのメモリ

VibeThinker-3Bとは?

VibeThinker-3Bは、WeiboAIがQwen2.5-Coder-3Bをファインチューニングした3.1Bパラメータの推論モデルです。目的は、答えを検証できる問題で多段階の推論を行うことに絞られています。具体的な対象は、数学コンテスト、競技プログラミング、STEMです。WeiboAIは2026年6月12日にMITライセンスで重みを公開しました。ローカルで実行する利点は、そのサイズにあります。4ビットGGUFのファイルサイズは1.93 GBで、モデルは約4 GBのメモリに収まるため、ほぼどのノートPCでも対応できます。

仕様VibeThinker-3B
総パラメータ数3.1B (3,085,938,688)
ベースモデルQwen2.5-Coder-3B
モダリティテキスト入力、テキスト出力(英語)
推論トークン予算クイックスタートのデフォルトは新規生成102,400トークン。最難関の問題には60Kから100Kを推奨
事後学習Spectrum-to-Signal Principle:二段階のSFT、複数分野のRL、自己蒸留、指示追従のRL
ツール呼び出しツール呼び出し向けの学習なし。提供元はエージェント用途を推奨していません
推奨サンプリング設定temperature 1.0、top_p 0.95
公開日2026年6月12日
ライセンスMIT

3Bモデルが最先端モデルと肩を並べる理由は、学習方法にあります。WeiboAIのSpectrum-to-Signal Principleパイプラインでは、まず複数の有効な解法を意図的に維持する二段階のカリキュラムSFTを行います。次に、64Kのコンテキストウィンドウ内で、数学、コード、STEMを対象に、検証可能な報酬を用いた強化学習を行います。その後、最も優れたRLの推論軌跡を単一の生徒モデルに蒸留し直し、最後に指示追従のRLを行います。著者らは、この手法の根底にある仮説をParametric Compression-Coverage Hypothesisと呼んでいます。検証可能な推論は少数のパラメータにうまく圧縮できますが、広範な世界知識はそうではないという仮説です。著者らはこのトレードオフの両面を明示し、分野を限定しないタスクには、より大きな汎用モデルを推奨しています。モデルカードにも明確な注意書きがあります。このモデルはツール呼び出しやエージェントのデータでは学習されていないため、関数呼び出しや自律型コーディングエージェントではなく、LeetCode形式の問題に使用してください。

VibeThinker-3Bのベンチマーク

これらの数値は、WeiboAI自身がモデルカードで公開したものです。注目は、IMOレベルの400問で構成されるIMO-AnswerBenchです。このベンチマークでは、3Bモデルが自身の数百倍の規模を持つモデルに並ぶ範囲のスコアを記録しています。

ベンチマークVibeThinker-3BDeepSeek V3.2GLM-5Kimi K2.5
IMO-AnswerBench
数学オリンピック
76.478.382.581.8
IMO-AnswerBench with CLR
検証済み推論
80.678.382.581.8
LeetCode contests
競技プログラミング
96.1%---

最初の二行は、パラメータ数を踏まえて読んでください。DeepSeek V3.2は671B、GLM-5は744B、Kimi K2.5は1Tで、3Bモデルの素のスコア76.4は、依然として三つすべてを下回ります。答えを検証できるタスクに向けたWeiboAIのテスト時スケーリング手法、Claim-Level Reliability Assessmentを使うと、同じベンチマークのスコアは80.6に上がります。これはDeepSeek V3.2を上回りますが、GLM-5とKimi K2.5には届きません。LeetCodeの行は比較ではありません。2026年4月25日から5月31日までの未見の週次および隔週コンテストで、128問中123問に初回の試行で合格した結果です。WeiboAIは、これに並べて競合モデルの数値を公開していません。モデルカードはAIME、HMMT、LiveCodeBenchの結果にも言及していますが、数値の表は公開していません。

VibeThinker-3Bのハードウェア要件

確認すべきシステム要件はメモリです。以下のGGUFビルドとファイルサイズは、コミュニティリポジトリprithivMLmods/VibeThinker-3B-GGUFに基づいています。

メモリ選ぶビルドファイルサイズ
4 GBQ4_K_M1.93 GB
6 GBQ5_K_M2.22 GB
8 GBQ6_K2.54 GB
12 GBQ8_03.29 GB
16 GB以上BF166.18 GB

隣り合うファイルのサイズ差は数百メガバイトなので、両方のビルドがメモリに収まるなら、大きい方を選んでください。ファイル自体のサイズに加えて、メモリに余裕を残してください。WeiboAIは最難関の問題で60Kから100Kのトークン上限を推奨しており、それほど長い推論過程には、重みに加えてKVキャッシュが必要です。この形式になじみがなければ、まずGGUFとは何かを確認してください。

Atomic ChatでVibeThinker-3Bを実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでVibeThinker-3Bを検索し、Download Optionsを開きます。
  3. お使いのメモリに収まるビルドを選び、チャットを開始します。

同じファミリーのほかのモデルについては、ローカルで実行できるVibeThinkerモデルの一覧をご覧ください。また、別の小型推論モデルであるQwen3-4B Thinking 2507と比較することもできます。

VibeThinker-3Bのライセンス

VibeThinker-3BはMITライセンスで公開されています。商用利用、改変、ファインチューニング、再配布が認められており、唯一の義務は著作権表示とライセンス表示を保持することです。そのため、このモデルを基に開発し、利用料なしで製品に組み込んで提供できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download WeiboAI/VibeThinker-3B
from transformers import AutoModel
model = AutoModel.from_pretrained("WeiboAI/VibeThinker-3B")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

VibeThinker-3Bは、WeiboAIがQwen2.5-Coder-3Bをベースに事後学習した3.1Bパラメータの推論モデルです。数学コンテスト、STEMの問題、コードなど、検証可能なタスクを対象としており、MITライセンスで重みが公開されています。WeiboAIは、小型でありながらAIMEやHMMTなどの数学ベンチマークで、はるかに大きなモデルに匹敵すると報告しています。

本文で紹介するQ4_K_M GGUFは約1.93 GBですが、これはファイルサイズであり、実行時の総メモリ使用量ではありません。本文の約4 GBという目安に加え、OSやほかのアプリが使うメモリも確保してください。必要量は実行環境とコンテキスト長によって増えるため、長い推論を行う場合はさらに余裕が必要です。

はい。重みはMITライセンスで公開されており、商用プロジェクトを含む無料での利用、改変、再配布が認められています。Atomic Chatでローカル実行する場合、サブスクリプションもAPIキーも不要で、トークンごとの料金もかかりません。

はい。モデルをダウンロードすれば、インターネット接続なしで、処理のすべてをご自身のマシン上で実行できます。Atomic Chatでは、すべてのプロンプトと応答がデバイス内にとどまるため、外部サーバーには何も送信されません。

WeiboAIは、数学コンテスト、STEM、競技プログラミングなど、答えを検証できる推論タスク向けのモデルとして公開しています。公式モデルカードでは、ツール呼び出しやエージェント型プログラミングのデータで学習しておらず、関数呼び出し、API連携、自律型コーディングエージェントには推奨しないと明記されています。