Ling-3.0-flashとは
Ling-3.0-flashは、inclusionAIが2026年8月2日にMITライセンスで公開したハイブリッド推論モデルです。総パラメータ数は124Bで、トークンごとにそのうち5.1Bが有効になります。これは、同研究組織の以前の兆規模のフラッグシップモデルで有効になっていたパラメータ数の約12分の1です。
| 仕様 | Ling-3.0-flash |
|---|---|
| 総パラメータ数 | 124B |
| 有効パラメータ数 | トークンあたり5.1B |
| アーキテクチャ | ハイブリッド線形MoE、ルーティング対象のエキスパート512個と共有エキスパート1個、有効なエキスパート8個 |
| レイヤー | KDAブロック35個とゲート付きMLAブロック7個 |
| コンテキスト長 | 262,144トークン |
| モダリティ | テキスト入力、テキスト出力 |
| 推論 | ハイブリッド推論にネイティブ対応、思考モードはデフォルトで有効 |
| リリース日 | 2026年8月2日 |
| ライセンス | MIT |
多くのMoEモデルと異なるのは、アテンションの構成です。ゲート付きMLAブロック1個に対してKimi Delta Attentionブロックを5個配置しています。この構成は後から付け加えたものではなく、事前学習の開始時に採用されました。線形アテンションのブロックは固定サイズの状態を保持するため、すべてのレイヤーで完全なKVキャッシュを保持するモデルに比べ、長い会話でのメモリ消費を大幅に抑えられます。
Ling-3.0-flashのベンチマーク
各モデルの開発元がそれぞれ測定・公開した数値を使い、inclusionAIの以前のフラッグシップモデル、現在のMoEモデル群、デンスモデルのQwen3.8-27Bと比較しています。ハイフンは、開発元がそのベンチマークの結果を公開していないことを示します。
| ベンチマーク | Ling-3.0-flash | Qwen3.8-27B | Ring-2.6-1T | MiniMax-M2.7 | DeepSeek-V4-Flash |
|---|---|---|---|---|---|
有効パラメータ数 | 5.1B | 27.8Bのデンスモデル | 63B | 10B | 13B |
AIME 2026 数学コンテスト | 93.2 | - | 95.8 | 94.2 | 96.5 |
HMMT Feb 2026 数学オリンピック | 87.0 | - | 93.5 | 71.9 | 94.8 |
SWE-bench Multilingual 多言語ソフトウェア開発 | 72.4 | - | 56.7 | 76.5 | 73.3 |
SWE-bench Pro 高難度ソフトウェア開発 | 56.6 | 61.7 | 53.9 | 56.2 | 52.6 |
Humanity's Last Exam 専門家向けの問題 | 22.7 | 30.8 | 18.3 | 28.1 | 34.8 |
両モデルに結果があるベンチマークでは、Qwen3.8-27Bが上回っています。SWE-bench Proでは61.7対56.6、Humanity's Last Examでは30.8対22.7です。一方、Lingの利点はトークンあたりのコストにあります。デンスモデルの27.8Bに対し、有効パラメータ数は5.1Bです。数学では、より大規模なMoEモデルが引き続き優位に立っています。
Ling-3.0-flashのハードウェア要件
システム要件で確認すべきなのはメモリです。私たちは元の重みからモデルを量子化し、各ビルドをAtomicChat/Ling-3.0-flash-GGUFとして公開しました。
| メモリ | 選ぶビルド | ファイルサイズ |
|---|---|---|
| 48 GB | AD-IQ2_XXS | 39.2 GB |
| 64 GB | AD-IQ2_M | 49.1 GB |
| 96 GB | AD-IQ4_XXS | 69.3 GB |
| 128 GB以上 | AD-Q4_K_S | 74.2 GB |
48 GBのMacBook Proでは、GPUメモリの上限を引き上げればAD-IQ2_XXSを実行できます。128 GBのMac Studioには、より大きなビルドを実行する余裕があります。PCでは、アテンション層をGPU上に保持し、エキスパートをシステムRAMにオフロードします。有効パラメータ数が5.1Bなので、24 GBのGPUと64 GBのRAMの組み合わせでも実用的に動作します。
Atomic ChatでLing 3.0 Flashを実行する方法
Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでLing-3.0-flashを検索し、Download Optionsを開きます。
- 搭載メモリに収まるビルドを選び、チャットを始めます。
量子化の一覧表とllama.cppのコマンドを含む詳しい手順は、私たちのLing 3.0 Flashをローカルで実行するためのガイドに掲載しています。
GGUFの量子化の各段階にまだなじみがなければ、まずGGUFとはをご覧ください。Appleの形式との比較は、GGUFとMLXの比較で確認できます。
Ling-3.0-flashのライセンス
Ling-3.0-flashはMITライセンスで公開されています。コードに著作権表示を残すことを条件に、商用利用、改変、再配布、非公開環境へのデプロイが認められます。
