Ling-3.0-flash

更新
04.10.2026
思考
ツール利用
推論
コード生成
多言語

Ling-3.0-flashは、トークンごとに有効になるパラメータがわずか5.1Bの、124Bのハイブリッド線形MoEです。ソフトウェアエンジニアリングでは、はるかに大規模なモデルに匹敵します。

基本情報

  • ライセンス: MIT
  • パラメータ数: 合計124B、トークンごとに5.1Bが有効
  • コンテキスト長: 262,144トークン
  • アーキテクチャ: ハイブリッド線形アテンション、ルーティング対象のエキスパート512個
  • 最小ハードウェア要件: AD-IQ2_XXSで約48 GBのメモリ

Ling-3.0-flashとは

Ling-3.0-flashは、inclusionAIが2026年8月2日にMITライセンスで公開したハイブリッド推論モデルです。総パラメータ数は124Bで、トークンごとにそのうち5.1Bが有効になります。これは、同研究組織の以前の兆規模のフラッグシップモデルで有効になっていたパラメータ数の約12分の1です。

仕様Ling-3.0-flash
総パラメータ数124B
有効パラメータ数トークンあたり5.1B
アーキテクチャハイブリッド線形MoE、ルーティング対象のエキスパート512個と共有エキスパート1個、有効なエキスパート8個
レイヤーKDAブロック35個とゲート付きMLAブロック7個
コンテキスト長262,144トークン
モダリティテキスト入力、テキスト出力
推論ハイブリッド推論にネイティブ対応、思考モードはデフォルトで有効
リリース日2026年8月2日
ライセンスMIT

多くのMoEモデルと異なるのは、アテンションの構成です。ゲート付きMLAブロック1個に対してKimi Delta Attentionブロックを5個配置しています。この構成は後から付け加えたものではなく、事前学習の開始時に採用されました。線形アテンションのブロックは固定サイズの状態を保持するため、すべてのレイヤーで完全なKVキャッシュを保持するモデルに比べ、長い会話でのメモリ消費を大幅に抑えられます。

Ling-3.0-flashのベンチマーク

各モデルの開発元がそれぞれ測定・公開した数値を使い、inclusionAIの以前のフラッグシップモデル、現在のMoEモデル群、デンスモデルのQwen3.8-27Bと比較しています。ハイフンは、開発元がそのベンチマークの結果を公開していないことを示します。

ベンチマークLing-3.0-flashQwen3.8-27BRing-2.6-1TMiniMax-M2.7DeepSeek-V4-Flash
有効パラメータ数
5.1B27.8Bのデンスモデル63B10B13B
AIME 2026
数学コンテスト
93.2-95.894.296.5
HMMT Feb 2026
数学オリンピック
87.0-93.571.994.8
SWE-bench Multilingual
多言語ソフトウェア開発
72.4-56.776.573.3
SWE-bench Pro
高難度ソフトウェア開発
56.661.753.956.252.6
Humanity's Last Exam
専門家向けの問題
22.730.818.328.134.8

両モデルに結果があるベンチマークでは、Qwen3.8-27Bが上回っています。SWE-bench Proでは61.7対56.6、Humanity's Last Examでは30.8対22.7です。一方、Lingの利点はトークンあたりのコストにあります。デンスモデルの27.8Bに対し、有効パラメータ数は5.1Bです。数学では、より大規模なMoEモデルが引き続き優位に立っています。

Ling-3.0-flashのハードウェア要件

システム要件で確認すべきなのはメモリです。私たちは元の重みからモデルを量子化し、各ビルドをAtomicChat/Ling-3.0-flash-GGUFとして公開しました。

メモリ選ぶビルドファイルサイズ
48 GBAD-IQ2_XXS39.2 GB
64 GBAD-IQ2_M49.1 GB
96 GBAD-IQ4_XXS69.3 GB
128 GB以上AD-Q4_K_S74.2 GB

48 GBのMacBook Proでは、GPUメモリの上限を引き上げればAD-IQ2_XXSを実行できます。128 GBのMac Studioには、より大きなビルドを実行する余裕があります。PCでは、アテンション層をGPU上に保持し、エキスパートをシステムRAMにオフロードします。有効パラメータ数が5.1Bなので、24 GBのGPUと64 GBのRAMの組み合わせでも実用的に動作します。

Atomic ChatでLing 3.0 Flashを実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応する無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでLing-3.0-flashを検索し、Download Optionsを開きます。
  3. 搭載メモリに収まるビルドを選び、チャットを始めます。

量子化の一覧表とllama.cppのコマンドを含む詳しい手順は、私たちのLing 3.0 Flashをローカルで実行するためのガイドに掲載しています。

GGUFの量子化の各段階にまだなじみがなければ、まずGGUFとはをご覧ください。Appleの形式との比較は、GGUFとMLXの比較で確認できます。

Ling-3.0-flashのライセンス

Ling-3.0-flashはMITライセンスで公開されています。コードに著作権表示を残すことを条件に、商用利用、改変、再配布、非公開環境へのデプロイが認められます。

Hugging Faceからモデルをダウンロード

huggingface-cli download inclusionAI/Ling-3.0-flash
# 当社のGGUFビルド:
huggingface-cli download AtomicChat/Ling-3.0-flash-GGUF --include "AD-IQ2_M/*"
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Ling-3.0-flash",
    "messages": [{"role": "user", "content": "Write a migration plan for this schema."}],
    "temperature": 0.6,
    "top_p": 0.95,
    "top_k": 20
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "inclusionAI/Ling-3.0-flash"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True, torch_dtype="auto", device_map="auto")

messages = [{"role": "user", "content": "Find the off-by-one in this loop."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
print(tokenizer.decode(model.generate(**inputs, max_new_tokens=2048)[0]))
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "Ling-3.0-flash",
  messages: [{ role: "user", content: "Refactor this module into smaller functions." }],
  temperature: 0.6,
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Ling-3.0-flashは、inclusionAIが2026年8月2日にMITライセンスで公開した、124Bの混合エキスパート(MoE)モデルです。トークンごとに5.1Bのパラメータが有効になり、ハイブリッド線形アテンション構成を採用しています。コンテキスト長は262,144トークンです。

私たちのAD-IQ2_XXSビルドは39.2 GBなので、ユニファイドメモリ48 GBが実用上の下限です。49.1 GBのAD-IQ2_Mは64 GBのマシンに適しており、74.2 GBのAD-Q4_K_Sには128 GBが必要です。

このモデルは、Kimi Delta Attentionブロック5個とゲート付きMLAブロック1個を交互に配置しています。線形アテンションのブロックは、トークンが増えるたびに拡大するKVキャッシュの代わりに固定サイズの状態を保持するため、長いチャットでのメモリ消費は標準的なTransformerよりも大幅に少なくなります。

はい。重みはMITライセンスで提供されており、商用利用、改変、再配布を無料で行えます。

オフロードを使えば実行できます。アテンション層をGPU上に保持し、エキスパートをシステムRAMに移します。トークンごとに有効になるパラメータが5.1Bだけなので、24 GBのGPUと64 GBのRAMの組み合わせでAD-IQ2_Mを実用的な速度で実行できます。