Ornith-1.5-35B-A3B

更新
04.10.2026
思考
ツール利用
画像認識
推論
コード生成
多言語

Ornith-1.5-35B-A3Bは、トークンごとに約3Bのパラメータを有効化する36BのMoEモデルで、コーディングでは規模が10倍のモデルを上回ります。

基本情報

  • ライセンス: MIT
  • パラメータ数: 合計36B、トークンごとに約3Bが有効
  • コンテキスト長: 262,144トークン
  • モダリティ: テキストと画像の入力
  • 最小ハードウェア要件: AD-IQ3_XXS-IQ2_Sでは16 GBのVRAM、IQ4_XSでは24 GB

Ornith-1.5-35B-A3Bとは?

Ornith-1.5-35B-A3BはOrnith 1.5ファミリーの中規模モデルで、2026年8月18日にMITライセンスで公開されました。スパースな混合エキスパートモデルで、総パラメータ数は36B、そのうちトークンごとに約3Bが有効になります。Ornithは、モデルが自ら学習課題を提案し、自らの試行から学ぶ自己改善ループでこのモデルを学習させています。

仕様Ornith-1.5-35B-A3B
総パラメータ数36B
有効パラメータ数トークンごとに約3B、256個のエキスパートのうち8個
アーキテクチャスパースMoE、ハイブリッドアテンション、Qwen3.5スタックを基盤に構築
層数40
コンテキスト長262,144トークン
モダリティテキストと画像の入力
推論思考過程を回答とは別に返します
公開日2026年8月18日
ライセンスMIT

このモデルをダウンロードする価値があるのは、スパースルーティングを採用しているためです。トークンの生成コストは3Bモデルとほぼ同程度でありながら、何倍も大きなモデルに匹敵するスコアを出します。その代償がメモリ容量です。36Bすべてのパラメータをメモリに常駐させる必要があるためです。

Ornith-1.5-35B-A3Bのベンチマーク

モデルカードに掲載されたOrnithの公開時の数値では、置き換え対象の旧モデル、同規模の直接の競合であるQwen3.6-35B-A3B、Muse Glimmer 30B、そしてはるかに大きなQwen3.5-397Bと比較しています。

ベンチマークOrnith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BMuse-Glimmer-30BQwen3.5-397B
Terminal-Bench 2.1
ターミナルエージェント
67.864.252.551.753.5
SWE-bench Verified
ソフトウェア開発
79.075.673.476.076.4
SWE-bench Pro
高難度のソフトウェア開発
59.650.449.551.251.6
GPQA Diamond
専門家レベルの科学
89.286.286.083.588.4
Humanity's Last Exam
専門家レベルの問題
25.620.821.422.028.7
MCP-Atlas
MCPツール
70.264.462.875.572.3
ClawEval
エージェント型コーディング
72.569.868.7-70.7

7項目中5項目で首位に立ち、コーディングのベンチマーク3種すべてで、規模が10倍のQwen3.5-397Bを上回っています。ただし、MCP-Atlasでは引き続きMuse Glimmerが首位のため、純粋なツールルーティングでは優劣が逆になります。

Ornith-1.5-35B-A3Bのハードウェア要件

システム要件で確認すべきなのはメモリ容量です。私たちは元の重みからモデルを量子化し、各ビルドをAtomicChat/Ornith-1.5-35B-A3B-GGUFとして公開しました。

メモリ選ぶビルドファイルサイズ
16 GBAD-IQ3_XXS-IQ2_S13.7 GB
24 GBIQ4_XS18.7 GB
32 GBQ5_K_M24.7 GB
48 GB以上Q6_K28.5 GB

サイズ順で隣り合うファイルの差は1 GBか2 GBなので、両方のビルドがメモリに収まる場合は、大きい方を選んでください。トークンごとに有効になるパラメータは約3Bだけなので、モデルの一部をVRAMではなくシステムRAMに置いても高速に動作します。同規模のデンスモデルではそうはいきません。

Atomic ChatでOrnith-1.5-35B-A3Bを実行する方法

Atomic Chatは、macOS、Windows、Linuxに対応した無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、起動します。
  2. モデルブラウザーでOrnith-1.5-35B-A3Bを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

量子化の一覧表とllama.cppのコマンドを含む詳しい手順は、私たちのOrnith 1.5 35Bをローカルで実行するためのガイドに掲載しています。

小型の姉妹モデルはOrnith-1.5-9Bで、両モデルともOrnithファミリーページに掲載されています。コーディング性能をほかのローカルLLMと比較するには、コーディングに最適なローカルLLMをご覧ください。

Ornith-1.5-35B-A3Bのライセンス

Ornith-1.5-35B-A3BはMITライセンスで公開されています。著作権表示をコードに残す限り、商用利用、改変、再配布、非公開環境へのデプロイが認められます。

Hugging Faceからモデルをダウンロード

huggingface-cli download ornith-ai/Ornith-1.5-35B-A3B
# Atomic ChatのGGUFビルド:
huggingface-cli download AtomicChat/Ornith-1.5-35B-A3B-GGUF Ornith-1.5-35B-A3B-IQ4_XS.gguf
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Ornith-1.5-35B-A3B",
    "messages": [{"role": "user", "content": "Open the repo and fix the failing test."}]
  }'
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "ornith-ai/Ornith-1.5-35B-A3B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto")

messages = [{"role": "user", "content": "Review this diff for race conditions."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
print(tokenizer.decode(model.generate(**inputs, max_new_tokens=2048)[0]))
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "Ornith-1.5-35B-A3B",
  messages: [{ role: "user", content: "Turn this spec into a failing test suite." }],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Ornith-1.5-35B-A3BはOrnithのスパースな混合エキスパートモデルで、総パラメータ数は36B、トークンごとに約3Bが有効になります。2026年8月18日にMITライセンスで公開されました。エージェント型コーディングとツール利用向けに開発されており、コンテキスト長は262,144トークンです。

IQ4_XSは18.7 GBなので、24 GBのグラフィックスカードなら全体をVRAMに収めて実行できます。16 GBでは、13.7 GBのAD-IQ3_XXS-IQ2_Sが収まります。32 GBのMacでは、24.7 GBのQ5_K_Mを実行できます。

有効パラメータ数を表しています。モデルは36Bのパラメータを保持していますが、各トークンの処理に使うのはそのうち約3Bです。そのため、生成コストは3Bモデルとほぼ同程度でありながら、品質ははるかに大きなモデルに匹敵します。

はい。重みにはMITライセンスが適用されているため、商用利用、改変、再配布はいずれも無料で認められています。

Ornith自身が公表した数値では、コーディングとエージェント関連の全項目で上回っています。Terminal-Bench 2.1では52.5に対して67.8、SWE-bench Proでは49.5に対して59.6です。両モデルは同規模で、トークンごとに約3Bのパラメータを有効化します。