このガイドでわかること:
- Ornith 1.5 35Bの概要と、9Bおよび397Bとの違い
- 実行に必要なハードウェア
- Atomic Chatまたはllama.cppでOrnith 1.5 35Bをローカル実行する方法
お使いのマシンがそれより小規模な構成の場合は、Ornith 1.5 9Bをローカルで実行する方法をご覧ください。この記事では35Bのみを扱います。
Ornith 1.5 35Bとは?
Ornith 1.5 35Bは、DeepReinforceが開発したオープンウェイトのMixture-of-Experts言語モデルで、新しいOrnith 1.5ファミリーの中規模モデルです。このファミリーはエージェント型コーディング向けに学習されており、フラッグシップの397B MoE、この35B MoE、9Bデンスモデルの3サイズが、いずれもMITライセンスで提供されています。35Bの重みは、2026年8月19日にHugging Faceで公開されました。
Ornith 1.5 35Bの主な仕様:
| 仕様 | Ornith 1.5 35B |
|---|---|
| 総パラメータ数 | 34.7Bに加え、1.9BのMulti-Token Predictionヘッドを別途提供 |
| トークンあたりのアクティブパラメータ数 | 約3B:ルーティング対象の256個のエキスパートのうち8個と、1個の共有エキスパート |
| アーキテクチャ | MoE、ハイブリッドアテンション(線形アテンション30層 + フルアテンション10層) |
| 層数 | 40 |
| コンテキスト長 | 標準で262,144トークン、1Mまで拡張可能 |
| モダリティ | テキストと画像の入力 |
| 推論 | 思考はデフォルトで有効、無効化も可能 |
| 複数トークン予測(Multi-Token Prediction) | 元の重みにヘッドを含む。GGUFドラフトファイルはまだ未提供 |
| リリース日 | 2026年8月19日 |
| ライセンス | MIT |
名前のA3Bは、総パラメータ数35Bのうち、トークンごとに3Bのパラメータが有効になることを意味します。速度は3Bに、メモリ使用量は35Bに対応します。ルーターがトークンごとに256個の中から異なる8個を選ぶため、すべてのエキスパートをメモリに常駐させる必要があります。このメモリ要件を回避する方法は、エキスパートをVRAMではなくシステムRAMに置くことです。これにより、このモデルを12 GBカードでも実行できるようになります。ハードウェアのセクションで具体的な数値を示します。
35Bはマルチモーダルでもあり、テキストと一緒に画像を処理できます。また、ベースとなるアーキテクチャであるQwen 3.5のハイブリッドアテンション設計を採用しています。40層のうち30層は線形アテンションを使用し、この方式では会話がどれほど長くなってもメモリ使用量が変わりません。通常はトークンごとに増大するKVキャッシュを保持するのは、残りの10層だけです。そのため、実際には長いチャットや大きな文書を扱う際のメモリ消費が、一般的な35Bモデルよりはるかに少なくなります。
Ornithは、モデルが自ら学習タスクを提案し、自分の試行から学ぶ、DeepReinforceの自己改善プロジェクトです。1.5世代では、そのループをコーディング以外の推論や一般的なエージェント作業にも拡張しています。35Bは推論モデルです。各回答では最終的な応答の前に思考ブロックを出力し、思考を完全に無効化することもできます。
35BにはMulti-Token Predictionヘッドが搭載されています。これは1回の順伝播で複数のトークン候補を生成する1.9Bのブロックで、投機的デコーディングを支えるものと同じ仕組みです。このヘッドは元の重みに含まれていますが、当社のGGUFビルドでは、独立したドラフトファイルとしてはまだ提供していません。
Ornith 1.5のリリースには、混同しやすい3つの異なるモデルが含まれています。
- Ornith 1.5 397Bは、DeepReinforceがClaude Opus 4.8とベンチマークで比較しているフラッグシップのMoEです。パラメータ数が397Bあるため、推論サービスの提供には複数GPUのデータセンタークラスターが必要で、Kimi K3と同じクラスのハードウェアを要します。
- Ornith 1.5 9Bは、ラインアップで最も小さいデンス型の視覚言語モデルです。8 GB GPUまたは16 GB MacBookに収まり、Ornith 1.5 9B専用のガイドも用意しています。
- Ornith 1.5 35Bは、このガイドで扱うMoEであり、3モデルのうち日常的なマシンで動く最も高性能なモデルです。24 GB GPUを搭載したデスクトップ、32 GB Mac、またはエキスパートをシステムRAMに置いた12 GBカードで実行できます。
Ornith 1.5 35Bのベンチマーク
モデルカードに掲載されたDeepReinforceのリリース時の数値では、35BをOrnith 1.0 35B、Qwen3.6 35B A3B、Gemma 4 31B、Qwen3.5-397Bと比較しています。
| Ornith 1.5 35B | Ornith 1.0 35B | Qwen3.6 35B A3B | Gemma 4 31B | Qwen3.5-397B | |
|---|---|---|---|---|---|
Terminal-Bench 2.1 (Terminus-2) エージェントによるターミナル操作タスク | 67.8 | 64.2 | 52.5 | 42.1 | 53.5 |
SWE-bench Verified 実務のソフトウェアエンジニアリングタスク | 79 | 75.6 | 73.4 | 52 | 76.4 |
SWE-bench Pro 実務のソフトウェアエンジニアリング、より難しい評価セット | 59.6 | 50.4 | 49.5 | 35.7 | 51.6 |
GPQA Diamond 専門家レベルの科学の問題 | 89.2 | 86.2 | 86 | 84.3 | 88.4 |
MCP-Atlas MCPサーバー経由のツール使用 | 70.2 | 64.4 | 62.8 | 55 | 72.3 |
Toolathlon-Verified | 48.7 | 42.4 | 41.7 | 40.8 | 38.3 |
35Bは、サイズが11倍のQwen3.5-397Bを、6つのベンチマークのうち5つで上回っています。397B級のモデルが、今や1枚の24 GBカードで動きます。
以下は、同じクラスのローカルモデルについて、各ベンダーが測定したスコアです。
| Ornith 1.5 35B | Qwen 3.8 27B | Muse Glimmer 30B | Nemotron 3.5 Lightning | |
|---|---|---|---|---|
パラメータ数 | 35B MoE (A3B) | 27Bデンスモデル | 30Bデンスモデル | 30B MoE (A3B) |
SWE-bench Verified 実務のソフトウェアエンジニアリングタスク | 79 | - | 76.0 | 51.6 |
GPQA Diamond 専門家レベルの科学の問題 | 89.2 | 89.2 | 83.5 | 75.4 |
Humanity's Last Exam あらゆる分野の専門家レベルの問題 | 25.6 | 30.8 | 22.0 | 11.7 |
この2つ目の表のスコアはすべて、各ベンダーのモデルカードまたはリリースブログから引用しています。各研究機関は独自の評価環境を使っているため、列間の小さな差に大きな意味はありません。ハイフンは、その数値をベンダーが公表していないことを示します。
ここでの直接の競合はQwen3.6 35B A3Bです。このモデルと同じくアクティブパラメータ数3Bの35B MoEで、DeepReinforce自身のモデルカードでも最初の比較対象になっています。リリース時の数値では、35Bはモデルカードに掲載されたすべてのコーディングおよびエージェント系ベンチマークで上回っています。Terminal-Bench 2.1では52.5に対して67.8、SWE-bench Verifiedでは73.4に対して79です。
35Bにとって、より参考になる比較対象は前世代のモデルです。Ornith 1.0 35Bは2026年6月にリリースされ、SWE-bench Verifiedで75.6を記録し、このサイズ帯のローカルでのコーディング向けMoEモデルの中でも最も高性能なものの1つでした。1.5はリリース時の比較表の全項目で上回っています。両者はアーキテクチャも各部のサイズも同じなので、ハードウェア要件の計算をそのまま適用できます。現在Ornith 1.0を実行しているなら、1.5の各ビルドも同じマシンに収まります。
Ornith 1.5 35B GGUF:当社で量子化しました
当社はDeepReinforceの元のBF16重みからAtomicChat Ornith 1.5 35B GGUFリポジトリを作成し、すべてのビルドを非量子化の参照モデルと比較して測定しました。リポジトリには13.7から36.9 GBまでの13種類のビルドに加え、全ビルドで共通して使う、別途ダウンロードが必要なビジョンプロジェクターが含まれています。Multi-Token Predictionヘッドは、これらのファイルには含まれていません。通常の順伝播ではこのヘッドを実行しないため、代わりに独立したドラフトファイルとして提供しています。接頭辞のADはAtomic Dynamicを表し、AD-Q5_K-Q4_Kのように2つを組み合わせた名前は、最も大きい2つのテンソルグループに適用した量子化形式を示します。両方が同じ場合は、名前を1つにまとめます。
| ファイル | サイズ | KLダイバージェンス | Top-1一致率 |
|---|---|---|---|
| Q8_0 | 36.9 GB | 0.011620 | 95.64% |
| AD-Q6_K | 29.1 GB | 0.012961 | 95.31% |
| Q6_K | 28.5 GB | 0.016665 | 94.63% |
| AD-Q6_K-Q5_K | 26.2 GB | 0.015793 | 94.85% |
| Q5_K_M | 24.7 GB | 0.026870 | 93.31% |
| AD-Q5_K-Q4_K | 22.1 GB | 0.025137 | 93.52% |
| AD-Q5_K-IQ4_XS | 21.5 GB | 0.026380 | 93.33% |
| Q4_K_M | 21.2 GB | 0.047718 | 91.01% |
| AD-Q4_K-IQ4_XS | 20.1 GB | 0.031512 | 92.71% |
| IQ4_XS | 18.7 GB | 0.054181 | 90.36% |
| AD-IQ4_XS-IQ3_S | 17.6 GB | 0.057726 | 90.12% |
| AD-IQ3_S-IQ3_XXS | 15.5 GB | 0.087334 | 88.07% |
| AD-IQ3_XXS-IQ2_S | 13.7 GB | 0.141624 | 84.70% |
表の見方:KLダイバージェンスは、量子化モデルの出力分布と元の重みの出力分布との距離を測ります。値が小さいほどよく、0は同一であることを意味します。Top-1一致率は、量子化モデルが参照モデルと同じ次のトークンを選ぶ位置の割合です。全体を1つの指標で把握するには、Top-1一致率を使ってください。次のセクションでは、どのファイルがお使いのハードウェアに収まるかを説明します。
AD-Q5_K-Q4_Kは、標準のQ5_K_Mより小さく、同時に精度も高くなっています。サイズは24.7 GBに対して22.1 GB、KLダイバージェンスは0.0269に対して0.0251です。1段階上のAD-Q6_K-Q5_Kは、標準のQ6_Kより2.3 GB小さく、こちらも精度が高くなっています。
表の数値はすべて当社が測定しました。参照モデルには元のBF16重みを使用しており、キャリブレーション用コーパスは公開済みで、生ログは測定指標のリポジトリにあるため、どの結果もご自身で確認できます。詳しい作成手順はモデルカードに掲載しています。
このモデルでは3つの公開元がQ4_K_Mという名前のファイルを提供していますが、同じファイルではありません。
| 公開元 | サイズ |
|---|---|
| ornith-ai(公式) | 21.7 GB |
| bartowski | 21.9 GB |
| AtomicChat | 21.2 GB |
量子化名が示すのは、公開元が指定した量子化レシピだけです。同じラベルでも、各公開元がそれぞれ異なる構成を選ぶため、1つの名前で3つの異なるサイズになります。ビルドを選ぶ際は、ファイルサイズと測定された品質を基準にしてください。
Ornith 1.5 35Bのハードウェア要件
Ornith 1.5 35Bで確認すべきシステム要件は、メモリです。次の表は、ファイル全体をGPUに載せて実行するために必要なVRAMを示しています。その後のセクションでは、システムRAMに置いたエキスパートを使って実行する方法を説明します。
| 利用可能なVRAM | 推奨GGUF量子化 | ファイルサイズ |
|---|---|---|
| 12から16 GB | AD-IQ3_XXS-IQ2_S | 13.7 GB |
| 16 GB | AD-IQ3_S-IQ3_XXS | 15.5 GB |
| 20 GB | AD-IQ4_XS-IQ3_S | 17.6 GB |
| 24 GB、コンテキスト用の余裕あり | AD-Q4_K-IQ4_XS | 20.1 GB |
| 24 GB | AD-Q5_K-Q4_K | 22.1 GB |
| 32 GB | AD-Q6_K | 29.1 GB |
| 48 GB以上 | Q8_0 | 36.9 GB |
Apple Siliconでは、統合メモリの約75パーセントを利用可能として計算してください。32 GB Macの場合は24 GBの行を参照します。
注:隣り合う2つのファイルで迷った場合は、大きい方を選んでください。1から2ギガバイト多く必要になりますが、誤ったトークンを選ぶ頻度が明らかに低くなります。品質が最も急激に低下する16 GB未満では、特に差が出ます。
メモリ容量の小さいGPUで実行する
メモリ容量の小さいカードでは、ファイルを小さくする代わりに、エキスパートをシステムRAMに置いてください。エキスパートは重みの93パーセントを占めますが、トークンごとに動くのはそのうち3Bだけです。そのため、計算負荷を低く保ったまま、必要なメモリ帯域をRAM側で賄えます。DeepSeek V4 Flashがデスクトップのハードウェアで実用的に動くのも、同じトレードオフによるものです。llama.cppでは、--cpu-moeですべてのエキスパートをCPUに配置し、--n-cpu-moe Nでは最初のN層のエキスパートをオフロードして、残りをGPUに保持します。これにより、アテンション、ルーター、共有エキスパートをVRAMに残したまま、12 GBカードで22.1 GBのAD-Q5_K-Q4_Kを実用的な速度で動かせます。具体的なコマンドはllama.cppのセクションにあります。ダウンロードを計画する際は、ファイル全体のサイズをRAMとVRAMの合計容量と照らし合わせてください。
Ornith 1.5 35Bを実行できるハードウェアは?
- 12 GB GPU(RTX 3060、RTX 4070):エキスパートをシステムRAMに置けば、22.1 GBのAD-Q5_K-Q4_Kを実行できます。コマンドはllama.cppのセクションにあります。
- 16 GB GPU(RTX 4060 Ti 16 GB、RTX 5060 Ti):AD-IQ3_S-IQ3_XXSを完全にVRAM内で実行できます。または、エキスパートをオフロードして4ビットビルドを実行できます。
- 24 GB GPU(RTX 3090、RTX 4090):AD-Q4_K-IQ4_XSを、コンテキスト用の余裕を残して完全にVRAM内で実行できます。会話を短く保つ場合はAD-Q5_K-Q4_Kも実行できます。
- RTX 5090(32 GB VRAM):AD-Q6_Kを完全にVRAM内で実行でき、この量子化ではモデルが元のモデルに近い挙動を示します。
- 48 GB以上(RTX 6000クラス、または24 GBカード2枚):Q8_0のファイル全体をVRAMに載せて実行できます。
- MacBook Pro(32 GB統合メモリ):Metal経由でAD-Q5_K-Q4_Kを実行できます。macOSはデフォルトで、GPUがアドレス指定できるメモリを統合メモリの約75パーセントに制限しているため、32 GB Macではモデルが約24 GBを利用できます。
- Mac Studio、MacBook Pro M4/M5 Max(48-64 GB):統合メモリが48 GB以上ならAD-Q6_Kを、64 GB以上ならQ8_0を実行できます。Apple Siliconでは、GGUFビルドがMetal経由でネイティブに動作します。形式の選択で迷っている場合は、GGUFとMLXの比較ガイドをご覧ください。DeepReinforceは4、6、8ビットの公式MLXビルドも提供しています。
Atomic ChatでOrnith 1.5 35Bをローカル実行する方法
Atomic Chatは、当社が開発した無料のオープンソースのローカルAIアプリです。Hugging Faceのモデルブラウザーとチャットを内蔵しており、llama.cppを手動でビルドする必要はありません。
Atomic ChatでOrnith 1.5 35Bを実行する手順は次のとおりです。
ステップ1:Atomic Chatをインストールする
atomic.chatからAtomic Chatをダウンロードし、お使いのプラットフォーム向けのビルドをインストールします。
- macOS:ユニバーサル.dmg(IntelおよびApple Silicon)、macOS 13.6以降
- Windows:x64向け.exeインストーラー
- Linux:root権限が不要な、x86_64向けの自己完結型.AppImage
- iOS:App Storeから入手
- Android:Google Playから入手
Linuxでは、chmod +xでAppImageに実行権限を付け、そのまま実行してください。初回起動時にアプリがFUSEについて確認してきた場合は、DebianまたはUbuntuではsudo apt install fuse libfuse2、Fedoraではsudo dnf install fuse fuse-libsでインストールします。
ステップ2:当社のOrnith 1.5 35B GGUFを探す
Modelsタブを開き、次を検索します。
AtomicChat/Ornith-1.5-35B-A3B-GGUF
カタログはHugging Faceと連携しているため、他の公開元のビルドも公開され次第表示されます。AtomicChatが公開している検索結果を選び、Download Optionsの選択欄を展開して、利用可能な量子化の一覧を表示します。
注:リリースから1日以内に、無検閲版やアブリテレーション済み版のフォークを含む、改変されたOrnith 1.5リポジトリがHugging Faceに登場しました。アプリのカタログ以外からダウンロードする場合は、入手するものの確認方法について、トラブルシューティングのセクションをご覧ください。
ステップ3:メモリ容量に合った量子化を選ぶ
上のハードウェア表を使ってください。一般的な構成では、次のように選びます。
- 24 GB GPU:AD-Q4_K-IQ4_XSをダウンロードします。
- 32 GB Mac:AD-Q5_K-Q4_Kをダウンロードします。
- 32 GB GPU:AD-Q6_Kをダウンロードします。
選択欄では、各ビルドがADの接頭辞を省いた短いタグで表示されます。AD-Q5_K-Q4_Kのように2つを組み合わせた名前は、小さい方の量子化形式のタグで表示されます。選択欄に表示されるサイズは当社の表のファイルサイズと少し異なります。同じ名前の行が2つある場合は、サイズで判断してください。コンテキスト用の余裕を残して収まる、最も大きな量子化を選びます。量子化名の意味がわからない場合は、GGUFとは何か、量子化はどう機能するかのガイドをご覧ください。
ステップ4:コンテキスト、思考、サンプリングを設定する
モデルが宣言しているコンテキスト長は262Kですが、最大値に設定するとKVキャッシュが事前に割り当てられます。チャットでは8,192トークン、コードや文書の作業では32,768トークンから始め、作業に必要な場合にだけ増やしてください。
コンテキストの操作部はチャット入力欄の横にあります。パーセント表示は会話がコンテキスト枠をどれだけ使っているかを示し、クリックするとContext Sizeスライダーが開きます。最大値はモデルに基づき、このビルドでは256Kです。これは仕様表にある262,144トークンと同じです。0を指定すると、GGUFから値を読み込みます。
モデル自体には、さらに2つの設定があります。Settings → Model Providers → Llama.cppを開き、モデル一覧でOrnith 1.5のビルドを探して、その行の歯車アイコンをクリックします。
- Auto Increase Context Size:デフォルトで有効です。会話がコンテキスト枠に収まらなくなるとコンテキストを拡張するため、ぎりぎり収まっていたビルドがメモリ上限を超えることがあります。メモリ上限に近い状態で使う場合は無効にしてください。
- GPU Layers:-1ですべての層をオフロードします。ファイルがVRAMに収まる場合に適した設定です。
Context SizeまたはGPU Layersを変更するとモデルが再起動するため、長い会話を始める前に設定してください。
思考はデフォルトで有効です。推論に対応するモデルでは、Atomic Chatのチャット横に電球アイコンが表示されます。クリックすると、思考の有効・無効を切り替えられます。
サンプリングは別のパネルにあります。チャット上部のモデル名の横にあるスライダーアイコンをクリックしてください。DeepReinforceの推奨値はtemperature 0.6、top_p 0.95、top_k 20です。エンジンはモデルの標準値を自動で取り込まないため、手動で設定してください。公開ベンチマークの実行ではtemperatureを1.0に上げています。これらの設定はモデルではなく、チャットのプロファイルであるアシスタントに保存されるため、モデルを切り替えても変わりません。
ステップ5:ローカルでチャットする
ダウンロードが完了すると、Atomic Chatがモデルを読み込み、内蔵チャットで開きます。
35Bはネイティブな視覚言語モデルなので、チャットに画像を添付し、その内容について質問できます。画像、重み、プロンプトはお使いのマシン内に留まります。
Atomic Chatは、http://localhost:1337/v1でOpenAI互換APIサーバーも提供します。Claude CodeやClineのようなコーディングエージェントを含め、OpenAI APIで通信するツールであれば、クラウドモデルの代わりにローカルモデルをそのまま利用できます。
llama.cppでOrnith 1.5 35Bを実行する方法
次のような要件がある場合は、llama.cppでモデルを直接実行する方法が適しているかもしれません。
- フラグで明示的に設定できる、OpenAI互換のローカルエンドポイント
- GPUへのオフロードとエキスパートのオフロードを細かく制御できること
- 再現可能なサーバー構成
35BはQwen 3.5と同じMoEアーキテクチャ系統を使用しています。上流のllama.cppは2026年2月からこれに対応しているため、リリース当日のGGUFも、最新のビルドでパッチなしで動作します。
ステップ1:最新のllama.cppをビルドする
NVIDIA CUDAの場合:
git clone https://github.com/ggml-org/llama.cpp cd llama.cpp cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j --target llama-cli llama-server
Apple Siliconでは、Metalがデフォルトで有効です。
cmake -B build -DCMAKE_BUILD_TYPE=Release cmake --build build -j --target llama-cli llama-server
ステップ2:モデルを実行する
次のコマンドは、Hugging FaceからAD-Q4_K-IQ4_XSをダウンロードし、すべての層をGPUにオフロードし、DeepReinforce推奨のサンプリング設定を適用して、コンテキスト長を8Kに制限します。
./build/bin/llama-cli \ -hf AtomicChat/Ornith-1.5-35B-A3B-GGUF:AD-Q4_K-IQ4_XS \ --jinja -fa on \ --temp 0.6 --top-p 0.95 --top-k 20 \ -ngl 99 \ -c 8192
システムのメモリ容量が異なる場合は、AD-Q4_K-IQ4_XSを別の量子化名に置き換えてください。--jinjaフラグは毎回付けてください。モデル独自のチャットテンプレートを適用するために必要です。DeepReinforceのベンチマーク設定を再現するには、temperatureを1.0に上げます。
ステップ3:ローカルのOpenAI互換APIを提供する
llama-cliをllama-serverに置き換えます。
./build/bin/llama-server \ -hf AtomicChat/Ornith-1.5-35B-A3B-GGUF:AD-Q4_K-IQ4_XS \ --alias ornith-1.5-35b \ --jinja -fa on \ --temp 0.6 --top-p 0.95 --top-k 20 \ -ngl 99 \ -c 8192 \ --host 127.0.0.1 --port 8080
次のコマンドでテストします。
curl http://127.0.0.1:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{ "model": "ornith-1.5-35b", "messages": [ { "role": "user", "content": "Summarize what expert routing changes about memory use." } ] }'ネットワーク上の他のマシンからアクセスする必要がない限り、サーバーを127.0.0.1にバインドしてください。
エキスパートをシステムRAMに置いて実行する
ファイルがカードに収まらない場合は、小さな量子化を選ぶ代わりに--cpu-moeを追加してください。
./build/bin/llama-server \ -hf AtomicChat/Ornith-1.5-35B-A3B-GGUF:AD-Q5_K-Q4_K \ --cpu-moe \ --jinja -fa on \ --temp 0.6 --top-p 0.95 --top-k 20 \ -ngl 99 \ -c 8192 \ --host 127.0.0.1 --port 8080
--cpu-moeは、すべてのエキスパートをCPUに配置します。より細かく制御するには--n-cpu-moe Nを使います。これは最初のN層のエキスパートをオフロードし、残りをGPUに保持します。モデルがメモリ不足にならなくなるまでNを増やしてください。アテンション、ルーター、共有エキスパートは引き続きVRAMに置く必要があるため、どちらの場合も-ngl 99はそのまま指定します。
llama.cppで画像を処理する
画像入力には、すべての量子化で共通して使うビジョンプロジェクターという追加ファイルが1つ必要です。一度ダウンロードし、選んだ量子化と一緒に指定してください。
llama-mtmd-cli \ -m Ornith-1.5-35B-A3B-AD-Q4_K-IQ4_XS.gguf \ --mmproj mmproj-Ornith-1.5-35B-BF16.gguf \ --image your-photo.jpg --image-min-tokens 1024 \ -ngl 99 -c 8192 \ -p "What is in this image?"
--image-min-tokens 1024は必ず指定してください。これがないと、グラフやスクリーンショットのように情報が密集した画像に割り当てられる視覚トークンが少なすぎて、モデルは見せられた内容ではなく、すでに持っている知識に基づいて回答します。find_slot: non-consecutive token positionと表示される行は正常です。このモデル系統で画像パッチに番号を付ける方式によるもので、正常に実行できた場合にも表示されます。
OllamaまたはLM Studioで実行する
どちらのアプリも内部でllama.cppを使用しています。Ollamaはリリース当日にornith-1.5をライブラリに追加したため、公式タグを利用できます。ollama run ornith-1.5:35bを実行すると、ビジョンプロジェクターを含む23 GBのビルドがダウンロードされます。ライブラリのタグで提供されるのは、モデルサイズごとに1つのビルドです。当社の表にある特定の量子化を使うには、Hugging Faceから直接取得してください。
ollama run hf.co/AtomicChat/Ornith-1.5-35B-A3B-GGUF:Q5_K_M
LM Studioでは、モデルカタログでリポジトリ名を検索してください。当社のファイルはこちらでも読み込めます。
トラブルシューティング
ダウンロードしたGGUFが本物のモデルではない
リリースから1日以内に、無検閲版やアブリテレーション済み版のフォークを含む、Ornith 1.5の名前を掲げた他の公開元のリポジトリがHugging Faceに登場しました。見慣れないリポジトリからダウンロードする前に、公開元が公式のornith-ai組織または知っている量子化の公開者であること、モデルカードが存在すること、ファイル一覧に妥当なサイズのGGUFファイルが実際に含まれていることを確認してください。4ビットの35Bモデルが400 MBになることはありません。そうした派生版を使いたい場合は、Ornith 1.5無検閲版をローカルで実行する方法のガイドで、ダウンロードする価値のあるビルドを紹介しています。
モデルが冗長に話し続ける、またはなかなか終了しない
上流モデルのサンプリングのデフォルト値は、llama.cppがフォールバック時に使う値とは異なります。そのため、エンジン独自の値が使われ、出力が冗長になります。DeepReinforceの推奨値であるtemperature 0.6、top_p 0.95、top_k 20を手動で設定してください。Atomic Chatでは、モデル名の横にあるスライダーアイコンからサンプリング設定を開けます。チャット用途では、電球アイコンで思考を無効にすることもできます。
Macで長いコンテキストを使うと生成結果が空になる
Metalでは、このアーキテクチャで約16Kトークンを超えるプロンプトを入力すると、応答が空になることがあります。llama.cppのissue #27442で追跡されており、現行の複数のビルドで再現しています。修正が反映されるまでは、Apple SiliconでContext Sizeを16,384以下に保つか、長いコンテキストを使う作業をCUDAマシンで実行してください。
収まるはずのカードでモデルが遅い
ファイルは読み込めるのに、その後の生成が極端に遅くなります。重みがぎりぎり収まる場合、その一部が共有システムメモリにあふれ、GPUはトークンごとにバス経由で読み込みます。代わりに、明示的にオフロードしてください。--n-cpu-moe Nを指定し、残りがVRAMに収まるまでNを増やします。アテンションとルーターはGPUに残り、システムRAMから読み込むのはエキスパートだけになります。
長いコンテキストでメモリ不足になる
重みは収まるのに、長い会話をするとモデルがクラッシュします。これはKVキャッシュがメモリの余裕を超えて増大するためです。Context Sizeは0ではなく明示的な値に設定し、上限に近い場合はAuto Increase Context Sizeを無効にしてください。さらに余裕が必要なら、量子化を1段階下げる代わりに、--n-cpu-moeでエキスパートをシステムRAMに移します。
よくある質問
自分のハードウェアでOrnith 1.5 35Bを実行する際によく寄せられる質問です。
Ornith 1.5 35BにはどれくらいのVRAMが必要ですか?
24 GBカード向けのビルドであるAD-Q4_K-IQ4_XSには約20 GBが必要で、元のモデルとのTop-1一致率は92.71%です。32 GB以上ではAD-Q6_Kが元のモデルに近い挙動を示し、48 GBではQ8_0を実行できます。VRAMが少ない場合は、エキスパートをシステムRAMに移します。次の質問をご覧ください。
Ornith 1.5 35Bは12 GB GPUで実行できますか?
はい。ファイルの残りをシステムRAMで賄える場合は実行できます。llama.cppで--cpu-moeを指定すると、重みの93パーセントを占めるエキスパートがRAMに配置され、アテンションはGPUに残ります。この方法なら、12 GBカードで22.1 GBのAD-Q5_K-Q4_Kを実用的な速度で動かせます。量子化を選ぶ際は、ファイル全体のサイズをRAMとVRAMの合計容量と照らし合わせてください。
Ornith 1.5 35BはMacで実行できますか?
はい。macOSは、GPUがアドレス指定できるメモリを統合メモリの約75パーセントに制限するため、32 GB Macではモデルが約24 GBを利用できます。AD-Q5_K-Q4_Kには十分な容量です。48 GB以上ではAD-Q6_Kを実行でき、64 GB以上ではQ8_0が収まります。DeepReinforceは4、6、8ビットの公式MLXビルドも提供しています。llama.cppには、Metalでコンテキスト長が16Kを超えると応答が空になる未解決のバグがあります。トラブルシューティングをご覧ください。
Ornith 1.5 35BはQwen3.6 35B A3Bより高性能ですか?
はい。DeepReinforceのリリース時の数値では、モデルカードに掲載されたすべてのコーディングおよびエージェント系ベンチマークで上回っています。Terminal-Bench 2.1では52.5に対して67.8です。両モデルは、アクティブパラメータ数3Bの35B MoEという同じ構成なので、同じハードウェアに収まります。
Ornith 1.5 35BはQwen 3.8 27Bと比べてどうですか?
GPQA Diamondでは89.2で同点です。Terminal-Benchでは、評価ハーネスのバージョンは異なりますが、Qwen 3.8 27Bが67.8に対して73.0で優位です。トレードオフはハードウェアにあります。27Bはデンスモデルで24 GBカードを必要とする一方、35Bはトークンごとに3Bのパラメータを有効にするため、生成が速くなります。エキスパートをオフロードすれば、12 GBカードでも実行できます。お使いのマシンにどちらも収まる場合は、Qwen 3.8をローカルで実行する方法のガイドも参照し、用途に応じて選んでください。
Ornith 1.5の9B、35B、397Bにはどのような違いがありますか?
違いはサイズと必要なハードウェアのクラスです。397Bは、DeepReinforceがClaude Opus 4.8とベンチマークで比較しているフラッグシップのMoEで、データセンタークラスターを必要とします。9Bは8 GB GPUまたは16 GB Mac向けのデンス型視覚言語モデルで、Ornith 1.5 9Bのガイドで扱っています。その中間にある35Bは、アクティブパラメータ数3BのMoEです。ハイエンドデスクトップで動くものとしては3モデルの中で最も高性能で、このガイドの対象です。
Ornith 1.5 35BはOrnith 1.0 35Bより高性能ですか?
はい。DeepReinforceのリリース時の数値では、Terminal-Bench 2.1が64.2から67.8に、SWE-bench Verifiedが75.6から79に、GPQA Diamondが86.2から89.2に、MCP-Atlasが64.4から70.2に向上しています。アーキテクチャと各部のサイズは引き継がれているため、現在Ornith 1.0を実行しているなら、1.5の各ビルドも同じマシンに収まります。
MTPヘッドとは何ですか?モデルは速くなりますか?
MTPはMulti-Token Predictionの略です。1回の順伝播で複数のトークン候補を生成する1.9Bのヘッドで、llama.cppでは--spec-type draft-mtpを使って投機的デコーディングに利用します。このヘッドは元の重みに含まれていますが、当社のGGUFビルドでは独立したドラフトファイルとしてまだ提供していないため、これらのビルドでは投機的デコーディングを利用できません。ヘッドがなくてもモデルは通常どおり動作します。
Ornith 1.5 35Bはローカルでの画像処理に対応していますか?
はい。35Bにはビジョンエンコーダーが含まれており、必要なプロジェクターファイルは、すべての量子化で共通して使う別途ダウンロードのファイルです。Atomic Chatでは、チャットに画像を添付してその内容について質問でき、データがマシンの外に出ることはありません。llama.cppでは、選んだ量子化と一緒にmmprojファイルを指定します。
Ornith 1.5 35BはOllamaまたはLM Studioで動きますか?
はい。Ollamaには公式の登録があり、ollama run ornith-1.5:35bで23 GBのビルドをダウンロードできます。当社のGGUFビルドも直接読み込めます。Ollamaではhf.co/AtomicChat/Ornith-1.5-35B-A3B-GGUFを指定するか、LM Studioではリポジトリ名を検索してください。
Ornith 1.5 35Bは商用でも無料で使えますか?
はい。Ornith 1.5ファミリー全体がMITライセンスで提供されており、商用利用、改変、再配布はいずれも認められています。
まとめ
24 GB GPUを搭載したマシン、または32 GB Macをお使いなら、Ornith 1.5 35Bはローカルで実行できる最も高性能なOrnithです。GPUではAD-Q4_K-IQ4_XS、MacではAD-Q5_K-Q4_Kをダウンロードし、コンテキスト長8Kから始めて、作業に応じて増やしてください。12 GBカードでは、小さなモデルに切り替える代わりに、--cpu-moeでエキスパートをシステムRAMに置きます。llama.cppを使う方法では、同じファイルをローカルのOpenAI互換API経由で提供できます。
要点:
- Ornith 1.5 35Bは、エージェント型コーディング向けの35B MoEで、トークンごとに約3Bのパラメータを有効にし、標準で262Kのコンテキスト長を備えています。
- 重みは2026年8月19日に、9Bおよび397BとともにMITライセンスで公開されました。
- 当社のGGUFビルドのサイズは13.7から36.9 GBです。24 GBカードにはAD-Q4_K-IQ4_XS、32 GB MacにはAD-Q5_K-Q4_Kを選んでください。
- エキスパートをシステムRAMに置けば、12 GB GPUで22.1 GBのビルドを実行できます。--cpu-moeを指定してください。
- 上流モデルのサンプリングのデフォルト値は、llama.cppがフォールバック時に使う値とは異なります。temperature 0.6、top_p 0.95、top_k 20を手動で設定してください。

