ブログ

/

ガイド

/

Ornith 1.5 9Bをローカルで動かす方法:GGUF、必要スペック、ベンチマーク

Ornith 1.5 9Bをローカルで動かす方法:GGUF、必要スペック、ベンチマーク

Ornith 1.5 9Bは、DeepReinforceの新しいOrnith 1.5ファミリーの中で、実際にローカルで動かせるモデルです。コーディング向けの9Bマルチモーダルデンスモデルで、4ビット量子化なら8 GB GPUまたは16 GB Macに収まります。このガイドでは、私たちが提供するAtomic Dynamic GGUFビルド、各ビルドに必要なメモリ容量、Atomic Chatとllama.cppそれぞれの具体的なセットアップ方法を解説します。

Ornith 1.5 9Bをローカルで動かす方法:GGUF、必要スペック、ベンチマーク
Andrew Dyuzhov
Andrew Dyuzhov
Calendar icon

August 19, 2026

目次

このガイドでは、次の内容を解説します。

  • Ornith 1.5 9Bの概要と、35Bおよび397Bとの違い
  • 実行に必要なハードウェア
  • Atomic Chatまたはllama.cppでOrnith 1.5 9Bをローカル実行する方法

ローカルで使うコーディングモデルを幅広く比較している場合は、コーディングにおすすめのローカルLLMのガイドをご覧ください。この記事ではOrnith 1.5 9Bのみを扱います。

Ornith 1.5 9Bとは?

Ornith 1.5 9Bは、DeepReinforceが開発したオープンウェイトのデンス言語モデルで、新しいOrnith 1.5ファミリーの最小モデルです。このファミリーはエージェント型コーディング向けに学習されており、フラッグシップの397B MoE、35B MoE、そしてこの9Bの3サイズが、いずれもMITライセンスで提供されています。9Bの重みは2026年8月19日にHugging Faceで公開されました。

Ornith 1.5 9Bの主な仕様:

仕様Ornith 1.5 9B
総パラメータ数9B(言語8.95B + 視覚0.46B)
アーキテクチャデンス型、ハイブリッドアテンション(線形アテンション24層 + フルアテンション8層)
層数32
コンテキスト長標準で262,144トークン、1Mまで拡張可能
モダリティテキストと画像の入力
推論思考はデフォルトでオン、オフに切り替え可能
複数トークン予測2026年8月23日に上流でヘッドを追加。GGUFドラフトファイルはまだありません
リリース日2026年8月19日
ライセンスMIT

9Bはマルチモーダルで、テキストとともに画像を処理できます。また、基盤となるアーキテクチャであるQwen 3.5のハイブリッドアテンション設計を採用しています。32層のうち24層では、会話がどれだけ長くなってもメモリ使用量が変わらない線形アテンションを使用します。通常はトークンが増えるたびに大きくなる通常のKVキャッシュを保持するのは、残りの8層だけです。そのため実際には、長いチャットや大きな文書を扱う際のメモリ使用量が、一般的な9Bモデルよりはるかに少なくなります。ハードウェアのセクションで具体的な数値を示します。

OrnithはDeepReinforceの自己改善プロジェクトです。モデルが自ら学習タスクを提案し、自分の試行から学びます。1.5世代では、このループをコーディング以外の推論や一般的なエージェント作業にも広げています。9Bは推論モデルでもあり、各回答では最終的な応答の前に思考ブロックを出力します。思考は完全にオフにすることもできます。

Ornith 1.5のリリースには、混同しやすい3つの異なるモデルが含まれます。

  • Ornith 1.5 397Bは、DeepReinforceがClaude Opus 4.8とベンチマーク比較しているMoEのフラッグシップモデルです。397Bパラメータを持つため、提供には複数GPUを搭載したデータセンターのクラスターが必要で、Kimi K3と同じクラスのハードウェアを要します。
  • Ornith 1.5 35Bは、アクティブパラメータ数が3Bの35B MoEで、DeepSeek V4 Flashと同じクラスに属し、複数トークン予測ヘッドを搭載しています。このモデル向けには別のGGUFビルドを公開しています。
  • Ornith 1.5 9Bは、このガイドで扱うデンス型の視覚言語モデルで、3つの中で最小です。8 GB GPUまたは16 GB MacBookに収まり、Ornithをローカルで動かす最も低コストな方法です。

Ornith 1.5 9Bのベンチマーク

モデルカードに掲載されたDeepReinforceのリリース時の数値では、9BをOrnith 1.0 9B、Qwen3.5-9B、Qwen3.6 35B A3B、Gemma 4 31Bと比較しています。

Ornith 1.5 9BOrnith 1.0 9BQwen3.5-9BQwen3.6 35B A3BGemma 4 31B
Terminal-Bench 2.1 (Terminus-2)
エージェントによるターミナル操作タスク
46.243.121.352.542.1
SWE-bench Verified
実世界のソフトウェアエンジニアリングタスク
70.669.453.273.452
GPQA Diamond
専門家レベルの科学分野の質問
86.482.581.78684.3
MCP-Atlas
MCPサーバーを介したツール使用
54.249.446.862.855

9Bは、サイズが3倍のデンスモデルであるGemma 4 31Bを、4つのベンチマークのうち3つで上回っています。

以下は、同じクラスのローカルモデルについて、各ベンダーがそれぞれ測定したスコアです。

Ornith 1.5 9BOmniCoder-9BApriel-1.6 15BMuse Glimmer 30BNemotron 3.5 Lightning
パラメータ数
9Bデンスモデル9Bデンスモデル15Bデンスモデル30Bデンスモデル30B MoE (A3B)
Terminal-Bench
エージェントによるターミナル操作タスク
46.223.614--
SWE-bench Verified
実世界のソフトウェアエンジニアリングタスク
70.6-2376.051.6
GPQA Diamond
専門家レベルの科学分野の質問
86.483.87383.575.4

この2つ目の表のスコアはすべて、各ベンダー自身のモデルカードまたはリリースブログに掲載されたものです。各研究機関は独自の評価環境を使っているため、列間の小さな差に大きな意味はありません。ハイフンは、ベンダーがその数値を公開していないことを示します。Terminal-Benchはバージョンが異なり、Ornithのカードは2.1、OmniCoderは2.0を報告し、Aprielはバージョンを明記していません。

ここでの直接の競合はOmniCoder-9Bです。TesslateがQwen3.5-9Bをエージェント型コーディング向けにファインチューニングしたモデルで、2026年3月にリリースされました。両モデルカードで共通するのはGPQA Diamondのみで、Ornithが86.4対83.8でリードしています。SWE-bench Verifiedでは、表に掲載された公開スコアのうち最も近いのはMuse Glimmer 30Bの76.0で、9Bとの差は6ポイント以内です。

9Bにとって、より有用な比較対象は前世代モデルです。Ornith 1.0 9Bは2026年6月にリリースされ、SWE-bench Verifiedで69.4を記録しました。8 GBカードに収まるローカルでのコーディング向けモデルの中でも、最も高性能なモデルの1つでした。1.5も同じサイズで登場しており、ハードウェア上の必要容量は同一です。現在Ornith 1.0を実行しているなら、1.5の各ビルドも同じマシンに収まります。

Ornith 1.5 9B GGUF:私たち自身で量子化しました

AtomicChat Ornith 1.5 9B GGUFリポジトリは、DeepReinforceの元のBF16重みから作成しました。リポジトリには2.8〜17.9 GBの14種類のビルドに加え、すべてのビルドで共通して使う、別途ダウンロードするビジョンプロジェクターを収録しています。ADという接頭辞はAtomic Dynamicを表します。AD-Q5_K-Q4_Kのように2つを組み合わせた名前は、最大の2つのテンソルグループにそれぞれ適用した量子化方式を示し、両方が同じ場合は1つの名前にまとめられます。

ファイルサイズKLダイバージェンスTop-1一致率
BF1617.9 GB基準100%
Q8_09.5 GB0.00224997.94%
AD-Q8_0-Q6_K8.6 GB0.00347397.46%
Q6_K7.4 GB0.00604596.54%
Q5_K_M6.5 GB0.02988392.80%
AD-Q5_K-Q4_K5.9 GB0.02549393.10%
AD-Q4_K-IQ4_XS5.6 GB0.03442691.93%
AD-IQ3_S-IQ3_XXS4.3 GB0.14413283.44%
AD-IQ2_S-IQ2_XS3.4 GB0.44158071.17%

表の見方:KLダイバージェンスは、量子化モデルと元の重みが生成する出力分布の隔たりを測ります。値が低いほど良く、ゼロは同一であることを意味します。Top-1一致率は、量子化モデルが基準モデルと同じ次のトークンを選ぶ位置の割合です。単一の総合指標を見るなら、Top-1一致率を使ってください。次のセクションでは、どのファイルがハードウェアに収まるかを説明します。

AD-Q5_K-Q4_Kは標準のQ5_K_Mより小さく、同時に精度も高くなっています。サイズは5.9 GB対6.5 GB、KLダイバージェンスは0.0255対0.0299です。

表の数値はすべて私たち自身で測定しました。基準は元のBF16重みで、キャリブレーションコーパスは公開されており、生のログは測定結果のリポジトリにあるため、どの数値もご自身で確認できます。詳しい手順はモデルカードに掲載しています。

Ornith 1.5 9Bのハードウェア要件

Ornith 1.5 9Bのシステム要件で確認すべきなのはメモリです。次の表は、必要な使用可能RAMとVRAMの合計容量を示しています。

使用可能メモリ推奨GGUF量子化モデルファイルサイズ残りの容量で確保できるもの
4 GBAD-IQ2_S-IQ2_XS3.4 GBテキストのみ、短いコンテキスト
6 GBAD-IQ3_S-IQ3_XXS4.3 GB約16Kのコンテキスト
8 GBAD-Q5_K-Q4_K5.9 GB約32Kのコンテキスト
12 GBAD-Q8_0-Q6_K8.6 GB約64Kのコンテキスト
16 GBQ8_09.5 GB約128Kのコンテキスト
24 GB以上BF1617.9 GB約128Kのコンテキスト

Apple Siliconでは、統合メモリの約75パーセントを使用可能として計算します。16 GB Macでは12 GBの行を参照してください。

注:サイズが隣り合う2つのファイルで迷ったら、大きい方を選んでください。必要容量は0.5ギガバイト程度増えますが、誤ったトークンを選ぶ頻度は明らかに下がります。特に5 GB未満では品質低下が最も急になるため、この差が大きくなります。

コンテキスト長によってメモリ使用量はどれだけ増える?

上記の数値はモデルの重みだけを対象にしています。それに加えて、エンジンはKVキャッシュを確保します。チャットが長くなるほど、モデルがメモリに保持するコンテキストが増え、必要な容量も増加します。会話に大きな文書やコードベースを貼り付ける場合も同様です。

従来のデンス型Transformerでは、32層すべてが各トークンのアテンションデータを保存します。このモデルでは、32層のうち24層が固定サイズの状態を持つ線形アテンションを使用し、フルアテンションの8層で使うKVヘッドはわずか4つです。私たちのビルドで測定したところ、モデルが保持するアテンションキャッシュは1トークンあたり32 KBで、同じ構成の標準的なTransformerが保存する量の約4分の1でした。

コンテキスト長アテンションキャッシュ
8K(一般的なチャット)約0.25 GB
32K(長い文書)約1 GB
128K(大規模なコードベース)約4 GB
262K(標準の最大コンテキスト長)約8.4 GB

262Kのコンテキスト全体は24 GBカードに収まります。AD-Q8_0-Q6_Kでは、重みとキャッシュを合わせて約17 GBになります。

Ornith 1.5 9Bを動かせるハードウェアは?

  • 8 GB GPU(RTX 3050、RTX 4060):AD-Q5_K-Q4_Kを完全にVRAMに載せて実行でき、約32Kのコンテキストを確保する余裕があります。
  • 12 GB GPU(RTX 3060、RTX 4070):AD-Q8_0-Q6_Kを完全にVRAMに載せて実行でき、この量子化ではモデルが元のモデルに近い挙動を示します。
  • 16 GB GPU(RTX 4060 Ti 16 GB、RTX 5060 Ti):Q8_0を実行でき、約128Kのコンテキストを確保する余裕があります。
  • 24 GB GPU(RTX 3090、RTX 4090):量子化していないBF16ファイルを完全にVRAMに載せて実行できます。
  • MacBook(統合メモリ16 GB):Metal経由でAD-Q8_0-Q6_Kを実行でき、約64Kのコンテキストを確保する余裕があります。macOSはデフォルトでGPUがアクセスできるメモリを統合メモリの約75パーセントに制限するため、16 GB Macでモデルが使えるのは約12 GBです。
  • MacBook Pro M4/M5 Max、Mac Studio(32 GB以上):Q8_0またはBF16を余裕を持って実行できます。Apple SiliconではGGUFビルドがMetal経由でネイティブに動作します。形式の選択に迷っている場合は、GGUFとMLXの比較ガイドをご覧ください。

実測スループット

単一のRTX 5090で、すべてをGPUにオフロードしてBF16ビルドを測定しました。

ビルドプロンプト処理生成
BF169,047 t/s94.3 t/s

ファイルが小さいほど生成は速くなり、5.9 GBのAD-Q5_K-Q4_Kでは毎秒280トークン近くに達します。

Atomic ChatでOrnith 1.5 9Bをローカル実行する方法

Atomic Chatは、私たちが開発した無料のオープンソースのローカルAIアプリです。Hugging Faceのモデルブラウザーとチャットを内蔵しており、llama.cppを手動でビルドする必要はありません。

Atomic ChatでOrnith 1.5 9Bを実行する手順は次のとおりです。

ステップ1:Atomic Chatをインストールする

atomic.chatからAtomic Chatをダウンロードし、お使いのプラットフォーム向けのビルドをインストールします。

  • macOS:ユニバーサル.dmg(IntelとApple Silicon)、macOS 13.6以降
  • Windows:x64向けの.exeインストーラー
  • Linux:root権限が不要な、x86_64向けの自己完結型.AppImage
  • iOS:App Storeから入手
  • Android:Google Playから入手

Linuxでは、chmod +xでAppImageに実行権限を付与し、直接実行します。初回起動時にアプリがFUSEについて確認してきた場合は、DebianまたはUbuntuではsudo apt install fuse libfuse2、Fedoraではsudo dnf install fuse fuse-libsでインストールしてください。

macOS、Windows、Linux向けのデスクトップビルドと、iOS、Android向けのビルドが並ぶAtomic Chatのダウンロードセクション

ステップ2:私たちのOrnith 1.5 9B GGUFを探す

Modelsタブを開き、次を検索します。

AtomicChat/Ornith-1.5-9B-GGUF

カタログはHugging Faceと連携しているため、他の公開者のビルドも公開されると表示されます。AtomicChatが公開した検索結果を選び、Download Optionsの選択メニューを展開すると、利用可能な量子化の一覧が表示されます。

AtomicChatが公開したOrnith-1.5-9B-GGUFリポジトリを表示するAtomic Chatのモデル検索結果。パラメータ数は9B、コンテキスト長は256K

注:リリースから数時間以内に、サードパーティーのOrnith 1.5リポジトリがHugging Faceに登場しました。アプリのカタログ以外からダウンロードする場合は、入手するものの確認方法について「トラブルシューティング」のセクションをご覧ください。

ステップ3:メモリ容量に合う量子化モデルを選ぶ

上記のハードウェア表を使ってください。最も一般的な構成では、次のように選びます。

  • 8 GB GPU:AD-Q5_K-Q4_Kをダウンロードします。
  • 12 GB GPUまたは16 GB Mac:AD-Q8_0-Q6_Kをダウンロードします。
  • 24 GB以上のGPU:BF16をダウンロードします。

選択メニューでは、各ビルドがAD接頭辞を省いた短いタグで表示されます。AD-Q5_K-Q4_Kのように2つを組み合わせた名前は、小さい方のタグで表示されるため、8 GBカードで選ぶファイルは6.4 GBのQ4_Kの行です。選択メニューに表示されるサイズは、表のファイルサイズと多少異なります。同じ名前の行が2つある場合は、サイズで判断してください。コンテキスト用の余裕を残して収まる、最も大きい量子化モデルを選びます。量子化の名前の意味がわからない場合は、GGUFとは何か、量子化はどのように機能するかのガイドをご覧ください。

Atomic Dynamicの量子化モデルと各サイズを一覧表示するAtomic ChatのDownload Options選択メニュー

ステップ4:コンテキスト、思考、サンプリングを設定する

モデルは262Kのコンテキスト長を宣言していますが、最大値を設定するとKVキャッシュがあらかじめ確保されます。チャットには8,192トークン、コードや文書の作業には32,768トークンから始め、作業で必要になった場合にのみ増やしてください。

コンテキストの操作項目はチャット入力欄の横にあります。パーセント表示は会話がコンテキストのどれだけを使用したかを示し、クリックするとContext Sizeスライダーが開きます。最大値はモデルに由来し、このビルドでは256Kです。これは仕様表に記載した262,144トークンと同じ値で、0を指定するとGGUFから値を読み込みます。

チャット入力欄の横にあるAtomic Chatのコンテキストインジケーター。Context Sizeスライダーを開き、会話の使用量を表示している

さらに2つの設定がモデル自体にあります。Settings → Model Providers → Llama.cppを開き、モデル一覧でOrnith 1.5のビルドを見つけ、その行の歯車アイコンをクリックします。

  • Auto Increase Context Size:デフォルトでオンです。会話で空きがなくなるとコンテキストを拡張するため、ぎりぎり収まっていたビルドがメモリ上限を超えることがあります。上限に近い状態で作業する場合はオフにしてください。
  • GPU Layers:-1はすべての層をオフロードします。VRAMに収まるデンスモデルでは、この設定が適しています。

Context SizeまたはGPU Layersを変更するとモデルが再起動するため、長い会話を始める前に設定してください。

思考はデフォルトでオンです。推論に対応するモデルでは、Atomic Chatのチャットの横に電球アイコンが表示されます。クリックすると思考のオンとオフを切り替えられます。

サンプリングは別のパネルにあります。チャット上部のモデル名の横にあるスライダーアイコンをクリックしてください。DeepReinforceはモデルにデフォルトのサンプリング設定を付属させていないため、自分で設定します。一般的な作業にはtemperature 1.0、top_p 0.95、top_k 20を使い、コーディングにはtemperature 0.6と同じtop_p、top_kを使います。一般的な作業には、DeepReinforceはpresence penalty 1.5も推奨しています。これらの設定はモデルではなく、チャットのプロファイルであるアシスタントに保存されるため、モデルを切り替えても同じ設定が維持されます。

ステップ5:ローカルでチャットする

ダウンロードが完了すると、Atomic Chatがモデルを読み込み、内蔵チャットで開きます。

9Bはネイティブの視覚言語モデルなので、チャットに画像を添付して、その画像について質問できます。画像、重み、プロンプトはすべて自分のマシン内にとどまります。

Atomic Chatは、http://localhost:1337/v1でOpenAI互換のAPIサーバーも公開します。Claude CodeやClineのようなコーディングエージェントを含め、OpenAI APIで通信するツールなら、クラウドモデルの代わりにローカルモデルをそのまま利用できます。

llama.cppでOrnith 1.5 9Bを実行する方法

次のものが必要なら、llama.cppからモデルを直接実行する方法が適しているかもしれません。

  • 明示的なフラグで設定できる、OpenAI互換のローカルエンドポイント
  • GPUオフロードの細かな制御
  • 再現可能なサーバー構成

9BはQwen 3.5と同じハイブリッドアテンション設計を採用しています。上流のllama.cppは2026年2月からこの設計に対応しているため、リリース当日のGGUFも現行ビルドでパッチなしに動作します。

ステップ1:現行のllama.cppをビルドする

NVIDIA CUDAの場合:

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON
cmake --build build -j --target llama-cli llama-server

Apple Siliconでは、Metalがデフォルトで有効です。

cmake -B build -DCMAKE_BUILD_TYPE=Release
cmake --build build -j --target llama-cli llama-server

ステップ2:モデルを実行する

次のコマンドは、Hugging FaceからAD-Q5_K-Q4_Kをダウンロードし、すべての層をGPUにオフロードし、DeepReinforceのコーディング向けサンプリング設定を適用して、コンテキスト長を8Kに制限します。

./build/bin/llama-cli \
  -hf AtomicChat/Ornith-1.5-9B-GGUF:AD-Q5_K-Q4_K \
  --jinja -fa on \
  --temp 0.6 --top-p 0.95 --top-k 20 \
  -ngl 99 \
  -c 8192

システムのメモリ容量が異なる場合は、AD-Q5_K-Q4_Kを別の量子化名に置き換えてください。実行時は毎回--jinjaフラグを付けてください。これによりモデル固有のチャットテンプレートが適用されます。コーディングではなく一般的なチャットには、DeepReinforceはtemperature 1.0とpresence penalty 1.5(--presence-penalty 1.5)を推奨しています。

ステップ3:ローカルのOpenAI互換APIを公開する

llama-cliをllama-serverに置き換えます。

./build/bin/llama-server \
  -hf AtomicChat/Ornith-1.5-9B-GGUF:AD-Q5_K-Q4_K \
  --alias ornith-1.5-9b \
  --jinja -fa on \
  --temp 0.6 --top-p 0.95 --top-k 20 \
  -ngl 99 \
  -c 8192 \
  --host 127.0.0.1 --port 8080

次でテストします。

curl http://127.0.0.1:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{ "model": "ornith-1.5-9b", "messages": [ { "role": "user", "content": "Summarize what linear attention changes about memory use." } ] }'

ネットワーク上の他のマシンからアクセスする必要がなければ、サーバーを127.0.0.1にバインドしてください。

llama.cppで画像認識を実行する

画像入力には、すべての量子化モデルで共通のビジョンプロジェクターという追加ファイルが1つ必要です。リポジトリからmmproj-Ornith-1.5-9B-F16.ggufを一度ダウンロードし、選んだ量子化モデルと一緒に指定します。

llama-mtmd-cli \
  -m Ornith-1.5-9B-AD-Q5_K-Q4_K.gguf \
  --mmproj mmproj-Ornith-1.5-9B-F16.gguf \
  --image your-photo.jpg --image-min-tokens 1024 \
  -ngl 99 -c 8192 \
  -p "What is in this image?"

--image-min-tokens 1024を必ず指定してください。これがないと、グラフやスクリーンショットなど情報量の多い画像に割り当てられる視覚トークンが不足します。

OllamaまたはLM Studioで実行する

どちらのアプリも内部ではllama.cppを使っています。Ollamaはリリースから1日以内にornith-1.5をライブラリに追加したため、公式タグが使えます。ollama run ornith-1.5:9bで6.6 GBのビルドが取得されます。ライブラリのタグではモデルサイズごとに1つのビルドが提供されます。表にある特定の量子化モデルを使うには、Hugging Faceから直接取得してください。

ollama run hf.co/AtomicChat/Ornith-1.5-9B-GGUF:Q5_K_M

LM Studioでは、モデルカタログでリポジトリ名を検索してください。私たちのファイルはLM Studioでも読み込めます。

トラブルシューティング

ダウンロードしたGGUFが本物のモデルではない

リリースから数時間以内に、他の公開者のリポジトリがHugging Face上でOrnith 1.5を名乗っていました。見慣れないリポジトリからダウンロードする前に、公開者が公式のornith-ai組織または知っている量子化の提供者であること、モデルカードが存在すること、ファイル一覧に妥当なサイズのGGUFファイルが実際に含まれていることを確認してください。4ビットの9Bモデルが400 MBに収まることはありません。そのようなモデルのいずれかを探している場合は、Ornith 1.5無検閲版をローカルで動かす方法のガイドで、ダウンロードする価値のあるビルドを紹介しています。

思考モードでモデルがループしたり同じ内容を繰り返したりする

リポジトリにはデフォルトのサンプリング設定が付属していないため、エンジンは自身のデフォルト値を使います。貪欲法に近い設定ではモデルが同じ内容を繰り返します。DeepReinforceの推奨値を自分で設定してください。一般的な作業ではtemperature 1.0、top_p 0.95、top_k 20、presence penalty 1.5を使い、コーディングではtemperature 0.6を使います。Atomic Chatでは、モデル名の横にあるスライダーアイコンからサンプリング設定を開けます。チャット用途では、電球アイコンで思考をオフにすることもできます。

画像入力で意味不明な文字列や終わりのない句読点が出力される

画像認識には、同じリポジトリからダウンロードしたプロジェクターファイルmmproj-Ornith-1.5-9B-F16.ggufを、--mmprojで指定する必要があります。Atomic Chatは自動的にこのファイルを認識します。また、--image-min-tokens 1024を必ず指定してください。これがないと、グラフやスクリーンショットに割り当てられる視覚トークンが不足します。

長いコンテキストでメモリ不足になる

重みは収まるのに、長い会話でモデルがクラッシュする場合、KVキャッシュが空き容量を超えて増大しています。Context Sizeは0ではなく明示的な値に設定し、上限に近い場合はAuto Increase Context Sizeをオフにしてください。さらに空きが必要なら、量子化モデルを1段階小さくします。1トークンあたり32 KBのキャッシュでは、1ギガバイト空けるごとに約32Kのコンテキストを追加できます。

よくある質問

自分のハードウェアでOrnith 1.5 9Bを動かす際によく寄せられる質問です。

Ornith 1.5 9Bに必要なVRAM容量は?

8 GBカード向けのビルドであるAD-Q5_K-Q4_Kなら約6 GBで、元のモデルに対するTop-1一致率は93.10%です。6 GBカードではAD-IQ3_S-IQ3_XXSを使い、24 GB以上なら量子化を省いてBF16を実行できます。このクラスのハードウェアについては、8GBにおすすめのローカルLLMのまとめをご覧ください。

Ornith 1.5 9BはMacで動かせますか?

はい。macOSはGPUがアクセスできるメモリを統合メモリの約75パーセントに制限するため、16 GB Macでモデルが使えるのは約12 GBで、AD-Q8_0-Q6_Kを実行するには十分です。統合メモリが24 GB以上ならQ8_0、32 GB以上なら基準となるBF16を実行してください。このクラスで快適に動く他のモデルについては、16GB MacにおすすめのローカルLLMのまとめをご覧ください。

Ornith 1.5はすでにリリースされていますか?

はい。Ornith 1.5 9Bの重みは、2026年8月19日にHugging Faceの公式ornith-ai組織で、35Bおよび397Bとともに公開されました。私たちのGGUFビルドはAtomicChat/Ornith-1.5-9B-GGUFリポジトリとAtomic Chatのカタログにあるため、今すぐOrnith 1.5をローカルで実行できます。

Ornith 1.5 9B、35B、397Bの違いは?

違いはサイズとハードウェアのクラスです。397BはDeepReinforceがClaude Opus 4.8とベンチマーク比較しているMoEのフラッグシップモデルで、データセンターのクラスターを必要とします。35Bはハイエンドデスクトップ向けの、アクティブパラメータ数が3BのMoEです。9Bは6 GB以上のGPUで動作するデンス型の視覚言語モデルで、テキスト専用の最小ビルドなら4 GBに収まります。

Ornith 1.5はQwenをファインチューニングしたモデルですか?

公式にはそう明言されていません。モデルカードには出発点となるチェックポイントの名前が記載されていません。アーキテクチャはQwen 3.5で、DeepReinforceは学習の一貫性を保つためにQwenのチャットテンプレートを調整したと述べています。学習自体はDeepReinforce独自の強化学習で、モデルが自らタスクを提案し、そこから学びます。ベンチマークのセクションにあるQwen3.5-9Bとのリリース時の比較数値が、その学習によって何が変わったかを示しています。

Ornith 1.5 9BはQwen 3.8 27Bと比べてどうですか?

Qwen 3.8 27Bは4ビットビルドに24 GB GPUが必要ですが、Ornith 1.5 9Bは8 GBで動作します。Terminal-Bench 2.1では、27Bのスコアは73.0、9Bは46.2です。マシンに27Bが収まるなら、27Bを実行してください。Qwen 3.8をローカルで動かすガイドをご覧ください。9Bは、それに満たないハードウェア向けの選択肢です。

Ornith 1.5 9BはOrnith 1.0 9Bより優れていますか?

はい。DeepReinforceのリリース時の数値では、Terminal-Bench 2.1は43.1から46.2、SWE-bench Verifiedは69.4から70.6、GPQA Diamondは82.5から86.4、MCP-Atlasは49.4から54.2に向上しています。両モデルは同じサイズなので、ハードウェアの容量計算もそのまま適用できます。

Ornith 1.5 9Bはローカルでの画像認識に対応していますか?

はい。9Bにはビジョンエンコーダーが付属し、必要なプロジェクターファイルmmproj-Ornith-1.5-9B-F16.ggufは私たちのリポジトリにあります。Atomic Chatでは、チャットに画像を添付してその画像について質問でき、マシンの外にデータが出ることはありません。llama.cppでは、選んだ量子化モデルと一緒にmmprojファイルを指定します。

Ornith 1.5はOllamaまたはLM Studioで動作しますか?

はい。Ollamaには公式のornith-1.5エントリーがあり、ollama run ornith-1.5:9bで実行できます。私たちのGGUFビルドも直接読み込めます。Ollamaではhf.co/AtomicChat/Ornith-1.5-9B-GGUFを指定するか、LM Studioでリポジトリ名を検索してください。

Ornith 1.5 9BをClaude CodeやClineで使えますか?

はい。Atomic Chatはhttp://localhost:1337/v1のOpenAI互換APIサーバーを通じてモデルを公開し、llama-serverも指定したポートで同じことができるため、Claude CodeやClineはクラウドエンドポイントの代わりにそのまま接続できます。エージェント作業には、コーディング向けのサンプリング設定であるtemperature 0.6、top_p 0.95、top_k 20を使ってください。

思考モードをオフにできますか?

はい。思考はデフォルトでオンです。Atomic Chatではチャットの横にある電球アイコンで切り替えられます。APIではenable_thinking: falseでオフにできます。

Ornith 1.5 9Bは商用利用も無料ですか?

はい。Ornith 1.5ファミリー全体がMITライセンスで提供されており、商用利用、改変、再配布はいずれも許可されています。

まとめ

マシンに8 GB GPUまたは16 GBの統合メモリがあるなら、ローカルで動かすOrnithモデルはOrnith 1.5 9Bです。8 GB GPUではAD-Q5_K-Q4_K、16 GB MacではAD-Q8_0-Q6_Kをダウンロードし、コンテキスト長8Kから始めて、作業の必要に応じて増やしてください。24 GBカードでは量子化を省き、BF16ファイルを選びます。llama.cppを使う方法では、同じファイルをローカルのOpenAI互換API経由で提供します。

要点:

  • Ornith 1.5 9Bは、エージェント型コーディング向けに学習された9Bのデンス型視覚言語モデルで、標準のコンテキスト長は262Kです。
  • 重みは2026年8月19日にMITライセンスで公開され、35Bと397Bも同時にリリースされました。
  • 私たちのGGUFビルドのサイズは2.8〜17.9 GBです。8 GBカードではAD-Q5_K-Q4_Kを選び、24 GB以上ならBF16を実行してください。
  • DeepReinforceのリリース時の数値では、9Bはサイズが3倍のモデルであるGemma 4 31Bを、4つのベンチマークのうち3つで上回っています。
  • モデルにはデフォルトのサンプリング設定が付属していません。一般的な作業ではtemperature 1.0、コーディングでは0.6に設定し、top_p 0.95、top_k 20を使ってください。
12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで使うローカルLLMを比較。モデルの選び方、量子化形式、メモリ使用量を確認し、PCのスペックに合うモデルを探せます。

9/30/26

15分

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5をOpus、Fable、GPT-6 Astraと比較し、お使いのハードウェアに合うローカルのQwen、Ornith、Bonsaiモデルを選びましょう。

9/29/26

13分

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できるのでしょうか?その仕組みを学び、JevとLayaのTetris比較デモを見て、独立したローカルの代替モデルとしてLayaをセットアップしましょう。

9/25/26

12分

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルAI画像生成ツールを比較し、7つのモデルをRTX 5090でベンチマーク測定しました。生成画像の例、生成速度、メモリ使用量、ライセンスの制限を確認できます。

9/25/26

14分