LocateAnything-3Bとは?
LocateAnything-3Bは、視覚グラウンディング向けに開発されたNVIDIAの3.8B視覚言語モデルです。画像と平易な英語による指示を与えると、指定した対象の正確なバウンディングボックスや点を返します。MoonViT視覚エンコーダとQwen2.5-3B-Instruct言語モデルを組み合わせた、NVIDIAのEagle VLMファミリーに属するモデルです。同じグラウンディング技術は、Nemotron 3 Nano Omniを含むNVIDIAの本番運用向けモデルにも組み込まれています。併用するNVIDIAの汎用モデルについては、Nemotron Nano 9B v2をご覧ください。NVIDIAは2026年5月26日に、研究向けリリースとして重みを公開しました。
| 仕様 | LocateAnything-3B |
|---|---|
| 総パラメータ数 | 3.8B |
| アーキテクチャ | MoonViT視覚エンコーダ + Qwen2.5-3B-Instruct言語モデル、MLPプロジェクタ |
| 中核となる仕組み | Parallel Box Decoding、最大2.5倍のスループット |
| 入力 | 最大2.5K解像度のRGB画像、最大24Kトークンのプロンプト |
| 出力 | ボックスと点の座標を含むテキスト、最大8,192トークン |
| 生成モード | Fast(並列)、Slow(自己回帰)、Hybrid(デフォルト) |
| 学習データ | 画像1,200万枚、クエリ1億3,800万件超、バウンディングボックス7億8,500万個 |
| リリース日 | 2026年5月26日 |
| ライセンス | NVIDIA License、非商用 |
特徴的なのはParallel Box Decodingです。標準的なVLMはボックス座標を1トークンずつ出力しますが、LocateAnythingは単一の並列ステップで、ボックス全体を1つの固定長ブロックとして予測します。NVIDIAの測定では、従来の手法に対して最大2.5倍のスループットを達成しています。デフォルトのハイブリッドモードでは並列にデコードし、ボックスの位置に曖昧さがある場合や出力形式が崩れた場合には、トークン単位のデコードに切り替えます。これはNVIDIAが推奨する速度と精度のバランスです。座標は0から1000の範囲に正規化された整数で返されるため、数行の解析コードで、どの回答も元の画像サイズに対応するピクセル座標に変換できます。
LocateAnything-3Bが得意なこと
NVIDIAは、自然の風景、ロボティクス、運転、GUI操作、文書理解にわたる1,200万枚の画像でこのモデルを学習させました。3.8Bモデルとしては幅広いタスクに対応しています。未知のカテゴリを含むオープンセット物体検出と出現頻度の低い物体の検出、物体が入り組んだ場面での密集した複数物体の検出、フレーズや参照表現のグラウンディング("people wearing red shirts")、実環境の画像内にあるテキストの検出とOCR対象の位置特定、文書レイアウトのグラウンディング、点による位置特定です。
特に注目される用途は2つあります。GUI要素のグラウンディングは、自然言語の指示からボタンや入力欄の画面上の座標をエージェントに提供します。これは、コンピュータ操作パイプラインが何かをクリックする前に必要となる機能です。もう1つは、データセットの自動ラベル付けです。モデルは説明に一致するすべての対象をボックスや点で示します。NVIDIAはこれを、大規模なアノテーションに対応する用途として挙げています。同社はほかにも、ロボティクスにおける知覚、自動運転、産業検査、リモートセンシングを用途に挙げています。
LocateAnything-3Bのハードウェア要件
システム要件で確認すべきなのはメモリです。NVIDIA公式の手順では、Linux上でTransformersを使ってBF16チェックポイントを実行します。llama.cppベースのアプリ向けには、コミュニティリポジトリyuuko-eth/LocateAnything-3B-GGUFで変換済みファイルが公開されています。どのビルドでも、メインファイルとともに0.87 GBのmmproj視覚ファイルを読み込みます。
| メモリ | 選択するビルド | ファイルサイズ |
|---|---|---|
| 4 GB | Q4_K_M | 2.11 GB |
| 6 GB | Q6_K | 2.80 GB |
| 8 GB | Q8_0 | 3.62 GB |
| 12 GB以上 | BF16 | 6.81 GB |
2つのビルドがどちらもメモリに収まる場合は、大きいほうを選びます。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。
Atomic ChatでLocateAnything-3Bを実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
- モデルブラウザでLocateAnything-3Bを検索し、Download Optionsを開きます。
- 利用可能なメモリに収まるビルドを選び、チャットを開始します。
ファミリーの概要については、ローカルで実行できるLocateAnythingモデルの一覧をご覧ください。
LocateAnything-3Bのライセンス
LocateAnything-3BはNVIDIA Licenseの下で提供されています。このライセンスでは、学術研究および非営利研究に限り、使用、複製、改変が認められています。NVIDIAとその関連会社を除き、商用利用は認められておらず、再配布時にはライセンスと帰属表示を保持する必要があります。2つの構成要素には、それぞれ独自の条件が適用されます。Qwen2.5-3B-Instruct言語モデルにはQwen Research License、MoonViT視覚エンコーダにはMITが適用されます。商用製品に組み込んで提供するモデルではなく、試作や研究に使うモデルとして扱ってください。
