LocateAnything-3B

更新
05.10.2026
思考
画像認識
推論
コード生成

LocateAnything-3BはNVIDIAの視覚グラウンディングモデルです。画像と自然言語の指示から、物体、GUI要素、文字の位置をバウンディングボックスや点で出力します。

基本情報

  • ライセンス: NVIDIA License、非商用研究のみ
  • パラメータ数: 3.8B
  • コンテキスト長: プロンプトは24Kトークン、出力は最大8,192トークン
  • モダリティ: 画像とテキストの入力、ボックスと点の座標を含むテキストの出力
  • 最小ハードウェア要件: メモリ4 GB(Q4_K_M GGUFの2.11 GBに加え、0.87 GBの視覚ファイル)

LocateAnything-3Bとは?

LocateAnything-3Bは、視覚グラウンディング向けに開発されたNVIDIAの3.8B視覚言語モデルです。画像と平易な英語による指示を与えると、指定した対象の正確なバウンディングボックスや点を返します。MoonViT視覚エンコーダとQwen2.5-3B-Instruct言語モデルを組み合わせた、NVIDIAのEagle VLMファミリーに属するモデルです。同じグラウンディング技術は、Nemotron 3 Nano Omniを含むNVIDIAの本番運用向けモデルにも組み込まれています。併用するNVIDIAの汎用モデルについては、Nemotron Nano 9B v2をご覧ください。NVIDIAは2026年5月26日に、研究向けリリースとして重みを公開しました。

仕様LocateAnything-3B
総パラメータ数3.8B
アーキテクチャMoonViT視覚エンコーダ + Qwen2.5-3B-Instruct言語モデル、MLPプロジェクタ
中核となる仕組みParallel Box Decoding、最大2.5倍のスループット
入力最大2.5K解像度のRGB画像、最大24Kトークンのプロンプト
出力ボックスと点の座標を含むテキスト、最大8,192トークン
生成モードFast(並列)、Slow(自己回帰)、Hybrid(デフォルト)
学習データ画像1,200万枚、クエリ1億3,800万件超、バウンディングボックス7億8,500万個
リリース日2026年5月26日
ライセンスNVIDIA License、非商用

特徴的なのはParallel Box Decodingです。標準的なVLMはボックス座標を1トークンずつ出力しますが、LocateAnythingは単一の並列ステップで、ボックス全体を1つの固定長ブロックとして予測します。NVIDIAの測定では、従来の手法に対して最大2.5倍のスループットを達成しています。デフォルトのハイブリッドモードでは並列にデコードし、ボックスの位置に曖昧さがある場合や出力形式が崩れた場合には、トークン単位のデコードに切り替えます。これはNVIDIAが推奨する速度と精度のバランスです。座標は0から1000の範囲に正規化された整数で返されるため、数行の解析コードで、どの回答も元の画像サイズに対応するピクセル座標に変換できます。

LocateAnything-3Bが得意なこと

NVIDIAは、自然の風景、ロボティクス、運転、GUI操作、文書理解にわたる1,200万枚の画像でこのモデルを学習させました。3.8Bモデルとしては幅広いタスクに対応しています。未知のカテゴリを含むオープンセット物体検出と出現頻度の低い物体の検出、物体が入り組んだ場面での密集した複数物体の検出、フレーズや参照表現のグラウンディング("people wearing red shirts")、実環境の画像内にあるテキストの検出とOCR対象の位置特定、文書レイアウトのグラウンディング、点による位置特定です。

特に注目される用途は2つあります。GUI要素のグラウンディングは、自然言語の指示からボタンや入力欄の画面上の座標をエージェントに提供します。これは、コンピュータ操作パイプラインが何かをクリックする前に必要となる機能です。もう1つは、データセットの自動ラベル付けです。モデルは説明に一致するすべての対象をボックスや点で示します。NVIDIAはこれを、大規模なアノテーションに対応する用途として挙げています。同社はほかにも、ロボティクスにおける知覚、自動運転、産業検査、リモートセンシングを用途に挙げています。

LocateAnything-3Bのハードウェア要件

システム要件で確認すべきなのはメモリです。NVIDIA公式の手順では、Linux上でTransformersを使ってBF16チェックポイントを実行します。llama.cppベースのアプリ向けには、コミュニティリポジトリyuuko-eth/LocateAnything-3B-GGUFで変換済みファイルが公開されています。どのビルドでも、メインファイルとともに0.87 GBのmmproj視覚ファイルを読み込みます。

メモリ選択するビルドファイルサイズ
4 GBQ4_K_M2.11 GB
6 GBQ6_K2.80 GB
8 GBQ8_03.62 GB
12 GB以上BF166.81 GB

2つのビルドがどちらもメモリに収まる場合は、大きいほうを選びます。この形式に馴染みがなければ、まずGGUFとは何かをご覧ください。

Atomic ChatでLocateAnything-3Bを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料ローカルアプリです。Hugging Faceのモデルブラウザとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして開きます。
  2. モデルブラウザでLocateAnything-3Bを検索し、Download Optionsを開きます。
  3. 利用可能なメモリに収まるビルドを選び、チャットを開始します。

ファミリーの概要については、ローカルで実行できるLocateAnythingモデルの一覧をご覧ください。

LocateAnything-3Bのライセンス

LocateAnything-3BはNVIDIA Licenseの下で提供されています。このライセンスでは、学術研究および非営利研究に限り、使用、複製、改変が認められています。NVIDIAとその関連会社を除き、商用利用は認められておらず、再配布時にはライセンスと帰属表示を保持する必要があります。2つの構成要素には、それぞれ独自の条件が適用されます。Qwen2.5-3B-Instruct言語モデルにはQwen Research License、MoonViT視覚エンコーダにはMITが適用されます。商用製品に組み込んで提供するモデルではなく、試作や研究に使うモデルとして扱ってください。

Hugging Faceからモデルをダウンロード

huggingface-cli download nvidia/LocateAnything-3B
from transformers import AutoModel
model = AutoModel.from_pretrained("nvidia/LocateAnything-3B")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

LocateAnything-3Bは、NVIDIAのEagleシリーズを基盤とする、パラメータ数3.8Bの視覚言語モデルです。視覚グラウンディングとオープンボキャブラリ物体検出向けに開発されています。画像とテキストプロンプトを与えると、指定した物体の正確な位置をバウンディングボックスや点で返します。固定されたクラスの一覧ではなく、あらかじめ限定されていないカテゴリ、参照表現、GUI要素、OCR対象のテキストを扱います。

FP16での推論には、重み、活性化、KVキャッシュを含めて、およそ8.4 GBのVRAMが必要です。INT4に量子化すると約2.1 GBまで減るため、RTX 4060のような8 GBのカードで実行できます。このモデルはBF16を使用するため、Ampere以降のNVIDIA GPU(RTX 30/40/50シリーズ、A100、H100)が必要です。

重みはHugging Faceから無料でダウンロードできます。NVIDIA License(非商用)の下で公開されており、学術研究および非営利研究に限り、使用、改変、複製が認められています。商用利用は認められていないため、有料製品で使用する前にライセンスを確認してください。

はい。huggingface-cliで重みをダウンロードすれば、インターネット接続なしで、すべての処理を手元のハードウェア上で実行できます。Atomic Chatではデバイス上で動作するため、解析する画像や入力するプロンプトがマシンの外に出ることはありません。また、Pythonランタイムを使わずにCPUのみでオフライン推論を行える、C++のggml移植版(locate-anything.cpp)もあります。

YOLOのような固定クラスの検出器とは異なり、オープンボキャブラリ検出を行います。任意のカテゴリを通常のテキストで指定すれば、再学習なしでその対象を検出できます。物体が密集した場面や出現頻度の低い物体に対して高い性能を発揮し、"the person on the left holding a phone."のような参照表現が指す対象も特定できます。このため、言語から空間座標を取得する必要があるGUIエージェント、ロボティクス、文書理解パイプラインに適しています。