MiniCPM-V 4.6

更新
05.10.2026
画像認識

MiniCPM-V 4.6は、OpenBMBが開発した1.3Bの視覚言語モデルです。デバイス上で画像や動画を読み取り、開発元が提供するGGUFビルドは最小0.5 GBです。

基本情報

  • ライセンス: Apache 2.0、商用利用も無料
  • パラメータ数: 1.3B、SigLIP2-400MとQwen3.5-0.8Bが基盤
  • コンテキスト長: 262,144トークン
  • モダリティ: 単一画像、複数画像、動画の入力
  • 最小ハードウェア要件: 最小0.5 GBのGGUFと1.11 GBの視覚プロジェクター。スマートフォンで動作

MiniCPM-V 4.6とは?

MiniCPM-V 4.6は、OpenBMBが開発した1.3Bの視覚言語モデルで、MiniCPM-Vファミリーの中でこれまでで最もエッジ環境に導入しやすいモデルです。SigLIP2-400MとQwen3.5-0.8B LLMを基盤とし、同ファミリーの単一画像、複数画像、動画の理解能力を継承しています。また、4倍/16倍を混在させた視覚トークン圧縮を導入し、実行時に精度と速度のバランスを調整できます。OpenBMBは、スマートフォンで画像や動画を理解するためのポケットサイズのMLLMと明確に位置づけています。

仕様MiniCPM-V 4.6
総パラメータ数1.3B
アーキテクチャSigLIP2-400M視覚エンコーダー + Qwen3.5-0.8B LLM
コンテキスト長262,144トークン
モダリティテキスト、単一画像、複数画像、動画の入力
トークン圧縮4倍/16倍を混在させた視覚トークン圧縮
モバイルプラットフォームiOS, Android, HarmonyOS
リリース日2026年4月
ライセンスApache 2.0

MiniCPM-V 4.6が得意なこと

強みは効率の高さで、OpenBMBはモデルカードの数値でそれを裏づけています。Artificial Analysis Intelligence Indexでは、Qwen3.5-0.8Bの10に対して13を記録し、トークンコストは19分の1に抑えられています。また、より大きなMinistral 3 3Bも上回ります。視覚言語タスクでは、OpenCompass、RefCOCO、HallusionBench、MUIRBench、OCRBenchでQwen3.5 2B相当の能力に達しています。LLaVA-UHD v4の手法により視覚エンコーディングのFLOPsを半分以上削減し、トークンスループットはQwen3.5-0.8Bの約1.5倍です。

視覚モデルとしては、対応する導入環境が非常に幅広くなっています。推論ではvLLM、SGLang、llama.cpp、Ollama、ファインチューニングではSWIFT、LLaMA-Factoryに対応し、GGUF、BNB、AWQ、GPTQの量子化版が提供されています。モバイル環境への対応コードはすべてオープンソース化されており、iOS、Android、HarmonyOSをカバーしています。

MiniCPM-V 4.6のハードウェア要件

システム要件で確認すべきなのはメモリですが、このモデルではほとんど必要ありません。以下はOpenBMB自身が提供するGGUFビルドです。

ビルドファイルサイズ
Q4_00.50 GB
Q4_K_M0.53 GB
Q8_00.81 GB
F161.52 GB
視覚プロジェクター(mmproj, F16)1.11 GB

フル精度のビルドでもプロジェクターを含めて3 GB未満なので、最近のノートパソコンならどれでも、またスマートフォンや十分なRAMを備えたRaspberryクラスのボードも実行先の候補になります。GGUF形式に初めて触れる方は、まずGGUFとは何かをご覧ください。

Atomic ChatでMiniCPM-V 4.6を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでMiniCPM-V 4.6を検索し、Download Optionsを開きます。
  3. ビルドを選び、チャットに画像を添付して、その画像について質問します。

小型ハードウェアで動くほかのモデルについては、ローカルLLMの全カタログをご覧ください。

MiniCPM-V 4.6のライセンス

MiniCPM-V 4.6はApache 2.0で公開されています。商用利用、改変、再配布がロイヤリティなしで認められているため、このモデルを使った製品を開発し、利用料なしで自分のハードウェア上で実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download openbmb/MiniCPM-V-4.6
# llama.cpp向けの開発元のGGUFビルド:
huggingface-cli download openbmb/MiniCPM-V-4.6-gguf MiniCPM-V-4_6-Q4_K_M.gguf mmproj-model-f16.gguf
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MiniCPM-V-4.6",
    "messages": [{"role": "user", "content": [
      {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}},
      {"type": "text", "text": "What does this chart show?"}
    ]}]
  }'
from transformers import AutoModel, AutoTokenizer
from PIL import Image

model_id = "openbmb/MiniCPM-V-4.6"
model = AutoModel.from_pretrained(model_id, trust_remote_code=True, torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)

image = Image.open("receipt.jpg").convert("RGB")
msgs = [{"role": "user", "content": [image, "Extract the total amount."]}]
print(model.chat(msgs=msgs, tokenizer=tokenizer))
import OpenAI from "openai";

const client = new OpenAI({ baseURL: "http://localhost:8000/v1", apiKey: "local" });
const res = await client.chat.completions.create({
  model: "MiniCPM-V-4.6",
  messages: [{ role: "user", content: [
    { type: "image_url", image_url: { url: "https://example.com/screenshot.png" } },
    { type: "text", text: "Describe this screenshot." }
  ]}],
});
console.log(res.choices[0].message.content);
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

MiniCPM-V 4.6は、OpenBMBが開発した1.3Bの視覚言語モデルで、SigLIP2-400MとQwen3.5-0.8B LLMを基盤としています。単一画像、複数画像、動画の理解に対応し、OpenBMBのモデルの中でこれまでで最もエッジ環境に導入しやすいモデルです。4倍/16倍を混在させた視覚トークン圧縮により、精度重視と速度重視を切り替えられます。

ごくわずかです。OpenBMB自身が提供するGGUFビルドは、Q4_0で最小0.5 GBに1.11 GBの視覚プロジェクターを加えた構成で、フルF16ビルドは1.52 GBです。最近のノートパソコンならどれでも余裕を持って収まり、オープンソース化された対応コードを使えば、iOS、Android、HarmonyOSのスマートフォンにも導入できます。

はい。重みはApache 2.0ライセンスで公開されており、商用利用、改変、再配布がロイヤリティなしで認められています。ローカルで実行する場合、API料金やトークン単位の課金はありません。

小型ハードウェアでの効率的な画像・動画の理解です。OpenBMBによると、ほとんどの視覚言語タスクでQwen3.5-0.8Bを上回り、OpenCompass、RefCOCO、HallusionBench、MUIRBench、OCRBenchなどのベンチマークでQwen3.5 2B相当の能力に達しています。また、LLaVA-UHD v4の手法により、視覚エンコーディングのFLOPsを50%超削減しています。

推論ではvLLM、SGLang、llama.cpp、Ollamaに、ファインチューニングではSWIFT、LLaMA-Factoryに対応しています。OpenBMBはGGUF、BNB、AWQ、GPTQ形式の量子化版を公開しているため、一般消費者向けのGPUやCPUで実行できます。