MiniCPM-V 4.6とは?
MiniCPM-V 4.6は、OpenBMBが開発した1.3Bの視覚言語モデルで、MiniCPM-Vファミリーの中でこれまでで最もエッジ環境に導入しやすいモデルです。SigLIP2-400MとQwen3.5-0.8B LLMを基盤とし、同ファミリーの単一画像、複数画像、動画の理解能力を継承しています。また、4倍/16倍を混在させた視覚トークン圧縮を導入し、実行時に精度と速度のバランスを調整できます。OpenBMBは、スマートフォンで画像や動画を理解するためのポケットサイズのMLLMと明確に位置づけています。
| 仕様 | MiniCPM-V 4.6 |
|---|---|
| 総パラメータ数 | 1.3B |
| アーキテクチャ | SigLIP2-400M視覚エンコーダー + Qwen3.5-0.8B LLM |
| コンテキスト長 | 262,144トークン |
| モダリティ | テキスト、単一画像、複数画像、動画の入力 |
| トークン圧縮 | 4倍/16倍を混在させた視覚トークン圧縮 |
| モバイルプラットフォーム | iOS, Android, HarmonyOS |
| リリース日 | 2026年4月 |
| ライセンス | Apache 2.0 |
MiniCPM-V 4.6が得意なこと
強みは効率の高さで、OpenBMBはモデルカードの数値でそれを裏づけています。Artificial Analysis Intelligence Indexでは、Qwen3.5-0.8Bの10に対して13を記録し、トークンコストは19分の1に抑えられています。また、より大きなMinistral 3 3Bも上回ります。視覚言語タスクでは、OpenCompass、RefCOCO、HallusionBench、MUIRBench、OCRBenchでQwen3.5 2B相当の能力に達しています。LLaVA-UHD v4の手法により視覚エンコーディングのFLOPsを半分以上削減し、トークンスループットはQwen3.5-0.8Bの約1.5倍です。
視覚モデルとしては、対応する導入環境が非常に幅広くなっています。推論ではvLLM、SGLang、llama.cpp、Ollama、ファインチューニングではSWIFT、LLaMA-Factoryに対応し、GGUF、BNB、AWQ、GPTQの量子化版が提供されています。モバイル環境への対応コードはすべてオープンソース化されており、iOS、Android、HarmonyOSをカバーしています。
MiniCPM-V 4.6のハードウェア要件
システム要件で確認すべきなのはメモリですが、このモデルではほとんど必要ありません。以下はOpenBMB自身が提供するGGUFビルドです。
| ビルド | ファイルサイズ |
|---|---|
| Q4_0 | 0.50 GB |
| Q4_K_M | 0.53 GB |
| Q8_0 | 0.81 GB |
| F16 | 1.52 GB |
| 視覚プロジェクター(mmproj, F16) | 1.11 GB |
フル精度のビルドでもプロジェクターを含めて3 GB未満なので、最近のノートパソコンならどれでも、またスマートフォンや十分なRAMを備えたRaspberryクラスのボードも実行先の候補になります。GGUF形式に初めて触れる方は、まずGGUFとは何かをご覧ください。
Atomic ChatでMiniCPM-V 4.6を実行する方法
Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。
- お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
- モデルブラウザーでMiniCPM-V 4.6を検索し、Download Optionsを開きます。
- ビルドを選び、チャットに画像を添付して、その画像について質問します。
小型ハードウェアで動くほかのモデルについては、ローカルLLMの全カタログをご覧ください。
MiniCPM-V 4.6のライセンス
MiniCPM-V 4.6はApache 2.0で公開されています。商用利用、改変、再配布がロイヤリティなしで認められているため、このモデルを使った製品を開発し、利用料なしで自分のハードウェア上で実行できます。
