North-Mini-Code-1.0

更新
04.10.2026
ツール利用
思考
埋め込み
推論
コード生成

North-Mini-Code-1.0は、エージェントによるコーディングとターミナル作業向けに開発されたCohereの30B-A3B MoEモデルです。コンテキスト長は256Kで、ライセンスはApache 2.0です。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計30B、トークンごとに3Bが有効
  • コンテキスト長: 256Kトークン、最大出力64K
  • モダリティ: テキスト入力、テキスト出力
  • 最小ハードウェア要件: メモリ12 GB(最小のGGUFは9.38 GB)

North-Mini-Code-1.0とは?

North-Mini-Code-1.0は、CohereとCohere Labsが研究用に重みを公開した、30Bパラメータの混合エキスパートモデルです。コード生成、エージェントによるソフトウェアエンジニアリング、ターミナル作業向けに調整されています。トークンごとに有効になるパラメータは3Bのみです。各トークンは128個のエキスパートのうち8個を通るため、モデル全体をメモリに収める必要はありますが、トークンあたりの計算量は小さく抑えられます。Cohereは2026年6月5日にApache 2.0のもとで重みを公開しました。

仕様North-Mini-Code-1.0
総パラメータ数合計30B、トークンごとに3Bが有効
アーキテクチャデコーダーのみの疎な混合エキスパート構成、エキスパート128個のうち8個が有効
アテンションRoPEを用いたスライディングウィンドウアテンションと、位置埋め込みを用いないグローバルアテンションを3:1の比率で交互に配置
コンテキスト長256Kトークン
最大出力64Kトークン
モダリティテキスト入力、テキスト出力
事後学習2段階のSFTの後、検証可能な報酬による強化学習(RLVR)
公開日2026年6月5日
ライセンスApache 2.0

各エキスパートはSwiGLU活性化関数を用いたFFNブロックです。ルーターはtop-k選択の前にロジットへシグモイド関数を適用し、疎な層群の前には単一のデンス層が置かれています。事後学習は、教師ありファインチューニング、続いて検証可能な報酬による強化学習という連続する2段階で行われ、エージェントによるコーディングに重点が置かれました。このモデルは処理の合間に思考を挟む機能に対応しており、Cohereによれば、この機能を有効にすると最も高い性能を発揮します。生成された思考は、その後のエージェントの処理ステップやチャットのターンに引き継いでください。Cohereは生成時にtemperatureを1.0、top_pを0.95に設定することを推奨しています。

North-Mini-Code-1.0が得意なこと

Cohereはリリース時の比較をスコア表ではなくグラフで公開しているため、ここに転載できる提供元の数値はありません。ただし、モデルカードには評価に使用したベンチマークが明記されています。エージェントによるコーディングにはSWE-Bench Verified、SWE-Bench Pro、Terminal-Bench v2、Terminal-Bench Hardを、ツールを使用しない複雑なコード生成にはSciCodeとLiveCodeBench v6を使用し、それぞれ3種類のシードで実行して平均を取りました。この一覧から、モデルが何を目的に作られたかがよく分かります。一般的なチャットではなく、ターミナルを使いながら複数のステップを進めるソフトウェアエンジニアリングです。

ツール使用は学習に組み込まれており、JSONスキーマによるツール定義を含む標準のチャットテンプレートを通じて利用できます。Cohereは、処理の合間に推論を挟む機能を有効にして、ローカルのvLLMサーバーに接続したOpenCodeでモデルを動かす方法を公開しています。何もダウンロードせずに、OpenCodeやホストされたHugging Face Spaceで試すこともできます。元の重みを使って推論を提供するには、vLLMのmainと、応答の解析に使うCohereのmelodyライブラリが必要です。

North-Mini-Code-1.0のハードウェア要件

システム要件で確認すべきなのはメモリです。トークンごとに有効になるのは3Bだけですが、30B全体を読み込む必要があります。Cohereはsafetensors形式で配布しています。以下のGGUFビルドと実際のファイルサイズは、コミュニティリポジトリunsloth/North-Mini-Code-1.0-GGUFのものです。

メモリ選ぶビルドファイルサイズ
12 GBUD-IQ2_M9.86 GB
16 GBUD-IQ3_S12.77 GB
24 GBUD-Q4_K_XL19.25 GB
32 GBUD-Q5_K_XL23.00 GB
48 GB以上UD-Q8_K_XL33.21 GB

隣り合うビルドのサイズ差は1〜2 GBなので、両方がメモリに収まる場合は大きい方を選んでください。この一覧よりも小さいビルドとして、メモリに余裕のないマシン向けに9.38 GBのUD-IQ1_Mもありますが、低ビット量子化では品質の低下が最も大きくなります。この形式を初めて使う方は、まずGGUFとは何かをご覧ください。

Atomic ChatでNorth-Mini-Code-1.0を実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでNorth-Mini-Code-1.0を検索し、Download Optionsを開きます。
  3. お使いのメモリに収まるビルドを選び、チャットを始めます。

同じ規模と構成のモデルと比較するなら、同じく30B-A3Bのコーディング向けMoEモデルであるQwen3 Coder 30B-A3Bをご覧ください。また、ローカルで実行できるすべてのモデルも参照できます。

North-Mini-Code-1.0のライセンス

North-Mini-Code-1.0はApache 2.0のもとで公開されています。このライセンスはロイヤリティなしでの商用利用、改変、再配布を認めているため、利用料を支払わずに、商用のコーディング環境で実行したり、ファインチューニングしたり、このモデルを基盤とする製品を提供したりできます。

Hugging Faceからモデルをダウンロード

huggingface-cli download CohereLabs/North-Mini-Code-1.0
from transformers import AutoModel
model = AutoModel.from_pretrained("CohereLabs/North-Mini-Code-1.0")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

North-Mini-Code-1.0は、CohereLabs初の開発者向けモデルです。エージェントによるソフトウェアエンジニアリング向けに開発された、30.5Bパラメータの混合エキスパートモデルで、有効になるパラメータは約3Bです。ツール使用と、処理の合間に思考を挟む機能に標準で対応しているため、コーディングエージェントとして計画を立て、ファイルを編集し、ターミナルコマンドを実行できます。Apache 2.0ライセンスのもとで重みが公開されており、Atomic Chatを通じて、すべての処理を自分のハードウェア上で実行できます。

フル精度のモデルは、FP8では単一のH100 80GB GPU、BF16では2x A100 40GBを想定しています。有効なパラメータが約3Bしかない疎なMoEであるため、量子化されたGGUFビルドでは必要な容量が大幅に小さくなります。約9GBからフルBF16までのビルドがあり、低ビット量子化版ならコンシューマー向けGPUにも読み込めます。Atomic Chatでは、利用可能なVRAMに収まる量子化版を選びます。

はい。Apache 2.0ライセンスのもとで公開されており、商用利用、改変、再配布を無償で行えます。Atomic Chatを通じてローカルで実行すれば、API料金やトークンごとの課金はありません。ただし、Cohereは同社の利用規定にも従うよう求めています。

はい。重みをダウンロードすれば、推論はすべて自分のマシン上で実行され、インターネット接続は必要ありません。インターネットに接続したコンピューターでファイルを取得し、ネットワークから物理的に隔離された環境へ移して、そこでモデルを実行することもできます。これにより、非公開のソースコードを自分のハードウェア内に留められます。これが、Atomic Chatでローカル実行する主な理由です。

huggingface-cli download CohereLabs/North-Mini-Code-1.0を使って重みをダウンロードするか、リソースの少ないハードウェア向けに量子化されたGGUFビルドを入手します。推論サーバーでの実行については、現在vLLMとSGLangがこのモデルのcohere2moeアーキテクチャに対応しています。一方、llama.cppとOllamaでは、128個のエキスパートへの対応を含むビルドが必要です。最も簡単なのはAtomic Chatを使う方法です。量子化版を選んでワンクリックで読み込んだら、チャットに使うことも、コーディングエージェントに接続することもできます。