Nex-N2-Pro

更新
04.10.2026
ツール利用
思考
画像認識
推論
コード生成

Nex-N2-Proは、Qwen3.5-397B-A17Bに事後学習を施した、Nex-AGIの396.8Bパラメータの混合エキスパート型エージェントモデルです。ライセンスはApache 2.0で、GGUFビルドは82 GBから用意されています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 総数396.8B、アクティブ約17B
  • コンテキスト長: 262,144トークン
  • モダリティ: テキストと画像を入力、テキストを出力
  • 最小ハードウェア要件: IQ1_S GGUF(81.8 GB)使用時に96 GBのメモリ

Nex-N2-Proとは?

Nex-N2-Proは、Nex-AGIが開発した396.8Bパラメータの混合エキスパートモデルで、Nex-N2としてリリースされた2つのモデルのうち大きい方です。Nex-AGIは両モデルをオープンソースとして提供しています。Qwen3.5-397B-A17Bに事後学習を施したモデルで、トークンごとに約17Bのパラメータがアクティブになり、エージェントによるコーディング、詳細な調査、ツール呼び出し、ターミナルでの実行といったエージェント型の作業を対象としています。Nex-AGIは2026年6月3日、小型のNex-N2-miniとともに、Apache 2.0ライセンスで重みをHugging Faceに公開しました。開発元自身が公開した起動例では、H100を8基ずつ搭載した2つのノードにまたがってProを稼働させているため、ローカル実行はノートPCではなくワークステーション向けです。

仕様Nex-N2-Pro
総パラメータ数396.8B
アクティブパラメータ数トークンごとに約17B
アーキテクチャ混合エキスパート方式。512のエキスパートのうちトークンごとに10を選択し、さらに共有エキスパートを使用
ベースモデルQwen3.5-397B-A17B(事後学習済み)
層数60
アテンションハイブリッド方式:4層ごとにフルアテンションを使用し、残りはゲート付きデルタ線形アテンションを使用
コンテキスト長262,144トークン
モダリティテキストと画像を入力、テキストを出力
複数トークン予測チェックポイントにMTP層を1層搭載
推論明示的な推論過程を出力し、qwen3推論パーサーで解析
関数呼び出し対応。qwen3_coderツール呼び出しパーサーを使用
推奨サンプリング設定temperature 0.7, top_p 0.95, top_k 40
リリース日2026年6月3日
ライセンスApache 2.0

Nex-AGIがこのリリースの中心に据えるのは、同社がAgentic Thinkingと呼ぶ考え方です。要件の理解、タスクの計画、コードの実装、環境からのフィードバック、評価、デバッグを1つのループでつなぎます。Adaptive Thinkingでは、いつ、どこまで深く考えるかをモデルが判断するため、単純な操作は素早く実行し、重要な判断では十分に推論します。Coherent Thinkingでは、汎用的な推論とエージェント型タスクに共通の推論の枠組みを適用します。Nex-AGIは、これによって能力を安定して転用できるとしています。設定もこのエージェント重視の設計に沿っています。4層に1層がフルアテンションを、残りがゲート付きデルタ線形アテンションを実行し、線形アテンションのvalueヘッドは64、keyヘッドは16で、位置数の上限は262,144トークンです。27層のビジョンタワーにより、テキストとともに画像も読み取れます。また、チェックポイントには複数トークン予測層が1層含まれています。

Nex-N2-Proのベンチマーク

Nex-AGIは、自社のモデルカードにリリース時の比較表を掲載し、N2の両モデルをGPT-5.5、Opus 4.7、Kimi-K2.6、GLM-5.1、MiniMax M3、DeepSeek-V4-Proと比較評価しています。以下は、各列の数値が比較的よくそろっている主要な項目です。

ベンチマークNex-N2-ProGPT-5.5Opus 4.7Kimi-K2.6MiniMax M3DeepSeek-V4-Pro
BrowseComp
ウェブ閲覧
83.784.479.883.283.583.4
GDPval
専門業務
1585176917531481-1554
Toolathlon
長期的なツール利用
51.955.652.850.0-51.8
Terminal-Bench 2.1
ターミナル操作エージェント
75.383.469.7-66.072.0
SWE-Bench Verified
ソフトウェア開発
80.882.987.680.280.580.6
SWE-Bench Pro
高難度のソフトウェア開発
58.858.664.358.659.055.4
GPQA Diamond
専門的な科学知識
90.793.694.290.5-90.1

Nex-N2-Proは、これらのどの項目でも首位ではありません。エージェントとターミナルに関する4項目ではGPT-5.5が、SWE-Benchの2項目とGPQA DiamondではOpus 4.7が首位です。この表でKimi-K2.6とDeepSeek-V4-Proの数値が報告されている項目では、Nex-N2-Proは両モデルをすべて上回っています。また、MiniMax M3に対しても、SWE-Bench Proを除くすべての項目で上回っています。SWE-Bench Proでは、MiniMax M3の59.0に対して58.8です。ProはGPT-5.5やOpus 4.7などの最上位モデルに引けを取らないというNex-AGI自身の総括は、この数値と整合しています。

Nex-N2-Proのハードウェア要件

確認すべきシステム要件はメモリです。この規模では、必要な容量も非常に大きくなります。Nex-AGIが提供するのは元のsafetensors形式の重みのみで、BF16では約794 GBです。以下の段階別の表には、コミュニティリポジトリbartowski/nex-agi_Nex-N2-Pro-GGUFの実際のファイルサイズを使用しています。このリポジトリでは、どのビルドも複数のシャードに分割されています。

メモリ選ぶビルドファイルサイズ
96 GBIQ1_S81.8 GB
128 GBIQ2_XXS106.3 GB
192 GBIQ3_XXS166.1 GB
256 GBIQ4_XS212.2 GB
384 GBQ5_K_M283.3 GB
512 GB以上Q8_0421.5 GB

2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。この表では、隣り合う段階の容量差が数十GBあります。モデルに画像を読み取らせたい場合は、同じリポジトリにある0.9 GBのmmprojファイルを追加してください。この形式に初めて触れる方は、まずGGUFとは何かをご覧ください。

Atomic ChatでNex-N2-Proを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードし、開きます。
  2. モデルブラウザーでNex-N2-Proを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

小型の姉妹モデルであるNex-N2-miniは、Qwen3.5-35B-A3B-Baseに事後学習を施したモデルです。Nex-AGIは、この2つのモデルがそれぞれ異なるレイテンシと品質のトレードオフに対応すると説明しています。両モデルはローカルで実行できるNexモデルのページに掲載されています。

Nex-N2-Proのライセンス

Nex-N2-ProはApache 2.0ライセンスで公開されています。このライセンスでは、ロイヤリティなしでの商用利用、改変、再配布が認められています。そのため、モデルをファインチューニングし、自社製品に組み込んで出荷し、自前のハードウェア上で提供しても、利用料やトークン単位の料金は発生しません。

Hugging Faceからモデルをダウンロード

huggingface-cli download nex-agi/Nex-N2-Pro
from transformers import AutoModel
model = AutoModel.from_pretrained("nex-agi/Nex-N2-Pro")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Nex-N2-Proは、nex-agiが2026年6月に公開した、Qwen3.5アーキテクチャに基づく重み公開型の混合エキスパート言語モデルです。総パラメータ数は396.8Bで、トークンごとに約17Bがアクティブになります。テキストと画像を受け付け、コーディング、ツール利用、長いエージェント型ワークフロー向けに調整されています。Apache 2.0ライセンスが適用されるため、無料でダウンロードして使用できます。

4ビット量子化ビルドには、合計で約214-256 GBのメモリが必要です。256 GBのユニファイドメモリを搭載したMac Studio、または24 GBのGPUと大容量のシステムRAMを搭載し、llama.cppのMoEオフロードを利用するPCで動作します。後者では、毎秒25+トークンの速度が報告されています。トークンごとにアクティブになるパラメータは17Bだけなので、実用的な速度を得るために複数GPUのサーバーは必要ありません。

はい。重みはApache 2.0ライセンスで公開されており、個人利用と商用利用、改変、再配布が無料で認められています。Atomic Chatでローカル実行する場合、自前のハードウェアと電気代以外の費用はかからず、API料金やトークン単位の課金もありません。

はい。重みをダウンロードすれば、Nex-N2-Proはネットワーク接続なしで、すべてお使いのマシン上で動作します。Atomic Chatでは、すべてのプロンプトと応答がデバイス内にとどまるため、コードや文書がサーバーに送信されることはありません。

エージェントによるソフトウェア開発向けに作られており、コードの作成とデバッグ、ツールの呼び出し、複数の手順からなるワークフローの自律的な実行を行います。実在するリポジトリの実際のバグを修正するベンチマークであるSWE-Bench Verifiedでは80.8が報告されており、日常のコーディングに役立つ水準です。262,144トークンのコンテキスト長と画像対応により、大規模なコードベース、長い文書、画像を対象とした推論も可能です。