Nex-N2-mini

更新
04.10.2026
ツール利用
思考
画像認識
推論
コード生成

Nex-N2-miniは、Nex-AGIがQwen3.5-35B-A3B-Baseをコーディングとツール使用向けに事後学習した35.1Bのエージェントモデルです。ライセンスはApache 2.0で、GGUFビルドは9.78 GBから提供されています。

基本情報

  • ライセンス: Apache 2.0
  • パラメータ数: 合計35.1B
  • コンテキスト長: Nex-AGIのモデルカードには記載なし
  • モダリティ: Nex-AGIによる記載なし。GGUFリポジトリではテキスト用の重みとともにmmprojプロジェクターファイルを提供
  • 最小ハードウェア要件: 最小ビルドの9.78 GBのIQ2_XXS GGUFを使用する場合、メモリ12 GB

Nex-N2-miniとは?

Nex-N2-miniは、Nex-AGIが提供するパラメータ数35.1Bのオープンウェイトのエージェントモデルで、Nex-N2としてリリースされた2モデルのうち小さい方です。Qwen3.5-35B-A3B-Baseをベースに事後学習されており、エージェントによるコーディング、詳細な調査、ツール呼び出し、ターミナルでの実行といった実務向けに設計されています。Nex-AGIは2026年6月4日、Apache 2.0の下でHugging Faceに重みを公開しました。同時に公開された大型モデルのNex-N2-Proは、Qwen3.5-397B-A17Bをベースに事後学習されています。

仕様Nex-N2-mini
総パラメータ数35.1B
ベースモデルQwen3.5-35B-A3B-Baseを事後学習
コンテキスト長Nex-AGIのモデルカードには記載なし
モダリティNex-AGIによる記載なし。GGUFリポジトリでは重みとともにmmprojプロジェクターファイルを提供
同シリーズの大型モデルNex-N2-Pro:Qwen3.5-397B-A17Bを事後学習
学習の重点領域Agentic Thinking:エージェントによるコーディング、詳細な調査、ツール呼び出し、ターミナルでの実行
推論明示的な推論過程を出力し、qwen3推論パーサーで解析
関数呼び出し対応。qwen3_coderツール呼び出しパーサーを使用
推奨サンプリング設定temperature 0.7, top_p 0.95, top_k 40
開発元の推論サービング構成Nex-AGIのSGLangフォーク。miniの起動例はH100を2基搭載したサーバー1台
リリース日2026年6月4日
ライセンスApache 2.0

このリリースの基盤となるのは、Nex-AGIがAgentic Thinkingと呼ぶフレームワークです。要件の理解、タスクの計画、コードの実装、環境からのフィードバック、評価とデバッグ、継続的な反復を、単一の閉ループにつなぎます。Adaptive Thinkingでは、いつ、どの程度深く思考するかをモデル自身が判断するため、単純な操作は素早く実行し、重要な判断では十分に推論します。Coherent Thinkingでは、汎用的な推論とエージェントタスクを通じて、共通の推論方式を維持します。実際の動作では、モデルは明示的な推論過程を出力し、関数を呼び出します。Nex-AGIのリファレンス構成では、カスタマイズしたSGLangフォーク内のqwen3推論パーサーとqwen3_coderツール呼び出しパーサーで、それぞれを解析します。

Nex-N2-miniのベンチマーク

Nex-AGIはリリース時の測定結果をモデルカードに公開し、N2の両モデルをGPT-5.5、Opus 4.7、Kimi-K2.6、GLM-5.1、MiniMax M3、DeepSeek-V4-Proと比較しています。以下の各行では、miniを同シリーズのPro、およびGPT-5.5、Opus 4.7と並べて比較しています。

ベンチマークNex-N2-miniNex-N2-ProGPT-5.5Opus 4.7
BrowseComp
ウェブ閲覧
74.183.784.479.8
Toolathlon
長期タスクでのツール使用
33.351.955.652.8
SWE-Bench Verified
ソフトウェア開発
74.480.882.987.6
SWE-Bench Pro
より難度の高いソフトウェア開発
50.258.858.664.3
Terminal-Bench 2.1
ターミナル操作エージェント
60.775.383.469.7
DeepSWE
エージェントによるコーディング
8.033.67054
GPQA Diamond
専門家レベルの科学
82.690.793.694.2

miniはここに示したどの項目でも首位ではなく、開発元の表も首位だとは主張していません。これは最先端の大規模モデルとの比較であり、それらに匹敵するのはProモデルです。上記の項目で最も差が大きいのはDeepSWEで、miniの8.0に対してGPT-5.5は70、Opus 4.7は54です。SWE-Bench Verifiedではminiが74.4、GPT-5.5が82.9、Opus 4.7が87.6で、GPQA Diamondではそれぞれ82.6、93.6、94.2です。上記以外の項目では、開発元の表にminiのスコアとしてGDPvalで1402、WildClawBenchで47.7、SWE Atlas QnAで31.5、SWE Atlas RFで30.0、SWE Atlas TWで23.3、Apexで9.4が掲載されています。開発元が最先端モデルの欄を空欄にした項目にも、miniの数値は掲載されており、WideSearchで62.0、TAU3で65.9、IFEvalで89.1です。

Nex-N2-miniのハードウェア要件

システム要件で確認すべきなのはメモリです。Nex-AGIは元のsafetensors形式の重みを提供し、独自のSGLangフォークを推奨しています。miniの起動例ではH100を2基搭載したサーバー1台を使っているため、ローカルマシンではGGUFビルドが現実的な選択肢です。以下の一覧では、Hugging Faceのコミュニティリポジトリbartowski/nex-agi_Nex-N2-mini-GGUFにある実際のファイルサイズを使用しています。最小の重みファイルはIQ2_XXSで、9.78 GBです。

メモリ選ぶビルドファイルサイズ
12 GBIQ2_XXS9.78 GB
16 GBQ2_K_L13.11 GB
24 GBIQ4_XS18.81 GB
32 GBQ4_K_M21.39 GB
48 GBQ6_K30.05 GB
64 GB以上Q8_036.91 GB

2つのビルドがどちらもメモリに収まる場合は、大きい方を選んでください。このリポジトリでは、サイズ順で隣り合うビルドの多くは差が1ギガバイト未満で、IQ3_XSの16.22 GBとQ3_K_Mの16.23 GBのように、ほぼ同じサイズのものもあります。小さいものにはIQ2_XXSの9.78 GB、IQ2_XSの10.80 GB、IQ2_Sの11.01 GBがあり、それより大きいものとしてIQ3_XXSの14.87 GB、IQ4_NLの19.86 GB、Q5_K_Mの25.02 GBも掲載されています。また、重みのビルドとは別に、bf16とf16のmmprojプロジェクターファイルが2つあり、それぞれ0.90 GBです。この形式を初めて使う場合は、まずGGUFとは何かを参照してください。

Atomic ChatでNex-N2-miniを実行する方法

Atomic Chatは、macOS、Windows、Linux向けの無料のローカルアプリです。Hugging Faceのモデルブラウザーとチャット機能を内蔵しており、llama.cppを手動でビルドする必要はありません。

  1. お使いのプラットフォーム向けのAtomic Chatをダウンロードして起動します。
  2. モデルブラウザーでNex-N2-miniを検索し、Download Optionsを開きます。
  3. お使いのメモリ容量に収まるビルドを選び、チャットを開始します。

大型モデルについてはNex-N2-Proを参照するか、ローカルで実行できるすべてのNexモデルをご覧ください。

Nex-N2-miniのライセンス

Nex-N2-miniは、Nex-AGIがモデルリポジトリに設定したApache 2.0ライセンスの下で公開されています。このライセンスでは、ロイヤルティなしで商用利用、改変、再配布が認められているため、利用料なしでモデルをファインチューニングし、自社製品に組み込んで提供し、自分のハードウェアで実行できます。

Hugging Faceからモデルをダウンロード

huggingface-cli download nex-agi/Nex-N2-mini
from transformers import AutoModel
model = AutoModel.from_pretrained("nex-agi/Nex-N2-mini")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Nex-N2-miniは、nex-agiがQwen3.5-35B-A3B-Baseをベースに構築した、パラメータ数35.1Bのオープンウェイトモデルです。トークンごとに約3Bのパラメータが有効になるMixture-of-Expertsモデルで、コーディング、ツール呼び出し、推論、長期にわたるタスクをこなすエージェントとして調整されています。画像入力にも対応し、256Kトークンのコンテキスト長をサポートします。

Q4量子化では重みが約21 GBになるため、RTX 3090、4090、5090などの24 GB GPUで実行でき、32 GB以上のユニファイドメモリを搭載したMacでも実行できます。より高精度なQ8の重みには、37 GB近くが必要です。llama.cppでCPUにオフロードすれば、速度は低下しますが、メモリ容量の小さいGPUでも実行できます。

はい。モデルはApache-2.0ライセンスの下で公開されており、商用環境への導入、改変、再配布を含めて無料で利用できます。Atomic Chatでローカル実行する場合、モデルは有料APIではなく自分のハードウェア上で動作するため、利用料はかかりません。

はい。重みを一度ダウンロードすれば、モデルはインターネット接続なしで、すべてお使いのマシン上で動作します。プロンプト、コード、ファイルは端末内に留まります。そのため、Atomic Chatではローカルで利用できるモデルとして提供しています。

最も得意なのは、エージェントによるコーディングとツール使用です。SWE-Bench Verifiedで74.4、Terminal-Bench 2.1で60.7を記録しており、複数のステップからなるタスクで、リポジトリ全体にわたるコードの編集やターミナルコマンドの実行ができます。また、難度の高い推論を評価するGPQA Diamondで82.6に達し、画像入力や長い文書にも対応します。