FastContext-1.0-4B-RL

更新
04.10.2026
ツール利用
コード生成
多言語

コンパクトな長文コンテキスト対応モデルFastContext-1.0-4B-RLを、Atomic Chatでローカル実行できます。オフラインでプライバシーを保ち、APIキーも不要です。無料で利用できます。

基本情報

  • ライセンス: Mit
  • コンテキスト長: 256Kトークン
  • 言語: 英語
  • 最小ハードウェア要件: 約3 GBのVRAM
  • 強み: 推論、コーディング、デバイス上での推論実行

FastContext-1.0-4B-RLとは?

FastContext-1.0-4B-RLは、MicrosoftがQwen3-4B-Instruct-2507を基盤に構築し、強化学習で調整した4Bパラメータのモデルです。

  • ライセンス: Mit
  • コンテキスト長: 256Kトークン
  • 言語: 英語
  • 最小ハードウェア要件: 約3 GBのVRAM
  • 強み: 推論、コーディング、デバイス上での推論実行

FastContext-1.0-4B-RLの主な特徴

  • ローカルのハードウェアでの実行に適した規模の4Bパラメータモデルです。
  • 約3 GBのVRAMで動作します。
  • 256Kトークンのコンテキスト長で、長い入力を扱えます。
  • リポジトリの探索タスクを得意とします。
  • 追加設定なしでツール呼び出しにも対応します。

FastContext-1.0-4B-RLが得意なこと

このモデルは3つの読み取り専用ツール(READ、GLOB、GREP)を利用でき、1回のターン内で複数のツールを並列に呼び出し、その結果を使って次の検索の方針を決められます。この設計は、次のような具体的な用途に適しています。

  • リポジトリの探索: 自然言語のクエリを受け取ると、関連するコードを特定します。ファイル全体を出力するのではなく、ファイルパスと行範囲を返し、必要な箇所に絞った根拠を示します。
  • ツール呼び出し: READ/GLOB/GREPをそれぞれ独立して呼び出し、複数の仮説を同時に検討します。これにより、FastContextの論文で行われたテストでは、メインエージェントのトークン使用量を最大60%削減しています。
  • エージェントへのコードの根拠提供: Mini-SWE-Agentなどのコーディングエージェントに組み込むと、メインモデルが必要に応じて呼び出す委任先として機能します。メインモデルを再学習する必要はありません。

FastContext-1.0-4B-RLをローカルで実行する方法

4Bパラメータのこのモデルは、控えめな性能のGPUでも扱える小ささです。Qwen3-4Bの4ビット量子化版に必要なVRAMは約2.5 GB、8ビット版は約4 GB、FP16版は約8 GBなので、6 GBのグラフィックスカードや最近のMacで実行できます。コンテキスト長は262,144トークンですが、コンテキストが長くなるとKVキャッシュが大きくなり、メモリ使用量も増えます。Hugging Faceから重みを取得します。

huggingface-cli download microsoft/FastContext-1.0-4B-RL

その後、TransformersやvLLMでモデルをサーバーとして実行するか、Atomic Chatにワンクリックで読み込んで、処理をすべてデバイス上で完結させながらリポジトリへの問い合わせを始められます。

FastContext-1.0-4B-RLのライセンス

FastContext-1.0-4B-RLはMITライセンスで公開されています。著作権表示とライセンス表示をソフトウェアに付属させて保持する限り、商用利用、改変、再配布、私的利用が認められます。

Hugging Faceからモデルをダウンロード

huggingface-cli download microsoft/FastContext-1.0-4B-RL
from transformers import AutoModel
model = AutoModel.from_pretrained("microsoft/FastContext-1.0-4B-RL")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

MicrosoftがQwen3-4B-Instruct-2507を基盤に構築し、強化学習で訓練した、4Bパラメータのリポジトリ探索用サブエージェントです。コーディングタスクを直接解くのではなく、読み取り専用ツールでコードベースを検索し、ファイルパスと行範囲を簡潔に返します。これが、より大きなコーディングエージェントに必要な箇所を絞って伝えるコンテキストになります。メインエージェントのコンテキストを整理された状態に保ち、無駄なトークンを減らすことが目的です。

4Bモデルなので、メモリ使用量は少なめです。Qwen3-4Bの4ビット量子化版は約2.5 GB、8ビット版は約4 GB、FP16版は約8 GBのVRAMで動作するため、6 GBのGPUや最近のMacで十分です。コンテキスト長は262,144トークンで、コンテキストが長くなるとKVキャッシュが大きくなるため、メモリ使用量がさらに増える場合があります。

はい。MITライセンスで公開されており、ライセンス表示を保持する限り、商用利用、個人利用、改変、再配布を無料で行えます。重みはHugging Faceから無料でダウンロードできます。Atomic Chatでローカル実行すれば、トークン単位のAPI料金もかかりません。

はい。重みをダウンロードすれば、インターネット接続なしで、モデルを自分のマシン上だけで実行できます。Atomic Chatではすべてがデバイス上に留まるため、コードやクエリがコンピューターの外に出ることはありません。非公開のリポジトリやプロプライエタリなリポジトリの探索に適しています。

huggingface-cli download microsoft/FastContext-1.0-4B-RLで重みをダウンロードし、TransformersやvLLMでモデルをサーバーとして実行するか、Atomic Chatにワンクリックで読み込みます。最も適した用途は、コーディングエージェント内で探索用サブエージェントとして使うことです。自然言語のクエリを渡して探索を委任すると、関連するファイルパスと行範囲を返します。これにより、メインエージェントからリポジトリ検索を切り離し、そのトークン消費量を減らせます。