FastContext-1.0-4B-RLとは?
FastContext-1.0-4B-RLは、MicrosoftがQwen3-4B-Instruct-2507を基盤に構築し、強化学習で調整した4Bパラメータのモデルです。
- ライセンス: Mit
- コンテキスト長: 256Kトークン
- 言語: 英語
- 最小ハードウェア要件: 約3 GBのVRAM
- 強み: 推論、コーディング、デバイス上での推論実行
FastContext-1.0-4B-RLの主な特徴
- ローカルのハードウェアでの実行に適した規模の4Bパラメータモデルです。
- 約3 GBのVRAMで動作します。
- 256Kトークンのコンテキスト長で、長い入力を扱えます。
- リポジトリの探索タスクを得意とします。
- 追加設定なしでツール呼び出しにも対応します。
FastContext-1.0-4B-RLが得意なこと
このモデルは3つの読み取り専用ツール(READ、GLOB、GREP)を利用でき、1回のターン内で複数のツールを並列に呼び出し、その結果を使って次の検索の方針を決められます。この設計は、次のような具体的な用途に適しています。
- リポジトリの探索: 自然言語のクエリを受け取ると、関連するコードを特定します。ファイル全体を出力するのではなく、ファイルパスと行範囲を返し、必要な箇所に絞った根拠を示します。
- ツール呼び出し: READ/GLOB/GREPをそれぞれ独立して呼び出し、複数の仮説を同時に検討します。これにより、FastContextの論文で行われたテストでは、メインエージェントのトークン使用量を最大60%削減しています。
- エージェントへのコードの根拠提供: Mini-SWE-Agentなどのコーディングエージェントに組み込むと、メインモデルが必要に応じて呼び出す委任先として機能します。メインモデルを再学習する必要はありません。
FastContext-1.0-4B-RLをローカルで実行する方法
4Bパラメータのこのモデルは、控えめな性能のGPUでも扱える小ささです。Qwen3-4Bの4ビット量子化版に必要なVRAMは約2.5 GB、8ビット版は約4 GB、FP16版は約8 GBなので、6 GBのグラフィックスカードや最近のMacで実行できます。コンテキスト長は262,144トークンですが、コンテキストが長くなるとKVキャッシュが大きくなり、メモリ使用量も増えます。Hugging Faceから重みを取得します。
huggingface-cli download microsoft/FastContext-1.0-4B-RL
その後、TransformersやvLLMでモデルをサーバーとして実行するか、Atomic Chatにワンクリックで読み込んで、処理をすべてデバイス上で完結させながらリポジトリへの問い合わせを始められます。
FastContext-1.0-4B-RLのライセンス
FastContext-1.0-4B-RLはMITライセンスで公開されています。著作権表示とライセンス表示をソフトウェアに付属させて保持する限り、商用利用、改変、再配布、私的利用が認められます。
