アブリテレーション済みモデルとは、学習によって身につけた拒否挙動を弱め、リクエストを拒否する頻度を下げるように改変されたオープンウェイトの言語モデルです。こうしたモデルは、アライメント済みモデルでは安全ガードレールによってリクエストが拒否されるような研究やサイバーセキュリティのテストでよく使われます。
この記事では、アブリテレーション済みモデルを詳しく解説します。以下の内容を学べます。
- アブリテレーション済みモデルとは何か
- 無検閲モデルや制限なしモデルとの違い
- アブリテレーション済みモデルの作成方法
- よく使われる場面
- 代表的なアブリテレーション済みモデルファミリー
要点
アブリテレーションとは、学習後のモデルを改変する処理です。その目的は、学習中にモデルに形成された拒否方向を抑制することです。アブリテレーションはモデルの重みを変更する手法であり、フィルターなしモデルを作成する方法の1つです。
- アブリテレーション済みモデルは、アライメント済みモデルに比べてリクエストを拒否する頻度が大幅に低くなります。これは、拒否に関連する挙動を抑制するように改変されているためです。
- アブリテレーション済みモデルは、サイバーセキュリティなどの分野でよく使われます。たとえば、レッドチームによるペネトレーションテストなど、アライメント済みモデルでは安全機構が作動してリクエストが拒否される領域が挙げられます。
- アブリテレーション済みモデルと無検閲モデルは同じではありません。「無検閲」は挙動を表す広い意味の呼称であり、アブリテレーションは特定の手法を指します。
- Atomic Chatは、対応するアブリテレーション済みGGUFをローカルで実行する最も簡単な方法です。モデルの検索、ダウンロード、チャットを1つのデスクトップアプリで行えます。
AIにおけるアブリテレーション済みとは?
abliteratedという語は、部分や機能を除去することを意味するablateと、obliterateを組み合わせたものです。モデルのそれ以外の部分を維持しながら、言語モデルから拒否に関連する挙動を取り除くことを表す非公式な名称として生まれました。
アブリテレーション済みモデルは通常、指示チューニング済みのオープンウェイトLLMを出発点とします。公開元はすでに、リクエストに従い、一部のカテゴリーのコンテンツを拒否するようにモデルを学習させています。その後、第三者が公開された重みを改変し、拒否に関連する内部表現が出力に及ぼす影響を小さくします。
AIモデルはなぜリクエストを拒否するのか?
現在のチャットモデルは通常、次のような複数の学習段階を経ます。
- 事前学習
- 指示チューニング
- 選好学習
- 安全性の学習
事前学習では、大規模なコーパスから言語を予測することをモデルに学習させます。
続く指示チューニングでは、リクエストに応答することを学習させます。
選好学習と安全性の学習では、どのような応答を返すべきかを方向づけます。
特に安全性の学習では、拒否すべきリクエストの例をモデルに与えます。モデルは多くの例を通じて、有害なリクエストに関連する活性化パターンを学習します。
その結果、モデルに「ねえ、代わりにFBIをハッキングして」と頼むと、おそらく「申し訳ありませんが、FBIのハッキングをお手伝いすることはできません。本日、ほかにお手伝いできることはありますか?」といった応答が返ってきます。
この拒否パターンは、モデルの重みに深く組み込まれた、学習による挙動です。
2024年の論文「Refusal in Language Models Is Mediated by a Single Direction」で、Andy Arditiらは、最大72Bのパラメータを持つ13のオープンなチャットモデルを調査しました。各モデルの残差ストリーム内で、拒否に強い因果的役割を果たす方向を発見しました。その方向を消去すると有害な指示への拒否が減少し、逆に追加すると無害な指示への拒否が生じました。
テストされた各モデルでは、それぞれ固有の方向が測定されており、その後の研究でも、より複雑である可能性がある拒否メカニズムの検討が続いています。
モデルのアブリテレーションはどのように機能するのか?
アブリテレーションでは、対照的なプロンプトを使い、モデルが拒否するときと応じるときで内部状態がどう異なるかを測定します。基本的には、研究者が、モデルが応じると分かっているリクエストと拒否すると分かっているリクエストを一連の形で与え、モデルのどの部分が活性化するかを調べます。人に電極を取り付け、さまざまな質問に答えるよう促したときに、どのニューロンが発火するかを測るようなものです。
これにより、研究者は拒否に関連する重みを特定し、抑制できます。大まかに見ると、アブリテレーションの処理は次のようになります。
1. 有害なプロンプトと無害なプロンプトを収集する
開発者は、次の2つのプロンプト集合から始めます。
- 元のモデルが確実に拒否する有害な指示。
- モデルが通常は回答する無害な指示。
2. モデルの活性化を記録する
各プロンプトをモデルに入力しながら、開発者は複数のTransformer層で残差ストリームの活性化を記録します。これらの活性化は、モデルの現在の内部表現を1つのブロックから次のブロックへ運ぶベクトルです。
この手順は、Maxime LabonneによるHugging Faceの元の解説で非常に詳しく紹介されており、有害な指示と無害な指示に対する活性化を、プロンプトの最後のトークンで記録しています。両グループを比較すると、内部表現が一貫して異なる箇所が分かります。
3. 拒否方向の候補を見つける
各層で、有害なプロンプトの平均活性化から、無害なプロンプトの平均活性化を引きます。その差が、拒否に関連する方向の候補になります。
次に、開発者は候補となる方向をテストします。有用な拒否方向は、次の2つの因果的な検証条件を満たす必要があります。
- その方向を除去すると、モデルが以前は拒否していたプロンプトへの拒否が減ること。
- その方向を追加すると、モデルが無害なプロンプトを拒否しやすくなること。
これらのテストは、拒否メカニズムと、単にプロンプト集合の主題と相関するだけのベクトルを区別するのに役立ちます。
4. 重みからその方向を除去する
方向を選定したら、モデルの重み行列をその方向に対して直交化できます。
平易に言えば、この編集では、選択した各行列から拒否方向に沿った成分を取り除きます。改変後のネットワークでは、対象の層を情報が通過する際に、その方向を表現しにくくなります。
アブリテレーションでは通常、研究者はアーキテクチャ、パラメータ数、トークナイザーの挙動を変更しません。既存の行列内の重みだけを変更することで、性能やスタイルの一貫性を維持することを目指しますが、必ずしも保証されるわけではありません(詳しくは後述します)。
最後に、編集した重みを新しいモデルとして保存し、GGUFなどの形式に量子化して、ローカルLLMアプリで実行できるようにします。
5. 改変したモデルを評価する
アブリテレーションの処理が完了したら、研究者は結果を評価します。拒否テストで対象の挙動が減少したかを測定するとともに、標準的な一連の性能ベンチマークをモデルに実行し、開発者が維持したかった全般的な能力に編集が影響していないかを確認します。
通常、これらのテストには次の項目が含まれます。
- 評価用に取り分けた有害なプロンプトに対する拒否率。
- 無害なプロンプトに対する応答品質。
- 指示追従性能。
- 元のモデルで使用された推論・知識ベンチマーク。
- 自由形式の会話における反復、非整合的な応答、過度な同意。
Labonneの元の実験では、アブリテレーションによって一部のベンチマークの性能が低下し、その後、追加の選好学習によって低下分の多くを回復できることが分かりました。この結果は、特定の狭い挙動に関わる方向の編集でも、対象のテスト以外の能力に影響し得るという、有用な注意点を示しています。
アブリテレーション済みモデル、無検閲モデル、ジェイルブレイクされたモデルの比較
無検閲は、通常なら拒否されるリクエストを何らかの方法で受け入れるモデルをまとめた、定義の緩やかな広い意味の挙動上の呼称です。この包括的な用語には、アブリテレーション済みモデルも含まれます。アブリテレーション済みと言う場合は、モデル自体に施す特定の編集手法を指しています。モデルのジェイルブレイクは、プロンプトによる回避に依存するという点で、アブリテレーションとは異なります。
| 手法 | 仕組み | 重みを変更するか | 必要な入力 | チャットをまたいで持続するか |
|---|---|---|---|---|
| アブリテレーション | 測定した拒否方向を除去する | はい | 対照的なプロンプト | はい |
| 無検閲のファインチューニング | 拒否の少ないデータで学習を続ける | はい | ファインチューニング用データセット | はい |
| LoRAファインチューニング | 挙動を変える学習済みアダプターを追加する | アダプターのみ | ファインチューニング用データセット | アダプターを読み込んでいる間 |
| モデルマージ | 複数のリリースの重みを組み合わせる | はい | 既存のモデルの重み | はい |
| ジェイルブレイク用プロンプト | 指示や書式によって安全機構を無効化しようとする | いいえ | プロンプトのみ | 通常はいいえ |
アブリテレーション以外にも、モデルをフィルターなしにする方法や、フィルターがないかのように振る舞わせる方法があります。
無検閲のファインチューニング
無検閲のファインチューニングでは、直接的な回答を報酬の対象とし、拒否を減らすように設計したデータセットから学習します。学習データは、文体、専門分野の知識、指示追従、性格も変えることがあります。Dolphinや一部のHermesリリースは、モデルカードに異なる学習手順が記載されている場合でも、アブリテレーション済みモデルと並べて語られることがよくあります。
ジェイルブレイクされたモデル
ジェイルブレイクでは、モデルの重みを変更しません。これは、アライメント済みモデルに拒否挙動を乗り越えさせるプロンプトベースの手法であり、基本的にはモデルに不具合を起こさせ、デフォルトの安全動作を無視させます。DANジェイルブレイクはその有名な例で、対策が施される前は、ユーザーがChatGPTを無検閲モデルとして利用できました。こうした手法には短期間で対策が施されることが多く、安全性の学習が数年前よりも大幅に強化されたため、2026年には以前ほど一般的ではなくなっています。
ベースモデル
事前学習済みのベースモデルとは、指示チューニングと安全性のチューニングを受けていないモデルです。そのため、拒否するプロンプトが少ない場合があります。ただし、チューニングは安全性のためだけに使われるわけではありません。モデルの応答品質を向上させるためにも使われるため、ベースモデルはファインチューニング済みの派生モデルに比べて性能が低くなることがあります。
アブリテレーション済みモデルはなぜ使われるのか?
私たちがアブリテレーション済みモデルを作成するのは、モデルがリクエストを拒否するタイミングや受け入れるタイミングを制御でき、ホスティング型AIプロバイダーに頼っていては利用できない領域でもモデルを使えるようになるためです。たとえば、次のような用途があります。
- アライメント研究では、制約のある挙動と改変後の挙動を比較します。研究者は、どの内部表現が拒否に寄与するのか、安全性のための介入がモデルの編集後も維持されるのかを検証できます。
- 許可を得たセキュリティ業務には、フィルターが過剰にブロックする可能性のある表現が含まれます。レッドチームや防御側の研究者は、正当な文脈でエクスプロイト、マルウェアの挙動、脆弱なコードについて議論することがよくあります。
- 創作には、センシティブな架空の題材が含まれることがあります。作家は、一般的な警告で場面を繰り返し中断せず、物語に関する指示に従うモデルを求めることがあります。
- 合成データのプロジェクトでは、一貫して応答を生成する挙動が必要です。対象のタスクが合法でも、安全性分類器の広いカテゴリーと重なる場合、拒否がデータセットに混入することがあります。
- ローカル推論では、プロンプトを利用者のデバイス内に保持できます。周辺のアプリケーションがテレメトリを送信したり外部サービスを呼び出したりしないことを条件に、機密情報を扱う際に役立つ場合があります。
アブリテレーション済みモデルの利点
アブリテレーションは誤った拒否を減らします。アライメント済みの版が過度に広く拒否の対象とする単語や話題を含む無害なリクエストにも、モデルが回答できるようになります。
この手法は、完全なファインチューニングよりも軽量です。活性化の測定と重みの編集は、大規模な代替データセットでモデルを学習させる場合よりも、必要なデータや計算量が少なくて済むことがあります。
元の指示チューニングは大部分が維持されます。この処理は、会話形式で応答し、書式に関するリクエストに従う方法をすでに学んでいる指示モデルを出発点とします。
改変した重みはローカルで実行できます。コミュニティの公開者は、ホスティング型APIにプロンプトを送信せず、デスクトップのランタイムで動作するGGUF量子化版を公開することがよくあります。
アブリテレーションは解釈可能性の研究に役立ちます。この介入は、測定した表現に因果的な役割があるかを検証するため、プロンプトと出力の相関を観察するだけの場合よりも多くの証拠を得られます。
アブリテレーション済みモデルの限界とリスク
アブリテレーションは、完全に無検閲のモデルを保証するものではありません。Nous Researchのllm-abliteration実装では、結果は測定用データセットに含まれる拒否パターンに依存すると説明されています。モデルには、回答を避けたり、内容を弱めたりする別の方法が残ることがあります。
能力が低下する可能性があります。重みの編集によって、ベンチマーク性能の低下、応答の整合性の低下、反復の増加が起こる場合があります。より強い介入では、さらに多くの拒否を取り除ける一方で、対象外の変化も増える可能性があります。
モデルが過度に同意するようになる可能性があります。拒否や慎重さは、不確実性を示す、誤った前提を指摘するといった挙動と重なります。ある表現を弱めることで、ユーザーの仮定をどの程度の確信を持って支持するかが変わることがあります。
既存の知識を引き出しやすくなることがあります。アブリテレーションは、新たな有害能力を追加しなくてもリスクを高め得ます。拒否率を下げることで、ベースモデルにすでに備わっている能力を利用しやすくなるためです。
アブリテレーション済みモデルの例
以下の5つのアブリテレーション済みチェックポイントは、主要なオープンモデルファミリーを網羅し、8Bのテキストモデルから27Bや32Bのマルチモーダルモデルまたは推論モデルまでを含みます。いずれも全重み版と、ローカルで利用しやすいGGUF変換版が提供されています。
| モデル | パラメータ数 | ベースモデル | 入力 | コンテキスト長 | ライセンス |
|---|---|---|---|---|---|
| Llama 3.1 8B Abliterated | 8B | Llama 3.1 8B Instruct | テキスト | 128K | Llama 3.1 |
| Qwen3 14B Abliterated | 14.8B | Qwen3 14B | テキスト | ネイティブ32K | Apache 2.0 |
| Gemma 3 27B Abliterated | 27B | Gemma 3 27B IT | テキストと画像 | 128K | Gemma |
| Mistral Small 3.2 Abliterated | 24B | Mistral Small 3.2 Instruct | テキストと画像 | 128K | Apache 2.0 |
| DeepSeek R1 Distill Abliterated | 32.8B | DeepSeek R1 Distill Qwen 32B | テキスト | 128K | MIT |
Meta-Llama-3.1-8B-Instruct-abliterated
Meta-Llama-3.1-8B-Instruct-abliteratedは、Maxime LabonneがFailSpyの元のアブリテレーション手法を用いて作成した、Meta Llama 3.1 8B Instructの拒否挙動を除去した版です。
この改変では、ベースモデルのLlamaチャットテンプレート、128Kのコンテキストウィンドウ、グループ化クエリアテンション、多言語テキスト生成が維持されています。
| 仕様 | 詳細 |
|---|---|
| 公開者 | Maxime Labonne |
| ベースモデル | Meta Llama 3.1 8B Instruct |
| パラメータ数 | 8B |
| アーキテクチャ | GQAを備えたデンス型デコーダー専用Transformer |
| ネイティブのコンテキスト長 | 128Kトークン |
| 入力 | テキスト |
| 対応言語 | 英語、ドイツ語、フランス語、イタリア語、ポルトガル語、ヒンディー語、スペイン語、タイ語 |
| 全重みの形式 | BF16 Safetensors |
| ライセンス | Llama 3.1 Community License |
公式のGGUF変換版では、以下のサイズが提供されています。
| 量子化 | ファイルサイズ |
|---|---|
| Q2_K | 3.18GB |
| Q4_K_M | 4.92GB |
| Q6_K | 6.6GB |
| Q8_0 | 8.54GB |
Qwen3-14B-abliterated
Qwen3-14B-abliteratedは、Maxime LabonneがデンスモデルのQwen3 14Bを実験的に改変したものです。
この手順では、有害な指示と無害な指示に対する残差ストリームの活性化の差から、拒否方向を導出します。次に、選択した射影の重みを、層ごとに異なる強度で直交化します。評価ではフレーズマッチングとMinos分類器を組み合わせ、間接的な拒否がリクエストに応じた応答として判定されないようにしています。推論時には、このリリースはtemperature=0.6、top_k=20、top_p=0.95、min_p=0を推奨しています。
同じファミリーのより新しく大きなモデルについては、無検閲のQwen 3.8 27Bをローカルで実行する方法のガイドをご覧ください。
| 仕様 | 詳細 |
|---|---|
| 公開者 | Maxime Labonne |
| ベースモデル | Qwen3 14B |
| パラメータ数 | 14.8B |
| アーキテクチャ | デンス型デコーダー専用Transformer |
| ネイティブのコンテキスト長 | 32,768トークン |
| モード | 思考モードと非思考モード |
| アブリテレーション | 選択した射影モジュールに対する、層ごとに重み付けした直交化 |
| 拒否の評価 | フレーズマッチングとNousResearch/Minos-v1 |
| 推奨サンプリング設定 | Temperature 0.6; top-k 20; top-p 0.95; min-p 0 |
| 全重みの形式 | F32 Safetensors |
| ライセンス | Apache 2.0 |
BartowskiのGGUF変換版では、以下の量子化版が提供されています。
| 量子化 | ファイルサイズ |
|---|---|
| IQ2_S | 4.96GB |
| Q3_K_M | 7.32GB |
| Q4_K_M | 9GB |
| Q6_K_L | 12.5GB |
Gemma 3 27B IT Abliterated
Gemma 3 27B IT Abliteratedは、Maxime LabonneがGoogle Gemma 3 27B ITを改変したマルチモーダルモデルです。テキストと画像の入力、62の言語モデル層、128Kのコンテキストウィンドウを維持しています。
独立した多言語評価では、この挙動の変化が安全でないプロンプトと通常の能力の両方にどう影響するかを測定しました。英語の安全でないプロンプトでは、アブリテレーション済みモデルが安全でない回答を生成する頻度は、アライメント済みチェックポイントの15.5倍でした。無害な多言語タスクにおけるP-MMEvalスコアは、以下の3言語で2.4から4.7ポイント低下しました。
| 評価 | Gemma 3 27B IT | アブリテレーション済み | 変化 |
|---|---|---|---|
| 安全でない応答の割合、英語 | 5.40% | 83.81% | +78.41パーセントポイント |
| P-MMEvalの無害なタスクのスコア、英語 | 75.6 | 73.2 | -2.4 |
| P-MMEvalの無害なタスクのスコア、中国語 | 69.7 | 65.0 | -4.7 |
| P-MMEvalの無害なタスクのスコア、フランス語 | 70.8 | 66.7 | -4.1 |
モデルの基本情報:
| 仕様 | 詳細 |
|---|---|
| 公開者 | Maxime Labonne |
| ベースモデル | Google Gemma 3 27B IT |
| パラメータ数 | 27B |
| 言語モデルの層数 | 62 |
| ネイティブのコンテキスト長 | 128Kトークン |
| 入力 | テキストと画像 |
| アブリテレーション | 重み係数1.5を適用した層ごとの拒否方向 |
| 報告されたリクエスト受け入れ率 | 90%超 |
| 推奨サンプリング設定 | Temperature 1.0; top-k 64; top-p 0.95 |
| 全重みの形式 | BF16 Safetensors |
| ライセンス | Gemma License |
公式のGGUF変換版には、6段階の量子化レベルが含まれています。
| 量子化 | ファイルサイズ |
|---|---|
| Q2_K | 10.5GB |
| Q4_K_M | 16.5GB |
| Q6_K | 22.2GB |
| Q8_0 | 28.7GB |
Mistral Small 3.2 24B Abliterated v2
NoctrexによるMistral Small 3.2 24B Abliterated v2のGGUF版は、huihui-aiがMistral Small 3.2 24B Instructを改変したモデルの量子化版です。ベースモデルは24言語、画像入力、関数呼び出し、128Kのコンテキストウィンドウに対応しています。
Huihui-aiは、タスク固有のアブレーション用データセットを使い、テキストのTransformerだけにアブリテレーションを適用し、視覚コンポーネントは変更しませんでした。参照実装では、Mistral3ForConditionalGenerationと公式のMistralトークナイザーでモデルを読み込み、ベースモデルのマルチモーダルおよびツール呼び出しのインターフェースを維持しています。
| 仕様 | 詳細 |
|---|---|
| 公開者 | huihui-ai |
| ベースモデル | Mistral Small 3.2 24B Instruct |
| パラメータ数 | 24B |
| コンテキスト長 | 128Kトークン |
| 入力 | テキストと画像 |
| 言語 | 24 |
| アブリテレーションの適用範囲 | テキストコンポーネントのみ |
| バージョンによる違い | v2では、異なるタスク固有のアブレーション用データセットを使用 |
| 全重みの形式 | BF16 Safetensors、約48GB |
| ライセンス | Apache 2.0 |
このモデルには、以下のGGUFリリースがあります。
| 量子化 | ファイルサイズ |
|---|---|
| IQ2_XS | 7.21GB |
| Q3_K_M | 11.5GB |
| Q4_K_M | 14.3GB |
| Q8_0 | 25.1GB |
DeepSeek R1 Distill Qwen 32B Abliterated
DeepSeek R1 Distill Qwen 32B Abliteratedは、DeepSeek R1を蒸留した32.8Bのデンスモデルを改変したものです。DeepSeekは、R1が生成した推論サンプルで元の蒸留モデルを学習させ、Qwen2.5 32Bをベースのアーキテクチャとして使用しました。Huihui-aiは、TransformerLensを使わず、Transformersによる概念実証用のアブリテレーション実装を適用しました。
| 仕様 | 詳細 |
|---|---|
| 公開者 | huihui-ai |
| ベースモデル | DeepSeek R1 Distill Qwen 32B |
| 基盤となるアーキテクチャ | Qwen2.5 32B |
| パラメータ数 | 32.8B |
| コンテキスト長 | 128Kトークン |
| 入力 | テキスト |
| 推論の形式 | <think>による思考の連鎖 |
| アブリテレーションの実装 | TransformerLensを使わない、Transformersベースの重み編集 |
| 全重みの形式 | BF16 Safetensors |
| Ollamaで直接利用できるモデル | huihui_ai/deepseek-r1-abliterated:32b |
| ライセンス | MIT |
Bartowskiのimatrixを使用したGGUF変換版は、10GB未満のIQ2から34.82GBのQ8_0まで提供されています。
| 量子化 | ファイルサイズ |
|---|---|
| IQ2_XS | 9.96GB |
| Q3_K_M | 15.94GB |
| Q4_K_M | 19.85GB |
| Q8_0 | 34.82GB |
アブリテレーション済みモデルをローカルで実行する方法
アブリテレーション済みモデルは、ほかのオープンウェイトLLMと同じローカルランタイムで動作します。Atomic Chat、Ollama、LM Studioでは、全重みのSafetensorsチェックポイントではなく、GGUFリポジトリを選びます。Q4_K_Mは、最初に試す量子化として実用的です。全重みよりも大幅に小さく、最も低ビットのファイルよりも高い品質を維持できます。
Atomic Chat
Atomic Chatは、macOS、Windows、Linuxでローカルモデルを実行するために私たちが開発した、無料のオープンソースアプリです。Atomic Chatでモデルを実行するには、次の手順に従います。
- ウェブサイトからAtomic Chatをダウンロードしてインストールします。
- アプリを起動し、画面の指示に従ってインストールを完了します。
- 準備ができたら、サイドバーからModelsを開きます。ここには、Hugging Faceモデルの完全なカタログがあります。
- モデル名または公開者名で、アブリテレーション済みモデルを検索します。
- モデルカードを開き、GGUF量子化版を選んで、Downloadを選択します。
- Use this modelを選択し、チャットを開始します。
詳しくは、LLMをローカルで実行する方法のガイドをご覧ください。
Ollama
Ollamaでは、Hugging FaceからGGUF量子化版を直接ダウンロードできます。Ollamaをインストールしたら、TerminalまたはPowerShellを開き、たとえば次のようなコマンドを実行してモデルをダウンロードします。
ollama run hf.co/mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated-GGUF:Q4_K_M
このコマンドは、4.92GBのQ4_K_Mファイルをダウンロードし、ローカルのOllamaモデルを作成して、対話型チャットを開きます。プロンプトを入力し、Enterを押します。セッションを終了するには、/byeを使います。
ダウンロード済みのモデルを確認するには、ollama listを実行します。
特定のリポジトリでHugging Faceからの直接読み込みが機能しない場合は、.ggufファイルを1つ手動でダウンロードし、同じディレクトリにModelfileという名前のファイルを作成します。
FROM ./model-name.Q4_K_M.gguf PARAMETER num_ctx 8192
次に、ローカルモデルをビルドして実行します。
ollama create abliterated-local -f ./Modelfile ollama run abliterated-local
LM Studio
LM Studioをインストールしたら、デスクトップのインターフェースを使ってモデルをダウンロードし、実行します。
- Discoverを開き、
mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated-GGUFなどの正確なGGUFリポジトリ名を貼り付けます。 - 一致する検索結果を開き、公開者名を確認します。
- 利用可能なファイルから
Q4_K_Mを選び、Downloadを選択します。 - Chatを開き、上部のモデルのドロップダウンからダウンロード済みのモデルを選択します。
- 検出されたモデルのチャットテンプレートはそのままにし、コンテキスト長8,192トークンから始めます。コンテキスト長を大きくするとメモリ消費量が増え、必要になるのは長い会話や文書を扱う場合だけです。
- モデルの読み込みが完了するまで待ち、プロンプトを入力します。一度ダウンロードすれば、インターネット接続なしでモデルとチャットできます。
LM Studioには、lmsコマンドラインツールも付属しています。使用前にLM Studioを一度起動してから、TerminalまたはPowerShellで、たとえば次のようにリポジトリをダウンロードします。
lms get "https://huggingface.co/mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated-GGUF" --gguf --always-show-download-options
選択を求められたら、量子化版を選びます。次に、ダウンロード済みモデルの一覧を表示し、最初の列に表示されたモデルキーをコピーします。
lms ls --llm
そのキーを使ってモデルを読み込み、たとえば8Kなどのコンテキスト長を選択して、ターミナルでチャットを開始します。
lms load <model_key> --context-length 8192 lms chat
別途ダウンロードした.ggufファイルをインポートするには、lms importを使って対話形式の指示に従い、その後、同じ方法で読み込みます。
lms import /absolute/path/to/model-name.Q4_K_M.gguf lms ls --llm lms load <model_key> --context-length 8192 lms chat
よくある質問
アブリテレーション済みモデルについて、よく寄せられる質問に簡潔に回答します。
アブリテレーション済みモデルとは、簡単に言うと何ですか?
アブリテレーション済みモデルとは、リクエストを拒否する回数を減らすように改変されたオープンウェイトLLMです。この編集では、モデルのほかの能力を維持しながら、拒否に関連する内部の方向を弱めます。
アブリテレーション済みモデルは無検閲モデルと同じですか?
アブリテレーション済みモデルは、無検閲モデル、または検閲を弱めたモデルの一種です。無検閲は、リクエストを拒否する頻度が低い傾向にあるモデルの広いカテゴリーを表し、アブリテレーション済みは、拒否挙動を減らすために用いる特定の重み編集手法を表します。
アブリテレーションはジェイルブレイクと同じですか?
いいえ。アブリテレーションは、モデルの内部活性化や保存された重みを改変します。ジェイルブレイクは、それ以外は変更されていないモデルで、プロンプトを使って拒否挙動を回避するため、その効果は通常、より一時的で、モデル固有のものになります。
アブリテレーションはすべての安全上の制限を取り除きますか?
いいえ。対象となるのは、特定のプロンプトデータセットから特定した拒否パターンです。ほかの学習済みの挙動、アプリケーションのフィルター、システムプロンプト、学習時に形成された選好が、引き続き出力に影響する場合があります。
どのLLMにもアブリテレーションを適用できますか?
この手法にはモデルの活性化または重みへのアクセスが必要なため、実用上の対象はオープンウェイトモデルになります。実装がモデルのアーキテクチャに対応している必要もあり、開発者には、活性化の測定と編集後の重みの保存に十分なリソースが必要です。
アブリテレーション済みモデルはどこで見つかりますか?
アブリテレーション済みモデルはHugging Faceで見つかります。
まとめ
まとめると、アブリテレーションとは、既存のオープンウェイトモデルに対象を絞った編集を施し、ベースモデルの知識、推論能力、指示追従能力をできるだけ維持しながら、学習による拒否挙動を弱める手法です。重要なポイントは次のとおりです。
- アブリテレーションは、拒否挙動を減らすことを目的とした重みレベルの改変です。アブリテレーションは、モデルのチェックポイント自体を変更します。
- 必ずしもすべての拒否を取り除くわけではありません。この改変は、拒否に関連する特定のパターンを対象とするため、一部の拒否挙動が残ることがあります。
- アブリテレーションは、有用な挙動を損なう可能性があります。そのため、アブリテレーション済みチェックポイントは、拒否テストと通常の能力ベンチマークの両方で、元のチェックポイントと比較する必要があります。
- アブリテレーション済みモデルは、完全にアライメントされたモデルではリクエストの受け入れを拒否するような領域で役立ちます。サイバーセキュリティ業務やペネトレーションテストなどがその例です。

