ブログ

/

ガイド

/

アブリテレーションとは?LLMの拒否応答を抑える仕組み

アブリテレーションとは?LLMの拒否応答を抑える仕組み

アブリテレーション済みモデルとは、学習によって身につけた拒否挙動を弱め、リクエストを拒否する頻度を下げるように改変されたオープンウェイトの言語モデルです。このガイドでは、アブリテレーションの仕組み、無検閲のファインチューニングやジェイルブレイクとの比較、アブリテレーション済みGGUFをローカルで実行する方法を解説します。

アブリテレーションとは?LLMの拒否応答を抑える仕組み
Alex Shapiro
Alex Shapiro
Calendar icon

August 24, 2026

目次

アブリテレーション済みモデルとは、学習によって身につけた拒否挙動を弱め、リクエストを拒否する頻度を下げるように改変されたオープンウェイトの言語モデルです。こうしたモデルは、アライメント済みモデルでは安全ガードレールによってリクエストが拒否されるような研究やサイバーセキュリティのテストでよく使われます。

この記事では、アブリテレーション済みモデルを詳しく解説します。以下の内容を学べます。

  • アブリテレーション済みモデルとは何か
  • 無検閲モデルや制限なしモデルとの違い
  • アブリテレーション済みモデルの作成方法
  • よく使われる場面
  • 代表的なアブリテレーション済みモデルファミリー

要点

アブリテレーションとは、学習後のモデルを改変する処理です。その目的は、学習中にモデルに形成された拒否方向を抑制することです。アブリテレーションはモデルの重みを変更する手法であり、フィルターなしモデルを作成する方法の1つです。

  • アブリテレーション済みモデルは、アライメント済みモデルに比べてリクエストを拒否する頻度が大幅に低くなります。これは、拒否に関連する挙動を抑制するように改変されているためです。
  • アブリテレーション済みモデルは、サイバーセキュリティなどの分野でよく使われます。たとえば、レッドチームによるペネトレーションテストなど、アライメント済みモデルでは安全機構が作動してリクエストが拒否される領域が挙げられます。
  • アブリテレーション済みモデルと無検閲モデルは同じではありません。「無検閲」は挙動を表す広い意味の呼称であり、アブリテレーションは特定の手法を指します。
  • Atomic Chatは、対応するアブリテレーション済みGGUFをローカルで実行する最も簡単な方法です。モデルの検索、ダウンロード、チャットを1つのデスクトップアプリで行えます。

AIにおけるアブリテレーション済みとは?

abliteratedという語は、部分や機能を除去することを意味するablateと、obliterateを組み合わせたものです。モデルのそれ以外の部分を維持しながら、言語モデルから拒否に関連する挙動を取り除くことを表す非公式な名称として生まれました。

アブリテレーション済みモデルは通常、指示チューニング済みのオープンウェイトLLMを出発点とします。公開元はすでに、リクエストに従い、一部のカテゴリーのコンテンツを拒否するようにモデルを学習させています。その後、第三者が公開された重みを改変し、拒否に関連する内部表現が出力に及ぼす影響を小さくします。

AIモデルはなぜリクエストを拒否するのか?

現在のチャットモデルは通常、次のような複数の学習段階を経ます。

  1. 事前学習
  2. 指示チューニング
  3. 選好学習
  4. 安全性の学習

事前学習では、大規模なコーパスから言語を予測することをモデルに学習させます。

続く指示チューニングでは、リクエストに応答することを学習させます。

選好学習と安全性の学習では、どのような応答を返すべきかを方向づけます。

特に安全性の学習では、拒否すべきリクエストの例をモデルに与えます。モデルは多くの例を通じて、有害なリクエストに関連する活性化パターンを学習します。

その結果、モデルに「ねえ、代わりにFBIをハッキングして」と頼むと、おそらく「申し訳ありませんが、FBIのハッキングをお手伝いすることはできません。本日、ほかにお手伝いできることはありますか?」といった応答が返ってきます。

この拒否パターンは、モデルの重みに深く組み込まれた、学習による挙動です。

2024年の論文「Refusal in Language Models Is Mediated by a Single Direction」で、Andy Arditiらは、最大72Bのパラメータを持つ13のオープンなチャットモデルを調査しました。各モデルの残差ストリーム内で、拒否に強い因果的役割を果たす方向を発見しました。その方向を消去すると有害な指示への拒否が減少し、逆に追加すると無害な指示への拒否が生じました。

テストされた各モデルでは、それぞれ固有の方向が測定されており、その後の研究でも、より複雑である可能性がある拒否メカニズムの検討が続いています。

モデルのアブリテレーションはどのように機能するのか?

アブリテレーションでは、対照的なプロンプトを使い、モデルが拒否するときと応じるときで内部状態がどう異なるかを測定します。基本的には、研究者が、モデルが応じると分かっているリクエストと拒否すると分かっているリクエストを一連の形で与え、モデルのどの部分が活性化するかを調べます。人に電極を取り付け、さまざまな質問に答えるよう促したときに、どのニューロンが発火するかを測るようなものです。

これにより、研究者は拒否に関連する重みを特定し、抑制できます。大まかに見ると、アブリテレーションの処理は次のようになります。

1. 有害なプロンプトと無害なプロンプトを収集する

開発者は、次の2つのプロンプト集合から始めます。

  • 元のモデルが確実に拒否する有害な指示。
  • モデルが通常は回答する無害な指示。

2. モデルの活性化を記録する

各プロンプトをモデルに入力しながら、開発者は複数のTransformer層で残差ストリームの活性化を記録します。これらの活性化は、モデルの現在の内部表現を1つのブロックから次のブロックへ運ぶベクトルです。

この手順は、Maxime LabonneによるHugging Faceの元の解説で非常に詳しく紹介されており、有害な指示と無害な指示に対する活性化を、プロンプトの最後のトークンで記録しています。両グループを比較すると、内部表現が一貫して異なる箇所が分かります。

3. 拒否方向の候補を見つける

各層で、有害なプロンプトの平均活性化から、無害なプロンプトの平均活性化を引きます。その差が、拒否に関連する方向の候補になります。

次に、開発者は候補となる方向をテストします。有用な拒否方向は、次の2つの因果的な検証条件を満たす必要があります。

  • その方向を除去すると、モデルが以前は拒否していたプロンプトへの拒否が減ること。
  • その方向を追加すると、モデルが無害なプロンプトを拒否しやすくなること。

これらのテストは、拒否メカニズムと、単にプロンプト集合の主題と相関するだけのベクトルを区別するのに役立ちます。

4. 重みからその方向を除去する

方向を選定したら、モデルの重み行列をその方向に対して直交化できます。

平易に言えば、この編集では、選択した各行列から拒否方向に沿った成分を取り除きます。改変後のネットワークでは、対象の層を情報が通過する際に、その方向を表現しにくくなります。

アブリテレーションでは通常、研究者はアーキテクチャ、パラメータ数、トークナイザーの挙動を変更しません。既存の行列内の重みだけを変更することで、性能やスタイルの一貫性を維持することを目指しますが、必ずしも保証されるわけではありません(詳しくは後述します)。

最後に、編集した重みを新しいモデルとして保存し、GGUFなどの形式に量子化して、ローカルLLMアプリで実行できるようにします。

5. 改変したモデルを評価する

アブリテレーションの処理が完了したら、研究者は結果を評価します。拒否テストで対象の挙動が減少したかを測定するとともに、標準的な一連の性能ベンチマークをモデルに実行し、開発者が維持したかった全般的な能力に編集が影響していないかを確認します。

通常、これらのテストには次の項目が含まれます。

  • 評価用に取り分けた有害なプロンプトに対する拒否率。
  • 無害なプロンプトに対する応答品質。
  • 指示追従性能。
  • 元のモデルで使用された推論・知識ベンチマーク。
  • 自由形式の会話における反復、非整合的な応答、過度な同意。

Labonneの元の実験では、アブリテレーションによって一部のベンチマークの性能が低下し、その後、追加の選好学習によって低下分の多くを回復できることが分かりました。この結果は、特定の狭い挙動に関わる方向の編集でも、対象のテスト以外の能力に影響し得るという、有用な注意点を示しています。

アブリテレーション済みモデル、無検閲モデル、ジェイルブレイクされたモデルの比較

無検閲は、通常なら拒否されるリクエストを何らかの方法で受け入れるモデルをまとめた、定義の緩やかな広い意味の挙動上の呼称です。この包括的な用語には、アブリテレーション済みモデルも含まれます。アブリテレーション済みと言う場合は、モデル自体に施す特定の編集手法を指しています。モデルのジェイルブレイクは、プロンプトによる回避に依存するという点で、アブリテレーションとは異なります。

手法仕組み重みを変更するか必要な入力チャットをまたいで持続するか
アブリテレーション測定した拒否方向を除去するはい対照的なプロンプトはい
無検閲のファインチューニング拒否の少ないデータで学習を続けるはいファインチューニング用データセットはい
LoRAファインチューニング挙動を変える学習済みアダプターを追加するアダプターのみファインチューニング用データセットアダプターを読み込んでいる間
モデルマージ複数のリリースの重みを組み合わせるはい既存のモデルの重みはい
ジェイルブレイク用プロンプト指示や書式によって安全機構を無効化しようとするいいえプロンプトのみ通常はいいえ

アブリテレーション以外にも、モデルをフィルターなしにする方法や、フィルターがないかのように振る舞わせる方法があります。

無検閲のファインチューニング

無検閲のファインチューニングでは、直接的な回答を報酬の対象とし、拒否を減らすように設計したデータセットから学習します。学習データは、文体、専門分野の知識、指示追従、性格も変えることがあります。Dolphinや一部のHermesリリースは、モデルカードに異なる学習手順が記載されている場合でも、アブリテレーション済みモデルと並べて語られることがよくあります。

ジェイルブレイクされたモデル

ジェイルブレイクでは、モデルの重みを変更しません。これは、アライメント済みモデルに拒否挙動を乗り越えさせるプロンプトベースの手法であり、基本的にはモデルに不具合を起こさせ、デフォルトの安全動作を無視させます。DANジェイルブレイクはその有名な例で、対策が施される前は、ユーザーがChatGPTを無検閲モデルとして利用できました。こうした手法には短期間で対策が施されることが多く、安全性の学習が数年前よりも大幅に強化されたため、2026年には以前ほど一般的ではなくなっています。

ベースモデル

事前学習済みのベースモデルとは、指示チューニングと安全性のチューニングを受けていないモデルです。そのため、拒否するプロンプトが少ない場合があります。ただし、チューニングは安全性のためだけに使われるわけではありません。モデルの応答品質を向上させるためにも使われるため、ベースモデルはファインチューニング済みの派生モデルに比べて性能が低くなることがあります。

アブリテレーション済みモデルはなぜ使われるのか?

私たちがアブリテレーション済みモデルを作成するのは、モデルがリクエストを拒否するタイミングや受け入れるタイミングを制御でき、ホスティング型AIプロバイダーに頼っていては利用できない領域でもモデルを使えるようになるためです。たとえば、次のような用途があります。

  • アライメント研究では、制約のある挙動と改変後の挙動を比較します。研究者は、どの内部表現が拒否に寄与するのか、安全性のための介入がモデルの編集後も維持されるのかを検証できます。
  • 許可を得たセキュリティ業務には、フィルターが過剰にブロックする可能性のある表現が含まれます。レッドチームや防御側の研究者は、正当な文脈でエクスプロイト、マルウェアの挙動、脆弱なコードについて議論することがよくあります。
  • 創作には、センシティブな架空の題材が含まれることがあります。作家は、一般的な警告で場面を繰り返し中断せず、物語に関する指示に従うモデルを求めることがあります。
  • 合成データのプロジェクトでは、一貫して応答を生成する挙動が必要です。対象のタスクが合法でも、安全性分類器の広いカテゴリーと重なる場合、拒否がデータセットに混入することがあります。
  • ローカル推論では、プロンプトを利用者のデバイス内に保持できます。周辺のアプリケーションがテレメトリを送信したり外部サービスを呼び出したりしないことを条件に、機密情報を扱う際に役立つ場合があります。

アブリテレーション済みモデルの利点

アブリテレーションは誤った拒否を減らします。アライメント済みの版が過度に広く拒否の対象とする単語や話題を含む無害なリクエストにも、モデルが回答できるようになります。

この手法は、完全なファインチューニングよりも軽量です。活性化の測定と重みの編集は、大規模な代替データセットでモデルを学習させる場合よりも、必要なデータや計算量が少なくて済むことがあります。

元の指示チューニングは大部分が維持されます。この処理は、会話形式で応答し、書式に関するリクエストに従う方法をすでに学んでいる指示モデルを出発点とします。

改変した重みはローカルで実行できます。コミュニティの公開者は、ホスティング型APIにプロンプトを送信せず、デスクトップのランタイムで動作するGGUF量子化版を公開することがよくあります。

アブリテレーションは解釈可能性の研究に役立ちます。この介入は、測定した表現に因果的な役割があるかを検証するため、プロンプトと出力の相関を観察するだけの場合よりも多くの証拠を得られます。

アブリテレーション済みモデルの限界とリスク

アブリテレーションは、完全に無検閲のモデルを保証するものではありません。Nous Researchのllm-abliteration実装では、結果は測定用データセットに含まれる拒否パターンに依存すると説明されています。モデルには、回答を避けたり、内容を弱めたりする別の方法が残ることがあります。

能力が低下する可能性があります。重みの編集によって、ベンチマーク性能の低下、応答の整合性の低下、反復の増加が起こる場合があります。より強い介入では、さらに多くの拒否を取り除ける一方で、対象外の変化も増える可能性があります。

モデルが過度に同意するようになる可能性があります。拒否や慎重さは、不確実性を示す、誤った前提を指摘するといった挙動と重なります。ある表現を弱めることで、ユーザーの仮定をどの程度の確信を持って支持するかが変わることがあります。

既存の知識を引き出しやすくなることがあります。アブリテレーションは、新たな有害能力を追加しなくてもリスクを高め得ます。拒否率を下げることで、ベースモデルにすでに備わっている能力を利用しやすくなるためです。

アブリテレーション済みモデルの例

以下の5つのアブリテレーション済みチェックポイントは、主要なオープンモデルファミリーを網羅し、8Bのテキストモデルから27Bや32Bのマルチモーダルモデルまたは推論モデルまでを含みます。いずれも全重み版と、ローカルで利用しやすいGGUF変換版が提供されています。

モデルパラメータ数ベースモデル入力コンテキスト長ライセンス
Llama 3.1 8B Abliterated8BLlama 3.1 8B Instructテキスト128KLlama 3.1
Qwen3 14B Abliterated14.8BQwen3 14Bテキストネイティブ32KApache 2.0
Gemma 3 27B Abliterated27BGemma 3 27B ITテキストと画像128KGemma
Mistral Small 3.2 Abliterated24BMistral Small 3.2 Instructテキストと画像128KApache 2.0
DeepSeek R1 Distill Abliterated32.8BDeepSeek R1 Distill Qwen 32Bテキスト128KMIT

Meta-Llama-3.1-8B-Instruct-abliterated

Meta-Llama-3.1-8B-Instruct-abliteratedは、Maxime LabonneがFailSpyの元のアブリテレーション手法を用いて作成した、Meta Llama 3.1 8B Instructの拒否挙動を除去した版です。

この改変では、ベースモデルのLlamaチャットテンプレート、128Kのコンテキストウィンドウ、グループ化クエリアテンション、多言語テキスト生成が維持されています。

仕様詳細
公開者Maxime Labonne
ベースモデルMeta Llama 3.1 8B Instruct
パラメータ数8B
アーキテクチャGQAを備えたデンス型デコーダー専用Transformer
ネイティブのコンテキスト長128Kトークン
入力テキスト
対応言語英語、ドイツ語、フランス語、イタリア語、ポルトガル語、ヒンディー語、スペイン語、タイ語
全重みの形式BF16 Safetensors
ライセンスLlama 3.1 Community License

公式のGGUF変換版では、以下のサイズが提供されています。

量子化ファイルサイズ
Q2_K3.18GB
Q4_K_M4.92GB
Q6_K6.6GB
Q8_08.54GB

Qwen3-14B-abliterated

Qwen3-14B-abliteratedは、Maxime LabonneがデンスモデルのQwen3 14Bを実験的に改変したものです。

この手順では、有害な指示と無害な指示に対する残差ストリームの活性化の差から、拒否方向を導出します。次に、選択した射影の重みを、層ごとに異なる強度で直交化します。評価ではフレーズマッチングとMinos分類器を組み合わせ、間接的な拒否がリクエストに応じた応答として判定されないようにしています。推論時には、このリリースはtemperature=0.6、top_k=20、top_p=0.95、min_p=0を推奨しています。

同じファミリーのより新しく大きなモデルについては、無検閲のQwen 3.8 27Bをローカルで実行する方法のガイドをご覧ください。

仕様詳細
公開者Maxime Labonne
ベースモデルQwen3 14B
パラメータ数14.8B
アーキテクチャデンス型デコーダー専用Transformer
ネイティブのコンテキスト長32,768トークン
モード思考モードと非思考モード
アブリテレーション選択した射影モジュールに対する、層ごとに重み付けした直交化
拒否の評価フレーズマッチングとNousResearch/Minos-v1
推奨サンプリング設定Temperature 0.6; top-k 20; top-p 0.95; min-p 0
全重みの形式F32 Safetensors
ライセンスApache 2.0

BartowskiのGGUF変換版では、以下の量子化版が提供されています。

量子化ファイルサイズ
IQ2_S4.96GB
Q3_K_M7.32GB
Q4_K_M9GB
Q6_K_L12.5GB

Gemma 3 27B IT Abliterated

Gemma 3 27B IT Abliteratedは、Maxime LabonneがGoogle Gemma 3 27B ITを改変したマルチモーダルモデルです。テキストと画像の入力、62の言語モデル層、128Kのコンテキストウィンドウを維持しています。

独立した多言語評価では、この挙動の変化が安全でないプロンプトと通常の能力の両方にどう影響するかを測定しました。英語の安全でないプロンプトでは、アブリテレーション済みモデルが安全でない回答を生成する頻度は、アライメント済みチェックポイントの15.5倍でした。無害な多言語タスクにおけるP-MMEvalスコアは、以下の3言語で2.4から4.7ポイント低下しました。

評価Gemma 3 27B ITアブリテレーション済み変化
安全でない応答の割合、英語5.40%83.81%+78.41パーセントポイント
P-MMEvalの無害なタスクのスコア、英語75.673.2-2.4
P-MMEvalの無害なタスクのスコア、中国語69.765.0-4.7
P-MMEvalの無害なタスクのスコア、フランス語70.866.7-4.1

モデルの基本情報:

仕様詳細
公開者Maxime Labonne
ベースモデルGoogle Gemma 3 27B IT
パラメータ数27B
言語モデルの層数62
ネイティブのコンテキスト長128Kトークン
入力テキストと画像
アブリテレーション重み係数1.5を適用した層ごとの拒否方向
報告されたリクエスト受け入れ率90%超
推奨サンプリング設定Temperature 1.0; top-k 64; top-p 0.95
全重みの形式BF16 Safetensors
ライセンスGemma License

公式のGGUF変換版には、6段階の量子化レベルが含まれています。

量子化ファイルサイズ
Q2_K10.5GB
Q4_K_M16.5GB
Q6_K22.2GB
Q8_028.7GB

Mistral Small 3.2 24B Abliterated v2

NoctrexによるMistral Small 3.2 24B Abliterated v2のGGUF版は、huihui-aiがMistral Small 3.2 24B Instructを改変したモデルの量子化版です。ベースモデルは24言語、画像入力、関数呼び出し、128Kのコンテキストウィンドウに対応しています。

Huihui-aiは、タスク固有のアブレーション用データセットを使い、テキストのTransformerだけにアブリテレーションを適用し、視覚コンポーネントは変更しませんでした。参照実装では、Mistral3ForConditionalGenerationと公式のMistralトークナイザーでモデルを読み込み、ベースモデルのマルチモーダルおよびツール呼び出しのインターフェースを維持しています。

仕様詳細
公開者huihui-ai
ベースモデルMistral Small 3.2 24B Instruct
パラメータ数24B
コンテキスト長128Kトークン
入力テキストと画像
言語24
アブリテレーションの適用範囲テキストコンポーネントのみ
バージョンによる違いv2では、異なるタスク固有のアブレーション用データセットを使用
全重みの形式BF16 Safetensors、約48GB
ライセンスApache 2.0

このモデルには、以下のGGUFリリースがあります。

量子化ファイルサイズ
IQ2_XS7.21GB
Q3_K_M11.5GB
Q4_K_M14.3GB
Q8_025.1GB

DeepSeek R1 Distill Qwen 32B Abliterated

DeepSeek R1 Distill Qwen 32B Abliteratedは、DeepSeek R1を蒸留した32.8Bのデンスモデルを改変したものです。DeepSeekは、R1が生成した推論サンプルで元の蒸留モデルを学習させ、Qwen2.5 32Bをベースのアーキテクチャとして使用しました。Huihui-aiは、TransformerLensを使わず、Transformersによる概念実証用のアブリテレーション実装を適用しました。

仕様詳細
公開者huihui-ai
ベースモデルDeepSeek R1 Distill Qwen 32B
基盤となるアーキテクチャQwen2.5 32B
パラメータ数32.8B
コンテキスト長128Kトークン
入力テキスト
推論の形式<think>による思考の連鎖
アブリテレーションの実装TransformerLensを使わない、Transformersベースの重み編集
全重みの形式BF16 Safetensors
Ollamaで直接利用できるモデルhuihui_ai/deepseek-r1-abliterated:32b
ライセンスMIT

Bartowskiのimatrixを使用したGGUF変換版は、10GB未満のIQ2から34.82GBのQ8_0まで提供されています。

量子化ファイルサイズ
IQ2_XS9.96GB
Q3_K_M15.94GB
Q4_K_M19.85GB
Q8_034.82GB

アブリテレーション済みモデルをローカルで実行する方法

アブリテレーション済みモデルは、ほかのオープンウェイトLLMと同じローカルランタイムで動作します。Atomic Chat、Ollama、LM Studioでは、全重みのSafetensorsチェックポイントではなく、GGUFリポジトリを選びます。Q4_K_Mは、最初に試す量子化として実用的です。全重みよりも大幅に小さく、最も低ビットのファイルよりも高い品質を維持できます。

Atomic Chat

Atomic Chatは、macOS、Windows、Linuxでローカルモデルを実行するために私たちが開発した、無料のオープンソースアプリです。Atomic Chatでモデルを実行するには、次の手順に従います。

  1. ウェブサイトからAtomic Chatをダウンロードしてインストールします。
  2. アプリを起動し、画面の指示に従ってインストールを完了します。
  3. 準備ができたら、サイドバーからModelsを開きます。ここには、Hugging Faceモデルの完全なカタログがあります。
  4. モデル名または公開者名で、アブリテレーション済みモデルを検索します。
  5. モデルカードを開き、GGUF量子化版を選んで、Downloadを選択します。
  6. Use this modelを選択し、チャットを開始します。

詳しくは、LLMをローカルで実行する方法のガイドをご覧ください。

Ollama

Ollamaでは、Hugging FaceからGGUF量子化版を直接ダウンロードできます。Ollamaをインストールしたら、TerminalまたはPowerShellを開き、たとえば次のようなコマンドを実行してモデルをダウンロードします。

ollama run hf.co/mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated-GGUF:Q4_K_M

このコマンドは、4.92GBのQ4_K_Mファイルをダウンロードし、ローカルのOllamaモデルを作成して、対話型チャットを開きます。プロンプトを入力し、Enterを押します。セッションを終了するには、/byeを使います。

ダウンロード済みのモデルを確認するには、ollama listを実行します。

特定のリポジトリでHugging Faceからの直接読み込みが機能しない場合は、.ggufファイルを1つ手動でダウンロードし、同じディレクトリにModelfileという名前のファイルを作成します。

FROM ./model-name.Q4_K_M.gguf
PARAMETER num_ctx 8192

次に、ローカルモデルをビルドして実行します。

ollama create abliterated-local -f ./Modelfile
ollama run abliterated-local

LM Studio

LM Studioをインストールしたら、デスクトップのインターフェースを使ってモデルをダウンロードし、実行します。

  1. Discoverを開き、mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated-GGUFなどの正確なGGUFリポジトリ名を貼り付けます。
  2. 一致する検索結果を開き、公開者名を確認します。
  3. 利用可能なファイルからQ4_K_Mを選び、Downloadを選択します。
  4. Chatを開き、上部のモデルのドロップダウンからダウンロード済みのモデルを選択します。
  5. 検出されたモデルのチャットテンプレートはそのままにし、コンテキスト長8,192トークンから始めます。コンテキスト長を大きくするとメモリ消費量が増え、必要になるのは長い会話や文書を扱う場合だけです。
  6. モデルの読み込みが完了するまで待ち、プロンプトを入力します。一度ダウンロードすれば、インターネット接続なしでモデルとチャットできます。

LM Studioには、lmsコマンドラインツールも付属しています。使用前にLM Studioを一度起動してから、TerminalまたはPowerShellで、たとえば次のようにリポジトリをダウンロードします。

lms get "https://huggingface.co/mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated-GGUF" --gguf --always-show-download-options

選択を求められたら、量子化版を選びます。次に、ダウンロード済みモデルの一覧を表示し、最初の列に表示されたモデルキーをコピーします。

lms ls --llm

そのキーを使ってモデルを読み込み、たとえば8Kなどのコンテキスト長を選択して、ターミナルでチャットを開始します。

lms load <model_key> --context-length 8192
lms chat

別途ダウンロードした.ggufファイルをインポートするには、lms importを使って対話形式の指示に従い、その後、同じ方法で読み込みます。

lms import /absolute/path/to/model-name.Q4_K_M.gguf
lms ls --llm
lms load <model_key> --context-length 8192
lms chat

よくある質問

アブリテレーション済みモデルについて、よく寄せられる質問に簡潔に回答します。

アブリテレーション済みモデルとは、簡単に言うと何ですか?

アブリテレーション済みモデルとは、リクエストを拒否する回数を減らすように改変されたオープンウェイトLLMです。この編集では、モデルのほかの能力を維持しながら、拒否に関連する内部の方向を弱めます。

アブリテレーション済みモデルは無検閲モデルと同じですか?

アブリテレーション済みモデルは、無検閲モデル、または検閲を弱めたモデルの一種です。無検閲は、リクエストを拒否する頻度が低い傾向にあるモデルの広いカテゴリーを表し、アブリテレーション済みは、拒否挙動を減らすために用いる特定の重み編集手法を表します。

アブリテレーションはジェイルブレイクと同じですか?

いいえ。アブリテレーションは、モデルの内部活性化や保存された重みを改変します。ジェイルブレイクは、それ以外は変更されていないモデルで、プロンプトを使って拒否挙動を回避するため、その効果は通常、より一時的で、モデル固有のものになります。

アブリテレーションはすべての安全上の制限を取り除きますか?

いいえ。対象となるのは、特定のプロンプトデータセットから特定した拒否パターンです。ほかの学習済みの挙動、アプリケーションのフィルター、システムプロンプト、学習時に形成された選好が、引き続き出力に影響する場合があります。

どのLLMにもアブリテレーションを適用できますか?

この手法にはモデルの活性化または重みへのアクセスが必要なため、実用上の対象はオープンウェイトモデルになります。実装がモデルのアーキテクチャに対応している必要もあり、開発者には、活性化の測定と編集後の重みの保存に十分なリソースが必要です。

アブリテレーション済みモデルはどこで見つかりますか?

アブリテレーション済みモデルはHugging Faceで見つかります。

まとめ

まとめると、アブリテレーションとは、既存のオープンウェイトモデルに対象を絞った編集を施し、ベースモデルの知識、推論能力、指示追従能力をできるだけ維持しながら、学習による拒否挙動を弱める手法です。重要なポイントは次のとおりです。

  • アブリテレーションは、拒否挙動を減らすことを目的とした重みレベルの改変です。アブリテレーションは、モデルのチェックポイント自体を変更します。
  • 必ずしもすべての拒否を取り除くわけではありません。この改変は、拒否に関連する特定のパターンを対象とするため、一部の拒否挙動が残ることがあります。
  • アブリテレーションは、有用な挙動を損なう可能性があります。そのため、アブリテレーション済みチェックポイントは、拒否テストと通常の能力ベンチマークの両方で、元のチェックポイントと比較する必要があります。
  • アブリテレーション済みモデルは、完全にアライメントされたモデルではリクエストの受け入れを拒否するような領域で役立ちます。サイバーセキュリティ業務やペネトレーションテストなどがその例です。
12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで動くローカルLLM|おすすめモデルと選び方

12GBのVRAMで使うローカルLLMを比較。モデルの選び方、量子化形式、メモリ使用量を確認し、PCのスペックに合うモデルを探せます。

9/30/26

15分

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5の代替モデル:ベンチマークとローカルAIモデル

Claude Sonnet 5.5をOpus、Fable、GPT-6 Astraと比較し、お使いのハードウェアに合うローカルのQwen、Ornith、Bonsaiモデルを選びましょう。

9/29/26

13分

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できる?Layaセットアップガイド

Jev 1.13はローカルで実行できるのでしょうか?その仕組みを学び、JevとLayaのTetris比較デモを見て、独立したローカルの代替モデルとしてLayaをセットアップしましょう。

9/25/26

12分

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルで使える画像生成AI|モデル・アプリ比較【2026年】

ローカルAI画像生成ツールを比較し、7つのモデルをRTX 5090でベンチマーク測定しました。生成画像の例、生成速度、メモリ使用量、ライセンスの制限を確認できます。

9/25/26

14分