Dramabox

更新
04.10.2026
音声

Dramaboxは、LTX-2.3の音声ブランチを基盤とするResemble AIの表現力豊かな音声合成モデルです。プロンプトで声、感情、話し方を制御でき、10秒の参照音声で声をクローンできます。

基本情報

  • ライセンス: LTX-2 Community License
  • パラメータ数: 3.3Bの音声専用Diffusion Transformer、LTX-2.3をIC-LoRAでファインチューニング
  • 言語: 英語
  • 最小ハードウェア要件: ウォームアップ済みのサーバーで、ピーク時のVRAM使用量が約24 GB
  • 追加機能: 10秒の参照音声によるボイスクローニング、出力へのPerth透かしの付与

Dramaboxとは?

Dramaboxは、LTX-2 Community Licenseのもとで提供されるLightricks LTX-2.3の音声ブランチを基盤とする、Resemble AIの表現力豊かな音声合成モデルです。フローマッチングを採用したLTX-2.3の3.3B音声専用Diffusion TransformerをIC-LoRAでファインチューニングしており、Gemma 3 12Bのテキスト埋め込みを条件として使用します。設計の考え方は、話者のアイデンティティ、感情、話し方、笑い、ため息、息遣い、間、切り替えをすべてプロンプトで制御することです。任意で10秒の参照音声を与えると、対象の声質をクローンできます。

仕様Dramabox
ベースモデルLightricks LTX-2.3、音声専用ブランチ
パラメータ数3.3BのDiffusion Transformer、フローマッチング
テキストによる条件付けGemma 3 12Bの埋め込み
ボイスクローニング10秒以上の参照音声(任意)、3から30秒のウィンドウ
言語英語
リリース日2026年4月
ライセンスLTX-2 Community License

Dramaboxのプロンプトの仕組み

プロンプトの形式では、発話内容と演技指示を分けます。二重引用符で囲んだ内容は、HahahaやHmmのように発声を文字で表したものも含め、そのまま発話されます。引用符の外側にある内容は、モデルが演じるものの、決して読み上げない演技指示です。たとえば、she sighs deeply, a long pause, his voice cracksといった指示が該当します。モデルカードの出力例は、冷たい怒りからささやきへと移る威厳ある女王から、冷蔵庫へ向かう様子を実況するフットボールの実況者まで幅広く、いずれも同じ仕組みで生成されます。

生成は少数のパラメータで制御します。cfg_scaleは出力がプロンプトにどれだけ厳密に従うか、stg_scaleは表現の強調度合いを制御し、長いシーンには長さの倍率または明示的な目標時間を指定します。すべての出力には、デフォルトでResemble Perthのニューラル透かしが付与されます。この透かしはMP3やAACによる圧縮後も残り、検出精度は100%近くに達します。フラグで無効化することもできます。

Dramaboxのハードウェア要件

Resemble AIによると、ウォームアップ済みのサーバーでのVRAM使用量はピーク時に約24 GBで、H100ではウォームアップ後の生成1回に約2.5秒かかります。ダウンロードするファイルは次の3つに分かれます。

ファイルサイズ内容
dramabox-dit-v1.safetensors6.6 GB音声専用DiT、LoRAマージ済み
dramabox-audio-components.safetensors1.9 GBコネクタ、射影、音声VAE、ボコーダー
gemma-3-12b-it-bnb-4bit~8 GBテキストエンコーダー、自動ダウンロード

Dramaboxをローカルで実行する方法

DramaBoxリポジトリをクローンし、src/inference.pyで1回ずつ生成するか、ウォームアップ済みのTTSServerを維持して繰り返し呼び出します。重みは初回実行時にダウンロードされます。VRAMを割り当てる前に音声を聴いてみたい場合は、Hugging Faceでホストされているデモ用Spaceを利用できます。

会話の台本作成に使うチャットモデルを探すには、ローカルモデルの全カタログをご覧ください。

Dramaboxのライセンス

重みは、Lightricksのベースモデルから継承したLTX-2 Community Licenseのもとで提供されます。商用利用の前に、リポジトリ内のライセンスファイルを確認してください。

Hugging Faceからモデルをダウンロード

git clone https://github.com/resemble-ai/DramaBox
python src/inference.py \
    --prompt 'A woman speaks warmly, "Hello, how are you today?"' \
    --voice-sample reference.wav \
    --output output.wav \
    --cfg-scale 2.5 --stg-scale 1.5
from src.inference_server import TTSServer

server = TTSServer(device="cuda")              # downloads weights on first run

server.generate_to_file(
    prompt='A woman speaks warmly, "Hello, how are you today?" '
           'She laughs, "Hahaha, it is so good to see you!"',
    output="output.wav",
    voice_ref="reference.wav",                  # optional, 10+ seconds of target voice
    cfg_scale=2.5,
    stg_scale=1.5,
    seed=42,
)
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Dramaboxは、Resemble AIの表現力豊かな音声合成モデルです。フローマッチングを採用したLTX-2.3の3.3B音声専用Diffusion TransformerをIC-LoRAでファインチューニングしており、Gemma 3 12Bのテキスト埋め込みを条件として使用します。話者のアイデンティティ、感情、話し方、笑い、ため息、息遣い、間、切り替えを、すべてプロンプト自体で制御します。

はい。任意で10秒以上の参照音声を与えると、対象の声質をクローンできます。参照音声がない場合は、プロンプト内の話者の説明に合う声をモデルが選びます。条件付けに使う参照音声のウィンドウは、3から30秒の範囲で調整できます。

Resemble AIによると、ウォームアップ済みのサーバーでのVRAM使用量はピーク時に約24 GBです。ダウンロードするのは、6.6 GBの音声DiT、1.9 GBの音声コンポーネント、初回実行時に自動取得される約8 GBの4ビットGemma 3 12Bテキストエンコーダーです。H100では、ウォームアップ後の生成にクリップ1本あたり約2.5秒かかります。

重みは、Lightricksのベースモデルから継承したLTX-2 Community Licenseのもとで一般公開されています。商用利用の前に、リポジトリ内のライセンスファイルを確認してください。

はい、デフォルトで入ります。すべての出力には、知覚できないニューラル透かしであるResemble Perthが付与されます。この透かしはMP3やAACによる圧縮や一般的な編集後も残り、検出精度は100%近くに達します。no-watermarkフラグで無効化できます。