Dramaboxとは?
Dramaboxは、LTX-2 Community Licenseのもとで提供されるLightricks LTX-2.3の音声ブランチを基盤とする、Resemble AIの表現力豊かな音声合成モデルです。フローマッチングを採用したLTX-2.3の3.3B音声専用Diffusion TransformerをIC-LoRAでファインチューニングしており、Gemma 3 12Bのテキスト埋め込みを条件として使用します。設計の考え方は、話者のアイデンティティ、感情、話し方、笑い、ため息、息遣い、間、切り替えをすべてプロンプトで制御することです。任意で10秒の参照音声を与えると、対象の声質をクローンできます。
| 仕様 | Dramabox |
|---|---|
| ベースモデル | Lightricks LTX-2.3、音声専用ブランチ |
| パラメータ数 | 3.3BのDiffusion Transformer、フローマッチング |
| テキストによる条件付け | Gemma 3 12Bの埋め込み |
| ボイスクローニング | 10秒以上の参照音声(任意)、3から30秒のウィンドウ |
| 言語 | 英語 |
| リリース日 | 2026年4月 |
| ライセンス | LTX-2 Community License |
Dramaboxのプロンプトの仕組み
プロンプトの形式では、発話内容と演技指示を分けます。二重引用符で囲んだ内容は、HahahaやHmmのように発声を文字で表したものも含め、そのまま発話されます。引用符の外側にある内容は、モデルが演じるものの、決して読み上げない演技指示です。たとえば、she sighs deeply, a long pause, his voice cracksといった指示が該当します。モデルカードの出力例は、冷たい怒りからささやきへと移る威厳ある女王から、冷蔵庫へ向かう様子を実況するフットボールの実況者まで幅広く、いずれも同じ仕組みで生成されます。
生成は少数のパラメータで制御します。cfg_scaleは出力がプロンプトにどれだけ厳密に従うか、stg_scaleは表現の強調度合いを制御し、長いシーンには長さの倍率または明示的な目標時間を指定します。すべての出力には、デフォルトでResemble Perthのニューラル透かしが付与されます。この透かしはMP3やAACによる圧縮後も残り、検出精度は100%近くに達します。フラグで無効化することもできます。
Dramaboxのハードウェア要件
Resemble AIによると、ウォームアップ済みのサーバーでのVRAM使用量はピーク時に約24 GBで、H100ではウォームアップ後の生成1回に約2.5秒かかります。ダウンロードするファイルは次の3つに分かれます。
| ファイル | サイズ | 内容 |
|---|---|---|
| dramabox-dit-v1.safetensors | 6.6 GB | 音声専用DiT、LoRAマージ済み |
| dramabox-audio-components.safetensors | 1.9 GB | コネクタ、射影、音声VAE、ボコーダー |
| gemma-3-12b-it-bnb-4bit | ~8 GB | テキストエンコーダー、自動ダウンロード |
Dramaboxをローカルで実行する方法
DramaBoxリポジトリをクローンし、src/inference.pyで1回ずつ生成するか、ウォームアップ済みのTTSServerを維持して繰り返し呼び出します。重みは初回実行時にダウンロードされます。VRAMを割り当てる前に音声を聴いてみたい場合は、Hugging Faceでホストされているデモ用Spaceを利用できます。
会話の台本作成に使うチャットモデルを探すには、ローカルモデルの全カタログをご覧ください。
Dramaboxのライセンス
重みは、Lightricksのベースモデルから継承したLTX-2 Community Licenseのもとで提供されます。商用利用の前に、リポジトリ内のライセンスファイルを確認してください。
