Supertonic-3

更新
05.10.2026
音声
多言語

Supertonic 3は、Supertoneが開発した99Mパラメータのオンデバイス音声合成(TTS)システムです。31言語に対応し、CPUで高速に動作します。ONNXアセットのサイズは約400 MBです。

基本情報

  • ライセンス:モデルはOpenRAIL-M、サンプルコードはMIT
  • パラメータ数:公開ONNXアセット全体で約99M
  • 対応言語:31言語。Supertonic 2の5言語から拡大
  • 最小ハードウェア要件:CPUのみ、ONNXアセットは約400 MB
  • 追加機能:laugh、breath、sighの表現タグ。プリセットおよびカスタム音声スタイル

Supertonic-3とは?

Supertonic 3は、Supertoneが開発した軽量な音声合成システムです。ONNX Runtimeを通じてすべての処理がデバイス上で動作し、音声合成のためにクラウドへアクセスすることはありません。第3弾となる今回のリリースでは、公開されている重みの対応言語が5言語から31言語に増えました。繰り返しや読み飛ばしの不具合が減り、読み上げの安定性が向上しています。Supertonic 2よりも話者類似度が向上し、laugh、breath、sighなどのシンプルな表現タグも追加されました。

仕様Supertonic-3
パラメータ数公開ONNXアセット全体で約99M
モダリティテキストから音声
対応言語英語、韓国語、日本語、ドイツ語、スペイン語、フランス語、ヒンディー語、ロシア語など31言語
ランタイムONNX Runtime、オンデバイス
音声固定のプリセットを同梱。Supertone Voice Builderでカスタムスタイルを作成可能
リリース日2026年5月
ライセンスOpenRAIL-M、サンプルコードはMIT

Supertonic 3の得意分野

実用的なオンデバイス推論を目指して設計されています。Supertoneによると、A100 GPUで測定したより大規模な比較対象モデルと比べても、CPUで高速に動作し、メモリ使用量も大幅に少なくなっています。GPUが不要なため、ローカル、ブラウザ、エッジ環境へ容易に導入できます。読み上げ精度については、開発元の測定によると、VoxCPM2などのはるかに大規模な公開TTSシステムと比較しても、WERとCERは競争力のある範囲に収まっています。

パラメータ数は約99Mで、0.7Bから2Bクラスの公開TTSモデルよりもはるかに小さく、ダウンロードサイズの小ささと起動の速さにつながっています。ONNXアセット一式のサイズは約400 MBで、テキストエンコーダ、継続時間予測器、ベクトル推定器、ボコーダで構成されています。

Supertonic 3のハードウェア要件

Pythonが動作するマシンであれば使えます。公開アセットの合計サイズは約400 MBで、ランタイムはCPUでの実行を主眼にしています。Supertoneは、想定する導入先としてブラウザとエッジ環境を挙げています。VRAM容量を考慮する必要はありません。

Supertonic 3をローカルで実行する方法

Python SDKをインストールすると、初回実行時にモデルがHugging Faceから自動的にダウンロードされます。

  1. pip install supertonic
  2. プリセットの音声スタイルを選び、テキストと言語コードを指定してsynthesizeを呼び出します。
  3. wavを保存します。laughやsighなどの表現タグは、テキスト内に直接挿入します。

SupertoneのVoice Builderを使うと、参照音声からカスタム音声スタイルを作成できます。購入したスタイルには、Supertonic 2と3の両方に対応する埋め込みが含まれます。音声と組み合わせるチャットモデルについては、ローカルモデルの全カタログをご覧ください。

Supertonic-3のライセンス

モデルはOpenRAIL-Mライセンス、サンプルコードはMITライセンスで公開されています。OpenRAIL-Mでは無料で利用できますが、ライセンスファイルに記載された用途に関する制限があるため、商用導入前に確認してください。

Hugging Faceからモデルをダウンロード

pip install supertonic
# SDKは初回実行時にHugging Faceからモデルのアセットをダウンロードします
from supertonic import TTS

tts = TTS(auto_download=True)
style = tts.get_voice_style(voice_name="M1")

text = "A gentle breeze moved through the open window while everyone listened to the story."
wav, duration = tts.synthesize(text, voice_style=style, lang="en")

tts.save_audio(wav, "output.wav")
print(f"Generated {duration:.2f}s of audio")
デスクトップ
macOS
(Intel・Apple Silicon)
ダウンロード
Windows
(x64)
ダウンロード
Linux
(x86_64)
ダウンロード

よくある質問

Supertonic 3は、Supertoneが開発した、重みが公開されている軽量な音声合成システムです。ONNX Runtimeを通じてすべての処理がデバイス上で動作し、音声合成のためにクラウドへアクセスすることはありません。公開版の対応言語が5言語から31言語に増え、読み上げの安定性が向上しています。laugh、breath、sighなどの表現タグにも対応しています。

いいえ。Supertoneによると、A100 GPUで測定したより大規模な比較対象モデルと比べても、CPUで高速に動作し、メモリ使用量も大幅に少なくなっています。パラメータ数は約99M、ONNXアセットのサイズは約400 MBで、ローカル、ブラウザ、エッジ環境への導入を想定して設計されています。

モデルの重みはOpenRAIL-Mライセンス、サンプルコードはMITライセンスで公開されています。OpenRAIL-Mでは無料での利用が認められていますが、ライセンスファイルに記載された用途に関する制限があるため、商用導入前に確認してください。

pip install supertonicでPython SDKをインストールすると、初回実行時にSDKがHugging Faceからモデルアセットをダウンロードします。プリセットの音声スタイルを選び、テキストと言語コードを指定してsynthesizeを呼び出し、wavを保存します。SupertoneのVoice Builderを使うと、参照音声からカスタム音声スタイルを作成できます。

対応言語が5言語から31言語に増え、繰り返しや読み飛ばしの不具合が減り、両モデルが共通して対応する言語全体で話者類似度が向上しました。また、Supertoneによると、VoxCPM2などのはるかに大規模な公開TTSシステムと比較しても、WERとCERは競争力のある範囲に収まっています。