Supertonic-3とは?
Supertonic 3は、Supertoneが開発した軽量な音声合成システムです。ONNX Runtimeを通じてすべての処理がデバイス上で動作し、音声合成のためにクラウドへアクセスすることはありません。第3弾となる今回のリリースでは、公開されている重みの対応言語が5言語から31言語に増えました。繰り返しや読み飛ばしの不具合が減り、読み上げの安定性が向上しています。Supertonic 2よりも話者類似度が向上し、laugh、breath、sighなどのシンプルな表現タグも追加されました。
| 仕様 | Supertonic-3 |
|---|---|
| パラメータ数 | 公開ONNXアセット全体で約99M |
| モダリティ | テキストから音声 |
| 対応言語 | 英語、韓国語、日本語、ドイツ語、スペイン語、フランス語、ヒンディー語、ロシア語など31言語 |
| ランタイム | ONNX Runtime、オンデバイス |
| 音声 | 固定のプリセットを同梱。Supertone Voice Builderでカスタムスタイルを作成可能 |
| リリース日 | 2026年5月 |
| ライセンス | OpenRAIL-M、サンプルコードはMIT |
Supertonic 3の得意分野
実用的なオンデバイス推論を目指して設計されています。Supertoneによると、A100 GPUで測定したより大規模な比較対象モデルと比べても、CPUで高速に動作し、メモリ使用量も大幅に少なくなっています。GPUが不要なため、ローカル、ブラウザ、エッジ環境へ容易に導入できます。読み上げ精度については、開発元の測定によると、VoxCPM2などのはるかに大規模な公開TTSシステムと比較しても、WERとCERは競争力のある範囲に収まっています。
パラメータ数は約99Mで、0.7Bから2Bクラスの公開TTSモデルよりもはるかに小さく、ダウンロードサイズの小ささと起動の速さにつながっています。ONNXアセット一式のサイズは約400 MBで、テキストエンコーダ、継続時間予測器、ベクトル推定器、ボコーダで構成されています。
Supertonic 3のハードウェア要件
Pythonが動作するマシンであれば使えます。公開アセットの合計サイズは約400 MBで、ランタイムはCPUでの実行を主眼にしています。Supertoneは、想定する導入先としてブラウザとエッジ環境を挙げています。VRAM容量を考慮する必要はありません。
Supertonic 3をローカルで実行する方法
Python SDKをインストールすると、初回実行時にモデルがHugging Faceから自動的にダウンロードされます。
- pip install supertonic
- プリセットの音声スタイルを選び、テキストと言語コードを指定してsynthesizeを呼び出します。
- wavを保存します。laughやsighなどの表現タグは、テキスト内に直接挿入します。
SupertoneのVoice Builderを使うと、参照音声からカスタム音声スタイルを作成できます。購入したスタイルには、Supertonic 2と3の両方に対応する埋め込みが含まれます。音声と組み合わせるチャットモデルについては、ローカルモデルの全カタログをご覧ください。
Supertonic-3のライセンス
モデルはOpenRAIL-Mライセンス、サンプルコードはMITライセンスで公開されています。OpenRAIL-Mでは無料で利用できますが、ライセンスファイルに記載された用途に関する制限があるため、商用導入前に確認してください。
