Skip to content

Repository files navigation

UtauTTS

UTAUボイスバンクの原音接続に学習ベースのイントネーション調整を加えた日本語TTS

ボイスバンクを使う前に、各音源の利用規約を確認してください。UtauTTSと作者は、ボイスバンクの利用で生じた問題について責任を負いません。

インストール

GitHub Releasesから環境と用途に合うZIPをダウンロードします。

パッケージ 用途
UtauTTS-win-x64.zip Windows x64向けGUIとCLI
UtauTTS-linux-x64.zip Linux x64向けGUIとCLI
UtauTTS-Server-win-x64.zip Windows x64向けHTTP Server
UtauTTS-Server-linux-x64.zip Linux x64向けHTTP Server

Windows版はZIPを展開してutautts.exeを実行します。

Linux版はQt 6.5以降、Qt Quick、Qt Multimedia、日本語フォントが必要です。ZIPを展開し実行権限を付けて起動します。

chmod +x utautts tools/* runtime/utautts-openjtalk-features runtime/utautts-worldline-bridge
./utautts

Debian/Ubuntu向けのパッケージ名などはインストールにあります。

GUI版には「足立レイ ver3.5.0」を同梱しています。利用条件は同梱ボイスバンクと音源内の文書を確認してください。

GUIで音声を作る

次の順で操作します。

  1. 文章欄へ文を入力する
  2. Ctrl+Enterまたは再生を押す
  3. 下のグラフでイントネーションとモーラ長を確認する
  4. 必要に応じて点や境界線を動かす
  5. 「ファイル」→「WAVを保存...」で保存する

文章は追加、削除、並べ替えできます。「WAVをすべて保存...」では、文章が入っているカードをまとめて合成します。

ボイスバンクを追加する

実行ファイルと同じ階層にあるvoiceへ音源のフォルダを置きます。

voiceディレクトリは「ファイル」→「音源フォルダを開く」から開けます。

voice/
  音源名/
    oto.ini
    *.wav

以下でも可

voice/
  音源名/
    音源名/
      oto.ini
      *.wav

配置後にUtauTTSを再起動するか「ファイル」→「音源を再読込」を選択することで再読み込みされます。

文章ごとの設定

右側の設定で選択中の文章に使う音源や合成方法を変更できます。

項目 内容
音源 使用するボイスバンク
原音形式 CV、VCV、CVVCの選び方。通常は自動
抑揚モデル 自動イントネーションやモーラ長の予測に使うモデル
Renderer 原音の長さと高さを変え、接続してWAVにする方式
音高 prefix.mapから選ぶ音階
抑揚 自動イントネーションの強さ
モーラ長 自動値がない場合に使う基本長
休止長 句読点などの休止時間
文頭の長さ 最初の原音に確保する先行発声。通常は自動

文頭が欠ける音源では「文頭の長さ」を長くし、余計なノイズを拾う音源では短くしてください。新規作成したカードに使う既定値は「設定」→「設定...」から変更できます。初期状態ではモーラ長120 ms、休止長180 ms、抑揚モデルframe-intonation-v8、Rendereropenutau-worldline-r-faithfulです。

イントネーションと長さを直す

テキストの解析が終わるとモデルが予測した値がグラフへ表示されます。

  • 点を上下へ動かすとそのモーラのピッチが変わります。
  • 縦線を左右へ動かすとモーラの長さが変わります。
  • Shiftを押しながら縦線を動かすと後ろの境界もまとめて移動します。
  • Ctrl+ZCtrl+Yでピッチとモーラ長のUndo/Redoを行います。

保存と連携

.utauttsプロジェクトには文章、カードの順序、音源やRendererなどの合成設定、手動編集した値が保存されます。

設定を有効にするとWAVと同名のファイルも書き出せます。

  • .txt: 入力した文章。UTF-8またはShift_JIS
  • .lab: HTK形式の推定音素境界。PSDToolKitなどのリップシンク用
  • .exo: 各文章のWAVを1レイヤーへ並べたAviUtl拡張編集用ファイル

exo出力後に表示される領域をAviUtlの拡張編集へドラッグすると作成したWAVを読み込めます。

Renderer

Renderer 特徴
openutau-worldline-r-faithful 既定。原音の音響特徴を時間軸へ配置し、フレーズ全体を再合成
openutau-classic-worldline-faithful OpenUTAU Classicと同じWorldline処理と5点包絡線で原音ごとに接続
waveform Go内で原音波形を伸縮して接続。原音の明瞭度を確認しやすい
openutau-classic-worldline-faithful-gpu Classic faithfulのCUDA版。対応するWindows配布物だけに同梱

抑揚モデル

モデル 内容
frame-intonation-v8 Open JTalkのアクセント特徴からフレーム単位のイントネーションを予測
prosody-multitask-v1 v8系のイントネーションに加えてモーラ長も予測

モデルやRendererはGUI、CLI、Serverで共通です。追加方法はモデル/Rendererプラグイン、GUIで集めた手動調整から個人用モデルを作る手順は手動調整から抑揚モデルを作るにあります。

CLI

CLIはGUI版のtools/utautts-cli.exeまたはtools/utautts-cliに入っています。次は同梱音源へ自動イントネーションを適用する例です。

.\UtauTTS\tools\utautts-cli.exe `
  --voicebank ".\UtauTTS\voice\足立レイver3.5.0" `
  --text "こんにちは、今日はいい天気です。" `
  --renderer openutau-worldline-r-faithful `
  --prosody frame-intonation-v8 `
  --prosody-pitch-only `
  --apply-pitch `
  --out ".\out.wav"

読みを直接渡す--kana、合成計画を書き出す--plan-out、原音形式を指定する--alias-policyなどもあります。全オプションはコマンドラインを参照してください。

HTTP Server

Server版を起動するとhttp://127.0.0.1:8080/でコンソールUIを使えます。

.\UtauTTS-Server\utautts-server.exe --voice-dir ".\UtauTTS-Server\voice"

文章解析、音源・モデル・Rendererの一覧、一件または複数件のWAV合成を/api/*から利用できます。APIのJSON形式と入力制限はUtauTTS Serverにあります。

うまく動かないとき

トラブルシューティングをご覧ください。

解決しない場合はIssueを送るか@2237yhに直接DMを送ってください。

詳細ドキュメント

謝辞

ライセンス

UtauTTSのソースコードはMIT Licenseです。models/の学習済みモデルはCC BY-SA 4.0です。同梱ボイスバンク、学習済みモデル、OpenUtau由来ファイルなどには個別の利用条件があります。配布物のTHIRD_PARTY_NOTICES.txtlicenses/、各同梱文書を確認してください。

About

UTAUボイスバンクの原音接続に、学習ベースのイントネーション調整を加えた日本語TTS

Topics

Resources

Stars

43 stars

Watchers

2 watching

Forks

Releases

Contributors

Languages