Skip to content

Latest commit

 

History

508 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

UtauTTS

UTAUボイスバンクの原音接続に、学習ベースのイントネーション調整を加えた日本語TTS

まだベータ版みたいなもんなのでゴリゴリ仕様が変わります。

ボイスバンクを使う前に、各音源の利用規約を確認してください。UtauTTSはボイスバンクの利用で生じた問題について責任を負いません。

インストール

GitHub Releasesから環境と用途に合うZIPをダウンロードします。

パッケージ 用途
UtauTTS-win-x64.zip Windows x64向けGUIとCLI
UtauTTS-linux-x64.zip Linux x64向けGUIとCLI
UtauTTS-mac-arm64.zip Apple Silicon Mac向けGUIとCLI
UtauTTS-Server-win-x64.zip Windows x64向けHTTP Server
UtauTTS-Server-linux-x64.zip Linux x64向けHTTP Server
UtauTTS-Server-mac-arm64.zip Apple Silicon Mac向けHTTP Server

Windows版はZIPを展開してutautts.exeを実行します。

Linux版はQt 6.5以降、Qt Quick、Qt Multimedia、日本語フォントが必要です。ZIPを展開し実行権限を付けて起動します。

chmod +x utautts tools/* runtime/utautts-openjtalk-features runtime/utautts-worldline-bridge
./utautts

macOS版はApple Silicon(arm64)向けです。署名・公証: 未実施。初回起動時: 隔離属性解除が必要になる場合があります。手順: インストール

GUI版には「足立レイ UTAU音源 ver3.5.0」を同梱しています。利用条件は同梱音源と音源内の文書を確認してください。

使い方

次の順で操作します。

  1. 文章欄へ読み上げる文を入力する
  2. 下部の「基本編集」でイントネーションと発音の長さを確認する
  3. 必要に応じて点や境界線を動かす
  4. Ctrl+Enterまたは再生ボタンで音声を確認する
  5. 「ファイル」→「WAVを保存...」で保存する

文章は追加、削除、並べ替えできます。「WAVをすべて保存...」では、文章が入っているカードをまとめて合成します。

音源を追加する

実行ファイルと同じ階層にあるvoiceへ音源のフォルダを置きます。

voiceディレクトリは「ファイル」→「音源フォルダを開く」から開けます。

voice/
  音源名/
    oto.ini
    *.wav

以下でも可

voice/
  音源名/
    音源名/
      oto.ini
      *.wav

配置後にUtauTTSを再起動するか、「ファイル」→「音源を再読込」を選択してください。

文章ごとの設定

右側の設定で選択中の文章に使う音源や合成方法を変更できます。

項目 内容
音源 使用するボイスバンク
原音形式 CV、VCV、CVVCの選び方。既定値は自動
抑揚モデル 自動イントネーションやモーラ長の予測に使うモデル
Renderer 原音の長さと高さを変え、接続してWAVにする方式
言語/phonemizer 言語別の読み上げ方式。日本語はja-kana、英語はen-arpasingen-deltaen-vccven-cv、中国語はzh-cvvc
音高 prefix.mapから選ぶ音階
抑揚 自動イントネーションの強さ
モーラ長 自動値がない場合に使う基本長
休止長 句読点などの休止時間
文頭の長さ 最初の原音に確保する先行発声。既定値は自動

文頭が欠ける音源では「文頭の長さ」を長くし、余計なノイズを拾う音源では短くしてください。新規作成したカードに使う既定値は「設定」→「設定...」から変更できます。初期状態では原音形式が自動、音高がC4、抑揚が2、モーラ長が120 ms、休止長が180 ms、抑揚モデルがframe-intonation-v9-t、Rendererがutautts-world-phraseです。

英語のカードでは、抑揚モデルが日本語用のままでも同梱のenglish-intonation-v1へ自動で切り替わります。

イントネーションと長さを直す

テキストの解析が終わるとモデルが予測した値がグラフへ表示されます。

  • 点を上下へ動かすとそのモーラのピッチが変わります。
  • 縦線を左右へ動かすとモーラの長さが変わります。
  • Shiftを押しながら縦線を動かすと後ろの境界もまとめて移動します。
  • Ctrl+ZCtrl+Yでピッチとモーラ長のUndo/Redoを行います。

保存と連携

.utauttsプロジェクトには文章、カードの順序、音源やRendererなどの合成設定、手動編集した値が保存されます。

設定を有効にするとWAVと同名のファイルも書き出せます。

  • .txt: 入力した文章。UTF-8またはShift_JIS
  • .lab: HTK形式の推定音素境界。PSDToolKitなどのリップシンク用
  • .exo: 各文章のWAVを1レイヤーへ並べたAviUtl拡張編集用ファイル

exo出力後に表示される領域をAviUtlの拡張編集へドラッグすると作成したWAVを読み込めます。

Renderer

Renderer 特徴
utautts-world-phrase 既定。公式WORLDで解析し、UtauTTS独自の特徴配置でフレーズ全体を合成
waveform Go内で原音波形を伸縮して接続。原音の明瞭度を確認しやすい
classic-utau UTAU互換resamplerで原音を処理し、wavtoolまたは内蔵処理で接続
diffsinger DiffSinger音源とbridgeを使う連携機能。対応条件はDiffSingerを参照

Classic UTAU用の実行ファイルはResamplers/またはWavtools/へ置きます。各フォルダは「ファイル」メニューから開けます。配置後は同じメニューの「Classic UTAUツールを再読み込み」を選びます。

追加のRendererやモデル、Classic UTAUツールを登録する場合は、モデル/Rendererプラグインを参照してください。

抑揚モデル

モデル 内容
frame-intonation-v9-t 既定。つくよみちゃんコーパスで学習。日常文を中立に読むスタイル
frame-intonation-v9-k Kokoro Speech Datasetで学習。朗読(語り)寄りのスタイル
english-intonation-v1 英語の強勢と句末境界を軽量に予測

frame-intonation-v9-*はOpen JTalkのアクセント特徴からフレーム単位の相対ピッチを予測します。モデルやRendererはGUI、CLI、Serverで共通です。学習元のライセンスは抑揚モデル、追加方法はモデル/Rendererプラグインにあります。

CLI

CLIはGUI版のtools/utautts-cli.exeまたはtools/utautts-cliに入っています。次は同梱音源へ自動イントネーションを適用する例です。

.\UtauTTS\tools\utautts-cli.exe `
  --voicebank ".\UtauTTS\voice\足立レイver3.5.0" `
  --text "こんにちは、今日はいい天気です。" `
  --renderer utautts-world-phrase `
  --prosody frame-intonation-v9-t `
  --prosody-pitch-only `
  --apply-pitch `
  --out ".\out.wav"

読みを直接渡す--reading、言語と発音形式、ユーザー辞書、モーラごとの長さ、TXT/LAB同時保存、合成計画を書き出す--plan-outなども指定できます。全オプションはコマンドラインを参照してください。

HTTP Server

Server版を起動するとhttp://127.0.0.1:8080/でコンソールUIを使えます。

.\UtauTTS-Server\utautts-server.exe --voice-dir ".\UtauTTS-Server\voice"

文章解析、ユーザー辞書、音源・モデル・Rendererの一覧、WAV/LAB、一括ZIPへのTXT/LAB同梱を/api/*から利用できます。APIのJSON形式と入力制限はUtauTTS Serverにあります。

うまく動かないとき

トラブルシューティングをご覧ください。

解決しない場合はIssueを送るか@2237yhに直接DMを送ってください。

ドキュメント

開発者向けのビルド、拡張、評価資料はドキュメント一覧から確認できます。

謝辞

ライセンス

UtauTTSのソースコードはMIT Licenseです。同梱モデル、ボイスバンク、文章データ、OpenUtau/WORLD由来ファイル、Qtなどの第三者コンポーネントには個別の利用条件があります。詳細はライセンスの適用範囲第三者通知THIRD_PARTY_NOTICES-*licenses/、各同梱文書を確認してください。

About

UTAUボイスバンクの原音接続に、学習ベースのイントネーション調整を加えた日本語TTS

Topics

Resources

Stars

43 stars

Watchers

2 watching

Forks

Releases

Contributors

Languages