【てきすとよみあげえーあい】

テキスト読み上げAI(TTS) とは?

最終更新:
💡 文章から、読み上げる声を生成する

テキストから読み上げ音声を生成するAI技術。TTSはText-to-Speechの略で、AIを使わない方式も含む音声合成全般を指す。声の自然さや制御できる内容はモデルによって異なる。

📌 このページのポイント
TTS:文章から読み上げ音声へ 文章 音声合成 音声 AI方式の例:Tacotron 2 音響モデル 文章 → 音声の特徴 ボコーダー 特徴 → 音声波形 中間の特徴:メルスペクトログラム VITSなど、別の設計もある 声の品質・制御項目はモデルによる
上段は文字から音声への変換。下段はTacotron 2の2段階構成の例で、矢印は情報の変換方向を表す。すべてのTTSがこの構成やAI方式を使うわけではない。
ひよこ ひよこ
TTSって昔からあるよね?AI版は何が違うの?
ペンギン先生 ペンギン先生
TTS自体は、文字から音声を作る技術全般の名前だよ。ニューラルTTSでは、学習したモデルで音声の特徴などを扱う。自然な音声を目指す技術は進んでいるけれど、どの文章でも人間と区別できないという保証ではないんだ。
ひよこ ひよこ
どんなことを調整できるの?
ペンギン先生 ペンギン先生
声の種類、読み上げ速度、抑揚などを調整できるエンジンがあるよ。ただし対応項目はそれぞれ違う。読み方などを指定するSSMLという規格もあるけれど、使うエンジンがどの指定に対応しているか確かめよう。
ひよこ ひよこ
技術的にはどうやって声を作るの?
ペンギン先生 ペンギン先生
たとえばTacotron 2は、音響モデルが文章からメルスペクトログラムという音声の特徴を作り、WaveNetを使ったボコーダーが波形へ変換する2段階の構成だよ。これは一つの方式で、すべてのTTSがこの構成とは限らないんだ。
ひよこ ひよこ
ほかの方式もあるんだね?
ペンギン先生 ペンギン先生
VITSのように、文章から音声までをまとめて学習するエンドツーエンド方式もあるよ。ニューラルTTSにも複数の設計があるので、AIを使うから必ずTransformer方式、あるいは必ず低遅延になるとは言えないんだ。
ひよこ ひよこ
文章を入れたら、そのまま公開してよいの?
ペンギン先生 ペンギン先生
まず実際に聞いて、読み間違いや間の取り方を確認しよう。数字や記号の読みは文脈で変わり、日本語の「今日」も読みの解釈が必要になるよ。声やモデルの利用条件も確かめよう。文章を読むTTSと、特定の人の声を再現することは分けて考えるとよいね。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「テキスト読み上げAI」って出てきたら「文章から読み上げ音声を作るAI」と思えればだいたいOK!
📖 おまけ:英語の意味
「Text-to-Speech AI」 = テキスト音声合成AI
💬 TTSはText-to-Speech(文字から音声へ)の略。音声合成は以前からあり、そのうち学習モデルを用いる方式をここでは扱うよ。

参考資料

← 用語集にもどる