【てきすとよみあげえーあい】
テキスト読み上げAI(TTS) とは?
最終更新:
💡 文章から、読み上げる声を生成する
テキストから読み上げ音声を生成するAI技術。TTSはText-to-Speechの略で、AIを使わない方式も含む音声合成全般を指す。声の自然さや制御できる内容はモデルによって異なる。
📌 このページのポイント
- TTSは文字から音声への変換で、AI方式だけを指す略語ではない
- ニューラルTTSは学習モデルで発音や音声の特徴を扱う
- 声・速さ・抑揚など、調整できる項目はエンジンによって異なる
- 音響モデルとボコーダーを分ける方式や、エンドツーエンド方式がある
TTSって昔からあるよね?AI版は何が違うの?
TTS自体は、文字から音声を作る技術全般の名前だよ。ニューラルTTSでは、学習したモデルで音声の特徴などを扱う。自然な音声を目指す技術は進んでいるけれど、どの文章でも人間と区別できないという保証ではないんだ。
どんなことを調整できるの?
声の種類、読み上げ速度、抑揚などを調整できるエンジンがあるよ。ただし対応項目はそれぞれ違う。読み方などを指定するSSMLという規格もあるけれど、使うエンジンがどの指定に対応しているか確かめよう。
技術的にはどうやって声を作るの?
たとえばTacotron 2は、音響モデルが文章からメルスペクトログラムという音声の特徴を作り、WaveNetを使ったボコーダーが波形へ変換する2段階の構成だよ。これは一つの方式で、すべてのTTSがこの構成とは限らないんだ。
ほかの方式もあるんだね?
VITSのように、文章から音声までをまとめて学習するエンドツーエンド方式もあるよ。ニューラルTTSにも複数の設計があるので、AIを使うから必ずTransformer方式、あるいは必ず低遅延になるとは言えないんだ。
文章を入れたら、そのまま公開してよいの?
まず実際に聞いて、読み間違いや間の取り方を確認しよう。数字や記号の読みは文脈で変わり、日本語の「今日」も読みの解釈が必要になるよ。声やモデルの利用条件も確かめよう。文章を読むTTSと、特定の人の声を再現することは分けて考えるとよいね。
📖 おまけ:英語の意味
「Text-to-Speech AI」 = テキスト音声合成AI
💬 TTSはText-to-Speech(文字から音声へ)の略。音声合成は以前からあり、そのうち学習モデルを用いる方式をここでは扱うよ。