【おんせいごうせい】
音声合成(テキストトゥスピーチ) とは?
最終更新:
💡 文字の内容を、読み上げる声にする技術
入力したテキストを読み上げ音声に変換する技術(TTS)。ここでは文字から声を作る音声合成を扱う。読み上げ支援や案内、ナレーションなどに使われる。
📌 このページのポイント
- Text-to-Speechは、テキストを読み上げ音声に変換する技術
- 読み方や話し方を処理して音声を作る。内部の方式は実装によって異なる
- 人名・略語・数字などは読み違えることもあり、生成音声を確認する
- 用意された声の選択と、特定の人の声を再現する機能は区別し、利用条件を確認する
音声合成って、どんなことをするの?
ここで説明するText-to-Speechは、入力したテキストを読み上げ音声にする技術だよ。読み上げ支援や、アプリの案内、ナレーションなどに使える。ニューラルモデルを使った方式もあるけれど、自然さは声や言語、文章によって変わるんだ。
文字がどうやって声になるの?
文字の構造や読み方を処理し、話し方を反映した音声を作るよ。例えば数字や略語は、文字のままではなく、読み上げ方へ変換する必要がある。処理の分け方や音声の作り方は方式によって違い、すべてが同じ内部構成ではないんだ。
文章を入れれば、読み方も正しくなる?
必ず正しくなるとは限らないよ。人名や略語、日付などは読み違えることがある。対応するサービスではSSMLという指定方法で読み方や間を調整できるけれど、対応範囲は異なる。公開前には実際の音声を聞いて確認しよう。
声は選べるの?
サービスが用意した声の中から選べるものがあるよ。選べる言語や話し方は声ごとに違う。Google CloudのSSMLでも声の組み合わせに対応条件があるので、どの声でも同じ指定が使えると考えないようにしよう。
特定の人の声も作れる?
対応する機能では録音を使った声の再現ができるけれど、録音の品質やモデルなどの条件があるよ。Azureのプロフェッショナル音声では、本人の同意の録音が必要で、利用も制限されている。誰の声でも少し録れば自由に使えるという意味ではないんだ。
まとめ:ざっくりこれだけ覚えればOK!
「テキストトゥスピーチ」って出てきたら「文字から読み上げ音声を作る技術」と思えばだいたいOK!
📖 おまけ:英語の意味
「Text-to-Speech(TTS)」 = テキストから音声へ
💬 Textは文字の文章、Speechは話す音声を表すよ。文字を入力して、それを読み上げる音声を作るという意味なんだ。