【おんせいせいせいえーあい】
音声生成AI とは?
最終更新:
💡 文字などをもとに、読み上げる声を作るAI
AIを使って読み上げなどの音声を合成する技術。テキストから音声を作るTTSや、許可された音声データから声の特徴を再現する方法などがある。自然さ、対応言語、声の利用条件はモデルやサービスによる。
📌 このページのポイント
音声生成AIは、何を作るの?
読み上げる声などを合成するよ。代表的なTTSでは文章を入れて音声を出す。声や話す速さ、抑揚を調整できるものもあるけれど、使える機能はモデルやツールによるんだ
聞くだけでは、人間と区別できない?
自然に聞こえる音声を作れるものはあるけれど、全ての文章や声で同じ品質にはならないよ。読み間違いや不自然な抑揚も起こる。公開する前に、固有名詞や数字、意味の区切りを実際に聞いて確かめよう
どういうところで使うの?
動画のナレーション、オーディオブック、アプリの読み上げなどに使えるよ。音声を用意する作業を助けられる。読み上げ支援では、聞き取りやすさや操作しやすさも確認して、利用者に合う形にするんだ
文章を入れれば、誰の声でも複製できる?
通常の読み上げと、声の複製は別の機能だよ。複製には対応する方法や録音が必要で、品質や必要な量も違う。例えばElevenLabsでは、複製する声を使う許可が必要とされている。他人の声を使うときは、許諾とサービスの条件を確認しよう
無料のツールなら、商用でも自由?
ツールと生成した音声の利用条件を分けよう。例えばVOICEVOXのソフトは商用でも使えるけれど、音声ライブラリごとの規約に従い、クレジットも必要。サービスではプランによって商用利用の条件も異なる。日本語の読み方や声の選択肢を試して、用途に合うものを選ぶんだ
📖 おまけ:英語の意味
「Voice Generation AI / Text-to-Speech AI」 = 音声を生成するAI・文章から音声を作るAI
💬 text-to-speechは文章を音声に変えるという意味だよ。音声を文字にするspeech-to-textとは、入力と出力の向きが逆なんだ