【おんせいにんしき】
音声認識 とは?
最終更新:
💡 話した言葉を文字にする
人の話し声を解析し、話された内容を文字に変換する技術。録音の文字起こしや音声入力などに使われる。言葉の意味を理解したり、声で本人を識別したりする技術とは役割が異なる。
📌 このページのポイント
- 音声から話された言葉を推定し、文字として出力する
- 録音の文字起こしや、話しながらの音声入力に使われる
- 雑音・話者の重なり・対応言語などで認識結果が変わる
- 認識結果は誤ることがあり、用途に応じて内容を確認する
音声認識はどうやって文字にするの?
録音やマイクの音声を解析し、モデルで話された言葉を推定して文字にするよ。音の特徴や言葉の文脈を利用するけれど、内部の処理が必ず同じ三段階に分かれるわけではない。基本は、話し声から文字を得ることなんだ。
雑音や方言があっても正しく読める?
精度は音声と使うシステムによるよ。雑音や反響、複数の人の重なった声、対応する言語や語彙などが関係する。口元に近いマイクで録るなど、入力の質を整えると役立つ。方言だから必ず認識できない、とも一律にはいえないんだ。
話し終わるまで文字は出ないの?
文字起こしなら、確認はもういらない?
聞き違いや固有名詞の誤りが残ることがあるよ。製品によっては専門用語などの候補を渡して認識を助けられる。認識の確からしさを示す値も正解の証明ではないので、重要な記録では元の音声と照らして確認しよう。
音声アシスタントや読み上げと同じもの?
役割を分けると分かりやすいよ。音声認識は声を文字にする。文字から意味や意図を扱う処理は別の役割で、文字を声にするのは音声合成。声の主を識別する話者認識も別なんだ。音声サービスでは複数の技術を組み合わせることがあるよ。
まとめ:ざっくりこれだけ覚えればOK!
「音声認識」って出てきたら「話し声から言葉を推定して、文字にする技術」と思えばだいたいOK!
📖 おまけ:英語の意味
「Speech Recognition」 = 話し声の認識
💬 話された言葉を認識するという意味だよ。声の主を識別する話者認識とは、目的が違うんだ。