0.7秒で返事が来る音声AI — Grok Voice Think Fast 2.0が塗り替えた会話の常識


音声AI三社比較(2026年7月 Artificial Analysis調べ) Grok Think Fast 2.0 GPT Realtime-2.1 Gemini 3.1 Flash 82.9% 79.1% 69.5% 0% 100% ⚡ 初回応答 0.70秒 🎙 ノイズ耐性 10倍
音声AI品質スコアと主な特徴(Grok Voice Think Fast 2.0)
ひよこ ひよこ
ペンギン先生、「Grok Voice Think Fast 2.0」ってリリースされたの?なんか速いって聞いたけど。
ペンギン先生 ペンギン先生
そう、xAIが2026年7月29日に発表して、8月5日から正式切り替えが始まったんだよ。一番の売りは「初回応答速度が0.70秒」という速さで、前のモデルの1.25秒からほぼ半分になったんだ。
ひよこ ひよこ
0.7秒って、人間が返事するより速くない?
ペンギン先生 ペンギン先生
実際ほぼそのくらいだね。人間の会話の「間」は大体0.5〜1秒と言われてるから、0.7秒はちょうど自然な会話に入り込める速さなんだ。これより遅いと「待ってる感」が出て、AIっぽさが抜けないんだよ。
ひよこ ひよこ
ChatGPTの音声とかGeminiと比べてどうなの?
ペンギン先生 ペンギン先生
Artificial Analysisっていう第三者機関の音声品質ベンチマークで比べると、こんな感じだよ。
モデル品質スコア初回応答速度価格(/分)
Grok Voice Think Fast 2.082.9%0.70秒$0.08
GPT-Realtime-2.179.1%非公開$0.06〜
Gemini 3.1 Flash(音声)69.5%非公開非公開
品質スコアでGrokが首位に立ってるね(2026年7月時点、Artificial Analysis調べ)。
ひよこ ひよこ
Grokが一番なんだ!でも品質スコアって何を測ってるの?
ペンギン先生 ペンギン先生
発音の自然さ・感情表現・言語の正確さ・ノイズへの強さなど複数の指標を組み合わせたもので、実際の人間との会話にどれだけ近いかを数値化してるんだ。特にGrok Voice Think Fast 2.0は、騒がしい環境での文字起こし精度が既存モデルの約10倍になったと発表されていて、屋外や雑音の多い場所でも使えるようになったんだよ。
ひよこ ひよこ
文字起こし精度10倍って、工場とかでも使えそう!
ペンギン先生 ペンギン先生
まさにそこが狙いの一つだね。テキストを音声に変えるTTSや、音声を聞き取るSTTと違って、Think Fast 2.0は「音声 → AI推論 → 音声」をひとつながりに処理する「speech-to-speech」方式で動いてるんだ。テキストを経由しないから速いし、感情やイントネーションも自然に引き継げる。
ひよこ ひよこ
それって内部でどう動いてるの?
ペンギン先生 ペンギン先生
従来の音声AIは「音声 → 文字起こし → LLMで考える → テキスト生成 → 音声合成」という4段階の処理だったんだよ。それに対してspeech-to-speechは、音声の「波形ごと」エンコードしてモデルに入力し、出力も直接音声波形で出す。段階が減る分だけレイテンシが下がって、今回の0.70秒が実現できたんだ。しかも推論トークン数を60%削減しながらこの品質を出してる点が技術的に面白いポイントだよ。
ひよこ ひよこ
音声AIがここまで進化すると、アプリとか仕事にどんな影響が出るの?
ペンギン先生 ペンギン先生
電話対応AIや車載AIが一気に実用的になるね。応答が0.7秒なら、もはや人と区別がつきにくい。コールセンターの自動応答や、ナビの音声操作、さらには議事録の即時作成まで、今まで「ちょっと使いにくいな」だったユースケースが全部フィットしてくる。音声AIが「話せる」から「仕事ができる」フェーズに入ったと言われてるんだよ。