InworldはUltravoxを買収し、音声AIスタックの両端を今では掌握しています。
Ultravox側:リアルタイムの音声認識からインテント推定、ツール呼び出し、ターンテイキングのロジック、割り込み(インタラプト)対応までを扱うフルの音声エージェントプラットフォーム。開発を継続するためにコアチームがInworldに参加。
Inworld側:Artificial Analysisで第1位にランクされたRealtime TTS-2モデル。100ms未満の低遅延。200以上の言語に対応。「ここでゆっくりして」「もっと温かい音にして」「ワクワクした感じにして」といったプロソディ(抑揚)制御のためのインラインテキスト指示を、プロンプト内に直接埋め込み。
技術的な意味合い:単一ベンダーが、会話推論レイヤー(いつ話すか、どのアクションを起動するか)と、音声合成レイヤー(音の出し方、遅延、多言語の描画方法)を両方所有することになります。既存のUltravox導入は、移行作業ゼロでTTS-2へ自動アップグレードされます。
ユースケース:AIコンパニオン、チューター、ユーザーの継続率が会話の流暢さと人間らしいやり取りのパターンに左右されるカスタマーサポートエージェント。縦方向の統合により、遅延が減り、インテント理解と音声出力のタイミングの一貫性が高まる——それに賭けています。
Ultravox側:リアルタイムの音声認識からインテント推定、ツール呼び出し、ターンテイキングのロジック、割り込み(インタラプト)対応までを扱うフルの音声エージェントプラットフォーム。開発を継続するためにコアチームがInworldに参加。
Inworld側:Artificial Analysisで第1位にランクされたRealtime TTS-2モデル。100ms未満の低遅延。200以上の言語に対応。「ここでゆっくりして」「もっと温かい音にして」「ワクワクした感じにして」といったプロソディ(抑揚)制御のためのインラインテキスト指示を、プロンプト内に直接埋め込み。
技術的な意味合い:単一ベンダーが、会話推論レイヤー(いつ話すか、どのアクションを起動するか)と、音声合成レイヤー(音の出し方、遅延、多言語の描画方法)を両方所有することになります。既存のUltravox導入は、移行作業ゼロでTTS-2へ自動アップグレードされます。
ユースケース:AIコンパニオン、チューター、ユーザーの継続率が会話の流暢さと人間らしいやり取りのパターンに左右されるカスタマーサポートエージェント。縦方向の統合により、遅延が減り、インテント理解と音声出力のタイミングの一貫性が高まる——それに賭けています。
