ByteDanceは、ネイティブな音声・映像フルデュプレックスモデルであるSeedRealtimeを正式にローンチしました。PANewsによると、このモデルは統合アーキテクチャを採用しており、音声・映像・テキストをネイティブに統合することで、連続するマルチモーダル情報ストリームに対するリアルタイムな対話を可能にします。
ByteDanceはSeedRealtimeが、同時に視聴・聴取・発話をサポートするよう設計されていると述べました。エンドツーエンドの人による評価の結果では、カスケード型モデルと比較して、音声と映像の対話におけるタイミング課題が半減し、さらに、バックグラウンドノイズや雑談による中断、応答の遅れ、誤トリガーも減少しました。同社はまた、会話をスムーズに完了できる確率が高まったとも説明しています。SeedRealtimeは現在、Doubaoアプリで完全に利用可能です。
