ME AIメッセージ。ByteDanceのSeedRealtime大規模モデルは、統一アーキテクチャで音声・映像・テキストをネイティブに統合し、「見ながら聴き、話す」全二重のリアルタイム対話を実現します。すでに豆包アプリに規模化して導入されました。従来のカスケード型の「聴く→書き起こす→考える→話す」という直列のつなぎ方を改め、端から端まででマルチモーダルを処理することで、大幅に遅延を低減し、自然さを高めています。(出典:ME)