字節推音視頻全雙工大模型
字節跳動(ByteDance)昨日正式發布原生音視頻全雙工大模型「SeedRealtime」。據公司介紹,該模型能夠聯合理解聲音、畫面與時序資訊,準確判斷交互對象及用戶意圖,實現「邊看、邊聽、邊說」的自然互動體驗。目前,「SeedRealtime」已在豆包手機應用程式全量上線,用戶可通過「打電話」功能進入視頻通話介面,體驗實時音視頻AI交互。
對話節奏問題減少一半
字節跳動表示,「SeedRealtime」通過統一架構原生融合音訊、視訊與文字,能在連續的多模態資訊流上即時交互。模型在音視頻聯合理解、主動交互能力和交互節奏把控三方面均有突破。端到端人工評測顯示,相比級聯模型,「SeedRealtime」的對話節奏問題減少一半,打斷、遲滯和誤觸發等現象顯著減少,單次對話能夠順暢、完整交流的機率也有明顯提升。
在音視頻聯合理解方面,「SeedRealtime」能結合音視頻即時理解用戶所處場景,提供更具針對性的幫助,同時更自然支援跨語言交流。
在主動交互能力上,模型具備持續的環境感知與主動表達能力,能在察覺畫面狀態變化時(如關鍵目標出現)主動提醒。
此外,「SeedRealtime」能即時感知用戶的對話狀態與交流節奏,於適當時機自然接話、停頓與回應;同時具備較強的抗干擾能力,能分辨旁人閒聊與背景雜訊,不因干擾誤觸發,保持溝通流暢連貫。
字節跳動表示,將持續優化模型,期望AI交互不再僅限於清晰輪次中的問答,而是能在連續變化的真實場景中理解上下文、敏銳把握時機,並在合適的時候提供幫助。