豆包上線音視頻全雙工大模型

  香港文匯報訊(記者 孫曉旭)字節跳動(ByteDance)昨日正式發布原生音視頻全雙工大模型「SeedRealtime」。據公司介紹,該模型能夠聯合理解聲音、畫面與時序信息,準確判斷交互對象及用戶意圖,實現「邊看、邊聽、邊說」的自然互動體驗。目前,SeedRealtime已在豆包手機應用程式(App)全量上線,用戶可通過「打電話」功能進入視頻通話界面,體驗實時音視頻AI交互。

  字節跳動表示,SeedRealtime通過統一架構原生融合音訊、視訊與文字,能在連續的多模態信息流上即時交互。模型在音視頻聯合理解、主動交互能力和交互節奏把控三方面均有突破。端到端人工評測顯示,相比級聯模型,SeedRealtime的對話節奏問題減少一半,打斷、遲滯和誤觸發等現象顯著減少,單次對話能夠順暢、完整交流的幾率也有明顯提升。

  增抗干擾力 能分辨雜訊

  在音視頻聯合理解方面,SeedRealtime能結合音視頻即時理解用戶所處場景,提供更具針對性的幫助,同時更自然支援跨語言交流。在主動交互能力上,模型具備持續的環境感知與主動表達能力,能在察覺畫面狀態變化時(如關鍵目標出現)主動提醒。此外,SeedRealtime能即時感知用戶的對話狀態與交流節奏,於適當時機自然接話、停頓與回應;同時具備較強的抗干擾能力,能分辨旁人閒聊與背景雜訊,不因干擾誤觸發,保持溝通流暢連貫。

  字節跳動表示,將持續優化模型,期望AI交互不再僅限於清晰輪次中的問答,而是能在連續變化的真實場景中理解上下文、敏銳把握時機,並在合適的時候提供幫助。