創科路上/「RoboDojo」平台獲全球學術及業界肯定 港大首創具身人工智能統一評測基準
具身人工智能(Embodied AI)技術近年發展迅速,但這些具身機械人模型到底哪個較強?強在哪裏?能不能從仿真走到真實世界?離真正通用操作機械人還有多遠?這些都缺乏統一的評測標準,令各款機械人難以作公平及標準化的比較。香港大學多媒體實驗室(MMLab)近日宣布,推出全球首個結合模擬環境與真實世界機械人操作的具身人工智能統一評測基準平台「RoboDojo」。
評測結果顯示,目前表現最佳的模型在真實測試的成功率僅得12.8%,遠低於人類專家的100%,反映AI機械人要實現穩定可靠的日常應用,仍有巨大的進步空間。RoboDojo推出以來,迅速獲得全球學術及業界高度關注與肯定,於社交平台錄得逾10萬次瀏覽及逾10萬次下載。\大公報記者 郭如佳
港大首創的「RoboDojo」統一評測基準平台,樹立了智能機械人評測的新標準。該項目由港大計算與數據科學學院副院長(人工智能科技轉化及拓展)羅平教授,與其博士研究生陳天行共同發起,並匯聚了包括加州大學柏克萊分校及清華大學在內、全球近20所頂尖大學與科研機構共同參與。
透過數十任務全面評估
港大研究團隊表示,具身人工智能旨在賦予機械人在實體環境中感知、推理並採取行動的能力。然而,現有的評測方法大多局限於模擬環境,或因採用不同的硬件配置、測試條件和評分標準,導致不同模型之間難以進行公平且標準化的比較。因此,即使機械人在示範中表現出色,亦未必能真實反映其在複雜多變的現實場景中,持續且穩定地執行任務的能力。
為應對挑戰,RoboDojo創新地將模擬評測、標準化真實機械人測試及策略模型比較整合至單一框架。平台目前涵蓋42項模擬任務、18項真實世界機械人任務,以及30個具代表性的機械人策略模型,全面評估機械人在泛化、記憶、精細操作和長程任務執行等關鍵維度的能力。
評測結果揭示了當前技術的瓶頸:目前表現最佳的模型,在模擬環境及真實測試中的成功率分別僅為8.80%和12.8%,遠低於人類專家的76.03%及100%。數據表明,具身人工智能要在複雜環境中實現穩定可靠的日常應用,仍有相當大的進步空間。
羅平教授表示,RoboDojo是首個由香港牽頭、結合模擬與標準化真實機械人評測的基準平台。它有助推動具身人工智能研究由過往着重示範成果,邁向可量度、可比較及值得信賴的技術進步。
促進全球學術產業協作
RoboDojo自推出以來,迅速獲得全球學術界與業界的高度關注。項目於社交平台X的發布內容錄得逾10萬次瀏覽;同時,其相關的開源資源亦在短短一周內,於AI社群平台Hugging Face錄得逾10萬次下載,反映國際科研群體對此項研究的高度肯定。
展望未來,港大期望RoboDojo將有助建立公平、透明和可重現的評測機制,促進全球學術界與產業界的深度協作,推動具身人工智能技術,由展示導向走向可持續發展,為研發更安全、更可靠並可應用於真實環境的機械人系統,提供核心技術支撐。