恒大研發新AI框架 提前偵測網絡欺凌
香港文匯報訊(記者 高鈺)網絡欺凌往往隱藏於中英夾雜、廣東話與網絡潮語混雜的對話之中,傳統人工智能(AI)系統難以識別,更遑論及早介入。香港恒生大學計算機科學系助理教授朱振輝領導的團隊,利用具私隱保護的數據及大型語言模型(LLM),從更廣泛的對話語境理解網絡欺凌行為,成功開發出能在欺凌逐漸形成時及早識別的框架,為建立更安全的數碼社群提供新方向。
朱振輝表示,項目於數年前開展時,當時的技術尚未能分析涉及多名參與者的複雜網上對話,而LLM領域的最新進展,令此項工作成為可能。
另一方面,港人網上溝通經常混合廣東話、書面中文、英文及本地網絡潮語,傳統AI系統難以處理這類語碼混合語言,加上網絡欺凌本身亦可能以諷刺或間接攻擊的形式出現,未必使用明顯的冒犯字眼。
分析中英夾雜完整對話脈絡
為應對這些挑戰,團隊開發了「具私隱保護的中英夾雜網絡欺凌數據集」,包含從社交平台X(前稱Twitter)蒐集的14,000多條經人工標註的帖文,分為1,600多段對話。原始資料集則包含數十萬則帖文。團隊耗時逾六個月進行數據蒐集、清理及標註工作。研究人員並非單純評估個別帖文,而是分析涉及多名參與者及多輪交流的完整對話。由LLM驅動的框架可識別受害者、施暴者及欺凌互動行為,同時考慮相關行為如何隨時間演變,系統能辨識重複針對、間接提及和不斷變化的人際關係,而這些情況往往容易被單一訊息層面的分析方法所忽略。
研究亦提出一套更有系統的方式評估網絡欺凌的嚴重程度,考慮因素包括欺凌互動行為的頻率、施暴者人數,以及參與者之間的權力失衡等,有助優先處理風險較高的個案。AI亦可協助識別可能構成問題的內容,但朱振輝補充指:「人手審查仍然必要,因為沒有任何自動化系統是完全準確的,而且網上語言變化迅速,數據集需定期更新及重新標註。」
研究結果顯示,私隱保障與有效的AI研究可以並存;在某些情況下,減少訓練數據中的雜訊及偏誤,更可提升模型表現,研究成果可支援未來在教育、社交媒體安全及數碼健康方面的研究及實際應用。未來團隊計劃把研究由文字擴展至圖像、迷因(meme)及其他多模態內容。