打破算力壟斷 實現AI高效普惠 善用遷移學習與知識蒸餾 理大陽行意致力攻克訓練難題

●陽行意研究項目:「生成式AI—可控創建」。  理大圖片
●陽行意研究項目:「生成式AI—可控創建」。 理大圖片


●陽行意   理大圖片
●陽行意 理大圖片

●陽行意研究項目:「世界模型—物理智能」。  理大圖片
●陽行意研究項目:「世界模型—物理智能」。 理大圖片

●陽行意於學術會議上就深度模型重用及重組進行報告。 理大供圖
●陽行意於學術會議上就深度模型重用及重組進行報告。 理大供圖

  AI模型訓練往往需動用成千上萬枚高效能芯片長時間運作,而芯片與算力需求所耗用的電與水,令訓練過程被形容為「耗能巨獸」。為降低環境衝擊並控制成本,業界與學術界近年正加緊尋找更聰明、更省電的高效訓練方法。

  專注研究生成式AI、世界模型與空間智能等方向的理大數據科學及人工智能學系助理教授陽行意指出,生成式AI的高效訓練,本質上屬於「系統問題」,而非單純的「演算法問題」。

  陽行意解釋,過往談及高效訓練,討論焦點多落在縮小模型規模或設計計算量更低的演算法。然而,訓練大型模型更像在經營一條大型生產線,模型本身只是其中一部機器,整體成本與效率還要取決於設備如何選配、數據能否及時送達、不同設備如何協同,及投入的「原料」是否真正有價值,「若只優化其中一個環節,整體效率未必會明顯提高。」

  模型設計需配合硬件能力

  要做到高效訓練,他認為當前最有效策略不在於探尋單一技術解決所有問題,而是要把硬件、訓練系統、模型和數據各層面同時打通,並梳理出關鍵因素。首先是硬件匹配。不同計算設備各有特點,有些擅長同時處理大量任務,有些更適合特定類型運算,只有讓模型設計與硬件能力相配合,才能真正發揮其效率。

  其次,是訓練平台與系統調度。很多時候模型並不是在「計算」,而是在「等待」,例如等待數據讀取、設備交換資訊,或資源重新分配等。他形容就像生產線中,即使某一台機器提速三成,但若原料供應跟不上,會令前後工序銜接不暢,總產能提升仍然有限。

  其三是模型效率。模型不必每次都從頭訓練,可只調整與新任務最相關部分;亦可讓小模型吸收大模型既有能力,降低訓練成本。他形容部分模型雖規模龐大,但執行任務時只需調用部分能力,猶如大型醫院按病情邀請相關專科介入,無須每次都召集所有科室,既能保留模型能力,也能降低計算成本。

  最後是數據效率。大模型需要海量數據,但部分數據重複、低質或與目標任務關聯少,並非愈多愈好。若能從海量數據中篩選最具價值部分,便有望用更少數據訓練出同等甚至更佳的模型表現。

  他指近年包括DeepSeek、Kimi等模型的發展,讓外界更清楚看到效率提升往往來自多環節協同改進,「每一層的改進可能只有百分之十或百分之幾十,但當這些提升疊加起來,最終可能帶來重量級的效率提升。」

  陽行意團隊的核心思路,是保留現有大模型的既有能力,以更少數據、算力與時間把模型快速遷移至新領域。他以改造大樓作比喻:一幢功能完備的大樓不必推倒重建,可在較低成本下調整內部結構,以適配醫院、學校等不同場景。循此思路,團隊從演算法、數據到系統層面同步降本增效,力求在有限資源下實現快速訓練與落地適配。

  他強調,高效訓練最終要解決的,不只是少用幾張GPU(圖形處理器)的技術問題,也不是讓生成式AI始終只是少數大型企業之間的資本與算力競賽,而是希望把訓練和創造模型的能力交給更多研究者、企業和普通使用者,讓AI能被每個人使用、改造和創造。