



讓全球智能體都會說地道粵語
當前,廣州正全力打造特色鮮明的“垂類模型之都”。2026世界人工智能大會期間,由廣州大學、廣州市社科聯共建的粵語語料庫建設與大模型評測重點實驗室于7月19日應邀亮相大會“人工智能高質量語料生態論壇”,并在現場重磅發布兩項原創核心成果——AI-DimSum粵語語料庫平臺搜索2.0、粵語真實語音上下文交互能力評測基準CRS-Bench,以方言垂類數據底座打造廣州AI的差異化競爭力。

“人工智能高質量語料生態論壇”現場
重磅成果
海量粵語語料“找得準、信得過”
模型能力“測得清、評得準”
在“人工智能高質量語料生態論壇”現場,AI-DimSum粵語語料庫平臺搜索2.0、粵語真實語音上下文交互能力評測基準CRS-Bench兩項原創核心成果重磅發布。粵語語料庫建設與大模型評測重點實驗室(以下簡稱“重點實驗室”)主任、廣州大學網絡空間安全學院教授齊佳音對這兩項成果進行了介紹。前者是重點實驗室在語料規模邁入TB級后推出的重要升級,具備三大特色:所有語料自帶“身份證”,來源更可信;搜索結果分三層呈現——精確、關聯和推薦,內容更豐富;融合社交功能和生態應用,實現搜索即社交、搜索即傳播、搜索即應用。后者由重點實驗室與GOMAX LAB合作建設,基于真實粵語語音資源,體現地域變體、包含上下文情景、具有文化語義復雜度,開辟了AI粵語能力評測的新賽道。
齊佳音在接受記者采訪時介紹:“從定位上說,AI-DimSum粵語語料庫的目標是建成‘兼容嶺南文化、兼容人工智能’的全球最大多模態通用粵語語料庫。從功能上說,AI-DimSum粵語語料庫不僅是傳統的語言學語料庫,更是服務于粵語AI創新的基礎數據設施。我們希望能盡快對接產業應用,通過產業需求拉動定制化語料的供給能力,包括主要大語言模型企業以及大灣區各類民生政務中的粵語服務密集型領域。”
齊佳音說,此次發布的兩項成果是廣州將豐富鮮活的粵語資源轉化為可用數據資產的重要實踐。AI-DimSum粵語語料庫平臺搜索2.0讓海量粵語語料“找得準、信得過”,為教育、文創、媒體和人工智能企業提供了便捷可信的數據服務入口;評測基準則讓模型能力“測得清、評得準”,將評測結果反饋到數據建設端,驅動模型能力持續提升。
現場觀眾、軟極網絡首席戰略官鄭志彬認為,本次兩大粵語AI創新成果的發布,補齊了粵語數字化發展的數據設施短板,有助于進一步筑牢嶺南文化數字根基,增強本土文化自信。
廣闊前景
讓嶺南文化在數字時代走得更遠
記者了解到,此次粵語AI成果亮相世界人工智能大會,是廣州市社科聯以社科重點實驗室推動人文與科技雙向奔赴的又一鮮活實踐。
2024年11月,在廣州市委宣傳部指導和推動下,廣州市社科聯與廣州大學聯合成立粵語語料庫建設與大模型評測重點實驗室,由中國工程院院士、廣州大學網絡空間安全學院名譽院長方濱興,國家語言服務與粵港澳大灣區語言研究中心主任、廣州大學二級教授屈哨兵擔任雙首席科學家,聯動大灣區多方資源推動粵語語料建設從專業工程走向社會參與,從資源整理走向生態培育。
一年來,重點實驗室圍繞“兼容嶺南文化”和“兼容人工智能”兩項目標,建設AI-DimSum多模態通用粵語語料庫平臺,現已匯聚超100萬字文本、3000小時高保真語音和1TB+音視頻,建成嶺南文化粵語思維鏈問答數據、粵語內容安全關鍵詞語料、粵語大模型安全評測數據集等特色語料,孵化出十余款應用,向全球AI開發者提供獨家高質量算法訓練數據。
廣州市社科聯相關負責人告訴記者:“我們希望AI能真正讀懂粵語的韻味,理解嶺南文化的靈魂,通過建設高質量的粵語語料庫,讓AI成為大灣區居民的好朋友和好幫手,實現前沿技術與本土文化的深度融合。因此,我們的研究致力于解決AI‘拼裝粵語’的痛點,讓全世界的智能體都能說‘地道’的粵語,讓嶺南文化在數字時代走得更遠。”
院士點評
粵語數據庫筑牢AI可信文化根基
本次論壇主旨演講嘉賓會聚圖靈獎得主與6位院士。他們圍繞“高質量垂域語料如何破解AI落地瓶頸”的問題,展開深度研討。
中國工程院院士、粵語語料庫建設與大模型評測重點實驗室首席科學家方濱興表示,粵語是大灣區的標志性文化載體,是海內外華人文化認同的重要語言紐帶。AI-DimSum多模態通用粵語語料庫平臺最重要的作用就是為粵語AI提供“文化忠實、安全可信、AI友好、持續成長”的數據基礎設施底座。
關注 · 廣州政府網