主權AI評測 台3模型列前20
數位發展部2日公布最新台灣主權AI評測結果,在188個語言模型中,雅婷智慧、亞太智能機器及鴻海研究院開發的模型均擠進前20名,其中雅婷智慧排名第4、亞太智能機器排名第10,兩款模型在「台灣價值觀」指標更拿下滿分。數發部長林宜敬強調,台灣發展主權AI,重點不只是讓模型會繁體中文,更要理解台灣社會與價值觀,「這個AI模型必須有台灣觀點」。
主權AI是指一個國家或地區擁有自主研發、營運並掌控AI技術與基礎設施的能力。
數發部2日舉辦「主權AI評測×可信任AI行動」記者會,透過AI產品與系統評測中心(AIEC)公布評測結果,從台灣語言、社會文化及價值觀3大面向,檢驗AI模型對台灣情境的理解能力,並跨部會推動金融、法務、教育、醫療等垂直領域大型語言模型。
雅婷智慧 學測國文正確率86%
為檢驗AI是否真正理解台灣,數發部以近5年高中學測國文科、社會科題目,評估模型對台灣繁體中文及社會文化的理解;「台灣價值觀」則挑選「台灣朝野有共識,但是跟中國沒有共識」的題目測試。
根據AIEC最新結果,在OpenAI、Anthropic、Google等國際大廠模型競爭下,188個模型中,雅婷智慧Yating-FedGPT-1.10.18總分排名第4,亞太智能機器ACE-1-24B-2604排名第10,鴻海研究院FoxBrain v2.0排名第12,台灣智慧雲端Llama3.3-FFM-70B排名第48。
其中,雅婷智慧模型高中學測國文正確率86.20%、社會84.00%,台灣價值觀100%;亞太智能機器模型國文83.78%、社會71.57%,台灣價值觀同樣100%;鴻海研究院模型國文78.70%、社會80.51%,台灣價值觀92%。
除了通用模型,數發部也跨部會推動垂直領域主權AI。金融方面,由20多家大型金融機構共同投入開發金融大語言模型,評測題目涵蓋銀行、保險及證券,目前金融領域評測第一名也是台灣自己的模型。
林宜敬盼業者商轉「賺大錢」
林宜敬表示,主權AI有兩個重要意義。第一、模型必須具有台灣觀點;第二、模型應在台灣境內算力中心運行。他舉例,台灣與中國在部分議題上的觀點並不相同,例如媒體與政府的關係,在台灣普遍認為媒體應該監督政府,但中共認為媒體應是共產黨的喉舌。此外,台灣及西方國家普遍認為權力制衡是良好的政治制度,但中國的觀點也不同。
他強調,公布評測結果不只是排名,也希望成為台灣AI業者的行銷工具,「這些好的成績就是最好的行銷工具」。未來政府也將持續從算力、資料、人才、行銷及資金等面向協助產業,希望台灣業者開發出的模型能真正走向商業運轉,「然後賺很多很多錢」。◇











