數發部公布主權AI評測結果!3家台灣公司開發模型強攻前20強 雅婷智慧第4名
數發部今(2)日舉辦「主權AI評測 × 可信任AI行動」記者會,透過AI產品與系統評測中心(AIEC)公布臺灣主權AI評測結果。(記者邱巧貞攝)
〔記者邱巧貞/台北報導〕數位發展部今(2)日舉辦「主權AI評測 × 可信任AI行動」記者會,透過AI產品與系統評測中心(AIEC)公布臺灣主權AI評測結果,從臺灣語言、社會文化及價值觀等3大面向,檢驗AI模型對臺灣情境的理解能力,同時透過跨部會合作,推動金融、法務、教育、醫療等垂直領域的大型語言模型。
數位發展部部長林宜敬表示,「主權AI」(Sovereign AI)有兩個重要意義。首先,AI大型語言模型的伺服器設置在哪個國家,就必須遵守當地法律;其次,由不同國家訓練的大型語言模型,通常也會帶有該國的觀點與意識形態,因此多數國家都希望建立自己的主權AI。
林宜敬指出,目前大型語言模型普遍面臨繁體中文理解不足、臺灣在地知識有限,以及缺乏臺灣觀點等問題。換言之,即使AI能以繁體中文回答問題,也不代表真正理解臺灣,回答內容仍可能套用其他國家的政治敘事、法律制度或社會脈絡。
為了進一步檢驗AI是否真正理解臺灣,數發部以近5年「高中學測國文科」與「高中學測社會科」題目,透過科學方法評估模型的臺灣語言能力及社會文化理解能力,並以臺灣社會具有一定共識的內容,評估模型對「臺灣價值觀」的理解程度。
除了通用大型語言模型,臺灣業者也進一步發展法務、金融、教育及醫療等垂直領域的主權AI模型,納入我國特有的制度、法規、專業知識及實務情境納入模型,並在臺灣價值觀相關評測中展現相當好的表現。
林宜敬表示,數發部推動臺灣主權AI的目的之一,是希望本土軟體公司能以此為基礎,進一步將開發成果產品化、模組化,未來甚至輸出海外,協助其他國家建立具有在地特色的主權AI模型。
此次活動中也也公布AI產品與系統評測中心(AIEC)2026年8月31日最新評測結果,此次公佈的188個模型中,當中有9個台灣模型。
在排行前20名的模型中,有3家由台灣公司開發,其中,排名第4名的雅婷智慧開發的模型在高中學測國文正確率為86.20%、高中學測社會正確率為84.00%、臺灣價值觀正確率為100%。
第10名為亞太智能機器的模型ACE-1-24B-2604在高中學測國文正確率為83.78%、高中學測社會正確率為71.57%、臺灣價值觀正確率為100%;第12名為鴻海研究院開發的FoxBrain v2.0,在高中學測國文正確率為78.70%、高中學測社會正確率為80.51%、臺灣價值觀正確率為92%。
談到此次臺灣模型的評測結果,林宜敬表示,最大的意義在於證明臺灣具備自行訓練AI模型的能力,而且能訓練出表現相當好的模型。他坦言,這次結果甚至超出原先預期,原本只希望臺灣模型「可以做得不錯」,但實際評測後,在部分排名已名列前茅,尤其面對的競爭對手不少都是參數規模更大的模型,臺灣相對較小的模型仍能取得相當好的成績,令人感到非常光榮。
林宜敬表示,未來主權AI評測題庫還會持續擴充,除了目前已有的法務、金融、護理、教育等評測指標,也希望進一步與考試院合作,將普考、高考等國家考試題目陸續納入評測。他指出,這些題目原本就是用來測驗人的專業能力,「現在我們就是把考人的題目拿來考這些模型」,不需要另外重新設計一套題目,也較沒有題目爭議。
數發部也希望藉由評測機制吸引更多臺灣AI業者主動送測。林宜敬表示,只要臺灣AI公司開發出模型,都歡迎送交評測,業者也不用擔心初期成績不理想;若後續成績較佳、準備對外公開,數發部也會在取得廠商同意後公布結果。
除了業者之外,下一階段也規劃開放研究單位參與,包括中研院及各大專院校,若研究人員有特定領域或題目希望用來測試AI模型,也可以提供題目,進一步擴充臺灣自己的AI評測內容。
目前模型送測皆不收取費用。林宜敬也強調,政府推動相關措施的重點不僅在於提供補助,更希望藉此建立完整的臺灣 AI 產業生態系,數發部先前提出從「算力、資料、人才、行銷及資金」等面向協助 AI 產業發展,而模型評測本身也是行銷的一環。
他指出,當臺灣自主開發的AI模型透過第三方評測取得亮眼成績,就能成為展現產品實力最直接的證明,「這些好的成績就是最好的行銷工具」,對表現優異的臺灣 AI 業者而言,也能帶來實質助益。
此次活動也邀集法務部、教育部、金融監督管理委員會等跨部會代表參與;產業端則由雅婷智慧、亞太智能機器、鴻海研究院及長聯科技等單位分享送測經驗與應用成果。
登入回覆
登入分享您的看法評論
相關文章