BTCC / BTCC Square / ltnTW /
立委質疑國際AI模型偏愛中國語料?科技巨頭曝關鍵:著作權因素

立委質疑國際AI模型偏愛中國語料?科技巨頭曝關鍵:著作權因素

Author:
ltnTW
Published:
2026-03-18 12:16:15
7
1

數位發展部於2025年12月發布「台灣主權AI訓練語料庫」,廣納高品質正體中文語料,讓AI模型在訓練過程中,更貼近台灣的語言使用。(本報資料照)數位發展部於2025年12月發布「台灣主權AI訓練語料庫」,廣納高品質正體中文語料,讓AI模型在訓練過程中,更貼近台灣的語言使用。(本報資料照)

〔記者邱巧貞/台北報導〕為強化人工智慧發展的核心基礎,數位發展部於2025年12月24日正式發布「台灣主權AI訓練語料庫」,廣納高品質正體中文語料,讓AI模型在訓練過程中,更貼近台灣的語言使用、文化脈絡與生活情境。目前整體訓練資料量已累計突破11億個tokens(詞元)。

數發部長林宜敬今(18)日列席立法院交通委員會進行專題報告時,針對主權AI發展現況接受質詢。有立委指出,我國現階段大型語言模型所使用的訓練資料量約為11億tokens,與國際動輒數百億甚至更高規模相比仍有明顯落差;此外,資料來源多集中於政府機關,且多為重複性高的行政資料,對模型能力提升有限,恐影響台灣在AI競爭中的發展。

對此,林宜敬回應,國際主流大型語言模型確實仰賴極為龐大的訓練資料,但其中高品質的繁體中文語料相對稀缺,且目前大量語料來自中國的簡體中文資料,容易帶入特定觀點。因此,台灣現階段的發展重點,是補足繁體中文語料,讓模型在語言與價值觀上取得平衡。

林宜敬表示,未來將持續擴大資料來源,目前優先納入政府開放資料及具授權的研究資料如中研院,並規劃透過制度設計,引導民間提供資料,逐步擴充語料庫的規模與品質。

他也提到,過去與Google等國際大型模型業者交流時,曾詢問對方為何不用台灣的繁體中文語料?對方提出兩個關鍵原因:第一是中國的簡體中文語料量本來就較大;第二是中國對著作權相對沒有那麼重視,使用相關語料進行訓練時風險較低,也較不需擔心被告或產生糾紛。相較之下,台灣在著作權保護較為嚴謹的情況下,資料取得成本與授權程序也相對複雜。

在制度面上,林宜敬指出,AI發展對既有著作權制度帶來衝擊,已是全球共同面臨的課題,相關規範的釐清通常需時3至5年,仰賴產業與法律體系逐步調整。此外,著作權相關制度調整由智慧財產局主責,數發部將與其密切合作。在法制尚未明確前,政府將優先處理爭議較低的資料來源,例如政府持有著作權的資料,作為現階段推動主權AI的基礎。

|Square

下載BTCC APP,您的加密之旅從這啟程

立即行動 掃描 加入我們的 100M+ 用戶行列

本站轉載文章均源自公開網絡平台,僅為傳遞行業信息之目的,不代表BTCC任何官方立場。原創權益均歸屬原作者所有。如發現內容存在版權爭議或侵權嫌疑,請透過[email protected]與我們聯絡,我們將依法及時處理。BTCC不對轉載信息的準確性、時效性或完整性提供任何明示或暗示的保證,亦不承擔因依賴這些信息所產生的任何直接或間接責任。所有內容僅供行業研究參考,不構成任何投資、法律或商業決策建議,BTCC不對任何基於本文內容採取的行為承擔法律責任。