數位發展部推動民間語料徵集 臺灣主權AI訓練語料庫規模成長逾3倍
Quick Look
數位發展部於15日啟動民間語料徵集計畫,推動臺灣主權AI訓練語料庫建設。自去年12月起,語料集數量從約2,000個增至逾5,000個,Token數從6億增至21億,規模成長逾3倍。民間語料徵集採自願參與、明確授權、可退出原則,將納入出版社及創作者的高品質原創內容,供模型訓練、微調及知識應用使用,內容不會被平台審查。
AI-generated summary
Why It Matters
生成式AI快速發展,模型是否真正理解台灣文化與觀點成為關注焦點,訓練語料的質量與來源被視為關鍵因素。數位發展部去年12月推動『臺灣主權AI訓練語料庫』,先以政府資料為基礎,如今進入民間語料擴充階段。
數位發展部今(15)日舉行「臺灣主權AI訓練語料庫啟動民間語料徵集」記者會,正式推動民間語料徵集計畫。(記者邱巧貞攝)
〔記者邱巧貞/台北報導〕生成式AI快速發展,模型是否真正理解台灣文化與觀點,關鍵之一就在訓練語料。數位發展部資料創新司司長王復中今(15)表示,「臺灣主權AI訓練語料庫」自去年12月推動至今,資料集數量已從約2,000個增加至逾5,000個,Token數更從6億增至21億,語料規模成長逾3倍;隨著政府資料累積至一定程度,下一階段將進一步擴大民間語料徵集,納入更多出版社及創作者的高品質原創內容。
王復中表示,隨著AI發展愈來愈快、功能日益強大,外界也開始關注AI究竟使用哪些資料進行學習與訓練,以及AI對不同語言、文化的理解程度,因此各國都相當重視自主、安全、可靠及具韌性的AI能力。
請繼續往下閱讀...
數發部建置「臺灣主權AI訓練語料庫」,目的之一就是希望AI在面對一本著作時,不只是透過外界評論或幾句摘要來理解內容,而是能更完整認識作品所要表達的核心思想,進一步理解台灣文化與觀點。
王復中指出,臺灣主權AI訓練語料庫自去年12月推動至今,採取「先政府、再民間;先中央、再地方」策略,目前資料集數量已從約2,000個增加至5,000個,Token數則從6億增加至21億,整體語料規模成長逾3倍。
目前語料內容涵蓋民俗、語言、生物、旅遊、出版品、法律、藝術、文化、經濟、地理、交通、醫療、歷史等不同領域,也納入本土語言。數發部希望透過持續擴充語料,提供生成式AI業者及技術團隊發展所需應用,讓AI更貼近台灣文化及不同領域的內容。
隨著政府資料累積至一定規模,數發部也將語料來源進一步從政府擴大至民間。王復中表示,民間擁有相當豐富的資源,尤其出版社所擁有的書籍,在內容深度及品質上具有價值,因此目前針對電子書、著作、書籍內容及書籍簡介等不同形式進行徵集,希望納入更多優質且具原創觀點的作品。
民間語料徵集機制採取「自願參與、明確授權、可退出」原則,在資料提供者自願的前提下取得明確授權,相關高品質語料未來可提供政府機關、民間團體及學研單位等資料應用端使用,包括模型訓練、微調、檢索增強生成(RAG)及知識萃取等,並可進一步應用於教育學習、行政輔助、智慧客服及專業諮詢。
至於外界也關注提供的語料是否會經過事先的內容審查,王復中說明,民間徵集主要由出版社負責篩選及品質把關,平台本身則針對內容結構、資料格式是否正確,以及資料能否順利供AI訓練等項目進行檢核,不會對內容本身進行干預。
在參與方式上,王復中表示,網站已設計三階段流程,資料提供者登入並申請帳號後,即可進行資料上架;完成後,平台將針對資料內容、格式及相關資訊進行檢核,整體流程則盡量簡化(https://taic.moda.gov.tw/content/application-guidelines?utm_source=chatgpt.com)。
一手掌握經濟脈動 點我訂閱自由財經Youtube頻道
What to Watch
AI outlook — possibilities, not facts
數位發展部將在未來數月內公布首批參與民間語料徵集的出版社及創作者名單
Likely · Within months
民間語料納入後,臺灣主權AI訓練語料庫的Token數將在一年內突破50億
Possible · Within months
Open Questions
- 民間語料徵集將持續多久?
- 將有多少出版社及創作者參與此計畫?
- 語料使用將如何監管以避免濫用?
- 是否會有激勵機制鼓勵民間主動提供高品質內容?







