中央廣播電臺(Rti)歷史網頁
close
臺灣之音立刻下載官方APP
開啟
:::

數發部建AI訓練語料庫 擬提1年期隱私強化計畫

  • 時間:2025-02-27 17:21
  • 新聞引據:採訪
  • 撰稿編輯:楊文君
數發部建AI訓練語料庫 擬提1年期隱私強化計畫
數發部常務次長葉寧表示,今年規劃先提出促進資料創新利用發展條例草案,明定政府資料開放可以不收費,明定公務人員資料開放免責條件,也會鼓勵公務機關開放資料給AI研究。(數發部官網)

數位發展部今天(27日)舉行建構台灣AI產業生態系記者會,宣布將從算力、資料、人才、行銷、資金5大政策工具著手,其中,在資料上將建立台灣主權AI訓練語料庫,並規劃提出1年期的隱私強化計畫,盼建立研究人員申請政府資料的整套機制。

數發部27日舉行建構台灣AI產業生態系記者會,由數發部長黃彥男親自主持。黃彥男表示,上任後以「數發3箭」強化數位韌性、發展數位經濟,規劃從算力、資料、人才、行銷、資金5大政策工具,建立完整的AI生態系。

在資料部分,數發部常務次長葉寧表示,AI訓練需要高品質資料,生成式AI需要文字等非結構化資料,中間可能牽涉著作權與個資。今年規劃先提出促進資料創新利用發展條例草案,明定政府資料開放可以不收費,明定公務人員資料開放免責條件,也會鼓勵公務機關開放資料給AI研究。他說:『(原音)個資的部分也會透過隱私強化技術,讓個資的爭議能夠減少,更重要的是除了政府的資料之外,我們也希望民間產業大家的資料也能夠在AI的、不管是訓練或是研發上面能夠共享,我們要創造一個良好的環境。』

葉寧指出,可信任人工智慧對話引擎(TAIDE)先前訓練語言資料需一一洽談,非常辛苦,目前推動建立台灣主權AI訓練語料庫,由高品質、有台灣觀點的語言資料組成語料庫,也希望是無償,降低模型訓練成本,國內外大型語言模型業者才會願意使用,語料庫希望先提供台灣語言模型訓練,未來才有能力提供給國外大型語言模型做訓練。

此外,數發部也規劃提出1年期的「資料匯流與隱私強化計畫」,正在爭取科發基金,數發部資料創新司副司長陳怡君說明,都有跟各部會說明,未來會視個案跟各部會討論資料欄位跟處理流程,依案例運用隱私強化技術來處理資料。數發部政務次長林宜敬補充,會請各部會整理目前手上擁有資料的目錄,如果有AI研究人員需要使用政府資料,可以通知數發部,數發部再代為向各部會提出需求,希望各部會提供資料時先做好去識別化,數發部再以隱私強化技術處理後提供給研究人員。

相關留言

本分類最新更多