
2025 年 12 月 29 日,開放文化基金會(OCF)與弗里德里希・諾曼自由基金會(FNF)共同舉辦線上研討會,發布《從開放資料到 AI-READY 國際實踐研究:賦能資料管理者,促進公民與政府的對話》Early Release 版本,並邀請台灣在地 AI 社群、產業實務者與開放資料社群一同對談,討論在生成式 AI 快速發展的今日,開放資料如何從「公開」進一步走向「可被機器理解、可被持續應用」。
完整報告、PDF 下載、GitHub Markdown 與 HackMD 協作版本,可參考 從開放資料到 AI-READY 國際實踐研究成果頁。
活動由開放文化基金會(OCF)專案經理劉俊彥(Ian Liu)主持,並邀請開放文化基金會(OCF)顧問、報告總主筆鄧東波(Dongpo Deng)導讀研究內容;弗里德里希・諾曼自由基金會(FNF)專案經理周雅薇(YaWei Chou)代表合作單位致詞。下半場則邀請 TwinkleAI 創辦人黃亮勳(Liang-Hsun Huang)、TwinkleAI 資深訓練師陳旻詣(Minyi Chen)、BookAI 創辦人謝昆霖(Kun-Lin Hsieh)共同分享台灣實務經驗。
此外,台灣開放資料與公民科技社群重要參與者 Ronny Wang 也以與會者身分參與本場活動。Ronny 同時是本報告中文在地訪談的受訪者之一,長期投入台灣開放資料實作與公民科技社群,在交流過程中也補充第一線資料處理與政府資料品質改善的實務觀察。
開放資料的新課題:不只是公開,而是能否被 AI 讀懂
研討會一開始,周雅薇代表 FNF 致詞。她表示,FNF 長期關注自由、民主、人權與數位創新之間的關係。從過去與 OCF 合作推動開源文化,到這次共同支持「從開放資料到 AI-READY 國際實踐研究」,核心關懷都在於:如何讓數位創新不只服務技術社群,也能強化民主治理、公民監督與公共利益。
劉俊彥在開場中說明,近年隨著「主權 AI」與政府資料集相關討論升溫,許多第一線資料管理者與公務人員開始面臨新的疑問:什麼樣的資料才適合 AI 使用?AI-Ready Data 是否代表新的工作負擔?既有開放資料工作流程是否需要全部重來?
《從開放資料到 AI-READY 國際實踐研究:賦能資料管理者,促進公民與政府的對話》正是從這些現場焦慮出發。報告希望提供公務機關、資料管理者與公民科技社群一份可參考的國際案例整理,協助大家理解世界各地如何處理資料格式、授權、隱私、文化語料與公私協力等挑戰。
簡單來說,AI-READY 開放資料並不是要推翻既有開放資料工作,而是提醒我們:如果資料仍停留在 PDF、掃描圖檔或缺乏結構的文件形式,即使形式上已經公開,對 AI 系統與後續應用來說,仍然可能是「看得到,但讀不懂」。
五個國際案例:從法規、技術到公私協力的不同路徑
報告採用 TOC 框架,也就是從 Technology(技術)、Organization(組織)與 Environment(環境)三個面向分析國際案例,並整理西班牙、德國、柬埔寨、法國等地的實踐經驗。
在研究導讀中,劉俊彥與鄧東波提到,AI-Ready Data 可以被理解為「主權 AI 的燃料」。若一個社會希望 AI 能理解在地語言、文化、制度與生活脈絡,就不能只仰賴外部大型模型既有的知識結構,而需要思考本地資料如何被整理、授權、結構化與持續維護。
報告中整理的案例包括:西班牙由資料主管機關透過「診斷、缺口、行動」的方式陪伴政府機關釋出資料,並在歐盟法規基礎下處理適法性與高價值資料開放問題;German Commons 則示範如何以開放授權釋出資料集,並同步開源資料清洗、去識別化與處理流程,讓資料不只是結果可用,連方法也能被檢視與再利用。
Open Development Cambodia 展現民間組織如何在制度尚未完備的環境中,先行整理資料、累積可信度,再逐步建立與政府合作的基礎。德國柏林的 Parla 案例,則使用議會公開資料建立 AI 問答系統,協助公務員回應民眾建議與查找議事資料。法國 CroissantLLM 則提醒大家,語言模型不只是技術問題,也是文化比例與語料主體性的問題。若模型訓練資料過度偏向單一語言或文化,它回應世界的方式,也會逐漸向那個資料來源傾斜。
鄧東波在導讀中強調,這份報告不是為了增加公務人員負擔,而是希望幫助大家在既有開放資料工作中,看見一些可以調整的方向。例如優先提供機器可讀格式、保留語意結構、補足欄位說明與時間資訊,並在資料釋出過程中思考授權、隱私與後續應用情境。
這也讓 AI-Ready 的討論不只停留在技術規格,而是回到資料治理的基本問題:資料要如何被描述、如何被維護、如何被負責任地再利用,以及如何在不增加第一線人員不必要負擔的前提下,逐步提升公共資料的可用性。
台灣案例一:TwinkleAI 從繁體中文模型看見資料荒漠
第一場台灣案例分享由 TwinkleAI 創辦人黃亮勳主講。他指出,TwinkleAI 是由民間社群組成,成立契機來自對繁體中文模型與台灣在地語料不足的憂慮。
黃亮勳提到,在模型訓練中,許多人會想到透過「蒸餾」國外模型來降低成本,但蒸餾不只是技術捷徑,也會把原模型的價值觀、用語習慣與知識偏誤一併帶入。若蒸餾西方模型,模型可能不夠理解台灣生活;若蒸餾中國模型,則可能帶入政治濾鏡、簡體語彙與不符合台灣民主社會的回答框架。
因此,TwinkleAI 嘗試自行建置更具台灣文化脈絡的資料集,例如以國家文化記憶庫 2.0 為基礎整理 FormosaVision 視覺資料集,並透過清洗、標註與 QA 產製,支援影像對話模型訓練。
黃亮勳也從國際案例中整理三個對台灣有啟發的方向:文化上可參考法國對在地語料比例的堅持;技術上可參考德國對結構化資料與原始格式的重視;合作上則可參考柬埔寨由民間先行示範、逐步建立政府信任的模式。
換句話說,台灣若要發展真正理解自身社會的 AI,就需要讓資料不只是「有公開」,而是能被整理成模型可以理解、可以追溯、可以負責任使用的形式。這也是繁體中文模型與在地 AI 發展最難、卻也最根本的基礎工作。
台灣案例二:BookAI 從 RAG 出發,先解決公務員真正的痛點
BookAI 創辦人謝昆霖則從另一條路徑切入。他坦言,自己早期也曾嘗試推動開放語料庫,但很快發現台灣面臨幾個現實困難:民眾主動貢獻資料比例不高、出版與版權資料取得成本高,若直接朝大型訓練資料集前進,推動門檻非常高。
因此 BookAI 轉向 RAG(Retrieval-Augmented Generation,檢索增強生成)技術,並將重點放在「資料如何為組織產生立即效益」。例如協助公部門導入會議紀錄、逐字稿整理、重點摘要與待辦事項產出等工具,讓公務員先從日常工作中感受到 AI 的價值。
謝昆霖形容,這是一種「特洛伊木馬」式的推動策略:與其一開始就談抽象的公共價值,不如先幫公務員解決無止境的會議、繁重的紀錄與質詢準備。當內部工作流程開始產生結構化資料,後續才有更多機會討論哪些資料可以公開、如何公開、如何讓資料進一步服務公共利益。
這個觀點也提醒開放資料社群:推動 AI-Ready Data 不一定只能從大型政策或資料平台開始,也可以從一個個能降低工作負擔的小工具開始。資料治理有時不是從宏大的口號開始,而是從「讓人比較準時下班」開始。這句話聽起來務實得有點可愛,但也非常接近現場。
對談焦點:法規、主權 AI 與資料品質
在後半場 Panel Discussion 中,與談人進一步討論台灣在法規、公共價值與資料品質上的挑戰。
針對現有法規限制,陳旻詣提到,許多基層公務員其實不是不願意釋出資料,而是擔心一旦資料被使用、爬取或再利用,自己是否會承擔法律風險。若缺乏清楚的免責與適法性規範,第一線人員自然傾向保守。
謝昆霖則認為,RAG 之所以適合公部門,是因為它讓資料提供者保有高度控制權。資料可以被索引、檢索,也可以在必要時下架或抽換,這比直接把資料丟進模型訓練更符合公部門對風險控管的需求。
談到主權 AI,陳旻詣指出,主權 AI 的核心不只是模型強不強,而是模型「腦袋裡裝了什麼」。若模型主要吸收中國或西方語料,就可能無法準確理解台灣法律、制度、語言習慣與社會脈絡。謝昆霖則提出「主權知識地圖」的想像:原始資料權利仍歸各單位所有,但可以建立可被檢索、可控制的索引層,讓台灣的知識地景逐步浮現。
至於資料品質參差不齊的問題,與談人也提出務實看法。陳旻詣認為,資料清洗應建立自動化流水線,品質不佳者可先過濾,不必一開始就試圖人工修完所有資料。
活動交流中,Ronny Wang 也以與會者身分補充,許多資料處理會有明確目的,例如預算書格式若大致一致,就能透過程式批次處理;少數例外再人工修正,或整理成具體問題回報政府改善。這段補充也呼應了台灣開放資料社群長期以來的實作經驗:資料品質改善不必總是從龐大工程開始,而可以從明確需求、可重複格式與具體回饋機制逐步推進。
這些討論共同指向一個結論:AI-Ready Data 並不是完美資料的幻想,而是一套逐步改善資料可用性、結構性與可治理性的過程。
從在地訪談到國際案例:讓社群經驗回到政策討論
值得一提的是,本場活動不只整理國際案例,也延續了報告在台灣本地訪談中累積的社群觀察。包含 Ronny Wang 在內的開放資料與公民科技實作者,提供了從資料清理、格式轉換到政府資料品質回饋的第一線經驗,使 AI-READY 開放資料的討論不只停留在政策願景,也能回到台灣長年開放資料實作的現場。
這樣的在地經驗,對台灣討論 AI-Ready Data 特別重要。因為資料是否能被 AI 使用,往往不是單純的技術問題,而是牽涉到資料產製流程、機關工作習慣、格式選擇、授權判斷、社群協作與長期維護。當國際案例與台灣實務經驗彼此對照時,也更能看見台灣下一階段推動開放資料與主權 AI 所需要的基礎建設。
從倡議到賦能:AI-READY 開放資料的下一步
活動最後,OCF 總結指出,結構化資料仍是 AI-READY 開放資料的核心。台灣未來可以採取雙軌策略:一方面由社群持續倡議結構化資料、開源工具與 Public Code;另一方面,產業與技術社群也可透過 RAG、會議摘要、OCR、資料整理 Agent 等工具,協助公務機關先解決內部效率問題。
當資料管理者不再只把開放資料視為額外負擔,而能看見它如何減少重工、改善行政流程、回應民眾需求,開放資料才有機會從「被要求公開」走向「主動設計成可用的公共基礎建設」。
這場研討會也提醒我們,AI 時代的治理問題不會只發生在模型端。真正的關鍵,常常在模型之前:資料是否存在?格式是否可讀?授權是否清楚?文化是否被保留?基層人員是否有工具與制度支持?
AI-READY 開放資料不是一句新口號,而是開放資料在下一個階段需要補上的基礎工程。它關乎政府治理效率,也關乎文化記憶、公民參與與台灣如何在全球 AI 浪潮中保有自己的聲音。
報告目前仍處於 Early Release 階段,OCF 後續將彙整 Webinar 與社群回饋,持續修訂文件版本;最新整理請見 從開放資料到 AI-READY 國際實踐研究成果頁,讓台灣的經驗與觀察也能回到國際開放資料與 AI 治理社群之中。