摘要:摘要:當前數字政府建設已進入深水區,政務大數據平臺作為數據底座支撐各類政務信息化應用,其隱私數據的安全性和合規性一直被業界廣泛關注。聯邦學習是一類解決數據孤島的重要方法
摘要:當前數字政府建設已進入深水區,政務大數據平臺作為數據底座支撐各類政務信息化應用,其隱私數據的安全性和合規性一直被業界廣泛關注。聯邦學習是一類解決數據孤島的重要方法,基于聯邦學習的政務一體化大數據平臺應用具有較高的研究價值。首先,介紹政務大數據平臺及聯邦學習應用現狀;然后,分析政務大數據平臺面臨的隱私數據的采集、分類分級、共享三大管理挑戰;接著,闡述基于聯邦學習的推薦算法和隱私集合求交技術的解決方法;最后,對政務大數據平臺隱私數據的未來應用進行了總結和展望。
關鍵詞:政務大數據;聯邦學習;推薦算法;隱私集合求交
論文《基于聯邦學習的政務大數據平臺應用研究》發表在《大數據》,版權歸《大數據》所有。本文來自網絡平臺,僅供參考。

0 引言
隨著人工智能、隱私計算、大數據技術的融合發展,全國各地掀起了數字政府建設的高潮,政務大數據平臺應運而生。政務大數據平臺是一個集數據匯聚、交換、治理、分析、應用、安全為一體的統一政務數據共享開放平臺?!度珖惑w化政務大數據體系建設指南》顯示,截至2022年9月,我國已有26個省級政務數據平臺、257個市級政務數據平臺、355個縣級政務數據平臺,多地已初步建成省市縣一體化的政務大數據平臺,這些平臺在推進數字政府建設中發揮著重要作用。
| 序號 | 類型 | 平臺上線量 | 平臺上線率 |
| 1 | 省級政務大數據平臺 | 26 | 76.47% |
| 2 | 市級政務大數據平臺 | 257 | 77.18% |
| 3 | 縣級政務大數據平臺 | 355 | 12.49% |
隨著政務大數據平臺的不斷落地,大量的數據匯聚到政務大數據平臺。平衡數據共享與隱私保護是學術界普遍關注的課題。在技術層面,如果沒有強有力的安全管理措施,這些數據一旦泄露,將會是一個巨大災難。在法律層面,我國越來越重視數據使用的合規性,《中華人民共和國數據安全法》和《中華人民共和國個人信息保護法》相繼出臺,進一步增加了政府機構之間、政企之間采集和共享隱私數據的難度。由上可知,推進一體化的政務大數據平臺依然面臨“數據孤島”問題。
本文從隱私保護技術的角度對當前政務大數據平臺中隱私數據的數據采集、分類分級、數據共享等進行了分析,提出以下研究目標:
最小必要:解決政府部門之間數據共享過程中出現的過度歸集數據的問題,防止出現超范圍歸集隱私數據、超權限使用隱私數據、違法違規交易隱私數據等行為。
科學分類:基于政務大數據平臺數據量大、隱私性強、結構復雜的特點,解決難以對海量多源異構的原始數據進行分類分級管理的問題,保持數據分類分級的一致性以及防護策略的有效性。
高質共享:兩個垂直機構或水平機構對雙方的隱私數據進行融合分析,從而得出決策數據,這種情況較為常見。在保證隱私數據安全的前提下,實現隱私集合求交,獲得高質量交集數據。此外,在“數據孤島”仍然存在的背景下,實現數源部門數據快速有效的供需匹配。
1 研究現狀
1.1 政務大數據相關研究
近年來,國家高度重視一體化政務大數據體系建設,先后出臺了《促進大數據發展行動綱要》《關于推進公共信息資源開放的若干意見》等系列文件,明確提出數據是國家基礎性戰略資源,要求推動建設全國一體化的國家大數據中心,加快新型基礎設施建設布局,加速推進政務數據開放和應用。從2018年起,全國各地相繼成立大數據管理機構,建立政務大數據共享平臺,并制定政務數據歸集規范,在一定程度上實現了政務數據統籌管理目標,為政務數據共享提供了統一平臺。然而,隨著我國政府數據的不斷開放,數據開放與隱私保護之間的矛盾日益凸顯,我國政府數據開放平臺在隱私保護方面的整體表現不佳。由政府數據開放引發的隱私泄露事件不僅侵犯了公民的權益,給政府部門造成經濟與聲譽上的損失,還嚴重制約了政府數據開放的發展。
1.2 聯邦學習相關研究
聯邦學習是隱私計算的一種主流技術。聯邦學習的概念最早是在2016年由谷歌提出的,它是一種滿足隱私保護和數據安全的分布式機器學習框架。聯邦學習僅需在數據分散存儲的節點上訓練模型,由于服務器無法獲取原始數據,個人數據隱私得到了有效的保護,有效解決了“數據孤島”和數據隱私保護的問題。另外,傳統的機器學習模型不能直接處理異構數據,利用聯邦學習技術,無須處理異構數據即可建立全局數據上的機器學習模型,既保護了數據隱私,又解決了數據異構問題。在數據隱私問題備受關注的今天,聯邦學習在避免數據泄露、中心點數據受到攻擊等方面具備顯著優勢。
在實際應用中,按照“孤島數據”的分布特點,聯邦學習可分為橫向聯邦學習、縱向聯邦學習、聯邦遷移學習3類。此外,聯邦學習架構也可分為需要協調方的客戶-服務器架構和不需要協調方的對等網絡架構,其中對等網絡架構可以進一步確保數據安全性,因為各方無須借助第三方便可通信。
聯邦學習在處理數據共享開放和數據隱私保護方面表現突出。到目前為止,聯邦學習已在金融風控、廣告營銷等方面落地。例如,淘寶、抖音、美團等電商平臺推送不同的產品宣傳信息,其背后的推薦模型需要大量的用戶特征數據。每一家電商企業只擁有用戶的一部分特征數據,如果可以接入其他與用戶有關聯性的數據,補充特征數據,那么廣告推薦的效果將大幅提升。然而,這些方法僅限于在線購物、視頻瀏覽等數據維度小的場景,無法處理城市交通綜合調度、教育醫療資源需求分配等基于政務大數據平臺的大型群體智能應用。
1.3 聯邦學習在政務大數據領域相關研究
聯邦學習技術快速發展,正在助力政府打破各領域的數據壁壘,已在多個真實場景中發揮了重要作用。在智慧警務領域,有研究提出通過聯邦學習技術實現不同地區相同警種間的數據協作,如精準步態識別、有遮擋的人物識別、行人重識別等任務。在智慧醫療領域,聯邦學習技術解決了電子健康記錄管理、醫療影像分析等隱私保護問題,有研究介紹了基于聯邦學習的全國首個跨多個省級區域的數字化聯防聯控平臺,解決了醫療大數據在多個地區之間的共享和隱私保護問題。在智慧交通領域,有研究提出一種基于聯邦學習的交通資源調度方法,該方法顯著提升了群體的出行效率。在智慧電力領域,有研究提出利用聯邦學習預測充電站的能源需求,根據預測結果決策是否在充電站預先存儲能源以及存儲多少能源。
以上研究對象均為某一領域的隱私數據分析,但跨領域的多維度數據應用并未取得較大突破,無法利用本領域的數據分析為其他領域的數據預測提供幫助,如智慧醫療領域的聯邦學習方法無法對市民的購物等生活數據進行關聯分析。然而,國家一體化政務大數據中包含多種跨領域數據,能夠挖掘更多的數據價值。本文的研究重點是在國家一體化政務大數據平臺的基礎上,實現基于聯邦學習技術的跨層級、跨領域、跨地區的海量多維隱私數據的融合應用。
2 政務大數據平臺隱私數據管理挑戰
根據《全國一體化政務大數據體系建設指南》,到2023年年底,全國一體化政務大數據體系初步形成,全國一體化指的是實現國家、省、市、縣四級政務大數據平臺上下貫通、協同作戰。在這個框架體系下,政務大數據平臺具有數據鏈條長、數據維度多、數據價值高的特點,這增加了數據開放共享的安全風險。同時,有些部門以數據安全要求高、僅供特定部門使用為由,在數據供需雙方自建共享渠道。針對數據安全的不同生命周期,有研究提出了數據安全能力成熟度模型,根據數據的生命周期,數據安全可分為采集安全、傳輸安全、存儲安全、處理安全、交換安全和銷毀安全。在基于一體化政務大數據平臺的數據全生命周期安全管理中,隱私數據的數據采集、分類分級、數據共享是數據安全領域的研究重點。
2.1 隱私數據安全采集難
數據采集包括外部數據和內部數據的采集,外部數據是指除了組織內部之外的所有數據提供方,采集過程需要保證數據的傳輸和存儲安全,并提供全過程審計的能力。根據采集的數據類型和數據源不同,數據采集可以選擇不同的技術工具。目前政務數據主要有數據庫數據和系統日志數據兩種來源。基于數據庫采集源數據,主要采用直接數據源同步、生成數據文件同步、數據庫日志同步3種方式。其中,直接數據源同步是指直接連接業務數據庫;生成數據文件同步是指從數據源系統現場生成數據文件,再通過文件系統同步到目標數據庫中;數據庫日志同步是指基于源數據庫的日志文件同步數據。以上技術是非涉密涉敏數據采集的常用手段,在公檢法、交通等領域不可行,急需從聯邦學習等隱私計算相關技術方法加以突破。
數據適用性差:目前,部分地區政務大數據平臺主要涉及垂直業務部門和本地同級相關部門的數據采集工作,一般采用必要性和最小化原則進行采集,防止出現超范圍采集用戶數據、超權限使用用戶數據、違法違規交易用戶數據及差異化用戶決策等違法行為。
數據一致性差:根據國家一體化政務大數據建設要求,各地區依托政務數據平臺統籌推進本地政務數據的歸集工作,實現省市縣三級數據匯聚整合,行業主管部門做好本行業政務數據的歸集工作。因數據維度、數據質量等差距,多數據源回歸過程普遍存在數據不一致的問題。
數據鮮活性低:在國家一體化政務大數據平臺建設的背景下,如何通過數據采集來持續提升數據鮮活度,是一項有較大挑戰性的工作。例如,由于人口庫數據存在流動人口動態變化及多源管理的問題,維護人口庫數據需要從橫向和縱向全維度實現反向數據反饋,實現數據“反哺”,以此實現平臺數據鮮活性。
2.2 隱私數據分類分級難
為了平衡數據使用的便捷性和數據保護的安全性,促進數據安全能力建設降本增效,政務大數據平臺通常會對政務數據資產進行分類分級,以便對數據采用精細化的安全管控手段,避免“一刀切”現象。同時,數據分類分級有助于發現冗余、無關、過時和被遺忘的數據,以便將其從系統中刪除。
安全合規難:《數據安全法》第二十一條明確規定,國家建立數據分類分級保護制度,對數據實行分類分級保護。這意味著在法律層面,數據分類分級工作已成為政府、企事業單位等開展數據處理活動必須遵守的規定。隨著《數據安全法》的落地,數據分類分級也將成為數據安全合規工作的首要任務。然而,目前相當一部分政務大數據平臺因起步建設較早、安全工作重視度不夠等原因,并沒有嚴格落實數據分類分級,隱私數據安全形勢仍然嚴峻。
規則趨同難:國家統籌建國家、省、市、縣四級一體化政務大數據平臺數據量大、結構復雜,難以對海量多源異構的原始數據進行分類分級管理,如何保持數據分類分級的一致性,是一個技術難題。
隱私保護難:目前數據分類分級工作普遍采用機器學習建模進行初篩,再由人工審核的方式。針對隱私數據的分類分級,人工參與程度較深,易造成敏感信息泄露、人力成本高、主觀因素大等問題。
2.3 隱私數據充分共享難
為了充分挖掘數據價值,各級政務大數據管理機構會跨系統、跨區域、跨層級進行數據共享,然而數據在共享的過程中可能存在隱私泄露的風險。
精準度量難:政務公共數據涉及社會經濟發展中各領域的關鍵數據,在數據開放共享中普遍存在度量難題,一是數源單位沒有采用有效的數據分類分級管理辦法,存在過度共享導致的隱私數據泄露的問題;二是數源單位開放的數據存在低質或無效問題,難以量化數據合格率。
安全管控難:政務公共數據在開放過程中普遍存在涉及鏈條長、機構多等問題,一是在共享取數過程中,數據存在被篡改或偽造的風險;二是開發過程存在代碼不規范等問題,容易造成數據泄露;三是數據二次或多次共享導致數據溯源難。
3 基于聯邦學習的政務大數據應用分析
基于國家一體化的政務大數據具備大規模特性,在進行多領域數據關聯分析時,常采用隱私集合求交技術實現隱私數據保護。同時,政務大數據應用場景具備數據量大、用戶多等特性,缺少個性化信息過濾服務。針對以上問題,本文提出了一種利用聯邦推薦系統實時精準定位所需數據的方法。
3.1 隱私集合求交技術及應用
隱私集合求交(private set intersection, PSI)也被稱為安全求交,它是指多個數源單位分別擁有一個集合,它們想求多個集合的交集,同時保證最終只會泄露交集的結果,而不會泄露各方非交集的集合元素。該技術被認為是跨機構數據合作的前置步驟,實現了跨源數據間的安全融合。
隱私集合求交技術應用發展迅速,可以分為基于密碼學和基于硬件兩類,二者各有優勢。基于密碼學的技術公開透明,各個參與方是對等的,安全性也有保障,但是在參考方很多的時候,需要兩兩交互,通信量大。而基于硬件的方法在參與方較多時,所需的通信輪數少。本文只討論基于密碼學的方法,這類方法包括基于公鑰體系(如同態加密)的方法、基于電路的方法、基于不經意傳輸的方法。
在保護數據隱私的前提下解決行業中的數據孤島問題,是聯邦學習價值的核心。目前聯邦學習在各種隱私集合求交場景應用廣泛,如金融、醫療、交通、旅游等。
以一個區縣級旅游目的地的旅游數據共享應用為例,某地旅游主管部門擬開展下一年高鐵游精準營銷計劃,需要建立一個基于游客的高鐵旅客數據、景區入園數據、公安住宿數據的游客畫像。經調研,當地只掌握游客景區入園數據,而游客在酒店的住宿數據由市級公安部門住宿登記平臺管理,通過高鐵出行的游客數據由國家鐵路部門管理,并且這些數據分別由區縣級、市級、國家部級3個不同級別的政務大數據平臺管理。在國家一體化政務大數據平臺框架下采用聯邦學習方案,各數據持有方不需要提交數據,通過隱私集合求交的方式,保證了本地數據的安全,降低了隱私泄露的風險,實現“數據不出域,模型出域”的目標。
3.2 推薦系統技術及應用
隨著互聯網、大數據技術的迅猛發展,海量信息常常會讓用戶迷失,無法找到想要的內容。為了解決這類信息過載問題,推薦系統(recommendation system, RS)應運而生。推薦系統利用用戶的各種知識和數據生成個性化推薦結果,其構建依賴于大量的用戶信息、物品信息以及二者之間的交互信息。目前,推薦模型主要分為協同過濾、基于內容、基于模型、混合推薦這4類。傳統的推薦系統以集中式訓練為主,即推薦系統的構建者先收集推薦系統所需要的數據(如評分、評論和點擊等)至一個集中區域,進而在該區集中式訓練推薦模型,達不到保護用戶數據隱私的目的。
基于聯邦學習的推薦系統是為保護用戶隱私而采用去中心化的推薦系統訓練方法,在該方法中,隱私數據依舊由用戶保存在各自的終端,不需要上傳至集中式的服務器,同時,模型的訓練過程是去中心化的,避免了隱私信息的泄露風險。
聯邦推薦系統常用的算法有隱私保護矩陣分解和隱私保護因子分解機兩種。根據所面對的場景,推薦系統可分為跨設備和跨機構兩類隱私保護推薦系統。跨設備的隱私保護推薦系統是指在不收集用戶原始隱私信息的前提下構建推薦系統;跨機構的隱私保護推薦系統是指多個機構已經存儲了用戶的隱私信息,在保護各自數據隱私的前提下,協同構建推薦系統的方法。由于政府的相關職能部門有必要存儲用戶的一些隱私信息,并且必須保護該信息的安全性,跨機構的隱私保護推薦系統更加符合政務平臺的需求。因此,本文以跨機構的隱私保護推薦系統為基礎,進行方法的探討。
以推薦系統在政務服務的相關事項應用為例,為了提高用戶辦事效率與政府服務水平,通過聯邦學習獲取用戶在社會保障主題庫、醫療健康主題庫、人口基礎庫等的多維用戶標簽信息,構建政務服務用戶畫像,在推薦計算中結合用戶相關屬性進行精準推薦。
政務服務聯邦推薦過程大致包括以下步驟:
階段一:通過聯邦學習生成用戶畫像標簽信息
1. 初始化政務大數據平臺(作為聚合服務器)的模型參數,并將模型訓練任務發布到社會保障、醫療健康等涉及政務服務的所有專題數據倉和基礎庫相關的隱私計算節點(也稱參與方)等。
2. 各隱私節點通過本地數據倉或基礎庫數據進行本地模型訓練。
3. 本地模型在訓練后,通過安全協議將參數更新傳輸至聚合服務器,由聚合服務器執行模型聚合計算,迭代生成新的全局模型參數。
4. 新的全局模型下發至各隱私計算節點。
持續進行上述步驟直至全局模型收斂,最終的訓練結果就是全維度用戶畫像標簽信息,為下一階段在推薦計算中結合用戶多維度屬性進行精準推薦奠定基礎。
階段二:通過本地模型進行推理預測
1. 根據用戶提交的登記身份信息和政務服務事項,分別獲取用戶畫像標簽信息和用戶辦件信息。辦件信息決定相關的業務數據倉或基礎庫。
2. 從用戶相似度計算和政務服務事項相似度計算兩方面著手,選擇一種推薦模型,構建政務服務辦理推薦特征矩陣,計算特征值。
3. 根據政務服務辦理特征值實現精準推薦。
3.3 隱私集合求交及聯邦推薦系統融合應用探索
本文以聯邦推薦系統為技術支撐,對政務大數據平臺中的數據采集、分類分級、數據共享3項關鍵工作進行下一步探索:
數據采集階段:在一體化政務大數據平臺環境下,數據需求單位(如市人社局)向數源單位(如省人社廳)申請人口庫數據回流,雙方通過聯邦學習隱私集合求交技術獲取相同的數據,為避免數據冗余,該部分數據屏蔽,只取帶有該市標簽的非已存數據回流。
分類分級階段:通過聯邦學習動態建立國家、省、市、區(縣)四級統一規范的分類分級標準和模型,具體做法是服務器節點設置在國家級,省、市、區(縣)作為參與方,維護一體化分類分級指標。某參與方在確定需回流數據后,對回流數據打上數源單位分類分級標簽。數據申請方收到帶標簽的數據,及時、高效、準確地進行數據分類分級和歸集數據。
數據共享階段:在國家一體化政務大數據平臺的基礎上,利用聯邦學習融合跨領域信息,構建一體化聯邦推薦系統,有效緩解數據稀疏、數據泄露等問題。該系統通過聯邦推薦系統的隱私保護因子分解機算法,在確保數據隱私和模型隱私安全的前提下,解決不同政務部門(數源單位)之間的數據供需匹配問題,即對數據擁有單位及數據需求單位進行聯邦推薦建模,預測二者的供需匹配度,幫助數據需求單位精準、快速、安全地找到最佳數源單位,然后依托一體化政務大數據平臺進行數據高質量共享。
一體化政務大數據平臺跨級聯邦推薦包括以下步驟:
1. 區縣級數據需求單位向本級政務大數據平臺提出數據共享申請。
2. 區縣級政務大數據平臺通過對本級社會保障、醫療保障等數據倉和基礎庫進行聯邦推薦,如果推薦數據達到預設可信閾值,直接反饋數據;如果未達到預設可信閾值,向市級政務大數據平臺提出數據共享申請。
3. 市級政務大數據平臺通過對本級社會保障、醫療保障數據倉等進行聯邦推薦,如果推薦數據達到預設值,直接反饋數據給區縣級政務大數據平臺,如果未達到預設值,向省級政務大數據平臺提出數據共享申請。
4. 以此類推,直到推薦模型達到收斂。
聯邦聚合服務器將最終的推薦模型進行解密,并將其發送給所有數據擁有者進行模型共享??缂壜摪钔扑]可以在保護數據隱私和安全的同時,提高推薦效果和準確性,適用于需要在不同級別的數據擁有者之間進行推薦模型訓練和共享的場景。下一步深度結合人工智能技術,政務大數據平臺將從當前的分析式共享數據轉變為生成式共享數據,實現從數據導向向業務導向的變革。
3.4 應用問題分析
目前,聯邦學習正處于快速發展的階段,有大量關于聯邦學習的應用場景的研究與討論。相關研究表明,基于政務大數據平臺的聯邦學習還有很多問題亟待解決。
隱私保護問題:保證數據的隱私性是聯邦學習能快速落地的基石,同時也是聯邦學習的核心挑戰,政務大數據具備高可信和高價值特性,被網絡安全攻擊者普遍關注,因此,在政務大數據應用中隱私安全尤為重要。但研究發現,聯邦學習架構的隱私保護不足以完全防御外部隱私攻擊。具體來說,在模型訓練和模型預測階段都可能泄露數據隱私,如在橫向聯邦學習中,梯度信息在未加保護的情況下會泄露隱私訓練數據的信息。目前,聯邦學習的隱私保護主要采用差分隱私、同態加密、安全多方計算等隱私保護技術,并且在一些場景應用中已取得了較好效果。聯邦學習系統需要持續增強對各類不良攻擊的防御能力,保障用戶數據的隱私。
通信效率問題:聯邦學習易受到參與方設備異構、網絡帶寬等影響,導致其計算與通信效率成為阻礙相關應用落地的最大挑戰。影響聯邦學習算法效率的主要因素是參與方與中央服務器之間需要交換大量模型和參數,會造成較大的通信開銷,因此網絡中的通信效率會對整體速度有較大的影響。比如不穩定的網絡情況、參數上傳和下載的過程中速度不一致都會導致整個算法的模型訓練成本過大。然而,政務大數據具有多樣性,包括結構化數據(如數據庫、表格等)和非結構化數據(如文檔、圖片、視頻等),這些數據來自不同的政府部門,具有不同的格式和類型,對通信效率提出了更高要求。因此,開發通信效率高的方法就顯得尤為重要,通常可以從降低傳輸頻率和減少每輪傳輸的信息量等方面著手。部分優化以增加參與方的本地計算為代價,部分優化以降低整個模型的準確性為代價。在實際優化的過程中,可以根據實際情況和需求決定采用何種方式降低通信成本。
數據異構難題:在聯邦學習中,訓練數據可以分布在大量的客戶端上,比如手機、網絡傳感器或者各類邊緣設備,然后通過服務器聚合成完整的全局模型,而不用傳輸用戶數據,從而保護了用戶的隱私信息。然而,在政務大數據平臺聯邦學習的環境中,各個客戶端數據樣本量和樣本類別都處于變化之中,即數據分布的異構性。由于參與聯邦學習的各個邊緣設備所處的實際物理環境不同,這些邊緣設備能為聯邦學習框架提供的數據各不相同,這種不同的數據分布會導致邊緣設備在本地訓練過程中產生模型偏移,從而影響聯邦學習在政務大數據中的應用成效,特別是使魯棒性較差的政務應用難以落地。目前,大規模、分布式、多模態多源異構數據采集應用是聯邦學習的一項重點研究領域。
4 總結與展望
聯邦學習作為破解“數據孤島”問題實現隱私數據開放共享的新方向,近年來受到學術界和政界的廣泛關注。本文從政務大數據平臺建設的角度出發,概述了政務領域隱私數據采集、分類分級和共享面臨的挑戰,進而通過聯邦學習隱私集合求交技術和推薦系統進行相關應用探索,并對相關問題進行了總結分析。
國家數據局的成立,將加速跨層級、跨地域、跨部門的國家一體化政務大數據平臺的構建,統籌推進數據資源整合共享和開發利用,以盡可能低的成本交換和共享數據。通過強化數據治理,進一步提升數據鮮活度、準確性、實用價值,真正實現暢通的數據資源大循環,促進經濟社會高質量發展,是一個長期而具有挑戰性的課題。
政務大數據的安全性需持續增強。數據安全性和合規性是制約政務大數據平臺一體化、智能化的關鍵因素。如何在國家一體化政務大數據平臺的基礎上,健全國家、省、市、縣各級數據統籌管理機構,推動公共數據匯聚整合和開發利用,是一個重要研究方向。其中,在安全合規的前提下,加快推進聯邦學習等隱私計算技術的場景應用,實現四級聯動,其背后的數據安全工作值得深入研究。
政務大數據的跨域性需持續釋放。政務大數據涉及多個領域和部門,蘊含著豐富的信息和價值,可以幫助政府進行政策制定、資源配置、社會管理等方面的決策和優化。通過聯邦學習賦能政務大數據平臺建設,可有效解決隱私數據跨地域、跨部門、跨層級、跨系統的整合和共享,為政府發現潛在的問題、趨勢和機會提供全面、精準的數據支持。
政務大數據的大規模性有助于大模型應用研究。政務大數據通常擁有龐大的數據量,這些數據涵蓋了政府的各個方面,如人口數據、交通數據、醫療數據、環境數據等,聯邦學習等隱私計算技術打破了領域之間數據、算力、算法共享的壁壘。同時,在ChatGPT引發AI技術新一輪熱潮的背景下,數字政府的未來創新也與大模型分不開。下一步圍繞政務大數據的大模型應用,如基于算力資源、算法模型、數據處理的超級任務場景等,都將是看得見的機遇。
參考文獻
[1] 國務院辦公廳. 關于印發全國一體化政務大數據體系建設指南的通知[Z]. 2022.
[2] 易成岐, 竇悅, 陳東, 等. 全國一體化大數據中心協同創新體系:總體框架與戰略價值[J]. 電子政務, 2021(6): 2-10.
[3] 國務院. 關于印發促進大數據發展行動綱要的通知[Z]. 2015.
[4] 鄭諧維. 隱私計算在政務數據共享中的應用[J]. 上海信息化, 2022(4): 17-21.
[5] 張聰叢, 郜潁潁, 趙暢, 等. 開放政府數據共享與使用中的隱私保護問題研究: 基于開放政府數據生命周期理論[J]. 電子政務, 2018(9): 24-36.
[6] 李瀛, 楊芮. 我國政府數據開放的隱私保護困境及管理框架研究[J]. 情報雜志, 2023, 42(1): 152-157.
[7] KONE?NÝ J, MCMAHAN H B, YU F X, et al. Federated learning: strategies for improving communication efficiency[EB]. arXiv preprint, 2016, arXiv: 1610.05492.
[8] 楊強. AI與數據隱私保護:聯邦學習的破解之道[J]. 信息安全研究, 2019, 5(11): 961-965.
[9] YANG Q, LI U Y, CHEN T J, et al. Federated machine learning: concept and applications[J]. ACM Transactions on Intelligent Systems and Technology, 2019, 10(2): 1-19.
[10] LIU B Y, WANG L J, LIU M, et al. Federated imitation learning: a privacy considered imitation learning framework for cloud robotic systems with heterogeneous sensor data[EB]. arXiv preprint, 2019, arXiv: 1909.00895.
[11] GONG Y, JIANG Z W, FENG Y F, et al. EdgeRec: recommender system on edge in mobile Taobao[C]//Proceedings of the 29th ACM International Conference on Information & Knowledge Management. New York: ACM, 2020: 2477–2484.
[12] 王海燕. 抖音的算法推薦特點分析[J]. 新媒體研究, 2018, 4(20): 21-22.
[13] 李宗辰, 張頤, 葉東, 等. 運用聯邦學習技術推動公安大數據的融合運用[J]. 警察技術, 2021(6): 34-37.
[14] 錢學勝, 吳寰宇, 陳誠, 等. 基于聯邦學習的新冠肺炎疫情跨區域智慧防控技術: 以上海市實踐為例[J]. 科技導報, 2021, 39(24): 96-107.
[15] SHI D Y, TONG Y X, ZHOU Z M, et al. Learning to assign: towards fair task assignment in large-scale ride hailing[C]//Proceedings of the 27th ACM SIGKDD Conference on Knowledge Discovery & Data Mining. New York: ACM, 2021: 3549–3557.
[16] 戴理朋, 楊鑫, 徐茹枝. 聯邦學習在電力數據分析中的應用及隱私保護研究[J]. 電力信息與通信技術, 2022, 20(11): 47-56.
[17] 劉雋良, 王月兵, 覃錦端, 等. 數據安全實踐指南[M]. 北京: 機械工業出版社, 2022: 42-82.
[18] 高磊, 趙章界, 林野麗, 等. 基于《數據安全法》的數據分類分級方法研究[J]. 信息安全研究, 2021, 7(10): 933-940.
[19] DECRISTOFARO E, TSUDIK G. Practical private set intersection protocols with linear complexity[C]//SION R. International Conference on Financial Cryptography and Data Security. Berlin: Springer, 2010: 143-159.
[20] PINKAS B, SCHNEIDER T, ZOHNER M. Faster private set intersection based on OT extension[C]//Proceedings of the 23rd USENIX conference on Security Symposium. New York: ACM, 2014: 797–812.
[21] 王力, 張秉晟, 陳超超. 隱私保護機器學習[M]. 北京: 電子工業出版社, 2021: 88.
[22] ADOMAVICIUS G, TUZHILIN A. Toward the next generation of recommender systems: a survey of the state-of-the-art and possible extensions[J]. IEEE Transactions on Knowledge and Data Engineering, 2005, 17(6): 734-749.
[23] 朱智韜, 司世景, 王健宗, 等. 聯邦推薦系統綜述[J]. 大數據, 2022, 8(4): 105-132.
[24] 梁鋒, 羊恩躍, 潘微科, 等. 基于聯邦學習的推薦系統綜述[J]. 中國科學: 信息科學, 2022, 52(5): 713-741.
[25] ZHANG Z Q, CHEN C C, ZHOU J, et al. An industrial-scale system for heterogeneous information card ranking in alipay[C]//Proceedings of the International Conference on Database Systems for Advanced Applications. Cham: Springer, 2018: 713-724.
[26] CHEN C C, ZHENG X L, WANG Y, et al. Context-aware collaborative topic regression with social matrix factorization for recommender systems[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2014, 28(1): 9-15.
[27] 仇阿根, 張用川, 羅寧, 等. 結合用戶特征的政務服務協同過濾推薦方法[J]. 集成技術, 2023, 12(1): 42-55.
[28] 王健宗, 孔令煒, 黃章成, 等. 聯邦學習算法綜述[J]. 大數據, 2020, 6(6): 64-82.
[29] 劉俊旭, 孟小峰. 機器學習的隱私保護研究綜述[J]. 計算機研究與發展, 2020, 57(2): 346-362.
[30] 陳凱, 楊強. 隱私計算[M]. 北京: 電子工業出版社, 2022: 130.
[31] 王騰, 霍崢, 黃亞鑫, 等. 聯邦學習中的隱私保護技術研究綜述[J]. 計算機應用, 2023, 43(2): 437-449.
[32] 楊強, 童詠昕, 王晏晟, 等. 群體智能中的聯邦學習算法綜述[J]. 智能科學與技術學報, 2022, 4(1): 29-44.
[33] 邱鑫源, 葉澤聰, 崔翛龍, 等. 聯邦學習通信開銷研究綜述[J]. 計算機應用, 2022, 42(2): 333-342.
[34] VARGHESE B, WANG N, BARBHUIYA S, et al. Challenges and opportunities in edge computing[C]//Proceedings of the 2016 IEEE International Conference on Smart Cloud (SmartCloud). Piscataway: IEEE Press, 2016: 20-26.
[35] HUANG W K, YE M, DU B. Learn from others and be yourself in heterogeneous federated learning[C]//Proceedings of the 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Piscataway: IEEE Press, 2022: 10133-10143.
[36] VOGEL S T, HE L, KOLOSKOVA A, et al. RelaySum for decentralized deep learning on heterogeneous data[EB]. arXiv preprint, 2021, arXiv: 2110.04175.
[37] 黃聿辰, 趙彥超, 郝江山, 等. 面向數據異構的聯邦學習性能優化研究[J]. 小型微型計算機系統, 2024, 45(4): 777-783.