中國共產黨新聞網>>理論
分享

以詞元為抓手健全數據產權制度

程娜

2026年06月23日08:22    來源:光明日報222

訂閱取消訂閱已收藏收藏大字號

點擊播報本文,約

【觀察與思考】

“十五五”規劃綱要提出,建立健全數據產權、流通利用、收益分配、安全治理等數據要素基礎制度。然而,受制於數據的多主體共創、非標准化等內在屬性,數據確權、流轉、分配、監管等難題交織並存,大量優質數據資源難以轉化為市場化生產要素,制約了數字經濟的提質增效。今年3月,國家數據局正式將人工智能領域的Token定名為“詞元”,將其界定為大模型對原始數據語義拆解、編碼折算后形成的最小標准化價值單元,這為數據產權制度走向精細化治理、培育智能經濟新形態提供了新的實踐路徑。

數據產權制度建設面臨的現實挑戰

產權制度是數據要素市場化配置的核心基石。《中共中央、國務院關於構建數據基礎制度更好發揮數據要素作用的意見》(簡稱“數據二十條”)確立了我國數據產權的“三權分置”框架,明確了數據資源持有權、數據加工使用權、數據產品經營權三類權能。區別於傳統實物要素,數據要素具備非競爭性、無限可復制性、多主體共創性、價值場景依附性等特征,導致在數據治理實踐中難以直接套用傳統物權“一物一權、排他獨佔”的規則體系,致使數據產權制度建設面臨現實困境。

一是權屬界定缺乏可操作標准。數據的非競爭性使其可被多方主體同步使用,多主體共創屬性又貫穿數據採集、清洗、加工全鏈條,不同參與主體的貢獻邊界交織疊加,難以量化比對,因而缺乏統一的確權依據。實踐中權責劃分長期依賴經驗判斷,不僅削弱了制度的可執行性,也使市場主體容易產生“不敢流通、不願共享”的心理,大量數據資源因此長期沉澱,難以轉化為現實生產力。

二是安全與定價雙重壁壘制約流通。原始數據可無限復制、極易外泄,一旦交付流轉便難以有效管控,隱私泄露、商業秘密流失等風險顯著抬升,進而直接壓低市場主體的數據流轉意願。同時,數據價值隨應用場景、加工深度、調用頻次動態波動,缺乏統一的價值評估基准,導致交易成本居高不下,數據資源容易陷入“可用不可流、可流不易用”的困境,從而阻礙全國一體化數據市場的培育。

三是收益分配機制失衡。數據價值的形成源於多主體的協同參與,但長期以來缺乏成熟的貢獻量化與收益核算方法,導致頭部平台能夠憑借技術優勢、流量入口和數據資源優勢主導收益分配規則,原始數據供給方、中小加工服務方難以得到合理回報,這既會削弱多元市場主體的參與積極性,也易固化強者恆強的分配格局,不利於形成公平有序的數據產業生態。

四是全鏈條監管治理存在短板。數據復制無痕、流轉隱秘的特性,使數據侵權、泄露問題具有發現難、溯源難、取証難等特征。與此同時,數據產權糾紛認定標准、損失核算依據尚不明確,整體上會形成“侵權成本低、維權成本高”的治理困境。傳統的監管模式難以覆蓋數據全生命周期,也難以統籌兼顧數據產權保護與數據安全管控。

詞元賦能數據產權制度建設的內在邏輯

Token在不同場景有三種形態:區塊鏈領域的“通証”,用於鏈上資產確權與流轉﹔網絡安全領域的“令牌”,用於身份認証與權限管理﹔人工智能大模型場景下的Token,是對數據解析與編碼后的處理單元。前兩類形態不依托原始數據生成,不承載語義信息,也不具備數據價值計量能力。詞元與原始數據有著本質區別:原始數據是內容本身,具有可復制、易外泄、價值模糊等特征,一旦流出難以收回﹔詞元是大模型解析、拆分和編碼后生成的標准化技術單元,不承載原始數據內容,僅用於計量使用規模、記錄調用行為、支撐價值分配。將數據使用轉化為詞元來計量,可在不轉移原始數據的前提下,實現“數據不動、價值可流動”。依托獨特的底層技術機制,詞元能夠精准回應數據產權制度建設實踐中面臨的確權難、授權難、流轉難等問題。

一是以標准化計量破解確權難題。數據確權的核心難點在於價值缺乏統一度量標尺。土地、器物等實物資產價值相對穩定、權屬清晰,可通過市場價格明確產權比例,而數據價值隨應用場景、加工深度、調用頻次動態變化,並由多方協同生產,各方貢獻交織混雜,難以精准界定權責份額,過去只能依靠經驗定性判定。詞元依托大模型統一運算規則,將文本、圖像、算力消耗等各類異構數據折算為可統計、可對比的標准化單元,形成了可比較的計量框架,能夠為數據價值衡量提供基礎標尺。

二是以非實體流轉破解流轉難題。數據流轉難的根本原因在於數據一旦流出就無法收回。詞元將市場流通的標的物由原始文件變為權益憑証,可以實現數據載體與價值權益的分離,即受讓方僅獲取詞元調用權與收益權,無法佔有原始數據。運行上,詞元採用“遠端請求、本地運算”閉環模式:使用者提交需求后,數據處理在數據持有方本地服務器完成,外部用戶僅能獲取最終結果,全程無法接觸原始數據。這種“數據不動、價值動”的模式,使數據持有方始終掌握數據控制權,從根本上降低了數據泄露與失控風險。

三是以權益可分拆化解確權與分配的交織難題。解決不了確權,分配就無從談起﹔分配不公,確權也沒有意義。詞元的權益可分拆屬性同時回應了這兩個難題:將原本整體模糊的數據權益拆分為大量獨立的詞元單元,每個詞元對應一份獨立的權益份額,各方主體依據貢獻度獲得相應數量的詞元,各自持有獨立的詞元份額,這些份額成為確權和分配的客觀尺度和依據。

四是以收益精准核算化解分配難題。分配難的根本原因是貢獻度無法衡量。數據產業鏈中,誰貢獻了多少、應獲得多少收益,長期缺乏客觀依據,平台企業往往憑借渠道優勢單方面決定分配比例,中小貢獻者處於弱勢。詞元具備可消耗、可清零的資源屬性,類似於碳配額或通信流量套餐。用戶每次調用數據或使用算力,消耗對應額度,額度耗盡后權限自動失效。這一機制將數據使用行為轉化為可量化、可約束的資源消耗過程。詞元的收益精准核算屬性提供了客觀的分配依據,可以通過詞元調用量、消耗量等客觀指標精准核算各方貢獻,調用越多、貢獻越大、收益越高。

五是以全鏈路可追溯破解監管難題。監管難的根本原因是侵權行為的“無痕性”。數據復制不留痕跡、流轉路徑無法追蹤,一旦發生泄露或侵權,監管部門難以知道誰泄露的、經過哪些環節、擴散到什麼范圍,追責無從下手。詞元具備全生命周期操作信息自動存証功能,完整記錄從生成、流轉、調用到消耗的每一步操作,操作主體、發生時間、行為軌跡均自動留痕,構成連續的操作記錄鏈條。當發生侵權時,監管機構可以沿著詞元鏈條逆向追溯,精准定位責任主體、還原行為過程、固定証據。

詞元賦能數據產權制度建設的現實約束與優化路徑

當前,詞元賦能數據產權制度建設仍面臨雙重約束。從內在看,詞元目前僅是技術層面的權益標記,現行法律尚未將其等同於物權或知識產權,司法實踐中能否作為確權憑証尚無統一裁判標准﹔無法核驗原始數據生成階段的真實性與合法性,對“原生數據造假”“非授權使用”等問題難以有效應對。從外部看,統一的詞元分詞、計量、定價標准體系尚未建立,詞元衍生權益與原始數據產權的權責邊界尚未厘清,頭部平台仍可憑借算力、技術與入口優勢在詞元生產、定價、流轉環節形成市場壟斷。

為此,應重點推進以下工作。一是強化頂層制度設計。立足“數據二十條”確立的“三權分置”制度框架,推動詞元深度嵌入數據要素市場化改革,明確詞元權屬生成、權益分置、流轉利用的制度規范,厘清原始數據產權與詞元衍生權益的邊界關系。二是加快統一標准建設。由相關部門牽頭統籌,加快制定詞元分詞規則、計量口徑、估值定價等基礎標准,逐步構建全國統一、兼容互通的詞元標准體系。三是健全法治監管體系。完善配套法律法規與司法解釋,明確詞元權益的合法屬性與適用范圍,細化監管規則與懲戒機制。四是規范市場競爭秩序。強化對平台的反壟斷與不正當競爭監管,遏制頭部市場主體利用技術優勢壟斷詞元資源、操縱定價規則,保障中小微市場主體平等參與權。五是升級安全防控能力。搭建詞元全流程追溯風控體系,建立分級分類安全保護機制,有效防范新型數據安全風險。六是深化場景生態拓展。持續推進詞元技術迭代,提升多模態數據適配能力,豐富行業應用場景,構建技術、市場、監管協同發展的良好產業生態。

(作者:程娜,系上海市習近平新時代中國特色社會主義思想研究中心研究員、上海大學馬克思主義學院教授)

(責編:劉圓圓、萬鵬)
微信“掃一掃”添加“學習大國”

微信“掃一掃”添加“學習大國”

分享到:
推薦閱讀