新媒体矩阵

高质量数据集成为AI刚需,公共数据加工产品能否形成稳定交易市场?

全国统一数据产权登记平台建成后,跨区域交易无需重复进行权属审核,降低了流通环节的核验成本。

进入2026年7月,随着工信部启动人形机器人与具身智能实景实训专项、《数据产权登记工作指引》正式实施,叠加世界人工智能大会预热期的产业信号,国内AI行业的关注点逐步从模型参数规模转向高质量数据供给。公共数据经授权运营、脱敏加工后形成的数据产品,成为合规数据供给的新方向。这类产品能否形成稳定的交易市场,是当前产业共同关注的实际问题。

AI产业对高质量合规数据集的采购需求正在上升。

一方面,大模型正向金融、医疗、工业等垂直场景深度落地,对应领域的标注数据需求量持续增加,公开通用数据集已无法满足细分场景的训练要求。具身智能赛道快速发展,真机物理交互数据供给缺口明显,数据迭代速度直接影响机器人落地进度。

另一方面,《生成式人工智能服务管理暂行办法》相关条款将于7月15日正式生效,爬虫获取的非授权数据合规风险提升,AI企业需要权属清晰、来源可追溯的合规数据源。此外,企业自行完成数据采集、标注、全流程治理的成本较高,市场化采购具备成本优势,成为多数企业的优先选择。

最近几年,各地争相开展公共数据授权运营、出台相关授权文件,公共数据加工产品已具备市场化交易的基础条件。

《数据产权登记工作指引》明确划定规则,原始公共数据仅可进行资源登记,不能单独办理产权登记;经授权运营主体脱敏加工、增值开发后形成的数据产品,可依法办理产权登记,具备交易合法性。目前国内多省市已在医疗、交通、城市治理等领域启动公共数据授权运营,相关行业数据集陆续在各地数据交易所上架。全国统一数据产权登记平台建成后,跨区域交易无需重复进行权属审核,降低了流通环节的核验成本。

尽管供需基础均已具备,公共数据加工产品尚未形成规模化的稳定交易市场,主要存在三方面问题。

第一,行业缺乏统一的产品标准。不同运营主体产出的数据集,在字段定义、标注规则、更新周期、数据颗粒度上没有统一规范,采购方无法直接横向对比选型,每笔交易都需单独对接需求、协商定价,交易成本偏高。第二,产品与AI训练需求匹配度不足。多数公共数据产品最初面向政务统计、行业监管场景设计,数据格式、字段维度、标注维度不符合AI模型训练的输入要求,采购方购入后通常需要二次加工,额外增加了使用成本。第三,市场格局较为分散。各地授权运营机构、数据交易所独立开发数据产品,同品类数据重复建设现象普遍,尚未形成全国统一的交易入口,采购方需要对接多个主体,筛选与沟通成本较高。

整体来看,公共数据加工产品面向AI训练的交易市场仍处于早期探索阶段。短期内,医疗、交通、工业等公共数据存量充足、AI应用需求明确的垂直领域,有望率先形成常态化的交易秩序。全国性的规模化稳定交易市场,仍需等待数据产品标准、定价机制、流通渠道的进一步统一。

底部.png

评论 0