新媒体矩阵

“你好,我是一名数据采集员”

专项采集岗需求增长快,根本原因是行业存在明显的数据缺口,算法迭代的速度普遍被数据产能卡住。

数据采集员,当前最爆火的职业之一。

近期我走访了多家具身智能相关企业,在数采工厂实地了解数据采集环节的真实状态。

苏州一家采集中心设在写字楼三层,采集作业几乎全天进行。

在采集中心,我们见到了采集团队组长林兴(化名),他的日常工作,是通过力反馈手柄和数据手套遥操作机械臂,同步录制动作过程中的全链路数据。

操作界面同步显示画面、深度图、关节角度、力传感器数值,所有数据带毫秒级时间戳。单个动作单日重复次数可达上百次,我到访当天,一组抓取动作已经完成近百次采集。

9e8977d9358310923fc36390a73d3a51.jpg

“去年行业讨论具身智能,多集中在大模型、算力、硬件本体,很少提及底层的数据生产,但今年,情况发生了本质变化,数据才是各家厂商要求的核心。”林兴介绍道。

但具身模型的动作能力上限,直接由真实交互数据的规模和质量决定,数据采集员就是这类数据的直接生产者。

很多人把数据采集员和数据标注员混为一谈,两者工作逻辑完全不同。

数据标注员是对已有数据做二次加工,给图片、语音等数据加标签。数据采集员是从0到1生产原始训练样本,比如人操控机器人完成动作,同步记录感知输入和控制信号的完整序列,产出的数据可以直接用来训练模型。

林兴的团队有24人,负责家用场景的动作采集,工作有固定流程。

林兴介绍到,每天到岗第一件事是校准设备。动捕相机、深度相机、力传感器、机器人控制器都要做时间同步,误差必须控制在10毫秒以内。同步超标的数据没有训练价值,校准不通过不能开工。

我们了解到,正式采集按任务清单执行,覆盖抓取不同材质物体、开关抽屉、叠毛巾、插拔充电头等动作,单个动作至少重复100次。采集过程中要主动调整变量,比如改变物体摆放角度、调节光照、更换不同规格的同类物品,保证数据覆盖更多场景差异。

动作演示不能按人的习惯来,要符合机器人的运动限制。比如人的腕关节能转接近180度,他们用的机械臂腕关节限位是常见范围±60度至±180度,演示超出这个角度,机器人复现不了,数据就作废了。而且力度也要稳定,抓取易碎品的握力、拧瓶盖的扭矩,波动不能太大,否则会影响训练效果。

每做完一组,采集员要当场初筛,删掉动作变形、同步出错的无效样本,再把合格数据上传至算法后台。

“这份工作重复度很高,但不是纯体力劳动。”林兴介绍到,“做采集工作时间久后,熟悉了机器人的运动边界,能控制动作一致性,还能根据模型反馈调整采集方式,直接判断数据的训练价值。”我在现场试戴了十分钟数据手套,只做了十几次抓取动作,手腕就有明显酸胀感。采集时上肢要保持固定姿势,注意力需要全程集中,长期从业的人员普遍存在手腕、肩部劳损,护腕和靠枕是工位的常规用品。

c2fe5ed61dd68468ed45494d3bf0d7b3.png

从BOSS直聘的全平台招聘数据看,国内数据采集岗位已经分成三个层级,不同层级的门槛、薪资、用工形式差距很大。

占比最高的是基础数据采集专员。工作以人工录入、信息整理、问卷收集、简单多模态数据整理为主,学历要求低,很多岗位支持居家兼职和实习。薪资方面,一二线城市全职月薪多在4000到8000元,三四线城市和兼职更低,日薪普遍150到260元。这类岗位招聘量最大,需求主要来自互联网公司、数据服务商和市场调研机构。

增速最快的是AI、人形机器人领域的专项数据采集岗。工作包括具身动作捕捉、路况图像采集、场景多模态数据录制,直接供给AI训练数据。受具身智能行业发展带动,2025年全行业这类岗位招聘量同比增长明显,普通执行岗月薪6000到12000元,能做采集方案、提供技术支持的岗位薪资更高。我走访的多家企业都在扩招这类人员,其中一家头部人形机器人公司,仅遥操作采集岗就有近200个编制,目前还在招人。

占比最少、薪资最高的是数据采集开发工程师,属于技术岗。要求掌握编程、分布式采集架构、反爬处理和数据清洗,全国平均月薪约15000元,1到3年经验的岗位薪资多在12000到25000元,资深工程师能到25000到50000元。

从地域分布来看,高薪技术岗集中在北上深等一线城市,基础采集岗在新一线和二三线的数据产业集群更多。

基础执行岗里超过六成不限工作经验,用工一般是全职驻场加居家众包结合。但求职也有两个常见风险:基础兼职岗常有收押金、培训费的骗局。

3c5400a2b4b0fbfe13fba6db856f85ff.png

专项采集岗需求增长快,根本原因是行业存在明显的数据缺口,算法迭代的速度普遍被数据产能卡住。

行业公开的技术资料显示,训练一个能做基础家务操作的具身模型,至少需要百万小时的高质量真实交互数据。但一个熟练的专项采集员,一天有效工作时间里只能产出4到6小时合格数据。

按这个效率算,100人的团队全年无休,一年也只能积累十几万小时。目前国内所有具身企业加起来的高质量标注交互数据,还没到百万小时的门槛。

其次是数据质量直接决定模型的能力上限,但高质量交互数据的成本比传统图像标注高几十倍。

除了人力成本,还要投入机器人、传感器、动捕设备这些硬件。如果要覆盖更多场景变量,成本还会继续上升。多数创业公司预算有限,只能先采集少数核心场景的数据,模型的泛化能力自然受限制。

最后工业装配场景的数据不能直接用在家务场景,桌面抓取的数据也用不了在地面搬运上,这直接导致数据无法跨场景使用。每开一个新场景,就要从头采集对应的数据,边际成本降不下来。这也是具身智能落地场景分散、没法快速规模化的一个重要原因。

这些因素加起来,让数据积累成了企业的核心壁垒。算法框架可以参考开源方案,硬件可以找供应链采购,但几百万小时的真实交互数据,只能靠企业自己慢慢攒。

5acea5e007836b21266097cfc4e099ba.png

探访中我问过多名采集员,觉得这份工作能做多久。多数人给不出明确答案,但结合现在的技术路线和行业节奏,这个岗位的变化方向是可以判断的。

短期2到3年内,专项采集岗的需求还会增长。

现在具身智能刚从实验室走向产业落地,工业、家政、物流、医疗都在尝试,每个新场景刚开始做的时候,都需要大量人工演示的数据给模型做初训。自主采集技术现在还不成熟,只能在少数标准化场景做辅助,替代不了人工采集的核心作用。

中期3到5年后,很多标准化、重复度高的动作采集工作会逐步被替代。自主探索算法成熟后,机器人可以在固定场景里24小时运行,自己筛选有效数据,完成标准化动作的积累。同时,仿真合成数据技术也会更接近真实环境,承担更多基础数据的预训练工作,如国内的光轮智能,已经是合成数据的独角兽公司。到时候,只做动作演示的基础采集岗,需求量会下降很多。

但这个岗位不会消失,只是工作内容会向上游转移。

核心剩下三类工作:一是新场景的初期示教,尤其是环境复杂、非结构化的场景,还是需要人先做示范,给模型提供初始样本;二是设计采集方案,根据不同场景确定采集变量、动作标准、质量要求,提高采集效率;三是数据质量校验,检查自主采集和仿真数据的有效性,删掉不合格样本,保证训练数据的质量。

更长期看,等具身模型有了通用物理交互能力,基础动作的数据足够了,这个岗位会进一步变成场景数据专家。

从业者不用自己做动作演示,而是针对特定行业制定数据标准、搭建行业数据集,解决长尾场景的数据问题。这时候核心能力就不是操作熟练度,而是对场景的理解和对数据逻辑的把控。

简单说,重复的体力型采集工作会被替代,需要理解场景、设计方案、判断质量的工作不会被替代。岗位的总需求量可能会减少,但对从业者的能力要求会越来越高。

我离开的时候接近晚上十点,还有多名采集员在加班,赶一个工业场景项目的交付。

在具身智能的产业链条里,数据采集员是后台岗位,但他们产出的真实交互数据,是现阶段模型能力迭代的核心基础。

底部.png

评论 0