75%收入被10家公司拿走:AI数据赛道的小公司越来越难活
硅谷投资人Deedy最新整理的AI训练数据与RL环境赛道榜单引发市场热一,榜单显示,28家核心公司合计年化营收约85亿美元,总估值接近960亿美元。整个赛道超过75%的收入,来自不到10家头部公司。其中第一梯队的四家企业营收规模遥遥领先,和第二梯队拉开了数量级差距。

三年前行业还分散着上百家标注公司,现在头部玩家的优势还在持续扩大,中小公司的生存空间不断收缩。
大模型厂商的采购逻辑变化,是推高行业集中度的直接原因。过去数据采购分散在不同部门、不同项目,供应商选择也相对零散。现在头部实验室普遍转向少数核心供应商加长期框架协议的模式,把整块数据业务打包交付。模型迭代速度越来越快,数据需求从单批次采购变成持续的对齐、评测、RLHF服务,频繁更换供应商的沟通成本和质量风险太高。
SurgeAI是这种模式的直接受益者。这家2020年成立的公司从未拿过外部融资,核心客户只有OpenAI、Google、Microsoft、Meta和Anthropic五家。它不做众包、不碰低端标注,只承接高难度的RLHF和安全评估业务。因为深度绑定了顶级实验室,单客价值极高,年化营收做到了约30亿美元,是赛道里规模最大的玩家。
同属第一梯队的Mercor增长速度更快。这家2023年才成立的公司,核心客户就是OpenAI、Anthropic、谷歌DeepMind等不到十家头部机构。2025年9月它的年化收入是5亿美元,2026年2月突破10亿,到6月已经超过20亿,九个月翻了四倍。
ScaleAI和Handshake也凭借各自的客户资源,站稳了10亿到15亿美元的年化营收区间。仅这四家公司的收入总和,就占到了全赛道的八成以上。
进入头部大模型的供应商体系,需要漫长的资质审核、质量验证和安全审计,一旦进入就很难被替换。排在后面的中小公司很难进入这个核心体系,大多只能接到边缘的低价值分包订单,或者服务预算有限的中小模型厂商。榜单里第二梯队的micro1、Turing,年收入分别在2.5亿和5亿美元左右,看起来体量不小,但和第一梯队相比,增长速度和客户质量都不在一个层级。

头部公司的业务边界还在不断扩张,进一步挤压单品类玩家的市场空间。
早期的数据公司分工明确,你做图像标注,我做文本处理,各自有独立的市场。现在头部公司都在做全链条布局,覆盖预训练数据清洗、指令微调、RLHF偏好数据、模型评测、红队测试、RL训练环境等全环节,客户在一家就能完成全部采购。
ScaleAI从图像标注起家,现在已经覆盖数据标注、模型评测、RLHF、企业级AI应用开发等多个板块,甚至切入了政府和军方采购。仅企业级AI应用业务,年化收入就达到2亿美元。Meta持有其49%的股份,直接锁定了长期大额订单。
Handshake原本是做了12年的大学生招聘平台,2025年初才切入AI训练数据业务。它把平台上的专业人士转化为数据标注员,快速切入专家级数据市场,起步时年化收入只有几百万美元,到2026年已经接近10亿美元。
客户更倾向于一站式解决方案,没有理由同时对接多家供应商。只做单一品类的中小公司,要么被迫降价抢单,要么只能深耕头部公司看不上的细分市场。排在更后面的垂直领域玩家,比如主打音频的DavidAl、主打代码的Datacurve,年收入大多在千万美元级别,很难突破增长天花板。
比业务扩张更根本的变化,是行业技术壁垒的快速抬升。
很多人对AI数据公司的印象还停留在人力外包,靠大量人工完成拉框打标签的工作。现在头部公司都在大量投入自动化标注工具、合成数据生成、交互式RL环境,用技术提升效率、降低人力占比。
低端图像标注的单价已经从几毛钱一张跌到几分钱,纯人力标注的毛利率普遍低于15%。头部公司用AI辅助标注,单人产出是纯人工的数倍,成本反而更低。原本靠低价竞争的小公司,现在连价格优势也保不住。
RL环境原生公司的出现,进一步拉大了技术代差。Fleet、Deeptune、BespokeLabs这些公司,做的是给AIAgent用的仿真训练环境,本质是软件产品,不是人力服务。这类业务技术门槛高、毛利空间大,是行业接下来的增长主力,但完全不在传统标注公司的能力范围内。
技术迭代需要持续的资金投入,采购自动化工具、搭建合成数据管线、招聘算法工程师都需要成本。中小团队没有足够的预算支撑试错,只能停留在纯人工标注的红海里,业务越做越低端。
剩下的中小玩家,大致只有两条出路。一条是深耕医疗、法律、具身智能等极细分的垂直领域,靠专业壁垒建立护城河。另一条是等待被头部公司并购,成为其全品类布局的一部分。
AI数据行业的分散时代已经结束,集中度提升的趋势还会继续下去。


















评论 0