“00后团队跑出一家32亿美金的独角兽,AI数据训练底层逻辑彻底变了。
这家名为AfterQuery的公司,如今已经跻身“超级独角兽”行列,短短五个月内估值增长约十倍。它既没有提前获得顶级资本的大额押注,也没有建设庞大的算力中心,切入点却正好踩中了AIAgent的新需求:为模型提供专业、复杂、可验证的训练数据。
相似的创业故事,正在国内市场同步上演。
市场消息显示,阿里巴巴计划领投AI训练与基准测试服务商UniPatAI一笔3亿美元融资,交易完成后,这家公司投后估值有望达到25亿美元,腾讯、红杉中国等机构也传出参投意向,目前各项谈判仍在推进当中。
放眼全球,除了AfterQuery、UniPatAI之外,Mercor等一批新生代数据企业接连跑出十亿级营收、数百亿估值,彻底颠覆了传统AI数据行业的原有格局。这一批年轻创业者入局的赛道,早已不是大众印象中基础人工标注、通用问答数据集的传统外包生意,而是一套向AI智能体迭代、具备闭环运行、结果可验证、支持自主试错能力的全新训练服务体系。
伴随全球AI产业正式迈入Agent爆发周期,一个值得深思的问题随之而来:为何一批年轻创业者创办的数据公司,能密集收获顶级资本重仓、实现百亿级估值跨越?当AI从预训练问答时代迈入Agent自主进化时代,数据赛道的需求结构、业务形态与估值体系发生了怎样的范式重构,又将重塑中国AI数据行业的未来走向?
全球AI数据创业潮全面兴起
Agent范式的兴起,正在重塑AI上游数据赛道的价值逻辑。一批由年轻技术人才创立的数据基础设施公司集中走入资本视野。
AfterQuery正是本轮浪潮当中最具代表性的案例。公司两位联合创始人斯宾塞·马蒂加、卡洛斯·乔治斯库,年仅23岁与22岁,创立企业之时仍在校读书。二人加入硅谷知名创业加速项目YC训练营,经过多次业务方向调整之后,最终确定聚焦大模型底层训练数据服务。
AfterQuery创始人 图源网络公开报道
该公司提供的产品包括监督微调及人类反馈强化学习数据、工具调用和电脑操作强化学习环境,以及定制训练集与模型评测。AfterQuery搭建平台,汇聚近十万名各行各业的专业从业者,输出专家推理数据集、强化学习训练环境与配套评测服务,彻底脱离基础标注的业务范畴。
这套成熟的解决方案,已经落地英伟达Nemotron3Ultra大模型的训练流程,也是英伟达官方技术报告当中唯一点名的数据合作服务商。根据《福布斯》援引知情人士消息,AfterQuery当前估值达到32亿美元,约合人民币215亿元。另有消息透露,公司目前已经实现盈利,新一轮融资的领投机构也基本确定。
同样站上行业风口的Mercor,创始团队同样是三名22岁的00后,CTO阿达什·希雷玛斯、CEO布兰登·富迪、COO苏尔雅·米德哈均为大学二年级辍学创业。Mercor最初的业务是依托AI完成简历筛选、岗位匹配与候选人资质审核,主要面向软件工程师、数理类技术岗位提供服务。企业快速扩张赛道边界,逐步将核心业务延伸至大模型评估、专业化数据标注领域。福布斯的数据显示,截至今年6月,Mercor年化总收入突破20亿美元,对比2月10亿美元的规模,半年之内营收实现翻倍增长。
Mercor创始团队 图源网络公开报道
另一案例来自有着12年大学生招聘平台运营经验的Handshake。2025年初,企业正式切入AI训练数据赛道,业务起步阶段年化收入仅维持在500万‑1000万美元;2026年1月,年化营收迅速攀升至5.5亿美元;第三方机构Sacra在当年4月给出的测算结果显示,其年化毛收入已经接近11亿美元。一年时间,Handshake的营收规模暴涨100倍。
梳理这些海外新晋的数据服务高估值玩家不难发现一条共性:企业不再单纯生产标准化问答样本、承接基础标注外包订单,业务重心集中在强化学习环境搭建、可验证任务数据集开发、Agent闭环仿真场景建设。资本市场也不再将其归类为人力服务企业,而是视作AI产业的核心基础设施,给到纯正科技公司的估值体系。
这股创业浪潮同样传导至国内市场,UniPatAI就是现阶段国内资本重点关注的项目。公司成立于2025年年末,创始人李宽曾就职于阿里通义实验室,核心团队大多来自月之暗面等头部AI企业。
UniPatAI专注搭建贴近真实业务场景的模型评测体系,配套输出训练、测评数据集,业务覆盖编程智能体、浏览器智能体、多模态视觉推理等方向,部分自研的基准测试集已经被海外AI实验室引用。它的角色早已不只是一名“AI考官”,业务边界持续拓宽:一边完成模型测试,一边配套训练数据;一边输出数据集产品,一边尝试将模型预测能力封装为标准化服务对外交付。
据市场公开报道,阿里计划领投UniPatAI3亿美元融资,推动企业估值来到25亿美元,腾讯、红杉中国等机构存在参投可能,不过交易条款尚未最终敲定。
这波热潮真正值得关注的,不是“年轻人卖数据又融了一笔钱”,而是AI训练数据的计价单位变了。过去,客户买的是一批图片、语音、文本和标签;现在,前沿模型公司更想买的是一套能让Agent反复试错、自动验收、持续产生奖励信号的工作环境。谁能证明自己的数据让模型在真实任务上多完成一步,谁才有机会从外包商变成“能力基础设施”。
纵向拆解:
AI产业需求结构的颠覆性变革
海内外大量青年创业公司获得高额资本青睐,并不只是赛道短期风口催生的结果,本质是AI数据产业内部的需求结构发生颠覆性转变,行业估值逻辑同步完成重构。
回望大模型预训练时代,整个行业的核心矛盾集中于数据总量的缺口。当时市场最迫切的需求是扩充数据集规模,对于数据精细化质量的要求相对有限。行业竞争比拼的核心是人力储备与标注交付产能,数据业务本质上属于人力外包服务。这套模式壁垒偏低,盈利空间受限,企业价值高度依附人力交付规模,行业内绝大多数企业很难拿到较高的资本市场估值。
随着Agent智能体技术快速落地,产业底层逻辑彻底反转。
2022年底ChatGPT正式上线,四个月之后OpenAI推出GPT‑4;GPT‑4迭代至GPT‑4o耗时13个月;进入2026年,GPT‑5.3、GPT‑5.4接连发布,两代模型的更新间隔缩短至一个月。
Anthropic的迭代节奏更快,5月底推出Opus4.8,仅仅11天之后,全新旗舰模型ClaudeFable5正式对外发布。模型迭代速度不断加快,实验室不断发现新的能力短板,市场对于定制化、高价值增量数据的需求持续走高。
现阶段通用文本数据集已经趋于饱和,大模型发展的瓶颈不再是知识储备不足,而是真实场景之下的任务执行、自主纠错能力短板。对应厂商的采购需求,市场已经不再盲目追逐海量问答样本,转而迫切采购闭环运行、支持试错、结果可验证、过程可复现的全套训练环境。
注:数字代表图谱所涉及的企业、产品应用或模型数量 来源:至顶智库整理绘制
数据采购行为,也从过去一年数次的阶段性项目,转变为常态化的日常采购。供给端随之做出调整,ScaleAI就已经将传统按月打包交付的模式,升级为API按需交付,客户提交标注任务之后,最快一小时就可以拿到生产级别的标签数据。
采购频次不断提升,单一项任务的数据体量同样持续扩大。模型所要学习的业务场景复杂度显著提高,一条训练样本不再是简单的文本修改,而是一套包含需求解读、多文件检索、跨文档修改、测试验证的完整数据包;单条样本对应的token规模,从数百个上涨至数万个。
采购频次提升、应用场景拓宽、单样本数据体量激增,三重因素叠加,直接将训练数据的整体市场需求拉高一个数量级。
头部企业的预算投入同样印证这一趋势。TheInformation的报道提到,Anthropic内部曾经规划单年投入10亿美元采购RL训练相关服务;OpenAI内部测算,2030年企业每年的数据相关开支将会达到80亿美元。
来源:20260916-深圳市人工智能行业协会-人工智能行业:2026全球人工智能展望报告 企业/产品/应用排序不分先后,至顶智库结合公开资料整理绘制
行业价值评判标准已经全面更新。预训练时代,企业核心竞争力取决于自有数据集的体量;Agent时代,原始数据本身的价值持续下降,真正具备高壁垒、高估值空间的,是可以支撑智能体持续进化的整套训练系统,以及真实业务场景的落地搭建能力。
对于数据服务商而言,核心竞争力不再仅仅是"数据产量"的比拼,更是行业理解深度、专家资源网络、复杂任务拆解能力的综合考验。能够为垂直领域提供"数据+知识"一体化解决方案的企业,将在AI产业深水区占据不可替代的位置。
横向分析:
AI数据服务业的中美估值差异溯源
既然海外聚焦Agent训练、模型评测的初创企业可以快速拿到高估值,国内以海天瑞声为代表的传统数据服务商,为什么很难获得同等水平的估值溢价?
中国的数据公司面对的是另一套商业现实。海天瑞声等企业,长期服务于智能语音、计算机视觉、自然语言处理和自动驾驶等领域。这些公司已经积累了交付体系、多语种能力和数据安全经验,但传统业务的财务表现也提醒市场:数据需求旺盛,不等于数据公司天然高利润。海天瑞声2025年营收为3.77亿元,归母净利润1411.85万元,净利率不足4%。增长存在,但项目型交付、人力成本和客户议价能力,仍在限制利润空间。
从某种意义上讲,中外数据创业公司的差别,不在于中国有没有数据,而在于谁在付钱、为什么付钱。海外头部AI数据公司的核心客户名单里,几乎攥着全球最能花钱的两类金主:顶级前沿AI实验室+国防部门。ScaleAI的核心客户覆盖OpenAI、Anthropic、Meta,同时手握美国国防部数亿级美元的长期合同,单份政府合同金额可达数千万美元,客户粘性极强,客单价长期维持在高位。
反观国内,AI数据服务商的客户以互联网大厂、央国企、各地政府项目为主,订单高度分散,单体客户贡献的营收规模有限;大部分订单依旧集中在低附加值的语音、图像基础标注业务,高价值的RLHF训练、模型安全测评订单占比偏低。
资本市场不同的定价逻辑,进一步拉大双方的估值差距。美国资本市场愿意将AI数据服务商视作底层基础设施,给出极高的远期估值溢价,定价的核心锚点,是企业未来十年在全球AI生态当中的战略位置。A股、港股市场对于数据企业的估值,更多基于短期现金流折现,很难给到和海外同等水平的长期生态溢价。
融资生态同样存在明显差异。美国AI赛道当中,主权基金、半导体巨头、云厂商共同形成体量巨大的长期资本池,资本愿意承担前沿赛道的高风险;国内AI数据行业资金主要来自产业资本与各地国资引导基金,投资方更加看重项目短期落地效果和产业协同价值,对于长期业务叙事的容忍度相对有限。
国内AI数据服务商
未来路在何方
看完海内外数据企业巨大的估值差距,一个现实问题摆在所有人面前:国内这批AI数据服务商,接下来到底该往哪里走?
艾瑞咨询给出了一组行业大盘预测,2024‑2029年,国内AI产业每年平均增速可以达到32.1%,到2029年整体市场规模有望突破一万亿元。万亿赛道就在眼前,但红利并不会平均分给赛道里的每一家企业。
先看供给端正在发生的真实变化。截至2026年8月,全国已经建成超过12.6万个高质量数据集,整体数据体量达到1815PB,短短五个月时间,规模涨幅就超过89%。规模快速膨胀的同时,行业的监管规则也在快速落地。目前高质量数据集的五项国家标准当中,已经有四项进入征求意见阶段,数据标注试点城市,也从最早7个城市扩充到39个。合规、标准化会成为行业接下来的硬性门槛。
赛道最明确的趋势,就是两极分化,新旧玩家的发展路径正在彻底拉开差距。
对于传统的基础标注服务商来说,市场依然留有生存空间。自动驾驶项目、政企数字化转型订单、大模型基础训练需求,会持续释放业务机会,企业营收可以保持相对平稳的水平。但短板同样很难改变,业务高度依赖人力、利润空间有限,行业内卷一直在持续。这也就意味着,这类企业的估值天花板十分清晰,它们更多只是AI产业链当中的配套服务商,很难真正分享到AI基础设施这一波高估值溢价。
与之相对的是,一批新生代创业企业瞄准Agent闭环训练、强化学习评测、复杂场景仿真等新兴赛道,更容易获得资本的青睐。但高估值不等于长期的经营保障,赛道马太效应会持续加剧,资源不断向少数头部团队集中。企业只有真正掌握场景仿真的核心技术,稳定对接大厂长期订单,才能够兑现市场给出的估值预期;仅仅依靠概念讲故事的创业项目,将会在行业洗牌阶段快速出局。
那国内能不能成长出对标ScaleAI、SurgeAI的龙头企业?其实从当前产业环境判断,直接复刻海外企业全球化扩张的路径,现实难度非常大。
海外数据巨头的成长根基,是一套面向全球市场的客户体系。国内企业很难照搬这套模式,更加务实的突围路线,是深度扎根本土产业生态。办公、工业制造、金融、医疗等垂直行业,就是最大的机会。未来企业比拼的不再是标注团队的人员规模,而是深度理解行业真实业务逻辑,搭建配套仿真训练、评测体系的综合能力,最终完成从人力外包商向AI基础设施服务商的转型。
AIAgent掀起的这一轮数据产业变革,从来不是一场简单的“年轻人创业造富”的资本故事。它本质上是AI产业分工的一次重新洗牌:数据不再只是一串静态的文本与标签,而是驱动智能体自主进化的核心生产资料。
海外初创企业凭借全新的服务模式收获资本热捧,既为国内行业提供了参照,也敲响了警钟。单纯追逐海外的估值神话没有实际意义,真正的竞争落脚点,从来不是复制一套商业模式,而是扎根中国本土的产业场景,补齐仿真训练、专业评测等核心能力。
国内数据服务商正站在转型的十字路口。摆脱人力外包的固有标签,深耕垂直行业的真实需求,把行业知识转化为可复用的智能训练体系,这才是中国AI数据行业真正的价值出路,也是本土AI产业能够长远发展的底层支撑。
文:几重山月 / 数据猿
责编:凝视深空 / 数据猿
红包分享
钱包管理

