“一家数据公司,凭什么说自己是“基础设施”?
“算力是你有钱就可以解决的,数据可不是你有钱就能解决的。数据里面有很多corner case,你有钱也不好解决。”
采访刚开始不久,李逆勇就说了这句话。
他是一家叫“本原智数”的公司的创始人。这家公司不做AI模型,只做数据。2026年6月,它刚刚并入港股上市公司千百度。
放在五年前,“数据”这个词在AI圈还是一个配角。大家聊参数、聊算力、聊模型架构,数据只是“喂”给模型的东西,量大管饱就行。
但今天,情况变了。
剑桥大学的一项研究显示,截至2025年,互联网公开高质量文本数据已消耗超过70%。AI过去十年赖以生存的“数据自助餐”正在关闭。
与此同时,AI本身也在进化。它不再满足于“学知识”,正在进入“学干活”的阶段。从写代码到做PPT,从开汽车到操作机器人,AI的每一次能力跃迁,背后都是数据需求的一次升级。
而数据服务这门生意,也在被重新定义。低端数据标注的毛利率不断下滑,但高端数据,专家轨迹数据、具身操作数据,正在成为一个数千亿甚至万亿级别的市场。
这篇文章基于对李逆勇的独家专访,试图回答三个问题:AI数据行业到底在发生什么?本原智数在做什么?下一个五年往哪走?
AI已经把互联网上的“好东西”学完了
接下来怎么办?
过去十年,AI靠“吃”互联网公开数据长大。
接下来,它靠什么继续进化?要回答这个问题,得先搞清楚AI到底在学什么。
从“婴儿”到“白领”,AI的学习在升级
“我们现在所做的,本质上只有一件事:把人类的知识和经验萃取出来,投喂给AI。 ”
李逆勇用这句话,概括了数据服务行业的本质。而萃取什么样的经验,取决于AI进化到了哪个阶段。
他梳理了一条清晰的“演进四步法”:
这个演进有一个清晰的方向:AI正在从“模仿感官”走向“模仿工作”。
前两个阶段,AI学的是“这个世界是什么样的”,声音对应什么文字,图片里有什么物体。这些任务相对简单,数据也相对好找。
但从自动驾驶开始,AI进入了“在这个世界里怎么干活”的阶段。开车不是单纯地“看到”路况,而是要在复杂的三维空间中做出一连串决策。这需要的数据,已经不是简单的图片标注能解决的。
到了大模型时代,AI要学的是人类的语言能力、逻辑能力、推理能力,属于白领的工作技能。而且,它正在从“初级白领”走向“高级白领”。
李逆勇举了个例子:“以前做代码任务的时候,可能单轮交互就完成了,你给我一个需求,我给你一段代码。现在可能需要10轮以上的交互。解决一个系统化的软件工程问题,和写一个简单的小程序,数据难度完全不是一个量级。”
核心变化是,AI正在从“学知识”走向“学干活”。而干活的数据,互联网上没有现成的。
三个真相,看懂数据行业的“冰火两重天”
既然AI要学的东西变了,那数据行业本身也在被彻底重塑。一边是低端数据标注的毛利率下滑,同质化竞争卷到无利可图;另一边,专家数据、具身数据的缺口在急速扩大,需求方愿意为一条高质量数据付出几百甚至上千元。这种“冰火两重天”的背后,是三个正在发生的根本性变化。
真相一:公开数据见顶了,但AI还得继续学
剑桥大学的研究不是孤例。整个行业都在意识到一个问题:过去十年用来训练AI的互联网公开数据,快被“吃”完了。
以前靠什么?维基百科、Reddit、GitHub、Common Crawl……这些公开语料库支撑了GPT、Claude、DeepSeek等一代代模型的预训练。
但这些数据是“存量”,它们被消费的速度远超生产的速度。接下来的问题是:模型还要继续训练,数据从哪来?
真相二:算力是“有钱就买得到”的,数据不是
这是容易被忽略的一个区别。
算力是标准化的商品。GPU就是GPU,只要有足够的钱,随时可以下单,等几个月就能到货。
但数据不是。高质量数据,一份投行分析报告、一份三甲医院的病历标注、一份资深律师的合同批注,这些东西不在互联网上,也不会公开出售。它们散落在企业内部、专家的大脑里、真实的生产流程中。
真相三:合成数据是“没办法的办法”,不是“更好的办法”
行业里有人把合成数据描绘成“未来的主流”,但李逆勇的判断很直白:“没有人会真正想用仿真数据。大家之所以用仿真数据,是因为没有那么多真实数据,没办法了才用。”
他以自动驾驶为例:头部公司的数据集中,99%是真实道路数据,只有1%是仿真,因为极端天气、事故场景实在采集不到,但又不能完全没有。
一组数据,看懂这个市场有多大
理论说完了,来看看数字。这些数字背后,是一个正在被重新定义的市场,它的边界在急速扩张,体量在以惊人的速度增长。
数据行业的“冰火两重天”有多悬殊?看几组数据就知道:
- OpenAI每年花在数据上的钱:50亿美金。
- 字节、阿里、腾讯三家每年数据综合预算都在数十亿量级。
- 今年上半年具身智能赛道融资约200亿,其中40-60亿流向数据采购。
- 具身数据采集成本目前约100元/小时,行业第一个门槛是100万小时,也就是1亿人民币。
- 而最终可能需要10亿小时级别,对应的市场规模,是数千亿甚至万亿级别。
李逆勇算了一笔账:头部智驾公司对外公布的道路数据是1亿小时。具身智能比自动驾驶多一个维度,不是二维的道路环境,是三维的物理世界。“所以至少需要10亿小时。”
而目前全球单家数据公司做得最多的,也就100万小时。
从100万小时到10亿小时,差了三个数量级。
这意味着什么?意味着这个行业才刚刚开始。
一家不做模型的“数据公司”
如何重新定义自己?
市场变了,需求变了,规则也变了。传统的数据标注公司,那种“客户给什么标准就标什么”的施工队模式,正在被淘汰。新的玩家正在重新定义“数据服务”这件事。
本原智数是其中之一,它选择了一条不一样的路:不做模型,只做数据;不被动执行,主动定义标准。这条路走得通吗?它凭什么?
本原是谁?
本原智数给自己的定位是:AI全生命周期数据服务商。
不做模型,只做数据,覆盖数据采集、清洗、标注、合成、评测到智能体落地。
这个定位有一个关键前提:中立。
“我们不构建自己的人工智能模型,因此不与任何一位客户争夺生意。”李逆勇在公开信中写道,“那些在市场上彼此竞争的伙伴,才能同样安心地与我们合作。”
2026年6月,本原智数正式并入港股上市公司千百度。有人好奇“鞋企+数据公司”的组合,但李逆勇的解释很清晰:千百度不做AI模型,不跟本原任何客户竞争,本原最珍视的“中立性”被完整保全了。
“曾有国内的大模型厂商给我们抛出过橄榄枝,希望我们并进去。但我们的底层思考是:一个独立第三方的数据公司价值非常高。 我们不希望变成某一家模型公司的数据部门。”
“三次跃迁”,理解本原战略的核心框架
李逆勇在采访中系统阐述了本原的“三次跃迁”。这不仅是公司的成长路径,也是整个AI数据服务行业的价值升级路径。
第一次跃迁:从“施工队”到“标准共建者”
过去,什么是“好数据”由模型厂商的算法科学家定义,数据公司只管“按图施工”。
但今天,模型厂商自己对“好数据”的定义能力在减弱。
为什么?因为数据越来越贴近真实任务。AI要学的是“如何写一份行业分析报告”“如何审一份合同”“如何做一份PPT”,这些任务的好与坏,算法科学家说了不算,行业专家说了算。
本原的破局方式:先评测,再生产。
“原测”平台先测评模型的能力短板,再告诉客户:“你如果想提升某项能力,需要这样的数据集。”
能做到这一点,是因为本原服务了大量模型公司,积累了全行业的know-how。同时,本原与斯坦福、伯克利、清华、交大等海内外顶尖院校共建学术基准。
第二次跃迁:从“通识数据”到“专家数据”
预训练阶段已经结束,现在进入post-training阶段。模型需要的不再是“通识知识”,而是“干活的能力”。
要教AI干活,需要两类专家数据:
学科型专家:解决“单点很难”的任务,数学证明、物理推理、高难度代码
实践型专家:解决“长链复杂”的任务,开车、审合同、做行业报告
专家稀缺怎么办?本原的解法是“分层生产”:“以医疗为例,最顶级的主任医师定义标准、拆解流程。流程拆到足够细之后,主治医师甚至医学院的博士生也可以来填充细节。”
既保证了框架质量,又实现了规模化。
本原的“原识”平台连接了10万+行业专家,覆盖医疗、金融、法律等十余个高门槛领域。
第三次跃迁:从“小样本”到“规模化挺进”
“能生产100条高质量数据和能生产100万条高质量数据,本质是两种不同的团队能力。”
大模型的本质是scaling law,数据生产也需要scaling。
李逆勇介绍道,本原的交付体系是:科学家+专家定标准→全球12大交付中心稳定交付→800万众包网络弹性扩容。
人机协作下,标注效率提升600%,成本降低45%。
需要指出的是,“三次跃迁”不是口号,而是通过四个平台逐一落地的。
它们的逻辑关系是一条完整的链条:先评测模型能力短板(原测)→ 再组织专家规模化生产所需数据(原识)→ 帮企业把模型转化为可运行的智能体(原智)→ 最后从数字世界走向物理世界(原物)。
每个平台的核心功能:
- 原测:找出模型短板,把“AI能力提升”翻译成“需要什么样的数据集”
- 原识:专家触达、培训、分层生产的一站式平台
- 原智:帮企业用更小、更精准的数据,把模型转化为能干活的应用
- 原物:具身智能一站式平台,从数据采集到规模化落地
李逆勇特别强调“原智”的差异化:“有很多专门开发智能体的公司,也有很多模型公司在做这件事情。我们的差异化来自于对数据的理解,更知道在垂类场景中,用更小、更精准的数据帮你快速应用好模型。 ”
一个正在被验证的方向:具身智能数据
如果说“三次跃迁”是本原的方法论,那么具身智能数据就是它正在押注的主战场。
具身智能让AI从数字世界进入物理世界。但数据缺口巨大,MIT研究显示真实场景数据缺口达90%。
本原的技术路径是“Ego+软手”:Ego解决“理解世界”(第一人称视角的环境感知),软手解决“操作世界”(柔性操作完成精细动作)。
李逆勇强调,公司没有锁死在单一技术路线上:“硬手/夹爪能解决一部分任务,Ego+软手能解决另一部分任务。我们围绕真实任务需要,探索多种高效采集方式。”
更重要的是,本原不是“谈概念”,而是已经有了可验证的交付能力:
为某头部模型公司1-2个月交付10万小时数据,涵盖一两百种场景、一两千种任务
具身数据月产能年底能达到50万小时
全业务线月交付数据量达亿级
“我们不是在讲概念,”李逆勇说,“而是在用真实的交付能力,一步步拓宽智能的边界。 ”
下一个五年
出海、生态与AGI的终局思考
讲了行业变化,讲了公司定位。最后一个问题:下一步往哪走?
出海、生态、AGI,这三个关键词勾勒出了本原智数对未来五年的判断。
出海:与Scale AI的差距与差异化
本原的对标企业是Scale AI,全球估值最高的AI数据公司。
差距是客观存在的。Scale AI年营收二三十亿美金,本原数亿人民币。
“人家起步也早很多,海外整个市场也好很多。我们还是一个处于追赶的阶段。”李逆勇说。
但差异化也很清晰:
第一,性价比。 “我们可能以1/10的价格,做到跟美国公司同等的数据水平。”
第二,在某些领域不弱于海外。 中国的视频生成模型(seedance、可灵)比美国(Sora已关停)强,本原在视频数据领域不弱于海外同行。在具身数据领域,中国整体跟国外在同一尺度。
目前,本原智数的出海路径已经在推进:优先服务出海的中国企业和海外华人创办的企业,同步在越南、印尼、马来西亚、菲律宾建设交付基地。
李逆勇说道,“预计今年下半年到明年上半年,海外市场会有比较好的表现。”
“双十亿”计划:一个5-10年的战略布局
如果说出海是本原的“横向扩张”,那“双十亿”计划就是它的“纵向深耕”。
数博会上发布的“双十亿”计划,指向两个方向:
- 10亿条白领专家操作数据(Computer Use场景,做PPT、写报告、审合同)
- 10亿小时具身智能数据(物理世界操作,机器人干活)
为什么是10亿?“自动驾驶需要1亿小时道路数据,具身比自动驾驶多一个维度,所以需要10亿小时。”
根据李逆勇对市场规模的估算:
- 一条白领数据200-300元 → 10亿条对应两三千亿市场
- 一小时具身数据200-300元 → 10亿小时对应两三千亿市场
合计数千亿甚至上万亿。
这么大的规模,本原不打算自己做。
“不可能我们一家能完成的,”李逆勇说,“我们计划招募100家生态合作伙伴,通过订单驱动、标准制定、工具赋能来共建。”
采访的最后,我们问了一个问题:“如果AGI真的实现了,数据服务行业还存在吗?”
李逆勇的回答很坦诚:“短期两三年,我不认为会有特别大的进展。但长期10年20年的维度,会有比较大的变化。”
但如果AGI真的到来呢?“不是数据公司该想的问题,是整个人类都要重新想一想:人类真的需要工作吗? ”
回到数据服务行业本身,它正在做的事情,把人类经验萃取出来交给机器,本身就是这个时代最值得被记录的故事之一。
“我们站在智能系统与真实世界不断交互、不断学习、不断修正的连接处。每一次我们帮助模型突破一道能力边界,那道边界就永久地后退了一步。”
这可能就是本原智数这家公司,以及它所在的这个行业,在这个时代最大的意义。
文:月满西楼 / 数据猿
责编:凝视深空 / 数据猿
红包分享
钱包管理

