【数智化人物展】美林数据寇二平:数据、模型与工程化是工业AI的三道大坎
2026-07-20 22:29:19
  • 0
  • 0
  • 0

寇二平

“【提示】2026第六届数智化颁奖典礼将于8月5日在北京举行颁奖点击可报名参加颁奖典礼丨此次人物榜单/奖项的评选依然会进行初审、公审、终审三轮严格评定,并会在国内外渠道大规模发布传播欢迎申报。

在今年的世界人工智能大会(WAIC)上,一位制造业CIO跟我说:"我们参加了许多培训,也尝试建了七八个智能体应用,但没有一个能在车间里真正用起来。现在特别焦虑,一方面想用但实在不知道怎么做。"

这句话我听了太多遍。2026年过半,AI的能力在飞速跃升,但工业现场的落地率并没有同步增长。这不是技术不够先进的问题,是整个行业还没有认识到工业AI场景落地真正的卡点在哪里。

过去几年,我们公司在高端装备制造和电力能源领域做了大量AI落地实践。我越来越确信一件事:工业AI落不了地,不是因为模型不够大,而是因为三道坎还没迈过去——数据、模型、工程化。这三道坎,每一道都不是靠砸钱或堆参数能解决的。

第一道坎:AI Ready的高质量数据集,到底怎么建

行业里有个共识:数据是AI的原料。但这个共识太笼统了,笼统到没有可操作性。

真正的问题是:企业手里有大量数据,但这些数据不是"AI就绪"的。Gartner对AI Ready数据有个定义——经过精心准备、组织并结构化,方便在AI中得到优化使用的数据。关键词是"精心准备"。工业企业的现实是:数据散落在各个系统里,格式不统一,语义不一致,质量参差不齐。76%的高管认为数据质量是AI落地的首要风险。

那企业构建高质量数据集的路径是什么?

我的判断是:不能从"数据有什么"出发,要从"模型需要什么"倒推。这就是信通院提出的"以模引数"——先定义模型需要什么能力,再反推需要什么数据,最后才知道要清洗什么、标注什么。顺序搞反了,就是花大量资源清洗了一堆用不上的数据。

具体路径上,AI Ready数据有三种形态:ML-Ready(特征化数据,服务传统机器学习)、LLM-Ready(语言化数据,服务大模型微调和知识库)、Agent-Ready(流程化数据,服务智能体)。同一个球磨机的振动信号,做成ML-Ready是提取频域特征做故障分类;做成Agent-Ready则是把整个诊断流程编码为智能体可执行的流程数据。加工深度完全不同,企业需要根据应用目标选择。

企业不需要一次性把三种数据都建好。务实的做法是选一个痛点明确、范围可控的场景,先跑通"采集—预处理—标注—质量验证"的完整闭环。我们在风机运检项目中就是这么做的:先完成8个核心知识库的构建,用T+6个月验证数据集价值,再用T+12个月扩展应用。先把一个场景打穿,建立信心和方法论,再规模化复制。

还有一个被严重低估的问题:数据标注的本质是多模态数据的结构化语义提取,它需要统一的业务语义支撑。而企业数据治理的成果物——主数据、数据标准、业务术语、指标标准——恰恰就是标注的标签来源。这意味着,传统数据治理不是过时了,而是比以往任何时候都更重要。高质量数据集建设不是另起炉灶,是在数据治理基础上向多模态、向AI应用场景的延伸。

第二道坎:大模型是全科医生,小模型是专科医生,不可偏废

关于模型选型,行业里存在两种极端:一种认为"大模型万能",什么都想用大模型解决;另一种认为"大模型不可控",退回小模型的舒适区。

我的看法是:大模型是全科医生,小模型是专科医生,两者不可偏废。

大模型擅长理解、规划、生成——它是"大脑"。但在工业现场,很多任务需要的是精准执行:实时监测设备工况、毫秒级故障定位、高频信号分析。这些任务,一个经过专门训练的小模型,效率更高、成本更低、部署更灵活。小模型是"工具",是"手"。

在风机运检项目里,我们用的是大小模型协同架构:大模型负责故障研判和检修方案生成,小模型负责实时工况监测和故障定位。两者配合,才是一个完整的智能体。

但比大小模型选择更重要的问题,是如何让大模型在工业场景里变得可信。

通用大模型的本质是语言统计——它在计算"最可能的token序列"。但在工业场景,"最可能"和"正确"之间隔着一条鸿沟。设备参数的安全阈值、工艺标准的约束条件、质量判责的业务规则——这些不是从语言统计里能学到的。

我的答案是:给大模型配一张"企业地图"。这张地图就是动态本体图谱。

基于本体论构建的企业知识框架有四层:概念层(企业有哪些核心业务对象)、关系层(这些对象之间是什么关系)、约束层(有哪些不能违反的规则)、实例层(具体的事实和数据)。大模型在这张地图里工作时,每一次推理都沿着本体定义的合法路径进行,输出必须通过约束层验证。解释不由AI"编造",而是推理路径本身。

这在技术路线上属于神经符号AI(NSAI)的实践。但我更愿意称其为NSAI的工程化实现——本体论+大模型满足了工程化的三个必要条件:组件间有明确的结构化接口(本体是神经与符号之间的API);天然满足工业级软件的可测试、可维护、可观测、可部署四个非功能需求;一套框架承载NSAI的三大范式。

从RAG到KAG再到OAG,是一个从"检索信息"到"理解知识"再到"构建认知"的跃迁过程。RAG只能检索片段,无法处理复杂逻辑;知识图谱增强了多步推理,但动态更新困难;而本体增强生成(OAG)把业务语义、规则和活动统一定义,支撑多智能体协同,这才是工业级可信AI的落地路径。

在出错成本极高的工业场景里,可解释、可控制、可回溯不是加分项,是准入门槛。本体论+大模型恰恰是当前技术条件下,唯一能同时满足"理解自然语言"和"保证推理可靠"这两个需求的路径。

第三道坎:工程化不是做项目
是建飞轮

如果说前两道坎是技术层面的,第三道坎是关于组织模式和工程能力方面的。

什么是工程化?工程化是低成本、标准件、可重复使用、可直接部署。一个AI方案如果每次都要从零开始定制,那叫手工作坊,不叫工程化。

但AI转型时代的工程化,面临一个根本矛盾:客户需求无法明确定义。

传统IT项目的逻辑是签合同、定需求、开发实施、验收交付。但AI不是这样。在AI转型阶段,客户自己也不知道AI到底能做到什么程度——他们需要的是和懂行的人一起探索。这不是需求不清晰的问题,是AI的价值本身需要通过实践来发现的。

这就是FDE(Forward Deployed Engineer)工作模式存在的理由。

FDE不是传统意义上的交付工程师。传统交付工程师是项目的执行者,按SOW完成既定任务,验收签字走人。FDE是客户业务的共同责任人,他站在产品研发和业务价值交付的交叉点上,与客户共同开发——我们称之为"联合创新"。

FDE的工作模式可以用一个无限循环来理解。公司侧(研发):需求规划→开发迭代→版本发布,FDE负责把客户现场的真实洞察持续输入产品路线图。客户侧(现场):场景洞察→落地部署→价值验证,FDE全程陪跑,打通"最后一公里"。两个循环通过FDE在交叉点持续双向流动——洞察回流驱动产品改进,能力输出驱动客户价值,形成一个自我促进优化的飞轮模型。

这个模式要跑通,关键在于把每次交付的成果要素化、标准化。FDE在客户现场做的事情,不能是一次性定制开发,而要持续沉淀为可复用的工程化资产:数据Ready模板、本体建模方法论、行业分析模型、智能体技能库。这些资产沉淀下来,下一次面对同类行业的客户就不需要从零开始——本体模型可以复用,数据标准可以继承,技能可以组合调用。这才是工程化的本质:最大限度地复用知识和能力,把边际成本降下来。

同时,FDE模式还有一个常被忽视的价值:锻炼团队。在AI时代,最稀缺的不是技术能力,而是"既懂行业又懂AI"的复合型人才。FDE在客户现场陪跑的过程中,深度理解行业know-how,同时把AI工程化方法论带回研发团队。这种双向的人才培养机制,比任何培训课程都有效。

我们在油气井工艺设计文档生成项目中验证了这个模式:基于本体与大模型构建"参数抽取→规则校验→人工复核→模板生成"的智能体,把工艺设计文档的编制周期从3天压缩到2小时。更重要的是,这个项目沉淀下来的参数本体、校验规则和模板,可以迁移到其他专业文档场景复用。一个项目的交付成果,变成了可复用的工程化资产。

写在最后

2026年,工业AI将从"模型竞赛"进入"工程化竞赛"。大模型的能力趋同是大概率事件。真正的差距将出现在三个地方:数据能不能AI Ready、模型能不能支撑可靠推理、场景能不能形成闭环飞轮。

这不是比谁的模型参数多,是比谁的地基打得牢。而地基这个东西,看不见、摸不着,但决定了你能盖多高的楼。

工业企业数智化转型最大的风险,不是技术落后,是认知惯性——用信息化的思维去做智能化的事,用项目制的逻辑去管AI的价值。不打破这些惯性,再先进的技术也只能停留在PPT里。工业AI落地必须跨过数据、模型和工程化的三道坎。

·申报人“寇二平”简介:

寇二平,美林数据技术股份有限公司AI应用研究院院长。长期专注于工业大数据、数据治理与工业AI应用领域,致力于推动AI技术在高端装备制造、电力能源等行业的工程化落地。

 
最新文章
相关阅读