AI制造

数据治理先于模型

AI制造

数据治理先于模型

制造业AI落地最大的坑不是模型,是数据;把数据准备当成独立能力单元经营,才是模型能跑起来的前提。

数据治理先于模型,是制造业 AI 落地被反复验证的一条铁律:在模型上线前先把散落在 12 个业务系统的生产数据统一成可训练资产,某标杆工厂的视觉质检漏检率从 4.2% 降到 0.3%、模型迭代周期从 6 周压到 4 天——但前提是,数据治理被当成一个独立的能力单元来经营,而不是顺手捎带。工厂该不该先买大模型?先看看自己的数据有没有"可被模型吃"的样子。

案例速写

华东一家年产值约 30 亿元的装备制造企业,2024 年想上"AI 质检 + 工艺参数推荐"。第一年他们直接采购了一套工业视觉大模型,结果上线三个月,漏检率不降反升,产线老师傅拒绝使用。复盘发现,问题不在模型:12 个业务系统(MES、QMS、设备物联网、ERP、工艺卡片……)里同一台设备的"合格标准"有 7 种写法,历史缺陷图片 60% 未标注或错标,模型吃进去的是一堆互相打架的脏数据。第二年他们换打法——先花 9 个月做数据治理,再上模型,才跑出上面那组数字。

转型动因

制造企业上 AI,最常见的冲动是"别人有模型我也要有"。但模型只是冰山一角,水下是数据。工厂的数据天然分散:设备点位、工艺参数、质检结论、物料批次各管各的,且大量沉淀在老师傅的经验和 Excel 里。没有统一口径,再强的模型也只是"用噪音拟合噪音"。这家企业的痛点很典型——不是没有数据,而是数据不可被机器消费。

技术嵌入

治理动作分三层:一是实体对齐,给每台设备、每个缺陷类型建唯一编码,把 7 种"合格"定义收敛成 1 个;二是标注闭环,把老师傅的判废经验结构化成标注规范,用"标一批→模型初筛→人复核"的方式滚动积累可信样本;三是版本化,每次数据更新打标签、可追溯,模型训练只用通过质检的版本。技术上不复杂,难的是把这三件事变成日常制度。

能力单元分析 ★ 必填

这是本文的关键。用能力单元论看,这家企业之前把"数据准备"和"模型推理"揉在同一个岗位里——工艺员既要懂业务又要懂标注,结果两项都做不深。治理的本质,是把"数据资产能力单元"从"模型推理能力单元"中分离出来:前者负责采集—清洗—标注—质检—版本化,产出标准化的"可被模型吃的数据";后者只管调用这份资产做训练和推理。调度逻辑随之翻转——从"人找数据、找到再用",变成"数据找模型、模型随取随用"。更妙的是,一份干净的数据资产,可以被质检、排产、工艺推荐多个模型单元复用,这正是"复用率"支柱在制造现场的体现。

组织变阵

分离之后,企业多了一个新角色:数据治理专员(可由工艺员转型),不再背产量指标,只背"数据可用率"。IT 部与工艺部从互相甩锅,变成联合定义"合格"标准的联席机制。老师傅的经验没有消失,而是被沉淀成标注规范——人退到定义规则的层位,机器做重复执行。这不是取代人,是把人的高价值能力单元挪到更上游。

ROI 兑现与踩坑

兑现很实在:漏检率 4.2%→0.3%、模型迭代 6 周→4 天、老师傅从"每人盯一条线"变成"管一池模型"。但踩坑也真实:第一,数据治理本身不直接产生营收,老板前 6 个月看不到回报,极易中途砍预算——必须用"模型上线后的省人/降损"反推治理价值;第二,标准打架,IT 部的"系统字段"和工艺部的"现场经验"对"合格"理解不同,不坐到一起定标准,治理永远卡住;第三,历史数据太脏,标注成本可能超过模型训练成本,该弃的历史库要敢弃;第四,组织抵触,把经验结构化等于让老师傅"交枪",要用署名权和分红设计换配合。

可迁移方法论

用四则法抽象:
  • 除法:把"上 AI"拆成数据准备 / 模型 / 评估三个独立单元,别一锅炖;
  • 乘法:同一份干净数据供多个模型复用,一次治理、多次变现;
  • 减法:砍掉永远用不上的历史库和不可标注的脏样本,别贪全;
  • 加法:补一条实时数据回流,让模型天天吃到新样本,避免"上线即过时"。
数据治理先于模型,不是口号,是把"数据"这个被忽略的能力单元,认真经营起来的结果。模型会越来越便宜,能被模型吃的数据,才是制造企业真正的护城河。
场景学社
AI制造
扫码在手机上阅读 · 转载请注明出处与永久链接
© 2026 场景学社 保留所有权利