【AI制造】强化学习排产调度:让排产从"5人10小时"变成"15分钟
强化学习排产调度,是让AI智能体在"订单—设备—工时"约束下反复试错、自己学会最优生产序列的方法。蓝沃智能把高铁零件厂排产从5人10小时压到15分钟、逾期率从16%—18%降到个位数。它回答了一个老问题:排产能不能不再靠老师傅拍脑袋?能,而且已经在工厂落地。
强化学习排产调度,是让AI智能体在"订单—设备—工时"约束下反复试错、自己学会最优生产序列的方法。蓝沃智能把高铁零件厂排产从5人10小时压到15分钟、逾期率从16%—18%降到个位数(据蓝沃智能公开案例)。它回答了一个老问题:排产能不能不再靠老师傅拍脑袋?能,而且已经在工厂落地。
一、案例速写:一家高铁零件厂的排产革命
高铁零部件制造是典型的"多品种、小批量、强交期"场景。一家为轨交配套的企业,每天要处理上百张工单、几十台数控机床的排布。过去,这道工序由5名计划员手工排产,从订单导入、设备负荷核算到工单下发,一轮要干满10个小时,遇到插单还得推倒重来。
据蓝沃智能2025年公开的落地案例,引入强化学习排产引擎后,系统把排产时间压缩到15分钟以内,订单逾期率从原先的16%—18%降到个位数(据蓝沃智能官网案例页)。这不是"快了一点",而是把排产从一项高人力、高经验的重活,变成了一道可重复、可审计的计算。
二、转型动因:老师傅会退休,订单不会
制造企业上马AI排产,动因几乎都一样:计划员是稀缺资源,且不可复制。
一位资深排产员的价值,在于脑子里装着"哪台设备今天状态好、哪批料急、哪个客户不能得罪"的隐性知识。问题是,这种知识随人走、随人变,一旦请假、离职、退休,排产质量就断崖。而订单波动、插单、设备故障是常态。人工排产在"稳定"二字上天然脆弱。
更深一层的压力来自交付节奏。下游主机厂对准时率的要求逐年抬升,逾期不仅罚款,还会掉进"信用降级—份额缩减"的循环。排产不准,是制造业最隐形的利润漏点。
三、技术嵌入:把排产变成一个"学会玩游戏"的问题
强化学习(Reinforcement Learning,强化学习)的核心,是让智能体在环境里不断试错、用奖励函数引导它收敛到最优策略。把它用在排产上,工程做法是:
- 状态空间:当前未排工单、每台设备负荷与状态、在制库存、交期日历;
- 动作空间:把某工单分配到某设备、某时刻开始;
- 奖励函数:准时交付加分、设备闲置扣分、工序冲突重罚、换型损耗减分。
四、能力单元分析 ★
用能力单元论(王甲佳,2007)的视角看,强化学习排产真正改变的,不是"算得更快",而是既有能力单元被重新分离与调用。
过去,排产是一个"打包"能力——计划员把订单理解、设备认知、经验判断、冲突协商揉在一起,不可分割。AI把它拆成了三个可独立调用的单元:
- 订单理解单元:结构化读取交期、工艺路线、物料齐套状态;
- 约束求解单元:在设备与工时约束下搜索可行序列(这部分交给强化学习智能体);
- 人机协同单元:把AI方案呈现给计划员,由人做最终确认与例外处置。
五、组织变阵:计划员没有消失,位置变了
一个常见误解是"AI排产=裁计划员"。真实落地里,计划员的角色从"排产执行者"转向"排产治理者":定义奖励函数的业务权重、处理AI兜不住的例外、把插单策略翻译成系统参数。
岗位协作也从"计划员闷头排、车间被动接"变成"系统与人对拍"。个别企业甚至出现新的岗位——排产算法运营,专门负责模型效果的持续调优与反馈闭环。
六、ROI兑现与踩坑
数据很好看,但坑也真实:
- 奖励函数设计是门手艺。准时率权重给太高,AI会拼命抢设备、牺牲换型损耗;给太低,又回到"看起来很忙、交付照样迟到"。权重调不对,模型就是个精致的摆设。
- 数据质量是地基。设备状态、工时标准若长期失真,强化学习再强也是"在错误地图上找最优路径"。某厂上线半年效果反复,最后发现是工时定额库三年没更新。
- 冷启动期会退步。模型刚训练完,在前几百张工单上可能不如老师傅。组织得有"容忍短期下滑"的心理账户,否则项目容易被叫停在黎明前。
七、可迁移方法论:用四则法抽象
把这件事抽象成场景四则法:
- 加法(加):在原有排产上叠加"约束求解单元"与"策略模型",能力总量变大;
- 减法(减):减去5人10小时的手工重复劳动,减去隐性知识随人流失的风险;
- 乘法(乘):一套排产模型×多工厂多产线,复用率被放大;
- 除法(除):把"排产"这道大能力,除成可独立调用的子单元,谁需要谁取用。
