摘要:本文从工业现场智能化改造的实际项目出发,分享边缘侧本地数据运算处理单元的设计、选型和调试的落地经验,所有内容都来自实际踩过的坑,适合有一定基础的中级工程师参考。
上个月给华东一家汽配厂做冲压线在线缺陷检测改造。甲方一开始铁了心要做全云化部署,说能省本地硬件钱。我们磨了半天嘴皮才同意加一块边缘侧本地数据运算处理单元。
上线那天测响应,云端处理平均延迟120ms,边缘本地处理平均不到8ms。刚好满足冲压机下料分拣的10ms 硬实时响应要求。差这一百毫秒,分拣错漏率从1.2%降到0.03%。这就是本地处理的价值。
为什么工业现场非要留一块本地处理单元
很多人现在一搞智能化就喊上云。云确实香,能做大算力集群分析。但放到现场,很多场景根本玩不转。
第一是响应要求。工业控制、实时检测,差个几十毫秒就是合格品和废品的区别。云端走公网,波动大到你不敢信,早晚出大事。
第二是带宽成本。一百台冲压机,每台每秒传3张1080P缺陷图,一个月的专线带宽费,够买三块全新的工业级边缘单元。三年下来,成本差出十倍。
第三是数据安全。很多汽配、军工的加工厂,不允许现场生产数据出工厂园区。所有运算必须本地完成。这个是硬性要求,没得谈。

核心设计:算力冗余和功耗散热的死局怎么破
说实话,选型的时候我见过太多人走极端。要么为了省成本,拿消费级开发板凑数,算力刚卡着需求留,一点余量都不给。要么就是盲目堆算力,什么大模型都能跑,结果功耗炸了,现场装不下。
按照GB/T 39161-2020 物联网边缘计算通用规范,工业级边缘单元的算力选型必须留15%~20%的动态冗余,应对现场多任务并发的情况。但也不是越多越好。
我给不同场景整理过一个大概的参考:如果只是做设备振动的预测性维护,采集数据做本地阈值判断,0.5TOPS的INT8算力足够。如果是单路1080P30帧的视觉缺陷检测,2TOPS刚好。四路以内的多相机检测,4TOPS足够。再多,你就得考虑散热了。
工业现场的安装空间大多卡死。大部分改造项目,边缘单元只能塞到控制柜的1U闲置位置里。不能装带过滤网的风扇——现场的铁屑油污不出三个月就堵死,风扇停转直接烧核心。只能用被动散热。
我做过实际测试,1U标准安装空间内,铝挤被动散热最多压8W的持续功耗。刚好对应2TOPS的INT8算力,功耗不到7W。你要是非要上个8TOPS的模块,功耗直奔20W,被动散热根本压不住,夏天车间温度上40度,不出一周就降频错运算。
我三年前第一次做这种项目就踩过这个坑。为了追求一步到位,选了高算力模块,结果夏天炸了三台,连夜拆机改被动散热片,折腾了一周。真的欲哭无泪。

现场调试的隐形坑:你很容易忽略的电磁兼容

就算你算力选对了,散热也做好了。还是很容易翻船在这个点上。电磁兼容。
工业现场什么东西最多?变频器、伺服电机、大功率电焊机。一开起来,整个控制柜的电磁干扰能翻几十倍。你拿消费级的板子,没有屏蔽,没有隔离,一开机数据跳的你看不懂,运算结果错漏一大堆,你找半天都找不到问题出在哪。
还是刚才那个汽配厂的项目,一开始图便宜,拿了一款树莓派改的开发板,参数看起来完全够,省了快两千块。结果一启动冲压机的伺服电机,单元的算力直接掉了30%,检测错漏率直接冲到2%,根本没法用。
最后测EMC才发现,这款开发板根本没做工业级抗扰设计,连电源都没有隔离。遇到伺服的脉冲干扰,直接丢指令。后来换成带隔离电源、全金属屏蔽壳的工业级模块,错漏率直接下来了。
记住,工业用的边缘侧处理单元,必须过GB/T 17626.2-2018 静电放电抗扰和GB/T 17626.4-2018 电快速瞬变脉冲群抗扰的三级以上认证。这点钱真的省不得。
现在圈子里都在吹大模型吹云原生,好像不搞全云化就是落后。其实我干了十几年工业改造,最深的感受就是,适合现场的才是最好的。很多场景下,一个设计得当的边缘侧本地数据运算处理单元,成本只有全云化方案的三分之一,可靠性还高好几个量级。少踩几个坑,比什么都强。