车间设备屏幕突然断连导致停机别急着换硬件先查网线供电IP地址和通信协议HMI系统连接中断排查与恢复指南
凌晨两点,产线突然停了。操作工跑过来喊:“触摸屏没反应了!”你过去一看,HMI黑屏,或者卡在登录界面一直转圈。第一反应往往是:“是不是屏幕烧了?赶紧换一块。”但先别急着下单买新硬件。我见过太多案例,最后发现就是一根被叉车蹭松的网线、一个DHCP地址悄悄漂移、或者PLC把通信端口给关了。HMI断连这事,十有八九是“路”断了,而不是“车”坏了。
把这件事想简单点:HMI和PLC通信,就像两个人打电话。网线是电话线,IP地址是电话号码,通信协议是双方约定好的方言,交换机是总机。电话线松了、号码改了、方言对不上,或者总机忙线,都会导致“打不通”。硬件损坏只是最后一种可能,而且往往排在排查清单的末尾。
先摸线、看灯、测电,别跳过最笨的一步
工业现场环境比办公室苛刻得多。灰尘、油污、震动、温差,都在悄悄侵蚀连接。HMI背后和交换机那边的网口指示灯,是你第一手情报。
- 绿灯常亮:物理链路通了。
- 绿灯闪烁:有数据在跑。
- 黄灯/橙灯:通常是百兆/千兆协商状态,别误以为故障。
- 灯全灭:先别动软件,换一根确认正常的网线交叉测试。
水晶头氧化、RJ45卡扣断裂、交换机端口进灰,都是高频翻车点。拔出来看一眼金属片是不是发黑,用无水酒精擦一擦,比直接换模块管用。
供电这块尤其容易被忽略。很多HMI用的是12V或24V直流电源适配器,车间电压波动大,适配器老化后输出电压掉到标称值的80%以下,屏幕会出现反复重启、花屏、或者半夜突然黑掉。拿万用表量一下输出端,别只看适配器上的标签。如果设备支持PoE(802.3af/at),那就得更小心:交换机PoE预算是有限的,一台交换机同时带4台HMI、2台摄像头、再加几个IO模块,很容易触发过载保护,导致部分设备间歇断电。去交换机管理界面看一下各端口的PoE功耗和状态,往往能直接定位问题。
IP地址:工业现场最常见的“隐形叛徒”
链路通了,接下来查IP。这一步能解决一半以上的“假性断连”。
很多产线为了省事,HMI和PLC都设成DHCP自动获取。平时好好的,一旦车间跳闸、交换机重启、或者配电柜除湿器启动,交换机重新分配地址,HMI可能从192.168.1.100变成192.168.1.105,但PLC程序里写死的还是192.168.1.100。通信瞬间断开,屏幕显示“连接失败”,但硬件一点毛病没有。
工业现场的铁律是:关键设备全部用静态IP。打开HMI的系统设置,确认IP、子网掩码、默认网关。注意子网掩码,255.255.255.0和255.255.0.0差一个层级,配错了设备明明在同一间车间却互相看不见。
用笔记本快速验证:
ping 192.168.1.100 -t
Windows下加-t可以持续ping,看延迟和丢包。稳定产线里,延迟应该在1ms~5ms之间,丢包率为0。如果偶尔跳到50ms以上,说明网络有拥塞或干扰;如果直接超时,优先查IP冲突或VLAN隔离。
再看ARP表:
arp -a
找到PLC和HMI的IP,核对MAC地址。如果同一个IP对应了两个不同的MAC,说明有设备偷偷上线抢地址了。工业交换机上最好把HMI、PLC、SCADA放在同一个VLAN,别和办公网、访客WiFi混用。跨VLAN通信需要路由器转发,多一跳就多一分断连风险。
通信协议:HMI和PLC得说同一种“方言”
IP对了,不代表能通信。HMI组态软件里选的驱动类型,必须和PLC实际开放的协议一致。这不是填个IP就行的事,而是双方要按同一套规则“握手”。
Modbus TCP 是最常见的老协议,默认端口502。很多断连案例就是因为端口被改了。有些PLC做安全加固后会关闭502,改用5020或50200;有些HMI工程师在组态里顺手改了端口号,自己忘了。验证方法很简单:
telnet 192.168.1.100 502
或者:
nc -zv 192.168.1.100 502
如果返回succeeded或端口开放,说明通道没问题;如果提示Connection refused,端口确实关了;如果一直Connecting...,多半是路由不通或被防火墙拦截。
Profinet 不走传统TCP/IP端口,它靠设备名称(Device Name)和DPRAM实时交换数据。HMI组态里的设备名必须和PLC在线时显示的名称一字不差。有些工程师复制了PLC工程,设备名没改,HMI自然就连不上。Profinet断连时,HMI通常报“设备未找到”或“名称解析失败”,这时候别去查端口,先去PLC侧看在线诊断。
EtherNet/IP 用CIP协议,默认端口44818。很多工程师习惯了查502,结果在AB系产线上白费功夫。验证方式:
nc -zv 192.168.1.100 44818
OPC UA 现在用得越来越多,但它的“断连原因”也更复杂。默认端口4840(非加密)或8443(TLS加密)。证书过期、信任链缺失、服务端策略变更,都会导致连接被拒。日志里通常会明确出现BadCertificateInvalid、BadSecurityPolicyRejected这类提示。遇到OPC UA断连,第一件事不是重启,而是去服务器上看证书有效期,以及HMI是否导入了最新的CA根证书。
让日志和抓包替你“问话”
别光靠猜,让设备自己把问题说出来。
HMI后台一般都有运行日志,路径通常在C:\HMI_Log\、/var/log/或者系统设置里的“事件记录”。关键词搜connect failed、timeout、authentication error、driver not responding。日志会告诉你断连发生在哪一秒、重试了几次、PLC返回了什么错误码。
PLC侧更要看。TIA Portal、GX Works2、Codesys这些编程软件都能在线监控通信状态。如果PLC显示Connection Active,但HMI一直报超时,问题大概率在HMI端配置或网络中间件。如果PLC显示Connection Lost,那就是PLC主动断开了,去看看是不是程序里写了通信超时复位逻辑,或者安全策略更新了。
抓包是最准的一招,听起来专业,其实门槛不高。装个Wireshark,接在HMI和PLC之间的交换机镜像端口上,或者直接用笔记本临时串进去。过滤条件按协议写死:
tcp.port==502 or tcp.port==44818 or tcp.port==4840 or tcp.port==8443
看报文行为:
- HMI发
SYN,PLC回SYN-ACK:握手成功,继续往下看应用层。 - HMI发
SYN,PLC回RST:端口拒绝,协议或端口配置错了。 - HMI一直
SYN重传:路由不通、VLAN隔离、或防火墙吞包。 - 应用层报文全是
00 00或乱码:波特率/字符集/字节序不匹配,Modbus里尤其要注意大端小端。
抓包不是为了显摆技术,而是让你一眼看清“谁在装死”。
恢复之后,别让它再空窗
断连修好了,别急着拍大腿庆祝。产线恢复只是第一步,防止下次再断才是真本事。
第一,立刻备份当前正常配置。HMI工程文件、PLC通信驱动配置、IP规划表、交换机端口配置,全部打包存到公司服务器,文件名带上日期和版本号。很多工程师等到下次断连才想起来找备份,结果翻遍U盘只找到三年前的旧版。
第二,加一层通信心跳监测。在PLC程序里写一段简单的轮询逻辑,每隔5秒检查一次HMI连接状态。断线累计3次,自动触发报警:亮灯、推送消息到维修微信群、或者上报MES系统。别等操作工发现停机再来找你。
第三,关键节点做冗余。预算允许的话,HMI和核心PLC之间上双交换机+双网卡,至少保证单点故障不会直接停线。预算有限也没关系,在HMI里开启“断线自动重连”,重连间隔建议设5~10秒。设太短,比如1秒,频繁握手会把PLC通信队列堵死,反而让本来能通的连接彻底卡住。
第四,建一份《产线通信拓扑表》。谁连谁、IP多少、端口多少、协议是什么、备用件型号是什么、交换机端口编号是多少,全部贴在电控柜旁边。下次断连,新人也能按图索骥,不用满车间找老师傅。这张表的价值,远超你换十块屏幕。
几个现场常踩的坑,提前避一避
- 网线别买家用超五类凑合。车间有变频器、伺服驱动器,电磁干扰强,至少上六类屏蔽线(CAT6A U/FTP),水晶头压完记得测通断。
- 交换机别放密闭电控柜底部。工业交换机长时间高温运行,电容老化快,表现为间歇丢包。留散热孔,或者挂壁安装。
- IP规划别拍脑袋。提前画好网段表,HMI、PLC、机器人、视觉、MES网关各占一段,别全挤在
192.168.1.x。预留20%的空余地址,方便后期加设备。 - 固件升级前一定先备份。PLC或HMI厂商推送安全补丁时,有时会调整默认端口、关闭旧协议、或者改变证书策略。不备份就升级,等于蒙眼过独木桥。
- 断连不要反复重启HMI。重启会清缓存,也可能触发HMI重新请求IP,反而掩盖真实问题。先查网络和协议,最后再考虑重启或重装系统。
车间设备断连,表面上是屏幕黑了,实际上是一场从物理层到应用层的连锁排查。网线松了就是松了,IP漂了就是漂了,端口关了就是关了。把这些基础项摸透,你会发现大部分停机根本不需要换硬件。把排查流程跑顺,把配置备份好,把心跳和冗余加上,下一次屏幕再闪断,你甚至能在操作工喊出来之前,就已经把产线拉回正常运行了。