75:EAP工程师全套运维排查工具使用教学

一、本课学习目标

  1. 完整区分五大类运维工具:基础网络工具、抓包解析工具、日志分析工具、GEM模拟器、服务器监控工具
  2. 掌握各类工具适用故障场景、常用操作命令、标准查看方法
  3. 学会故障分层排查工具使用顺序,从底层网络到上层协议逐级定位问题
  4. 明确量产环境工具使用限制、禁止操作与风险规避要点
  5. 能够独立搭配多工具组合排查复合型叠加故障,缩短故障MTTR

二、运维工具整体五大分类

  1. 基础网络连通工具:Ping、Telnet、端口扫描、路由查询
  2. SECS/GEM抓包解析工具:抓包、报文筛选、SxFy检索、时序分析
  3. EAP日志分析工具:日志过滤、关键字检索、异常统计、批量导出
  4. GEM设备模拟器:离线调试、报文模拟、新机预对接、故障复现
  5. 服务器资源监控工具:CPU/内存/磁盘/网卡负载实时查看

三、第一类:基础网络连通工具(故障排查第一步)

1. Ping

核心用途:检测三层IP连通性、网络丢包、传输延迟,判断网线/交换机/设备硬件故障
常用操作:

  • Windows长ping持续监控:ping -t 设备IP
  • Linux持续ping:ping 设备IP
    判定标准:持续丢包>0.5%会造成设备随机离线、T5心跳超时
    适用场景:设备OFFLINE、频繁闪断、报文延迟超时排查
    避坑:Ping通不代表HSMS端口正常,仅代表网络三层可达

2. Telnet

核心用途:检测目标IP端口是否放行,验证HSMS 7000/7001端口连通状态
操作示例:telnet 192.168.1.50 7000
现象区分:

  • 连接失败:防火墙拦截、机台HSMS服务未启动、端口未开放
  • 黑屏无报错:端口正常可达,故障出在HSMS参数/协议层面

3. 端口扫描工具

用途:批量扫描网段端口占用、排查IP冲突、闲置端口异常占用
使用规范:仅00:00-06:00低峰使用,禁止量产高峰扫描整网段,避免网络风暴

4. Traceroute路由追踪

用途:定位跨网段丢包节点,排查交换机、网关转发异常
适用场景:跨VLAN设备间歇性断线、报文往返延迟过高

四、第二类:SECS/GEM抓包解析工具(协议类故障核心工具)

1. 抓包软件通用操作流程

  1. 选择业务网卡开启抓包,过滤目标设备IP,减少冗余报文
  2. 设置过滤条件:HSMS端口7000、设备IP、SxFy报文关键字
  3. 保存抓包文件,故障时段报文单独归档留存用于复盘RCA

2. 典型故障报文识别

  1. 无S1F1应答:设备HSMS服务未启动、DeviceID不匹配
  2. S7F3下载Recipe返回FAIL:参数越限、存储空间不足、名称不匹配
  3. S5F1报警报文缺失:机台Alarm Report开关未开启、EAP未订阅ALID
  4. S6 Trace报文大量延迟:采集测点过多、服务器负载打满

3. 工具使用红线

禁止长期持续抓包(占用服务器磁盘、拉高CPU),故障定位完成立即关闭抓包

五、第三类:EAP日志分析工具

1. 日志筛选核心关键字(快速定位故障)

Connect、Disconnect、Timeout、Error、Fail、Alarm、Recipe、Memory Full、Disk Full

2. 常用筛选功能

  1. 按时间区间筛选:仅导出故障发生前后30分钟日志
  2. 按设备IP筛选:单独提取单台设备通信日志
  3. 批量检索报错统计:统计单日断线、报错总次数,定位重复故障

3. 日志导出规范

涉密日志导出必须走审批+脱敏,抹除产品Lot、工艺参数后才可交付厂商

六、第四类:GEM设备模拟器(调试预对接专用)

核心用途

  1. 新机台进场前预调试EAP配置,无需占用实物机台
  2. 复现线上复杂故障,模拟报警、Lot流转、Recipe下发、Trace采集
  3. 版本升级前完整功能测试,提前发现配置兼容问题

标准调试流程

  1. 模拟器配置对应机型DeviceID、IP、点位ALID/SV/DV/CEID
  2. 模拟完整自动化流程:联网→下发Recipe→Run加工→LotEnd闭环
  3. 模拟各类异常:通信断线、报警触发、Recipe报错、Trace数据缺失

使用场景:测试环境专用,禁止模拟器接入量产业务网段

七、第五类:服务器资源监控工具

监控四大核心指标及对应故障

  1. CPU使用率:持续>80%,报文解析延迟、T3超时、设备断线
  2. 内存占用:持续>80%,内存泄漏、服务闪退、OOM崩溃
  3. 磁盘使用率:>80%预警,>90%日志无法写入、业务卡死
  4. 网卡带宽/丢包:带宽打满、持续丢包引发批量离线

日常巡检操作

每日早班开机前查看20分钟资源曲线,提前预判负载瓶颈,拆分设备、精简Trace测点优化负载

八、故障排查标准工具使用顺序(由底层到上层)

  1. Ping+Traceroute:确认网络链路无丢包、无中断
  2. Telnet:校验HSMS端口正常开放
  3. 服务器监控工具:排查服务器资源瓶颈
  4. 抓包工具:分析SECS/GEM报文交互异常
  5. 日志工具:检索报错日志,定位业务逻辑问题
  6. 模拟器:离线复现故障,验证优化方案效果

九、量产环境工具使用硬性红线

  1. 量产高峰禁止长时间抓包、全网段端口扫描,避免网络风暴
  2. 抓包、日志导出涉密报文数据必须执行审批脱敏流程,禁止私自外传
  3. GEM模拟器仅允许在测试网段运行,禁止接入生产VIP/业务网段
  4. 磁盘占用超90%优先清理过期日志,禁止长期满盘运行再排查故障
  5. 工具产生的抓包、日志文件统一归档,故障复盘完成后定期清理,不长期占用磁盘

十、本课核心总结

  1. EAP运维工具分为网络、抓包、日志、模拟器、服务器监控五大类,各司其职覆盖全部故障场景
  2. 排查遵循从底层网络到上层协议的顺序,先确认链路、服务器资源,再分析报文与业务日志
  3. 抓包工具是定位SECS/GEM协议异常的核心手段,模拟器用于提前预调试、复现线上故障
  4. 所有工具在量产环境存在使用限制,严格遵守低峰操作、涉密数据审批两条核心规范
  5. 多工具组合搭配可快速定位复合型叠加故障,有效降低故障平均恢复时长MTTR

十一、课后小作业

  1. EAP运维排查工具分为哪五大类?
  2. Ping与Telnet分别能排查什么问题,Ping通能否代表HSMS通信正常?
  3. 抓包工具过滤哪些核心内容可以快速定位设备故障?
  4. GEM模拟器有哪三类核心使用场景,量产环境有什么使用限制?
  5. 服务器监控四大指标出现高负载会分别引发什么量产故障?
Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐