ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

SDH网络故障应急处理实战:从告警定位到业务恢复

SDH网络故障应急处理实战:从告警定位到业务恢复 简介这是一份面向华为SDH传输设备运维人员的故障处理应急方法PPT系统梳理了从故障准备到现场定位、再到恢复业务的完整思路。内容涵盖SDH原理与告警机理、工程组网信息收集、常见仪表操作以及先外部后传输、先单站后单板、先高速后低速、先高级别告警后低级别告警等定位原则。重点介绍了环回法、替换法、配置数据分析法、告警性能分析法、仪表测试法和经验处理法的适用场景与操作步骤并配有故障案例分析如通过R_LOS、TU_AIS、LP_RDI等告警组合快速判断光路故障。压缩包内为1个PPT演示文稿大小约1.16MB适合需要提升传输网故障排查效率的现场工程师与网管维护人员学习参考。目前已有120人学习下载。 传输机房的值班电话在凌晨两点炸响网管界面一片红SDH网络多点告警客户那边业务已经断了。接过这种夜班电话的人都知道那一刻最考验人的不是会不会点网管软件而是能不能在一堆告警里理出一条清晰的应急思路。我在华为SDH设备上摸爬滚打了十几年处理过不少大大小小的传输故障有个很深的体会SDH应急处理方法比速度重要判断比动作重要。很多单位都有一份“故障处理应急方法”的PPT可PPT上列再多条目到了现场真正管用的还是排查逻辑和动手习惯。这篇内容不打算复述PPT目录而是把这些年沉淀下来的应急思路、告警判断、现场操作手段以及踩过的坑整理成一套可以照着用的打法适合传输网维护工程师、刚接手SDH网络的新人也适合正在制定应急演练方案的朋友。1. 动手之前先想清楚应急处理的三条铁律1.1 先恢复业务再定位根因SDH网络承载的往往都是2M、155M甚至更重要的生产业务故障发生时客户的真实诉求不是“你告诉我什么坏了”而是“赶紧让业务通”。所以在应急处理的第一分钟要先问自己一个问题有没有办法先让业务恢复比如触发保护倒换、临时调度空闲纤芯、用备用端口把业务拉通。先把业务抢回来再让网管和现场人员慢慢查根因这是传输维护里最核心的优先级。我见过不少刚入行的同事一上来就钻进“定位故障点”里拿着OTDR满线路测业务断了半天还不处理客户电话一个接一个。定责和排查当然要做但那是业务恢复之后的事。记住一个原则先恢复、后定位先抢通、后分析。1.2 先看光路再怀疑单板SDH设备本身是很稳定的真正让它出故障的多半在设备外面的光路上。尾纤断裂、法兰松动、光模块接口污染、光缆被挖断这些物理层问题占了SDH故障的大头。所以遇到告警尤其是光口类告警不要下意识怀疑光板坏了先拿光功率计测收光确认有没有光、光功率正不正常再动设备。这里有个经验之谈很多备件光板换下来检测是好的最后发现是尾纤脏了或者法兰没拧紧。先看光路不是口号是能省掉大量无用功的实操纪律。1.3 先留证据再动手操作故障现场的任何操作都会改变设备当前状态。告警截图、单板指示灯状态、光功率实测值、网管上的性能数据这些都要在动手之前先记录下来。不光是写报告需要更重要的是万一操作失误把故障扩大或者多个故障交叉出现原始记录能帮你快速回退不至于连自己做了什么都不清楚。我个人习惯是手机拍一张网管告警全屏图、拍一张设备机柜灯态照片再用本子记下关键参数。整个过程一两分钟但关键时刻能救命。2. 华为SDH常见告警怎么看一张速查表加三种判断逻辑2.1 五分钟认全高频告警华为SDH网管上报的告警名称看着多其实天天打交道的就那么十几个。这里列一张高频告警速查表列出的都是应急处理时最容易碰到的告警名称含义常见原因应急处理动作LOS信号丢失收不到光光纤断、尾纤脱落、对端光板不发光查光路、测光功率确认物理连接LOF帧失步收光但帧不同步光功率过低、接收模块劣化、上游信号异常测收光功率清洁接口必要时换光板MS-AIS复用段告警指示信号上游信号中断或劣化本端收到对端发的AIS往上游查看哪个站点最早产生LOSAU-AIS / TU-AIS高阶/低阶通道告警指示业务通道中断上游通道故障或配置异常结合业务路径逐段排查先倒换抢通HP-RDI / LP-RDI高阶/低阶通道远端缺陷指示对端检测到故障回告本端说明问题很可能在对端优先查对端B1/B2/B3 误码过限再生段/复用段/高阶通道误码性能越限光功率劣化、光模块性能下降、光纤老化测光功率清洁光路考虑更换尾纤或光板HP-SLM / LP-SLM高阶/低阶通道信号标签失配业务配置与远端不一致或对端VC12交叉配置丢失核对两端业务配置重新下发交叉这个表不用背用的时候对照即可。重点是理解“告警不是终点而是线索”每个告警都指向某个方向顺着方向查才不会被告警数量带偏。2.2 抓住告警之间的“上下游关系”SDH告警最迷惑人的地方就是“一个故障点会产生一串告警”。比如下游站点收不到光会报LOS上游站点则会收到对端的RDI回告中间网元可能还会报MS-AIS、TU-AIS。如果不看时间线很容易把真正的故障点淹没在告警风暴里。应急时我会先按“产生时间”排序找到最早出现的那条告警它往往最接近根因。然后顺着业务方向理一遍这条业务从A站到B站、再到C站哪一段的光路断了哪一端在回告告警的传播方向就把答案指出来了。把这个逻辑跑一遍大部分故障的定位范围能缩小到两站之间。2.3 区分业务中断告警与性能劣化告警告警也分轻重缓急。LOS、LOF、MS-AIS、AU-AIS、TU-AIS这类告警说明业务中断或即将中断必须立即处置而误码过限、指针调整这类属于性能劣化告警可能业务还没断但已经在恶化处置优先级可以往后放一放。很多人都犯过这个错网管上同时跳出一堆告警看到“误码过限”就赶紧复位单板结果把原本正常的业务硬生生搞断了。性能劣化告警的正确处理方式是先分析是哪个段落、哪个方向产生的误码再决定是否需要上站处理而不是一上来就“重启大法”。3. 应急操作四板斧环回、测光、复位、倒换3.1 环回法缩小故障范围的最快手段环回是SDH故障定位里最经典也最有效的方法。简单说就是把某个端口发出去的信号在设备侧或线路侧直接绕回来通过“信号走到哪一步断了”来判断故障区间。华为网管上可以做软件环回现场也可以拔插尾纤做硬件环回。举个例子某条2M业务不通先在网管上对该2M端口做内环回如果本端自环正常说明本端设备和交叉配置没问题再到对端做环回逐段压缩很快就能判断问题出在本端设备、线路还是对端设备。这里必须提醒一句环回操作会中断该端口承载的业务而且环回做完一定要及时拆除。我处理过一起“故障已经恢复但业务仍然不通”的案例原因就是之前排查时留下的环回没清干净信号被绕回了原站业务自然无法正常建立。3.2 光功率测试用数据代替猜光口告警出来以后下一步就是测光功率。把光功率计串在尾纤上看收光值是否在正常范围内。设备不同、业务速率不同收光灵敏度也不同但判断逻辑是通用的无光基本是断纤或对端无光输出收光偏弱可能是光路衰耗过大、法兰接触不良、光模块性能下降收光在正常范围但仍有告警则需要怀疑板卡问题。现场测光的时候尾纤的接头和法兰盘是最容易被忽略的地方。尾纤端面只要沾上灰尘衰耗立刻上去好几个dB。很多“光板故障”其实是接头脏了用光纤清洁笔或无水酒精棉擦一下就能恢复千万别急着换板子。3.3 单板复位与拔插动作要小记录要全单板复位和拔插属于“影响性操作”能不动尽量不动。有些运维兄弟一看到板卡指示灯异常就想着复位这是个特别危险的惯性动作。复位主控板或交叉板会中断全框业务复位光板也会中断该板所带的所有业务在没有业务窗口的情况下这一下可能就把小故障变成大事故。如果确实需要拔插单板先确认板位、先做好标签记录佩戴防静电手环操作时动作要轻、要稳。华为OSN系列的单板大多支持热插拔但热插拔不等于“随便拔”插回前检查金手指是否干净、导轨是否对齐插到位后确认指示灯状态恢复再做业务验证。3.4 保护倒换与临时业务调度SDH网络通常配置了复用段保护环、子网连接保护或通道保护。故障发生时如果保护没有自动倒换或者自动倒换没有成功可以在网管上人工发起倒换先把业务切到保护通道上。华为网管里倒换模式有“强制倒换”和“人工倒换”紧急情况下“强制倒换”优先级更高能让业务立刻切到保护路径。但要注意强制倒换属于高优先级操作业务恢复后一定要及时清除强制状态恢复到“自动倒换”否则后面再有故障时保护机制可能失效。临时业务调度也是应急手段之一如果网络里有空闲纤芯或空闲端口可以临时配一条路径把业务绕开故障点等故障排除后再调整回原路径。4. 一次典型故障的完整处置复盘告警风暴到业务复通4.1 故障发生凌晨的告警风暴某天凌晨某地市一台OSN3500和一台OSN2500组成的两纤复用段保护环出现多点告警网管上瞬间刷出几十条信息下挂在站点上的2M业务全部中断。值班同事的第一反应是“环断了”但不确定是光缆中断、设备故障还是板卡异常。我没有急着复位任何单板而是先截全屏、看告警时间线。最早的一条告警来自OSN3500的某个光口类型是LOS产生时间比其他告警早了大概30秒。方向很明确OSN3500这个光口收不到对端过来的光。这基本可以排除主控板、交叉板的问题焦点集中在光口到对端这一段光路上。4.2 快速定位从告警时间线到光路检查顺着LOS告警的方向联系对端站点检查发光口。对端光板指示灯正常说明电源和板卡基本没问题用光功率计测本端受光读数为零判断断点在光缆或尾纤链路上。此时保护环里如果有空闲纤芯可以先用备用纤芯把业务抢通再安排线路人员沿线排查光缆。现场检查时发现路径经过的ODF架上有一根尾纤法兰明显松脱轻轻一碰就掉了。重新插紧法兰、拧好后光功率恢复正常再核对网管告警逐渐消失2M业务在一个小时内全部恢复。4.3 应急恢复调度纤芯与注意事项抢通后我把强制倒换状态清除让网络回到自动倒换模式然后重新检查所有板卡和光口的状态。这里有个细节如果是光缆中断、短时间无法修复需要做临时纤芯调度操作前一定要确认备用纤芯是全程可用的不能只看这一段有纤就跳最好在两端都测一下光功率再下配置。调度完成后要同步更新纤芯资料和网络拓扑记录否则等光缆修好后调度信息一乱后续维护会埋雷。4.4 复盘这次处置里哪些动作是多余的这次故障本身不难但我复盘时专门记下了几个值得说的点一是最开始有人建议直接换光板被光功率测试拦下来了如果按“换板大法”走至少多花一个小时还可能因为拔插单板把业务中断时间拉长二是尾纤法兰松脱这个原因靠网管告警只能判断大概方向真正定位还得靠现场光路检查三是保护倒换流程我们即便在半夜也没有省每一步都在网管上留了操作记录事后做分析报告非常省事。5. 平时不备好半夜两行泪应急工具箱与日常储备5.1 现场应急工具清单应急处理能不能快很大程度上取决于平时工具齐不齐。我出故障现场基本固定带这样一套东西工具用途备注光功率计测收光/发光功率判断光路状态每半年校准一次红光笔查找断纤、识别纤芯注意不要直射眼睛光纤清洁笔/无水酒精清洁尾纤端面、法兰盘操作前先清理接头备用尾纤/法兰/衰减器替换劣化尾纤适配光功率多备几种型号网管笔记本及Console线连接网管或设备本地调试确认账号权限可用常见备件板卡光板、电源板、主控板备件状态要定期加电检测标签纸、记号笔记录纤芯、单板、操作信息防止恢复时搞混这里特别说一句红光笔判断光纤断点很好用但红光也是激光千万不要对着眼睛看。现场用过的人都知道这个动作一旦发生就不是小事。5.2 网管侧平时要做的三件事一是数据备份。华为SDH网管的数据库和网元配置要定期备份并确保备份文件能正常恢复否则设备故障后连配置都找不回来业务恢复就无从谈起。二是拓扑和纤芯记录更新。每次跳纤、调度、新增业务都要同步更新网络拓扑和纤芯占用表。很多故障处置慢不是技术不够而是现场手头没有一份最新的纤芯资料临时翻旧图纸越翻越乱。三是应急演练。平时找个业务低峰期在网管上做一次人工倒换演练验证保护逻辑和倒换状态是否正常。等故障真的来了按照演练过的动作执行心里自然就有底。最后再说一个我自己踩过的坑。刚接触SDH那会儿半夜处理故障看一个光板指示灯异常着急忙慌地把板子拔了下来结果插回去时导轨没对准金手指插歪了业务直接被拍断。从此以后现场拔插单板我一定先开好操作票看清板位一个人操作、另一个人复核绝不凭感觉动手。SDH这个行当稳比快重要预案比事后补救重要这些习惯积累在平时关键时刻真的能救命。本文还有配套的精品资源点击获取
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进