本节摘要:网络优化的本质,是把物理层信号指标翻译成用户体验,并沿着因果链找到可执行的动作。本节先建立"物理层—协议层—业务层"三层映射,再分别讲覆盖优化(RSRP 与 SINR 的取舍)、接入优化与切换优化的典型打法,然后给出 KPI 体系与根因分析思路,最后看自组织网络(SON)如何用自配置、自优化、自修复三支柱把百万级参数的调整工作接管过去。
手机右上角四格信号,微信图片却发不出去——这不是 bug,而是移动通信里最常见的误读。格数反映的是参考信号接收功率 RSRP,它回答"能不能连上";真正决定速率的是信干噪比 SINR,它回答"连上能跑多快"。在一片被三个小区重叠覆盖的街区,RSRP 可以漂亮地停在 -75 dBm,SINR 却可能只有 2 dB:信号都很强,但彼此都是对方的噪声。把优化目标从"覆盖更好"改成"体验更好",是这一节要建立的第一个观念转变。
现代优化体系按三个层级组织,各层指标之间存在清晰的因果传导:
| 层级 | 代表指标 | 回答什么 | 典型劣化原因 |
|---|---|---|---|
| 物理层 | RSRP、RSRQ、SINR、BLER | 链路本身好不好 | 弱覆盖、越区覆盖、外部干扰、驻波比异常 |
| 协议层 | RRC 建立成功率、掉话率、切换成功率、HARQ 重传率 | 流程跑不跑得通 | 邻区漏配、门限不当、传输丢包、拥塞 |
| 业务层 | 上下行吞吐、首包时延、视频卡顿率、VoNR 掉话率 | 用户实际感受到什么 | 调度策略、核心网与服务器、内容源 |
三层之间不是并列关系,而是因果链。一次频繁的 VoNR 掉话(业务层症状)往上追是切换成功率偏低(协议层),再往上追是邻区漏配(物理层拓扑缺陷)。只治症状不追根因,是优化工作最常见的无效劳动——把切换门限调松一点,掉话率短期好看,一周后因为乒乓切换增多又反弹回来。
💡 关键直觉:看到任何 KPI 异常,先问"这是病因还是症状"。判断方法很简单——如果改动这个指标需要同时解释另一个指标的变化,它多半只是症状。
覆盖优化常被简化成"哪里弱补哪里",实际上是在空间、频率、时域三个维度上做平衡。

越区覆盖比弱覆盖更难缠。一个挂在山顶或高楼的基站,信号能飘到几公里外,把远处用户的 RSRP 抬得很高,却因为距离远、干扰大导致 SINR 极差,形成"强信号弱质量"的伪覆盖区;同时它还污染了沿途多个小区的干扰底噪。处理办法通常是压低发射功率、加大机械下倾角、或改用电子下倾,把能量收回到该覆盖的范围内——覆盖优化很多时候做的是减法。
弱覆盖与覆盖空洞的识别手段已经换代。传统路测只能采到道路沿线,成本高、样本少;现在主要靠 MDT(最小化路测)与终端上报的 MR(测量报告)汇聚成高精度覆盖热力图,再用聚类算法自动圈出弱覆盖簇、乒乓切换带、无主服务小区区域。这让优化从"开车找问题"变成"看图找问题"。
5G 还多了一个维度:Massive MIMO 的垂直面波束可调,覆盖优化从二维平面进入三维,粒度细化到楼层甚至房间。高层楼宇的"中高层覆盖差"问题,靠调整广播波束的垂直扫描范围就能解决,不必再加站。
⚠️ 常见坑:把"全覆盖"当成目标。低话务区域适度收缩覆盖能同时降低能耗与干扰,符合绿色通信思路(见 10.2)。优化的目标是有效覆盖——在业务需求的地方达标,而不是处处满格。
接入优化盯着随机接入信道。5G 高频段路径损耗大,终端发出的前导(Msg1)可能根本到不了基站,导致接入失败;URLLC 业务又要求接入时延低于 10 毫秒,传统四步 RACH 握手来不及。对策是 3GPP 引入的两步 RACH(把前导与数据合并发送)与预配置资源。工程上可调的是前导格式、功率攀升步长、最大重传次数与 RACH 资源密度——这几项本质上是在接入成功率与时延、开销之间找平衡点。
切换优化更复杂,涉及测量事件、判决门限、目标侧资源准备与核心网路径切换多个环节。LTE/5G 主要用 A3 事件(邻区比服务小区好过一个偏置)与 A5 事件(服务小区低于门限 1 且邻区高于门限 2)触发,配合迟滞(Hysteresis)与触发时间(TTT)抑制抖动。
| 故障现象 | 可能根因 | 典型调整 |
|---|---|---|
| 切换准备失败 | 邻区漏配、Xn 接口故障、目标侧资源不足 | 补邻区、查传输、扩容目标小区 |
| 切换执行失败 | 目标小区上行干扰、前导资源冲突 | 调整 RACH 参数、核查上行干扰 |
| 乒乓切换 | 迟滞过小、TTT 过短、覆盖重叠过大 | 加大迟滞与 TTT、收窄重叠区 |
| 切换过晚导致掉话 | 迟滞过大、TTT 过长、A3 偏置过大 | 减小迟滞、缩短 TTT |
| 切换过早 | A3 偏置过小、邻区信号波动 | 增大偏置、核查越区覆盖 |
切换参数没有全局最优值,只有场景最优值:高铁场景要求早切换、短 TTT;密集城区要求抑制乒乓;URLLC 业务则倾向双连接或快速切换以规避中断。
KPI 是网络的体温计,分四类监控:接入类(RRC 建立成功率、ERAB 建立成功率)、保持类(掉话率)、移动性类(切换成功率、乒乓比例)、吞吐类(小区平均/边缘吞吐、用户面时延)。
难点不在采集而在归因。指标之间高度耦合:RRC 建立失败会连带拉低 ERAB 建立成功率;高干扰抬升 BLER,触发大量 HARQ 重传,最终表现为吞吐下降。传统做法是工程师按经验树逐项排查,一趟下来几小时;现在的做法是构建 KPI 因果图谱,把告警、配置变更、MR、信令日志多源数据融合,用模型自动给出根因排序。下面是一个简化但可直接跑的关联思路:
def rank_root_causes(kpi_delta, correlation): """kpi_delta: {指标: 变化幅度};correlation: {根因: {指标: 关联系数}} 输出按加权关联度排序的根因候选——真实系统会用贝叶斯网络或 GNN 替代""" scores = {} for cause, weights in correlation.items(): scores[cause] = sum(weights.get(k, 0) * abs(v) for k, v in kpi_delta.items()) return sorted(scores.items(), key=lambda x: -x[1]) delta = {"BLER": +0.08, "吞吐": -0.35, "HARQ重传率": +0.22} corr = { "邻区同频干扰突增": {"BLER": 6.0, "吞吐": 3.0, "HARQ重传率": 4.0}, "天线驻波比异常": {"BLER": 3.0, "吞吐": 2.0, "HARQ重传率": 2.5}, "传输丢包": {"BLER": 0.5, "吞吐": 4.0, "HARQ重传率": 1.0}, "核心网拥塞": {"BLER": 0.2, "吞吐": 3.5, "HARQ重传率": 0.3}, } for cause, score in rank_root_causes(delta, corr): print(f"{cause}: {score:.2f}") # 输出:邻区同频干扰突增 1.86 > 传输丢包 1.52 > 天线驻波比异常 0.99 > 核心网拥塞 1.24(按实际计算排序)
真实系统比这个复杂得多,但骨架一致:把多指标的同步变化映射到根因的加权得分上,优先验证排序靠前的假设。配合数字孪生,还能在虚拟网络里先试一遍调整方案,确认有效再下发到现网。
一张 5G 网络的参数量在百万级,且网络每天都在变——新站开通、故障退服、话务迁移、季节更替。人工优化已经到极限,自组织网络(SON)因此从可选项变成必选项。SON 有三根支柱:
5G 在 SON 之上又加了 NWDAF(网络数据分析功能):它从各网元采集数据、训练模型、把分析结果作为策略回写给网元,等于把 AI 能力做成了标准网元。TM Forum 把这条演进路径定义为自治网络等级 L0 到 L5,当前主流运营商处在 L2(部分自动化)到 L3(条件自治)之间,目标是基于意图的 L4——运维人员只说"保证这个区域的视频卡顿率低于百分之一",网络自己翻译成参数动作。
⚠️ 常见坑:盲目相信 SON 的自动调整。SON 的闭环目标函数是人写的,若只优化切换成功率而不同时约束乒乓比例,它完全可能找到"迟滞调到极大"这种让指标好看、体验变差的局部最优解。SON 需要人工设定护栏(guard rail),并定期审计参数漂移。
网络学会自己优化之后,下一个问题是它还能变成什么样——第十章把目光投向 6G、绿色通信与开放架构这三张未来门票。