3.2 链路感知与质量监测:SLA指标体系


3.2 链路感知与质量监测:SLA 指标体系

3.1 节建好了隧道,本节解决选路的原料问题:每条隧道此刻的时延、抖动、丢包是多少、怎么测、多久测一次。这些数字是 3.3 节一切决策的输入,也是第 6 章可见性平台展示的原始数据——没有可信的指标,"智能选路"就是掷骰子。

指标先于策略

选路策略写得再花哨,也只等价于指标的质量。广域网选路关心三个核心指标加两个辅助指标:时延(单程或往返,决定交互类应用的"跟手"程度)、抖动(时延的波动幅度,破坏实时流的播放节奏)、丢包(每百包丢失比例,触发重传与卡顿);辅助的是带宽可用度(链路还剩多少余量)与连接健康(探测是否可达)。五个指标合起来构成一条链路的"体检单"。

探测怎么做:两条通道互补

工程上有两类探测通道,成熟方案两者都用。隧道级心跳:边缘设备在每条隧道上周期发送探测包(可类比为 BFD 式双向心跳),间隔典型 100 毫秒到 1 秒,乘以失败倍数即判不可达;它负责"生死判断",特点是轻量、快。应用级探测:模拟真实业务包大小与频率的探测流(语音用小包高频、视频用中大包),测量结果更贴近真实应用的体验;它负责"质量判断",开销大一些,通常对关键隧道常开、普通隧道降频。两类探测都在边缘本地执行,结果逐级上报控制器汇总,同时留在本地供失联时的自治选路使用——这与 2.1 节"边缘自治兜底"呼应。

指标的统计口径

裸测量值会跳,直接拿来决策会造成误切。标准做法是滑动窗口加平滑:取最近若干个采样(例如 30 秒窗口内按秒聚合),丢包率与平均时延用指数加权平均,抖动取窗口内时延的标准差或最大最小差。决策读的是平滑值,告警看的才是瞬时值——这条纪律能挡掉大半"链路明明没事却总在切"的故障单。

图:SLA 探测与指标生成机制:从探测包到体检单

图:SLA 探测与指标生成机制:从探测包到体检单

阈值从哪来:别照抄厂商默认值

厂商预置的 SLA 模板(语音 150/30/1 这类数字)只是行业经验的起点,直接全网套用是常见错误。正确顺序是:先在现网测出各应用的真实基线(9.1 节的调研产出),再把阈值定在"基线的合理余量"处。例如现网视频会议本底时延 80 毫秒,阈值定 150 毫秒余量合理;若本底已 130 毫秒,150 的阈值会让链路常年贴线、频繁触发切换。阈值还分触发阈值恢复阈值:触发 150、恢复 120——两个值之间的缓冲带是防止乒乓切换的关键,3.3 节展开。

探测的盲区

链路感知有两个已知盲区,审方案时要问。盲区一:单程与往返。 心跳测的是往返时延,上下行不对称的链路(4G 上行弱)会把问题藏起来;对策是双向探测或利用应用反馈。盲区二:探测包与真实包的不同命。 探测包小、优先级高,可能一路绿灯而真实业务包在队列里排队;应用级探测与真实业务体验数据(第 4 章的应用性能统计)互校,才能缩小偏差。

一组可直接抄的探测参数

把本节的纪律落成参数,下面是一组经过实战检验的起点配置(各厂商字段名不同,数值口径相通):

参数 建议值 说明
隧道心跳间隔 1000 毫秒 判生死用,太快浪费带宽
心跳失败倍数 3 三连失联判不可达,总判定约 3 秒
应用探测间隔(关键隧道) 5000 毫秒 语音视频所在隧道常开
应用探测间隔(普通隧道) 30000 毫秒 降频轮询控制开销
统计滑动窗口 30 秒 决策读平滑值的窗口
采样上报周期 60 秒 边缘到控制器的遥测频率
事件即时上报 触发即报 切换、越限类事件不等周期

参数之外再说一遍两条纪律的"为什么"。决策读平滑值:某分行宽带曾经因为一次骨干切换造成 20 秒的高丢包,瞬时值触发了切换(这是对的),但随后平台的告警风暴与人工误操作(反复手动回切)造成了二次故障——如果决策与告警都锚定平滑值,这次事件只会留下一条"链路抖动、已切换、已恢复"的正常记录。告警看瞬时值但按事件聚合:瞬时劣化该让运维知道,但要知道的是"一件事",不是三百条采样。

问题:体检单准不准,怎么验证?

用对照组。在一条链路上同时跑两个独立来源的测量:边缘自带的探测,和一台外置测速仪(或运营商的检测服务)。跑一周,对比两者的时延曲线相关性。相关性高(趋势一致)说明探测可信;如果边缘探测长期"报喜"而外置测量显示劣化,大概率是探测包太小或路径不同(比如探测走了管理通道而非业务隧道)——这正是 3.2 节讲的"探测包与真实包不同命"盲区的实锤。验证过一次之后,这套对照可以固定成季度例行动作。

决策阈值与告警阈值的分工

同一体检单上的数字,在决策与告警两处的用法应当不同,混用会造成两套机制的互相干扰。决策阈值(3.3 节策略表里的触发与恢复值)面向自动化:取值贴近业务可感知的体验边界,带缓冲带,动作是切换。告警阈值面向人:应当比决策阈值更宽松——切换都处理好了的事,人不需要知道;人要知道的是"切换之后还不达标"(所有备选链路都越限)、"趋势性劣化"(一周内丢包基线爬升)、以及"探测异常"(心跳失败但链路似乎可达)。用一句话概括分工:决策阈值回答"要不要换路",告警阈值回答"要不要人来看"。两套阈值在平台里分开配置、分开评审,是告警治理(6.3 节)的前置条件——大量噪音告警的根源就是两套阈值共用一套值。

多链路比较的公平性

同一站点多条链路的指标要"同场竞技",公平性有三个前提,缺一个比较结果就失真。前提一:同口径测量——所有链路的探测包大小、间隔、统计窗口必须一致,用 1000 字节包测宽带、64 字节包测专线再放一起比,是隐形的不公平。前提二:同业务时段——链路的优劣随时段翻转(宽带晚高峰差、专线全天稳),比较要用同一时段的窗口数据;策略执行时的"当下值"天然满足,但人为调阈值时要看同时段历史。前提三:同方向——去程质量好不代表回程好,尤其不对称链路;双端边缘各自测量自己方向的质量并交换结果,才能避免"单边报告"的偏差。三个前提都成立于成熟方案的设计里,但运营中的人工分析(比如调阈值、写方案)常常违反——把这三条贴在分析报告的模板上,是最便宜的防错。

本节要点

  • 五指标体检单:时延、抖动、丢包为主,带宽余量与可用性为辅;决策读平滑值,告警看瞬时值。
  • 双通道探测:隧道级心跳判生死(快),应用级探测量质量(准),本地执行、本地留底、上报汇总。
  • SLA 阈值要用现网基线校准,触发与恢复双阈值之间留缓冲带。
  • 盲区两处:往返时延掩盖上下行不对称;探测包不同于真实包,需业务体验数据互校。

指标到手,下一节把指标变成决策:一条流量在什么时刻、被谁、依据什么判据切换到另一条隧道。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U