要判断基本连通性,先用常见工具做“能否到达”的验证:ICMP的 ping、路由追踪的 traceroute/mtr。同时使用运营商的 Looking Glass 或机房提供的控制台进行远程检测。
从不同网络执行:ping -c 100 IP(观察丢包与平均延迟);mtr -rwzbc 100 IP(查看每跳丢包和延迟分布)。若可用 TCP 测试,使用 tcping 或 curl --max-time,排除 ICMP 被限速的情况。
ICMP 可能被防火墙或运营商限速,若 ping 丢包较多但 TCP 链接正常,应进一步做 TCP/UDP 的端口连通性测试,避免误判。
延迟稳定性不仅看平均值,还要看 中位数(Median)、95th/99th 百分位、抖动(jitter) 和 丢包率。这些指标能反映间歇性拥塞和突发延迟。
建议长期采样:每分钟或每5分钟测一次,持续7天以上,统计 p50/p95/p99。使用 smokeping 或 pingplotter 做趋势可视化;使用 iperf3(TCP/UDP)做带宽与延迟共同测试。
若 p95 明显偏高或抖动大,说明链路不稳定;若 ICMP 与 TCP 差异明显,注意可能存在 ICMP 限速或 QoS 策略,应优先参考 TCP 测试结果。
单点测试容易受所在 ISP 路由影响,应从国内主要运营商(如电信/联通/移动)以及海外节点并行测试,覆盖不同骨干路径。
使用 RIPE Atlas、Speedtest 的企业版、各云厂商的测试实例,或在机房要求提供的多个对等点做 ping/traceroute。也可以利用 BGP Looking Glass 验证不同 AS 的可达性。
在高峰/非高峰时段各做至少数百次采样,比较路由变化与延迟分布,观察是否存在时段性不稳定或某些 ISP 特有的问题。
CN2 常见分为 GIA(性能优先)与 GT(性价比/普通),通过 BGP AS 路径和运营商的路由公告可判断走的是哪类链路,影响最终的延迟与稳定性。
使用 traceroute/bgp.he.net/Looking Glass 查看 AS PATH、下一跳和 MPLS 标签信息;结合 mtr 观察某跳的持续丢包或高延迟,定位是哪一段链路在波动。
如果发现回程不对称或某 AS 出现间歇性丢包,可能是对等策略或拥塞问题,需与机房或运营商沟通,要求查看链路利用率、队列策略或调整 BGP 优先级。
核心监控项:可达性(HTTP/TCP/ICMP)、RTT(p50/p95/p99)、丢包率、抖动、带宽利用率;告警应基于百分位指标与连续错误数触发,避免瞬时抖动造成噪声告警。
推荐组合:合成监控(synthetic checks)+ 实时探针(如 RIPE/Atlas 或自建 probe)+ APM/网元监控。使用 Prometheus + Alertmanager 或 Zabbix,设置自动化脚本在告警触发时采集 traceroute/iperf 作为辅助排查数据。
建立故障响应流程(告警分级、联络清单、快速回退方案),并在检测到跨 ISP 丢包或延迟突增时自动切换到备份链路或触发运维工单,长期保存监控数据用于趋势分析和 SLA 验证。