板块14 · RGSE 进阶专题与故障排查方法论
板块14 · RGSE 进阶专题与故障排查方法论
本板块解决什么问题:从"把网络配通"升级到"解释为什么这么走、跨域怎么规划、故障根因在哪"。这是 RGSE 的主线,也是三级认证的能力分水岭。
对应 RGSE 考纲:BGP 路由属性和高级特性、ISIS 原理与应用、MPLS 原理和应用、SR 原理和应用、IPSec、组播、QoS、IPv6、EVPN VXLAN、局域网/路由规划设计、常见故障排查与解决方案。
考试结构:C8511-Written(笔试)+ C8511-Lab(实验),笔试成绩 24 个月内有效。
14_1 RGSE 的能力分水岭
| 层级 | 典型问题 | RGSE 的答案形态 |
|---|---|---|
| RGSA | "怎么配通 OSPF?" | 命令序列 |
| RGSP | "园区网双核心怎么设计?" | 方案 + 配置 + 验收 |
| RGSE | "为什么这条路由不优选?跨域 VPN 怎么规划?故障根因在哪?" | 原理推演 + 联动分析 + 定位路径 |
RGSE 的三个关键特征
- 跨技术联动——BGP + MPLS + QoS + 组播叠加,不是单点技术。
- 跨厂商互通——能力标准明确包含"含跟常见的非锐捷设备联动"。
- 方案与排障——局域网规划设计、路由规划设计、常见故障排查各占相当比重。
★ 备考启示:不能只会锐捷自家命令,必须懂协议标准本身。考题里出现"与某厂商设备对接"的场景是常态。
RGSE 答题的思维框架
拿到一个复杂问题时的标准动作:
① 定界 —— 这是几层的问题?(物理 / 二层 / 三层 / 应用)
② 定因 —— 是协议行为、配置错误、还是设计缺陷?
③ 定责 —— 涉及哪几台设备、哪几条链路?
④ 定方案 —— 临时规避 + 根本解决,两者都要给
⑤ 定回退 —— 改错了怎么退回来?
14_2 BGP 选路 13 条与高级特性
BGP 选路规则(13 条,按优先级)
RGSE 必考,且是排障核心。前 8 条必须背熟:
| 序号 | 规则 | 说明 |
|---|---|---|
| 1 | Weight(权重) | 私有属性,本地有效,越大越优 |
| 2 | Local_Preference | AS 内有效,越大越优 |
| 3 | 本地始发优先 | 本地 network/aggregate > 从邻居学来 |
| 4 | AS_Path 长度 | 越短越优 |
| 5 | Origin 属性 | IGP(i) < EGP(e) < Incomplete(?) |
| 6 | MED | 越小越优 |
| 7 | EBGP 优于 IBGP | 同目的优先选 EBGP 路径 |
| 8 | 到下一跳的 IGP 度量 | 越小越优(热土豆路由) |
| 9-13 | 最老 EBGP 邻居 / Router ID 小 / Cluster_List 短 / 最小邻居地址 | 兜底 |
记忆锚点:Weight → Local_Pref → 本地始发 → AS_Path → Origin → MED → E/BGP → IGP Cost。
★ 一句话区别:Local_Pref 管"我怎么出去",MED 管"别人怎么进来"。
BGP 属性分类(高频考点)
| 分类 | 属性 |
|---|---|
| 公认必遵(Well-known Mandatory) | AS_Path、Next_Hop、Origin |
| 公认自决(Well-known Discretionary) | Local_Preference、Atomic_Aggregate |
| 可选可传递(Optional Transitive) | Community、Aggregator |
| 可选非传递(Optional Non-transitive) | MED、Originator_ID、Cluster_List |
★ 必考题:MED 是"可选非传递",跨 AS 传递时会丢失;Community 是"可选可传递",可以跨 AS 携带标记。
路由反射器(Route Reflector)
解决的问题:IBGP 水平分割(从 IBGP 邻居学到的路由不再转发给其他 IBGP 邻居),导致 AS 内需要全互联(n 台设备需 n(n-1)/2 个会话)。
没有 RR: 有 RR:
R1──R2 R1──┐
│╲ │╲ R2──┼── RR ── 反射给所有 Client
│ ╲ │ ╲ R3──┘
R3──R4
6 条会话 3 条会话
! RR 上配置
Ruijie(config)# router bgp 65001
Ruijie(config-router)# neighbor 2.2.2.2 route-reflector-client
Ruijie(config-router)# neighbor 3.3.3.3 route-reflector-client
Ruijie(config-router)# exit
防环机制:Originator_ID(记录始发者 RID)和 Cluster_List(记录经过的 RR 簇)。收到携带自己 RID 的路由即丢弃。
BGP 联盟(Confederation)
把大 AS 拆成若干子 AS,内部用 EBGP,对外仍是一个 AS。相比 RR,配置改动大但更符合真实管理边界。
| 对比项 | 路由反射器 RR | 联盟 Confederation |
|---|---|---|
| 改动范围 | 只需改 RR 本身 | 所有设备都要改配置 |
| 对外表现 | 仍是同一 AS | 仍是同一 AS |
| 防环 | Originator_ID / Cluster_List | 子 AS 号(AS_CONFED) |
| 适用 | 大多数场景(主流) | 有明确管理边界拆分需求 |
BGP 常用策略配置
! 用 route-map 设置 Local_Preference(控制"我怎么出去")
Ruijie(config)# route-map SET-LP permit 10
Ruijie(config-route-map)# set local-preference 200
Ruijie(config-route-map)# exit
Ruijie(config)# router bgp 65001
Ruijie(config-router)# neighbor 10.0.0.2 route-map SET-LP in
! AS-Path 追加(影响"别人怎么进来",让对端走别的路)
Ruijie(config)# route-map PREPEND permit 10
Ruijie(config-route-map)# set as-path prepend 65001 65001 65001
Ruijie(config-route-map)# exit
Ruijie(config-router)# neighbor 10.0.0.2 route-map PREPEND out
! Community 标记
Ruijie(config-route-map)# set community 65001:100
Ruijie(config-router)# neighbor 10.0.0.2 send-community
BGP 验证
Ruijie# show ip bgp 192.168.1.0 ! 查看该路由的所有路径与属性
Ruijie# show ip bgp summary ! 邻居状态
Ruijie# show ip bgp neighbors 10.0.0.2 advertised-routes ! 我发出去的路由
Ruijie# show ip bgp neighbors 10.0.0.2 received-routes ! 我收到的路由
Ruijie# show ip bgp community 65001:100 ! 按 community 过滤
★ 排障利器:
show ip bgp x.x.x.x能列出该前缀的所有候选路径及其属性,配合选路规则逐条比对,就能回答"为什么选了这条而不是那条"。
现场故事 · "为什么流量走了贵的那条专线"
客户有两条专线:A 线带宽大但贵,B 线便宜。规划是主走 B、备份走 A,但实际流量一直跑在 A 线上。
工程师查路由表,两条路由都在。用show ip bgp 目标网段一看:两条路径的前 3 条选路规则(Weight、Local_Pref、本地始发)全部相同,第 4 条 AS_Path 长度上 A 线比 B 线短一跳,所以 A 当选。
解决:在 B 线邻居上用 route-map 把 Local_Preference 调高到 200(优先级高于 AS_Path),流量立刻切到 B 线。
复盘:BGP 选路是"逐条比较、先命中先赢"。不理解 13 条顺序,就永远解释不了"为什么它选了那条"。所有 BGP 流量路径问题,最终都归结为"逐条比对选路规则"。
14_3 ISIS 原理与应用
与 OSPF 的对比
| 对比项 | OSPF | ISIS |
|---|---|---|
| 层级 | 基于 IP(协议号 89) | 基于数据链路层(不依赖 IP) |
| 区域 | 基于接口(ABR 在设备上) | 基于设备(L1/L2 路由器) |
| 区域边界 | 在 ABR 上 | 在链路上 |
| 扩展性 | 良好 | 更优(运营商骨干首选) |
| 报文 | 5 种 | 9 种(Hello/LSP/CSNP/PSNP 等) |
| 度量 | Cost(参考带宽/带宽) | 默认所有接口 Cost=10(与带宽无关) |
路由器级别
| 级别 | 作用 |
|---|---|
| L1 | 区域内路由,类似 OSPF 非骨干区域 |
| L2 | 区域间路由,组成骨干 |
| L1/L2 | 兼具,类似 OSPF ABR(默认) |
NET 地址格式
NET = AreaID(1-13字节) . SystemID(6字节) . SEL(1字节,固定00)
示例:49.0001.0000.0000.0001.00
└─区域──┘ └─System ID──┘ └SEL┘
配置
Ruijie(config)# router isis 1
Ruijie(config-router)# net 49.0001.0000.0000.0001.00
Ruijie(config-router)# is-type level-2-only ! 骨干路由器
Ruijie(config-router)# exit
Ruijie(config)# interface gi0/1
Ruijie(config-if)# ip address 10.0.0.1 255.255.255.252
Ruijie(config-if)# ip router isis 1
Ruijie(config-if)# isis circuit-type level-2-only
Ruijie(config-if)# exit
验证
Ruijie# show isis neighbors
Ruijie# show isis database
Ruijie# show isis topology
Ruijie# show ip route isis
★ 注意:ISIS 默认所有接口 Cost 都是 10,与带宽无关。要按带宽计算需手工
isis metric或使用 wide metric。这是与 OSPF 最容易混淆的一点。
14_4 MPLS 与 MPLS VPN
MPLS 核心概念
MPLS(Multi-Protocol Label Switching)在 IP 包头前插入 32 位标签,路由器按标签转发,不再查 IP 路由表。
传统 IP 转发:每个路由器都要查路由表 → 慢、每跳独立决策
MPLS 转发: 入口打标签,中间只看标签 → 快、路径可预先规划(TE)
| 术语 | 说明 |
|---|---|
| LER(Label Edge Router) | 边缘路由器,负责压入(Push)/弹出(Pop)标签 |
| LSR(Label Switching Router) | 核心路由器,负责标签交换(Swap) |
| LSP(Label Switched Path) | 标签交换路径,单向 |
| FEC | 转发等价类,同一类数据包走同一路径 |
| LFIB | 标签转发表 |
标签操作三种
Push(压入)→ Swap(交换)→ Pop(弹出)
入口LER 中间LSR 出口LER
MPLS VPN 三大组件
| 组件 | 作用 |
|---|---|
| VRF | 虚拟路由转发表,实现路由隔离(不同客户的路由互不干扰) |
| RD(Route Distinguisher) | 路由区分符,8 字节,把可能重叠的私网 IP 变成全局唯一的 VPNv4 地址 |
| RT(Route Target) | 路由目标,BGP 扩展团体属性,控制路由导入导出 |
★ 一句话区分 RD 与 RT(必考):
- RD 解决"地址重叠"问题——让 192.168.1.0/24 在 A 客户和 B 客户处变成不同的 VPNv4 前缀
- RT 解决"路由该给谁"问题——拓扑控制,决定 VPN 成员关系
配置示例
! ============ PE 设备 ============
! 1. 创建 VRF
PE(config)# ip vrf CUSTOMER-A
PE(config-vrf)# rd 65001:100
PE(config-vrf)# route-target both 65001:100
PE(config-vrf)# exit
! 2. 接口绑定 VRF(★ 先绑 VRF 再配 IP)
PE(config)# interface gi0/1
PE(config-if)# ip vrf forwarding CUSTOMER-A
PE(config-if)# ip address 192.168.1.1 255.255.255.0
PE(config-if)# exit
! 3. 启用 MPLS
PE(config)# mpls ip
PE(config)# interface gi0/24
PE(config-if)# mpls ip
PE(config-if)# exit
! 4. MP-BGP 传递 VPNv4 路由
PE(config)# router bgp 65001
PE(config-router)# neighbor 2.2.2.2 remote-as 65001
PE(config-router)# neighbor 2.2.2.2 update-source loopback 0
PE(config-router)# address-family vpnv4 unicast
PE(config-router-af)# neighbor 2.2.2.2 activate
PE(config-router-af)# neighbor 2.2.2.2 send-community extended
PE(config-router-af)# exit-address-family
PE(config-router)# address-family ipv4 vrf CUSTOMER-A
PE(config-router-af)# neighbor 192.168.1.2 remote-as 65010 ! CE 侧 EBGP
PE(config-router-af)# exit-address-family
★ 部署禁忌:
ip vrf forwarding会清空接口上已配置的 IP 地址。所以顺序是:先绑定 VRF,再配 IP。反过来会导致 IP 丢失,这个坑很多人踩过。
验证
PE# show ip vrf ! 查看 VRF 列表
PE# show ip vrf interfaces ! 查看绑定到 VRF 的接口
PE# show ip route vrf CUSTOMER-A ! 查看 VRF 路由表(★ 最常用)
PE# show ip bgp vpnv4 all ! 查看 VPNv4 路由
PE# show mpls forwarding-table ! 查看标签转发表
PE# show mpls ldp neighbor ! 查看 LDP 邻居
PE# ping vrf CUSTOMER-A 192.168.1.2 ! 带 VRF 的 ping(★ 必会)
★ 排障要点:配了 VRF 之后,所有针对该 VPN 的 ping / traceroute 都必须带
vrf 名称参数。直接用ping 192.168.1.2走的是全局路由表,会不通——这是 VRF 环境最常见的"误判为故障"。
14_5 SR(Segment Routing)概述
承上启下:14_4 的 MPLS 解决了「按标签转发」,但标签要靠 LDP 或 RSVP-TE 逐跳分发,中间每台设备都得维护 LSP 状态,协议重、运维难。SR 的想法很直接:既然路径是源端决定的,那就把路径直接写进报文头里,中间节点照着走就行。
SR 的核心思想
传统 MPLS 需要 LDP/RSVP-TE 来分发标签,协议复杂。SR 的思路:把路径信息编码进报文头部的"段列表"(Segment List),源节点指定路径,中间节点只需按段转发。
| 对比项 | MPLS(LDP/RSVP-TE) | SR |
|---|---|---|
| 标签分发 | 需要 LDP / RSVP-TE 协议 | 由 IGP(OSPF/ISIS)扩展分发 |
| 状态维护 | 中间节点需维护每条 LSP 状态 | 中间节点无需维护连接状态 |
| 路径控制 | 依赖 TE 隧道 | 源路由,段列表显式指定 |
| 与 SDN 结合 | 较弱 | 天然适配(控制器下发段列表) |
两种 SR 实现
| 实现 | 说明 |
|---|---|
| SR-MPLS | 在 MPLS 数据平面上实现,用 MPLS 标签作为 Segment(主流部署) |
| SRv6 | 基于 IPv6,用 IPv6 扩展头(SRH)承载段列表,是演进方向 |
关键概念
| 概念 | 说明 |
|---|---|
| Segment(段) | 一段指令,如"去往节点 X""走某条链路" |
| Node SID | 标识某个节点的段(类似 Prefix SID) |
| Adjacency SID | 标识某条邻接链路的段 |
| Segment List | 有序的段列表,构成完整路径 |
| SRGB | Segment Routing Global Block,全局标签块 |
示例:报文要从 A 到 D,指定路径 A → B → C → D
传统 MPLS:需要沿途建立 LSP,每个节点维护状态
SR: 源节点 A 压入段列表 [B, C, D],中间节点按栈顶段逐跳转发
! SR 基础配置示意(ISIS SR)
Ruijie(config)# router isis 1
Ruijie(config-router)# segment-routing mpls
Ruijie(config-router)# segment-routing global-block 16000 23999
Ruijie(config-router)# exit
Ruijie(config)# interface loopback 0
Ruijie(config-if)# ip address 1.1.1.1 255.255.255.255
Ruijie(config-if)# isis prefix-sid index 1
Ruijie# show isis segment-routing ! 查看 SR 状态
Ruijie# show segment-routing ! 查看 SR 全局信息
14_6 IPSec 技术原理与应用
IPSec 体系
| 组件 | 作用 |
|---|---|
| AH | 认证头,提供完整性 + 数据源认证(不加密) |
| ESP | 封装安全载荷,提供加密 + 认证(主流) |
| IKE | 密钥交换协议,负责协商 SA(分 v1 / v2) |
| SA | 安全关联,双方约定的加密/认证参数集合 |
两种封装模式
传输模式(Transport): [IP头][ESP头][数据][ESP尾]
保护的是上层数据,用于主机到主机
隧道模式(Tunnel): [新IP头][ESP头][原IP头][数据][ESP尾]
保护整个原始 IP 包,用于网关到网关(★ 站点互联用这个)
IKE 两个阶段
阶段一(IKE SA): 协商加密/认证算法,建立安全通道
主模式(6 个报文)/ 野蛮模式(3 个报文)
↓
阶段二(IPSec SA):在安全通道内协商数据加密参数
快速模式
↓
数据传输
站点到站点 IPSec VPN 配置
! 1. 定义兴趣流(哪些流量走 VPN)
Ruijie(config)# ip access-list extended VPN-TRAFFIC
Ruijie(config-ext-nacl)# permit ip 192.168.10.0 0.0.0.255 172.16.10.0 0.0.0.255
Ruijie(config-ext-nacl)# exit
! 2. IKE 阶段一策略
Ruijie(config)# crypto isakmp policy 10
Ruijie(config-isakmp)# encryption aes 256
Ruijie(config-isakmp)# hash sha
Ruijie(config-isakmp)# authentication pre-share
Ruijie(config-isakmp)# group 2
Ruijie(config-isakmp)# exit
Ruijie(config)# crypto isakmp key Ruijie@123 address 202.100.1.2
! 3. IPSec 阶段二变换集
Ruijie(config)# crypto ipsec transform-set TS1 esp-aes 256 esp-sha-hmac
Ruijie(config-crypto-trans)# mode tunnel
Ruijie(config-crypto-trans)# exit
! 4. 加密映射并应用到接口
Ruijie(config)# crypto map CMAP 10 ipsec-isakmp
Ruijie(config-crypto-map)# match address VPN-TRAFFIC
Ruijie(config-crypto-map)# set peer 202.100.1.2
Ruijie(config-crypto-map)# set transform-set TS1
Ruijie(config-crypto-map)# exit
Ruijie(config)# interface gi0/1
Ruijie(config-if)# crypto map CMAP
Ruijie(config-if)# exit
IPSec 验证与排障
Ruijie# show crypto isakmp sa ! 阶段一 SA 状态
Ruijie# show crypto ipsec sa ! 阶段二 SA 状态(看加解密包数)
Ruijie# show crypto map ! 查看加密映射
Ruijie# clear crypto isakmp ! 清阶段一(改配置后)
Ruijie# clear crypto sa ! 清所有 SA
| 现象 | 排查方向 |
|---|---|
| 阶段一建不起来 | 两端 isakmp policy 参数(加密/hash/认证/DH 组)是否一致;预共享密钥是否一致;peer 地址是否可达 |
| 阶段一通但阶段二不通 | 兴趣流是否镜像对称(本端 permit 源 A 目的 B,对端必须是源 B 目的 A);变换集是否一致 |
| SA 起来了但业务不通 | 路由是否指向 VPN;是否缺少 NAT 豁免(见下) |
| 加解密包数为 0 | 流量没匹配兴趣流;路由没走 VPN 接口 |
★ NAT 与 IPSec 冲突(经典坑):如果出口同时做了 PAT,走 VPN 的流量会被 NAT 转换后不再匹配兴趣流,导致 VPN 不通。解决:在 NAT 的 ACL 中 deny 掉 VPN 的兴趣流,让这些地址不做 NAT。
Ruijie(config)# ip access-list extended NAT-ACL
Ruijie(config-ext-nacl)# deny ip 192.168.10.0 0.0.0.255 172.16.10.0 0.0.0.255 ! VPN 流量不做 NAT
Ruijie(config-ext-nacl)# permit ip 192.168.10.0 0.0.0.255 any
Ruijie(config-ext-nacl)# exit
14_7 QoS 技术原理与应用
QoS 解决什么问题
网络拥塞时的四种处理模型:
| 模型 | 说明 | 适用 |
|---|---|---|
| Best-Effort | 尽力而为,不区分 | 默认 |
| IntServ | 资源预留(RSVP),每流预留 | 规模小,难部署 |
| DiffServ | 差分服务,按类区分(主流) | 园区/骨干网 |
QoS 四大组件
| 组件 | 作用 |
|---|---|
| 分类与标记(Classification & Marking) | 识别流量并打标记(DSCP / 802.1p / IP 优先级) |
| 拥塞管理(Queuing) | 拥塞时决定谁先发(PQ / CQ / WFQ / CBQ) |
| 拥塞避免(Avoidance) | 提前丢包防全局同步(RED / WRED) |
| 限速与整形(Policing & Shaping) | 控制速率(CAR / GTS) |
常用队列机制对比
| 机制 | 特点 | 适用 |
|---|---|---|
| PQ(优先队列) | 高优先级队列绝对优先 | 语音等实时业务;低优先级可能饿死 |
| CQ(定制队列) | 按比例分配带宽 | 一般业务 |
| WFQ(加权公平) | 按流公平分配 | 默认机制 |
| CBWFQ / LLQ | 类的加权公平 + 低时延队列 | 语音 + 数据混合(推荐) |
DiffServ 配置示例
! 1. 分类:用 class-map 匹配流量
Ruijie(config)# class-map match-any VOICE
Ruijie(config-cmap)# match ip dscp ef
Ruijie(config-cmap)# match access-group 101 ! 也可匹配 ACL
Ruijie(config-cmap)# exit
! 2. 策略:用 policy-map 定义动作
Ruijie(config)# policy-map QOS-POLICY
Ruijie(config-pmap)# class VOICE
Ruijie(config-pmap-c)# priority 1000 ! LLQ,保证 1000kbps
Ruijie(config-pmap-c)# exit
Ruijie(config-pmap)# class class-default
Ruijie(config-pmap-c)# bandwidth remaining percent 50
Ruijie(config-pmap-c)# exit
Ruijie(config-pmap)# exit
! 3. 应用:绑定到接口出方向
Ruijie(config)# interface gi0/1
Ruijie(config-if)# service-policy output QOS-POLICY
Ruijie(config-if)# exit
限速配置
! 接口限速(CAR)
Ruijie(config)# interface gi0/1
Ruijie(config-if)# rate-limit output 10000000 1875000 1875000 conform-action transmit exceed-action drop
! 10Mbps 突发 突发
! 或用 policy-map 做限速
Ruijie(config-pmap-c)# police 10000000 conform-action transmit exceed-action drop
常用 DSCP 值
| DSCP | 名称 | 典型业务 |
|---|---|---|
| EF(46) | Expedited Forwarding | 语音(VoIP) |
| AF41(34) | Assured Forwarding | 视频会议 |
| AF31(26) | Assured Forwarding | 关键业务应用 |
| BE(0) | Best Effort | 普通上网 |
验证
Ruijie# show policy-map ! 查看策略配置
Ruijie# show policy-map interface gi0/1 ! ★ 查看接口策略命中情况(看包数)
Ruijie# show class-map ! 查看分类
Ruijie# show queue ! 查看队列状态
★ 排障要点:
show policy-map interface会显示每个 class 的匹配包数。QoS 不生效时先看计数器——不增长说明流量根本没被分类到(ACL 或匹配条件错了)。
QoS 部署建议
① 尽量在靠近源的位置打标记(信任边界)
② 中间设备信任标记,按标记调度,不必重复分类
③ 队列调度只在真正可能拥塞的接口上配(通常是出口/上行口)
④ 语音用 LLQ(priority),关键业务用 CBWFQ 保证带宽
⑤ 不要过度设计——QoS 配置越复杂,排障越困难
14_8 EVPN VXLAN 与大二层
传统大二层的问题
虚拟机迁移、分布式业务要求"跨三层网络实现二层互通"。传统方案(STP + 大二层)的问题:
STP 大二层的困境:
✗ 阻塞链路,带宽浪费
✗ 收敛慢,收敛期丢包
✗ 广播域过大,风暴影响面大
✗ VLAN 只有 4094 个,云环境不够用
VXLAN 的核心思路
VXLAN(Virtual Extensible LAN):把二层以太帧封装在 UDP 里,跨三层网络传输——"二层跑在三层上"(Overlay)。
原始以太帧 ──封装──▶ [外层IP头][UDP 4789][VXLAN头(VNI)][原始以太帧]
↑
24 bit VNI,支持 1600 万个隔离域
| 对比项 | VLAN | VXLAN |
|---|---|---|
| 标识位数 | 12 bit(4094 个) | 24 bit VNI(约 1600 万个) |
| 跨三层 | 不支持 | 支持(Overlay) |
| 依赖 STP | 是 | 否(Underlay 用路由,无环) |
| 封装 | 802.1Q | MAC-in-UDP(UDP 4789) |
VXLAN 关键术语
| 术语 | 说明 |
|---|---|
| VTEP | VXLAN 隧道端点,负责封装/解封装 |
| VNI | VXLAN 网络标识,类似 VLAN ID 但 24 位 |
| Underlay | 底层 IP 承载网络(跑路由协议,无环) |
| Overlay | 叠加的虚拟二层网络 |
| EVPN | 控制平面,用 MP-BGP 传递 MAC/IP 可达信息 |
为什么需要 EVPN
早期 VXLAN: 靠组播泛洪学习 MAC(依赖 Underlay 组播,难运维)
EVPN VXLAN: ★ 用 MP-BGP 作为控制平面传递 MAC/IP 路由
→ 无组播依赖、支持 ARP 抑制、支持主机路由(/32)精确转发
| EVPN 优势 | 说明 |
|---|---|
| 控制平面学习 | MAC 地址通过 BGP 通告,不靠数据平面泛洪 |
| ARP 抑制 | VTEP 本地代答 ARP,减少泛洪 |
| 主机路由 | 通告 /32 主机路由,支持跨网段最优转发 |
| 多活网关 | 支持分布式任播网关,虚拟机迁移无需改网关 |
配置示例(EVPN VXLAN)
! 1. Underlay:IGP 打通 VTEP 之间的 Loopback
Ruijie(config)# router ospf 1
Ruijie(config-router)# network 1.1.1.1 0.0.0.0 area 0
Ruijie(config-router)# exit
! 2. 创建 VXLAN 与 VNI 映射
Ruijie(config)# vxlan 10
Ruijie(config-vxlan)# vni 10010
Ruijie(config-vxlan)# exit
! 3. 配置 VTEP 接口
Ruijie(config)# interface overlayrouter 1
Ruijie(config-if)# vxlan 10
Ruijie(config-if)# exit
! 4. EVPN 控制平面(MP-BGP)
Ruijie(config)# router bgp 65001
Ruijie(config-router)# neighbor 2.2.2.2 remote-as 65001
Ruijie(config-router)# neighbor 2.2.2.2 update-source loopback 0
Ruijie(config-router)# address-family l2vpn evpn
Ruijie(config-router-af)# neighbor 2.2.2.2 activate
Ruijie(config-router-af)# exit-address-family
Ruijie(config-router)# exit
! 5. 配置 EVPN 实例(EVI)与 VLAN 关联
Ruijie(config)# evpn
Ruijie(config-evpn)# vni 10010 l2
Ruijie(config-evpn-vni)# rd 1.1.1.1:10010
Ruijie(config-evpn-vni)# route-target both 65001:10010
Ruijie(config-evpn-vni)# exit
验证
Ruijie# show vxlan ! 查看 VXLAN 配置
Ruijie# show vxlan vni 10010 ! 查看指定 VNI
Ruijie# show bgp l2vpn evpn summary ! EVPN 邻居状态
Ruijie# show bgp l2vpn evpn ! EVPN 路由
Ruijie# show mac address-table vxlan ! VXLAN MAC 表
Ruijie# show evpn ! EVPN 全局信息
部署要点
① Underlay 必须先通:VTEP 的 Loopback 之间必须路由可达
② MTU 要放大:VXLAN 封装增加 50 字节左右开销,Underlay 建议 MTU ≥ 1600
③ EVPN 邻居必须 activate(address-family l2vpn evpn 下)
④ RD/RT 规划与 MPLS VPN 类似,RD 区分、RT 控制导入导出
14_9 故障排查四法论与综合案例
排障四法
| 方法 | 含义 | 适用 |
|---|---|---|
| 分层法 | 从物理层往上逐层排除 | 最通用,任何故障都能用 |
| 分段法 | 把路径切成几段,逐段测试 | 跨多跳、跨域的网络 |
| 对比法 | 拿"正常的"和"异常的"对比配置/状态 | 部分通、部分不通 |
| 替换法 | 换端口、换线、换设备 | 怀疑硬件/链路问题 |
分层法标准流程(自底向上)
① 物理层 端口 up 吗?光模块/线缆/光衰正常吗?CRC 涨吗?
↓ show ip interface brief / show interfaces counters
② 数据链路层 MAC 学到了吗?VLAN 对吗?Trunk 放通了吗?有环路吗?
↓ show mac address-table / show vlan / show spanning-tree
③ 网络层 ARP 有吗?网关通吗?路由表有条目吗?
↓ show arp / show ip route / ping 网关
④ 传输层 端口通吗?ACL 拦了吗?
↓ show ip access-lists(看计数器)/ telnet 端口测试
⑤ 应用层 DNS 解析对吗?服务本身起来了吗?
↓ nslookup / 应用层日志
分段法示意
PC ──①── 接入 ──②── 汇聚 ──③── 核心 ──④── 出口 ──⑤── 互联网
逐段测试:
① PC → 网关 测接入层与 SVI
② 网关 → 核心互联地址 测汇聚到核心
③ 核心 → 出口内网口 测核心到出口
④ 出口 → 运营商网关 测出口链路
⑤ 出口 → 公网 DNS 测端到端
哪一段不通,故障域就锁定在哪一段
对比法要点
适用场景:同一台交换机上 A 端口通、B 端口不通
标准动作:
① 对比两端端口配置 show running-config interface A / B
② 对比端口状态 show interfaces status
③ 对比 VLAN 归属 show vlan
④ 对比生成树状态 show spanning-tree interface
⑤ 对比安全特性 show port-security interface
综合案例一:全网间歇性丢包
现象:整个办公网每隔十几分钟丢包几秒,无规律,业务投诉不断
排查过程:
① 分层:ping 网关也丢,说明问题在二层或三层以下
② 查交换机 CPU:show cpu —— 发现周期性冲高
③ 查 MAC 表:show mac address-table count —— 某 VLAN MAC 数量周期性暴增
④ 查端口:show interfaces status —— 未发现 err-disable
⑤ 抓包:发现大量源 MAC 不断变化的帧
根因:某端口下接入了环路或 MAC 泛洪源
解决:定位该端口,启用 port-security 限制 MAC 数量 + rldp
复盘:间歇性丢包 + CPU 冲高 + MAC 数量异常 = 二层环路/泛洪三件套
综合案例二:VRRP 切换后部分终端不通
现象:核心主备切换演练后,大部分终端正常,约 20% 终端仍无法上网
排查过程:
① 查 VRRP 状态:show vrrp brief —— 新 Master 正常
② 查终端 ARP:arp -a —— 发现这 20% 终端的网关 MAC 仍是【旧 Master 的 MAC】
③ 手动清空终端 ARP:arp -d * —— 立刻恢复
根因:部分终端未响应新 Master 的免费 ARP,ARP 缓存未刷新
解决:缩短 ARP 老化时间;或在网关侧主动发送免费 ARP
复盘:VRRP 切换依赖免费 ARP 刷新终端缓存,这是设计上的"软肋"
→ 关键业务终端建议缩短 ARP 老化时间,或在演练后主动清缓存
综合案例三:BGP 路由振荡
现象:某条 BGP 路由反复 up/down,日志里邻居频繁重建
排查思路:
① 查邻居状态:show ip bgp summary —— 状态在 Established 与 Idle 间跳变
② 查可达性:ping 邻居地址 —— 时通时断(底层链路问题)
③ 查底层:物理链路 / MTU / 中间设备
④ 若底层正常,检查是否配置了 route-map 导致路由被反复撤销
⑤ 检查是否有 dampening 抑制
解决顺序:先修底层链路,再考虑启用路由阻尼(dampening)抑制振荡
复盘:BGP 是应用层协议,绝大多数"路由振荡"根因在【底层】
→ 不要一上来就调 BGP 参数,先确认 ping 邻居是否稳定
RGSE 排障答题模板
遇到一个复杂故障,按这五步组织答案:
① 现象确认 —— 影响范围(哪些网段/业务)、时间规律(持续/间歇)
② 信息收集 —— 拓扑、配置、日志、show 输出(不要凭猜测)
③ 定界 —— 用分层/分段法锁定故障域在哪一段
④ 定因 —— 给出根因,并说明"为什么这个根因会导致这个现象"
⑤ 解决与规避 —— 临时规避方案 + 根本解决方案 + 回退方案
14_10 速记卡 · 板块14
| 编号 | 一句话结论 | 关键词 |
|---|---|---|
| ★1 | BGP 选路 13 条,前 8 条必背:Weight→LP→本地始发→AS_Path→Origin→MED→E/BGP→IGP Cost | 记忆锚点 |
| ★2 | Local_Pref 管"我怎么出去",MED 管"别人怎么进来" | 一句话区别 |
| ★3 | MED 是可选非传递(跨 AS 丢失);Community 是可选可传递 | 必考题 |
| ★4 | RR 解决 IBGP 全互联;防环靠 Originator_ID + Cluster_List | 反射器 |
| ★5 | ISIS 默认所有接口 Cost=10,与带宽无关 | 与 OSPF 差异 |
| ★6 | RD 解决地址重叠,RT 解决路由给谁 | MPLS VPN 必考 |
| ★7 | ip vrf forwarding 会清空接口 IP,先绑 VRF 再配 IP |
部署禁忌 |
| ★8 | VRF 环境下 ping 必须带 vrf 名称 |
最常误判 |
| ★9 | SR 把路径编码进段列表,中间节点无状态;SR-MPLS 主流,SRv6 是方向 | 核心思想 |
| ★10 | IPSec 阶段一对参数与密钥,阶段二对兴趣流与变换集;兴趣流必须镜像对称 | 排障要点 |
| ★11 | IPSec 与 NAT 冲突时,在 NAT ACL 中 deny 掉 VPN 兴趣流 | 经典坑 |
| ★12 | QoS 四步:分类打标 → 队列调度 → 拥塞避免 → 限速整形;语音用 LLQ | 部署顺序 |
| ★13 | VXLAN = MAC-in-UDP(UDP 4789),VNI 24 位;EVPN 用 MP-BGP 传 MAC/IP | 大二层 |
| ★14 | 排障四法:分层、分段、对比、替换 | 方法论 |
| ★15 | 间歇丢包 + CPU 冲高 + MAC 暴增 = 二层环路/泛洪三件套 | 综合判断 |
浙公网安备 33010602011771号