MTU 黑洞和碎片 PCAP 分析:查找 PMTUD 故障、MSS 问题和停滞的 TCP

如何诊断 MTU 黑洞、路径 MTU 发现失败、TCP MSS 不匹配、碎片、ICMP 阻止消息、VPN 隧道以及数据包捕获中的停滞连接。

MTU 黑洞, 路径 MTU 发现, TCP 消息传送, fragmentation, 粒子电容分析, VPN 故障排除

MTU 问题会造成一些最令人困惑的网络故障。小请求有效。 Ping 可能有效。 DNS 可能有效。 TCP 连接。 TLS 可能会启动。然后,大量响应会停滞、上传挂起、网站部分加载、VPN 流量中断或 RTSP/HTTP 流在较高比特率下失败。用户搜索“MTU黑洞pcap”、“路径MTU发现失败”、“TCP MSS问题”、“碎片数据包捕获”和“大数据包停顿VPN”,因为连接不是简单地打开或关闭。

数据包捕获可以显示大型数据包是否被发送、分段、丢弃、重传或因丢失 ICMP 反馈而被阻止。但必须仔细解释跟踪,因为捕获点、卸载和隧道开销可能会扭曲可见的数据包大小。

PCAP 手术在这里很有用,因为 MTU 调查通常需要集中跟踪:一次 TCP 会话、原始计时、ICMP 消息、重传、MSS 协商以及停顿前后足够的数据包。

MTU 是什么意思

MTU 是链路上的最大传输单元。以太网通常使用 1500 字节。 VPN、PPPoE、隧道、覆盖和云网络会减少有效路径 MTU,因为它们会添加标头。

如果发送方传输的数据包大于路径可以承载的数据包,则必须发生以下两种情况之一:

  • 数据包在允许的情况下被分段。
  • 数据包被丢弃,发送方必须了解较小的路径 MTU。

路径 MTU 发现依赖 ICMP 消息来报告数据包太大。如果这些 ICMP 消息被阻止,发送者可能会继续发送消失的数据包。这就是经典的MTU黑洞。

MTU黑洞的症状

常见症状包括:

  • TCP 连接打开,但大量传输停滞。
  • HTTPS 握手在 ClientHello 或 ServerHello 之后停止。
  • 登录页面已加载,但文件上传失败。
  • VPN 连接,但某些网站无法加载。
  • SSH 会一直工作,直到出现大量输出。
  • 小负载的 API 调用可以工作,大负载则失败。
  • RTSP 控制有效,但媒体或大型交错数据包表现不佳。
  • 以相似的数据包大小重复重传。

关键模式是尺寸敏感性。小数据包通过。较大的数据包会失败。

MSS协商

TCP 最大分段大小是在 SYN 交换期间协商的:

Client -> Server: SYN, MSS 1460
Server -> Client: SYN-ACK, MSS 1460

ICMP fragmentation needed

If the capture shows:

then Path MTU Discovery is working.

If the capture shows:

then an MTU black hole is plausible.

Fragmentation evidence

In a pcap, look for:

TLS handshake stalls and MTU

VPN and tunnel overhead

Capture point and offload

To avoid mistakes:

Checklist for MTU black hole PCAP analysis

Use this process:

Final diagnosis

<!-- pcap-localized-evidence-foundation-v1:start -->

用数据包证据回答“MTU 黑洞和碎片 PCAP 分析:查找 PMTUD 故障、MSS 问题和停滞的 TCP”

直接答案是:分析器 label 或应用消息不能单独确定原因。应从 capture point 与 flow direction 开始,证明最后成功的 protocol boundary 和首个失败 boundary。另一位 reviewer 必须能找到支撑句子的 packet、gap 或 interval,并知道什么证据可以否定判断。

把抓包放到路径地图上

记录 client、server,以及中间的 proxy、load balancer、NAT 或 firewall。写明 interface、位置、clock、OS 和可见方向。client 附近的 capture 证明什么到达 client,但不能证明 server 没发送;server 附近只证明该位置的出口。对比两个观察点前,修正 clock offset,并按 flow tuple、TCP sequence 或 transaction ID 对齐。

检查 snap length、dropped packets、offload、capture filter、ring buffer 和开始时间。host 上的 bad checksum 可能是 offload artifact。大 segment 可能来自 GRO/TSO,并非 wire 上的一个 packet。有限文件里缺少 packet,不能在证明观察点本应看到它之前写成 network loss。

按顺序读取边界

边界 成功证据 有效失败证据
Link/IP direction、addresses、route 一致 ARP/NDP 缺失、ICMP、MTU、asymmetry
TCP SYN、SYN-ACK、ACK、sequence 正确 retransmission、RST、zero window、timeout
TLS ClientHello、ServerHello、handshake 推进 alert 或 SNI/ALPN/certificate boundary
Application 完整 request 与对应 response status、gap 或提前 close
User response time 或 failure window stall 对应已证实边界

在第一个没有成功证据的边界停止。TCP 未建立时不要先解释 HTTP。request 到达 proxy 却未出现在 upstream,边界位于 proxy 或其路径;upstream 已收到但 timeout 前没有 response,应通过 ACK 与 bytes 推进区分 application delay 与 network loss。

分开 observation 与 hypothesis

observation 可以指到记录:“client 发送到指定 sequence,sender 重复同一 segment 三次,本观察点没有出现推进 ACK。”hypothesis 是“路径丢失 segment”。另一位置的 capture 或 dropped records 可能否定它。为每个假设写一项支持证据与一项反证。

retransmission 或 duplicate ACK 不能自动分配责任。reordering、loss、capture artifact、receiver delay 会产生相似 label。关联 direction、sequence、ACK、SACK、RTT、window 与 application timing。DNS/DHCP 对齐 transaction ID 与 attempts,HTTP 对齐 request/response,TLS 对齐 handshake direction。

编辑前保全原件

计算 original checksum,并保持原件不变。filter、trim、redaction 在 working copy 上完成。记录 input、operation、时间、前后 packet count、output checksum 与理由。timestamp rewrite 或删除 packets 后,该副本不再适合某些 timing 或 sequence 结论。

addresses 与 identifiers 使用一致 aliases,保持 endpoint 可追踪。不能删除判断所需的 port、direction、length。secret mapping 单独保存。通过抓取与导出范围PCAP Surgery 概览检查派生文件。

发布前 QA

title 与 answer 是否回答同一 flow?每个 duration 是否写明 clock 与观察点?首个 failure boundary 是否明确?有没有 alternative explanation?复测是否只改一项?original 是否保留?限制结论:“该文件证明指定 interval 的 client 附近行为,不证明 server 内部执行。”

Semrush 验证的一般词 PCAP analyzer 只由产品页负责。技术博客保持自身问题,不编造 volume 或 KD。

<!-- pcap-localized-evidence-foundation-v1:end --><!-- pcap-localized-flow-verdicts-v1:start -->

flow 台账与排除实验

围绕“MTU 黑洞和碎片 PCAP 分析:查找 PMTUD 故障、MSS 问题和停滞的 TCP”为每个方向建立一行:endpoint aliases、首末 packet、已发送和已确认 bytes、resets、retransmissions、requests、responses。相同 hostname 不等于同一连接,source port、开始时间、TCP initial sequence 用于区分 sessions。经过 NAT 或 proxy 时记录 flows 的对应关系,不期待 sequence 或 ports 相同。

计算 TCP,不数 labels

追踪 receiver 的 next expected sequence。payload 按长度推进 sequence,SYN 与 FIN 也各占一个编号。较高 segment 到达后持续 Duplicate ACK,支持 loss 或 reordering。SACK blocks 说明哪些 ranges 到达,但不能证明丢失位置。sender 侧看到 retransmission 而 receiver 侧没有,应检查中间 path;sender capture 连 original 都没有,应检查 capture loss 或 offload。

区分 duplicate ACK 后的 fast retransmit 与沉默后的 RTO。比较事前 RTT、advertised window、zero-window probes、burst 与 transfer size。overlap、spurious retransmission、从 flow 中段开始抓取都会改变 analyzer label,label 数量不等于 loss 数量。

用边界测量时间

使用 request first byte、request complete、response first byte、response complete。TTFB 不自动等于 server time。response 前 retransmission 可能增加 network delay;request 已完整 ACK 后长时间沉默更支持 application wait。写明数值、unit、clock、point。

两个观察点先在双方向匹配特征 packet,估算 offset,再使用各文件内部 intervals。clock 不确定时给 range。成功与失败 window 应保持相近 duration 与 load。

协议专项问题

DNS 检查 ID、name、type 与 retry resolver;DHCP 检查同一 client identifier 的 Discover/Offer/Request/ACK;TLS 找各方向最后 handshake message 与 alert;HTTP 识别 4xx/5xx 生成者及 upstream flow;TCP close 识别 FIN/RST sender 与未 ACK bytes。

决定性实验与交付

选择两个竞争 hypothesis 和一个区分实验。另一端 capture 区分 network loss 与 measurement loss;test 中关闭 offload 检查 artifact;固定 path 发送相同 request 检查 intermittency;upstream log 对照 packet boundary 检查 application delay。执行前先写预期。

reviewer 能用 metadata 重复计算、找到同一 boundary 并理解限制,才算验收。交付 original/derived checksums、filter、packet ranges、trim/redaction 操作,以 owner、next action 和可测量 close 条件结束。

复现性复核

从新 connection 使用相同 inputs 与 filters 重复三次。ports 与 initial sequence 可以变化,但 boundary、direction、response pattern 应当重复。完整报告成功与失败。修复只改一个变量,并确认预期 packet behavior 发生变化,而不只是应用消息消失。

在另一设备打开 derived copy。reviewer 应找到 flow aliases、clock、capture point、最后成功、首个失败和 alternative。redaction 后重新搜索 hostname、query、header、sensitive payload,同时保留判断所需 length 与 direction。列出未测范围:反方向、IPv6、reconnect 或其他 load。

最终状态只能是范围内已证明、仍可复现、或因指定 capture 缺失而未决。只验证一个 flow 时不能写成“整个网络已修复”。

反向对照与置信度

关闭“{{TITLE}}”前先写反向预测。如果原因是 network path,移动 capture point 后两个位置分别应出现什么 pattern?如果是 server delay,request bytes 是否应全部 ACK 而 response 仍缺失?在结果前写预期,可以防止事后改变解释。

confidence 必须绑定 evidence。high 需要重复结果以及两个观察点或独立证据;medium 表示完整 capture 仍有未测 alternative;low 只有 label 或粗略 timing。confidence 不会把 hypothesis 变成 fact,但能确定 next action。

慢速或 intermittent failure 要测量超过通常 failure interval。比较 rates 而非原始 counts:每 megabyte 的 retransmissions、每 connection 的 failures、相似 load 下的 latency percentiles。记录 idle、reconnect、DNS cache、TLS session reuse,因为它们会改变第二次运行。

交付包包含 flow table、五个 event 的 timeline、first difference、exclusion test、fix result、untested scope。packet numbers 对应 derived copy,并通过 time map 返回 original。接收团队无需 secrets 或作者 session 即可重复 verdict,才算通过。

<!-- pcap-localized-flow-verdicts-v1:end -->