MTU 黑洞和碎片 PCAP 分析:查找 PMTUD 故障、MSS 问题和停滞的 TCP

如何诊断 MTU 黑洞、路径 MTU 发现失败、TCP MSS 不匹配、碎片、ICMP 阻止消息、VPN 隧道以及数据包捕获中的停滞连接。

MTU 黑洞, 路径 MTU 发现, TCP 消息传送, fragmentation, 粒子电容分析, VPN 故障排除

MTU 问题会造成一些最令人困惑的网络故障。小请求有效。 Ping 可能有效。 DNS 可能有效。 TCP 连接。 TLS 可能会启动。然后,大量响应会停滞、上传挂起、网站部分加载、VPN 流量中断或 RTSP/HTTP 流在较高比特率下失败。用户搜索“MTU黑洞pcap”、“路径MTU发现失败”、“TCP MSS问题”、“碎片数据包捕获”和“大数据包停顿VPN”,因为连接不是简单地打开或关闭。

数据包捕获可以显示大型数据包是否被发送、分段、丢弃、重传或因丢失 ICMP 反馈而被阻止。但必须仔细解释跟踪,因为捕获点、卸载和隧道开销可能会扭曲可见的数据包大小。

PCAP 手术在这里很有用,因为 MTU 调查通常需要集中跟踪:一次 TCP 会话、原始计时、ICMP 消息、重传、MSS 协商以及停顿前后足够的数据包。

MTU 是什么意思

MTU 是链路上的最大传输单元。以太网通常使用 1500 字节。 VPN、PPPoE、隧道、覆盖和云网络会减少有效路径 MTU,因为它们会添加标头。

如果发送方传输的数据包大于路径可以承载的数据包,则必须发生以下两种情况之一:

  • 数据包在允许的情况下被分段。
  • 数据包被丢弃,发送方必须了解较小的路径 MTU。

路径 MTU 发现依赖 ICMP 消息来报告数据包太大。如果这些 ICMP 消息被阻止,发送者可能会继续发送消失的数据包。这就是经典的MTU黑洞。

MTU黑洞的症状

常见症状包括:

  • TCP 连接打开,但大量传输停滞。
  • HTTPS 握手在 ClientHello 或 ServerHello 之后停止。
  • 登录页面已加载,但文件上传失败。
  • VPN 连接,但某些网站无法加载。
  • SSH 会一直工作,直到出现大量输出。
  • 小负载的 API 调用可以工作,大负载则失败。
  • RTSP 控制有效,但媒体或大型交错数据包表现不佳。
  • 以相似的数据包大小重复重传。

关键模式是尺寸敏感性。小数据包通过。较大的数据包会失败。

MSS协商

TCP 最大分段大小是在 SYN 交换期间协商的:

Client -> Server: SYN, MSS 1460
Server -> Client: SYN-ACK, MSS 1460

ICMP fragmentation needed

If the capture shows:

then Path MTU Discovery is working.

If the capture shows:

then an MTU black hole is plausible.

Fragmentation evidence

In a pcap, look for:

TLS handshake stalls and MTU

VPN and tunnel overhead

Capture point and offload

To avoid mistakes:

Checklist for MTU black hole PCAP analysis

Use this process:

Final diagnosis

<!-- pcap-localized-evidence-foundation-v1:start -->

用数据包证据回答“MTU 黑洞和碎片 PCAP 分析:查找 PMTUD 故障、MSS 问题和停滞的 TCP”

直接答案是:分析器 label 或应用消息不能单独确定原因。应从 capture point 与 flow direction 开始,证明最后成功的 protocol boundary 和首个失败 boundary。另一位 reviewer 必须能找到支撑句子的 packet、gap 或 interval,并知道什么证据可以否定判断。

把抓包放到路径地图上

记录 client、server,以及中间的 proxy、load balancer、NAT 或 firewall。写明 interface、位置、clock、OS 和可见方向。client 附近的 capture 证明什么到达 client,但不能证明 server 没发送;server 附近只证明该位置的出口。对比两个观察点前,修正 clock offset,并按 flow tuple、TCP sequence 或 transaction ID 对齐。

检查 snap length、dropped packets、offload、capture filter、ring buffer 和开始时间。host 上的 bad checksum 可能是 offload artifact。大 segment 可能来自 GRO/TSO,并非 wire 上的一个 packet。有限文件里缺少 packet,不能在证明观察点本应看到它之前写成 network loss。

按顺序读取边界

边界 成功证据 有效失败证据
Link/IP direction、addresses、route 一致 ARP/NDP 缺失、ICMP、MTU、asymmetry
TCP SYN、SYN-ACK、ACK、sequence 正确 retransmission、RST、zero window、timeout
TLS ClientHello、ServerHello、handshake 推进 alert 或 SNI/ALPN/certificate boundary
Application 完整 request 与对应 response status、gap 或提前 close
User response time 或 failure window stall 对应已证实边界

在第一个没有成功证据的边界停止。TCP 未建立时不要先解释 HTTP。request 到达 proxy 却未出现在 upstream,边界位于 proxy 或其路径;upstream 已收到但 timeout 前没有 response,应通过 ACK 与 bytes 推进区分 application delay 与 network loss。

分开 observation 与 hypothesis

observation 可以指到记录:“client 发送到指定 sequence,sender 重复同一 segment 三次,本观察点没有出现推进 ACK。”hypothesis 是“路径丢失 segment”。另一位置的 capture 或 dropped records 可能否定它。为每个假设写一项支持证据与一项反证。

retransmission 或 duplicate ACK 不能自动分配责任。reordering、loss、capture artifact、receiver delay 会产生相似 label。关联 direction、sequence、ACK、SACK、RTT、window 与 application timing。DNS/DHCP 对齐 transaction ID 与 attempts,HTTP 对齐 request/response,TLS 对齐 handshake direction。

编辑前保全原件

计算 original checksum,并保持原件不变。filter、trim、redaction 在 working copy 上完成。记录 input、operation、时间、前后 packet count、output checksum 与理由。timestamp rewrite 或删除 packets 后,该副本不再适合某些 timing 或 sequence 结论。

addresses 与 identifiers 使用一致 aliases,保持 endpoint 可追踪。不能删除判断所需的 port、direction、length。secret mapping 单独保存。通过抓取与导出范围PCAP Surgery 概览检查派生文件。

发布前 QA

title 与 answer 是否回答同一 flow?每个 duration 是否写明 clock 与观察点?首个 failure boundary 是否明确?有没有 alternative explanation?复测是否只改一项?original 是否保留?限制结论:“该文件证明指定 interval 的 client 附近行为,不证明 server 内部执行。”

Semrush 验证的一般词 PCAP analyzer 只由产品页负责。技术博客保持自身问题,不编造 volume 或 KD。

<!-- pcap-localized-evidence-foundation-v1:end --><!-- multilingual-blog-closeout:start -->

直接答案与验收边界

关于“MTU 黑洞和碎片 PCAP 分析:查找 PMTUD 故障、MSS 问题和停滞的 TCP”的简短答案是:如何诊断 MTU 黑洞、路径 MTU 发现失败、TCP MSS 不匹配、碎片、ICMP 阻止消息、VPN 隧道以及数据包捕获中的停滞连接。 这句话应当被视为需要验证的结果,而不是对所有输入、设备、项目或环境的承诺。完整结果会记录初始状态、准确操作、可见输出,以及能够证明任务已在 PCAP Surgery 中完成的条件。

证据优先的操作程序

修改完整项目之前,先从小型、可重复的案例开始。记录应用版本、操作系统、输入或设备身份、相关设置和预期结果。只执行一个明确动作,保留第一处意外变化,并在条件允许时与已知正常案例比较。同时修改多个控件会掩盖究竟哪个条件制造或修复了问题。

检查点 1:MTU 黑洞和碎片 PCAP 分析:查找 PMTUD 故障、MSS 问题和停滞的 TCP

针对“MTU 黑洞和碎片 PCAP 分析:查找 PMTUD 故障、MSS 问题和停滞的 TCP”,要区分产品判断与操作系统、硬件、源文件、权限或工作流边界。归因之前先确认哪一层提供了证据,避免把相邻症状写成已经证明的根本原因。

检查点 2:如何诊断 MTU 黑洞、路径 MTU 发现失败、TCP MSS 不匹配、碎片、ICMP 阻止消息、VPN 隧道以及数据包捕获中的停滞连接。

只有在保存、导出或重新打开后的结果仍与观察状态一致时,才能关闭“如何诊断 MTU 黑洞、路径 MTU 发现失败、TCP MSS 不匹配、碎片、ICMP 阻止消息、VPN 隧道以及数据包捕获中的停滞连接。”。临时界面反馈有参考价值,但持久证据更强。把剩余限制记录下来,避免下一位读者误判为完整成功。

检查点 3:MTU 是什么意思

针对“MTU 是什么意思”,要区分产品判断与操作系统、硬件、源文件、权限或工作流边界。归因之前先确认哪一层提供了证据,避免把相邻症状写成已经证明的根本原因。

检查点 4:MTU黑洞的症状

只有在保存、导出或重新打开后的结果仍与观察状态一致时,才能关闭“MTU黑洞的症状”。临时界面反馈有参考价值,但持久证据更强。把剩余限制记录下来,避免下一位读者误判为完整成功。

检查点 5:MSS协商

针对“MSS协商”,要区分产品判断与操作系统、硬件、源文件、权限或工作流边界。归因之前先确认哪一层提供了证据,避免把相邻症状写成已经证明的根本原因。

检查点 6:ICMP fragmentation needed

只有在保存、导出或重新打开后的结果仍与观察状态一致时,才能关闭“ICMP fragmentation needed”。临时界面反馈有参考价值,但持久证据更强。把剩余限制记录下来,避免下一位读者误判为完整成功。

检查点 7:Fragmentation evidence

针对“Fragmentation evidence”,要区分产品判断与操作系统、硬件、源文件、权限或工作流边界。归因之前先确认哪一层提供了证据,避免把相邻症状写成已经证明的根本原因。

检查点 8:TLS handshake stalls and MTU

只有在保存、导出或重新打开后的结果仍与观察状态一致时,才能关闭“TLS handshake stalls and MTU”。临时界面反馈有参考价值,但持久证据更强。把剩余限制记录下来,避免下一位读者误判为完整成功。

检查点 9:VPN and tunnel overhead

针对“VPN and tunnel overhead”,要区分产品判断与操作系统、硬件、源文件、权限或工作流边界。归因之前先确认哪一层提供了证据,避免把相邻症状写成已经证明的根本原因。

检查点 10:Capture point and offload

只有在保存、导出或重新打开后的结果仍与观察状态一致时,才能关闭“Capture point and offload”。临时界面反馈有参考价值,但持久证据更强。把剩余限制记录下来,避免下一位读者误判为完整成功。

验收矩阵

检查点 需要保留的证据 通过条件
MTU 黑洞和碎片 PCAP 分析:查找 PMTUD 故障、MSS 问题和停滞的 TCP 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果
如何诊断 MTU 黑洞、路径 MTU 发现失败、TCP MSS 不匹配、碎片、ICMP 阻止消息、VPN 隧道以及数据包捕获中的停滞连接。 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果
MTU 是什么意思 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果
MTU黑洞的症状 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果
MSS协商 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果
ICMP fragmentation needed 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果

失败隔离、恢复与交接

在第一个失败边界停止。保留源文件、项目、会话或抓取;破坏性编辑前先制作副本;每次实验只改变一个变量。多项修改后重跑完整流程,即使结果不同,也无法解释为什么。

要区分没有证据与证明不存在。空白界面可能来自错误输入、范围、过滤器、权限、设备、时间区间或项目状态。解释 decoder、编辑器、报告或导出之前,先证明采集或导入路径。

交接之前重新打开持久成果,检查开头、判断点和结尾。记录版本、平台、配置、预期行为、观察结果和最小复现步骤。删除或遮蔽敏感内容,并确认接收人有权接收。

问答

最快且可靠的开始方式是什么?

使用最小但有代表性的案例,写下预期结果,并且只改变一个变量。添加过滤器、效果、编辑、自动化或更大输入之前,先确认基础路径。

应该保存哪些证据?

保留输入身份、版本、平台、相关设置、准确动作、第一处意外变化和最终输出。项目、会话、报告或导出都应关闭并重新打开后再视为持久证据。

什么时候需要重复这套程序?

当应用、操作系统、driver、firmware、模型、源文件或工作流变化可能影响结果时。保留之前已经通过的案例,作为未修改的比较基线。

什么时候可以交接?

当另一位有权限的人能够识别输入、重复动作、看到相同结果、理解剩余限制,并且无需未记录的本地状态就能打开成果时。

相关指南

下面的同语言页面覆盖相邻阶段,同时不会改变本主题的规范所有页。

<!-- multilingual-blog-closeout:end -->