DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应

如何通过数据包捕获来诊断 DNS 超时、重传、无响应、SERVFAIL、UDP 丢失、TCP 回退、解析器延迟和应用程序延迟。

域名解析超时, DNS重传, 粒子电容分析, 解析器延迟, 数据包捕获, DNS 故障排除

DNS 故障通常伪装成应用程序故障。浏览器显示无法访问某个站点。 API 客户端显示超时。服务在打开连接之前需要五秒钟的时间。用户搜索“DNS 超时 pcap”、“DNS 重传 Wireshark”、“DNS 查询无响应”、“DNS 解析器数据包捕获缓慢”和“SERVFAIL 与超时”,因为可见错误很少解释是否名称解析失败、解析器缓慢或网络丢失数据包。

如果您保持 DNS 查询、响应、计时、重传和回退行为完好无损,则数据包捕获可以准确地回答这个问题。

PCAP 手术很有用,因为 DNS 证据通常埋藏在大痕迹中。您可能需要隔离一个客户端、一个解析器、一个域和一个时间窗口,同时保留时间戳和请求 ID。

健康的 DNS 交换是什么样的

基本的 UDP DNS 交换很短:

Client -> Resolver: Query A example.com
Resolver -> Client: Response A example.com 93.184.216.34

The important fields are:

DNS timeout vs DNS error

Retransmission and retry behavior

A trace may show:

0.000 Client -> 8.8.8.8 Query example.com
1.000 Client -> 8.8.8.8 Query example.com
2.000 Client -> 1.1.1.1 Query example.com
2.030 1.1.1.1 -> Client Response example.com

这表明第一个解析器没有及时响应,而第二个解析器则及时响应。应用程序延迟包括等待第一个解析器所花费的时间。

丢失查询与丢失响应

对于一个捕获点,您可能不知道查询或响应是否丢失。捕捉位置很重要。

如果您在客户端上捕获并看到查询离开但没有响应到达,则响应可能已丢失、被阻止、延迟或从未生成。如果您在解析器上捕获但从未看到查询,则查询在到达解析器之前已丢失或在路径上被阻止。如果解析器看到并回答查询,但客户端从未看到响应,则损失发生在返回路径上。

有两个捕获更强:

  • 客户端捕获
  • 旋转变压器端捕获

它们一起可以证明数据包是在解析器之前、解析器之后还是在客户端主机内消失。

UDP 碎片和大型 DNS 响应

由于 DNSSEC、许多记录、TXT 记录或 EDNS0 缓冲区大小,DNS 响应可能会变得很大。大型 UDP 响应可能会分段。碎片可能无法跨越防火墙或 NAT 设备。

症状包括:

  • 小型 DNS 查询有效。
  • 大量响应超时。
  • DNSSEC 域失败的频率更高。
  • TCP 回退成功。
  • 带有截断位的响应会导致通过 TCP 重试。

如果解析器设置了截断位,则客户端可以通过 TCP 重试。这是正常的。如果 TCP 回退被阻止,用户可能会看到 DNS 超时或间歇性故障。

基于 TCP、DoT 和 DoH 的 DNS

经典 DNS 使用 UDP 和 TCP 端口 53。现代环境可能使用基于 TLS 的 DNS 或基于 HTTPS 的 DNS。正常的数据包捕获可能不会暴露加密 DNS 的域名,但它仍然可以显示时间、连接、重试和服务器可达性。

分析应用程序延迟时,首先确定使用哪个解析器路径。浏览器可以使用 DoH,而系统工具则使用操作系统解析器。这可以解释为什么“nslookup”可以工作但浏览器失败,或者为什么一个应用程序很慢而另一个应用程序却不慢。

搜索域和重复查询

企业和 VPN 环境通常会附加搜索域。对“service”的简单查找可能会产生如下查询:

service.corp.example.com
service.office.example.com
service

Checklist for DNS PCAP analysis

Use this process:

Final diagnosis

<!-- pcap-localized-evidence-foundation-v1:start -->

用数据包证据回答“DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应”

直接答案是:分析器 label 或应用消息不能单独确定原因。应从 capture point 与 flow direction 开始,证明最后成功的 protocol boundary 和首个失败 boundary。另一位 reviewer 必须能找到支撑句子的 packet、gap 或 interval,并知道什么证据可以否定判断。

把抓包放到路径地图上

记录 client、server,以及中间的 proxy、load balancer、NAT 或 firewall。写明 interface、位置、clock、OS 和可见方向。client 附近的 capture 证明什么到达 client,但不能证明 server 没发送;server 附近只证明该位置的出口。对比两个观察点前,修正 clock offset,并按 flow tuple、TCP sequence 或 transaction ID 对齐。

检查 snap length、dropped packets、offload、capture filter、ring buffer 和开始时间。host 上的 bad checksum 可能是 offload artifact。大 segment 可能来自 GRO/TSO,并非 wire 上的一个 packet。有限文件里缺少 packet,不能在证明观察点本应看到它之前写成 network loss。

按顺序读取边界

边界 成功证据 有效失败证据
Link/IP direction、addresses、route 一致 ARP/NDP 缺失、ICMP、MTU、asymmetry
TCP SYN、SYN-ACK、ACK、sequence 正确 retransmission、RST、zero window、timeout
TLS ClientHello、ServerHello、handshake 推进 alert 或 SNI/ALPN/certificate boundary
Application 完整 request 与对应 response status、gap 或提前 close
User response time 或 failure window stall 对应已证实边界

在第一个没有成功证据的边界停止。TCP 未建立时不要先解释 HTTP。request 到达 proxy 却未出现在 upstream,边界位于 proxy 或其路径;upstream 已收到但 timeout 前没有 response,应通过 ACK 与 bytes 推进区分 application delay 与 network loss。

分开 observation 与 hypothesis

observation 可以指到记录:“client 发送到指定 sequence,sender 重复同一 segment 三次,本观察点没有出现推进 ACK。”hypothesis 是“路径丢失 segment”。另一位置的 capture 或 dropped records 可能否定它。为每个假设写一项支持证据与一项反证。

retransmission 或 duplicate ACK 不能自动分配责任。reordering、loss、capture artifact、receiver delay 会产生相似 label。关联 direction、sequence、ACK、SACK、RTT、window 与 application timing。DNS/DHCP 对齐 transaction ID 与 attempts,HTTP 对齐 request/response,TLS 对齐 handshake direction。

编辑前保全原件

计算 original checksum,并保持原件不变。filter、trim、redaction 在 working copy 上完成。记录 input、operation、时间、前后 packet count、output checksum 与理由。timestamp rewrite 或删除 packets 后,该副本不再适合某些 timing 或 sequence 结论。

addresses 与 identifiers 使用一致 aliases,保持 endpoint 可追踪。不能删除判断所需的 port、direction、length。secret mapping 单独保存。通过抓取与导出范围PCAP Surgery 概览检查派生文件。

发布前 QA

title 与 answer 是否回答同一 flow?每个 duration 是否写明 clock 与观察点?首个 failure boundary 是否明确?有没有 alternative explanation?复测是否只改一项?original 是否保留?限制结论:“该文件证明指定 interval 的 client 附近行为,不证明 server 内部执行。”

Semrush 验证的一般词 PCAP analyzer 只由产品页负责。技术博客保持自身问题,不编造 volume 或 KD。

<!-- pcap-localized-evidence-foundation-v1:end --><!-- multilingual-blog-closeout:start -->

直接答案与验收边界

关于“DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应”的简短答案是:如何通过数据包捕获来诊断 DNS 超时、重传、无响应、SERVFAIL、UDP 丢失、TCP 回退、解析器延迟和应用程序延迟。 这句话应当被视为需要验证的结果,而不是对所有输入、设备、项目或环境的承诺。完整结果会记录初始状态、准确操作、可见输出,以及能够证明任务已在 PCAP Surgery 中完成的条件。

证据优先的操作程序

修改完整项目之前,先从小型、可重复的案例开始。记录应用版本、操作系统、输入或设备身份、相关设置和预期结果。只执行一个明确动作,保留第一处意外变化,并在条件允许时与已知正常案例比较。同时修改多个控件会掩盖究竟哪个条件制造或修复了问题。

检查点 1:DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应

把“DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应”作为“DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应”的独立验收关口。记录操作前状态、第一处可见变化和最终状态。如果结果与页面描述的目标不同,就回到最后一个已经确认的检查点,不要依靠假设继续。

检查点 2:如何通过数据包捕获来诊断 DNS 超时、重传、无响应、SERVFAIL、UDP 丢失、TCP 回退、解析器延迟和应用程序延迟。

把“如何通过数据包捕获来诊断 DNS 超时、重传、无响应、SERVFAIL、UDP 丢失、TCP 回退、解析器延迟和应用程序延迟。”写成另一位操作者可以重复的通过或失败陈述。包括必须存在的内容、必须不存在的内容,以及失败时安全的恢复动作。在修复副本通过同一检查前,不要改变原始项目或抓取。

检查点 3:健康的 DNS 交换是什么样的

把“健康的 DNS 交换是什么样的”作为“DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应”的独立验收关口。记录操作前状态、第一处可见变化和最终状态。如果结果与页面描述的目标不同,就回到最后一个已经确认的检查点,不要依靠假设继续。

检查点 4:DNS timeout vs DNS error

把“DNS timeout vs DNS error”写成另一位操作者可以重复的通过或失败陈述。包括必须存在的内容、必须不存在的内容,以及失败时安全的恢复动作。在修复副本通过同一检查前,不要改变原始项目或抓取。

检查点 5:Retransmission and retry behavior

把“Retransmission and retry behavior”作为“DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应”的独立验收关口。记录操作前状态、第一处可见变化和最终状态。如果结果与页面描述的目标不同,就回到最后一个已经确认的检查点,不要依靠假设继续。

检查点 6:丢失查询与丢失响应

把“丢失查询与丢失响应”写成另一位操作者可以重复的通过或失败陈述。包括必须存在的内容、必须不存在的内容,以及失败时安全的恢复动作。在修复副本通过同一检查前,不要改变原始项目或抓取。

检查点 7:UDP 碎片和大型 DNS 响应

把“UDP 碎片和大型 DNS 响应”作为“DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应”的独立验收关口。记录操作前状态、第一处可见变化和最终状态。如果结果与页面描述的目标不同,就回到最后一个已经确认的检查点,不要依靠假设继续。

检查点 8:基于 TCP、DoT 和 DoH 的 DNS

把“基于 TCP、DoT 和 DoH 的 DNS”写成另一位操作者可以重复的通过或失败陈述。包括必须存在的内容、必须不存在的内容,以及失败时安全的恢复动作。在修复副本通过同一检查前,不要改变原始项目或抓取。

检查点 9:搜索域和重复查询

把“搜索域和重复查询”作为“DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应”的独立验收关口。记录操作前状态、第一处可见变化和最终状态。如果结果与页面描述的目标不同,就回到最后一个已经确认的检查点,不要依靠假设继续。

检查点 10:Checklist for DNS PCAP analysis

把“Checklist for DNS PCAP analysis”写成另一位操作者可以重复的通过或失败陈述。包括必须存在的内容、必须不存在的内容,以及失败时安全的恢复动作。在修复副本通过同一检查前,不要改变原始项目或抓取。

验收矩阵

检查点 需要保留的证据 通过条件
DNS 重传和超时 PCAP 分析:查找缓慢的解析器、丢失的查询和损坏的响应 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果
如何通过数据包捕获来诊断 DNS 超时、重传、无响应、SERVFAIL、UDP 丢失、TCP 回退、解析器延迟和应用程序延迟。 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果
健康的 DNS 交换是什么样的 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果
DNS timeout vs DNS error 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果
Retransmission and retry behavior 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果
丢失查询与丢失响应 初始状态、一个动作和结果状态 另一位操作者可以重复所述结果

失败隔离、恢复与交接

在第一个失败边界停止。保留源文件、项目、会话或抓取;破坏性编辑前先制作副本;每次实验只改变一个变量。多项修改后重跑完整流程,即使结果不同,也无法解释为什么。

要区分没有证据与证明不存在。空白界面可能来自错误输入、范围、过滤器、权限、设备、时间区间或项目状态。解释 decoder、编辑器、报告或导出之前,先证明采集或导入路径。

交接之前重新打开持久成果,检查开头、判断点和结尾。记录版本、平台、配置、预期行为、观察结果和最小复现步骤。删除或遮蔽敏感内容,并确认接收人有权接收。

问答

最快且可靠的开始方式是什么?

使用最小但有代表性的案例,写下预期结果,并且只改变一个变量。添加过滤器、效果、编辑、自动化或更大输入之前,先确认基础路径。

应该保存哪些证据?

保留输入身份、版本、平台、相关设置、准确动作、第一处意外变化和最终输出。项目、会话、报告或导出都应关闭并重新打开后再视为持久证据。

什么时候需要重复这套程序?

当应用、操作系统、driver、firmware、模型、源文件或工作流变化可能影响结果时。保留之前已经通过的案例,作为未修改的比较基线。

什么时候可以交接?

当另一位有权限的人能够识别输入、重复动作、看到相同结果、理解剩余限制,并且无需未记录的本地状态就能打开成果时。

相关指南

下面的同语言页面覆盖相邻阶段,同时不会改变本主题的规范所有页。

<!-- multilingual-blog-closeout:end -->