Черная дыра MTU и анализ фрагментации PCAP: обнаружение сбоев PMTUD, проблем MSS и остановок TCP

Как диагностировать черные дыры MTU, сбой обнаружения MTU пути, несоответствие TCP MSS, фрагментацию, заблокированные сообщения ICMP, туннели VPN и остановку соединений при перехвате пакетов.


Проблемы MTU приводят к наиболее запутанным сетевым сбоям. Маленькие запросы работают. Пинги могут работать. DNS может работать. TCP подключается. TLS может запуститься. Затем большие ответы останавливаются, загрузка зависает, веб-сайты загружаются частично, VPN-трафик прерывается или потоки RTSP/HTTP не работают при более высоком битрейте. Пользователи ищут «черная дыра MTU pcap», «ошибка обнаружения MTU пути», «проблема TCP MSS», «захват фрагментированных пакетов» и «большие пакеты останавливают VPN», потому что соединение не просто работает или отключается.

Захват пакетов может показать, отправляются ли большие пакеты, фрагментируются, отбрасываются, повторно передаются или блокируются из-за отсутствия обратной связи ICMP. Но трассировку следует интерпретировать осторожно, поскольку точка захвата, разгрузка и накладные расходы туннеля могут искажать видимые размеры пакетов.

PCAP Surgery здесь полезен, поскольку для исследования MTU часто требуется целенаправленное отслеживание: один TCP-разговор, исходное время, сообщения ICMP, повторные передачи, согласование MSS и достаточное количество пакетов до и после остановки.

Что означает МТУ

MTU — это максимальная единица передачи по каналу. Ethernet обычно использует 1500 байт. VPN, PPPoE, туннели, оверлеи и облачные сети могут уменьшить эффективный MTU пути, поскольку они добавляют заголовки.

Если отправитель передает пакеты размером больше, чем может передать путь, должно произойти одно из двух:

  • Пакеты фрагментируются там, где это разрешено.
  • Пакеты отбрасываются, и отправитель должен узнать меньший MTU пути.

Обнаружение MTU пути использует сообщения ICMP, чтобы сообщить о том, что пакет слишком велик. Если эти сообщения ICMP заблокированы, отправитель может продолжать отправлять пакеты, которые исчезают. Это классическая черная дыра MTU.

Симптомы черной дыры MTU

Общие симптомы включают в себя:

  • TCP-соединение открывается, но большая передача останавливается.
  • Подтверждение HTTPS прекращается после ClientHello или ServerHello.
  • Страница входа загружается, но загрузить файл не удается.
  • VPN подключается, но некоторые сайты не загружаются.
  • SSH работает до тех пор, пока не появится большой вывод.
  • Вызовы API с небольшими полезными нагрузками работают, большие полезные нагрузки терпят неудачу.
  • Управление RTSP работает, но медиа или большие чередующиеся пакеты ведут себя плохо.
  • Повторные передачи повторяются с одинаковыми размерами пакетов.

Ключевой закономерностью является чувствительность к размеру. Мелкие пакеты проходят. Большие пакеты терпят неудачу.

MSS-переговоры

Максимальный размер сегмента TCP согласовывается во время обмена SYN:

Client -> Server: SYN, MSS 1460
Server -> Client: SYN-ACK, MSS 1460

ICMP fragmentation needed

If the capture shows:

then Path MTU Discovery is working.

If the capture shows:

then an MTU black hole is plausible.

Fragmentation evidence

In a pcap, look for:

TLS handshake stalls and MTU

VPN and tunnel overhead

Capture point and offload

To avoid mistakes:

Checklist for MTU black hole PCAP analysis

Use this process:

Final diagnosis

<!-- pcap-localized-evidence-foundation-v1:start -->

Пакетный ответ для «Черная дыра MTU и анализ фрагментации PCAP: обнаружение сбоев PMTUD, проблем MSS и остановок TCP»

Краткий ответ: label анализатора или сообщение приложения не определяет причину. Начните с точки захвата и направления, докажите последнюю успешную protocol boundary и первую неудачную. Для «Черная дыра MTU и анализ фрагментации PCAP: обнаружение сбоев PMTUD, проблем MSS и остановок TCP» другой reviewer должен найти packet, gap или interval, поддерживающий каждую фразу, и понять, какой факт её опровергнет.

Разместите capture на карте пути

Запишите client, server и все proxy, load balancer, NAT или firewall. Укажите interface, место, clock, OS и видимые направления. Capture у client доказывает приход туда, но не отсутствие отправки server. Capture у server доказывает выход в этой точке, но не весь путь. Перед сравнением двух точек исправьте clock offset и сопоставьте flow tuple, TCP sequence или transaction ID.

Проверьте snap length, dropped packets, offload, capture filter, ring buffer и время старта. Bad checksum на host может быть offload artifact. Большой segment может быть результатом GRO/TSO и не существовать так на проводе. Отсутствие packet в ограниченном файле не является network loss, пока не доказано, что точка обязана была его видеть.

Читайте границы по порядку

Граница Успешный признак Полезный признак отказа
Link/IP direction, addresses и route согласованы нет ARP/NDP, ICMP, MTU, asymmetry
TCP SYN, SYN-ACK, ACK и sequence retransmission, RST, zero window, timeout
TLS ClientHello, ServerHello и прогресс alert или SNI/ALPN/certificate boundary
Application полный request и связанный response status, gap или ранний close
User response time или failure window stall на доказанной границе

Остановитесь на первой границе без успеха. Если TCP не завершён, не начинайте с HTTP. Если request пришёл на proxy, но отсутствует на upstream, граница внутри proxy или его пути. Если upstream получил запрос без response до timeout, ACK и продвижение bytes отделяют application delay от network loss.

Отделите observation от hypothesis

Observation можно указать: «Client отправил до определённой sequence, sender повторил segment трижды, а в этой точке не появилось продвигающего ACK». Hypothesis: «путь потерял segment». Другая точка или dropped records могут её опровергнуть. Для каждой гипотезы запишите подтверждающий и опровергающий факт.

Retransmission и duplicate ACK не назначают виновного. Reordering, loss, capture artifact и receiver delay дают похожие labels. Свяжите direction, sequence, ACK, SACK, RTT, window и application timing. Для DNS/DHCP сопоставляйте transaction ID и attempts; для HTTP request/response; для TLS направление handshake.

Сохраните original

Рассчитайте checksum и не изменяйте оригинал. Filter, trim и redaction выполняются над working copy. Запишите input, operation, время, packet count до/после, output checksum и причину. После timestamp rewrite или удаления packets копия не поддерживает часть выводов о timing и sequence.

Addresses и identifiers заменяйте устойчивыми aliases. Не удаляйте port, direction и length, если они нужны выводу. Secret mapping держите отдельно. Проверьте границы capture и export и обзор PCAP Surgery.

QA перед публикацией

Title и answer относятся к одному flow? Каждая duration называет clock и точки? Первая failure boundary определена? Есть alternative explanation? Повтор меняет одну переменную? Original сохранён? Ограничьте итог: «Файл доказывает поведение около client в этом interval, но не внутреннее выполнение server».

Проверенный Semrush-термин PCAP analyzer принадлежит только странице продукта. Техническая статья не получает выдуманный volume или KD.

<!-- pcap-localized-evidence-foundation-v1:end --><!-- pcap-localized-flow-verdicts-v1:start -->

Flow ledger и исключающий тест

Для «Черная дыра MTU и анализ фрагментации PCAP: обнаружение сбоев PMTUD, проблем MSS и остановок TCP» создайте строку по каждому направлению: endpoint aliases, первый/последний packet, отправленные и подтверждённые bytes, resets, retransmissions, requests и responses. Одинаковый hostname не объединяет соединения; source port, время старта и TCP initial sequence разделяют sessions. Для NAT/proxy запишите связь flows, не ожидая одинаковых sequence и ports.

Считайте TCP, а не labels

Следите за next expected sequence receiver. Payload сдвигает sequence на длину; SYN и FIN также занимают номер. Стабильный Duplicate ACK после более высоких segments поддерживает loss или reordering. SACK blocks показывают пришедшие ranges, но не место потери. Retransmission у sender без появления у receiver требует проверки пути; отсутствие original уже в sender capture требует проверки capture loss или offload.

Отделяйте fast retransmit после duplicate ACKs от RTO после тишины. Сравните предыдущий RTT, advertised window, zero-window probes, burst и размер transfer. Overlap, spurious retransmission и capture с середины flow меняют label, поэтому число labels не равно числу потерь.

Измеряйте время по границам

Используйте request first byte, request complete, response first byte и response complete. TTFB не равен server time автоматически. Retransmission до response может добавить network delay; полностью подтверждённый request и долгая тишина поддерживают application wait. Укажите значение, unit, clock и point.

Для двух точек совместите характерный packet в обоих направлениях, оцените offset и используйте intervals внутри файлов. При неизвестном clock дайте range. Сравнивайте успешные и неудачные windows одинаковой длительности и нагрузки.

Вопросы протокола

DNS: совпадают ID, name и type, меняет ли retry resolver/source port? DHCP: относятся ли Discover/Offer/Request/ACK к одному client identifier? TLS: последнее handshake message каждого направления и alert. HTTP: кто создал 4xx/5xx и есть ли upstream flow? TCP close: кто отправил FIN/RST и какие bytes не подтверждены?

Решающий тест и передача

Выберите две гипотезы и один разделяющий тест. Capture у другого конца разделяет network loss и measurement loss; выключение offload в тесте проверяет artifact; одинаковый request на фиксированном path — intermittency; upstream log против packet boundary — application delay. Запишите ожидания заранее.

Reviewer должен повторить расчёт по metadata, найти ту же границу и назвать ограничение. Передайте original/derived checksums, filter, packet ranges и операции trim/redaction. Закончите owner, действием и измеримым условием закрытия.

Проверка воспроизводимости

Откройте новую connection и повторите сценарий трижды с одинаковыми inputs и filters. Ports и initial sequence могут меняться, но boundary, direction и response pattern должны повторяться. Запишите успехи и отказы. Исправление меняет одну переменную; после него должно измениться ожидаемое packet behavior, а не только исчезнуть сообщение.

Откройте derived copy на другом компьютере. Reviewer находит flow aliases, clock, capture point, последний успех, первый отказ и alternative. После redaction снова ищите hostname, query, header и чувствительный payload, сохраняя нужные length и direction. Перечислите непроверенное: обратное направление, IPv6, reconnect, другая load.

Итог: доказано в указанном объёме, всё ещё воспроизводится или открыто из-за конкретного capture. Не пишите «сеть исправлена», если проверен один flow.

Противоположный контроль и доверие

До закрытия «{{TITLE}}» запишите противоположный прогноз. Если причина в network path, какой pattern должен быть виден в двух точках после переноса capture? Если это server delay, останутся ли request bytes подтверждёнными при отсутствии response? Ожидания до теста предотвращают подгонку объяснения после результата.

Свяжите confidence с доказательствами. High требует повторения и двух точек либо независимого подтверждения; medium — полного capture с непроверенной alternative; low — только label или примерного timing. Confidence не превращает hypothesis в fact, но задаёт next action.

Для медленного или intermittent failure измеряйте дольше обычного интервала. Сравнивайте rates: retransmissions на мегабайт, failures на connection и latency percentiles при сходной load. Запишите idle, reconnect, DNS cache и TLS session reuse, так как они меняют второй запуск.

Передайте flow table, timeline из пяти событий, first difference, exclusion test, fix result и untested scope. Packet numbers относятся к derived copy, а time map возвращает к original. Получатель должен повторить verdict без secrets и без session автора.

<!-- pcap-localized-flow-verdicts-v1:end -->