Черная дыра MTU и анализ фрагментации PCAP: обнаружение сбоев PMTUD, проблем MSS и остановок TCP
Как диагностировать черные дыры MTU, сбой обнаружения MTU пути, несоответствие TCP MSS, фрагментацию, заблокированные сообщения ICMP, туннели VPN и остановку соединений при перехвате пакетов.
Проблемы MTU приводят к наиболее запутанным сетевым сбоям. Маленькие запросы работают. Пинги могут работать. DNS может работать. TCP подключается. TLS может запуститься. Затем большие ответы останавливаются, загрузка зависает, веб-сайты загружаются частично, VPN-трафик прерывается или потоки RTSP/HTTP не работают при более высоком битрейте. Пользователи ищут «черная дыра MTU pcap», «ошибка обнаружения MTU пути», «проблема TCP MSS», «захват фрагментированных пакетов» и «большие пакеты останавливают VPN», потому что соединение не просто работает или отключается.
Захват пакетов может показать, отправляются ли большие пакеты, фрагментируются, отбрасываются, повторно передаются или блокируются из-за отсутствия обратной связи ICMP. Но трассировку следует интерпретировать осторожно, поскольку точка захвата, разгрузка и накладные расходы туннеля могут искажать видимые размеры пакетов.
PCAP Surgery здесь полезен, поскольку для исследования MTU часто требуется целенаправленное отслеживание: один TCP-разговор, исходное время, сообщения ICMP, повторные передачи, согласование MSS и достаточное количество пакетов до и после остановки.
Что означает МТУ
MTU — это максимальная единица передачи по каналу. Ethernet обычно использует 1500 байт. VPN, PPPoE, туннели, оверлеи и облачные сети могут уменьшить эффективный MTU пути, поскольку они добавляют заголовки.
Если отправитель передает пакеты размером больше, чем может передать путь, должно произойти одно из двух:
- Пакеты фрагментируются там, где это разрешено.
- Пакеты отбрасываются, и отправитель должен узнать меньший MTU пути.
Обнаружение MTU пути использует сообщения ICMP, чтобы сообщить о том, что пакет слишком велик. Если эти сообщения ICMP заблокированы, отправитель может продолжать отправлять пакеты, которые исчезают. Это классическая черная дыра MTU.
Симптомы черной дыры MTU
Общие симптомы включают в себя:
- TCP-соединение открывается, но большая передача останавливается.
- Подтверждение HTTPS прекращается после ClientHello или ServerHello.
- Страница входа загружается, но загрузить файл не удается.
- VPN подключается, но некоторые сайты не загружаются.
- SSH работает до тех пор, пока не появится большой вывод.
- Вызовы API с небольшими полезными нагрузками работают, большие полезные нагрузки терпят неудачу.
- Управление RTSP работает, но медиа или большие чередующиеся пакеты ведут себя плохо.
- Повторные передачи повторяются с одинаковыми размерами пакетов.
Ключевой закономерностью является чувствительность к размеру. Мелкие пакеты проходят. Большие пакеты терпят неудачу.
MSS-переговоры
Максимальный размер сегмента TCP согласовывается во время обмена SYN:
Client -> Server: SYN, MSS 1460
Server -> Client: SYN-ACK, MSS 1460
ICMP fragmentation needed
If the capture shows:
then Path MTU Discovery is working.
If the capture shows:
then an MTU black hole is plausible.
Fragmentation evidence
In a pcap, look for:
TLS handshake stalls and MTU
VPN and tunnel overhead
Capture point and offload
To avoid mistakes:
Checklist for MTU black hole PCAP analysis
Use this process:
Final diagnosis
<!-- pcap-localized-evidence-foundation-v1:start -->Пакетный ответ для «Черная дыра MTU и анализ фрагментации PCAP: обнаружение сбоев PMTUD, проблем MSS и остановок TCP»
Краткий ответ: label анализатора или сообщение приложения не определяет причину. Начните с точки захвата и направления, докажите последнюю успешную protocol boundary и первую неудачную. Для «Черная дыра MTU и анализ фрагментации PCAP: обнаружение сбоев PMTUD, проблем MSS и остановок TCP» другой reviewer должен найти packet, gap или interval, поддерживающий каждую фразу, и понять, какой факт её опровергнет.
Разместите capture на карте пути
Запишите client, server и все proxy, load balancer, NAT или firewall. Укажите interface, место, clock, OS и видимые направления. Capture у client доказывает приход туда, но не отсутствие отправки server. Capture у server доказывает выход в этой точке, но не весь путь. Перед сравнением двух точек исправьте clock offset и сопоставьте flow tuple, TCP sequence или transaction ID.
Проверьте snap length, dropped packets, offload, capture filter, ring buffer и время старта. Bad checksum на host может быть offload artifact. Большой segment может быть результатом GRO/TSO и не существовать так на проводе. Отсутствие packet в ограниченном файле не является network loss, пока не доказано, что точка обязана была его видеть.
Читайте границы по порядку
| Граница | Успешный признак | Полезный признак отказа |
|---|---|---|
| Link/IP | direction, addresses и route согласованы | нет ARP/NDP, ICMP, MTU, asymmetry |
| TCP | SYN, SYN-ACK, ACK и sequence | retransmission, RST, zero window, timeout |
| TLS | ClientHello, ServerHello и прогресс | alert или SNI/ALPN/certificate boundary |
| Application | полный request и связанный response | status, gap или ранний close |
| User | response time или failure window | stall на доказанной границе |
Остановитесь на первой границе без успеха. Если TCP не завершён, не начинайте с HTTP. Если request пришёл на proxy, но отсутствует на upstream, граница внутри proxy или его пути. Если upstream получил запрос без response до timeout, ACK и продвижение bytes отделяют application delay от network loss.
Отделите observation от hypothesis
Observation можно указать: «Client отправил до определённой sequence, sender повторил segment трижды, а в этой точке не появилось продвигающего ACK». Hypothesis: «путь потерял segment». Другая точка или dropped records могут её опровергнуть. Для каждой гипотезы запишите подтверждающий и опровергающий факт.
Retransmission и duplicate ACK не назначают виновного. Reordering, loss, capture artifact и receiver delay дают похожие labels. Свяжите direction, sequence, ACK, SACK, RTT, window и application timing. Для DNS/DHCP сопоставляйте transaction ID и attempts; для HTTP request/response; для TLS направление handshake.
Сохраните original
Рассчитайте checksum и не изменяйте оригинал. Filter, trim и redaction выполняются над working copy. Запишите input, operation, время, packet count до/после, output checksum и причину. После timestamp rewrite или удаления packets копия не поддерживает часть выводов о timing и sequence.
Addresses и identifiers заменяйте устойчивыми aliases. Не удаляйте port, direction и length, если они нужны выводу. Secret mapping держите отдельно. Проверьте границы capture и export и обзор PCAP Surgery.
QA перед публикацией
Title и answer относятся к одному flow? Каждая duration называет clock и точки? Первая failure boundary определена? Есть alternative explanation? Повтор меняет одну переменную? Original сохранён? Ограничьте итог: «Файл доказывает поведение около client в этом interval, но не внутреннее выполнение server».
Проверенный Semrush-термин PCAP analyzer принадлежит только странице продукта. Техническая статья не получает выдуманный volume или KD.
<!-- pcap-localized-evidence-foundation-v1:end --><!-- pcap-localized-flow-verdicts-v1:start -->Flow ledger и исключающий тест
Для «Черная дыра MTU и анализ фрагментации PCAP: обнаружение сбоев PMTUD, проблем MSS и остановок TCP» создайте строку по каждому направлению: endpoint aliases, первый/последний packet, отправленные и подтверждённые bytes, resets, retransmissions, requests и responses. Одинаковый hostname не объединяет соединения; source port, время старта и TCP initial sequence разделяют sessions. Для NAT/proxy запишите связь flows, не ожидая одинаковых sequence и ports.
Считайте TCP, а не labels
Следите за next expected sequence receiver. Payload сдвигает sequence на длину; SYN и FIN также занимают номер. Стабильный Duplicate ACK после более высоких segments поддерживает loss или reordering. SACK blocks показывают пришедшие ranges, но не место потери. Retransmission у sender без появления у receiver требует проверки пути; отсутствие original уже в sender capture требует проверки capture loss или offload.
Отделяйте fast retransmit после duplicate ACKs от RTO после тишины. Сравните предыдущий RTT, advertised window, zero-window probes, burst и размер transfer. Overlap, spurious retransmission и capture с середины flow меняют label, поэтому число labels не равно числу потерь.
Измеряйте время по границам
Используйте request first byte, request complete, response first byte и response complete. TTFB не равен server time автоматически. Retransmission до response может добавить network delay; полностью подтверждённый request и долгая тишина поддерживают application wait. Укажите значение, unit, clock и point.
Для двух точек совместите характерный packet в обоих направлениях, оцените offset и используйте intervals внутри файлов. При неизвестном clock дайте range. Сравнивайте успешные и неудачные windows одинаковой длительности и нагрузки.
Вопросы протокола
DNS: совпадают ID, name и type, меняет ли retry resolver/source port? DHCP: относятся ли Discover/Offer/Request/ACK к одному client identifier? TLS: последнее handshake message каждого направления и alert. HTTP: кто создал 4xx/5xx и есть ли upstream flow? TCP close: кто отправил FIN/RST и какие bytes не подтверждены?
Решающий тест и передача
Выберите две гипотезы и один разделяющий тест. Capture у другого конца разделяет network loss и measurement loss; выключение offload в тесте проверяет artifact; одинаковый request на фиксированном path — intermittency; upstream log против packet boundary — application delay. Запишите ожидания заранее.
Reviewer должен повторить расчёт по metadata, найти ту же границу и назвать ограничение. Передайте original/derived checksums, filter, packet ranges и операции trim/redaction. Закончите owner, действием и измеримым условием закрытия.
Проверка воспроизводимости
Откройте новую connection и повторите сценарий трижды с одинаковыми inputs и filters. Ports и initial sequence могут меняться, но boundary, direction и response pattern должны повторяться. Запишите успехи и отказы. Исправление меняет одну переменную; после него должно измениться ожидаемое packet behavior, а не только исчезнуть сообщение.
Откройте derived copy на другом компьютере. Reviewer находит flow aliases, clock, capture point, последний успех, первый отказ и alternative. После redaction снова ищите hostname, query, header и чувствительный payload, сохраняя нужные length и direction. Перечислите непроверенное: обратное направление, IPv6, reconnect, другая load.
Итог: доказано в указанном объёме, всё ещё воспроизводится или открыто из-за конкретного capture. Не пишите «сеть исправлена», если проверен один flow.
Противоположный контроль и доверие
До закрытия «{{TITLE}}» запишите противоположный прогноз. Если причина в network path, какой pattern должен быть виден в двух точках после переноса capture? Если это server delay, останутся ли request bytes подтверждёнными при отсутствии response? Ожидания до теста предотвращают подгонку объяснения после результата.
Свяжите confidence с доказательствами. High требует повторения и двух точек либо независимого подтверждения; medium — полного capture с непроверенной alternative; low — только label или примерного timing. Confidence не превращает hypothesis в fact, но задаёт next action.
Для медленного или intermittent failure измеряйте дольше обычного интервала. Сравнивайте rates: retransmissions на мегабайт, failures на connection и latency percentiles при сходной load. Запишите idle, reconnect, DNS cache и TLS session reuse, так как они меняют второй запуск.
Передайте flow table, timeline из пяти событий, first difference, exclusion test, fix result и untested scope. Packet numbers относятся к derived copy, а time map возвращает к original. Получатель должен повторить verdict без secrets и без session автора.
<!-- pcap-localized-flow-verdicts-v1:end -->