HTTP/2 GOAWAY および RST_STREAM PCAP 分析: リセット ストリーム、プロキシ制限、および gRPC エラーのデバッグ

HTTP/2 GOAWAY、RST_STREAM、gRPC 利用不可エラー、プロキシ ストリーム制限、TLS ALPN ネゴシエーション、接続の再利用、およびパケット キャプチャの証拠を診断する方法。

http2 goaway, rst_stream, GRPC が使用できません, プロキシのリセット, alpn, pcap 分析, http2 troubleshooting

1 つの TCP 接続で多数のストリームが伝送される可能性があるため、HTTP/2 障害の診断は困難な場合があります。単一のリクエストが「RST​​_STREAM」で失敗したり、接続全体が「GOAWAY」を受信したり、gRPC クライアントが「UNAVAILABLE」、「INTERNAL」、「CANCELLED」、または「stream replace」を報告したりする場合があります。クライアント、プロキシ、ロード バランサー、サーバーのいずれがストリームを終了したかがログに説明されていない場合、ユーザーは「HTTP2 GOAWAY pcap」、「RST_STREAM 分析」、「gRPC ストリーム リセット パケット キャプチャ」、「HTTP/2 プロキシ リセット」、および「ALPN HTTP2 トラブルシューティング」を検索します。

HTTP/2 証拠では TLS、ALPN、接続タイミング、ストリーム リセット、および TCP クローズ動作を保存する必要があるため、PCAP サージェリーが役立ちます。 TLS が暗号化されており、キーが利用できない場合でも、パケット キャプチャには、制御された環境でのみタイミング、TCP リセット、接続の再利用、および場合によっては復号化された HTTP/2 が表示されます。

HTTP/2 接続とストリームの比較

HTTP/2 は、1 つの接続上で複数のストリームを多重化します。ストリームのリセットは、TCP 接続のリセットとは異なります。

  • RST_STREAM: 1 つのストリームがキャンセルまたは失敗しました。
  • GOAWAY: エンドポイントが HTTP/2 接続を閉じているか、ドレインしています。
  • TCP FIN/RST: 基礎となる接続が閉じるか中止されます。

アプリケーションでは、これらを 1 つのエラーにまとめることがよくあります。パケット証拠とログはそれらを分離する必要があります。

ALPN ネゴシエーション

TLS 上の HTTP/2 は通常、ALPN に依存します。 TLS ハンドシェイクは「h2」または別のプロトコルをネゴシエートします。 ALPN が HTTP/2 をネゴシエートしない場合、クライアントとサーバーはフォールバックするか失敗する可能性があります。

保存する:

  • ClientHello ALPN 拡張機能。
  • サーバーが選択した ALPN (表示されている場合)。
  • TLS アラート。
  • ハンドシェイク中に TCP がリセットされます。

HTTP/2 がネゴシエートされたことがない場合は、まだ「RST_STREAM」をデバッグしないでください。

GOAWAY

「GOAWAY」は、その接続上で新しいストリームを作成してはならないことをピアに伝えます。これは、正常なドレイン、デプロイ、プロキシ接続のエージング、またはロード バランサーの動作中には正常である可能性があります。クライアントがドレイン接続を誤って再利用する場合、またはアクティブなリクエスト中に GOAWAY が表示される場合に問題になります。

重要な質問:

  • ゴーアウェイを送ったのは誰ですか?
  • 最後のストリーム ID は何でしたか?
  • アクティブなストリームが失敗しましたか?
  • クライアントは新しい接続を再試行しましたか?
  • GOAWAY は固定接続年齢で発生しますか?

RST_STREAM

RST_STREAM は 1 つの HTTP/2 ストリームを終了します。原因には次のようなものがあります。

  • クライアントのキャンセル。
  • サーバーがリクエストを拒否しました。
  • プロキシのタイムアウト。
  • フロー制御の問題。
  • 最大ストリーム制限。
  • gRPC の期限を超えました。
  • プロキシによって変換されたバックエンド リセット。

ストリーム ID とタイミングが重要です。これらがなければ、パケットのストーリーは不完全です。

TCP層は依然として重要

HTTP/2 は TCP 上にあります。基礎となる接続に再送信、ゼロ ウィンドウ、リセット、MTU の問題、またはアイドル タイムアウトがある場合、HTTP/2 エラーは二次的なものである可能性があります。

相関させる:

  • ストリームのリセット時間。
  • リセット前の TCP 再送信。
  • FIN/RST 送信者。
  • アイドル間隔。
  • 表示されている場合は TLS close_notify。

Checklist

このワークフローを使用します。

  1. DNS、TCP、および TLS ハンドシェイクを保持します。
  2. ALPN が HTTP/2 でネゴシエートしたことを確認します。
  3. 障害がストリーム レベルであるか接続レベルであるかを特定します。
  4. GOAWAY のタイミングと送信者を探します。
  5. 復号化されたトレースまたはログで RST_STREAM タイミングとストリーム ID を探します。
  6. プロキシ/ロードバランサーのログと関連付けます。
  7. TCP 再送信、ゼロ ウィンドウ、FIN、および RST を確認します。
  8. クライアントが正しく再試行するかどうかを確認します。
  9. トリミング時にパケットのタイミングを維持します。
  10. 暗号化された場合、pcap 証拠を HTTP/2 デバッグ ログと結合します。

最終診断

HTTP/2 GOAWAY エラーと RST_STREAM エラーは、一般的なネットワーク障害ではありません。これらは、ALPN、プロキシの動作、gRPC の期限、TCP の健全性、および接続の再利用と相関付ける必要があるストリームおよび接続の制御信号です。

PCAP 手術はタイムラインの維持に役立つため、HTTP/2 および gRPC の障害を適切なレイヤー (TLS ネゴシエーション、ストリーム リセット、接続ドレイン、プロキシ タイムアウト、または TCP トランスポート障害) に減らすことができます。