RTSP 流在 30 秒后停止:Keepalive、会话超时、NAT 和摄像头空闲断开连接

为什么 RTSP 流在 30 秒、60 秒或几分钟后停止,以及如何调试 keepalive 请求、会话超时、NAT、RTP 静默和摄像头断开连接。

rtsp流停止, rtsp保活, 会话超时, 相机断开连接, rtsp诊断, RTP 沉默

成功启动但 30 秒后停止的 RTSP 流与从未启动的流是不同的问题。身份验证有效。 SDP 被退回。 SETUPPLAY 可能成功了。媒体可能已经到达一段时间了。然后摄像机关闭会话、RTP 停止、播放器冻结或连接超时。

诸如“RTSP 流在 30 秒后停止”、“RTSP keepalive 超时”、“摄像头流在一分钟后断开连接”和“RTSP 会话超时”之类的搜索通常指向会话生命周期问题。流可能需要保活请求、NAT 映射可能过期、摄像机可能关闭空闲 RTSP 会话、UDP 媒体可能在路径更改后被阻止,或者 RTCP 可能在断开连接之前显示媒体丢失。

RTSP Inspector 在这里很有用,因为时间线很重要。您需要知道第 0 秒、第 30 秒、第 60 秒发生了什么,以及流停止的确切时刻。

为什么RTSP启动后就停止

常见原因包括:

  • 客户端不发送 RTSP keepalive。
  • 相机需要“GET_PARAMETER”保持活动状态。
  • 相机需要“OPTIONS”保持活动状态。
  • RTSP 会话超时比预期短。
  • NAT 或防火墙状态过期。
  • UDP RTP 停止,而 RTSP TCP 保持打开状态。
  • 媒体静默后,摄像机关闭 TCP 连接。
  • 客户端使用了错误的聚合控制 URL。
  • 相机固件存在会话清理错误。
  • RTCP 在流冻结之前报告数据包丢失或抖动。

修复取决于哪一层首先停止:RTSP 控制、RTP 媒体、RTCP 反馈或底层 TCP/UDP 路径。

RTSP 会话标头和超时

在“SETUP”之后,相机通常会返回一个“Session”标头:

RTSP/1.0 200 OK
Session: 12345678;timeout=60
Transport: RTP/AVP/TCP;unicast;interleaved=0-1

OPTIONS vs GET_PARAMETER keepalive

Two common keepalive methods are:

OPTIONS rtsp://camera/stream RTSP/1.0
Session: 12345678

和:

GET_PARAMETER rtsp://camera/stream RTSP/1.0
Session: 12345678

When debugging, check:

Aggregate control URL problems

This can create subtle behavior:

NAT and firewall idle timeout

Symptoms:

Camera idle disconnects

Look for:

RTP silence vs RTSP disconnect

Checklist for streams that stop after 30 seconds

Use this process:

A useful report includes:

Final diagnosis

<!-- rtsp-localized-evidence-foundation-v1:start -->

“RTSP 流在 30 秒后停止:Keepalive、会话超时、NAT 和摄像头空闲断开连接”的可复现实证流程

直接答案是:黑屏或单个状态码不能证明故障归属。可靠诊断必须把 RTSP 请求与响应、协商后的 Transport、有效 Session,以及后续 RTP 序列号、时间戳和 RTCP 证据放进同一条时间线。处理“RTSP 流在 30 秒后停止:Keepalive、会话超时、NAT 和摄像头空闲断开连接”时,可以从最接近可见症状的层开始,但不能把控制层、网络路径和解码器问题混成一个结论。

修改摄像机、防火墙或 VMS 前,先建立一份小型基线。记录隐藏密码后的 RTSP URL、测试时间、路径、请求的 Transport、服务器响应和首个媒体包到达时间。设备同时支持 UDP 与 TCP interleaved 时,应分两次测试。不要在同一次实验里同时更换路径、凭据和传输模式,否则第二次成功也无法说明哪项变化真正修复了问题。

检查层 必须保存的证据 决策问题
RTSP 方法、状态、头字段、CSeq、Session 服务器是否接受了这一项操作
SDP control、payload type、clock rate、codec 服务器描述的是否为目标媒体轨
Transport client_port、server_port、interleaved 两端是否使用同一条媒体通道
RTP SSRC、sequence、timestamp、marker 媒体单元是否按可解释顺序到达
RTCP sender report、CNAME、BYE 时钟、身份和结束事件能否关联
解码器 SPS/PPS/VPS、packetization mode 已到达的 payload 能否完成初始化

始终区分“媒体没有到达”和“媒体到达但无法解码”。SETUP 与 PLAY 成功后仍无 RTP,应检查 UDP 路径、NAT、防火墙和不匹配的 Transport 响应。RTP 序列出现缺口,证明存在丢包或重排。序列连续却仍无画面,则应转向 payload type、clock rate、帧边界以及 H.264/H.265 参数。这个边界比播放器的笼统错误更能确定下一位修复责任人。

怎样写出可直接引用的答案

用三句话写明最后成功的操作、第一项失败证据和下一项区分实验。例如:“DESCRIBE、SETUP 与 PLAY 均成功;客户端声明的端口没有收到 RTP;改用 TCP interleaved 可区分 UDP 被阻断和媒体路径错误。”没有响应或数据包证据时,不要直接宣称整台摄像机或整段网络已经损坏。

最小复现资料包括什么

保存 OPTIONS、DESCRIBE、SETUP、PLAY、SDP、Transport 响应和脱敏后的 Session。媒体侧至少记录 SSRC、首尾序列号、clock rate、缺口数量和抓取时长。VLC 或另一套 VMS 的成败可以作为差异实验,但不能证明成功客户端正确处理了所有协议边界。

什么时候检查服务器,什么时候检查客户端

服务器明确拒绝方法、返回不存在的 control URL、回复不兼容 Transport,或无说明地改变 SSRC/时钟时,应先检查服务器。客户端重复过期 nonce、遗漏 Session、请求 UDP 却没有开放端口,或把每个 NAL 结尾都当成 access unit 结尾时,应先检查客户端。故障位于中间路径时,每个结论都必须附带数据包与时间。

交付报告前怎样复核

从新连接重新测试,只比较两条时间线的第一个差异。删除密码和完整 Authorization 值,把每项结论关联到 CSeq、sequence 或 timestamp。继续查看相关 RTSP 指南,并用 RTSP Inspector在本地测试 RTSP 流和收集证据,无需把摄像机视频上传到公共服务。

<!-- rtsp-localized-evidence-foundation-v1:end --><!-- rtsp-localized-layer-verdicts-v1:start -->

从观察记录到可复核的分层结论

处理“RTSP 流在 30 秒后停止:Keepalive、会话超时、NAT 和摄像头空闲断开连接”时,先写观察,再写解释。观察必须能由另一位工程师在抓包中重新找到,例如带 CSeq 的 RTSP 状态、SDP 字段、Transport 响应、序列号缺口、SSRC 变化,或 RTP timestamp 与 RTCP sender report 的对应关系。“服务器很慢”或“编码不兼容”只是待验证假设,直到具体证据能比其他原因更好地解释结果。

把链路拆成边界。先确认 TCP 建立,再确认 OPTIONS 或 DESCRIBE 被接受;SDP 必须描述可用媒体轨、control URL、payload type 和 clock rate;SETUP 需要兼容的 Transport,PLAY 需要有效 Session。之后才检查 RTP 到达、顺序、时间和解码器准备。停在第一项缺少成功证据的边界,不要让后续数据掩盖前序缺口。

做对照实验时,尽量固定来源和时间区间。UDP 与 TCP interleaved 使用相同路径和凭据;main stream 与 sub stream 使用相同客户端和传输模式;比较 VLC 与 VMS 时,记录双方真实发送的方法、头字段和 URL。control URL、Authorization、Session 或 keepalive 的差异,可能比软件名称更能解释结果。

排除矩阵

每次先列两个假设。没有媒体时,可以比较 UDP 被阻断和服务器发往错误端口;TCP interleaved 检查前者,比较 Transport 提议、响应、IP 与端口检查后者。画面损坏时,RTP sequence 可区分丢包与初始化不足,而首帧前是否存在 SPS/PPS/VPS 可检查 codec 参数假设。

每个假设都要写支持证据和可反驳证据。任何数据包都无法否定的说法过于宽泛。“NAT 丢弃 UDP”可被客户端端口实际收到 RTP 反驳;“缺少 H.264 参数”可被 IDR 前有效 SPS/PPS 反驳。这样报告会成为有优先级的判断,而不是无序的可能性清单。

不要混用不同时间

RTSP CSeq 表示控制事务顺序,RTP sequence 表示包顺序,RTP timestamp 表示媒体采样时间,capture clock 表示数据到达观察点的时间。它们不是同一只钟。到达抖动不能单独证明 timestamp drift;没有 sequence 证据的 timestamp 跳变也不能单独证明丢包。音视频同步应使用 RTCP sender report 关联不同 RTP 时钟与共同参考。

最终验收资料

当修复能在新连接中以一项已记录变更重复出现时,才关闭调查。报告需要写明输入、最后成功边界、第一项失败证据、变更、复测结果和未测试事项。附上短小相关的 transcript 或统计,而不是一份没有范围的巨大文件。隐藏秘密,但保留 CSeq、脱敏 Session、SSRC 与时间区间。

使用RTSP 故障排除重建顺序,并通过 RTSP Inspector 报告把已证实的故障边界交给摄像机、网络或 VMS 团队。

变更记录与回归测试

把修复写成可重复的变更记录:旧值、新值、设置位置、重新连接时间,以及预期出现的数据包变化。改用 TCP interleaved 时,不能只记录“画面出现”;还应确认媒体不再依赖独立 UDP 端口,而是出现在已协商的 interleaved 通道。修改 control URL 时,SETUP 必须使用新路径,PLAY 与 keepalive 必须保持同一 Session。

条件安全时做一次反向对照:在测试环境临时恢复旧值,或选用相同输入的历史抓包,确认同一边界重新失败。这样可避免把偶然重启、缓存或未记录的网络变化误认为修复。生产摄像机不应为了验证而主动中断,可使用时间和输入都清楚的旧证据。

让连接持续超过 keepalive 与 Session timeout,观察 OPTIONS/GET_PARAMETER、CSeq 推进和 Session 一致性。RTP 应在等长时间窗口里比较丢包、重复、重排和 SSRC 变化。codec 修复必须从全新连接验证 SDP、启动参数、首个 IDR 与后续帧;已经初始化的 decoder 可能掩盖启动参数缺失。

限制结论范围。“该客户端使用 TCP 验证 main stream 十分钟”比“RTSP 已修好”准确。写明已验证的媒体轨、Transport、codec、客户端和时长;未验证的音频、sub stream 或断网重连应保留为开放项。

把事实和建议分开。事实是响应、数据包和测量值;建议是基于事实修改摄像机、防火墙、VMS 或客户端。即使另一团队选择不同修复方式,也应能接受事实本身。最后写明下一步负责人和关闭条件,并按 RTSP Inspector 报告指南交付脱敏后的短时间区间。

<!-- rtsp-localized-layer-verdicts-v1:end -->