计算结果

原始速率 128 GT/s
有效带宽(单向) 15.75 GB/s
全双工带宽(理论合计) 31.50 GB/s
等效比特率 126 Gbps
与其他接口对比

输入要传输的数据量,根据PCIe链路配置计算所需的传输时间与时延估算。

传输时延分析

时延分解
有效带宽 — GB/s
总传输时间
TLP 数量
数据传输时间
不同代数传输时间对比

时延估算说明

  • 上述固定时延为协议层参考估算值,显示典型值并附带范围(最小~最大),实际时延因设备实现而异
  • 不同 IP 厂商(Synopsys DesignWare、Cadence、Xilinx/AMD、ARM 等)的 PHY 和控制器实现差异较大,PHY 层时延可能相差 2~3 倍
  • PHY 层时延随代数变化:高速 SerDes 并行转换更快,但 Gen3+ 均衡(DFE)和 Gen6 PAM4 DSP+FEC 增加管线延迟
  • Ack/Nak 时延与链路速率正相关:高速链路的往返确认更快
  • 事务层处理时延与设备类型强相关:简单寄存器设备 ~0.2μs,NVMe/GPU 等复杂设备可达 1~5μs
  • Switch 转发时延典型值约 0.1~0.4 μs/跳,Broadcom PEX 系列较低
  • 协议开销仅含 TLP Header(16B)+LCRC(4B),编码效率已在带宽中扣除;DLLP(Ack) 为周期发送,不计入每包

PCIe各代规格参数对照表,包含传输速率、编码方式、带宽等关键指标。

参数 Gen1 Gen2 Gen3 Gen4 Gen5 Gen6 Gen7
发布年份 2003 2007 2010 2017 2019 2022 2025
传输速率 2.5 GT/s 5.0 GT/s 8.0 GT/s 16.0 GT/s 32.0 GT/s 64.0 GT/s 128.0 GT/s
编码方式 8b/10b 8b/10b 128b/130b 128b/130b 128b/130b PAM4 + FLIT PAM4 + FLIT
编码效率 80% 80% 98.5% 98.5% 98.5% ~94.5% ~94.5%
x1 有效带宽 250 MB/s 500 MB/s ~985 MB/s ~1.97 GB/s ~3.94 GB/s ~7.56 GB/s ~15.12 GB/s
x4 有效带宽 1 GB/s 2 GB/s ~3.94 GB/s ~7.88 GB/s ~15.75 GB/s ~30.25 GB/s ~60.50 GB/s
x8 有效带宽 2 GB/s 4 GB/s ~7.88 GB/s ~15.75 GB/s ~31.51 GB/s ~60.50 GB/s ~121.00 GB/s
x16 有效带宽 4 GB/s 8 GB/s ~15.75 GB/s ~31.51 GB/s ~63.02 GB/s ~121.00 GB/s ~242.00 GB/s
最大 Payload 4096 Bytes(所有代数一致)

计算说明

  • 有效带宽 = 传输速率 × Lane数 × 编码效率 ÷ 8(GT/s → GB/s)
  • Gen1/Gen2使用 8b/10b 编码,每10bit传输8bit有效数据,效率80%
  • Gen3/4/5使用 128b/130b 编码,每130bit传输128bit有效数据,效率98.46%
  • Gen6/Gen7使用 PAM4 调制 + FLIT 模式(242b/256b 编码),编码效率约94.5%;Gen7 速率翻倍至 128 GT/s
  • 以上为单向带宽,PCIe为全双工,实际可同时双向传输

TLP Header、LCRC 等协议开销会吃掉一部分链路带宽。此页计算给定 Max Payload Size / 读请求大小下的实际载荷效率与有效带宽。

开销模型说明

  • 每次 TLP 开销 = Header(3DW 12B / 4DW 16B)+ LCRC 4B;STP/Seq/END 帧符号与 DLLP 未计入(与"传输时延"标签页口径一致)
  • 写效率 = MPS ÷ (MPS + 单个 MWr TLP 开销)
  • 读效率 = 读请求大小 ÷ (读请求大小 + MRd 开销 + CplD 数量 × CplD 开销);CplD 开销 = 3DW Header 12B + LCRC 4B = 16B
  • 小 Payload 对效率影响巨大:128B MPS 的写效率不足 87%,而 4KB 可达 99.5% 以上