← ブログ一覧へ
MicroLED光互连并行链路DeskewFEC可靠性

几百条低速通道如何成为一条可靠链路?

几百条低速光通道怎样重组成可靠链路?从真实 BER 分布与故障注入,讲清分条、时钟、deskew、纠错、热备和零误码统计。

Kaiyo Nan
この記事は中国語で書かれ、Google 翻訳で自動翻訳されています。
中国語の原文を見る →

MicroLED 光互连 · 技术难点深读。原始证据与独立分析分开呈现,点击原图可查看大图。

把 512 个 MicroLED 各自跑到 2 Gbit/s,相乘得到 1.024 Tbit/s,并不代表应用已经拿到一条 1 Tbit/s 的可靠链路。还要回答:这一位属于哪个字、哪条通道先到、坏掉的像素由谁接替,以及切换过程中丢失的数据由谁负责。

宽并行方案降低了单通道模拟电路的难度,却把一部分工作移到了时钟、通道编排和故障管理。这不是缺点,而是必须算清楚的架构交换。

1. 先看最差通道,不要只看速率乘法

MOSAIC 的原型包含 100 个通道,但论文传输实验每次接入 25 个。下面保留的就是这 25 个通道的 BER 分布,而不是 100 路同时运行的证明。

MOSAIC 原论文 Figure 11:20 m、2 Gbps 条件下 25 路 BER 分布,横轴由左至右误码率降低
原图证据 D16-MOSAIC-F11|Benyahya 等,MOSAIC: Breaking the Optics versus Copper Trade-off with a Wide-and-Slow Architecture and MicroLEDs,SIGCOMM 2025,PDF 第 9 页 Figure 11 / §7.1,DOI。实测;20 m、每路 2 Gbit/s、25 路 PRBS 测试。保留原坐标、阈值与图注,仅裁切。横轴反向排列:越往右 BER 越低;原图称 CDF,不宜按通常左小右大的坐标直觉读分位数。正文报告中位 BER <2×10⁻⁸,边缘通道最差至约 4×10⁻⁵。阈值 2×10⁻⁴ 是论文采用的特定 FEC 条件,不是所有光互连的通用合格线。© 2025 owner/author(s),publication rights licensed to ACM;为本段直接技术分析所需的局部引用,并非获授权转载。

这张图真正有用的地方,是告诉我们“通道数”和“相同质量的通道数”不同。弱通道可能来自 die 差异、键合电阻、耦合偏移或 PD/TIA 差异;只看平均接收功率,很容易遗漏尾部。

净吞吐应写成:

Ruseful = Ndata × Rlane × ηcoding × ηframing × ηavailability

这里 Ndata 只数运载数据的通道,不数时钟、校验和备用路;各项效率按实际协议定义,不能重复扣同一份开销。MOSAIC §4.1 的设计例子是 400 路数据加 60 路纠错冗余,每路 2 Gbit/s:460 路的物理总速率为 920 Gbit/s,承载输入数据为 800 Gbit/s,应用净荷还需看上层格式。它不是 460 路实测吞吐,更不能当作 512 路芯片的现成规格。

2. 分条不是复制:必须知道每一位在哪里

发送端把输入字拆到多条 lane,接收端按相同规则合回去。例如把连续四位分给四路,下一拍继续送后四位;如果第三路晚到一拍,四路电平都判对了,重组结果仍然会错。

因此至少需要区分三张“地图”:逻辑数据位分配到哪条 lane;该 lane 对应哪个 LED、光学通道和 PD;当前哪个备用通道接替了失效位置。成像光纤可能由多个纤芯共同传一个光学通道,因此“纤芯数”也不能直接当 lane 数。

训练序列或独特标记可以确定位边界、逻辑编号和映射;是否逐比特分条、逐字分条或采用 gearbox,则取决于主机接口。若要兼容窄而快的主机电接口,仍然可能需要速率与位宽转换,不能因为光侧是并行就宣布整条系统没有 SerDes。

3. CDR 可以简化,时序问题不会消失

独立 CDR 从每路数据跳变恢复采样时钟,适应每路相位差,但要付出功耗、锁定和测试代价。源同步方式让发送端把时钟也送过去,接收端用转发时钟采样;MOSAIC §4.2 明确采用后者。

源同步仍要管理 LED、驱动、光路、TIA 和采样器之间的相对延迟。接收端可能需要可调采样相位、分组校准或训练,具体实现不能从“没有完整 CDR”这句话推出来。转发时钟还可能成为共因失效点,其备用路径和切换必须单独验证。

MOSAIC §3.3 用“纤芯相差 1 cm、传播时间约 5 ns/m”估算 50 ps,等于 2 Gbit/s 下 0.5 ns 比特周期的 10%。这是说明量级的假设计算,不是测得整个 Tx→Rx 的总 skew,也不包含所有电子路径和温漂。

4. 三个对齐,别混成一个

位对齐解决在哪个时刻判 0/1;字边界对齐解决连续比特如何组成字;通道对齐,也就是 deskew,解决哪些字属于同一拍。已经亮起 lane_up,不代表后两项都完成。

Xilinx Aurora 官方原图:单路初始化、多路绑定、链路验证及超时回退
原图证据 D16-AURORA-F04-01|Xilinx,Aurora 8B/10B Protocol Specification,SP002 v2.3,2014-10-01,PDF / 印刷第 23 页 Figure 4-1,AMD 官方原件。规范流程图,不是实测数据。原图保留单路旁路、多路绑定、验证和超时回退,仅裁切。用途是解释通用的多路初始化边界;不表示 MicroLED 必须使用 Aurora,也不表示 MOSAIC 或 Avicena 使用这一状态机。版权归 Xilinx / 权利人;为本段直接技术分析所需的局部引用,并非获授权转载。

图里的 Single Lane 旁路说明单通道不需要多路绑定;多通道必须经过 Channel Bonding,再验证所有 lane 的一致状态,超时则回到初始化。它体现的是状态机对失败的显式处理,而不是证明具体光芯片已实现相同逻辑。

解决 deskew 的一种通用方法,是早到的数据先写入 FIFO,等同批最晚通道到齐再一起读。下面是独立教学算例,不是厂商参数:若每路 2 Gbit/s,完整路径最大相对 skew 假设为 2.3 ns,另留 3 bit 余量,则每路所需比特存储下界为:

D ≥ ceil(Δt × Rlane) + M = ceil(2.3 ns × 2 Gbit/s) + 3 = 8 bit

512 路合计只有 4096 bit,即 512 byte;这只是数据容量下界,不能当完整 RTL 的面积。字宽、指针、跨时钟域、标记检测及最坏漂移都要另计。FIFO 也只能保存正确采样的位,不能救回采样点落在眼图边缘造成的错误。

更要区别固定 skew 和频率偏差。若读写时钟长期不同频,任何有限深度 FIFO 都会最终溢出或欠读,必须由共同频率、速率匹配、协议允许的空闲补偿或流控解决;“加深缓冲”不能永久解决时钟偏差。

5. 坏像素、随机误码和掉线,不是同一种故障

故障合适的处理层关键限制
转移后缺 die、键合开路、永久暗像素出厂筛选、修复、静态坏点映射、备用 lane备用光学位置必须确实能连到接收端,不是把逻辑编号改一下就能修复
运行时少量随机 bit error信号裕量、纠错码、残余错误检测需要知道独立/突发分布,平均 BER 不够
某一路持续失效定位、短时纠错保护、备用切换、重新对齐切换前后序号与状态要一致
多路串扰突发、公共电源或时钟失效共因故障防护、独立冗余、协议恢复多个相邻坏路可能落在同一码字,突破单错误纠正能力

纠错和备用各解决一半问题:ECC 能暂时掩盖错误,但持续坏路会一直占用纠错能力;备用能恢复路径,却不能自动保证切换空窗里没有坏数据。

MOSAIC Figure 13 原图:两次通道故障注入,只有 ECC 的链路第二次故障后误码上升,ECC 加备用切换保持基线
原图证据 D16-MOSAIC-F13|Benyahya 等,MOSAIC,SIGCOMM 2025,PDF 第 10 页 Figure 13;配置见第 9 页 §7.1,DOI。故障注入实测;10 Gbit/s Ethernet、10 m、12 路原型,6 路数据(约 1.7 Gbit/s/路)与 5 路 SECDED 校验;按数量相减,剩余备用预算为 1 路,不据此推断物理布局。纵轴是 NIC-reported BER;在 Time Steps 7 与 14 两次先后注入通道失效。没有给出每个 time step 的秒数,不能据图宣称 ns / μs 级切换;也不是数百路同时故障测试。© 2025 owner/author(s),publication rights licensed to ACM;仅裁切,为本段直接技术分析所需的局部引用,并非获授权转载。

图中 ECC-only 在第二次故障后恶化;ECC + Hotswap 在两次故障之间完成替换,恢复了纠错余量。这说明“持续可用”需要错误检测、定位与修复协作,不是证明任何两路故障都可同时纠正。另一个细节是,小原型用了 SECDED;400+60 路的设计例子是单错误纠正码预算,不能直接冒充相同 SECDED 保护等级。

6. “不需要 FEC”到底省掉哪一层?

MOSAIC §4.1 把宽慢转换放在 PMA 层,原有 PCS 的 FEC 仍可覆盖经过光链路的数据。因此,少加一层强纠错,不等于主机侧完全没有 FEC;它另加的跨通道 ECC 主要针对通道故障保护。任何架构都要画清纠错器在分条之前还是之后,以及坏 lane 会在一个码字内产生几个错误。

CRC 是检测,不负责把错位修正;FEC/ECC 在能力范围内纠正,不保证无限错误都可修复;重传需要相应协议、序号、缓存和往返时间。对透明物理链路,重传往往由更上层承担,不能假定驱动芯片或光模块自动完成。

7. 零误码跑多久,才能有意义?

独立、平稳错误假设下,观察 N bit 且零错误,BER 的单侧 95% 上限近似为 −ln(0.05)/N≈3/N。于是要支持“单路 BER 的 95% 上限约 10⁻¹²”,需要约 3×10¹² bit;2 Gbit/s 下约 25 分钟,而不是看几秒眼图。

512 路并测可以同时积累这些位数,但不能把所有通道的比特合起来,跑约 3 秒就宣称每一路都达标:那最多约束合并平均值。若要保守地让“512 路各自上限”同时满足 95% 置信要求,可按 Bonferroni 将每路失效概率设为 0.05/512,零错时每路约需 9.23×10¹² bit,即约 77 分钟。两个计算均不替代高低温、突发错误或长期老化测试。

8. 下一步最值得做的是故障注入,不是再报一个 Tbps 数字

一个有说服力的验证闭环应同时记录每 lane 的 BER、训练时间、FIFO 占用、纠错次数、不可纠正块、净吞吐、残余错误和尾延迟。

先逐路扫描光功率与采样相位,再开相邻通道,确认弱路和串扰;随后插入受控延迟,确认越过 deskew 能力时会明确报错,而不是默默拼错字。再逐个注入暗像素、错误突发和映射变化,最后测试“两次故障间隔缩短”和公共时钟丢失。失败判据应包含数据重复、丢失、乱序、静默损坏和恢复时间超限,而不只是灯有没有重新亮起来。

对 MicroLED 光互连而言,die 和转移良率决定可用光学资源;驱动、耦合与 PD 决定每路裕量;时钟、分条和纠错决定这些资源能否成为可信的数据服务。真正有价值的系统工作,就是把三者连成可测、可诊断、可恢复的链路。

来源与证据边界

  • Benyahya 等,MOSAIC,ACM SIGCOMM 2025:§3.3、§4、§7.1 为本文主要依据;100 路阵列、25 路同时传输、12 路容错原型、400+60 路扩展设计分开记录。未取得公开的完整 skew 分布、切换绝对时间或量产可靠性日志。
  • Xilinx,Aurora 8B/10B Protocol Specification,SP002 v2.3:第 23 页 Figure 4-1,仅作多路通信基本机制的官方实例,不是 MicroLED 专用协议。
  • AMD,Aurora 64B/66B 错误信号说明:官方列出 RX 时钟补偿和通道绑定 FIFO 的溢出/欠读边界;不据此推断具体光芯片设计。
  • deskew 存储与 BER 时间是本文独立计算;参数是假设值,不是测得或厂商公布的规格。全部假设和计算过程已在正文给出。

引用与说明

本文为独立技术分析,测量、仿真、作者估算、公司公告与教学假设分别标注。第三方原图只用于直接讨论其数据、结构和边界,版权仍归原权利人;开放许可按图注执行,其他局部引用不代表取得通用转载授权。未上传完整论文或受限调研报告,内容不代表原作者、出版商、机构或雇主意见。

继续阅读