几百条低速通道如何成为一条可靠链路?
几百条低速光通道怎样重组成可靠链路?从真实 BER 分布与故障注入,讲清分条、时钟、deskew、纠错、热备和零误码统计。
MicroLED 光互连 · 技术难点深读。原始证据与独立分析分开呈现,点击原图可查看大图。
把 512 个 MicroLED 各自跑到 2 Gbit/s,相乘得到 1.024 Tbit/s,并不代表应用已经拿到一条 1 Tbit/s 的可靠链路。还要回答:这一位属于哪个字、哪条通道先到、坏掉的像素由谁接替,以及切换过程中丢失的数据由谁负责。
宽并行方案降低了单通道模拟电路的难度,却把一部分工作移到了时钟、通道编排和故障管理。这不是缺点,而是必须算清楚的架构交换。
1. 先看最差通道,不要只看速率乘法
MOSAIC 的原型包含 100 个通道,但论文传输实验每次接入 25 个。下面保留的就是这 25 个通道的 BER 分布,而不是 100 路同时运行的证明。
这张图真正有用的地方,是告诉我们“通道数”和“相同质量的通道数”不同。弱通道可能来自 die 差异、键合电阻、耦合偏移或 PD/TIA 差异;只看平均接收功率,很容易遗漏尾部。
净吞吐应写成:
这里 Ndata 只数运载数据的通道,不数时钟、校验和备用路;各项效率按实际协议定义,不能重复扣同一份开销。MOSAIC §4.1 的设计例子是 400 路数据加 60 路纠错冗余,每路 2 Gbit/s:460 路的物理总速率为 920 Gbit/s,承载输入数据为 800 Gbit/s,应用净荷还需看上层格式。它不是 460 路实测吞吐,更不能当作 512 路芯片的现成规格。
2. 分条不是复制:必须知道每一位在哪里
发送端把输入字拆到多条 lane,接收端按相同规则合回去。例如把连续四位分给四路,下一拍继续送后四位;如果第三路晚到一拍,四路电平都判对了,重组结果仍然会错。
因此至少需要区分三张“地图”:逻辑数据位分配到哪条 lane;该 lane 对应哪个 LED、光学通道和 PD;当前哪个备用通道接替了失效位置。成像光纤可能由多个纤芯共同传一个光学通道,因此“纤芯数”也不能直接当 lane 数。
训练序列或独特标记可以确定位边界、逻辑编号和映射;是否逐比特分条、逐字分条或采用 gearbox,则取决于主机接口。若要兼容窄而快的主机电接口,仍然可能需要速率与位宽转换,不能因为光侧是并行就宣布整条系统没有 SerDes。
3. CDR 可以简化,时序问题不会消失
独立 CDR 从每路数据跳变恢复采样时钟,适应每路相位差,但要付出功耗、锁定和测试代价。源同步方式让发送端把时钟也送过去,接收端用转发时钟采样;MOSAIC §4.2 明确采用后者。
源同步仍要管理 LED、驱动、光路、TIA 和采样器之间的相对延迟。接收端可能需要可调采样相位、分组校准或训练,具体实现不能从“没有完整 CDR”这句话推出来。转发时钟还可能成为共因失效点,其备用路径和切换必须单独验证。
MOSAIC §3.3 用“纤芯相差 1 cm、传播时间约 5 ns/m”估算 50 ps,等于 2 Gbit/s 下 0.5 ns 比特周期的 10%。这是说明量级的假设计算,不是测得整个 Tx→Rx 的总 skew,也不包含所有电子路径和温漂。
4. 三个对齐,别混成一个
位对齐解决在哪个时刻判 0/1;字边界对齐解决连续比特如何组成字;通道对齐,也就是 deskew,解决哪些字属于同一拍。已经亮起 lane_up,不代表后两项都完成。
图里的 Single Lane 旁路说明单通道不需要多路绑定;多通道必须经过 Channel Bonding,再验证所有 lane 的一致状态,超时则回到初始化。它体现的是状态机对失败的显式处理,而不是证明具体光芯片已实现相同逻辑。
解决 deskew 的一种通用方法,是早到的数据先写入 FIFO,等同批最晚通道到齐再一起读。下面是独立教学算例,不是厂商参数:若每路 2 Gbit/s,完整路径最大相对 skew 假设为 2.3 ns,另留 3 bit 余量,则每路所需比特存储下界为:
512 路合计只有 4096 bit,即 512 byte;这只是数据容量下界,不能当完整 RTL 的面积。字宽、指针、跨时钟域、标记检测及最坏漂移都要另计。FIFO 也只能保存正确采样的位,不能救回采样点落在眼图边缘造成的错误。
更要区别固定 skew 和频率偏差。若读写时钟长期不同频,任何有限深度 FIFO 都会最终溢出或欠读,必须由共同频率、速率匹配、协议允许的空闲补偿或流控解决;“加深缓冲”不能永久解决时钟偏差。
5. 坏像素、随机误码和掉线,不是同一种故障
| 故障 | 合适的处理层 | 关键限制 |
|---|---|---|
| 转移后缺 die、键合开路、永久暗像素 | 出厂筛选、修复、静态坏点映射、备用 lane | 备用光学位置必须确实能连到接收端,不是把逻辑编号改一下就能修复 |
| 运行时少量随机 bit error | 信号裕量、纠错码、残余错误检测 | 需要知道独立/突发分布,平均 BER 不够 |
| 某一路持续失效 | 定位、短时纠错保护、备用切换、重新对齐 | 切换前后序号与状态要一致 |
| 多路串扰突发、公共电源或时钟失效 | 共因故障防护、独立冗余、协议恢复 | 多个相邻坏路可能落在同一码字,突破单错误纠正能力 |
纠错和备用各解决一半问题:ECC 能暂时掩盖错误,但持续坏路会一直占用纠错能力;备用能恢复路径,却不能自动保证切换空窗里没有坏数据。
图中 ECC-only 在第二次故障后恶化;ECC + Hotswap 在两次故障之间完成替换,恢复了纠错余量。这说明“持续可用”需要错误检测、定位与修复协作,不是证明任何两路故障都可同时纠正。另一个细节是,小原型用了 SECDED;400+60 路的设计例子是单错误纠正码预算,不能直接冒充相同 SECDED 保护等级。
6. “不需要 FEC”到底省掉哪一层?
MOSAIC §4.1 把宽慢转换放在 PMA 层,原有 PCS 的 FEC 仍可覆盖经过光链路的数据。因此,少加一层强纠错,不等于主机侧完全没有 FEC;它另加的跨通道 ECC 主要针对通道故障保护。任何架构都要画清纠错器在分条之前还是之后,以及坏 lane 会在一个码字内产生几个错误。
CRC 是检测,不负责把错位修正;FEC/ECC 在能力范围内纠正,不保证无限错误都可修复;重传需要相应协议、序号、缓存和往返时间。对透明物理链路,重传往往由更上层承担,不能假定驱动芯片或光模块自动完成。
7. 零误码跑多久,才能有意义?
独立、平稳错误假设下,观察 N bit 且零错误,BER 的单侧 95% 上限近似为 −ln(0.05)/N≈3/N。于是要支持“单路 BER 的 95% 上限约 10⁻¹²”,需要约 3×10¹² bit;2 Gbit/s 下约 25 分钟,而不是看几秒眼图。
512 路并测可以同时积累这些位数,但不能把所有通道的比特合起来,跑约 3 秒就宣称每一路都达标:那最多约束合并平均值。若要保守地让“512 路各自上限”同时满足 95% 置信要求,可按 Bonferroni 将每路失效概率设为 0.05/512,零错时每路约需 9.23×10¹² bit,即约 77 分钟。两个计算均不替代高低温、突发错误或长期老化测试。
8. 下一步最值得做的是故障注入,不是再报一个 Tbps 数字
一个有说服力的验证闭环应同时记录每 lane 的 BER、训练时间、FIFO 占用、纠错次数、不可纠正块、净吞吐、残余错误和尾延迟。
先逐路扫描光功率与采样相位,再开相邻通道,确认弱路和串扰;随后插入受控延迟,确认越过 deskew 能力时会明确报错,而不是默默拼错字。再逐个注入暗像素、错误突发和映射变化,最后测试“两次故障间隔缩短”和公共时钟丢失。失败判据应包含数据重复、丢失、乱序、静默损坏和恢复时间超限,而不只是灯有没有重新亮起来。
对 MicroLED 光互连而言,die 和转移良率决定可用光学资源;驱动、耦合与 PD 决定每路裕量;时钟、分条和纠错决定这些资源能否成为可信的数据服务。真正有价值的系统工作,就是把三者连成可测、可诊断、可恢复的链路。
来源与证据边界
- Benyahya 等,MOSAIC,ACM SIGCOMM 2025:§3.3、§4、§7.1 为本文主要依据;100 路阵列、25 路同时传输、12 路容错原型、400+60 路扩展设计分开记录。未取得公开的完整 skew 分布、切换绝对时间或量产可靠性日志。
- Xilinx,Aurora 8B/10B Protocol Specification,SP002 v2.3:第 23 页 Figure 4-1,仅作多路通信基本机制的官方实例,不是 MicroLED 专用协议。
- AMD,Aurora 64B/66B 错误信号说明:官方列出 RX 时钟补偿和通道绑定 FIFO 的溢出/欠读边界;不据此推断具体光芯片设计。
- deskew 存储与 BER 时间是本文独立计算;参数是假设值,不是测得或厂商公布的规格。全部假设和计算过程已在正文给出。
引用与说明
本文为独立技术分析,测量、仿真、作者估算、公司公告与教学假设分别标注。第三方原图只用于直接讨论其数据、结构和边界,版权仍归原权利人;开放许可按图注执行,其他局部引用不代表取得通用转载授权。未上传完整论文或受限调研报告,内容不代表原作者、出版商、机构或雇主意见。