1. 为什么AI基础设施需要1.6T光互连?
在当今AI计算集群中,数据流动就像大都市早晚高峰的车流——传统道路已经无法承载激增的流量。以GPT-4这样的千亿参数模型训练为例,单个任务就可能需要上万块GPU协同工作,这些芯片之间每秒钟要交换的数据量相当于同时播放4万部高清电影。现有的800G光模块就像双向四车道的高速公路,而Credo最新发布的1.6T Cardinal系列则相当于扩建成了八车道。
这种带宽需求爆炸式增长主要来自三个维度:
- 模型参数规模:大语言模型的参数量每年增长约10倍
- GPU集群规模:单个训练任务动辄需要数千张加速卡
- 数据并行策略:模型并行、流水线并行等技术大幅增加节点间通信量
关键指标对比:在典型AI训练场景中,800G光模块的功耗约占集群总功耗15%,而Cardinal系列通过3nm工艺和架构优化,将这一比例降至8%以下。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Cardinal系列的核心技术创新
2.1 3nm工艺带来的能效革命
Credo选择台积电3nm制程不是偶然。相比上一代7nm工艺,3nm在相同性能下可降低约35%功耗,或者在相同功耗下提升约15%性能。这对于光DSP芯片尤为关键,因为:
- 激光驱动器的电压摆幅直接影响光信号质量
- 时钟数据恢复(CDR)电路的抖动性能决定误码率
- 数字信号处理算法的实时性要求极高
实测数据显示,Cardinal在224Gbps单通道速率下,功耗仅1.5W/channel,比业界平均水平低40%。这相当于在1.6T(8x224G)配置下,整颗DSP芯片功耗控制在12W以内。
2.2 全重定时与LRO的双模架构
传统光模块采用"全重定时"(full-retimed)架构,所有信号都经过完整的时钟恢复和重新定时。Cardinal创新性地提供了两种工作模式:
| 模式类型 | 延迟 | 适用场景 | 功耗优势 |
|---|---|---|---|
| 全重定时 | <40ns | 长距离传输(>2km) | 支持更复杂的均衡算法 |
| LRO模式 | <25ns | 机架内互联(<100m) | 省去部分时钟电路,功耗降低20% |
在AI训练集群中,90%的流量发生在同一机架内的GPU之间。LRO模
