Appearance
光电路交换入门:比CPO更好吗?
原文标题: Optical Circuit Switching 101: Better Than CPO? 来源: Jason's Chips
💡 核心观点
光电路交换(OCS)是一种通过反射镜直接路由光信号的技术,相比传统的电分组交换(EPS),具有极低的延迟(降低98%)和功耗(不到10%),但存在插入损耗和重定向速度慢的问题。OCS主要用于AI训练中的“大象流”场景,在脊柱交换替换、谷歌TPU超级吊舱以及扩展域中均有应用。随着相干精简收发器的采用,OCS的链接预算将大幅提升,推动其在AI基础设施中的渗透率增长。市场主要玩家包括Lumentum和Coherent,以及一家隐藏的小市值OCS供应商。MEMS型OCS因低插入损耗和谷歌大规模验证而占据优势,液晶型则在可靠性上有潜力。对于投资者,OCS市场受益于AI增长、采用率和附着率三重复合增长,是一个高成长赛道。
📖 中文全文
光电路交换入门:比CPO更好吗?
本文是我那篇非常受欢迎的“CPO 101”文章的OCS版本。很多人喜欢那篇文章,所以我将照搬格式,因为我不够有创意。
引言
OCS就是一个镜子盒子。光进去,从镜子(或其他东西)上反射,然后从另一个方向出来。
分析OCS市场时最重要的概念是 附着率 的力量。交换机本身有一堆端口。端口数越高,称为“基数”越高。OCS出货量的计量单位不是盒子数量,因为盒子大小不一——大盒子贵,小盒子便宜。相反,计量单位是端口数,因为盒子的成本通常随端口数增加而增加。因此,附着率可以定义为端口连接到XPU的比率。2:1意味着每个加速芯片对应2个OCS端口。对于每个OCS用例,附着率都在上升。此外,OCS本身是一项处于S曲线早期-中期阶段的新技术。因此,这是一个极好的市场,因为其增长率随三个向量增长:AI增长率、采用率和附着率。 OCS增长率 = AI增长率 × 采用率 × 附着率
目录
- 交换机入门
- OCS与电分组交换机(EPS)对比
- 脊柱交换机替代
- 谷歌TPU超级吊舱OCS
- 扩展域OCS
- OCS类型
- OCS市场模型
- Lumentum
- Coherent
- 隐藏的小市值OCS供应商
- 最终思考:比CPO更好吗?
交换机入门
交换机非常简单。数据中心必须按层次结构组织,否则每个GPU都要与其他所有GPU通信,导致链路按O(n²)扩展,很快填满整个数据中心——这通常被认为是不好的。为了构建这个网络,流量必须被路由,而交换机就是路由流量的设备。
OCS与电分组交换机(EPS)对比
EPS(搞笑地是“每股收益”的缩写)是当前几乎无处不在的标准电交换机。它通过收发器接收光信号,转换为电信号,通过交换机ASIC(逻辑芯片)读取并路由,再通过收发器转换回光信号,发送到目的地。而OCS则只是将光从镜子上反射。所以直观上思考一下权衡:如果必须将信号从光转换到电再回到光(OEO),这肯定需要时间,也需要能量。交换机本身也是活跃的,消耗更多能量。因此,EPS的主要问题是延迟和功耗。这不是小差异:与EPS相比,OCS几乎免费。Lumentum在其R300交换机上声称:“R300已证明相比OEO分组交换机解决方案,交换机延迟降低98%。OCS的功耗也低于EPS的10%。”
但显然EPS在某些方面更好。否则它为什么是使用最广泛的解决方案?思考一下信号通过收发器离开交换机系统时会发生什么:信号被接收,然后重新发送,这意味着另一侧出来的是一个全新的光束。而在OCS中,光从镜子上反射,损失了一点信号,没有被重新放大。此外,直觉上,光必须传播两倍的距离,因为它从未在交换机处停下来。就像直接航班与中转航班。结果,信号遭受更大的插入损耗,最终到达目的地时更加“扭曲”。具体来说,如果距离带来的插入损耗(在EPS设置中)是x,交换损耗是y,那么总OCS插入损耗是2x + y。
另一个权衡是:移动镜子来重定向连接需要时间。时间不长,只有几毫秒。但EPS可以为每个数据包做出全新的路由决策。这正是OCS在AI之前未能普及的核心原因:传统云流量是“老鼠流”。这些是微小、短暂且不可预测的连接(搜索查询、API调用、结账)。你需要交换机为每个数据包做出实际决策。连接变化太快,微镜无法处理。而AI工作负载是“大象流”。训练将完全相同的加速器集群指向彼此,连接持续数小时不变。OCS空头会认为,随着我们转向推理,我们将从大象流回到老鼠流,因为每个用户查询都是不同的。这在叶层可能成立。但在脊柱层(OCS所在位置),网络流量仍被归类为大象流,因为通过的数据只是prefill到decode的KV传输,而不是单个token。
脊柱交换机替代
现在,我们来讨论镜子盒子的用例。今天我们将讨论三个值得注意的用例:
- 脊柱交换机替代
- 谷歌TPU超级吊舱OCS
- 扩展域OCS
脊柱交换机替代指的是替换脊柱交换机。这是OCS的完美(通常是规范的)用例。在脊柱交换机层面,几乎所有AI工作负载都是大象流。脊柱OCS几乎比脊柱EPS免费,以至于能将脊柱资本支出降低30%,功耗降低40%。论点很简单:目前Google之外的脊柱OCS渗透率低于5%。这个数字将会增长。每个被OCS替换的EPS都会增加年复合增长率。这是一个采用率的故事。
然而,我们仍需解决插入损耗问题。当前4 dB的链接预算几乎只能承受一次OCS跳转。那么到底什么会引发采用?相干精简收发器!光通信就是通过光传输数据。有两种方法对光进行编码(调制):IMDD和相干(不是指Coherent公司)。IMDD基本上是把手电筒开和关,仅编码亮度信号。相干调制则像是……它在亮度、相位和振幅中编码信号。相干调制的优点是使接收器更容易检测信号,因此允许信号承受更大的插入损耗(更高的链接预算)。这就是为什么相干用于长距离电信和跨域扩展。但另一方面,它更昂贵且复杂。
因此,扩展域正在采用一种轻量级的相干版本,称为“相干-精简”。随着这些收发器的采用,链接预算翻倍或三倍,为OCS跳转留出充足空间。实际上,我们将有如此大的链路余量,光可以同时处理两次跳转。这意味着可以构建具有脊柱和超级脊柱架构的网络,两者都是OCS。
谷歌TPU超级吊舱OCS
谷歌的架构很奇怪。英伟达(NVL72)非常简单直观。每72个GPU的机架是其自己的扩展域(一个计算和内存“单元”)。扩展结构通过收发器、叶交换机和脊柱交换机将这些机架连接在一起。谷歌的芯片间互连(ICI)是其扩展网络,但不同于NVL72,它不是一个机架。相反,它是一个由9216个TPU组成的混杂体,共享一个巨大的内存域,但通过“机架”连接,每个机架是64个TPU组成的4x4x4立方体(立方体内用铜线,立方体之间用收发器)。这就是为什么它被称为超级吊舱。这个吊舱形状像三维环面,基本上是一个巨大的芯片甜甜圈。
每个这样的超级吊舱有48个OCS。因此,端口与TPU的比率是确定的1.5:1。本质上,OCS随TPU出货量而扩展。但还有更好的:这也涉及附着率的故事。这基于FundaAI的出色工作。三维环面是为全规约通信模式而构建的,这在训练中很常见。每个芯片主要与其最近邻通信,结果像初中生传纸条一样在整个网络中传播,直到每个人都读到。然而,在混合专家(MoE)模型的推理中,通信模式变为全对所有。每个token被分派到分布在吊舱各处芯片上的不同专家。不再是学生传纸条,而是每个孩子必须同时与所有其他孩子交谈。为了我们的目的,让我们用一个更好的比喻:把数据中心的全对所有通信想象成一个城市。每个家庭同时开车到城市的另一端。现在,让我们把问题说清楚。想象这个城市有一个中央交叉路口。当有成千上万辆车试图穿到另一边时,可能会或可能不会出现轻微拥堵。在数据中心,这被称为二分带宽,当需要全对所有通信时,它成为关键规格。最终,这个问题必须被解决。你想到了所有可能的解决方案,但似乎都无法克服一个事实:在二维平面上,道路空间有限,你无法容纳所有车辆。于是你雇佣了一个天才城市规划师。凭借无限的税收收入,这个人决定给每个人一架直升机。现在,没有中央交叉路口了,而是有一个中央空域,但因为增加了一个维度,二分带宽不再成为约束。
对于n维空间中N个芯片,二分带宽按以下公式缩放:二分带宽 ∝ N^(n-1)/n,所以N^(2/3)在3D中,N^(5/6)在6D中,当n→∞时趋近于N^1。这基本上就是谷歌正在考虑的做法:从3D环面转向4D或更高维。每次增加维度,每个TPU的OCS端口数量在数学上都会增加。这需要一段时间,不会在2027年发生。4D环面的专利已经提交,但在TPU v8中,谷歌坚持使用3D环面。这很可能与扩展域TPU处于同一时间线,如2029-2030年或更晚。但它有潜力在中期将附着率翻倍(4D环面中为3:1),而在长期,上限可达5倍或更高(达到10:1比率)。
扩展域OCS
光学扩展域,即在机架内用光纤代替铜线连接GPU,是CPO市场的皇冠明珠,但对OCS来说,它只是一个有趣的看涨期权。这是因为与CPO不同,扩展域OCS完全是可选的!其想法是将OCS直接放置在机架中以取代NVlink交换机,但问题是没有物理定律迫使常规交换机在光学扩展域世界中失败。这只是供应商对使用哪种交换机的选择。因此,我不会重点关注这个市场或对其进行详细建模。
OCS类型
正如我们讨论过的,光学镜盒的两个主要缺点是重定向连接的速度和插入损耗。这两个缺点也构成了不同类型OCS之间的主要权衡。我们将讨论液晶和MEMS,因为它们是当今数据中心部署中两种相关的OCS类型。压电和Sipho类型将留到以后——你会明白为什么。思考MEMS和液晶之间区别的最简单方式是:对于MEMS,你从物体(镜子)上反射光;对于液晶,你通过物体(介质)引导光。所有的规格差异都源于此。
以下是相关镜盒规格的等级列表。
先从插入损耗和成本开始:液晶和MEMS在成本上非常相似,但MEMS在插入损耗方面决定性胜出。这可能是两种OCS之间最大且最重要的区别。MEMS的插入损耗为1.5 dB,而液晶为3 dB。分贝是对数刻度,10 dB就是一个数量级,所以3 dB意味着你在一次跳转中损失了一半信号。相当糟糕。根据Lumentum2025年的OCS网络研讨会:“此能力体现在R300中,目前支持多达300x300端口,典型插入损耗为1.5 dB或更低。需注意低损耗性能的重要性——这是一项关键特性,因为它是将OCS技术引入超大规模环境的主要技术障碍之一。这体现在需要支持收发器链接预算内的额外OCS损耗——FR4/DR4约为4 dB,LR4/ER4约为6 dB。” 这种差异背后的核心机制是,对于液晶,必须先将光分束,然后使其通过有源介质,其中部分光被吸收,然后再重新合并。分束和通过介质都会产生插入损耗。而MEMS就是一面镜子。一面真正的镜子。
液晶在可靠性方面对MEMS大肆宣传,我认为有些夸大。例如,有一种说法称MEMS因运动部件而在三年后磨损。这从根本上忽略了这样一个事实:即使部件运动,它们并不相互滑动,实际上没有摩擦。运动部件不等于会磨损的滑动部件。谷歌的MEMS舰队已经生产运行了十年,拥有数万个单元。如果MEMS交换机三年后失效,他们很可能会注意到并说点什么。然而,液晶的可靠性仍然好得多。这是因为该系统没有运动部件(镜子),并使用更低电压的组件。
现在讨论重定向时间。这决定了交换机改变端口连接所需的时间。目前,MEMS和液晶大致持平在10-100毫秒范围(液晶实际上略慢)。然而,一种新型液晶正在开发中——铁电液晶——其切换时间为10-100微秒。这是Coherent的下一代材料。因此,切换时间由液晶决定性地获胜。但我把重定向时间放在C级是有原因的:如果你决定使用OCS,你只需要在重新配置网络时更改端口连接。这发生在分钟到天的数量级上。微秒或毫秒根本不重要。
最后讨论安装基数。MEMS在此胜出,原因很简单:谷歌。谷歌是迄今为止全球最大的OCS用户,已经运营了十年的OCS舰队。他们实际上是该技术的先驱,在AI需求巨浪迫使它们外包之前,大部分交换机都是内部生产的(Palomar品牌)。而且全是MEMS。这是S级。这很重要。在大规模下经过验证的可靠性是数据中心采购官员的决定性要求。总体而言,MEMS要好得多。但这并不意味着液晶不会获得任何采用。它仍然是可行的技术,这里的规格不会二元地决定采用。如果MEMS供应商的产能售罄,超大规模数据中心会乐意购买液晶。拥有OCS才是最重要的。
下面,我将分享我对OCS市场的详细模型,包括加速器出货量、TPU出货量、外部商份额、ASP和端口比率(基于行业调研)。我将讨论Lumentum和Coherent作为这个市场的参与者,以及我预期两者之间的市场分配,并附上各自的模型。最后,我将分享一家隐藏的小市值OCS供应商。
(付费内容部分:市场模型、Lumentum、Coherent、隐藏小盘OCS供应商等详细分析和数据,由于文章在此处设置了付费墙,以下内容为预览。实际付费用户可查看完整模型和供应商分析。)
最终思考:比CPO更好?
(文章结尾部分未在抓取内容中显示,但根据标题,作者可能将OCS与CPO比较。由于内容不完整,无法提供完整翻译。)
注意:本文为付费内容预览,仅部分可见。以上翻译基于提供的文章开头和中间部分,已尽可能完整。根据用户要求,已标注付费预览提示。实际翻译字数已超过800字。
🔗 原文链接
https://www.jasonschips.ai/p/optical-circuit-switching-101-better