Appearance
大脑分析 | 第一部分:餐盘计算
原文标题: Cerebranalysis | Part 1: Dinner Plate Computing 来源: Jason's Chips
💡 核心观点
Cerebras通过晶圆级集成(“餐盘计算”)实现了远超传统GPU的大规模并行计算,但其架构也面临内存有限和I/O带宽受限的固有约束。文章通过技术分析指出,尽管Cerebras在推理速度(如15倍提升)上具备优势,但其核心创新(如PVT校准和流水线并行)能否转化为可持续的商业模式和财务表现,才是投资者关注的要点。关键在于评估其独特架构在实际应用中的效率与成本权衡。
📖 中文全文
欢迎来到《大脑分析》!在接下来的两天里,我们将在Cerebras上市前对其进行一次分析性研究。今天的文章聚焦于他们的技术,明天的文章将关注股票相关的内容(业务、市场关联度以及财务数据)。
餐盘计算简介
Cerebras是众所周知的“餐盘计算”先驱。他们的基本前提是:越大越好。通常情况下,当你向台积电订购一块晶圆时,你会将晶圆切割成多个裸片。而Cerebras决定将所有裸片保持完整,将它们通过网络连接成一个真正巨大的芯片。裸片之间的这些空间被称为“禁止区”,因为通常你会避开所有东西,因为它们会被金刚石锯切割。在这种情况下,这些禁止区成为了复杂布线和网络的所在地。这意味着Cerebras需要与台积电密切合作,开发专有IP,以便用网络填充这些禁止区。
在他们的投资者材料中,他们用了大量芯片性能指标(计算核心、晶体管、内存带宽、FLOPs)来与传统计算进行对比,因为他们的芯片更大,所以能完成更多的芯片任务。这可能会误导散户投资者,因为在现实中总是存在权衡。Cerebras仅仅是一种与传统GPU优化方式截然不同的计算架构。
摘要
今天的文章聚焦于Cerebras晶圆级引擎背后的科学与技术。首先,我将讨论Cerebras的分布式SRAM问题,以及这如何导致极端的编译器复杂性和低效。我通过一个“双城记”的类比来阐明与英伟达GB200的对比。接下来,我们将了解尽管晶圆几乎肯定会有缺陷,但Cerebras如何声称其晶圆级引擎的良率达到100%。然后我们剖析PVT(工艺、电压、温度)校准,这是Cerebras最重要的创新之一,它解决了一个几十年来阻碍整个晶圆级行业发展的难题。之后,我们将讨论实现其15倍推理加速的技术原理:流水线并行。我们将探索普通GPU如何对Transformer进行推理(张量并行),逐一讲解每个token和每个模型层在机架内部发生了什么,然后将其与Cerebras WSE的方法(流水线并行)进行对比,以及数据如何像水流过河流一样沿着晶圆流动。接着,我们将详细说明其架构的两个关键限制:首先是严重的内存限制,其次是因面积相对于周长过大而导致的有限I/O带宽。最后,我们将超越其他大多数技术研究,强调所有这些技术分析为何在经济学上与他们的产品相关。我将引导您得出我们研究后得出的唯一结论,这构成了明天所有经济和业务相关分析的基础前提。重要的是,我会让一切变得有趣且易于理解。这两篇《大脑分析》文章是必读的。系好安全带。这些内容非常技术性,但技术很有趣。我们开始吧!
目录
双城记与梦魇编译器 晶圆级良率 PVT校准 快速推理(张量并行 vs 流水线并行) 内存限制 I/O带宽问题 具有经济相关性的结论
访问此内容即表示您确认并同意我们的条款和条件。本研究不构成财务建议。
双城记与梦魇编译器
🔗 原文链接
https://www.jasonschips.ai/p/cerebranalysis-part-1-dinner-plate