Appearance
Cerebras 完整投资分析(免费版)
原文标题: Cerebras Full Investment Analysis (Free) 来源: Jason's Chips
💡 核心观点
Cerebras 的晶圆级架构在推理速度上具有显著优势(通过消除全规约和HBM延迟),但代价是极小的片上内存和I/O带宽,导致每个token生成成本高昂。其定制模型5.3 Codex Spark性能明显弱于前沿模型,实际加速效果远低于理论值,表明其“溢价token”价值主张尚未获得市场认可。投资者应关注快速推理是否能开辟全新应用市场(如实时交易、具身AI),以及架构改进(FP8/FP4支持、混合键合)能否改善经济性。当前财务数据无参考意义,关键变量是未来市场对优质高价token的实际需求。
📖 中文全文
新的首次公开募股(IPO)总是乐趣多多!遗憾的是,散户投资者这次被坑了一把,因为原本定价相当合理,但IPO价格在上市前被上调了50%,而且如果券商提供配额,散户投资者几乎只能分到半股。在IPO当天,该股开盘价较IPO价格翻了一番,使得首个可买入价格对应约1000亿美元的市值。但现在或许到了根据基本面进行交易的时候了,本文将对此进行全面分析。今天,我将带你开启一段全面的旅程。我们先从他们的晶圆级引擎的技术基础讲起,然后评估他们产品的业务和市场方面。关于Cerebras,你想知道的一切,都在这里。内容大纲:餐盘计算简介;双城记与噩梦编译器;晶圆级良率;PVT校准;快速推理(张量并行 vs 流水线并行);内存限制;I/O带宽问题;经济相关性;财务数据;如何看待Cerebras;测试5.3 Codex Spark;看涨理由;结论。作为一名Substack作者,我有义务说明,这种研究是付费订阅才能获得的!!访问此内容即表示您承认并同意我们的条款和条件。本研究不构成财务建议。
餐盘计算简介 Cerebras 是餐盘计算领域众所周知的先驱。他们的基本前提是:越大越好。通常,当你向台积电订购晶圆时,你会将晶圆切割成裸片。Cerebras 决定保持所有裸片完整,而是将它们通过网络连接成一个真正的大芯片。裸片之间的这些空间被称为禁止区,因为通常你会把所有东西都排除在外,因为它们将被金刚石锯切割。在这种情况下,这些禁止区成为了复杂布线和网络连接的场所。这意味着 Cerebras 需要与台积电紧密合作,开发专有IP,以便用网络填充这些禁止区。在他们的投资者材料中,他们用大量芯片性能指标(计算核心、晶体管、内存带宽、FLOPs)与传统计算进行对比,因为他们的芯片更大,所以能完成更多芯片任务。这可能会误导散户投资者,因为在现实中,总有权衡。Cerebras 只是一个优化方式与传统GPU截然不同的计算架构。
双城记与噩梦编译器 SRAM 是内存层次结构顶端的超快速且昂贵的内存。比DRAM甚至HBM都快。这种内存通常采用逻辑工艺制造,且紧邻计算单元。在传统GPU中,所有核心共享同一个统一的SRAM池。然而,在晶圆尺度上,统一的内存池在物理上是不可行的。因此,Cerebras 为每个计算核心设计了独立的48 KB SRAM。这非常小(整个WSE总共只有44 GB内存,而GB200 NVL72机架有13.5 TB的HBM3E)。我喜欢把这想象成双城记。一个是只有几百居民的小村庄。在这个村庄里,中间有一个共享图书馆,居民们去那里获取需要的信息。这个村庄很容易协调,因为任何两个居民都可以阅读相同的书籍。另一个是噩梦般的同质化郊区,有90万座一模一样的微型房屋。每栋房子都有自己的小书架。你只能阅读自己房子里的书。可以想象,对于这个文明来说,协调和沟通任何信息都成了一场噩梦。
编译器是将人类(或智能体)意图(代码)转化为硅片行动的机器。它需要告诉晶体管该做什么。在拥有共享图书馆的村庄里,编译器的工作很简单。在同质化郊区,这是一场噩梦,因为你必须编写一个主进度表,保证第452,000号人恰好在正确的毫秒内将确切正确的数据片段放在他们的小书架上,然后第452,001号人一使用完该数据片段就将其传递下去。因为这种硬件从根本上决定了编译器的复杂性,Cerebras 永远无法达到NVIDIA的软件优化水平。然而,这确实为新的晶圆级竞争对手构成了相当高的进入门槛。
晶圆级良率 制造芯片非常困难。有时一粒灰尘就能毁掉你的芯片。晶圆良率只是好的裸片数量除以晶圆上裸片总数的百分比。没有人能接近100%的良率;它总是在50%到100%之间。但是等等!等等。Cerebras 正在将它的芯片做成整个晶圆。如果你永远无法达到100%的良率,那岂不是意味着 Cerebras 永远无法获得功能正常的晶圆级引擎?每块晶圆都至少有一个缺陷!并非如此。Cerebras 做了一件非常聪明的事——他们在核心之间内置了额外的冗余通信路径。如果他们发现晶圆的一部分(某个裸片)有缺陷,编译器只需绕过它即可。这就是 Cerebras 声称其晶圆级引擎良率达到100%的方式。
PVT校准 PVT 代表工艺、电压和温度变化。半导体制造是一个高度化学的过程。所有的蚀刻、沉积等工序都是通过化学反应完成的,尽管在示意图中可能感觉像是物理过程。由于这些过程都是化学性的,它们在整个餐盘上永远无法完全均匀。靠近边缘的晶体管可能开关速度更快,或者运行温度略高于靠近中心处的相同晶体管。通常,这对传统GPU无关紧要,因为裸片无论如何都会被切割开。但对 Cerebras 来说,这就成了问题,因为整个晶圆级引擎需要完全同步。这正是几十年前导致业界放弃晶圆级计算的问题。如果你必须将整个晶圆级引擎芯片的时钟速度调整为最慢晶体管的速度,性能将糟糕透顶。然而,Cerebras 开发了一种系统,可以动态地实时重新校准整个晶圆。他们检测晶圆每个部分的温度、电压和频率特性,然后主动管理相应的功率输送。基本上,每个核心都得到了它确切需要的东西。这无疑是他们最重要的创新之一。PVT校准对 Cerebras 来说是一道真正的护城河,对晶圆级竞争对手构成了巨大的进入壁垒。
快速推理(张量并行 vs 流水线并行) 这是我们的主菜。张量并行 vs 流水线并行是他们唯一拿得出手的招数,正是凭借这一点,他们才能向市场提供其核心价值主张:快速推理。
张量并行 让我们思考一下标准GPU运行推理的方式,即张量并行。通常,模型权重太大,无法放入GPU的SRAM中。它必须被分割并由多个GPU并行处理。一旦各个GPU完成,它们必须通过全规约(all-reduce)来共享答案,即每个GPU必须与所有其他GPU通信。这通常发生在同一个NVLink扩展域内,所以延迟是微秒级的,听起来还不错,但有两件事实际上使它对于快速推理来说问题很大。首先,这种全规约必须针对模型生成的每个令牌(token)进行,因为解码是顺序的。其次,它不仅需要针对每个令牌进行,还必须针对模型的每一层进行。Transformer由许多注意力层和多层感知机层组成。
来源:3blue1brown 因此,对于一个100层的模型,每个生成的令牌都需要在张量并行组内进行100次全规约操作。如果你有很多令牌,那就是大量的延迟!HBM还造成了另一个延迟瓶颈。每次生成一个令牌时,都必须将模型权重从HBM加载到计算单元。这与我们刚刚讨论的全规约和张量并行方法完全无关,但却是Cerebras能够绝对碾压Blackwell速度的另一个原因。总而言之,每个令牌几微秒的延迟导致普通GPU通常达到每秒数百个令牌的速度。
流水线并行 流水线并行就像一条流水线。如我所说,模型由许多层组成。每次你计算一层的数学运算时,都会得到一个激活输出,并将其传递到流水线的下游,交给下一层。现在轮到Cerebras登场了。Cerebras 有一个巨大的芯片。而GPU无法将模型的完整层级放入其SRAM,Cerebras 可以。因此,当Cerebras进行矩阵运算时,它不需要执行全规约操作来合并模型层不同切片的答案。它也不需要HBM。所有通信都在芯片上进行,而芯片上的通信速度非常快。注意,我说的是模型层,而不是整个模型。这很重要。Cerebras 不会把整个模型放在一个芯片上。它仍然不够大。它只是将一大堆餐盘串在一起,每个餐盘处理许多层,获得激活输出,并传递给下一组层。Cerebras 存在严重的I/O带宽瓶颈(我们稍后会谈),但这里不是问题,因为激活输出非常小。结果呢?数据就像流水一样顺着晶圆流下。顺畅、丝滑、无忧无虑。通过消除全规约和HBM通信延迟,推理速度提升了15倍。
内存限制 还记得我告诉过你,每个计算核心有48 KB的SRAM,即每个餐盘44 GB吗?事实证明,这远远不足以在前沿模型世界里做任何有用的事情。要服务一个模型,你必须将权重和KV缓存(上下文)都放入SRAM中。44 GB甚至不足以容纳大多数模型的权重;而KV缓存要大得多。要容纳一个经典的开源模型,比如较小较笨的Llama之一或更重要的DeepSeek V4,你需要个位数的餐盘来容纳权重,两位数的餐盘来容纳KV缓存。因为每个餐盘的内存如此之少,却又如此昂贵,这使得使用Cerebras服务模型在资金效率上非常非常低。
I/O带宽问题 现在你可能会问,为什么我们不直接把KV缓存卸载到晶圆外部的HBM上呢?有趣的是,芯片本身的图片应该给你一个明显的线索。大面积、小周长。片外带宽为1.2太比特每秒,而内部带宽为21拍比特每秒。这意味着芯片内部的数据传输速度比芯片外快一万倍以上。除此之外,它也无法与GPU相比。以B200为例,它有14.4太比特每秒的带宽,是WSE-3的10倍以上。这就像一个巨大的奥林匹克标准游泳池,但唯一能灌满或排空它的物理方式是通过一根细塑料吸管吸水。这也是他们的硬件在训练中失败的主要原因。训练需要数据不断地从WSE传输到外部内存,而它绝对没有足够的I/O带宽。这是直观的,你可以想象WSE在训练中的工作就是模拟一个庞大的、光互连的GPU集群,而在推理中,它只需要模拟几台服务器或一个机架。但这里重要的结论是:没有出路:权重和KV缓存必须始终由片上SRAM持有。
经济相关性 这一切意味着什么?想想我们讨论过的内容。我们已经确定WSE是一种与GPU根本不同的架构。它需要极其复杂的编译器、冗余的通信路径和PVT校准。它非常非常不同。我们探讨了是什么让这个非常不同的芯片更好——通过流水线并行,Cerebras 避免了全规约和HBM延迟,使推理速度比传统GPU快15倍。我们探讨了是什么让这个非常不同的芯片更差——即令人窒息的内存限制和微小的I/O带宽。注意这里:优势关乎速度和使用该芯片的最终用户体验质量,而劣势都以比特数量来衡量,关乎提供这种高质量服务的纯粹成本和经济不吸引力。这引出了我们的结论。这个芯片更好是因为它能更快地生成令牌,但更差是因为每个令牌的生成成本要高得多。Cerebras 以及一般的晶圆级计算,是快速、高溢价令牌的提供者。这家公司的业务方面完全在于探索这种速度是否值得额外成本。人们真的愿意为昂贵但快速的令牌买单吗?这种令牌会从传统的NVIDIA生成的令牌中抢占份额吗?是否存在需要这种令牌的新用例,因为之前硬件不存在而无法解锁,还是当前的体系已经足够满足我们所有AI应用?让我们一起来寻找答案。
财务数据 Cerebras 的IPO在最初130美元的股价下获得了20倍的超额认购。人们真的想买这个东西。昨天,他们将IPO价格提高到了160美元。Polymarket 上仍几乎100%认定他们将以超过500亿美元的市值收盘(这对应的是基本股权价值,仅占完全摊薄后的约70%,所以远高于表格中显示的数字)。他们2025年的收入很小且无关紧要,为5.1亿美元。目前,他们有246亿美元的剩余履约义务(RPO)和200亿美元的合同价值来自OpenAI,这可以随时间推移而扩大,但这意味着约67亿美元的稳态年化经常性收入(ARR)。假设IPO价格为每股160美元乘以完全摊薄的股份数,隐含的对OpenAI的ARR的收入倍数为7.4倍。
关于Cerebras的第一圣谛 以下是关于Cerebras的第一圣谛。财务数据毫无用处。完全彻底地毫无用处。前瞻估计毫无用处。增长率毫无用处。倍数毫无用处。为什么会这样?让我们从第一性原理来思考。
如何看待Cerebras Cerebras 是一个典型的处于S曲线早期、具有高两位数到三位数增长潜力的未经验证的技术。这种高层的概念特征让我们可以锚定两家在这个频道上有很多报道的公司:Lumentum 和 Bloom Energy。
Lumentum Lumentum 的30,000英尺框架很简单:一个市场(光学)注定(根据物理定律)要取代另一个(铜缆),以完全主导某个用例(AI网络)。 Jason's Chips | Lumentum系列 | 第三部分:扩展CPO的起源 所以,我将向你们介绍一个我用来研究股票的有趣小方法…… 2个月前 · 56个赞 · 4条评论 · Jason's Chips 由于这种转变是不可避免的,新市场的领先者拥有巨大的确定性增长跑道。这就是光学如此热门的原因。同时,这种增长是可衡量、可计算的。很容易建模。我们可以自信地预测Lumentum有50%的同比增长,因为我们只需用光学的增长率作为锚点。
Bloom Energy Bloom 略有不同。一家公司为一个单一市场提供了客观优越的解决方案,有潜力完全取代现有者。 Jason's Chips | Bloom Energy论点(免费版) 作为一名Substack作者,我有义务说明,我免费发布此文是为了举例说明您通过付费订阅会获得什么样的研究…… 1个月前 · 79个赞 · 19条评论 · Jason's Chips 这与Lumentum不同,因为市场没有变化。Bloom 参与的是表后能源市场,就像GE Vernova一样。他们是直接竞争对手。没有铜缆的对应物。没有从一个市场到另一个市场的转变。正因为如此,Bloom的增长可能有些不可预测且爆发式。没有大的Kager数字可依赖。这只是一个客户以多快的速度采用新解决方案,以及新解决方案是否(以及在多大程度上)优于旧方案的问题。然而,这里的增长仍然是可预测的。如果新解决方案更好,它仍会慢慢取代现有者。
Cerebras Cerebras 完全不同。从我们的第一篇文章中,我们最终得出结论:Cerebras 提供的是与Nvidia根本不同的产品:溢价令牌。溢价令牌速度更快,但成本也高得多。Cerebras 像Lumentum吗?不,没有任何一个世界,溢价令牌会不可避免地取代普通令牌。它们只是两种不同的产品,各有不同的权衡。Cerebras 像Bloom Energy吗?不。WSE不是生成相同最终产品(对Bloom来说是电力,对NVIDIA来说是普通令牌)的优越方式。在这两种比较中,Cerebras 实际上都糟糕得多。它真的不一定能从任何人手中抢走份额。然而,有一个关键区别,非常关键。非常非常重要。推理市场是世界上最大的单一市场。AI网络和表后电力是很大的市场,但它们不是最大的。推理是,而且当前的霸主是世界上最大的公司。如果这些溢价令牌从整个蛋糕中切下足够大的一块,Cerebras 就是一个非常有吸引力的投资。唯一的问题是,它能否切下更大的一块左派份额?再次强调,与Lumentum不同,它并不能保证获得任何份额。现在你可能理解为什么我说财务数据毫无用处了。几十亿美元的ARR根本不重要。如果你不盈利,而你的市场是世界上最大的市场,那么更重要的、实际上唯一重要的是快速推理的市场份额。没有任何收入能拯救Cerebras免于提供根本上不受欢迎的解决方案。如果他们服务于推理市场的一个可观份额,那么任何估值都不算高。因此,本文的目的就是评估快速推理市场最终变得极其巨大的可能性有多大。
5.3 Codex Spark 5.3 Codex Spark 是OpenAI专门为在Cerebras硬件上运行快速推理而定制开发的模型。目前它是唯一为Cerebras硬件定制的模型,所以实际上,这个模型是任何Cerebras投资分析中最重要的元素之一(如果不是最重要的)。但出于某种原因,它很少被讨论。它牺牲了很大一部分性能,以便变得小巧。它的基准测试性能低得多,上下文窗口仅为当前前沿模型的八分之一,但推理速度超过每秒1000个令牌。正如我们上一篇文章所述,为了运行特定大小的模型,必须串接一定数量的餐盘。模型权重越大,需要的晶圆级引擎就越多,经济性就越差。因此,小模型对于Cerebras来说更具成本效益。那么这个模型到底有多好?这里我发现了一些有趣的事情。Cerebras 的IPO是有史以来最受炒作的事件之一,但唯一为其硬件定制的模型5.3 Codex Spark却是最不受炒作、最不受待见的模型之一。
X平台情绪 AI活在X上,所以我们从X情绪开始。有趣的是,我找不到大V账号发布关于5.3 Codex Spark的内容,因为它太不受讨论了,但足够多的帖子让我得出结论:人们普遍一点也不喜欢这个模型。 Emil Wagman @EmilWagman @mark_k @OpenAI 有人试过GPT 5.3 Codex Spark吗?好快,但在我看来太笨了,做不了实际工作。2026年5月11日下午6:26 · 33次浏览 Lee Penkman @LeeLeepenkman 绝望了,又试了一下Spark,哈哈,它把一切都搞砸了,连JSON都搞不对。奇怪它比GPT 5.5低差这么多……不过它通过提示恢复了,所以我想它还是能用的……所以我用在这里是对的……它思考程度也很高,但现在是……2026年5月11日上午5:53 · 171次浏览 · 4个赞 主要抱怨就是性能。简而言之,它是一个愚蠢的模型。前沿智能 unsurprisingly 需要一定的蛮力,而小模型无法提供。
我自己的测试:股权研究 我对人们通常用来测试这些模型的基准测试有一点偏见。我不关心你在“人类最后考试”上的分数,或者你是否能一次性构建一个贪吃蛇游戏。这些不是我现实生活中会做的事情。这是人们经常说的一点,但我认为它被低估了,因为这与基准测试任务有本质区别。为此,我们将进行两个测试,我基本上是问自己接下来需要做什么才想到的。那就是股权研究和编码。在一个非常元(meta)的转折中,我同时询问了5.5和5.3 Codex Spark,要求它们查找5.3 Codex Spark的定价和使用数据。所以是用Cerebras来评估Cerebras。 5.3 Codex Spark xhigh fast vs 5.5 xhigh fast 这主要是一个速度测试。在研究任务上衡量质量非常困难,因为它非常主观,可能需要大量样本进行定性评估才能感受到真正的差异。这就是为什么我们还要做编码测试。但对于速度,你可能会注意到一些有趣的事情。尽管Cerebras号称快十倍以上,但5.3 Codex Spark花了2分19秒,而5.5花了3分9秒。这意味着5.5只多花了36%的时间,而不是900%的时间。这有两个原因。我在测试中亲眼观察到了这两个原因,这也是我们半导体行业人士一直在谈论的事情。完成任务所需的大部分时间(甚至可能是大部分)花在了网络搜索、工具调用和JavaScript执行上。听起来耳熟?没错!CPU又来了。所有那些研究报告都说推理中的大部分延迟是CPU密集型的。好吧,事实证明这不仅仅是理论。5.3 Codex有一个非常有趣的现象:它在毫秒级内生成令牌,然后你必须等待两三秒钟让CPU运行工具调用。你们应该试试。感觉非常奇怪,但你会立刻明白为什么需要CPU,以及如果你只加速一半的工作负载,快速推理并不像宣传的那么美好。由于上下文窗口非常小,压缩(compaction)发生得非常频繁。每次模型必须压缩其上下文时,都会引入更多的延迟。即使在那个短短两分钟的任务中,GPT-5.3 Codex Spark也不得不压缩其上下文,这就是为什么它并没有比5.5快很多的原因,而5.5拥有100万个令牌的上下文窗口。更大的上下文窗口实际上减少了延迟,因为它允许模型在不进行压缩的情况下运行更长时间。
我自己的测试:编码 我目前正在为半导体投资者开发一个全栈终端,希望能在本月底发布。它有很多酷炫的功能,比如:
- 所有AI基础设施公司的图鉴,按行业和细分领域分类
- 来自比特币矿工的所有HPC共址站点地图
- 用于回测和模拟交易的投资组合实验室
- 收益日历,可以查看即将到来的收益、将事件添加到日历、下载过去事件的记录
- 台湾营收追踪器
- 内存价格追踪器
- 供AI智能体自主访问应用功能的API端点
- 10个不同的计算器 因此,我让两个模型都来构建我的下一个功能,即投资组合实验室的模拟交易功能。这不是一个好的速度测试,因为5.5最终调用了应用内浏览器进行测试,就像真实用户一样,而5.3 Spark则立即交付了代码。它们做出了完全不同的工作流决策,因此无法进行苹果对苹果的比较,与股权研究任务不同。即便如此,GPT 5.5花了16分钟,而5.3 Codex Spark花了3分钟,这大约只有5倍的差距。即使其中一个模型做了更多工作,这仍然不是10倍!它们的表现如何?我们先来看5.5。GPT 5.5成功实现了模拟交易功能,我能够创建名为“Bloomentum”的新模拟投资组合。另一方面,5.3 Codex Spark的结果是这样的。为了看到5.3 Codex Spark能创建的实际成品,我将错误粘贴回去,并让它修复了bug。5.3 Codex Spark完成的工作质量要差得多。首先,还有一个bug:定价报价根本无法加载。但仅看这个工具的UI,你就能注意到差异。它非常不直观、不友好。它是黑白的,而不是匹配应用程序的颜色。买入按钮甚至不清楚!此外,还有这种奇怪的抖动效果,每次你点击按钮或输入内容时,元素会闪烁。
结论 5.3 Codex Spark更快吗?是的,毫无疑问。但是,它像Cerebras声称的那样快十倍吗?根本不是。现实世界的工作负载不仅仅是纯粹的前向传播。还有工具调用和上下文限制。就像SAT考得好并不能保证你在现实职业生涯中成功一样,在实验室基准测试中运行快速推理也不能保证同样的加速效果适用于现实生活。然而,性能差异仍然非常显著。人们倾向于使用前沿级别的智能,即使存在更便宜的开源替代品,这自有其原因。OpenAI和Anthropic的总和ARR不是800亿美元没有理由。更智能的模型能把事情做得更好。它们不仅做得更好,而且通常能找到更高效的方式,在这个过程中使用更少的令牌,并且速度也更快。不是因为有纯粹的推理速度,而是因为它们优越的推理能力。修复类似我们测试中出现的bug和失败所需的时间,很可能会压倒由更快速推理带来的任何收益,因为现实工作中的加速幅度还不够大。最后,一个被忽视的信号是5.3 Codex Spark本身的存在。OpenAI没有为GPT 5.5提供超快的Cerebras选项。他们特意创建了一个更小、更弱的模型,针对这套硬件进行了优化。这实际上很能说明问题,因为它是一个刻意的选择。他们肯定首先考虑过在前沿模型上提供Cerebras服务,然后通过测试和审慎考虑后决定放弃,认为要么不可能,要么不经济。
看涨理由 老实说,这些5.3 Codex Spark的测试相当悲观,那么真正的看涨理由是什么?嗯,我觉得有几个。
未被发现的TAM 未被发现的TAM论点简单地认为,没有人真正知道快速推理可以用于什么,因此可寻址市场完全未被发现。因为没有人知道这些用例,市场没有认识到它,而因为没有市场认知,它必然被低估。这里我能想到三个潜在的用例。
快速基本面投资 我曾尝试过一两次利用财报电话会催化剂进行交易,每次都失败了。我对自己对公司的基本面理解充满绝对的自信,然后立刻被现实教训,因为我的思考速度太慢,无法处理刚刚呈现给我的信息,并将之与公司的基本面变化联系起来。可以想象,这可能是Cerebras非常擅长的事情。想象你是一家对冲基金,你在公司里有很多联系人,并且已经建立了一个模型。你所要做的就是把所有这些东西交给LLM,告诉它留意催化剂。一旦事件发生或财报电话会开始,模型能够立即运行推理,调整模型并得出结论。在其他人还冥思苦想刚刚发生了什么的时候,仅仅早几秒或几分钟得出基于基本面的结论,这意味着你可以抓住10%或20%的涨幅。
具身/类人AI 如果我想要一个AI加入我的Zoom通话呢?如果我想和一个模型对话,让它像我的朋友一样打断我呢?在类人来回对话中,需要一定的速度水平,才能以人类熟悉的节奏进行思想交流。想想你现在与AI对话的方式。基本上是长时间独白接长时间独白。这是因为推理速度的限制。你可以想象,一旦这个限制消失,将解锁大量用例。机器人技术是另一个有趣的应用。想象一下,如果人形机器人能像人类一样说话。这将是一个极其巨大的可寻址市场,包括所有服务行业,如餐饮、酒店业和前台工作。
实时人类增强 最后,你有实时人类增强,即基本上给人类一个耳机,让LLM实时帮助这个人。想想高风险会议、实时谈判之类的事情。
低垂的果实 第二类是低垂的果实。低垂的果实是指Cerebras可以轻松实现的架构创新,这将带来单位经济效益的阶跃式变化。由于他们的架构远不如传统GPU成熟,因此非常缺乏优化,所以可以被优化。
支持FP8和FP4 他们能做的第一件事是支持FP8和FP4。我很困惑他们为什么还没有这样做。他们目前只支持FP16,这就像你的手机存储空间非常有限,但软件只允许你以4K高清格式存储照片和视频。我认为很可能是因为如果启用这种支持,他们将不得不重新设计核心。由于他们最初的设计是针对训练市场的,所以从未以这种方式进行过优化。无论如何,有传言说这应该会在WSE-4中实现,这将轻松带来内存容量2倍的提升。
混合键合 他们能做的第二件事更偏向推测。如果在他们的WSE顶部混合键合一整个SRAM晶圆会怎样?这将非常困难,因为它涉及解决大量工程问题和晶圆厂的折腾。如果他们能做到这一点,他们的内存将提升一个数量级。老实说,这将使Cerebras变成一个完全不同的故事。但再次强调,这非常具有推测性,没有迹象表明他们正在追求这一点。
非Nvidia生态系统 由于Nvidia收购了Grok,他们是唯一拥有快速推理解决方案的主要加速计算提供商。AMD和超大规模厂商没有。如你所见,这个论点很简单:他们与Nvidia的Grok LPU机架有效竞争的唯一途径是与Cerebras合作。Cerebras的所有竞争对手都远远落后,并且没有可比的商业吸引力,无论是MatX、SambaNova还是D-Matrix。Cerebras将是唯一的选择。
结论 由于智能体推理的总延迟存在固定且不变的现实世界限制,因此加速前向传播本身会带来收益递减现象,因为没有任何纯粹的Transformer前向传播技巧能让你的CPU更快地进行网络搜索、运行JavaScript和调用工具。我相信Cerebras已经远远超过了那个点。根据我的经验,GPT 5.5低快速延迟已经远更依赖CPU而非GPU。唯一为Cerebras定制的模型表现不佳,商业吸引力很小。这让我相信,他们在上一篇文章中讨论的技术权衡和“溢价令牌”价值主张目前还没有找到市场契合点。因此,我没有参与这次IPO。然而,由于看涨理由,我仍将密切关注这家公司。它们目前都还没有显现,但如果真的显现,整个故事可能会彻底反转。问题是,我不会去猜测它们。我想在看到它们发生之后再入场。如果因此错过了第一个100%的涨幅以确保这个论点真实存在,那也没关系。看看Bloom Energy或Lumentum的图表。任何错过了第一个100%涨幅的人可能都不会抱怨。如果你喜欢这篇免费文章,请分享以帮助它获得更多曝光 😃
🔗 原文链接
https://www.jasonschips.ai/p/cerebras-full-investment-analysis