Appearance
第011期 – GPT 5.5 对决 Claude 4.7:OpenAI 从悬崖边归来(代币经济学) | 编辑转录稿
原文标题: Ep. 011 - GPT 5.5 vs Claude 4.7: OpenAI's Comeback From the Brink (Tokenomics) | Edited Transcript 来源: The Transcript Desk
💡 核心观点
AI模型竞争格局重新洗牌:OpenAI的GPT 5.5虽重回前沿,但并未取得决定性优势,而Anthropic凭借Claude 4.7及Claude Code在收入和技术体验上实现反超。模型成本激增(token单价上升、快速模式溢价达6倍)使得用户开始考虑性价比,而基准测试已无法反映真实性能,行业竞争焦点转向产品体验(CLI vs App)与智能体编排能力。同时,中国AI(如DeepSeek)受限于算力但仍能在开源领域保持领先,但增长斜率取决于算力投入。投资者应关注:模型层利润率收窄,未来赢家将是能平衡成本、效率与平台体验的公司,且有从模型提供商向NeoCloud转型的趋势。
📖 中文全文
编者按:不值得读。唯一有趣的是迪伦·帕特尔说 Gemini 和 OpenAI 将在两周内发布新模型。这段录音是在 2026 年 5 月 5 日录制的。所以这意味着 5 月 18 日到 5 月 24 日,这也正好是 Google I/O 举行的时间。 章节时间戳 00:00 OpenAI 的回归与最新 AI 模型大战 04:05 AI 模型的高成本与快速模式的有效性 08:16 当 AI 代币对某些任务变得太贵 13:11 为什么 AI 模型质量下降以及基准测试失效 18:42 深入分析 Claude 4.7 的特性与分词器变化 25:29 DeepSeek 的发布与中国 AI 算力限制 28:20 上下文窗口的未来与智能体编排 30:47 大辩论:CLI 还是 App 用于 AI 交互 36:33 戳穿 AI 假新闻与上下文窗口局限 40:51 AI 竞赛:中国、Meta 与 Neo Cloud 愿景 43:46 最终想法与听众反馈请求 制作工具:Transcript Desk Chrome 扩展 完整视频:https://www.youtube.com/watch?v=BhVf3hEGnuA 今年年初,OpenAI 陷入了严重困境。Anthropic 的 Claude Opus 4.5 发布引发了一波开发者开始使用 Claude Code,到 4 月份,Anthropic 的收入在可比基础上超过了 OpenAI。OpenAI 的 GPT 5.4 回应是如此尴尬,他们在模型发布卡中甚至没有将其与 Claude 进行比较。接着 GPT 5.5 来了——终于回到了前沿,但这足以夺回王冠吗?
转录稿 00:00-00:08 SemiAnalysis 主持人:大家好,欢迎回到 Semi-Analysis 周报。 00:08-00:36 SemiAnalysis 主持人:本周我们有一期大节目,请来了一些重磅嘉宾——Doug、Max,可能还有其他人参与。Dylan Patel 从一个不错的设备连线,戴着耳机,还有一个印有 Semi-Analysis 标志的水壶。我们将讨论 Claude Code,这已成为我们的主要话题之一,还有 GPT 5.5、DeepSeek 等等。那么,让我们开始吧。 00:36-01:16 SemiAnalysis 主持人:好了各位,欢迎。你们相信吗?今天是 5 月 5 日,也就是说 GPT 5.5 发布了。另外,祝 Max 生日快乐。Max 上周刚在 Semi-Analysis 通讯中首次以第一作者的身份发表了文章——编程助手深度分析。最有趣的是,他当时紧张地问 Doug 和 Michelle 他是否能通过试用期。老兄,你显然通过了——有什么好担心的?现在 Max 是 Semi-Analysis 的全职员工了。 Max Kan:很高兴在这里。真的很兴奋。 SemiAnalysis 主持人:欢迎加入团队! 01:16-02:16 SemiAnalysis 主持人:让我们快速回顾一下那篇文章。最初,它应该只是对 GPT 5.5 Pro 或只是 5.5——不管他们最后定什么名字——的评测,我们假设在测试新模型时会叫它 5.5。有人开玩笑说我们叫它“spud”或“potato patata”。但后来 Anthropic 发布了 Claude Opus 4.7,它具有一些我们在文章中涵盖的重大新功能。我们还看到了 DeepSeek V4,它在延迟了大约四到五甚至六个月后终于发布了。所以那篇文章变成了一篇关于所有最新发布的综述。Max,你能给我们一个高层次的总结吗? 02:16-04:06 Max Kan:当然。简而言之:OpenAI 一度情况非常严峻。今年年初,Anthropic 在收入方面迅速缩小差距。根据泄露的信息,Anthropic 的 ARR 达到了约 190 亿美元,而 OpenAI 是 240 亿美元。到 4 月初至中旬,Anthropic 显然在可比收入基础上超过了 OpenAI,即使考虑与超大规模云厂商的毛收入与净收入相关的不同会计处理方式。主要推动力是 Anthropic 的 Opus 4.5——它在编程和智能体能力上真正上了一个台阶。从 11 月底到 4 月,大多数人都转向在各种工作负载上大量使用 Opus 4.5 和 4.6。OpenAI 试图用 GPT 5.4 反击,但说实话,那个发布是个尴尬;他们在模型发布卡中甚至没有将其与 Opus 模型比较,只与之前的 OpenAI 模型比较。这很能说明问题。然后 GPT 5.5 来了,OpenAI 回到了前沿。Opus 模型又被加入了对比。尽管 Twitter 上有一些炒作,但它并没有明确比 4.6 或 4.7 更好,但绝对达到了同等水平并且可用。所以 OpenAI 又有了机会。 04:06-06:10 SemiAnalysis 主持人:Doug,你呢?你日常用什么?两个都用还是更倾向于其中一个? Doug O'Laughlin:我试了很多次想用 Claude Code,但使用限制每天都阻碍我。我不知道为什么我总是在 API 上碰上限。有时我光是开始就要花超过 15 分钟。 SemiAnalysis 主持人:你试过绕过它吗? Doug O'Laughlin:当然试过。我甚至在 OpenAI 的 Slack 里发帖求助。这很令人沮丧。另外,OpenAI 的快速模式似乎非常昂贵,而且会吹爆上下文窗口。 Max Kan:是的,对我来说它们并驾齐驱,基本可以互换。但我真正想要的是快速模式加上高可用性,目前还没有人能做到这一点。 Doug O'Laughlin:OpenAI 的“快速模式”现在不基本是假新闻吗? Max Kan:嗯,这么说还算公平。它们减少了推理深度,而且实际上并不是很快。Opus 的快速模式也不再像以前那样快两倍了——现在不到两倍了。 SemiAnalysis 主持人:对,起点大概是 2.5 倍快,但现在不到两倍了。 Max Kan:OpenAI 实际上有三个快速版本:优先级模式、快速模式和 5.3 codec spark。5.3 codec spark 基本上是一个完全不同的模型,感觉像噱头。快速模式可能和 Opus 的快速模式相当。 Doug O'Laughlin:我一直在 codecs 中测试快速模式,感觉慢——有时我开了快速模式也没觉得更快。 SemiAnalysis 主持人:是的,我认为 Jordan 最近给我看了 token 输出速度在不同模式下的变化——峰值、中位数、低谷——显示 OpenAI 的优先级模式并不总是提供更快的响应。 Max Kan:优先级模式更多是关于有服务等级协议保证的执行,不一定是更快的交互,尽管它确实有一个小溢价,比如两倍的成本。 SemiAnalysis 主持人:那个每秒 token 数据是多少来着? Max Kan:我们看到对于 4.6 基础版,token 速度大约在每秒 35 到 40 个 token 之间。快速模式开始时大约 90 TPS,但现在降到了大约 70。所以你支付了六倍的价格,却只得到了不到两倍的速度。 SemiAnalysis 主持人:对。内部,Max,你提出了这一点——或者我想我们都同意——这是这里的工程师第一次真正选择速度而非质量。我不确定这具体意味着什么,但用户似乎想要快速模式,即使质量受损。 Max Kan:是的,肯定的。我认为很大一部分原因是 4.7 在日常任务中并没有比 4.6 有实质性的质量提升。 06:10-07:33 Max Kan:我之前在想这个——如果你把这映射到 OpenAI 的 Cerberus 深度学习接口,并且考虑到 Opus 4.5 通过了某个关键的智能或能力阈值,很多常规任务就变成了“一次完成”,意味着你不需要监督输出或监督模型。所以也许即使你永远不运行比那个更大的模型…… 07:38-07:59 SemiAnalysis 主持人:假设你在 Cerberus 上有一两千亿参数——你就能在那个规模上获得 GPT 5.5 级别的智能,可能不到一年。我想我们已经到了大多数人日常工作中并不真正需要前沿级别智能的地步。 07:59-08:15 SemiAnalysis 主持人:如果这些模型继续变得更贵,情况尤其如此。最初,我以为我们可能还能负担得起以快速模式运行 Mythos,但我不认为现在还有可能了。很多人已经被这些模型的价格排除在外了。我想我们正处于全面定价排除的边缘。 08:15-08:36 SemiAnalysis 主持人:我认为我们负担不起。比如 Mythos 大概是六到七倍贵?Mythos 是 25,150 或 25,125 token,而其他的是 5,15 token,Opus 是 5,25 token。所以 Mythos 大约贵五倍,然后快速模式在此基础上再贵六倍。 08:36-08:51 SemiAnalysis 主持人:目前,按照我们的 token 花费,我还能证明其合理性。但如果这个数字翻倍,我就会想,“哦天哪,也许我们得关掉快速模式了。”在这一点上,利润率真的很重要。 08:51-09:02 SemiAnalysis 主持人:你们认为有没有可能我们在 SemiAnalysis 研究中定义一些如此重要的事情,以至于我们愿意只为那一个项目或任务支付这个溢价? 09:02-09:23 Dylan Patel:我认为 Mythos 在 token 效率上更高。对于大多数任务,Mythos 快速模式可能比 4.6 快速模式更便宜,至少根据对 Codex、5.4 和 5.5 的比较是这样。即使模型变得更贵,对于相同任务的价格跳跃并不大。我不期望新模型对相同任务会花费更多。 09:23-09:30 Dylan Patel:问题不在于每个任务的价格;而在于我们不断想出新的任务用这些模型来做。 09:30-09:33 SemiAnalysis 主持人:是的,这就是杰文斯悖论。 09:33-09:49 Dylan Patel:完全正确。根据我们未来几个月要做的事情,我们会发现新的、更复杂的任务需要更大的模型。但现在,我甚至不考虑一个任务是否值得花费 token;我只是花掉它们。但如果模型变得非常贵,我们就得重新考虑一个任务是否值得花那些快速模式 token 的成本。那将会很悲哀。 09:49-10:13 SemiAnalysis 主持人:问题:真正的权衡是什么?我有过这样的经历:烧掉 token 比我自己做这项工作还要贵。比如,你们有什么例子说明成本不值得? 10:13-10:39 SemiAnalysis 小组成员:有几次我在 DigitalOcean 的小型服务器上设置了一个基准测试,使用 Opus 进行了六次快速模式调用,花费了大约 400 美元。我想,这真的值得我花 10 分钟吗?大概不值。 10:39-11:04 SemiAnalysis 小组成员:是的,我认为那些你可以用脚本完成或写文档的东西——也许模型的第一稿还不错,但编辑可能很烦人。有时模型会搞乱编辑或错误的部分。这是一个质量与成本的讨论。 11:04-11:13 SemiAnalysis 小组成员:以双倍价格完全浪费 token?我想我还没碰到过。 11:13-11:40 SemiAnalysis 主持人:好的,我来说一个我的例子:如果你在抓取大型数据集,到了某个点,回报递减。比如,你想从一家公司获取 10,000 名员工,然后对每个人进行复杂的搜索或画像。但当你计算成本时,数据增强 API 可能只有 token 成本的十分之一。 11:40-12:13 SemiAnalysis 主持人:所以我烧掉了 800 美元 token 来做一些本来调用 API 只需 55 到 100 美元的事情。一种方法可能很粗糙,另一种至少在理论上是经过验证的。所以这可能是在通过 API 提供数据与烧 token 相比效率低下的最清楚例子。以那种方式抓取整个互联网在 token 效率上就是不行。 12:13-12:48 SemiAnalysis 主持人:是的,我一直很好奇是否存在一种权衡,即支付那种智能水平根本不值得。就像《瑞克和莫蒂》 meme 一样,对吧?AI 的全部目的就是“递给我黄油”。这真是浪费。我们需要更好的 token 效率。你可以以更便宜的价格雇人来做一些琐碎的工作,而不是支付 token 费用。 12:48-13:03 SemiAnalysis 小组成员:但通常你已经习惯了 token 更便宜或更快,以至于你甚至不考虑替代方案,尤其是在有聚合出价的情况下。 13:03-13:12 SemiAnalysis 主持人:那么要点是什么,Dylan?OpenAI 真的回归了吗?你觉得他们正在回归? 13:12-13:22 Dylan Patel:我不知道,老兄。每个人都在两周内有新发布——Google、OpenAI,可能还有 Anthropic。Google 和 OpenAI 肯定有。 13:22-13:50 SemiAnalysis 小组成员:他们要发布什么?更多预训练?更多强化学习?相同的基座模型?可能完成他们一开始有点仓促推出的预训练,然后更多强化学习,然后一个新模型。Google 主要是在推动多模态更新。 13:50-14:10 SemiAnalysis 主持人:我听到一种说法,即使对于不使用快速模式的普通用户来说,Claude 4.7 实际上也比 4.6 差。你们同意吗? 14:10-14:26 SemiAnalysis 小组成员:我认为指令遵循客观上更差了。模型经常忽略 CloudMD 指令或者没有完全按照技能要求去做。这似乎是一个持续存在的问题。 14:26-14:34 SemiAnalysis 小组成员:我觉得这更像是计算分配的问题。比如它仍然说,“我们今天做了很多工作,享受周末吧,”而我会说,“今天是周一,回去工作!”这很令人沮丧——它试图让我停止工作。肯定是一个使用问题。 14:34-14:47 SemiAnalysis 小组成员:黄金时代是量化之前的 4.6。那些日子真好。快速模式 4.6 摆脱了限制。但随着这些模型成熟、针对推理进行优化、并获得更多用户,当使用量扩大十倍或一百倍时,体验实际上似乎变差了…… 14:58-15:22 SemiAnalysis 主持人:是的,我认为这已经发生了。老实说,4.7 感觉还行——大概和 4.6 差不多。实际上更多是现在用的人太多了。我需要一个 NIMBY AI——“别在我后院”的前沿模型,只有我能用,这样我就能获得更高的性能或更快的访问。这也是为什么 codecs 现在很有吸引力;理论上,因为使用的人更少,你可以获得更高的速率。 15:22-16:00 SemiAnalysis 主持人:Max,我们能谈谈基准测试吗?当你看到 4.7 发布及其基准分数时,它在大多数测试上更好,但并非全部。这让我们开始思考什么时候基准测试有用,什么时候它们不足。Doug 的观点是个人体验各不相同,偏好也因此形成,但理想情况下,应该有一些客观指标来说明 4.7 是否真的比 4.6 更好。 16:00-17:14 Max Kan:老实说,基准测试试图成为那个客观指标,但我认为它们现在已经不行了。你需要接近前沿性能才有机会成为最好。但即使基准测试排名第一也不能保证模型在实际中就是最好的。现在,基准测试基本上只是一个快速的“感觉”检查,确保模型不是绝对的垃圾。让我惊讶的是,很少有人深入挖掘这些基准测试的细节,或者意识到它们与真实世界的 LLM 用例多么不具代表性。例如,像“人类最后一次考试”这样的东西听起来很厉害,但当你仔细看,它只是一系列晦涩的选择题,并不反映典型的 LLM 任务。它们被设计成选择题是为了便于自动验证,但真实世界是开放式的。 17:14-18:40 Max Kan:即使是看起来更实用的基准测试,比如用于编程的 SuiteBench 2,也不完美。你会认为编程是可验证的——给模型一个任务,运行测试,看它是否通过。但很难写出自然措辞、完全没有歧义、并且只有一个正确答案的编程题目。SuiteBench 最初是从 GitHub issue 抓取的,但熟悉 GitHub issue 的人都知道,题目描述并不是那种你可以直接交给 AI 的明确定义的任务。验证器还会检查问题描述中甚至没有提到的实现细节,比如要求 AI 逐字生成一个非常具体的错误信息。后来的版本试图修复这些问题,但仍然不完美,这真的凸显了基准测试在这个领域的局限性。 18:40-19:46 SemiAnalysis 主持人:有道理。现在,回到 4.7 本身,除了基准测试之外,还有一些功能变化。你在文章中提到,人们现在更少关心原始模型质量,而更关心模型及其“配套系统”——实际的产品体验。所以人们应该评判的不是在某个通用 bash 提示符下的 Opus 4.7,而是像 Claude Code 对比 Codex 这样的东西。在 4.7 发布期间,他们宣布了一个额外的“高推理努力”模式,介于高和最高之间。他们增加了高分辨率图像支持,用于截图和样式,这对前端应用有帮助。另外,模型现在默认省略思考内容,所以用户看不到 AI 的“思考”过程。还有一个新的任务预算功能,允许你控制模型在被上下文窗口大小限制之前可以投入多少“努力”或工作量。可能最重要的是:他们更新了分词器,这可能导致用户为完全相同的输出多支付 35% 的 token,仅仅因为 token 计数方式变了。 19:46-21:30 SemiAnalysis 主持人:好的,抱歉——Dylan 完全在我吐槽分词器的时候走神了。我那段独白真的把他给说睡着了。分词器太无聊了,直接把 Dylan 给放倒了——这就是要点!不,说真的,现在他醒了,我们可以深入探讨所有我们想要的细节了。 21:30-22:04 SemiAnalysis 主持人:那么总结一下:GPT 5.5 还行——不是颠覆性的,但绝对足够好并且有充足的容量。现在,关于那些基准测试——它们很烂。但分词器的差异呢?从 Opus 4.6 到 4.7,他们换了分词器,所以同样的输出在新分词器下可以多出 35% 的 token。 Max Kan:是的,他们实际上从 4.6 到 4.7 增加了词汇量,这导致了更多的 token。 SemiAnalysis 主持人:那不应该意味着每个输出的 token 更少吗?因为更大的词汇量通常意味着模型可以用更少的 token 表示更长的片段。 Max Kan:你会这么想,但实际上用了更多的 token,因为每个 token 更细粒度了。想象一下,如果你有一种语言只有 28 个 token,你就得一个字母一个字母地拼写。但如果你有 500 个 token,包括像“of”和“the”这样的常见词,理论上你需要的 token 会更少。但在实践中,模型并没有因为词汇量更大而更 token 高效;实际上它使用了更多的 token。 22:04-23:05 SemiAnalysis 主持人:有趣。好观点。从概念上讲,你可以用整个单词作为 token 来训练一个模型,但实际上,更大的词汇量反而让模型在 token 效率上更差了。哇,我这问题问得够猛的! 23:06-23:13 SemiAnalysis 主持人:哇。他一直在想。好的,是啊。 23:13-23:36 SemiAnalysis 主持人:更 token 高效的整个理念是你可以用更少的 token 解决整个任务。如果你有一个更细粒度或更大的 token 大小,或者只是一个更大的词汇量,你可以在潜在空间表示更多信息。例如,短语“semi-analysis”可能是一个 token,而不是被拆分成“semi”和“analysis”。 23:36-24:09 SemiAnalysis 主持人:但那样就会产生更多上下文,对比“some analysis”可能只需要四个 token。我明白了。这都关乎选择——更丰富的信息。比如,“semianalysis”的嵌入在潜在空间中可能更接近“Dylan”的嵌入,而分开的“semi”或“analysis”可能不接近它。 24:09-24:27 SemiAnalysis 主持人:目前还不清楚这是否真的能显著提升性能,因为人们仍然在争论 4.7 和 4.6 哪个更好。而且也有人辩论它到底更 token 高效还是更差,因为如果模型没有明显更好,何必费心搞一个新分词器? 24:27-24:43 SemiAnalysis 主持人:也许这只是一个早期的检查点——他们需要更多强化学习来改进 4.7,然后发布一个真正有区别的 4.8 版本。我认为 Anthropic 不会像 OpenAI 那样明显推出半成品模型。OpenAI 的 5.3 Codex 基本上只是代码上的强化学习。那是他们迄今为止最半成品的模型吗? 24:43-25:12 SemiAnalysis 主持人:之前,我们在 Opus 之前见过 Sonnet——比如 4.5 Sonnet,然后 4.5 Opus,然后 4.6。这是第一个只发布 Opus 的新模型。实际上,Opus 4.7 基本上也是 Sonnet。 Jordan Nanos:你不是真相教徒吧? SemiAnalysis 主持人:是啊,然后 Opus 4.7 就是 Vitas。这就对了。这完全是真相教徒的话。 25:12-25:30 SemiAnalysis 主持人:Opus 4.6 一直都是 Sonnet——大家都记得吗?就像,它是一个大小模型,去掉了掩码之类的。是的,那种模型。 25:30-25:38 SemiAnalysis 主持人:不管怎样,我想还是回到 DeepSeek 上,因为我们还没怎么讨论它。 Dylan Patel:哦,DeepSeek——文章里的“DeepState”部分? SemiAnalysis 主持人:对,DeepSeek。我们只是简单提了一下,但有很多内部想法没有写出来。 25:38-25:56 SemiAnalysis 主持人:我的问题是:你认为中美之间的开源 AI 差距又开始拉大了吗?感觉是的,我认为这与算力限制有关。你们怎么看? 25:56-26:18 SemiAnalysis 主持人:快速想法——DeepSeek 值得注意因为它是一个百万 token 上下文窗口的模型。许多领先的开源模型,即使是那些用于编程的好模型,也没有达到百万 token 上下文。另外,他们发布后来又删了一篇推理和视觉空间的论文,这暗示他们可能会发布多模态版本或在做相关研究。 26:18-26:52 SemiAnalysis 主持人:这些发展很有趣,因为它们可能帮助中国在产品基础上赶上。在开放代码上比较 Cloud Code、Codex 和 DeepSeek,DeepSeek 可能支持所有相同的功能,但在许多其他方面也更好。但当 DeepSeek 首次发布时,我经常用它做各种事情;现在我不怎么用了。 Jordan Nanos:那 Kimi 2.6 不是更好吗? SemiAnalysis 主持人:对。 Jordan Nanos:我也不用那个了。 SemiAnalysis 主持人:我的意思是,第一次 DeepSeek 发布感觉像是凭空冒出来的——完全成熟。这次发布只是开源领域里的最先进水平;它不一定比 Kimi 2.6 好。 26:52-27:40 SemiAnalysis 主持人:这次发布最大的改进似乎是在推理优化方面。他们提到 Ascend 内核部分支持推理,这可能首次解锁中国更多的算力。从权重大小来看,它似乎被设计成适合一个 H200 8x 计算单元的内存域。所有当前的顶尖模型都可以在那个内存范围内进行推理,没有比那个更大的最先进模型。 27:40-28:14 SemiAnalysis 主持人:这显然是一个硬上限。他们可能有更大的模型,但可能不会公开以 200 个计算单元的配置发布。感觉他们撞上了一堵墙。你认为这会减缓或限制中国 AI 的进展,因为他们无法在更大规模上进行推理吗? 28:14-28:42 SemiAnalysis 主持人:我想听一些尖锐的观点。 Dylan Patel:好吧,我想……你他妈的到底在说什么? SemiAnalysis 主持人:他激动了。开始冒汗了。 28:42-29:08 SemiAnalysis 主持人:DeepSeek 主要是一个工程发布。这很吸引人,尤其是所有新的注意力变体和 Kibbe 缓存中的压缩。他们的基础设施工作很扎实。Kibbe 管理 256k 上下文,而 DeepSeek 做到一百万——这对于需要很长上下文的任务来说是一个巨大的升级。 Jordan Nanos:但从 256k 跳到百万 token 有用吗?或者像在 Opus 里那样实用? Dylan Patel:不,那是垃圾。 SemiAnalysis 主持人:也不是完全没用,但可能只是在最先进水平上的一个理论进步。 29:08-29:37 SemiAnalysis 主持人:问题是,没有人希望在大型任务中不断清理上下文。拥有完整的上下文可见性非常有帮助。压缩——总结并压缩先前 token 的过程——就是不好用。无法使用百万 token 上下文窗口令人沮丧。但老实说,我认为干脆清空上下文可能更好。 Dylan Patel:清空更好? SemiAnalysis 主持人:是的,这是我的尖锐观点。我宁愿重新开始。把到目前为止我们做过的事情做个总结,复制粘贴那个,然后重新开始。忘掉压缩。 29:37-29:56 SemiAnalysis 主持人:DeepSeek 3.2 的论文发现,对于他们的基准测试——我认为不是很好——一旦你为某个任务超出了上下文窗口,通过完全清空上下文来继续,性能实际上比试图总结或压缩要好。 Dylan Patel:做总结不就是底层压缩在做的事吗? 30:00-30:21 SemiAnalysis 主持人:当我说“做个总结”时,我意思是像,实际使用整个上下文窗口而不是仅最后我在做的事情。我会试图记住,但我不会去读一百万个 token 的缓慢推进。相反,我会说,“好吧,我刚才在做什么?读这个。”然后我可能只复制粘贴一小部分,而不是全部。所以我并不是真正在总结所有东西——我只是在移交任务。 30:21-30:37 SemiAnalysis 主持人:有不同方式来压缩信息,但我认为压缩与总结不同。压缩是关于早期移除不必要的思考痕迹。它不是让模型对整个上下文写一个总结。 30:37-30:46 SemiAnalysis 主持人:我以为总结意味着实际拿你的整个上下文,然后问,“嘿,请总结一下这个。”那是一种方法,他们尝试过多种方法。 30:46-31:07 SemiAnalysis 主持人:这是我的尖锐观点:Anthropic 在 Claude Code 的 CLI 上做得很好。他们不断让 CLI 变得更好。但 CLI 并不是编排智能体的最终平台。所以从某种程度上说,他们过于专注于改进 CLI,从而陷入了创新者的困境。 31:07-31:32 SemiAnalysis 主持人:另一方面,OpenAI 对未来智能体编排平台的真正愿景。它是一个应用为基础的经验,整合了语音、多模态和各种东西。应用远比 CLI 好。用户真的应该使用应用,而不是被困在 CLI 上,CLI 是一条死胡同——一个来自 2025 年上半年的遗留物。 31:32-31:42 Dylan Patel:你是说应用是永远的未来了?还是你指他们的设备?他们明年说要发布一个消费设备。 31:42-31:52 SemiAnalysis 主持人:不,不。我指的是笔记本应用——Codex 应用。这是关于他们的长期计划。 31:52-31:55 Dylan Patel:那为什么 Codex 应用这么烂? 31:55-32:01 SemiAnalysis 主持人:这全是关于长期愿景。 32:01-32:24 SemiAnalysis 主持人:Dylan,我认为你想得太小了。在一个完美的、极致的世界里,操作系统甚至都不需要。你只需要一些硬件,插上电,它打开终端,连接到你的云 API,然后为你构建操作系统。 32:24-32:37 SemiAnalysis 主持人:Codex 应用正在添加生成式 UI 功能,这很有趣。但如果你是编程纯粹主义者,生成式 UI 是 CLI 体验的下游产物。 32:37-32:50 Dylan Patel:我是 CLI 派——这只是个人偏好。我喜欢 CLI。比如,Claude Code 的使用感觉真的只是一个 CLI 封装。你一眼就能看出来。 32:50-33:01 Dylan Patel:而 Codex CLI 感觉就像一个应用封装。好像他们把所有东西都强行塞进了这个结构里。 33:01-33:15 SemiAnalysis 主持人:对于未来是什么样子,有两种阵营,老实说,谁知道长期哪一方会赢。我很乐意让竞争保持开放。但从一个真正的极致主义者的角度来看,一切都是 CLI 的下游。只是 token——这是最有效的方式。 33:15-33:28 SemiAnalysis 主持人:你只需要一个 API 和输入。你的应用和所有其他东西?那只是层层混淆。Mythos(已知的极致主义者)在这点上肯定更同意 OpenAI 而不是 Anthropic。我们是谁来决定我们真正想要什么 UI? 33:28-33:33 Dylan Patel:不,老兄。永远是 CLI,一路到底。纯粹的极致愿景。 33:33-33:42 Dylan Patel:我是 VS Code 插件派。我甚至昨天测试过。我一直在烦 Max,他让我滚开,关于用 Ghosty 做 CLI 的东西……但就是不好用。 33:42-33:54 SemiAnalysis 主持人:尽管如此,如果你同时打开六个 Ghosty CLI 终端,感觉比在 Codex 应用中同时处理六个不同的聊天要好。 33:54-34:09 Dylan Patel:确实,我感觉效率更高。与 VS Code 相比,我可以打开六个窗口,左边有文件浏览器,右键点击很容易——工作流就是更好。 34:09-34:13 SemiAnalysis 主持人:区别在于,你实际上在写真正的代码,你在乎输出,而我看都不看代码。 34:13 Dylan Patel:不,我也不读代码——我只是在复制图片或 Excel 文件。别指责我读代码! 34:21-34:35 SemiAnalysis 小组成员:你在说 Edson。我最喜欢的部分是,我实际上同意 API 或 CLI 基本上就是新的编译器。现在没人真的读编译器了。没人在乎。他们不需要碰那些魔法。 34:36-34:50 SemiAnalysis 小组成员:未来可能如此,但就目前而言,对于任何你真正在乎的代码,情况并非如此。模型仍然产生很多糟糕的输出,需要引导来修复。 34:51-35:11 SemiAnalysis 小组成员:我不是说我还在自己敲代码,但我确实读代码。今天早上,我在读一个群聊,里面有一些世界上最好的内核程序员。他们发现——因为他们是我兄弟,你知道我是个社交达人——最好的方法是…… 35:12-35:35 SemiAnalysis 小组成员:听着,Max,Codex 很蠢,但我只是让它生成代码,然后它基本就能工作。它生成的代码很粗糙,然后我让 Opus 重写并清理。你不能反过来——你不能让 Opus 生成代码然后让 Codex 修复。 35:36-35:51 SemiAnalysis 小组成员:有趣的是,公司里其他所有人都喜欢相反的工作流。整个公司实际上喜欢反过来。 35:52-36:01 SemiAnalysis 小组成员:但嘿,我们又不是在写 Treedow 的内核或什么的,对吧?我们主要做内核基准测试,但是的,我们写了一些内核——不是 Treedow 内核,只是 GPU 模式内核竞赛。 36:02-36:15 SemiAnalysis 小组成员:事情是这样的:如果你谈论小众的微架构细节,Claude 倾向于含糊其辞,而不是直接去做。Codex 会直接尝试实现所有东西,即使很粗糙。然后 Opus 会清理并修复它。 36:16-36:34 SemiAnalysis 小组成员:Doug,这跟上下文窗口有关。当你把大量关于 GPU 指令集架构文档喂给模型写内核时,你需要巨大的上下文窗口——比如一百万个 token——因为较小的窗口很快就没空间了。 36:35-36:43 SemiAnalysis 小组成员:不管怎样,Dylan,你想回到 DeepSeek 吗?有什么尖锐观点吗?为什么这次没有震动市场,即使 KVCache 减少了 90%? 36:44-37:00 Dylan Patel:老兄,我有一阵子没在亚洲了,但每次我去,他们都在引用一些新论文,把 KVCache 减少了一大截——过去三年一直在发生。美国研究者甚至从来没听说过这些论文。他们像称赞最了不起的东西一样称赞它们。 37:01-37:14 Dylan Patel:DeepSeek 和 TurboQuant 是最近冒出来的最大的几个,但 TurboQuant 显然是假新闻。是的,这挺搞笑的。 37:15-37:24 Dylan Patel:老实说,也许人们只是厌倦了被烧伤。现实是,杰文斯定律明显在起作用,GPU 价格在上涨——这只是简单的经济学。 37:25-37:33 Dylan Patel:说到真正的假新闻,我们来谈谈 Sub-Q。没有计划就此写文章或发帖,只是免费的内幕消息。有人读过吗?这非常可疑。 37:34-37:41 Dylan Patel:实际上极其、超级、极度可疑——就像人们到处在创业一样。 37:42-37:58 Dylan Patel:我真心觉得如果他们现在关闭融资,他们会说,“哇,那只是把 10 个上下文窗口拼接在一起的 Opus。” 37:59-38:15 SemiAnalysis 小组成员:你觉得市场火爆到他们下个月能关闭一轮 2000 亿美元的融资吗? Dylan Patel:如果他们做了,我不知道能否达到 2000 亿美元,但也许 500 亿美元 对应 10 亿估值…… SemiAnalysis 小组成员:一万亿? Dylan Patel:不,我说的是十亿。 SemiAnalysis 小组成员:不,万亿、万亿、万亿。 Dylan Patel:抱歉,十亿。 38:16-38:23 SemiAnalysis 主持人:等等,你们在说 Anthropic 吗?Dylan,你知道我们在讨论什么吗? Dylan Patel:不,抱歉。我以为你们在讨论 Anthropic。 SemiAnalysis 主持人:不,我们不是。我们实际上是在讨论模型稀疏性。 38:24-38:38 SemiAnalysis 主持人:我正在说最坏的情况。你今天看到那个叫 SubQ 的假新闻 Twitter 帖子了吗? Dylan Patel:哦,是啊,是啊,是啊,我看到了。 SemiAnalysis 主持人:别担心。我们实际上自己申请了 API 访问——用我们的 SemiAnalysis 邮箱——来获取这个模型的访问权限,这据说是非常真实的东西,兄弟。 38:39-38:52 SemiAnalysis 主持人:谁知道呢?也许是一个状态空间模型,也许是别的东西。但我不认为它是 SSM。只是觉得好笑,因为人们对 DeepSeek 恐慌。如果它是真的,今天股票应该已经跌了一亿亿亿个百分点。 38:53-39:15 SemiAnalysis 主持人:但显然,这不是真的。我是说,无意冒犯创始人,也许他是正经的,但看着这些人,我不觉得他们能解决 AI 中最难的一个问题。 39:16-39:48 SemiAnalysis 主持人:不过,这让我想起——Llama 的 Scout 或 Maverick,我想 Scout,最小的那个,宣布有 1000 万 token 上下文窗口,但发布权重中并没有真正支持。我很惊讶没有拥有无限算力的人尝试过更昂贵的、上下文窗口更大的模型。他们从哪里获得数据,对吧?大多数人用 16K 或 32K 上下文窗口预训练,然后微调来 hack 出更长的上下文。但有什么数据是真正为超长窗口存在的呢? 39:49-40:07 SemiAnalysis 主持人:这就是为什么我 25 万到 100 万 token 上下文的实验是垃圾——根本没有这样的数据。模型对那么大的上下文泛化不好。如果你跳到 1000 万 token,除了 100 万以外还有什么有用信息?差别微乎其微。 40:08-40:25 Dylan Patel:有道理。也许是合成数据,或者别的什么?何必费事?似乎明显有人在做,但还没有人公开发布超过 200 万的东西。 SemiAnalysis 主持人:Google 实际上在他们的 3.1 pro 版本中提供了 200 万 token 服务——他们从 100 万开始,然后更新到 200 万,在某些模型上。 40:26-40:52 Dylan Patel:好的,所以目前真正现实的是 100 万。有道理。 SemiAnalysis 主持人:对,那为什么不用 TPU 扩展一下试试呢? 40:53-41:07 SemiAnalysis 主持人:顺便说一下,Max,这在文章里被遗漏了,Doug 问过这个问题——中国是在迎头赶上还是仍然落后于他们的 AI 模型?我那天在烦你:DeepSeek 或 Kimmy 是领先还是落后于 Meta?他们相对于 Grok、Cursor 或 SpaceX 的 XAI 又处于什么位置? 41:08-41:34 Max Kan:我想说,今天 DeepSeek 可能领先于所有这些公司。但真正的问题是从这里开始的斜率——他们的增长轨迹。这可能听起来很基础,但决定一个 AI 模型有多好的关键输入仍然是你拥有多少算力。 41:35-41:57 Max Kan:显然,百度签署了所有这些大规模交易——似乎他们已经解决了炒掉然后重新招聘人才的问题…… 41:57-42:09 SemiAnalysis 小组成员:整个 AI 团队现在正在开发一些扎实的模型。我预计 Meta 将在今年年底前(如果不是的话,肯定在 2027 年上半年)领先于所有中国竞争对手。 42:09-42:21 SemiAnalysis 小组成员:Meta 不是在搞模型蒸馏吗? SemiAnalysis 小组成员:我不认为他们在从 Anthropic 蒸馏。 SemiAnalysis 小组成员:我以为他们在蒸馏中国的模型。 SemiAnalysis 小组成员:他们主要只是在运行开源模型。Mistral 就是那样做的——他们不从 Anthropic 蒸馏,而是从中国那边蒸馏。 42:21-42:36 SemiAnalysis 小组成员:有道理。我们为什么还要讨论 Mistral,一家领先的法国前沿模型公司? SemiAnalysis 小组成员:老兄,他们的收入非常强劲。 SemiAnalysis 小组成员:是的,我知道。 SemiAnalysis 小组成员:还有,酒瓶——他们也有那些。 SemiAnalysis 小组成员:你骑车时捡起酒瓶? SemiAnalysis 小组成员:每家前沿模型公司基本上都在倒计时,等着变成一家 NeoCloud。 42:36-43:09 SemiAnalysis 小组成员:是的,他们都在试图变成 NeoCloud——或者我相信他们在收购公司来实现这一点。 SemiAnalysis 小组成员:Cerebrus 要变成 NeoCloud 吗? SemiAnalysis 小组成员:NVIDIA 推出 NeoCloud 呢? SemiAnalysis 小组成员:任何公司的最终商业模式就是变成一家 NeoCloud。SemiAnalysis 也会变成一家 NeoCloud。 SemiAnalysis 小组成员:然后我们变成 ClusterMax 白金。 SemiAnalysis 小组成员:钻石等级。 SemiAnalysis 小组成员:不,我们需要一个更高的等级。 SemiAnalysis 小组成员:对,钻石现在太普遍了。 SemiAnalysis 小组成员:叫 Mustang 怎么样? SemiAnalysis 小组成员:SemiAnalysis——锂等级? SemiAnalysis 小组成员:锗?我瞎编的。 SemiAnalysis 小组成员:最稀有的是什么? SemiAnalysis 小组成员:你最喜欢的半导体是什么,Doug? Doug O'Laughlin:我们应该用半导体材料命名等级。 SemiAnalysis 小组成员:你对半导体感兴趣?把名字都列出来。 SemiAnalysis 小组成员:列举前五个?我们应该叫铑,最稀有和最贵的贵金属。 SemiAnalysis 小组成员:钒? SemiAnalysis 小组成员:好了各位,这跑题了。让我们收尾吧。 43:40-44:22 SemiAnalysis 小组成员:在我们结束前有什么最终看法吗? SemiAnalysis 小组成员:我不知道。 SemiAnalysis 小组成员:我也不知道。 44:22-44:55 SemiAnalysis 主持人:好的,快速感谢我们的一位听众 Anna,她建议了这种格式,我们今天做了。你随时可以在这里或在评论中反馈,如果你想让我们尝试不同的东西。我们一直在争论是做每周新闻、回顾过去一两周的通讯文章,还是别的什么。所以,如果你坚持听到了这期节目的最后,反馈会很有帮助。 SemiAnalysis 小组成员:我打赌观众比 Dylan 更有耐心——他都没坚持到结束! 制作工具:Transcript Desk Chrome 扩展
🔗 原文链接
https://thetranscriptdesk.substack.com/p/ep-011-gpt-55-vs-claude-47-openais