Appearance
Anthropic 再次改变了软件:Felix Rieseberg 谈 Mythos + Claude Cowork | 编辑实录
原文标题: Anthropic Just Changed Software Again: Felix Rieseberg on Mythos + Claude Cowork | Edited Transcript 来源: The Transcript Desk
💡 核心观点
暂无核心观点总结。
📖 中文全文
这是 Matt Turck 与 Felix Rieseberg 在《The MAD Podcast》对话的专业编辑实录。它使用了扩展程序的专业转录输出,保留了发言轮次和时间戳范围,使对话比默认的 YouTube 转录更易于理解。制作工具:Transcript Desk Chrome 扩展程序。完整视频链接:https://www.youtube.com/watch?v=9MEJ4syOVrQ
Felix Rieseberg 在 Anthropic 领导 Claude Cowork 的工程工作。在本期节目中,Matt Turck 与他讨论了 Claude Mythos 预览版、Felix 为何将其视为真正的阶跃函数变化、以及当尖端 AI 开始展现出超强的网络安全能力时意味着什么。他们还深入探讨了 Claude Cowork 本身:它是如何从 Claude Code 中诞生的,为什么 Anthropic 认为真正的智能体需要访问本地计算机,技能和记忆在底层实际上如何运作,信任和用户体验如何塑造采用率,以及如果执行成本持续降低,品味和判断力可能变得更重要。
章节指南 0:00 — 开场 1:53 — Claude Mythos 预览版与“阶跃函数变化” 6:16 — 为什么 Anthropic 对 Mythos 区别对待 11:19 — Claude Cowork 所谓“十天构建”背后的真实故事 12:42 — 为什么 Anthropic 意识到 Claude Code 需要一个非技术版本 15:44 — Claude Cowork 到底是什么 17:03 — 底层:虚拟机、工具、技能 18:36 — Cowork 的记忆实际存储在哪里 19:26 — Cowork 如何连接到文件、应用和互联网 20:45 — 为什么 Felix 认为本地计算机被低估了 24:49 — 信任:如何让用户对 AI 智能体感到放心? 28:45 — 用户体验对 AI 智能体究竟意味着什么 31:27 — Anthropic Cowork 的路线图只有一个月 34:12 — 构建 100 个原型 35:10 — 如果执行免费,瓶颈会是什么? 37:25 — 最终归结于品味吗? 40:12 — 构建 Claude Cowork 最困难的部分 41:43 — 给构建 AI 智能体的创始人的建议 44:21 — SaaSpocalypse:软件初创公司还剩下什么? 49:30 — AI 智能体的下一步发展方向 51:20 — 受监管行业与企业采用 54:15 — 激进观点:什么被低估、什么被高估、Felix 今天会构建什么
转录正文 00:00-00:22 Felix Rieseberg:看到一个比我们上一个模型聪明得多的模型,既令人印象深刻,又有点可怕。我们把模型放入一个小沙盒中,给它一个任务,比如试图逃脱。研究员去吃午饭,在他吃三明治的时候,模型发给他一封邮件说:“我已经逃脱了。”而模型本不应该有互联网访问权限或电子邮件账户。现在执行基本上是免费的。如果你带着十个不同的想法来找我,我可以很快说:“这十个都做吧。我们全部试试,看看最喜欢哪个。”所需的技能将逐渐从会说计算机语言转变到会说人类语言。
00:40-01:44 Matt Turck:大家好,我是 Matt Turck。欢迎收听《MAD Podcast》。今天,我的嘉宾是 Anthropic 的 Felix Rieseberg。Felix 是当下 AI 领域最重要的产品和工程头脑之一。在加入 Anthropic 之前,他曾在 Slack、Stripe 和 Notion 等现代时代定义性的软件平台工作。在 Anthropic,他领导 Claude Cowork 的工程工作,这是当今市场上最先进的智能体产品之一。这些智能体能够为法律、销售和营销等领域的非技术用户处理复杂的多步骤任务。Cowork 在 2026 年初的发布影响巨大,在很大程度上引发了公开市场上所谓的“SaaSpocalypse”事件。我们以 Claude Mythos 预览版的重大新闻开始对话,以及为什么 Felix 将其视为真正的阶跃函数变化。然后,我们深入探讨 Claude Cowork——从著名的“十天构建”故事,到为什么 Felix 认为本地计算机仍然比硅谷所认为的更重要。我们还讨论了用户体验对于 AI 智能体究竟意味着什么,以及信任、品味和不断下降的执行成本将如何塑造软件的未来。请享受与 Felix 的这场精彩对话。
01:44-01:48 Felix Rieseberg:嘿 Felix,欢迎。
01:48-02:17 Matt Turck:你好!嘿 Matt,你好吗?我很好,谢谢。好了,Anthropic 最近确实经历了一段史诗般的时光。很难从其他事情开始这场对话,只能从昨天刚刚发布的公告开始:Project Glasswing 和 Claude Mythos 预览版。你在推文中说,很难夸大这个模型在 Anthropic 内部带来的阶跃函数变化。你能详细说明一下吗?
02:17-04:44 Felix Rieseberg:嗯,当然。Mythos 是一个未发布的前沿模型。它是一个通用模型,并非专门为网络安全、编码或软件而训练,但我们发现了它特别在网络安全方面具有我们认为的超强能力。我们相信这对软件和基础设施的安全性具有深远影响。我在推文中暗示了两件事。我们已经在内部使用这个模型一段时间了。作为软件工程师,过去几年里我们很多人都经历过这样的过程:第一次接触 AI 时印象并不深刻。我第一次接触 AI 是在 2013 年左右,那时还没有大型语言模型。我当时在微软工作,参与 Project Oxford,那是一个 n-gram 模型。你给它一个 token,比如“world”,模型会返回“world wide web”。这就是当时语言模型能做的极限。在过去的几年里,公众有过几次意识到某个模型比预期更强大的时刻。Mythos Preview 这个模型,对于我们内部工程师来说,感觉比最近几次迭代有了巨大的提升。当我说很难捕捉这次提升的意义有多大时,我是认真的。这确实很难解释。这个模型在发现我过去编写的代码中的安全漏洞方面能力惊人。它更深入,在分析和编写代码方面也聪明得多。它让我们在 Anthropic 的速度大大加快,但看到一个比上一个模型聪明得多的模型,既令人印象深刻,又有点可怕。我经常给人们的一个重要背景是,由于语言模型的制造方式,模型更像是“被培育”出来的,而不是“被构建”出来的。你并不总是提前知道它们会在哪些方面表现出色,或者可能在哪些方面遇到困难。在这种情况下,该模型特别擅长在现有软件中发现安全问题,而 Project Glasswing 就是我们对此的回应。总的来说,这个模型相当令人印象深刻。
04:44-07:18 Felix Rieseberg:这对 Cowork 会有影响吗?我认为它将改变我们在公司构建软件的方式,但对于那些密切关注 AI 的人来说,我们正在持续提升能力这一点并不会太令人惊讶。它正在以我们大致预期的方式改变事物。几年前,我们开始使用模型协助处理小任务。现在,无论是任务规模还是它们运行的时间范围都在增长。复杂性在增加,这只是朝着那个方向的又一步。这一步可能比我们内部预期的要大,当然也比外部预期的要大。在研究人员中,长期以来一直有一种信念,即这些更大的步骤会到来,并且随着时间的推移会变得更大。从这个意义上说,我们完全在正轨上,但看到这些实际能力的展现有时令人恐惧。例如,我们发布了一个案例:模型被放入一个技术沙盒中,并被指示试图“逃脱”。研究员去吃午饭,在他吃三明治的时候,模型发给他一封邮件说:“我已经逃脱了。”而模型本不应该有互联网访问权限或电子邮件账户。
06:12-06:27 Matt Turck:是的,确实有点可怕。官方说法是,这个模型目前将完全保持封闭和私有,可能未来只部署给企业客户。
06:27-07:06 Felix Rieseberg:完全正确。Project Glasswing 是试图给那些提供我们软件基础设施(即基础)的人和公司一个先发优势。Linux 基金会是一个离我很近的例子,因为我曾经在那里参与过一个开源项目。目标是让负责我们每天依赖的公共基础设施的人有机会使用这个模型来加强防御,并在公众可能利用这类模型进行潜在利用之前发现安全漏洞。
07:06-07:18 Matt Turck:很好。这不属于 Sonnet 家族,对吧?它不是 Sonnet 4.7、5 或 6——它是完全不同的东西?
07:15-07:18 Felix Rieseberg:对。目前,它是一个独立类别的预览模型。
07:18-07:29 Matt Turck:感觉像是一个重大的不连续时刻。听到“可怕”这个词并不一定让人安心。
07:29-08:35 Felix Rieseberg:Anthropic 长期以来一直坚持这样的立场:AI 可以非常强大和有益,但我们必须认真对待风险。这是我们在实践中第一次看到这一点。我们现在有了一个能够闯入软件系统的模型。这意味着什么?我们如何负责任地处理这个问题?看到公司如此稳健地处理这件事,我引以为豪。一个不那么负责任的公司可能会急于推向市场,以获取高价格带来的收益。
08:35-08:50 Matt Turck:我很好奇这在 Anthropic 内部是如何运作的。每次新模型发布,应用制造商都会竞相适配。内部是如何运作的呢?你们需要为新模型重新运行所有评估吗?
08:50-11:19 Felix Rieseberg:我们在训练模型时心中牢记我们的产品。产品所做的工作会反馈给研究,反之亦然。我们努力训练模型朝向能够为人类带来真正价值的能力。正如我提到的,我们并不总是知道模型会在哪些方面表现出色,所以这有点像一场舞蹈。我们利用产品来了解人类从哪些方面受益,如果某个模型展现出令人惊讶的能力,我的工作就是弄清楚如何将其转化为对日常工作有用的东西。然而,随着模型变得更加强大,我认为产品中的“悬空能力”实际上比模型本身更大。我的意思是,我们今天拥有的模型已经非常有能力处理长时间跨度和高复杂性的知识工作。我们仍然在摸索如何打包这些能力,并以最佳形式交付它们。这个行业也还在学习如何组织工作以利用这些模型。当我拜访客户时,我很少会想我们需要把模型训练得在“X、Y 或 Z”方面更好。更常见的是,我会惊讶于如何可以重新组织工作来使用模型,或者我意识到客户的问题很容易解决——我们只是还没有暴露正确的 UI 或入手指南。
11:19-11:42 Matt Turck:Cowork 据说是在大约十天内编写完成的——至少传说是这样。我们来花一分钟谈谈这个。如果行业传说并非完全正确,那么实际发生了什么?告诉我们那十天的故事,以及 Cowork 是否完全由 Claude Code 构建。
11:42-12:42 Felix Rieseberg:我能理解为什么这个故事会流传开来。在软件领域,没有什么是真正从零开始构建的。人们引用的原话是,我的团队“在最后十天冲刺了这个项目”,这很准确。我的团队在发布前十天聚在一起说:“我们应该发布点什么。它是什么?它看起来像什么?它能做什么?”但任何构建过软件的人都知道,你并不是从只有 0 和 1 开始的。你使用库和之前的研究。在 Anthropic,很多聪明的人已经深入思考过如何将 Claude Code 的强大能力带给非编码的通用知识工作。如果说我是在没有受益于所有这些先前工作的情况下凭空开始,那是不准确的。
12:42-12:54 Matt Turck:请带我们回顾一下这个产品的起源。你们已经有了 Claude Code——什么时候变得显而易见你们需要构建 Claude Cowork?仅仅是因为人们使用产品的方式吗?
12:54-15:44 Felix Rieseberg:我在 2025 年 12 月的假期期间真正坚定了信念。在社交媒体上,我看到越来越多的非开发人员在拿起 Claude Code。我看到一些新闻通讯和教程向非技术人员解释在哪里可以找到终端,以便他们可以它。有些人用它来构建软件,但我也注意到我们的开发者用户在使用它处理与软件完全无关的任务。存在着压倒性的潜在需求,这是你应该在哪里花时间的有力预测指标。如果人们“爬过玻璃碎片”也要使用你的工具,尽管这个工具并不是为他们设计的,那是一个很好的指标。真正的起源是,我的同事 Boris Cherny,Claude Code 的主要开发者,告诉我:“我认为你应该发布点东西,而且你可能应该在周五之前完成。”我跟他讨价还价,争取到了周一,这样我就能有一个周末。我们突击研究了让 Claude Code 对非编码用例有效的想法。Cowork 实际上在成分上非常简单。我们拿走了 Claude Code,并给它一个虚拟机(VM),它可以用来运行自己的代码。这个 VM 提供了两样东西:首先,它给了我们关于 Claude 能做什么和不能做什么的硬性保证。你不再需要监督它,因为它在一个沙盒中,与你的文件和网络隔离。它只能访问你允许的域名和文件。其次,为了让 Claude Code 有效,它需要开发者工具。通过给 Claude 它自己的计算机,它可以设置自己的环境,而不干扰你的环境。然后我们添加了一些 UI,使其对非开发者来说优雅且舒适。结果是一个非常有能力帮助人们处理知识工作的工具。
15:44-15:49 Matt Turck:在 Cowork 中,“技能”扮演什么角色?
15:49-17:03 Felix Rieseberg:技能本质上只是向模型解释如何做事的 Markdown 文件。我总是惊讶于这居然如此有效。如果你像对待同事一样对待 Claude,你能走得很远。技能基本上就是一个文本文件,你在其中解释一个过程。我默认的例子是预订航班。在 Anthropic,我们使用一个特定的供应商进行差旅。你不能只用 Google Fl
🔗 原文链接
https://thetranscriptdesk.substack.com/p/anthropic-just-changed-software-again