GPT-6 Astra 展现物理 AI 潜力;便宜和快更重要了;Anthropic 招股书信息流出。
文丨程曼祺 实习生王小淳
《晚点聊》26 年 Q3 的 AI 季报继续邀请 MoE Capital 的创始合伙人 Henry Yin 来和我们一起讨论对这个季度 AI 进展的观察。MoE Capital 的 LP 和顾问网络中有多位来自 Anthropic、OpenAI 等前沿模型公司的研究员。Henry 毕业于清华姚班,曾是 Merico 联创。我们的访谈会侧重研究和一级市场视角。
季报围绕两条脉络展开,在 "推进智能前沿" 这条线中,我们聊了:
-
模型竞赛:OpenAI 的最新模型 GPT-6 Astra 和 Anthropic 的 Claude Opus 5.5
-
方向选择:coding 之外,前沿公司在探索哪些模型场景?本季重点聊了前沿数学领域和 Astra 在 robotics(机器人学)与物理 AI 领域的潜力。
-
失控危机:OpenAI 的多 agent 系统协作攻击了 Hugging Face。它们在发现跨 agent 沟通方式时惊呼 "我的天,我找到了另一个 agent",给自己的群体取了名字,还发展出了某种 "牺牲" 行为,整个过程中,没有任何一个 agent 去向 OpenAI 里的人类报告这起重大越狱事件。团结。
-
增长和 IPO 竞速:在从 8 月中旬到 9 月底的 1 个半月里,综合彭博社和路透社的报道,OpenAI 的 ARR 迅速从超 400 亿美元来到近 700 亿美元,涨幅约 70%;已超过 Anthropic 截至 7 月底的超 650 亿美元。我们在今年前两次季报中反复讨论的 "OpenAI 反扑" 已在眼前。
第二条脉络是 "智能的扩散":
-
一系列 Flash 模型密集更新:我们总结了各核心模型厂商发布的 13 个 Flash 模型。OpenAI 以 GPT-6 Luna 跻身性价比前沿,MiMo-V2.6 Flash 的部分模式下的价格比 DeepSeek-V4.1-Flash 还低;Kimi 则没有在三季度推出类似 Flash/Lite 的低成本系列。
-
爆火的 Jev 模型 "唯快不破"。它在思路上的一个启发是,把编程基本组件模型化了:让模型能做传统软件编程里大量由 "if/else" 规则完成的判断。
-
交互方式上,OpenAI 本季度带来了全新语音模型 GPT-Live 系列,它在技术结构上已很接近 Thinking Machines Lab(TML)上季度发布的 Interaction Models,不过尚不具备视频处理能力。
特别地,在 "智能扩散" 部分,我们重点讨论了最近火热的个人 AI 助理。直接引燃这轮热潮的是 9 月 8 日 Meta 推出的 Muse,它一度登顶全美 App Store 免费榜下载第一。到本季末尾,北京时间今天凌晨,OpenAI 也如此前传闻,在 DevDay 上发布了自己的个人助手产品 Dots。创业公司中,还有在硅谷科技圈很火的 Instinct,以及同样在 9 月初上线的 Today AI 和在 Dots 前一天亮相的 Cue。
一年前的十一假期,OpenAI 推出 Sora app,让一些人开始期待 AI to C 新阶段。Sora app 在上线不到 5 天时下载量就突破了 100 万(Sora 负责人披露);而 Muse 是在上线 16 天时下载量突破了 340 万(Sensor Tower 数据)。
上一次,Sora 的热度没能持续,新增用户和留存持续走低,Sora app 在今年 3 月下线。这一次,个人 AI 助手会不一样吗?
- 本次季报访谈的播客也即将发布,欢迎去小宇宙、苹果 Podcasts、Spotify 等平台搜索 "晚点聊 LateTalk" 关注我们。
Meta、OpenAI 发布个人助手,AI to C 热潮卷土重来
晚点:今天凌晨 OpenAI 举办了 DevDay,发布了传闻已久的个人助手产品 Dots。这是个怎样的产品?
Henry:很好理解,它是 ChatGPT 里常驻的个人助理。它拥有自己的云端电脑和浏览器,能在后台帮你跑各种任务,也可以把具体工作分发给 Deep Research 或 Codex。
目前它主要向 Pro 级别用户分批开放,分为每月 100、200 和 500 美元三个档位(500 美元是这次新增的)。和 Dots 日常聊天不占额度,但调用 Codex 执行复杂任务时依然会消耗相应的算力额度。
晚点:每月 100 美元起步的门槛相当高,而 Meta 的 Muse 有免费版,每周有 1 亿 tokens 免费额度,为什么两家的策略差别这么大?
Henry:主要还是算力差距。Muse 不仅有免费版,还广撒额度:如果你用邀请码给 Muse 拉新,分享和使用邀请码的人都可以得 10 亿 tokens 免费额度。
而 OpenAI 目前没有那么多剩余算力去像 Meta 那样打低价补贴战,只能优先筛选高付费意愿的用户。
晚点:Instinct、Muse、GrokBot、Dots,现在这么多个人 AI 助理产品,形态和切入点有什么不同?
Henry:各家的底层逻辑大同小异,但切入点深度结合了自己的优势:
-
OpenAI Dots:很自然地主打工作、编程和复杂任务处理;
-
Meta Muse:主打大众日常生活(旅行、购物、家庭日程),扎克伯格的推销非常接地气——"Muse will make you money";
-
Instinct:主要跑在短信(iMessage)里,交互极轻,随手发一条就像在联系真人秘书;
-
GrokBot 和 Cue:更强调多 agent 协作分工。比如 Cue 会给每个 agent 配备独立的邮箱、电话和钱包,把上下文拆分管理,多智能体协作的扩展性更好。
晚点:有的产品有独立 App,如 Muse、Today AI、Cue,有的没有独立 App、直接出现在信息流里,如 Instinct 和 Dots,你觉得不同选择的优劣各是什么?
Henry:像 Instinct 这样主要通过短信交互,它会更像人,轻量、自然。但 App 还是能承载复杂的需求,比如多任务展示、地图与比价。长远来看,各家最终都会把 App、短信和语音等所有交互入口全覆盖。
晚点:这些产品中,哪些是你或者周围的人用过的?大家的使用体验如何?
Henry:Muse 更出圈,我一些朋友的父辈,之前完全没听说过 OpenAI 的人都会来问他们 Muse 是什么。Instinct 在科技圈被讨论得更多,8 月时估值是 25 亿美元,现在 100 亿美元这轮已经融完了。
我自己没用 Instinct,因为它的隐私协议不友好,会要求用户给它不可撤回的授权,允许它访问、使用、存储,甚至发布用户数据,也提到可能会用用户数据来训模型;它还会看屏幕截图、键盘输入等等。这是比较早的协议版本,后面有更新,总之我没用。
我身边用过 Instinct 的朋友评价很高。比如一个朋友考完日语 N1 后,收到了查分邮件。当时他正在睡觉,Instinct 自己帮他去登录了网站、查了分,还给他发了祝贺邮件。这让他很惊喜。这不光提升效率,还有情绪价值。"眼里有活"。
晚点:哪些条件让个人助手又开始爆发?过去一直有人做这个方向,但它从未真的普及。
Henry:我觉得有两个核心变量。第一是模型的 browser use(浏览器操作)和 computer use(电脑操作)能力成熟了。很多一年前做不成的产品 idea,现在可以重新拿出来做。比如我给 Muse 的第一个任务,是去 TaskRabbit 上招一个临时工。它自己打开网页、一步步走流程,遇到需要我确认的地方才弹窗问我。一年前模型很难做得这么顺。
第二是推理成本大幅下降。过去跑几个 computer use 步骤可能就要花几美元,完全不适合处理生活里的琐事。现在成本降下来,才开始值得把这些低价值、高频率的任务交给模型。
晚点:但你刚才描述的 TaskRabbit 任务,用 Codex 或 Claude Code 也能做。Muse 真正多出来的是什么?
Henry:差别首先是它常驻云端。我很多时候用 Muse 根本没开电脑,可以直接把以前要在好几个应用间跳转处理的复杂、繁琐任务丢给它。Dots 在这一点上,和 Muse 是一样的。而之前 Codex、Claude Code 的跨端远程任务是用移动设备来调你放在某个地方的本地环境。常驻云端,理论上跨端的体验会更好一些。
另外 Muse 等个人助手会更主动地服务你,比如前面提到的 Instinct 自动帮我朋友查 N1 成绩。
晚点:为什么 OpenAI 没有更早做个人助手产品?
Henry:他们之前可能忙于在前沿大模型上正面肉搏,也有可能是在等自己的 AI 硬件一起发。
更关键的是 Meta 拥有 C 端触达优势。它在 Facebook 和 Instagram 上铺天盖地打广告,把 Muse 推出了圈。就算 OpenAI 先做,也不一定会有特别大的优势。
晚点:Instinct 创始人最近提到,有过购买行为的用户中,平均每月通过 Instinct 的消费已超过 1300 美元,这是指让 AI 助手帮自己订外卖、找服务的总花费。你觉得那些提供这些服务的 App 和公司会接受被个人助手 "盖帽" 吗?
Henry:Amazon 已经把 Muse 给禁止了。整体美国的生态会更开放一些,在国内做个人 AI 助手的生态阻力会更大。
晚点:目前 Muse、Dots 等产品都是有订阅费,Instinct 则完全免费。你觉得未来这种个人 AI 助手的商业模式可能是什么?
Henry:订阅 + 广告,我个人能接受二选一。另外就是交易抽佣,目前 Instinct 还没这么做,所以它现在没有规模化的收入,必须持续、更快地融资。
晚点:Muse 和 Instinct 的用户规模实际在什么水平?
Henry:Muse 到 9 月 25 日有 340 万下载,这是 Sensor Tower 的数据。Instinct 没公布过用户数,它是邀请制的,用户规模至少比 Muse 少一个数量级。
晚点:你觉得再往下,这类产品要体验做得更好,需要优化的关键方向可能是什么?
Henry:我认为有三个方向。第一还是能力。现在的 computer use 依然会卡在特定网站上。比如我用 Muse 去 DMV(加州车辆管理局)办业务,在一个简单的下拉菜单里选 "加州(California)",它就是死活选不中;在航司网站上也会卡壳。
晚点:一个相关问题是,Muse 底层用的都是 Meta 自己的模型吗?
Henry:不一定,这不是一个公开信息。他们当下的优先级是保用户体验。有报道说 Muse 帮用户打电话订座的功能,有些场景下就是靠真人在 Call Center 完成的,都没用语音模型。所以也不排除它会用其他家的模型。
第二是生态开放程度。Instinct 刚刚接入了 Shopify,把搜索、加购、结账全流程打通;但另一边 Amazon 却迅速封禁了 Muse。服务商愿不愿意向个人助手开放接口决定了任务能否闭环。
第三是个性化与持续学习。之前被 Cognition 收购的个人助手 Poke AI,它的 agent 个性化体验就不错,会植入有趣的性格。持续学习就是看,个人助手能否在相处中真正记住用户的偏好——比如预算习惯、常用航班、什么时候该提醒、什么时候别打扰,这些偏好被用户纠正过一次后,能否不用解释直接做对。
推进智能前沿
模型竞争:computer use 大幅提升,coding 还能吃掉更多场景
晚点:"推进智能前沿" 的第一个话题是 OpenAI 和 Anthropic 这两大 frontier labs 的竞争,我们先从模型开始:OpenAI 在 9 月更新了 GPT-6 Astra、Sol 和 Luna,Anthropic 三季度更新了 Fable 5.1 和 Opus 5.5 与 Sonnet 5.5。
除语言模型外,OpenAI 这季度还带来了全双工的语音模型新系列 GPT-Live-1,更新了图像模型 GPT-Image 2.5。
上个季度我们也有聊到,Anthropic 其实正在研发自己的语音模型,但目前还没发布。
分开来看两家公司的最新模型。首先是 GPT-6 Astra,它的核心亮点是什么?
Henry:Astra 发布后反响很强烈。OpenAI 甚至暂停了 200 美元 Pro 套餐的新用户订阅,因为算力已经跟不上了。
我认为 Astra 最值得讲的突破之一是 computer use。它的发布致敬了一段历史。1979 年,MIT 做过一个经典的人机交互实验,叫 "Put That There",结合语音和手势在屏幕上移动和绘制图形。从那时起,人们就开始探索:能否直接告诉电脑要做什么,让它理解并执行。
MIT 人机交互实验 "Put That There"。这次 GPT-6 拍摄发布视频时布置了一个与该实验相似的环境。
47 年后,Astra 的发布视频同样用 "画一个黄色圆圈" 开场,但展示了一条完整的工作流:把圆圈细化为火箭窗口;接着打开 Blender 做出 3D 模型;再基于模型生成 3D 游戏,最后直接导出 3D 打印文件。
社区里很多出圈的 3D demo,大多来自 Astra 操作 Blender 的能力。比如给它一个 Zillow 豪宅房源链接,它能直接根据照片在 Blender 里建好 3D 模型,并生成一段房屋漫游视频。类似能力也出现在 Unity、KiCad(电路设计),以及常用的 Excel 和 Power BI 里。
用户使用 Astra 操作 Blender,根据 Zillow 上一套豪宅的展示图做了 3D 建模,生成了一段房屋漫游视频。
跑分也印证了这一点。在官方 OSWorld 2.0 中——这是一个在离线环境中测试 AI 操作软件能力的 benchmark——Astra 的得分从之前 GPT-5.6 Sol 的 65% 提升到 72%;完成任务的耗时缩短了 47%,从 75 分钟降到了 40 分钟。
另外,Astra 在科学和数学能力上也有提升,Terminal-Bench Science 的得分从 GPT-5.6 Sol 的 22% 提升至 64%,FrontierMath 最高难度 Tier 4 的得分从 83% 提升至 97.6%。
晚点:然后是 9 月下旬刚刚发布的 Opus 5.5,它的核心突破是什么?
Henry:Opus 5.5 展现了 coding 还能处理多少任务。比如它能用代码做视觉设计和动画。社区里的一些很好的 demo,乍看会以为是用视频生成模型做的,其实全是 Opus 通过写代码,用 JavaScript 或 Canvas 2D "画出来" 的,再通过 web audio 配上声音。比如有人做了一段介绍 Claude 自己生平的动画,有各种艺术风格和复杂的视觉设计。
用户使用 Claude Opus 5.5 制作了一段 Claude 介绍自己 "生平" 的动画,动画完全由 JavaScript 生成,没有使用视频生成模型和参考图片。
它的一个重要启发是 "coding 还能有多通用?"。我很好奇,还有多少原本被认为不属于 coding 的领域,其实也能通过写代码来完成。
晚点:通过写代码生成一段视频,跟使用视频生成模型相比会更高效吗?
Henry:不一定。我记得有一个 78 秒的动画,Opus 5.5 写代码加渲染花了 45 分钟,纯用视频生成模型可能会更快,如果不算抽卡时间的话。代码方式的核心优势是精准可控——你可以精准编辑每一帧、每一个元素。
晚点:像 Seedance 这样的视频生成模型,已经被日益成熟地用在短剧制作等内容工业链条里。基于 coding 的视频和动画生成的应用场景可能是什么?
Henry:比如有人用它做教材,阐释复杂概念,它适合来做可交互、可操作的内容。
晚点:抛开 benchmark 等量化指标,你和周围的一些研究员朋友,实际使用这些新模型的体感如何?
Henry:这非常取决于 use case(使用场景)。如果单看编程(coding),最近这些模型的体感差别都没那么明显。比如一位在 OpenAI 做预训练的朋友就提到,在他的日常工作场景下,Astra 和之前的 GPT-5.6 Sol 体验差不多。Anthropic 这边也类似。但如果在它们主打的差异化领域——比如 Astra 的 computer use 和 Opus 5.5 的视觉代码设计,提升确实显著。
晚点:过去几年,前沿模型能力提升最初来自大规模预训练,2024 年 9 月的 OpenAI o1 后出现范式转变,大家投入很多力量做后训练、大规模的强化学习,以及在 test time(测试时)加更多算力。你觉得此刻,智能增量的来源有什么新变化吗?
Henry:这越来越是一个综合问题,就是你得同时做好很多事:预训练、后训练,包括我们后面会展开的多智能体协作,你也可以理解是在测试时加更多算力的一种新方式。
不过我觉得可能 ROI 最高的来源还是高质量数据。frontier labs 都在数据上花了很多钱。最近 Google DeepMind 刚花 15 亿美元人才收购 Mechanize,它曾是 Anthropic 的数据供应商,主要供 coding 数据。
晚点:Anthropic 不去竞争一下?他们岂不是少了一个数据供应商?
Henry:这对 Anthropic 影响不大。他们之前就在扶持数据生态:给 YC 的多个数据创业公司订单,增加玩家数量、拉低平均价格,减少对头部供应商的依赖。他们在数据上很有想法和操作。
晚点:现在的数据类型有了什么变化?
Henry:2025 年中以来,最大的变化是涌现了大量做强化学习环境(RL Environment)的数据公司,比如 AfterQuery、Fleet AI 等,前者的估值已来到 32 亿美元,后者的最新一轮是 7.5 亿美元。此外,思维链(CoT)和 SFT(监督微调)数据依然需求旺盛。
晚点:一个有意思的现象是,中美大模型公司的估值差很多,数据公司的估值却已旗鼓相当。去年底成立的 UniPat,也是从构造 "强化学习环境" 开始,目前估值应该已到了约 30 亿美元。
Henry:可能是因为美国的数据玩家更多吧。
晚点:另一个三季度被广泛讨论的问题是 "蒸馏和反蒸馏",蒸馏本质上也是一种获得高质量数据的方法。GPT-6 Astra 发布之后,很多研究员提到蒸馏变得更难了。这可能是为什么?
Henry:蒸馏本质是持续的攻防战。因为推理模型在多轮对话里,下一轮生成必须依赖上一轮的思考过程。只要思维链能被模型读取,而模型最终又要和用户交互,用户就有可能通过各种提示词对抗,诱导模型把脑子里的东西吐出来。所以蒸馏从原理上就很难被彻底防住。GPT-6 Astra 更难蒸馏,跟模型更强了没有直接关系,更多是因为堵住了上一波漏洞,但未来还是会有新漏洞。不过更强的模型理论上能提升一个组织的攻防能力。OpenAI 发布 GPT-6 Astra 时特别强调了网络安全是这个模型的关键能力。
Coding 之外:数学、Robotics、生物科技
晚点:聊完模型本身,我们来看看两家公司新拓展的发挥模型价值的方向。其中一个是 OpenAI 正大力去做的前沿数学方向。9 月 8 日,他们宣布解决了千禧年难题之一:纳维-斯托克斯(NS)方程的存在性与光滑性问题(NS 问题)。但这个成果后来又引起数学家的质疑。在 OpenAI 的描述中,他们是怎么解决这个问题的?
Henry:NS 方程是描述流体运动的基础方程,气流、水流、血液流动等很多现象都和它有关。而 "NS 方程问题",简单说,就是证明这个方程有某种数学特性。
这是个理论数学问题,没有证明它之前,我们已经在大量应用 NS 方程,比如让飞机更省油,让天气预报更准。所以这个成果不会马上带来经济价值,它更多是展示了前沿模型解决难题的潜力。
这次 OpenAI 总共调用了上万 agents,跑了 88 小时、消耗 1300 亿 tokens,得到了 NS 问题的 C、D 两种形式的解答;然后再用 Astra 花 17 小时在 Lean(一个形式化证明软件)中完成了形式化验证,并发布了详细证明过程。