Greg Brockman 谈 Astra 与 OpenAI 的下一步:纳维-斯托克斯是能力坐标,计算机使用跨过阈值,聊天与代理两种形态走向合并(TBPN,2026-09-08)
嘉宾为 OpenAI 联合创始人、总裁 Greg Brockman,访谈录于 OpenAI 宣布其内部模型解决纳维-斯托克斯存在性与光滑性问题的当天(美东 9 月 8 日周二),全长 24 分钟,是本轮发布潮里 OpenAI 高层篇幅较长的一次对外表态。本期值得读的原因有三:他把千禧年难题定位为“能力坐标”,其分量重于科研成果本身,并给出了从数学到药物研发的推演路径;他用“计算机使用跨过阈值”来解释 Astra 上线后 Blender 建模刷屏的现象,并将其与两年前 Operator 的失败放进同一条产品谱系;他第一次比较完整地讲了 ChatGPT 的聊天与代理两种使用模式如何并存、如何合并,以及健康业务的三支柱结构。全片观点为嘉宾本人陈述,涉及的用户数(周活“远超十亿”、健康查询周活三亿、曾试用者十亿至十五亿)均为口播、无出处;纳维-斯托克斯的算力投入、代理规模等细节他在访谈中并未披露,本文据 WSJ 同日报道补充,已单独标注。
一、纳维-斯托克斯:结果是新知识,更重要的是它代表模型能力到了哪一格
开场主持人请他“摆桌”。他的表述是模型“解决了纳维-斯托克斯问题”,具体形态是找到了一个反例,或者说一个证明,表明这组理论方程在特定条件下确实会出现奇点、会失效。这是七个千禧年难题之一,悬置时间很长。他给结果本身的评价分两层:其一,“这是人类的新知识”,证明“非常优雅、漂亮”,方程在流体力学等领域应用广泛;其二,也是他反复强调的一层,“对我来说更重要的是这代表了我们在模型能力上处于什么位置,以及我们确实能生成可以从中学习的新知识”,让模型帮助解决原本够不着、或者要花很长时间才能解决的问题。
主持人的追问带着明显的怀疑:这会帮我订机票吗、会治愈癌症吗、还是只是帮你招到对这类东西着迷的研究员?他判断这件事不会出现在“与科技圈隔了三层的亲友后院烧烤”的话题里。Brockman 的回答分两段:方程本身的应用覆盖从洋流到飞机周围气流、湍流等现象;但真正的意义在于“更广泛的洞见与方法”能帮科学家与数学家加速研究,“如果我们有了能解决这类问题的模型,那么接下来会发生什么、还有哪些问题是可以立刻着手的”。他把治愈疾病、开发新药归入“当模型到了这种辅助水平时开始变得真实得多”的范畴,并称我们现在可以对能够着手的挑战抱有大得多的野心。
据 WSJ 同日报道补充(嘉宾访谈中未提及):证明长 165 页并附逐步形式化验证;完成证明的是一个未发布的内部模型,OpenAI 称其“显著强于”上周刚发布的 GPT-6 Astra,在公司自建的数学题库上 Astra 约解出一成、该模型接近五成;模型自 8 月下旬开始训练,9 月 1 日被同时投向六个未解难题,50 小时后人工把算力集中到纳维-斯托克斯一题,代理数量从 100 扩到最多约一万个,共发送 270 万条消息、消耗 1300 亿输出 token,耗时约 88 小时、算力成本“数百万美元”;结果未在发表前交外部数学家审阅,发布前数小时有包括 Anthropic 研究员在内的竞争对手对 OpenAI 的叙事提出异议。这些数字说明访谈里“模型解决了”一句背后是万级代理的协作搜索,与单个模型推理是两种口径,评估“能力到了哪一格”时应当把算力投入一并计入(作者归纳)。
二、Astra 与“计算机使用的新阈值”:从 Blender 建模到淋浴排水口的毛发过滤器
对 Astra 发布后的反馈,他说“被社区的反应震住了”,用词是“非常谦卑”。他的核心判断是“很清楚,我们已经到达了计算机使用的一个新阈值”:这个模型能以此前不可能的方式与各种应用程序协作,人们正在充分利用这一点去创造。主持人补充的现象是整个周末科技圈都在谈 Blender,很多人“把自己的房子在 Blender 里重建了一遍并规划了装修”。他列举的用例包括大量 3D 创作、把实体地点映射成 3D 模型、设计实体零件,其中一个用户设计了淋浴排水口的毛发拦截机构并真的把它制造了出来。主持人戏称这是“淋浴毛发超级智能”,他接住了这个梗:宏大挑战和冷僻应用固然常被谈论,“但真正重要的是你生活里那些你很想解决的日常问题,现在都可能了”,目标是赋能个人、让人拥有“超能力”。
主持人接着问的是合并问题:Codex、ChatGPT Work、桌面版 ChatGPT,加上他自己装了英伟达显卡的游戏 PC 和 Mac Mini,眼下的“解锁”工作是早期用户自娱自乐,未来会不会都收进一个提示框里。Brockman 的方向性回答是要把工具从“需要底层接入或指引”转向“让人真正能飞起来”:人设定目标,仍然可以下到细节、提供监督,“最终你应该对结果负责”,但手里有一个绝对的放大器,“蹦床,或者说思维的火箭”。他明确说,Blender 一类工具在引擎盖下被调用、作为细节隐入背景,“绝对是行进方向”。
背景补充:GPT-6 Astra 于 9 月 3 日先向 Daybreak 计划的企业测试者开放,付费 ChatGPT 用户拿到的是加了网络安全护栏的版本;Brockman 在当天简报会上称该模型未来会被视为通用人工智能的早期阶段,并说“留给读者自己判断这是否够格”(据 Bloomberg)。此前 9 月 1 日 OpenAI 公告内部测试认定 Astra 能在有限人工输入下设计并执行新型网络攻击,因此限制公开版本的网络能力、只向少数测试者开放完整版(据 WSJ)。本次访谈全程未触及网络安全这条线,安全只出现在一句“我们在安全地开发这些东西,这是我们的核心承诺之一”(作者注)。
三、聊天与代理两种模式:聊天“活得很好”,代理采用是“近乎垂直的墙”,两者是一个时点现象
这是本期信息密度较高的一段。他给出的结构是:今年以来使用形态明显从纯聊天转向代理,但“聊天活得很好”,ChatGPT 周活“现在远超十亿”,市场份额“又开始爬升”,原因是公司在教育、健康等大量重要用例上持续投入;与此同时,生产力与深度知识工作类用例“真正起飞”,“自从推出 ChatGPT Work 以来,我们看到的是一堵近乎垂直的代理采用之墙”。他强调两种模式并存只是“一个时点”,公司正在持续把它们统一、合并,一种新的 AI 消费形态正在浮现。
他对这个形态的描述回到了“AI 的承诺”:一个你可以对话、可以把工作委托出去、主动且持久的东西。“如果倒回五年、十年,我们被许诺的从来不是一个底层语言模型,你得考虑上下文窗口、得选思考强度、得在不同模型之间挑。这些都不是未来。”方向是“真正的放大、真正把时间还给你、真正让计算机按你的目标和意愿运转”。
背景补充:ChatGPT Work 于 7 月 9 日发布,基于 GPT-5.6,定位是连续数小时处理文档、表格、演示与网页应用;7 月 21 日 OpenAI 披露 Codex 与 ChatGPT Work 两款代理产品合计用户达一千万,较月初接近翻倍,同期 ChatGPT 周活为“超过九亿”(均据 Bloomberg)。对照本次口播的“远超十亿”,周活口径在七周内跨过了十亿,但他没有给出代理产品的最新用户数,“垂直的墙”缺少数字支撑,是本期需要等待后续披露来验证的一处(作者归纳)。“市场份额又开始爬升”同样为口播,未说明份额口径与来源。
四、发现问题与先发者劣势:两个文本框太混乱,模型应当主动告诉你它还能做什么
主持人提出一个策略层面的问题:AI 行业存在某种“先发者劣势”,几十亿人试过 ChatGPT,其中相当比例在早期形成了固定印象;而最近几周新的代理产品上线,用户一试就“被彻底震住”,先发者需要不断提醒市场有哪些新用法。他自己的例子是跑着一个持久代理,每次 SpaceX 发射或延期都会通知他。Brockman 承认这是“能力过剩”下的发现问题,“我们作为一个领域需要以第一优先级面对它,我们还没有完全做到,但我认为我们有机会比以往任何产品都解决得更好”。
他的自我批评相当直接:ChatGPT 和 ChatGPT Work 现在都是文本框,“新的文本框比旧的强得多,可有些原因让你仍然想用旧的”,“这太混乱了,人们只是想要一个能帮他们解决问题的东西,全部意义在于把时间拿回来,你不该被迫成为所有内部细节的专家”。解法在于模型已经理解你要做什么、掌握大量关于你的上下文,因此应当能够主动说“如果你换个问法、加上这个连接器、授权我做这件事、这样接入你的凭证,我就能替你做另一件事”,公司正在大量投入这种“自我认知”与引导流程。他把先发者劣势与优势并列:印象固化是劣势,但周活超十亿是“没有任何人在这些模型上拥有的使用量”,此外“大约还有十亿到十五亿人以前试过 ChatGPT”,这是可以回头告诉他们“现在能解决你的问题了”的存量。
营销一段由主持人发起:人人想做“AI 界的苹果”,想到的是 1984 广告与 Mac 对 PC,但苹果真正做得好的是反复敲打非常具体的产品细节,新相机、Memoji、Safari 里的某个功能;AI 需要传达的表面积“大一个数量级”,Astra 的发布视频很棒,但应当有广告牌列出 ChatGPT 能替你省时间的具体事项。Brockman 说这是他今年“真正意识到的一件事”:刚发布的 ChatGPT Images 2.5 的发布视频展示了一个人画烛台草图、生成多个变体、选中一个、最后出现实物烛台,“那就是你想要的,它立刻对你说话”。他补充了一条反直觉的经验:公司有时展示冷僻用例,对某个特定的人很惊艳,但人们不会由此推出“既然它这么强,我也能做我一直等着的那件事”,这种联想比他以为的难得多。他要的是让人说“我现在就想要那个东西”的用例,再从那里开始探索。主持人给的旁证是他一个做房地产开发的朋友整天用 ChatGPT 写交易备忘录,却总来问他“ChatGPT 能不能做这个”,而他手里明明有一个会解释自己能做什么的东西。
五、图像是能力包的一部分:质量阈值之上才出现新应用,图像、语音、编码要合成一个整体
主持人说 Images 2 发布时他一度觉得“图像已经解决了”,周六花几个小时设计家具、跑了几百个提示词,问图像模型还能走多远。Brockman 的回答是他反复用的“阈值”框架:每跨过一个新的能力阈值,“根本上全新的应用会以你事先几乎想不到的方式被解锁”。在知识工作、专业工作、营销等领域,你只需要高于一个质量阈值,低于它就只是“很酷的概念,但最终材料没法用,问题没有真正解决”;跨过之后,精确的编辑控制、速度、创造力、结果的多样性以及与人的往复互动,会打开整块新用例。他举的例子是幻灯片制作与网站搭建,“在中间拥有图像生成能力,是 OpenAI 相对于部分竞争对手非常独特的地方”,下游能产出好得多的成品。这一比较为其一家之言,访谈未与竞品能力逐项对照。他的总结是把图像、语音、编码“视为一个包”,合成一个赋能个人的 AI,“你能创造任何你想象的东西”。
六、健康三支柱:消费者、临床医生、医院企业端,合力后才能碰“把医疗带进 AI 时代”
他把健康业务拆成三边。消费者侧:每周三亿人带着健康问题来用 ChatGPT(口播)。临床医生侧:自下而上,是一个为临床医生调校过的 ChatGPT,直接给出医学文献引用。企业侧:直接卖给医院、由医院开通,已有嵌入 Epic 系统的集成。三个支柱各自先做到尽可能好的服务,形成动能之后会出现协同,届时“真正改造美国乃至全球医疗”才会摆上桌面。他列的协同点有两个:一是患者作为信息搬运工的负担,看不同专科要自己带着病历、反复解释问题,“最终你是那个必须做决定的医生,不管你愿不愿意”,所有人在一个平台上时信息共享才可能;二是临床试验入组,这是药物开发的巨大瓶颈,找到符合条件且能受益的人依赖这类数据,前提是人们愿意托付信息。他把公司的目标定为建成医疗领域的头部平台,并称已经在“非常具体的方式”里看到效果,他喜欢的用户故事是“从 ChatGPT 得到的信息帮我救了自己或亲人”,医生说了一件事、用户能复核并提出异议,最后得到好结果,“这每天都在发生”。
主持人把记忆功能与健康连在一起:ChatGPT 的记忆已经能在新线程里主动带出三周前的相关信息,用在健康上可能识别出人类要花数年才发现的模式。Brockman 用自己家的经历作答:他的妻子公开谈过自己的病情,那是一段五年的历程,看了许多专科医生,每位医生“摸的是大象的一部分”、只处理那一部分,直到过敏科医生说所有症状是相连的,是一种影响全部子系统的遗传病。他说很难估计有多少人有类似情况却永远查不出来,功能上高度专科化的体系永远拼不出完整诊断,而一个既深度参与你生活各方面、又是全部医学领域的领域专家的 AI,正是能补上这一环的东西。
七、Operator 的谱系:低于阈值的产品失败了,团队“烧掉一长串问题”后计算机使用被解决
收尾问题是如何讲 Operator 的故事:它看起来像失败或支线任务,但在计算机使用的进展之下又显得极其重要。他的框架是“时机”与“迭代部署”:总有一个阶段能力还不到位,但从真实世界部署里学习非常有帮助。他对 Operator 的定性毫不回避:它是一个基于云的计算机使用系统,慢、不够准确、“用起来相当痛苦”,有些人得到了价值,但整体在阈值之下。今年团队“真正建立起动能”,公司“投入大量精力去烧掉一长串问题”,聚焦解决计算机使用,交付了显著成果,“永远没有做完,但这是一个真正的里程碑”。他的对照是过去代理通过连接器、通过“极其费力地手工编码的系统”使用计算机,与人类的用法完全不同,而人类已经能用计算机上的一切,因为一切都是为人设计的;从 OpenAI 成立之初就有一个梦想,有一天能造出以这种方式操作的 AI,“我认为在 Astra 上我们做到了”。
主持人的观察是 Astra 像是多条押注在同一时点汇合,模型本身、计算机使用、语音;去年 OpenAI 像一家大公司在运营,产品实验的心态类似超大规模云厂商“有 20% 甚至 5% 的命中率就行”,今年整家公司“切回了创业公司模式”,聚焦、所有人朝一个方向划桨,动能与增长的差别由此而来,“把一家公司从像大公司那样运营和发布,拉回像创业公司那样发布和聚焦,感觉是不可能的任务”。Brockman 的回应只有“聚焦”二字,加上“每一件事都应当加总起来帮助我们完成使命”。
八、研报视角的读法与验证点(作者归纳)
第一,能力梯度的坐标已经错位。访谈里“模型解决了纳维-斯托克斯”与 WSJ 披露的“未发布模型远强于上周刚发布的 Astra”放在一起,说明 OpenAI 对外发布的产品与内部能力之间留有一个代际,Astra 在自建数学题库上约一成的解题率是可以被后续披露验证的锚点。评估这条线时应当区分单模型推理与万级代理协作搜索两种口径,后者的算力成本本身就是一个可比指标。
第二,代理采用的“垂直之墙”需要数字。7 月 21 日的一千万代理用户是已知的上一个刻度,本期没有更新,下一次官方披露的 Codex 与 ChatGPT Work 用户数是检验这句话的直接方式;“市场份额又开始爬升”同样待第三方流量数据核对。
第三,“计算机使用跨过阈值”与连接器生态是两条路线的竞争。Brockman 明确把连接器路线称为“极其费力的手工编码系统”,把 GUI 直接操作视为终局。这对依赖 API 集成的 SaaS 与代理工具链意味着什么,眼下只有周末 Blender 刷屏这一类定性证据,可观察的验证点是 Astra 计算机使用在企业侧的付费落地与错误率披露。
第四,健康三支柱里企业端与临床试验入组是商业化的关键路径。消费者侧三亿周活是免费流量,临床医生侧与医院侧(Epic 集成)才是收入与数据托管的入口,临床试验入组一旦成型会直接触及药企的成本结构,这是下一步值得跟踪的合作公告。
第五,与 Anish Acharya 9 月 6 日在 Lenny's Podcast 的说法对读。Acharya 认为“太危险不能发布”的说法混淆了营销、推理算力与竞争考量,而 OpenAI 在 Astra 上做的正是同类限制(限制公开版网络能力、完整版只给少数测试者)。Brockman 本期对此只字未提,只留了一句“安全地开发”的承诺,两期放在一起读能看到实验室对外叙事与投资人怀疑之间的距离。
(口径提示:本文基于 YouTube 自动字幕整理,字幕中 ChatGPT 多处被识别为“chat GBT”“Chach BT”,已按上下文还原;“ChatGPT Images 2.5”“Codex”“Operator”“Epic”按字幕与公开产品名还原。周活“远超十亿”、健康查询“每周三亿人”、曾试用者“十亿到十五亿”均为嘉宾口播且无出处;纳维-斯托克斯证明的页数、代理数量、耗时、token 与算力成本、Astra 与未发布模型的解题率对比,均引自 WSJ 2026-09-09 报道,嘉宾访谈中未提及;GPT-6 Astra 发布节奏、网络安全限制与 ChatGPT Work 用户数引自 Bloomberg 与 WSJ 报道,日期以美东为准。)