← 返回AI 应用主题跟踪

Computer Use的速度进展、技术路径与OpenAI新一代开发者接口——OpenAI Computer Use负责人Ari Weinstein、API团队Nikunj Handa访谈要点梳理(Latent Space,2026-09-30)

Latent Space,40 分钟 · 2026-09-30

——据Latent Space节目《OpenAI’s Computer Use Is Now Faster Than Humans — Ari Weinstein & Nikunj Handa》(2026-09-30)整理

摘要:本文对Latent Space在OpenAI DevDay之后对谈OpenAI Computer Use产品与工程负责人Ari Weinstein、API团队产品负责人Nikunj Handa一期节目的主要观点进行了梳理汇总。梳理了DevDay上与Computer Use相关的发布内容、Computer Use近一年的能力进展与技术路径,介绍了异步工具调用、UltraFast推理、Decisions API等新接口能力,最后阐述了提示缓存、上下文压缩与平台高层抽象的方向。据Weinstein介绍,GPT-6.1 Sol的成本为Astra的五分之一,在Computer Use场景下为七分之一;其本人一项耗时2小时的订餐任务由Computer Use在15分钟内完成。据Handa介绍,推理团队的效率优化使Luna价格下调约80%;提示缓存目前提供30分钟内的命中保证,12小时的缓存保证处于预览阶段。

关键词:个人代理;编程代理;推理成本;代理安全;研发效率;OpenAI;Agents API;Decisions API

一、DevDay发布内容与Dots的云端计算机

节目录制于OpenAI DevDay主题演讲结束之后,Weinstein首先介绍了与Computer Use相关的发布内容以及Dots的产品形态。

(一)与Computer Use相关的发布

据Weinstein介绍,此次发布中与Computer Use相关的内容主要有四项:一是Dots,即新的个人助理产品,具备若干Computer Use功能;二是新模型GPT-6.1 Sol,其成本为Astra的五分之一,在Computer Use场景下为七分之一,在成本与速度上尤其适合Computer Use;三是Agents API纳入Computer Use,开发者可以基于Codex与ChatGPT所用的同一套Computer Use进行开发;四是现有功能的演示,包括App Shots以及Mac上的原生Computer Use,演示中Computer Use自动为应用截图,用户可同时在电脑上处理其他事务。

此外还有Decisions API。Weinstein表示,Decisions API并行生成、不启用思考环节、模型规模小于Computer Use所用模型,因而速度很快,但在长程复杂任务上能力相对较弱;如何把两类做法结合起来仍是有待研究的问题。

(二)Dots的独立云端计算机与用例

Weinstein表示,每个Dot都拥有一台位于云端的独立Linux虚拟计算机。与此前产品相比,一是此前的产品通常使用云端浏览器,或直接操作用户本人的电脑;二是Dot可以运行完整的桌面应用,也可以使用浏览器。他认为,Computer Use的价值在于通用性:全球软件均为人设计,代理如今可以使用同样的软件,人在电脑上能做的事情都可以交给Dot办理。至于哪些用例更有价值,他认为取决于用户本人,建议从“自己把时间花在哪里、哪些可以委托给代理”入手。

用例方面,一是Weinstein本人订阅了一项可按克数定制食材的备餐服务,自行下单一次需耗时2小时,交由Computer Use后15分钟完成,速度约为其本人的8倍,所用模型为GPT-6.1 Sol;二是据其介绍,OpenAI开发者体验团队大量将Computer Use用于YouTube,主持人指出YouTube的A/B测试、社区帖子等功能未开放接口;三是主持人提到的客服沟通、机票预订与购物等日常事务。

二、Computer Use的能力进展与技术路径

Weinstein认为,与数月前相比,Computer Use已发生“180度”的变化,进展同时来自模型与运行框架两端。

(一)近一年的主要变化

Weinstein此前任职于Apple,其后创办Sky,后加入OpenAI。他表示,自己一直关注自动化,希望帮助人们把时间从繁琐的电脑操作中节省出来。据其介绍,Sky时期即在做Computer Use,当时模型能力有限;近一年来模型在Computer Use上的能力大幅提升。

他认为变化主要体现在三个方面:一是纠错能力,此前模型能够可靠地启动任务,但随后会遇到各种问题,目前模型善于调试、重试并检视哪些做法有效;二是以代码执行操作,在Codex中展开工具调用可以看到,Computer Use往往编写JavaScript代码交由计算机执行,一次完成多个动作,速度与能力均有提升;三是接口更为多样,模型可根据任务选用截图、可访问性接口或Playwright等不同机制。

至于DevDay前后的差别,他表示团队持续改进,单日之差的意义有限,过去一两个月的累积变化更值得关注,Dots中的Computer Use与新模型是其中令人期待的部分。

(二)多模态接口与App Shots

Weinstein表示,引入更多模态是较为关键的进展。过去的Computer Use产品要在滚动页面上花费大量时间:截图、尝试操作、向下滚动、再截图,如此往复。借助可访问性接口以及对文档对象模型(DOM)的直接访问,语言模型可以一次看到整个页面或整个应用,并编写代码一次完成多个步骤。他同时指出,相当一部分提速来自对大量细小问题的逐项排查。

App Shots是这一思路的体现。据其介绍,一是用户连按两次Command键,即可把当前应用中的内容带入Codex或ChatGPT;二是点开附件可以看到原始文本与原始的可访问性表示,团队在完整导出信息的同时做了大量工作以节省token;三是与普通截图相比信息更完整,网页截图不包含链接指向何处,日历截图中的日程标题可能被截断,App Shots则向模型提供完整的上下文。他表示,为有无障碍需求的用户设计的读屏技术,同样有助于大模型使用计算机。

(三)评测方式与成本表现

据Weinstein介绍,OpenAI内部以多种方式衡量Computer Use,其中一部分针对运行框架的不同组合与配置;线上产品带有更多安全检查,且按任务需要作不同配置,情况较为复杂。他表示,无论采用何种衡量方式,结果都显示出较为一致的提升,提升有时来自运行框架、有时来自模型。他特别提到,GPT-6.1 Sol在Computer Use上的成本优势,超过其相对Astra的基准成本降幅。

三、速度前沿、开发者接入与编程闭环

Weinstein介绍了Computer Use在速度上的下一阶段目标、开发者接入Agents API的考虑以及在软件开发中的用法。

(一)从快于普通用户到超越熟练用户

Weinstein表示,经过过去几个月的工作,Computer Use完成任务的速度在多数情况下大概已快于普通人。他认为下一阶段的目标是达到“超人”水平,即操作软件的速度与熟练的电脑用户相当或更快。其意义有两点:一是可以构建实时性更强的产品;二是使用门槛降低后,人们会把一些习惯手动完成的事情默认交给代理,从而节省大量时间。

关于瓶颈,他表示模型、推理、运行框架与界面表示各层面都有待解决的问题。随着Computer Use提速,单步操作本身的耗时日益成为约束:在基准任务中,相当一部分时间用于等待目标网站加载,如在DoorDash网站上自动完成任务时即是如此。据其介绍,页面加载完成与触发模型下一步动作之间的延迟应尽量压缩;浏览器的页面加载可以采用事件驱动方式处理,另一些事件则无法以事件驱动方式处理,复杂度较高。

(二)Agents API接入与信任建设

主持人表示,三四年前业界对把大模型接入网络与个人设备尚存顾虑,目前他已让Computer Use代为配置DNS、支付账单,涉及金额达数万美元。

Weinstein表示,许多开发者的应用需要与第三方网站和服务协同,Computer Use具有通用性,Agents API使开发者可以使用与OpenAI自有产品相同的实现。他认为自建Computer Use运行框架有其价值,但难度较大;OpenAI的模型是在自家运行框架上训练的,使用与训练分布一致的框架可能在速度、成本与准确率上具有优势。

在信任方面,他认为人们仍处于逐步适应并信任这项技术的过程中,开发者有责任逐步建立信任,做法包括:一是确保产品可靠;二是设置适当的安全检查;三是在付款等后果较重的操作之前征得用户同意;四是视应用情况,只允许代理访问完成任务所必需的网站或应用。

(三)软件开发与测试闭环

Weinstein表示,他个人较为看重、实际中也较为常见的一类用法,是由Computer Use测试代理自己编写的软件。以往Codex完成开发后须由人来测试,人实际上成了代理的质检员;有了Computer Use,代理既能开发也能测试,软件开发生命周期得以闭合,交到用户手中时软件已可运行。他本人在开发Computer Use时,即让一个Computer Use代理去操作另一个Computer Use代理。

主持人补充了两种用法:一是其自行开发的可视化试玩技能,可以发现只看代码难以察觉的设计问题;二是复刻应用,由Computer Use逐屏操作、截图并记录,再交由Codex重建。

四、GPT-6系列的接口能力与Decisions API

Handa负责API团队的产品工作,加入OpenAI约3年。据其介绍,每一代新模型发布时,API团队都与后训练团队、研究团队密切配合,梳理模型的新能力并在API中开放。

(一)异步工具调用、中途引导与UltraFast推理

据Handa介绍,随GPT-6开放的新能力主要包括:一是异步函数调用,在Codex、Dots等产品中工具调用耗时较长,模型发起调用后可继续推理,稍后再回头查看结果,无须暂停等待;二是中途引导,即在模型推理过程中注入消息,例如在工具调用完成时补充指令。他表示,API团队的原则是待某项能力在运行框架中训练成熟后再放入API;上述能力多由数月前推出的WebSocket支撑,后者打开了与模型的双向通信。

关于UltraFast推理,Handa表示,推理团队持续运行Codex代理来挖掘Astra的性能:此前数月的重点是效率与降本,Luna价格因此下调约80%;目前重点转向尽可能提高运行速度。他表示,WebSocket起初是为GPT-5.3 Codex Spark推出的,其作用在于降低工具往返调用的开销。

(二)Decisions API的由来与实现

据Handa介绍,Decisions API受外部同类产品启发,该产品发布后,用户纷纷询问,内部团队也提出需要速度快得多的分类系统。来自推理团队与基础设施团队的工程师动手做出原型并验证可行,整个项目大约一周前才开始;目前团队正持续压低时延,一旦达到时延目标,将在数日内发布。他认为这体现了OpenAI的“黑客文化”。

实现方式上,他表示这一版本没有训练新模型,完全建立在现有Luna权重之上:一是约束输出,结构化输出是其中的重要部分;二是优化推理栈以压低时延;三是多个问题作为一个批次并行运行;四是由于基于Luna,自然具备视觉能力。他表示,这是OpenAI一贯的迭代式部署做法,先推出首个版本、观察反馈,再视需要改进模型。对于节目中提到的置信度与校准问题,他认为这可能是需要在后续模型版本中继续提升的重点领域。

(三)适用场景与局限

Handa表示,目前看到的主要用例是高速分类,此外有三类场景:一是Computer Use,由Astra编写JavaScript脚本控制计算机与由Luna逐次选择单个动作相比,后者达不到同等智能水平,但对部分任务可能已经够用;二是与GPT Live结合,GPT Live是双向实时API,采用前端模型与后端模型配合的架构,前端负责对话、速度快且善于委派,后端由Astra等模型承担,其工具调用以往显得很慢,内部有团队做出了GPT Live控制计算机的演示,体验明显更为流畅自然;三是内部应用,用户运营团队率先用于支持工单分类,Dots后续也将出现建立在Decisions API之上的快速响应功能。

五、Agents API、缓存、上下文压缩与平台方向

Handa介绍了基于Agents API的自有产品、Responses API的性能工作以及平台高层抽象的开放问题。

(一)基于Agents API的自有产品

据Handa介绍,OpenAI有一批自有产品完全建立在Agents API之上,包括新近上线的安全类产品,以及当日发布的会议类功能,演示中会议笔记可在日历界面直接汇入。他表示,Agents API与Decisions API是OpenAI较新的两项产品,希望得到开发者各方面的反馈,以确定后续方向。

(二)Responses API的性能与缓存

Handa表示,Responses API是OpenAI的主力接口,当前重点是性能,主要有两个方向。一是时延,团队正在重写整个Responses API技术栈,以尽可能缩短响应时间。二是缓存,尤其针对个人代理这类单一线程持续不断延续的应用:目前提供30分钟内缓存命中的保证;已为一家用户推出更长的缓存窗口,提供12小时的缓存保证,该功能尚处预览阶段,将尽快向全部用户开放,用户为缓存多付少量费用,即便隔3至4小时再回到同一线程,仍可获得缓存带来的性能;缓存读取的价格也在持续下调。

他建议开发者在构建应用时充分考虑缓存,并使用缓存诊断工具查找缓存失效的环节。此外,API已提供预热功能:开发者若预知即将收到某一提示词,可提前支付缓存写入费用,使缓存在随后30分钟内随时可用,并可据此派生多个线程实例。

(三)上下文压缩

节目中提到,模型的上下文窗口为100万token,缓存之外仍需要有效的压缩。Handa表示,OpenAI有自有的压缩技术:一是在Agents API中,压缩内置于运行框架;二是在Responses API中有两种方式,其一为服务端压缩,开发者设定token阈值,达到后自动压缩、减少所占用的上下文,其二为“/compact”指令,开发者可自行决定压缩时机,保有完全的控制权。据其介绍,不少大型编程代理倾向于手动方式,开源的Codex运行框架即采用“/compact”。他还表示,团队正在研究新的压缩技术,其中包括若干基于文件的方案,部分已可在Codex运行框架中看到。

(四)高层抽象与“AI云”

Handa此前任职于Stripe。他表示,Stripe的很多工作是在核心支付原语之上构建更高层的原语与产品,这一做法在AI领域如何落地是他持续思考的问题。他认为:一是OpenAI已有过几次尝试,早先推出的Assistants API并不契合;二是Agents API提供了Codex运行框架,但应给予多大的灵活度仍无定论;三是记忆库等更高层的API对象如何设计、如何把存储等概念抽象出来,是一个有待探索的领域;四是当前AI领域的常见做法是提供底层API原语和示例运行框架,再由开发者让编程代理去实现,其中多少应内置于API是他反复思考的问题。他希望听取开发者的意见。

主持人以“AI云”作类比,认为OpenAI正在逐一构建AI原生版本的基础云服务,缓存预热等底层能力向开发者开放,为构建新产品提供了更多途径。Handa对此表示认同。

总的看,Weinstein认为Computer Use在过去数月间已发生“180度”的变化,完成任务的速度在多数情况下大概已快于普通人,下一阶段的目标是达到或超过熟练用户的操作速度,由此带来实时性更强的产品,并使人们默认把更多事务交给代理;同时需要通过可靠性、安全检查与用户授权逐步建立信任。Handa表示,Responses API将继续围绕时延与缓存提升性能,Agents API与Decisions API尚处早期,更高层的抽象应在多大程度上内置于API仍是开放问题,有待开发者反馈。