三个月前,Dwarkesh 一直在发布关于强化学习的精彩博客和节目,他发布了一个关于 RLVR 视频文章的框架性问题,这让很多 Computer Use 领域的人感到不满:
我们对公开学习并不陌生,也对在拥有大平台时犯错所带来的压力并不陌生。然而,我们曾在 Anthropic 参加 Computer Use 发布活动,曾在 Claude Cowork 现场,并制作了第一个关于它的大型播客,在 AIE 组织了第一个 Computer Use 专场来展示最前沿进展,并且近距离参与了 OpenAI 收购 Sky Software,而这次收购如今支撑着 Codex 在 computer use 领域所享有的全面主导地位。这就是为什么我们很兴奋地为你带来今天的第一位嘉宾,Ari Weinstein,Sky 的联合创始人,如今领导着所有那些外行可能会错过的惊人 CUA 进展:
Ari 解释了为什么 Computer Use 现在与几个月前相比“180 度不同”,智能体如何学会调试并从失败中恢复,为什么将截图与无障碍数据、DOM、Playwright 以及生成的代码结合起来会改变速度方程,以及为什么下一个前沿是让智能体在使用软件方面真正达到超人水平。
OpenAI 克隆 Jev
在下半部分,来自 OpenAI API 团队的 Nikunj Handa 拆解了新的开发者技术栈:异步工具调用、回合中引导、WebSockets、UltraFast 推理、Decisions API、提示缓存、预热、压缩以及 Agents API。鉴于我们是第一个 Jev 播客,我们特别关注 Decisions API 异常快速的冲刺:
以及为什么它目前只是一个 Luna 包装器,但团队有动力且足够无我,愿意克隆他们认为好的模式。
我们讨论:
为什么 OpenAI 认为
Computer Use 在过去几个月里发生了巨大变化Dots,以及当每个智能体都拥有自己的
Linux 计算机时会发生什么变化为什么 Computer Use 现在可以完成某些任务
比普通人更快从人类水平到
“字面意义上的超人”computer use 的路径为什么现代智能体更擅长
调试并从失败中恢复截图、无障碍树、DOM、Playwright 和
生成的 JavaScript 如何协同工作App Shots,以及为什么它们比普通截图给模型提供更丰富的上下文为什么 Computer Use 可以闭环连接
编写软件与测试软件当智能体可以
进行支付并操作网站时的信任、权限与安全异步函数调用,以及为什么模型不再需要在工具运行时停止推理回合中引导、WebSockets,以及
更响应式智能体背后的架构UltraFast 推理,以及 OpenAI 如何将前沿模型推向更低延迟
Decisions API 背后的快速内部故事为什么 Decisions API 不只是
低延迟下的结构化输出GPT Live、快速工具调用,以及
实时计算机控制OpenAI 如何已经在将 Decisions API 用于
支持分类与内部工作流更长的提示缓存、缓存预热,以及缓存感知应用
针对长时间运行的智能体线程,服务端压缩与手动压缩的对比
什么应该放在
Agents API 内部,而不是开发者自己的测试框架中
OpenAI 作为
“AI 云”,以及对超越原始模型 API 的更高层原语的探索
Ari Weinstein
OpenAI 计算机使用(Computer Use)产品与工程
Nikunj Handa
OpenAI API 产品
LinkedIn:https://www.linkedin.com/in/nikunjhanda/
时间戳
00:00:00 OpenAI DevDay:Dots、GPT-6.1、Agents API 与 Decisions API
00:02:52 Dots 与个人云计算机
00:04:59 为什么计算机使用“截然不同(180 度不同)”
00:06:04 从 Sky 到可自我调试的计算机使用智能体
00:09:24 计算机使用如何观察和操作软件
00:12:09 从快于人类到超人类计算机使用
00:16:03 Agents API:信任、权限与安全
00:17:31 用于编码、测试与 QA 的计算机使用
00:19:14 GPT-6 API、异步工具调用与 UltraFast 推理
00:23:21 Decisions API 背后的快速故事
00:25:32 Decisions API 是什么以及它如何工作
00:30:24 OpenAI 正在用新 API 构建什么
00:32:23 提示缓存、预热与 API 性能
00:35:20 面向长时间运行智能体的上下文压缩
00:37:13 记忆、更高层 API 与 AI 云
文字记录
引言:OpenAI DevDay 与新的智能体技术栈
Vibhu [00:00:00]: 好的。我们非常兴奋能来到这里。今天是 OpenAI DevDay。特别播客
Swyx [00:00:08]: 我们是你们直播后的第一个播客。
Vibhu [00:00:10]: 第一个播客。我们有 Ari 在这里,他领导计算机使用智能体的产品与工程团队。在我们开始深入探讨计算机使用之前,你想快速回顾一下吗?宣布了什么?你们今天发布的一连串消息是什么?
Ari Weinstein [00:00:24]: 是的。是的,这是超级令人兴奋的一天。我们刚结束主题演讲。真的很棒。有一堆计算机使用相关的发布,我认为值得思考。我们有 Dots,这是新的、某种个人助理产品,而且它有一些非常令人兴奋的计算机使用功能。还有 GPT-6.1 Sol,这是一个惊人的新模型,我认为它特别适合计算机使用,因为它在成本和速度方面的优势。我想,我想我们分享过,它的成本是 Astra 的五分之一,如果专门看计算机使用,成本是七分之一,这真的很惊人。抱歉,有太多东西了。我正在努力梳理。
Swyx [00:01:02]: 还有 API。
Ari Weinstein [00:01:03]: Agents API,现在里面有了计算机使用,这真的很酷,因为现在开发者可以基于与 Codex 和 ChatGPT 中相同的计算机使用来构建。然后还有一些我们现有计算机使用功能的演示,比如应用截图(app shots),你可以把你电脑上正在做的事情的上下文非常快地带入 Codex 和 ChatGPT。然后,还有 Mac 上的原生计算机使用,Roman 让它自动截取他的应用截图,而且当计算机使用正在使用他的应用时,他还可以在电脑上做其他事情。所以是的,真的很令人兴奋的主题演讲。
Swyx [00:01:35]: 更不用说 Decisions API 了。
Ari Weinstein [00:01:37]: Decisions API。
Swyx [00:01:38]: 一开始,它们都是同一个模型吗?比如,这是。还是同一个数据集蒸馏到不同的模型?
Swyx [00:01:44]: 就像,基本上,Computer Use 是在用 Decisions API,还是它们,像是,有点分开的?
Ari Weinstein [00:01:49]: 所以 Decisions API 真正酷的地方在于,你知道,它拥有所有这些新能力。它并行进行推理。它没有推理能力。它是一个更小的模型,比我们用于 Computer Use 的那些要小。所以这些能力让它非常快。
Dots 与将工作委托给云计算机
Swyx [00:02:07]: 是的。
Ari Weinstein [00:02:07]: 它们也让它在做,像是,长周期、复杂任务方面稍微差一点。所以我想我会说,如何把这些方法结合起来,仍然是一个开放的研究领域。但是,是的,我真的很兴奋看到人们用 Decisions API 构建出什么。
Vibhu [00:02:24]: 有趣的事情之一是 Dots 现在附带了个人电脑。
Ari Weinstein [00:02:28]: 是的。
Vibhu [00:02:28]: 所以看起来它们更加持久了。你已经用了一段时间了。人们应该如何突破界限?比如,人们应该以什么为目标?他们应该尝试什么?就我个人而言,目前我把它用于很多客户服务。就像
Ari Weinstein [00:02:41]: 酷
Vibhu [00:02:41]: “哦,这是错的。我不想登录。我不想认证。”找到什么然后把它修好。
Ari Weinstein [00:02:45]: 是的。
Vibhu [00:02:46]: 我们应该如何进一步推进?人们应该尝试什么?
Ari Weinstein [00:02:50]: Dots 是一个非常酷的产品,因为每个 Dot 都可以访问它在云中的自己的 Linux 虚拟计算机,这与我们的其他产品不同。你知道,传统上,我们可以访问云中的浏览器,或者它可以访问你自己的计算机,但现在你在云中获得了自己的整个 Linux 计算机。所以它可以运行完整的桌面应用程序,也可以使用网络浏览器。所以,是的,你知道,我认为 Computer Use 的强大之处,以及我认为它如此令人兴奋的原因,是因为它使得智能体可以做任何你作为一个人可以做的事情,因为世界上所有的软件都是为人类设计的,现在智能体可以使用同样的软件,你可以委托给智能体。所以,是的,就像,你在计算机上会做的任何事情,你都可以让一个 Dot 去做。是的,我认为特别有用的是什么,真的取决于最终用户是谁,以及在他们生活中什么是有价值的。但是,是的,我会从思考,像是,你花时间做的一件事之一,以及你如何能把这些委托给一个智能体开始。
Swyx [00:03:47]: 是的,很多航班预订和购物,老实说甚至,像是,玩游戏之类的,对吧?
Ari Weinstein [00:03:52]: 完全正确。
Swyx [00:03:52]: 是的。
Ari Weinstein [00:03:53]: 是啊,我不知道。对我来说,我最近做的一件事,我一直在弄的。我订阅了一个备餐服务,因为我想吃得健康点,你懂吧?我真的很喜欢我找到的这个备餐服务,因为它让我能高度精细地定制我点的餐。所以我可以比如说,“我要这么多克鸡肉和这么多克米饭。”但它太复杂了。我花了两个小时才下完一单,然后我发现我可以让 Computer Use 帮我做,它 15 分钟就搞定了。所以我实际上省了两个小时。它既比我快八倍完成,又在 GPT-6.1 Sol 上帮我省了两个小时。
Swyx [00:04:32]: 是啊。
Ari Weinstein [00:04:32]: 所以这类任务我觉得,真的非常强大。
Swyx [00:04:36]: 作为一个创作者,我可以自动地、立刻告诉你,我的头号用例就是自动化 YouTube。
Ari Weinstein [00:04:40]: 不错。
Swyx [00:04:40]: 因为 YouTube 不通过 API 暴露很多东西。
Ari Weinstein [00:04:43]: 是啊。
Swyx [00:04:43]: 你只能把它放进虚拟机里,然后就像,运行它,比如说,比如说他们的 AB 测试功能或者发社区帖子。这些都不能通过 API 用,因为他们讨厌开发者。
Swyx [00:04:53]: 总之,所以,Ari Weinstein [00:04:55]: 我也从我们的开发者体验团队那里听说过。他们经常把它和 YouTube 一起用。是啊。真的很棒。
Swyx [00:04:59]: 所以我想画一下,你知道。比如说,我想来点刺激的。我们的一个,领先的 AI 播客,我们的朋友,以说 Computer Use 在过去两年里没有进步而闻名。
Computer Use 在过去一年里如何变化
Ari Weinstein [00:05:12]: 是啊。
Swyx [00:05:13]: 这是一个非常有趣的陈述,我认为你是世界上最适合谈论这个的人之一,比如,事情是如何进展的,对吧?
Ari Weinstein [00:05:20]: 是啊。你知道,他们几个月前说的,我想,我希望他们现在有不同的看法,因为 Computer Use 和以前相比,简直是 180 度不同。
Swyx [00:05:26]: 他是个,他是个很难打动的人。
Ari Weinstein [00:05:27]: 是啊,好吧。嗯,我们正在努力。
Swyx [00:05:30]: 但是,你知道,你做过。你基本上整个职业生涯都在做,某种计算机自动化,对吧?
Ari Weinstein [00:05:34]: 是啊。
Swyx [00:05:34]: 比如快捷指令
Ari Weinstein [00:05:35]: 是啊
Swyx [00:05:35]: 在苹果,然后是 Sky,然后,然后加入 OpenAI。你能画一下,比如你的主线是什么,比如是什么驱动着你,以及——你,当时可能不可能做到什么
Ari Weinstein [00:05:47]: 是啊。
Swyx [00:05:48]: 还有,比如你的里程碑大概是什么。
Vibhu [00:05:49]: 我想接着问一个后续问题,从使用 Codex Computer Use 的角度来看,比如从上周
Ari Weinstein [00:05:57]: 是啊
Vibhu [00:05:57]: 到今天,主要的变化是什么?是模型吗?是 dots 吗?是 harness 吗?所以所有历史加上今天公告里真正改变的东西?
Ari Weinstein [00:06:04]: 是的。从主线来看,我想我一直对自动化以及帮助人们自动化任务感到兴奋,因为这样你就能节省生活中的时间,专注于对你来说比非常精细地操作计算机更重要的事情。所以,是的,这就是我们开发其中一些产品的原因。我之前在苹果工作。我们创办了一家叫 Sky 的公司。我们最终加入了 OpenAI,这真的非常令人兴奋。而且我认为有些事情是
Swyx [00:06:27]: 而且几乎就像你必须绕过苹果,直到苹果说:“好吧,我们就直接雇你,你可以在内部工作,”对吧?就像。
Ari Weinstein [00:06:35]: 那是一个很酷的工作地方。回顾 Sky,真正有趣的是,我们当时也在研究 Computer Use,而模型的能力要差得多。而现在,仅仅在过去一年里,模型在 Computer Use 方面已经变得极其强大。我认为我看到的最大变化是,以前它们可以可靠地启动任务,但随后会遇到问题,而现在它们非常擅长调试。它们非常擅长重试,反思什么有效、什么无效。而且我认为我们也推动了 Computer Use 领域本身向前发展。我认为我们使用了更多技术。现在 Computer Use 经常编写代码。所以如果你在 Codex 中实际查看并手动展开工具调用,你可以看到它不仅仅是一次做一个动作。它实际上是在编写 JavaScript 代码,然后由计算机执行,有时一次执行多个动作,这大大加快了速度,也大大提升了能力。我们使用了更多的可访问性、多模态接口。所以,模型可能使用截图,可能使用可访问性,可能使用 Playwright。它可以根据手头的任务使用许多不同的机制。然后,是的,模型的加速一直非常惊人。所以,是的,今天有什么不同?我认为我们一直在让计算机变得更好,所以我认为仅仅一天的差异,可能比过去一个月或过去两个月的影响要小一些。但是,是的,我认为 Dot 中的 Computer Use 非常令人兴奋,还有我们推出的新模型。
衡量 Computer Use 并改进测试框架
Vibhu [00:08:03]: 在主题演讲中,Tejal 提到了 Computer Use 速度提升了 7 倍,在一些基准测试上表现好得多。你们如何考虑衡量它?Computer Use 是那种,正如你所说,你知道,它是随着时间的推移而改进的。
Ari Weinstein [00:08:20]: 是的。
Vibhu [00:08:20]: 是测试框架吗?是模型吗?是后训练吗?
Ari Weinstein [00:08:22]: 对。
Vibhu [00:08:22]: 你们内部如何看待衡量它有多好,以及新模型带来了哪些变化?
Ari Weinstein [00:08:29]: 我们实际上有很多不同的衡量方式,其中一些是基于测试框架的不同排列和配置。这有点复杂,因为你知道,我们的生产产品有更多的安全检查,而且这些检查会根据手头任务的需求进行不同的配置。所以有很多种衡量方式,但我认为无论我们怎么衡量,都能发现相当一致的提升。这些提升有时来自测试框架,有时来自模型。而且,我对这个结果真的很兴奋——GPT-6.1 在 Computer Use 上的成本效益甚至超过了它相对于 Astra 的基线成本改进。看到这个真的很酷。
Swyx [00:09:10]: 是的。我是说,直播中我特别喜欢的一个可视化是,你在改进你的帕累托前沿曲线,而且有很多讨论是关于你如何与测试框架一起改进它的。
Ari Weinstein [00:09:24]: 是的。
Swyx [00:09:24]: 你能举一些你经历过的顿悟时刻的例子吗?不管是模型驱动测试框架还是测试框架驱动模型,或者别的什么?
Ari Weinstein [00:09:32]: 我不想重复自己,但我认为引入更多的模态一直是非常强大的。
Swyx [00:09:36]: 好的。
Ari Weinstein [00:09:36]: 一个更具体的例子是,过去我认为我们看到很多 Computer Use 产品不得不花大量时间在滚动上,你知道吗?所以它会截个屏,尝试做点什么,然后它会说“哦,我得往下滚动到下一页结果”,然后再截个屏,再尝试做点什么,再往下滚动。所以我认为,有了无障碍功能和其他东西,以及直接访问 DOM 和其他类似的东西,现在语言模型实际上可以看到整个页面或整个应用。它可以编写代码一次执行多个步骤。所以我认为这些可能是最大的单个顿悟时刻。还有很多相比之下不那么令人兴奋的小顿悟,但实际上我们也发现很多速度提升是由大量小的摩擦点驱动的,我们需要深入进去进行内省。
应用截图、无障碍功能与更好的计算机上下文
Swyx [00:10:21]: 是的。很多非常困难的工程工作。
Ari Weinstein [00:10:23]: 是的。
Swyx [00:10:23]: 我是说,总的来说应用截图,对吧?我觉得人们不太理解其中的区别,因为 Codex 里有一个很好的可视化,当它
Ari Weinstein [00:10:30]: 是的
Swyx [00:10:30]: 当你截取应用截图时,但也许他们理解的区别是,你实际上能够驱动每个按钮,而且你有每个文本,以一种非常优化的表示形式。
Ari Weinstein [00:10:40]: 是的。完全正确。是的。其实挺有趣的。如果你想真的非常极客地了解它,你可以进入 Codex,按两个 Command 键来截取应用截图。这样你就能从你正在使用的任何应用中抓取内容,带入 Codex 或 ChatGPT 聊天中。然后,如果你点击附件,再点击右上角那个小小的按钮,你就能看到原始文本和原始的无障碍表示。是的,我们投入了大量工作来
Swyx [00:11:04]: 就把所有东西都倒出来。对。
Ari Weinstein [00:11:05]: 倒出来,但同时还要做到 token 高效,高效地做这件事。这里面有点像一门艺术。而且,你知道,事实证明,最初为人类发明的同一项技术——你知道,那些可能有无障碍需求、想使用屏幕阅读器技术的人——那项技术对他们使用电脑非常有帮助。它对 LLM 使用电脑也非常有帮助。所以,能着手做这件事真的很有趣。
Vibhu [00:11:27]: 补充一下背景,我觉得很多人不理解 app shots。他们甚至不知道这是个功能。
Ari Weinstein [00:11:30]: 对。
Vibhu [00:11:31]: 就是当你双击 command 时,它会拉进来一个看起来像截图的东西
Ari Weinstein [00:11:34]: 对
Vibhu [00:11:34]: 然后你会想,“哦,我为什么只是打开了一张截图然后把它扔进去?”不,它实际上是在拉取所有元数据、所有代码、所有东西。
Ari Weinstein [00:11:40]: 对,没错。对。所以这就像,你知道,如果你对一个带有链接的网页截图——截图并不包含链接指向哪里。它不包含,你知道,也许你截取你的日历,事——事件标——标题是被截断的,你知道吗?但当你做一个 app shot 时,它会给语言模型提供关于一切的全部上下文,而这让它,差不多,能做更多事情。
Swyx [00:12:02]: 对。对于那些想看更多的人,Jason Liu,我邀请他在 AI Engineer 上做了一个完整的 workshop。
Ari Weinstein [00:12:07]: 太棒了。
Swyx [00:12:08]: 做得很好。
Vibhu [00:12:09]: 我有一个更宏观的愿景问题
迈向超人级的计算机使用
Ari Weinstein [00:12:11]: 对
Vibhu [00:12:11]: 关于 Computer Use agents。所以你举的例子——截图、滚动页面、截图——就是我们当时所处的位置。
Ari Weinstein [00:12:17]: 对。
Vibhu [00:12:17]: 今天,它们可以自动化很多事情。瓶颈是什么?是模型吗?是 harness 吗?什么。你觉得它在比如两年内会走向哪里?你觉得它会连续运行数小时吗?我们怎么到达那里?对 Computer Use 的走向有什么预测吗?
Ari Weinstein [00:12:32]: 是的。我的意思是,我觉得真正疯狂的是,你知道,团队在过去几个月里取得的成就是,现在 Computer Use 在完成任务方面,在大多数情况下可能比普通人还要快。我认为下一个前沿是让 Computer Use 的表现真正达到超人水平,它在使用软件方面实际上能像我们这样的专家级 Computer User 一样快,甚至更快。我认为当那一天到来时,将会产生重大影响,也会非常令人兴奋,因为我觉得我们将能够突然构建出提供更多实时体验的产品。而且我认为它还会。降低使用 Computer Use 的门槛,或者说降低其启动能量,我想,会让我们开始默认用智能体去做某些我们过去习惯手动完成的事情。我觉得这也很令人兴奋,因为它会为我们节省大量时间。而且我认为,你知道,有很多不同的小麻烦和瓶颈在某种程度上阻碍着这一点。我认为,是的,模型侧有事情,推理侧有事情,harness 侧有事情,在表示层面也有事情。你知道,我们发现随着 Computer Use 变得更快,我们越来越受限于执行某个操作的速度本身。比如,你知道,在我们 Computer Use 任务的基准测试中,有相当一部分时间实际上是在,比如说,你在自动化 doordash.com 上的一个任务。很多时间实际上是在等待 doordash.com 本身加载,你知道吗?
Swyx [00:14:04]: 是的,那你就写一个 wait,然后执行这个 wait。
Ari Weinstein [00:14:07]: 是的,完全对。而且你想要得到。是的,实际上,真正重要的是你要让那个去——你希望它最终加载完成和你去
Swyx [00:14:16]: 是的
Ari Weinstein [00:14:16]: 触发 LLM 执行下一个动作之间,延迟尽可能小,而这本身其实是一门统计科学。
Swyx [00:14:20]: 也许可以用事件驱动的方式来做这件事。
Ari Weinstein [00:14:22]: 在可能的情况下,你希望它是事件驱动的。
Swyx [00:14:24]: JavaScript 有一些 load 事件。
Ari Weinstein [00:14:25]: 而且 JavaScript 有 load 事件用于。或者说网页浏览器有用于网页导航的 load 事件,但还有其他类型的事件实际上真的无法做到事件驱动。所以有很多复杂性
Vibhu [00:14:34]: 我想到的一个是,比如和客服聊天。
Ari Weinstein [00:14:37]: 是的。
Vibhu [00:14:37]: 回复可能要 30 秒,也可能要三分钟。
Ari Weinstein [00:14:39]: 哦,对。
Swyx [00:14:41]: 我用 Codex 跟好多机器人打过交道。这很棒,但我也在想,另一边是否知道他们在跟一个机器人说话,因为我,比如,用完整的句子回答。比如,我大小写都正确。
Ari Weinstein [00:14:50]: 那太好笑了。
Swyx [00:14:51]: 比如,我给出完整的编号——完整的参考编号之类的。比如,这太。这明显太好了。我不在乎。比如,我只是,比如,想解决我的支持工单。
Vibhu [00:14:58]: 我提示过它,比如,你知道,“别假装你是机器人。做一个非常恼火的人类。”
Vibhu [00:15:02]: 简短的一句话,比如
Swyx [00:15:04]: 是的
Vibhu [00:15:04]: 推动它,做所有这些。我还告诉它,“在你等待回复的时候,比如,使用子代理来研究更好的方法,弄清楚我们需要什么。”
Ari Weinstein [00:15:12]: 不错。
Vibhu [00:15:12]: 这就像,人类的小干预。
Ari Weinstein [00:15:14]: 那太棒了。我还觉得有一半时间另一端是个机器人,所以现在你
Vibhu [00:15:17]: 是的
Ari Weinstein [00:15:17]: 让机器人互相交谈了。
Swyx [00:15:18]: 是的。我还要说,你知道,就像,你知道,我们现在在计算机使用方面的一个里程碑是,你知道,三四年前,我们害怕将LLM连接到网络和
Ari Weinstein [00:15:31]: 是的
Swyx [00:15:31]: 到我们的,到我们的设备。而现在我让它为我配置DNS。
Ari Weinstein [00:15:35]: 哇。
Swyx [00:15:36]: 我让它支付我的账单,而且,就像,真的,就像,数万美元的,就像,东西,我只是发送过去,用计算机使用来冒险,而且,就像,你知道,最坏的情况会是什么?
Swyx [00:15:48]: 所以那-那一切都,那一切都真的很好。
在代理API中安全地使用计算机使用
Ari Weinstein [00:15:50]: 是的。
Swyx [00:15:50]: 我认为现在你已经。你知道,显然,你也必须自己试用你的产品以及所有这些事情。现在你已经以API形式发布了这个,你想告诉开发者哪些陷阱或提示,因为他们即将,我猜,亲身遇到所有这些?
Ari Weinstein [00:16:03]: 首先,我真的很兴奋我们把计算机使用带入了代理API。我认为这真的很棒,因为显然很多开发者正在构建希望与第三方网站和服务合作的应用程序。所以计算机使用具有这种通用性。它可以与任何东西一起工作。所以现在突然之间,开发者可以使用我们正在构建的相同计算机使用实现来构建。我认为如果你想构建自己的计算机使用框架,有很多伟大的工作要做,但这很难。而且,我们在我们的计算机使用框架上训练我们的模型,所以使用为模型分发的那个有优势。实际上可能有速度、成本和准确性优势。所以我认为让人们在此基础上构建真的很棒。而且,是的,你知道,我认为就像你所说的,我觉得我们都还在这个过程中,也许,我们中的一些人比世界上许多人更领先,比如,对这种技术感到舒适并信任它。所以我认为我们有责任,通过确保我们构建可靠的东西,通过构建正确的安全检查,通过在做一些重要的事情如付款之前征求用户同意,通过,询问,你知道,也许取决于应用程序,确保你只让它访问任务实际需要的网站或应用程序,来随着时间的推移建立这种信任。所以那是我认为需要思考的重要事情。但是是的,我真的鼓励人们尝试新的代理API,在它上面构建各种酷东西。我们很乐意听到你的反馈,如果,你知道,取决于进展如何。
Vibhu [00:17:31]: 你有没有看到它影响开发工作流程的方式有什么变化?关于 dots 的一点是,你知道,你会在 Slack 里看到它。
Ari Weinstein [00:17:38]: 是的。
Vibhu [00:17:38]: 你会看到人们使用语音和构建。Roman 展示的那个例子,改变这个应用并沿途给我发送截图等等。
用于测试和闭合软件循环的 Computer Use
Ari Weinstein [00:17:46]: 是的。
Vibhu [00:17:46]: 在采用方面,你有没有看到人们如何使用 Computer Use 进行编码工作流程?人们应该从中吸取什么建议吗?
Ari Weinstein [00:17:55]: 实际上,我最喜欢的 Computer Use 用例之一,也是我们在实际中经常看到的,是让 Computer Use 让代理——实际上测试代理构建的软件,这比听起来要重要得多。因为传统上,你知道,你会在 Codex 中构建一些东西,然后——Codex 为你构建它,然后你必须测试它,而你现在就像代理的 QA,对吧?所以有了 Computer Use,你可以完成开发——软件开发生命周期,其中,代理可以构建软件,它可以测试它。所以我玩得很开心,你知道,构建东西,让代理测试它。当它到我这里时,它已经能工作了。我有额外的乐趣,因为有时我在开发 Computer Use 本身,所以现在我有 一个 Computer Use 代理在使用我的 Computer Use 代理,而后者又在使用其他东西。所以是的,我真的,我真的认为这是一个超级强大的用例类别。
Swyx [00:18:44]: 我有一个视觉游戏测试技能,是我开发的,它真的能捕捉到很多设计问题,Ari Weinstein [00:18:49]: 不错
Swyx [00:18:50]: 你知道,通常当你只看代码时,你不会真正发现它。不过,它也非常适合克隆应用。如果你在使用一个糟糕的 SaaS,想干掉这个 SaaS,你只需一屏一屏地克隆它。而且显然,Computer Use 可以完全驱动一切,截图,记录下来,然后用 Codex 克隆一切。
Ari Weinstein [00:19:06]: 那真的很酷。
Swyx [00:19:06]: 但是的,感谢你所有的进展。我想,那是
Ari Weinstein [00:19:08]: 当然
Swyx [00:19:09]: 我们的时间。
Nikunj Handa:OpenAI API 的新内容
Ari Weinstein [00:19:10]: 是的。
Swyx [00:19:10]: 这不是我们最后一次谈话。
Ari Weinstein [00:19:12]: 是的,酷。这真的很有趣。谢谢你们邀请我。
Swyx [00:19:14]: 好的。
Vibhu [00:19:14]: 好的。好的,我们严格截止。我们直接开始吧。
Nikunj Handa [00:19:17]: 开始吧,是的。
Vibhu [00:19:19]: 好的,那么,Nikunj,我们非常高兴有你。你在 API 方面发布了很多东西,就像我们刚才
Nikunj Handa [00:19:25]: 是的
Vibhu [00:19:25]: 和 Ari 谈到的。你现在可以用 Computer Use 代理构建。你有什么想强调的,API 方面的变化,并稍微介绍一下你自己以及你做什么?
Nikunj Handa [00:19:34]: 是的,当然。我叫 Nikunj。我负责 API 团队的产品。在这里大约三年了。一直在做模型发布相关的工作。我觉得这在我于 OpenAI 的这段时间里,一直是一件持续在做的事。而且,每出一个新模型,我们基本上都会尝试与后训练团队、研究团队非常紧密地合作,弄清楚它有什么新东西。然后我们把这些能力在 API 中暴露出来。大致就是这么个说法。如果你看看 GPT-6 带来的所有新东西,我们推出的很酷的新能力,首先是异步函数调用。所以你在 Codex、Dots 等很多东西里看到的情况是,工具调用耗时太长,因此你不必在工具运行期间暂停模型的执行。所以你可以直接发起一个工具调用,继续运行,继续推理,然后再回来查看。因此我们推出了异步工具调用。我们还推出了中途引导(mid-turn steering),所以现在你可以在模型推理过程中,在中途注入消息。这样当你的工具调用完成时,你就可以把那些指令放进去。
异步工具调用、中途引导与 WebSockets
Swyx [00:20:43]: 而且这在一定程度上也是一种模型对齐能力,对吧?
Nikunj Handa [00:20:46]: 是的。
Swyx [00:20:46]: 就像,它们必须训练出被训练的能力。
Nikunj Handa [00:20:48]: 没错,是的。而且
Vibhu [00:20:49]: 我觉得我们在应用里已经有了。它推理的时候,你一直都可以引导。
Nikunj Handa [00:20:54]: 是的。
Vibhu [00:20:54]: 它当时不是最好的。现在已经好多了。
Nikunj Handa [00:20:57]: 是的。
Vibhu [00:20:57]: 很期待看到它在版本里表现如何
Nikunj Handa [00:20:58]: 是的,而且我喜欢我们的主要
Vibhu [00:20:59]: 而现在
Nikunj Handa [00:21:00]: 目标,我们在 API 里的主要目标是,一旦某项能力被训练进 harness,就把它放进 API。所以我们会等那个时刻,直到它足够好。而这其中很多实际上是由 WebSockets 驱动的,我们推出了它,我想说是在几个月前。所以 WebSockets 就打开了这种与模型之间的、完整的双向通信。这不是 GPT Life 那个东西。我说的只是 GPT-6。你可以做所有这些,比如异步工具调用、异步推理、注入消息。这是一个做起来非常有趣的 API。我觉得,真的很享受。
Swyx [00:21:33]: 是的。这就是为什么我们是工程播客,因为我们可以聊 WebSockets。
UltraFast 与推理栈
Nikunj Handa [00:21:36]: 是的。
Swyx [00:21:37]: 这也和 UltraFast 非常搭配,对吧?
Nikunj Handa [00:21:39]: 哦,是的。
Swyx [00:21:39]: 就像,那现在,我觉得是史上第一次在 API 中可用。
Nikunj Handa [00:21:43]: 是的。
Swyx [00:21:43]: 那基本上就是你能达到的理论最快速度,智能的前沿。
Nikunj Handa [00:21:49]: 是的。能参与那个项目真是太令人兴奋了。我想,在进入 API 之前,UltraFast 最有趣的部分就是看着推理团队用 Astra 大展身手。他们就像,一直在运行这些 Codex 智能体,试图榨取更多性能。而且,我想说,至少有好几个月,很多精力都集中在效率和降低成本上,这就是我们能够将 Luna 价格降低约 80% 的原因。其中很大一部分是由他们落地的所有推理改进推动的。然后现在他们转变了方向,转向如何让这个运行得尽可能快?所以 UltraFast 在像 Astra 这样的模型上看起来真是太棒了。能达到那么快的速度真的很酷。而且,WebSockets 就像。实际上,这是我们第一次推出 WebSockets,是为 GPT 5.3 Codex Spark 推出的,那是。不敢相信我们给模型起了这个名字,但你知道,我们就是为它推出的。显然,它帮助很大,因为,你得有工具调用。你确实大大减少了与工具来回交互的开销。所以,WebSockets 在这方面非常棒。
Swyx [00:22:57]: 是的。看到这种情况总是很可爱,比如我有我的重置使用限制,然后我有我从未使用过的 Spark 使用限制。
Nikunj Handa [00:23:03]: 是的。
Swyx [00:23:04]: 就像,如果我想要它就在那里。
Nikunj Handa [00:23:05]: 我想它终于没了。
Swyx [00:23:06]: 没了。没了,是的。
Nikunj Handa [00:23:07]: 我知道它没了,所以。
Swyx [00:23:08]: 是的。你在慢慢淘汰所有,你知道,那些
Nikunj Handa [00:23:11]: 旧的,是的。
Swyx [00:23:11]: 老家伙们。
Vibhu [00:23:11]: 这是很棒的一周。我是说,这是我们第一次以极快速度拥有 Frontier Intelligence。
Nikunj Handa [00:23:17]: 是的。
Vibhu [00:23:18]: 人们真的很喜欢它。
Nikunj Handa [00:23:19]: 是的。
Vibhu [00:23:19]: 所以
Swyx [00:23:20]: 是的
Vibhu [00:23:20]: 第一次它回来了。
Swyx [00:23:21]: 是的。对于 5.3 Spark 明确归功于 Cerebras。你们没有确认或否认,UltraFast 与 Ce- Cerebras 有关,但人们是。我只想说人们确实关心,并且想知道这件事。而且你们也有自己的芯片。房间里的大象,决策模型。
决策 API:OpenAI 的快速决策模型
Nikunj Handa [00:23:38]: 哦,是的。
Swyx [00:23:38]: 决策 API。我们是第一个与 Diogo 进行大型 Jev 深度探讨的播客,而且我也,你知道,在 AI Engineer 上介绍了他。你多快看到 Jev 然后就像
Nikunj Handa [00:23:49]: 哦我的天。是的。
Nikunj Handa [00:23:50]: 是的。首先,就像,大力赞扬 Diogo 和 Jev 团队,真的启发了
Swyx [00:23:55]: 是的
Nikunj Handa [00:23:55]: 市场上的整个细分领域。就像,显然 Jev 一出来,每个人都像,为之疯狂。我们的用户像,联系我们。但同样,我们的内部团队也说,“我们需要一个快得多的分类系统。”我们可以。我不想,像,抢先透露一些即将到来的 dots 功能
Swyx [00:24:16]: 哇
Nikunj Handa [00:24:16]: 但你会看到,一些很酷、非常敏捷、快速的东西构建在 decisions API 之上。但是,你知道,就像,是的。感谢 Jev 启发了这整个事情。显然,OpenAI 的很多人被这个吸引住了,他们说:“我们怎么能让它工作?我们不会,就像——”
Swyx [00:24:33]: 好的。
Nikunj Handa [00:24:33]: “训练一个新模型。”但是
Swyx [00:24:34]: 就像,四周前,这还不在开发者的雷达上,对吧?
Nikunj Handa [00:24:37]: 不,完全不在。不。
Swyx [00:24:37]: 好的。
Nikunj Handa [00:24:37]: 这就像
Swyx [00:24:38]: 哇
Nikunj Handa [00:24:38]: Jev 启发的,就像
Swyx [00:24:40]: 我认为你是你们实验室里第一个克隆并采用这个的人。
Nikunj Handa [00:24:44]: 是的。是的。我觉得 OpenAI 有很强的黑客文化,人们就是,他们对事情感到兴奋。所以,来自推理团队的一个很棒的人,来自基础设施团队的人说:“这太棒了。我们要在上面捣鼓。”他们构建了一个原型,它就像,能工作,现在我们只是在延迟上爬坡,试图让它尽可能快,我们想在未来几天内推出它。所以一旦我们达到延迟目标,我们就会尝试把它发布出去。
Vibhu [00:25:13]: 这很有趣。在黑客文化的同时,你也,正如 Sam 所说,99%,最可靠的 API 之一,Nikunj Handa [00:25:20]: 嗯嗯
Vibhu [00:25:20]: 我想可能是使用最多的,这直接是你的团队。人们应该如何看待 decisions API?我觉得很多人看到了 Jev,听到了热议,但没有用它构建过。你正在让它变得非常主流。
决策模型擅长什么
Nikunj Handa [00:25:32]: 嗯嗯。
Vibhu [00:25:33]: 人们应该把它看作什么?他们应该如何使用它?
Nikunj Handa [00:25:36]: 是的。我认为我们看到的主要用例是,非常快速的分类。所有的 Computer Use 演示都很棒,非常酷。我认为当然会有局限性,比如,让 Astra 写一个类似 JavaScript 的脚本来控制你的电脑, versus 让 Luna 一次选择一个动作。我认为,它不会达到相同的智能水平,但也许有些 Computer Use 任务对它来说已经足够好了。所以很兴奋看到这个实现。我在内部看到的另一个很酷的原型是人们把它和 GPT Live 连接起来。所以 GPT Live 就像,你知道,我们的双向、实时,Swyx [00:26:14]: 语音
Nikunj Handa [00:26:14]: A- API。而且,它构建在这个,前端模型和后端模型的模型上。所以 GPT Live 是这个,就像
Swyx [00:26:20]: 思考或说话者
Nikunj Handa [00:26:21]: 超级快。是的,思考或说话者的东西。所以 GPT Live 是说话者,超级快,非常擅长委托,而你有像 Astra 这样的东西坐在后面。但工具调用在 GPT Live 中总是感觉,非常慢。所以人们一直在,把这些,GPT Live 控制电脑的工具调用演示放在一起,它感觉更加敏捷和自然。所以我有点兴奋看到人们用 Live 和 Luna 在 decisions API 上做什么。所以那会非常令人兴奋。是的。
Swyx [00:26:55]: 所以我想为大家理清这一点,尤其是从产品方面,因为很多人都在推出 Jev 的克隆版。过去两周大约有 100 个。
决策模型有何不同
Nikunj Handa [00:27:01]: 哦,真的吗?太棒了。
Vibhu [00:27:03]: 头几天。
Swyx [00:27:04]: 但是,就像,他们可以克隆一个 Jev API,老实说就是结构化输出
Nikunj Handa [00:27:09]: 是的
Swyx [00:27:09]: 这是 OpenAI 最先做到的。
Nikunj Handa [00:27:10]: 是的。
Swyx [00:27:11]: 对吧?所以,我觉得让我们为大家理清什么是决策模型,就
Nikunj Handa [00:27:16]: 是的
Swyx [00:27:17]: 就,比如,什么是重要的?不仅仅是延迟。也不仅仅是结构化输出,对吧?因为我可以直接把 Luna 当作——决策模型的定价和 Luna 一样,对吧?
Nikunj Handa [00:27:26]: 嗯嗯。
Swyx [00:27:27]: 关闭推理,然后有结构化输出。我有 Jev 吗?你知道,没有,对吧?这就是
Nikunj Handa [00:27:33]: 是的
Swyx [00:27:33]: 这就是真正的
Vibhu [00:27:34]: 那里有一种置信度。
Swyx [00:27:35]: 是的。
Nikunj Handa [00:27:36]: 是的,完全正确。我觉得,方式是这样的。所以我们还没有为此训练一个新模型。
Swyx [00:27:40]: 是的。
Nikunj Handa [00:27:40]: 我们,就像,完全基于我们已有的相同 Luna 权重来构建这个。
Swyx [00:27:44]: 哦。
Nikunj Handa [00:27:44]: 所以是的。这,就像,真的只是 Luna。而且,在此基础上,你所做的是进行约束。所以,就像,结构化输出是其中很大一部分。你实际上是在优化推理栈,以便在 TTFD 上变得非常快。而且因为你可以有多个问题,你所做的就是,基本上并行运行这些,Swyx [00:28:05]: 作为一个批次。
Nikunj Handa [00:28:06]: 是的。你把这些作为一批来运行。你——人们正在研究各种推理技术,试图让它尽可能快。但我想说,至少我们一开始的实现和这个第一个版本,就像是在 Luna 之上进行零样本推理,看看效果如何。显然,你想把它发布出去。就像,这是 OpenAI 经典的迭代部署方式。发布出去,看看人们怎么想,然后,我们会根据需要做更多的模型改进。所以是的。这就是决策 API。
Swyx [00:28:38]: 是的。而且,显然作为一个好处,你有视觉能力。他们没有视觉能力,对吧?
Nikunj Handa [00:28:42]: 没错。
Swyx [00:28:42]: 显然,Jev 自带
Nikunj Handa [00:28:43]: 是的。就像,我们通过 Luna 免费获得它。是的。
Swyx [00:28:45]: 是的。我确实认为,就像,你知道,一些创新,听起来,如果仍然是相同的 Luna 权重,那还有待实现,比如,置信度相关的东西,比如,校准是我们播客中讨论过的,基准校准。因为基本上,整个重点是 RLHF 会让你倾向于你想听到的内容。
校准、架构与开放研究问题
Nikunj Handa [00:29:03]: 是的。
Swyx [00:29:03]: 但实际上,并不是,比如,置信度的量是多少。
Nikunj Handa [00:29:06]: 是的。是的,完全同意。我很想看看结果会如何。也许会有,就像,会有。这些将会是,就像,我们可能不得不,就像,攀登的关键领域
Swyx [00:29:15]: 是的
Nikunj Handa [00:29:15]: 随着,随着未来模型的发布。但是,是的。
Swyx [00:29:18]: 然后从架构方面来说,另一个在争论中的事情,显然,你——没人知道,因为 Jev 不谈这个,但两种猜测是,第一,也许是用扩散模型而不是自回归。
Nikunj Handa [00:29:28]: 嗯嗯。
Swyx [00:29:29]: 但你能够以你的方式实现并行生成。然后另一个是某种机制可解释性类型的东西
Nikunj Handa [00:29:37]: 嗯嗯
Swyx [00:29:37]: 就是你,就像,分析激活值然后直接输出
Nikunj Handa [00:29:40]: 那会很酷
Swyx [00:29:41]: 权重。
Nikunj Handa [00:29:42]: 是的。
Swyx [00:29:42]: 这个,就像,你们所有人都做过这方面的研究。人们一直在猜测。
Vibhu [00:29:45]: 已经有演示了
Swyx [00:29:46]: 是的
Vibhu [00:29:46]: 这两个也都是。我觉得 Gemini 分享了 Gemini diffusion、Gemma diffusion 在 Jev 风格的输出上。
Nikunj Handa [00:29:53]: 哦,太棒了。
Vibhu [00:29:53]: 而且,可解释性的人也已经,你知道,从中间层提取出了可解释性,但这些都是猜测。
Swyx [00:29:59]: 这就像,你想要瞄准的是什么,对吧?因为你可以实现 API。每个人都可以实现 API。这实际上相当简单。但是,就像,然后还有速度,然后还有准确性,然后还有其他的校准特性。
Nikunj Handa [00:30:11]: 嗯嗯。
Swyx [00:30:11]: 我不知道还有什么。
Nikunj Handa [00:30:13]: 是的。是的。不,完全同意。这太酷了,就像,整个领域现在已经被开启了,人们会做很多很酷的东西,每个人都会互相学习。而且,是的,我对此很兴奋。
开发者接下来应该构建什么
Vibhu [00:30:24]: 我觉得作为平台团队的一员,你的很多工作就是赋能构建者。
Nikunj Handa [00:30:27]: 嗯嗯。
Vibhu [00:30:28]: 你认为人们应该用 decisions API 以及 Computer Use 智能体构建什么?有没有你一直在内部构建的东西,你认为在新变化之后会真正打开局面?
Nikunj Handa [00:30:39]: 是的。好的,让我们想想。decisions API,内部用例一直相当明显。就像,用户运营团队,就像,扑了上去。我们就像,“我们得把我们所有的支持工单分类。”还有什么出现了?显然,有,就像,非常酷的 GPT Live 演示。我确信,就像,Codex 应用团队可能会,就像,接手这个并尝试用它做一些很酷的事情。所以,你知道,就像,这整件事开始,就像,一周前,所以它,就像,非常早期,而且
Swyx [00:31:06]: 哦,一周。
Nikunj Handa [00:31:07]: 我们很兴奋。是的。是的,差不多。
Vibhu [00:31:08]: 在,评估方面有一个很大的推动,LLM 作为评判者在那里有非常低的延迟。
Nikunj Handa [00:31:13]: 对。是的。看到那个会很有意思。然后,有了 Agents API,我们基本上就是,有一堆第一方产品,比如,在 OpenAI 完全构建在它之上。我们刚发布的 Codex 安全相关的东西就是完全构建在 Agents API 之上的。我们有,算是——我们——我们今天要发布一个类似会议类型的东西。
Agents API 与 OpenAI 的第一方产品
Swyx [00:31:40]: 嗯嗯。
Nikunj Handa [00:31:40]: 我记得好像有个演示。你记得 Sam 展示的时候那些插件扩展吗?好像有个演示,比如,你在日历里,你可以,比如,把你的会议笔记
Swyx [00:31:51]: 比如,放进一个单一的
Nikunj Handa [00:31:52]: 流入你的空间
Swyx [00:31:52]: 类似 Google Docs 那种东西。
Nikunj Handa [00:31:53]: 对。
Swyx [00:31:54]: 对吧?
Nikunj Handa [00:31:54]: 所以——所有那些东西,都是完全构建在 Agents API 之上的。然后是的,我,就是很期待看到。比如,我们刚把它推出来,让我们看看人们会在它之上构建什么。
Vibhu [00:32:04]: 我觉得你展示得非常好。整个编辑空间、页面、协作、添加你的点。比如,那是很多,所以
Nikunj Handa [00:32:12]: 对
Vibhu [00:32:12]: 人们可以从中获得很多灵感。
Nikunj Handa [00:32:14]: 对。用 Astra 一切皆有可能,你知道。比如,事情现在发展得太快了。就像
Swyx [00:32:19]: 对
Nikunj Handa [00:32:19]: 人们从想法到执行如此之快,太惊人了。
Swyx [00:32:23]: 有没有什么是你希望人们关注并给你反馈的?比如,什么——比如,你知道,也许你只是把这个推出来,然后你希望——而且有,比如,一个岔路口,你希望开发者帮你决定。
Responses API 性能与长期缓存
Nikunj Handa [00:32:35]: 所以我觉得 Agents API 和 decisions API,它们就像,这些是我们最新的产品。很希望,比如,得到关于它们的任何和所有反馈,以弄清楚该把它们带向何方。我觉得,在这边,我们,比如,对 Responses API 非常开放,它算是我们这边的主力。比如,现在真的专注于性能,而性能主要体现在,比如,两个主要方面。第一就是,比如,延迟。我们一直在,比如,重写整个 Responses API 技术栈,以,比如,从 TTFT 角度、DVD 角度让它尽可能快。所以有,比如——那,比如,继续是,比如,我们的一个主要关注领域。我们一直在尝试做的第二件事是,比如,真正深入缓存,特别是这些,比如,个人代理,它们,你知道,比如,基本上,比如,一个单一线程,就那么一直永远进行下去。我们一直在,尝试,比如,真正提升我们在缓存方面的水平。我们现在提供,比如,30 分钟内缓存命中的保证。我们实际上,比如,我们——对于我们的一个用户,我们刚推出了,比如,一个长得多的缓存窗口。所以我们有,比如,一个 12 小时的缓存保证,我们提供这个,这样你就有,比如,保证的缓存命中,持续
Swyx [00:33:40]: 那是公开 API 吗?
Nikunj Handa [00:33:42]: 还不是。那是在预览中。
Nikunj Handa [00:33:43]: 我们会尽量尽快把这个推送给所有人。但是,就像,只需为缓存写入多付一点点费用,我们就能保证,缓存读取在更长的时间内有效。所以即使,比如,你的 instinct 线程,你只是在上面做了些操作,然后三四个小时后再回来,你仍然能获得缓存带来的性能优势。而且推出了
Vibhu [00:34:04]: 而且你用新模型把成本也降低了不少,对吧?
Nikunj Handa [00:34:07]: 哦,是的。没错。
Vibhu [00:34:08]: 大概便宜了 25%,所以
Nikunj Handa [00:34:08]: 是的,通过降低缓存读取成本,是的。
缓存预热与高性价比的 Agent 线程
Vibhu [00:34:10]: 对于开发者来说,他们应该实现
Nikunj Handa [00:34:13]: 是的
Vibhu [00:34:13]: 因为这样会便宜很多。
Nikunj Handa [00:34:14]: 是的。是的。就是,在构建应用时要非常有缓存意识,并使用我们的提示诊断或缓存诊断工具来弄清楚,哪里出现了性能下降。所以缓存这部分,真的非常重要。是的,我还想谈谈预热。我们现在在 API 中已经有了这个功能。所以,如果你知道,“嘿,我将会得到一个缓存,” 就像——抱歉,“我将会得到这个提示。我只想,预先预热缓存,现在就支付缓存写入费用,然后让它在接下来的 30 分钟内随时准备好。”
Swyx [00:34:49]: 而且它可以生成该线程的许多实例。
Nikunj Handa [00:34:51]: 完全正确,是的。
Swyx [00:34:52]: 是的。
Nikunj Handa [00:34:52]: 你可以一直继续,然后拥有
Swyx [00:34:54]: 是的,就在那里不断调整提示
Nikunj Handa [00:34:55]: 大量的这样的实例。所以,是的,我非常期待收到关于底层性能方面的反馈,这样我们就能继续让 Responses API 成为在 LLM 之上构建应用时最高效、最可靠的方式。然后你基本上就有了我们的新产品,我只是在寻求任何和所有的反馈。
Swyx [00:35:15]: 是的,直接用就对了,对吧?
Nikunj Handa [00:35:16]: 所以是的,直接用
Swyx [00:35:16]: 告诉我们该
Nikunj Handa [00:35:17]: 是的。请帮我们定义路线图。所以是的。
Swyx [00:35:20]: 对我来说,缓存这件事,很棒,对吧?就像,显然非常需要。但归根结底,你仍然会碰到百万 token 上下文的限制
压缩与管理百万 Token 上下文
Nikunj Handa [00:35:28]: 嗯嗯
Swyx [00:35:28]: 而且在可预见的未来这大概不会改变。
Nikunj Handa [00:35:31]: 嗯嗯。
Swyx [00:35:31]: 就像,你仍然需要好的压缩。
Nikunj Handa [00:35:33]: 是的。
Swyx [00:35:33]: 这方面最好的实践是什么?
Nikunj Handa [00:35:34]: 是的。是的,完全同意。首先,OpenAI 有自己的专有压缩,comp
Swyx [00:35:40]: 它在
Nikunj Handa [00:35:41]: 压缩。
Vibhu [00:35:42]: 压缩。
Swyx [00:35:42]: 它在 agents 里。
Vibhu [00:35:43]: 它在 API 里。
Nikunj Handa [00:35:43]: 是的。
Vibhu [00:35:43]: Agents API。
Nikunj Handa [00:35:44]: 是的。
Swyx [00:35:44]: 你替我们决定,对吧?
Nikunj Handa [00:35:45]: 是的,没错。所以在 Agents API 中,它内置于 harness 中。如果你使用的是 Responses API,那么有两种实现方式。一种是我们所说的服务器端压缩,基本上就是告诉 Responses API,如果你达到了这个 token 阈值,就自动压缩它,然后,呃,减少使用的上下文。第二种方式是 /compact,如果你想要完全控制的话。所以你可以在任何时候 /compact
Swyx [00:36:15]: 我明白
Nikunj Handa [00:36:15]: 根据你自己的逻辑来决定何时,比如
Swyx [00:36:17]: 这不是 AGI。
Nikunj Handa [00:36:18]: 它。
Swyx [00:36:18]: 这不是 AGI。
Nikunj Handa [00:36:19]: 是的。是的。
Swyx [00:36:20]: 是的。但它,我的意思是
Nikunj Handa [00:36:20]: 是的
Swyx [00:36:20]: 这是手动覆盖。
Nikunj Handa [00:36:21]: 是的,这是手动方式。而且,我不知道,但很多大型编码代理喜欢手动操作。我的意思是,如果你看看 Codex 在开源 Codex harness 中的实现,你可以看到他们使用 /compact 并这样做。而且,顺便说一下,我们正在研究新的压缩技术。其中一些你将在 Codex harness 中看到。比如,它已经在 Codex harness 中实现了。所以,它们是一些基于文件的系统,我们正在试验。所以是的,压缩方面也有很多很酷的事情正在进行。
Swyx [00:36:57]: 酷。我们时间不多了。
Nikunj Handa [00:36:59]: 好的。
Swyx [00:36:59]: 我想你已经谈了很多关于性能的内容,也谈了很多关于你正在推出的新 API。关于平台的未来,你能给我们一些其他提示,说明你感兴趣的事情吗?
更高层次的平台原语和 AI 云
Nikunj Handa [00:37:13]: 我们显然是非常低层次的。比如,我之前在 Stripe 工作,在 Stripe,很多游戏都是在核心支付原语之上构建这些更高层次的原语和产品。而且,我一直很好奇在 AI 中做到这一点的最佳方式是什么。我认为我们已经有过几次尝试。我们很久以前就推出了 assistance API,但并不是很合适。我们有点像是用这个 Agents API 来推进,它给你 codex harness,但比如,什么是正确的灵活性程度?这是一个开放的问题。比如我们应该如何拥有记忆墙和所有这些更高层次的 API 对象来抽象掉更多的存储概念。比如这是一个完整的,有一个完整的空间,我非常好奇如何设计。我认为 AI 中的很多事情就是有一个低层次的 API 原语,看到一个示例 harness,然后让你的编码代理实现它。但我们在 API 中构建多少,这是我一直在思考的问题。
Swyx [00:38:24]: 是的。
Nikunj Handa [00:38:24]: 所以我不知道大家对此有什么想法。如果有人有想法,听到会非常有趣。
Swyx [00:38:30]: 是的。我一直提到的类比,我们就以此结束,你正在构建一个 AI 云,对吧?
Nikunj Handa [00:38:35]: 嗯嗯。
Swyx [00:38:35]: 就像,这是 Sam 一年前说过的话
Nikunj Handa [00:38:38]: 嗯嗯
Swyx [00:38:38]: 在哪里,而你,这几乎就像你在做 AWS 的发明,你必须做,好吧,这是 EC2
Nikunj Handa [00:38:45]: 是的
Swyx [00:38:45]: 这是 S3,这就像。但你在做的是每一个的 AI 原生版本。
Vibhu [00:38:48]: 有很多类比,所以你在为你已知会用到的东西预热缓存
Nikunj Handa [00:38:53]: 是的。
Vibhu [00:38:53]: 而且很好的是这一切都暴露给构建者
结语
Nikunj Handa [00:38:56]: 嗯嗯
Vibhu [00:38:56]: 因为它只是打开了你可以构建新事物的方式。
Nikunj Handa [00:38:59]: 是的,绝对如此。
Swyx [00:39:00]: 好的。
Vibhu [00:39:00]: 太棒了。那么
Swyx [00:39:01]: 这就是全部了。
Nikunj Handa [00:39:01]: 谢谢你们,各位。
Vibhu [00:39:02]: 谢谢。
Nikunj Handa [00:39:02]: 是的。
