AIE NYC 的门票现已开售,欢迎申请仅限受邀者的 AIE CODE。加入我们!
我们与今天的嘉宾有着一段不同寻常的关系:自合著InstructGPT 论文以来的这些年里,Diogo Almeida一直在说,可通过 API 获取的前沿模型走错了路——从对齐到拒答再到可靠性的各个角度都是如此——由于 ChatGPT 的巨大成功,我们抛弃了除自回归聊天微调 LLM 之外的所有模式。
在一段如今观看量已达 约 4000 万次的发布视频中(相比之下,GPT4o 是 2200 万,Fable 5 是 1500 万,Navier Stokes 是 7400 万,而 6 Astra 是 1.37 亿),Diogo 介绍了 Jev,它随即席卷了 AI 时间线——我们将跳过完整的 Jev 讲解,因为你最喜欢的 AI 影响者/教育者很可能已经做过一个了。我们还收集了:
官方的
patterns和cookbooks,你应该先看这些,来自Allie的 Jev 用例
基于速度的——游戏与计算机使用
语音 + 计算机使用示例,我们在 1 小时 34 分钟处讨论的必看内容
用于编码代理的 Jev有官方指南来自 Theo 的合理反驳——Diogo 发表了一篇关于KV 缓存暴政的笔记,你应该在播客之后作为关于 Jev + 编码代理的后续阅读,因为他相信缓存统治一切
构建在 Jev 之上的编程语言(Diogo 的最爱)用于分析的 Jev回放和用户旅程回顾“暗数据”
Jev 的一个核心目标是“消失在背景中”——例如像正则表达式一样不起眼
Jev 梗图
相反,我们将聚焦于我们能够独特提供的内容——对Jev 如何以及为何被创造的更广泛的哲学和使命层面的理解,以及你应该对 TypeSafe 的未来模型(ReasoningJev?)有何期待,以及你应该着手哪些用例和想法,而不是第 55 个低投入的 Jev API 克隆,或者做一个通用的 JevBench 基准测试——这是Diogo 已公开拒绝的做法。
为什么是 RLCD:三种 RLHF,以及为什么它们全都是错误的北极星
Diogo 对 RLHF 了解颇深,毕竟他曾是 OpenAI 后训练(post-training)开创团队的一员——他将这一领域的三个分支追溯到 Christiano 等人 2017(机器人后空翻演示)、Stiennon 等人 2020(学习摘要)以及他的心血之作 Ouyang 等人 2022(InstructGPT)。从那时起,从 Function Calling 到 Structured Outputs 再到 Reasoning,每一项创新都像是在基于字符串的序列到序列预测范式之上打的一个补丁。正如他在播客中提到的,从 2023 到 2024 年,由于个人和组织的双重低估,他屡屡受挫,未能训练出一个能准确解决他所认为的、让 LLM 成为软件核心的根本问题的模型:可靠性。
Jev 的核心创新是“用于校准决策的强化学习”(Reinforcement Learning for Calibrated Decisions),这是一种新颖的、尚未发表的技术,它优化的目标是“在 System One 任务上给出具有认识论诚实概率的答案”,而非人类评分反馈(RLHF)——后者会导致幻觉、谄媚以及对人类的永久依赖——也非带有评分标准的可程序化验证输出(RLVR)——后者能解纳维-斯托克斯方程,却加剧了智能的参差不齐,且难以与其他软件集成。
我们之前在播客中讨论过校准问题,但理解 RLCD 为何变得必要的最佳单一去处,或许是 Diogo 的 AIE 演讲,其中讨论了为什么为人类训练一代有用的 AI 助手,反而损害了它们作为用于自动化的可组合、可编程 AI 的训练模型的能力。
在最后,他还预告了他对缩放定律的反主流观点——这暗示了如何在没有大实验室数十亿美元资金的情况下,建立一个现代的新实验室……
最苦涩的教训:任务与数据胜过算力
我们花了相当多时间讨论 Diogo 关于最苦涩的教训的文章:
他的观点是:“你优化什么,就得到什么,而机器学习中最苦涩的教训是,其中最重要的部分根本不是机器学习。”——选对北极星,例如为用户偏好点赞,还是被集成到工具调用中——会让其他一切各归其位。
我们很兴奋能与刚染了头发的 Diogo 交流,讨论:
为什么 AI 能解决
极其困难的问题,却仍然无法自动化基本工作
System One 模型是什么,以及为什么 Jev 是为软件而非聊天而构建的
RLHF、模式崩溃、校准,以及为人类偏好优化的隐藏成本
为什么当 AI 被埋在软件依赖项内部时,拒绝回答会成为一个问题
为什么 TypeSafe 拒绝公开基准,而是优化
每美元智能
“最苦涩的教训”:为什么
正确的任务和正确的数据可能比算力更重要。为什么 TypeSafe 认为自己是
数据实验室而非模型实验室。RLCD 与 RLHF 和 RLVR作为 AI 根本不同的北极星。为什么
可靠性和鲁棒性比简单的确定性更重要。Jev 的编程原语以及智能如何映射到
软件控制流。为什么开发者应该将 AI 工作流分解为
小而可衡量的决策。如何用
结构化状态取代庞大的提示词和系统消息。为什么 Diogo 认为 AI 最终应该
消失在软件的背景中。
“反向 SaaS 末日”以及 AI 如何增强现有软件。系统一与系统二智能以及推理模型的局限。暗数据、计算机使用、实时智能,以及
Jev 最大的早期用例。为什么 Jev 可以重塑
围绕单一模型架构构建的编码代理。为什么 Diogo 说他
不会用 10 亿美元进行预训练。通往 TypeSafe 的 OpenAI 之旅,以及为什么他认为许多
新实验室正在错误地接近 AI。超越
KV 缓存的编码代理、共享状态、子代理以及多代理的未来
Diogo Almeida
LinkedIn:https://www.linkedin.com/in/diogomdaTypeSafe AI:https://typesafe.ai/
时间戳
00:00:00 Jev 发布周与 AI 经济革命
00:02:50 什么是 Jev?系统一模型与可编程 AI
00:05:54 RLHF、模式崩溃、校准与 Yann LeCun
00:10:29 程序化 AI、拒绝与安全对齐
00:17:21 为什么 TypeSafe 拒绝公开基准测试
00:20:43 最苦涩的教训:数据、算力与正确的任务
00:24:59 RLCD 与 RLHF 和 RLVR
00:28:42 为什么强大的 AI 仍未实现经济自动化
00:39:55 可靠性、鲁棒性与确定性
00:48:11 模型版本控制、LTS、速度与每美元智能
00:54:04 深入 Jev 的 API 与编程原语
00:58:28 如何使用 Jev 构建:结构、分解与小决策
01:18:28 反向 SaaS 末日与 AI 消失在软件中
01:33:21 计算机使用、暗数据与 Jev 最大的用例
01:38:48 Jev 如何重塑编码代理
01:41:00 AI 安全、前沿节奏与 RLVR 的局限
01:48:03 为什么 Diogo 不会用 10 亿美元进行预训练
01:55:19 TypeSafe 背后的 OpenAI 故事
02:01:41 为什么 Diogo 认为大多数新实验室正在错误地理解 AI
02:08:00 超越 KV 缓存的编码代理与多代理的未来
文字记录
引言:Jev 发布周与开发者势头
Swyx [00:00:00]: 好的,我们在演播室。这是一个特殊的场合,因为本周,我的好朋友 Diogo 发布了 Jev,它已经占据了整个时间线。你感觉如何?现在作为你是什么感觉?
Diogo Almeida [00:00:16]: 情感上?
Swyx [00:00:17]: 是的。
Diogo Almeida [00:00:17]: 从未如此糟糕。就像,我现在是一个衣衫褴褛的人,因为事情太多了,而我是个技术型 CEO,所以我有,就像,很多火要扑。
Swyx [00:00:29]: 是的。
Diogo Almeida [00:00:29]: 但在精神上,我感觉——我一直这么说,而且这些年来在我的 over-under 活动中也一直这么说。就像,我觉得整个人工智能领域就像那种嘉年华的镜屋,每个人都疯了,说着最奇怪、毫无意义的话。而感觉就在这一周,我好像更好地与现实同步了,就像,哦,人们现在看到了。人工智能可以远超曾经的想象。
Diogo Almeida [00:01:06]: 而且,是的,我们将会实现。就像,一场基于人工智能的经济革命又回到了桌面上,这他妈的太棒了。
Diogo Almeida [00:01:17]: 我太兴奋了,开发者们懂了。是的,是的,而且我想向开发者们表达我永恒的感激,还有
Swyx [00:01:25]: 是的。
Diogo Almeida [00:01:26]: 我对这个社区和一切感到太兴奋了。太棒了。
Swyx [00:01:28]: 是的,你昨天说,你决定优先考虑市政厅会议,而不是一堆像 VIP、投资者之类的人,因为你想确保他们是你最关注的人,对吧?工程师们,开发者们。
Diogo Almeida [00:01:43]: 是的,感觉有点像,哦天哪,我现在在和非常重要的人说话。
Swyx [00:01:47]: 是的。
Diogo Almeida [00:01:47]: 我可能不应该透露是谁。
Swyx [00:01:48]: 是的。
Diogo Almeida [00:01:48]: 但对我来说感觉有点肮脏,我,就像,也许在事情上过于真诚了。就像,如果在我那巨大的要交谈的人的日历事件中,社区不是其中之一,那感觉就像,肮脏。
Swyx [00:02:04]: 是的。
Diogo Almeida [00:02:04]: 实际上,在我理想的世界里,会像,一直都有社区。我在想,“我应该在走去你工作室的路上主持一场市政厅会议吗?”然后我想,“不,那太疯狂了。”
Swyx [00:02:12]: 当然。是的。嗯,你们一直在 Discord 上主持市政厅会议。Discord 现在有 10 万人了。你的 Twitter
Diogo Almeida [00:02:19]: 我不关注这些统计数据。
Swyx [00:02:20]: 是的。
Diogo Almeida [00:02:20]: 所以我的天啊。
Swyx [00:02:21]: 你的 Twitter 爆了。那,那真的很有趣,因为,就像,在 AIE 上,你说,“是的,请关注我,”然后你甚至没有,就像,提供你的账号。
Diogo Almeida [00:02:29]: 我是个菜鸟。我是个菜鸟。
Swyx [00:02:29]: 你真是个菜鸟。
Diogo Almeida [00:02:30]: 我是个菜鸟。
Swyx [00:02:31]: 但不,但那个,就像,那是,就像积极的气场,就像
Diogo Almeida [00:02:33]: 酷
Swyx [00:02:33]: 你不知道如何推广自己。
Diogo Almeida [00:02:35]: 是的。有人,就像,当我发帖说,“天哪,我们三个都在 twending——热门话题上。”然后他们说,“那是个人信息流。”
Swyx [00:02:42]: 那是个人,是的。
Diogo Almeida [00:02:43]: 然后我说,“哦,不。”
Swyx [00:02:44]: 当然,当然它会对你显示为热门。
Diogo Almeida [00:02:45]: 尴尬。是的。
Swyx [00:02:45]: 是的,因为那是你点击的内容。
Diogo Almeida [00:02:47]: 是的。
Swyx [00:02:47]: 所以好吧。我们,是的,所以恭喜一切。
什么是 Jev?系统 1 模型与每美元智能
Diogo Almeida [00:02:50]: 谢谢。
Swyx [00:02:50]: 我们之后会聊到更多细节,等你方便的时候。不过,对于那些像是活在石头底下的人,或者只是想要一个权威定义的人,我们先来说说,Jev 是什么?
Diogo Almeida [00:03:02]: 呼。让我想想。这问题挺难的。
Swyx [00:03:07]: 好的。如果你愿意的话,我很乐意换个方式再问一遍
Diogo Almeida [00:03:09]: 不用。我很乐意
Swyx [00:03:10]: 好的
Diogo Almeida [00:03:10]: 我很乐意,就随便聊聊。
Swyx [00:03:12]: 嗯。
Diogo Almeida [00:03:13]: 我想说,这个问题让我松一口气的第一件事是,现在我不用再向我父母解释这个问题了,因为 ChatGPT 就能解释。
Swyx [00:03:20]: 不错。
Diogo Almeida [00:03:21]: 所以我的看法是,我们需——需要一类新的模型。我们并不执着于给这类模型命名。我们——我们想出的最准确的名字是 System 1 模型。
Swyx [00:03:33]: 嗯。
Diogo Almeida [00:03:33]: 会有原因的,但——我们不叫它们决策模型是有原因的,因为,它们会是。就像,System 1 不止于此。我只能说这么多。我们没料到这会成为我们的大发布,所以我们还有存货。
Swyx [00:03:48]: 你应该说低调的研究预览。
Diogo Almeida [00:03:52]: 差不多就是,对吧?差不多就是。但我们。所以有一类模型,我们这样描述它们:机器原生、System 1、大型可编程。我认为这些是——这类模型的目标是让代码成为消费者。所以,与预训练大型语言模型不同,后者是为了互联网的自动补全,或者 RLHF 模型,比如聊天机器人指令遵循模型,是为了回复文本,或者 RLVR。它在 RLHF 中处于一个奇怪的灰色地带。就像,这些是为了让事物直接被代码消费,因此得名类型安全。所以我们真正想要的是让 AI 尽可能强大,我们认为做到这一点的方法是将它与软件集成。我们正在设计一切,不仅仅是外部,还有模型的深层内部,都为软件优化。所以第一,Jev 是我们的第一个大型可编程模型,或者 System 1 模型,随你怎么叫。Jev 旨在优化每美元智能,因此得名 Jev。
Swyx [00:05:03]: 杰文斯悖论。
Diogo Almeida [00:05:03]: 杰文斯悖论,是的。它优化的是每美元智能。我喜欢和人们争论可靠性、成本、校准和速度之间哪个最重要。Jev 旨在成为。Jev 将成为处于每美元智能前沿的模型的名字。还有其他优化方式,比如 ML,或者至少如果你擅长 ML,一切都是权衡。我们只是全力以赴。
校准、模式崩溃与 RLHF 的局限
Swyx [00:05:31]: 是的。对我来说,校准是人们之前谈论不多的一件新事物。我们过去做过一期节目,和 Hugging Face 的 Clementine Foreia 一起,他们当时说,“是的,实际上,他——他们只是。”或者,这就是你关于 RLHF 的整个论点,就是它们更倾向于崩溃成你最想听到的
Diogo Almeida [00:05:50]: 哦
Swyx [00:05:50]: 或者最可能的情况是,而不是像他们自己对某件事的内部信心那样。
Diogo Almeida [00:05:54]: 我能就此发表一下高见吗?
Swyx [00:05:56]: 请讲。好的。
Diogo Almeida [00:05:57]: 酷。就像,我听说你的听众是最懂技术的,所以我其实想深入聊聊这个。
Swyx [00:06:02]: 是的。
Diogo Almeida [00:06:03]: 而且如果——我经历了极度的精确性,以确保我们发布视频中的一切都是准确和真实的。显然,这非常不寻常。没有人注意到的一件事是 RLHF 的缺点,特别是模式丢弃。
Swyx [00:06:17]: 模式丢弃还是模式崩溃?
Diogo Almeida [00:06:19]: 是一回事。
Swyx [00:06:19]: 你是这么叫的吗?
Diogo Almeida [00:06:20]: 是一回事。
Swyx [00:06:20]: 好吧。
Diogo Almeida [00:06:21]: 我最终想写一篇关于这个的博客,但我,就像,想尽可能告诉更多人,因为我觉得这是件非常有趣的事。所以这个辛辣的观点,我非常相信 Yann LeCun。我认为 Yann LeCun 的观点实际上是最接近的之一
Swyx [00:06:36]: 那这个呢?
Diogo Almeida [00:06:37]: 嗯,我现在应该讨论这个,还是应该等等再进入模式崩溃?
Swyx [00:06:40]: 不,稍后。进入模式,进入模式崩溃。我不知道。
Diogo Almeida [00:06:42]: 所以我实际上认为,在各种观点中,Yann LeCun 的是最准确的之一。但他有一个非常著名/臭名昭著的幻灯片,关于,Swyx [00:06:52]: 蛋糕?
Diogo Almeida [00:06:53]: LLM 注定要失败。
Swyx [00:06:54]: 好的。
Diogo Almeida [00:06:54]: 就像那个,他有一个饼图,上面有一小部分——很小的一点——然后说随着序列长度的增加,它出错的概率会增加。是的,就是这个。这个。我喜欢这个,因为它看起来在数学上显而易见,但显然是错的,对吧?就像,它在数学上显而易见,但在经验上并不成立。这是我最喜欢教人们的事情,比如,你在哪里
Swyx [00:07:21]: 脱节在哪里,对吧?
Diogo Almeida [00:07:22]: 没错。我可以还是你想告诉我?
Swyx [00:07:27]: 关于模式崩溃?
Diogo Almeida [00:07:28]: 哦,不。哦,所以模式崩——崩溃与此相关。
Swyx [00:07:31]: 是的。
Diogo Almeida [00:07:31]: 脱节发生是因为如果你处于一个模式覆盖或校准分布中,你就像,不是。你不会因为拥有离群值而受到过度惩罚。你会期望,就像,某些东西。某些时候你会处于分布外,某些时候你会处于分布内。这就是当你覆盖分布时发生的情况。这就像 GAN 之前的模型。它们生成模糊的图像,对吧?
Diogo Almeida [00:07:54]: 相反,GAN 模式丢弃。它们,就像,丢弃少数类,只做非常常见的那些。这就是为什么这种效应不会发生,对吧?就像,为了生成非常长的字符串而不出错,它们需要,就像,极其保守,因为错误发生时很容易看到。当像,一个看起来正确的微妙事情发生时,很难看到。而这种校准,就像,对字符串的概率分布来说完全是毒药。
Swyx [00:08:22]: 是的。
Diogo Almeida [00:08:23]: 而且这是一个很微妙的观点,就像,我认为这就是为什么这种情况不会发生,这就是为什么字符串在决策方面如此糟糕,或者,让字符串模型超载用于决策,就像,是一段糟糕的时光。
Yann LeCun、JEPA、缩放定律与实践研究
Swyx [00:08:38]: 既然我们谈到了 Yann,你同意他的解决方案——也就是类似世界模型、JEPA 类型的嵌入方法——是正确的解决之道吗?基本上,就像,它可能失败的原因之一是,你试图在 token 输出上进行推理,然后,然后又循环回来,继续,一直继续直到达到类似句尾的地方。就像,那是,而他的解决方案是 JEPA,对吧?
Diogo Almeida [00:09:02]: 是的。
Swyx [00:09:02]: 也就是,联合野心,Diogo Almeida [00:09:04]: 是的
Swyx [00:09:04]: 联合嵌入预测。所以,就像,那是解决之道吗,或者,你有,你有对此的看法吗?
Diogo Almeida [00:09:10]: 哦,天哪。我可能不应该过多谈论机器学习的内部细节,但我会说,我的品牌,除了疯狂之外,是实用。
Diogo Almeida [00:09:20]: 就像,即使我在这里的观点也是实用的。而且就像,我。我是缩放定律的粉丝吗?看情况。这取——这,这,这,就像,这。缩放定律告诉你,对于投入的量,你在某件事上能变得多好。
Diogo Almeida [00:09:33]: 缩放定律确实意味着指数级更多的资源,通常换来次线性的收益,这看起来是一笔糟糕的投资,除非那些,就像,线性收益,就像,真的很有价值。但这一切。对我来说,这一切都关乎,就像,我们能用手头的东西做什么来产生尽可能大的他妈的影响?我可以骂人。
Swyx [00:09:51]: 是的。
Diogo Almeida [00:09:51]: 是的。
Swyx [00:09:52]: 是的。
Diogo Almeida [00:09:52]: 是的。
Swyx [00:09:53]: 我们,我们,我们被批准面向成年人了。
Diogo Almeida [00:09:54]: 当然啦。
Swyx [00:09:55]: 而且如果你之后想深入的话,我们还有一个缩放定律的东西。
Diogo Almeida [00:09:58]: 哦,如果我们可以的话,我可以。看,那部分现在不是特别相关。
Swyx [00:10:02]: 是的。
Diogo Almeida [00:10:03]: 我实际上。如果你想深入我最痛苦的教训,我认为那更相关。
Swyx [00:10:06]: 好的。
Diogo Almeida [00:10:06]: 但就像,对我来说,我一切都关乎,就像,语用学。而且我认为 JEPA 的东西是非常酷的早期研究。我真的很喜欢很棒的研究。它现在实用了吗?
Diogo Almeida [00:10:21]: 可能不应该说。但就像,只是有很多。
Diogo Almeida [00:10:29]: 我只是认为,现在整个研究世界里散落着如此多未经雕琢的钻石,它们还没有被抛光,因为人们不知道如何,就像,做正确的任务。而且我认为我们的发布所做的,它。它是否让我们作为一家公司启动起来?就像,是的。它对我们作为一家公司会很好吗?是的。我认为它会对这个方向,就像,程序化 AI 的方向,更加伟大。会有,就像,一场在我们之上的淘金热,因为,就像,软件是超级他妈的充满活力的。但我认为也会有一场与我们平行的淘金热,就像,我们可以用所有不同的方式暴露东西,让软件更强大,这样人们就能做出更酷的东西。然后我们就回到了,就像,早期互联网的能量?
Swyx [00:11:12]: 是的。
Diogo Almeida [00:11:12]: 我觉得这就是为什么,Twitter 上就只是,“Jev.”?就是,就是。这就像一场派对
Swyx [00:11:18]: 这很鼓舞人心,因为它,它,就像,和我们习惯的那么不同,我们习惯的是,“抱歉你不能做这个,但我们做缩放定律,只有大实验室才能做,”对吧?
Diogo Almeida [00:11:28]: 那个。其实,如果我。我,如果可以的话,我要跑个题。
Swyx [00:11:32]: 好啊。
Diogo Almeida [00:11:32]: 我觉得你可能会喜欢这个。
Swyx [00:11:33]: 真的吗?我们都跑了五个题了。挺好的。挺有趣的。是啊。
Diogo Almeida [00:11:35]: 哦,是啊。我跑题跑得都迷路了。
Swyx [00:11:37]: 这对听众来说会很难理清楚,但他们会理清楚的。没事。
安全对齐、拒绝与 API 理念
Diogo Almeida [00:11:40]: 是啊,我们可以在后期剪辑。
Swyx [00:11:40]: 这是我的回应。是啊。
Diogo Almeida [00:11:41]: 所以 Discord 上有个热门话题,人们一直问我,我还没时间解释,就是我为什么反对安全对齐,以及我们为什么不拒绝?我并不反对安全这个原则,但我认为安全对齐通常与用户不一致。而拒绝就只是,就像,显然是一种类型错误。就像,如果你是一个人,你在和,比如,一个机器人或什么的聊天,你在云端写代码,然后发生了拒绝,就像,“抱歉,我不能读取 DNA.py。”那真是烦人的时刻。真烦——就,就很烦
Diogo Almeida [00:12:18]: 对吧?但你可以应付它,对吧?而且因为斯德哥尔摩综合征,你被迫应付它。
Diogo Almeida [00:12:23]: 我也有这方面的故事。我需要在这里再深入跑个题。但就像,如果你想要这个作为后台运行的依赖项,如果那个拒绝了会怎样?如果别人在用那个依赖项呢?他们不知道那个系统是什么。就像,你想要软件仅仅因为用户在里面发了,比如,一条奇怪的消息就随机崩溃吗?
Diogo Almeida [00:12:42]: 就像,那真是,就像,彻头彻尾的疯狂。它来自一个,就像,那些不懂软件、不懂编程的人的地方,而且就像,他们痴迷于,就像,我相信这个,就像,AI 同事这种不用马的马车,而不是去发掘,就像,AI 的全部力量。
Swyx [00:13:01]: 说得有道理。
Diogo Almeida [00:13:01]: 是啊。
Swyx [00:13:01]: 你想要的是那种核心内核,到处都能用。
Diogo Almeida [00:13:05]: 对。正是如此。就像,认知核心,对吧?
Swyx [00:13:07]: 是啊。
Diogo Almeida [00:13:08]: 而且你需要这个东西是——就像,如此通用,如此为其用例优化。你想要它,就像,你想要它在所有未来的用例上都能用,在人们正在做的所有奇怪玩意儿上都能用。
Swyx [00:13:19]: 是啊。
Diogo Almeida [00:13:19]: 我们显然没有在任何那些东西上训练过。它能用很令人惊讶吗?不,因为我们在更奇怪的东西上训练过,我的朋友。
Diogo Almeida [00:13:28]: 所以。但关于,就像,安全对齐,先跑个题。
Swyx [00:13:32]: 好。
Diogo Almeida [00:13:32]: 在我看来,安全对齐对产品来说是有意义的,比如 ChatGPT 和 Claude。安全对齐和能力对齐的区别在于,能力对齐是关于做用户想让它做的事。这对软件工程师来说太棒了。他们希望自己的东西能完成该做的事,而且它越可预测,他们需要测试和摆弄它的次数就越少。Jeb 还远没达到那个程度。它有可能达到,但要想让它像数据库查询那样好,好到你根本不用去想它,你需要多得多的可靠性。它就在那里,当你需要智能的时候。但安全对齐恰恰相反,它不是遵循指令。它是当你想要遵循别人的指令时,比如 OpenAI 和 Anthropic 的指令。
Swyx [00:14:13]: RAG 的价值栈。
Diogo Almeida [00:14:14]: 没错。这对产品来说非常合理。再说一次,ChatGPT 就应该这样做。如果——如果他们不想用 ChatGPT 做某些不适合工作场合的角色扮演,那是他们的事,因为也许那正是他们有父母和孩子的用户想要的。那没问题。但在 API 里,那就太疯狂了,对吧?那完全不可接受,因为人们需要围绕这个来编程,而那太反用户了,简直。它。我。哈。我可能是个容易生气的人,所以我应该试着冷静下来。
Swyx [00:14:52]: 人们能感受到你的热情,我觉得这非常好。我要给你的一个反驳是,如果我们用它来杀人呢,对吧?那才是真正的问题。不适合工作场合的东西,它是私人的、个人的,无所谓。但没错,我们会把它用在战争中。而那正是公司可以合理地希望自己的 API 不被用于的事情。
Diogo Almeida [00:15:14]: 我明白。我认为在某些务实的地方可以持有这种观点。但我个人不认为通用技术的基础是那样的地方。
Diogo Almeida [00:15:27]: 比如,我会希望我们的东西不被用来杀人吗?显然会。我会希望它被用于世界上各种各样伟大的事情吗?显然会。我会为此施加影响吗?会。我会在技术层面这样做吗?绝对不会,因为那会割裂智能。每一次你试图让它过拟合到某些奇怪的东西上,你都在越来越多地割裂它的智能。而且这些东西已经被割裂到了——它们现在被割裂得太厉害了。
Swyx [00:15:54]: 是的。
Diogo Almeida [00:15:54]: 所以,而且更进一步说,对我来说,我认为智能更像是一个数据库,而不是一个同事。我不认为数据库有责任去检查它们是否被用于,比如,什么不太好的事情?比如 CIA。其实,我不太清楚 CIA 到底做什么。你可以想象。你可以想象,杀害那些甚至不是坏人的人之类的。
Diogo Almeida [00:16:21]: 而且,我不认为这是数据库的责任。此外,让我觉得奇怪的是,当人们在 Slack 上注册我们的产品时,他们会说:“嘿,我们要部署这个。我们能部署这个东西吗?”我只能说:“兄弟,我们是一个 API。你是开发者。这不关我的事,”对吧?就像,你甚至不应该知道整个任务是什么
Swyx [00:16:46]: 是的
Diogo Almeida [00:16:46]: 因为它应该被分解成小事情。我们不应该能够知道下游用户在做什么,这是一个很好的边界,可以给软件工程师最大的权力。理想情况下,他们用它来做好的事情,理想情况下,我们可以帮助他们,我们已经讨论过做开源和慈善等等。我们现在完全没有时间做其他任何事情。但是,只要我负责,他们就会从技术层中消除任何这种偏见。
隐私、基准测试和信任智能
Swyx [00:17:11]: 是的,那很好。既然我们谈到这个话题,让我们也简要谈谈你的隐私政策、服务条款,这引起了一些
Diogo Almeida [00:17:18]: 哦
Swyx [00:17:18]: 误解。我想先澄清这一点。
Diogo Almeida [00:17:21]: 当然。
Swyx [00:17:21]: 我认为这可能需要你用两句话来解释,比如,你不会。你对你的 API 并没有那么严格限制。就像,显然
Diogo Almeida [00:17:27]: 哦,是的。哦,是的,所以是的
Swyx [00:17:27]: 从意识形态上讲,你非常认真地阐述了你作为平台的角色。
Diogo Almeida [00:17:30]: 是的。是的。我不知道你指的是什么,但是,这。我看到了一些关于基准测试的事情。
Swyx [00:17:38]: 是的。
Diogo Almeida [00:17:38]: 就像,显然我们不会阻止人们做。哦,天哪,我应该小心我说的话。我意识到
Swyx [00:17:43]: 不,你说过,你公开说过
Diogo Almeida [00:17:44]: 是的
Swyx [00:17:44]: 那是在预览期。你没有在发布时把它去掉。
Diogo Almeida [00:17:47]: 是的。好的。
Swyx [00:17:47]: 现在你要把它去掉。
Diogo Almeida [00:17:48]: 所以团队正在做一些
Swyx [00:17:49]: 是的
Diogo Almeida [00:17:49]: 我甚至不知道的事情,所以很高兴知道团队传达了这一点。我让他们与律师核实一下。
Swyx [00:17:54]: 是的。
Diogo Almeida [00:17:54]: 就像,我们显然不会阻止人们做那种事情。我非常赞成。所以我非常反对公开基准测试。我非常赞成——我对作为代理的私有基准测试持中等态度。我
Swyx [00:18:09]: 所以你担心饱和,或者,比如,在公开基准测试上训练?所以,这很容易作弊。
Diogo Almeida [00:18:15]: 不仅容易作弊,还有很多漏洞。所以我认为我们是。或者任何与我们竞争的人,大致上都有。就像,你可以说,比如
Swyx [00:18:28]: 大概有 50 个 Jev 克隆,是的。
Diogo Almeida [00:18:30]: 嗯,当然。
Swyx [00:18:31]: 是的。
Diogo Almeida [00:18:32]: 嗯,这些。假设存在竞争。
Swyx [00:18:34]: 我们会谈论那些。是的。
Diogo Almeida [00:18:34]: 或者我们假设,两年后会出现一个行业,里面的人在做和我们类似的事情。我们卖的是每单位某种东西的智能,比如每美元或每秒。没有人。就像,人们痴迷于成本和速度。我相信那是。这很酷,但真正重要的是智能。成本和速度就像是,是不好的东西。你为某样东西付钱,你需要拿回那个东西,而智能才是真正重要的。智能的问题在于它有一种难以言喻的特质,对吧?就像好模型的“气味”。比如我们发布后两小时发生的事情,实际上比视频传播得广得多,就像是,“天哪。”
Swyx [00:19:16]: 这实际上可用了。
Diogo Almeida [00:19:17]: 它。嗯
Swyx [00:19:17]: 是的。
Diogo Almeida [00:19:17]: 它,就像,超越了那个。
Swyx [00:19:20]: 是的。
Diogo Almeida [00:19:20]: 就像,那个。呼,发布太疯狂了,人们真的能感觉到我们对此有多在意,而这正是我认为这件事长期的关键。我认为公开基准测试与此背道而驰。就像,它们是一种让人们信任智能的方式,因为智能有一种难以言喻的特质,但公开基准测试极其容易被操纵。即使他们试图不这样做,他们仍然会。就像,在过去,每个实验室都有一个团队收集看起来像 MMLU 的数据,让它看起来更好,这只不过是多了一些步骤的基准测试。
Diogo Almeida [00:19:58]: 所以我相信,从长远来看,需要的是感觉和信任,直到你把它放入工作流中,针对那个工作流进行评估和测量,并对它在真正重要的工作流上的表现有自己的感觉。我们的工作是不断推进可靠性的“九个九”。这就像是我们作为一家公司需要做的事情中永远存在的一部分,我们需要尽一切努力让人们知道这是我们非常关心的事情。就像,如果我们想的话,我们本可以在一年半前发布 Jev,如果我们想让它笨一点的话。
最苦涩的教训:任务、数据和北极星
Swyx [00:20:34]: 哦。
Diogo Almeida [00:20:34]: 它。就像,那个。我最苦涩的教训,对吧?就像架构和 是的。
Swyx [00:20:40]: 我会提出来
Diogo Almeida [00:20:40]: 当然
Swyx [00:20:41]: 既然你,既然你谈到了它,这里。
Diogo Almeida [00:20:43]: 当然。就,就像 Sutton 说的,算法大致上胜过计算。数据显然比计算重要得多。做正确的任务,拥有北极星是最难、最重要的事情。这在 LLM 领域已经发生了两次,对吧?也许 2.2 次。有 RLHF,它把任务转向了指令遵循。没人意识到那是可能的。RLVR 做了,就像,一个微小的,就像,对方向的编辑,现在是我们,对吧?RLCD。我们有了一个新任务,目标是程序在循环中。而且,是的,数据重要得
Swyx [00:21:28]: 对
Diogo Almeida [00:21:28]: 难以置信地多。
Swyx [00:21:29]: 所以
Diogo Almeida [00:21:29]: 就像,我无法,我无法更少地强调它。
Swyx [00:21:31]: 是的,你认为自己是一个数据实验室,而不是,就像,一个模型实验室。那是
Diogo Almeida [00:21:35]: 绝对
Swyx [00:21:35]: 某个东西。这是你们用的措辞吗?
Diogo Almeida [00:21:37]: 是的。我们是。我们永远都会,像,如此在意数据。对我来说,模型能力就意味着数据。数据复杂得令人难以置信,而正是它决定了能否达到极致。就像,你根本想象不到数据能改变一切到什么程度。数据太重要了。
TypeSafe 作为数据实验室与合成数据策略
Swyx [00:21:57]: 是的。
Diogo Almeida [00:21:57]: 我的天。所以如果有人在找工作,我们正在招聘无限多的数据人员,真的是无限。
Swyx [00:22:04]: 什么才算一个好的数据人员?就像,显然是那种在意通读记录的人,不管是什么记录。你比如说,你说过,你们所有的数据都是合成的。
Diogo Almeida [00:22:15]: 没错。
Swyx [00:22:15]: 但这只是,像,触及表面,对吧?
Diogo Almeida [00:22:18]: 是的。
Swyx [00:22:19]: 就像,不是。就像,合成的,那又怎样,对吧?合成,但我们有人带着大量的品味和大量的用心去看,去看这些,阐明哪里不对,回去,重新生成。这就是如今一个好的数据人员该做的吗?
Diogo Almeida [00:22:31]: 让我试着弄清楚怎么讲。就像,这,这超级复杂,而且就像,我实际上是用一个我估计比这期播客最终时长还要长的演讲来给数据人员做入职培训的。所以我试着讲,像,高层次的东西。那么第一,我们不做人们那种合成数据。好吧,我会做。实际上,第零点是。数据和合成数据取决于你的任务。就像,你数据的形状。你任务的形状会改变数据。就像,RLVR 的数据有点像是环境,对吧?
Swyx [00:23:03]: 是的。
Diogo Almeida [00:23:04]: RLHF 的是人类反馈?每个任务都有自己独特的数据类型,而我们,当然,有我们自己独特的数据类型,对吧?所以第一,我们有那个。第二,我。我们不想在用户数据上训练的原因,即使我们能,对吧?就像,我们现在可能可以要求任何条款,而且它会。我们。我不知道那会不会有区别。我们真的不想要那个,因为无论如何,真实世界的数据有太多偏见。有,像,一种幂律,像,人们,像,问同样的事情,你最终会,像,过拟合到它上面,像,分裂到它上面,以及所有那些。第二,我们,像,瞄准的是,像,多年后一个完整的科幻未来,在那里,像,这些模型将会是,像,通用基础设施,一层又一层又一层,深入到技术栈深处,到,像,人们甚至无法想象的东西。就像,我想把我们的模型想成,像,有点像,LLM 是 UDP,我们的模型是 TCP。各种各样东西可以建在那之上,而我们需要能够搞定那些未来用例,这样软件开发者才能真正构建那些未来东西。而做到这一点的方式是,即使我们拥有当下的所有数据,我们也只会过拟合到当下,然后它就不会起作用。我们需要的是,像。
Diogo Almeida [00:24:21]: 这几乎感觉像是……他们才是艺术家?他们研究这个认知核心。我们的认知核心,嗯,比任何其他人的都平整得多。然后他们找出那些不平整的地方,然后以一种……的方式精准地处理它们。你永远无法完美地做到这一点,对吧?但他们处理的方式,是在每一个可能的维度上——过去、现在、未来——都解决了它。
Swyx [00:24:45]: 是通用情况,而不是特定情况。
Diogo Almeida [00:24:47]: 没错。而且,这每一次都需要大量的智能。
RLCD 与 RLHF:定义一项新任务
Swyx [00:24:50]: 好,我们之前提到了一点。你有点批评我的想法,说它非常受 RLVR 影响,这很公平。让我们实际提一下 RLCD。
Diogo Almeida [00:24:59]: 哦。
Swyx [00:24:59]: 显然,据我们所知,你有一些秘密配方。你实际上从未就此发表过论文或类似的东西。没有,对吧?
Diogo Almeida [00:25:05]: 对,还没有。
Swyx [00:25:06]: 但是,人们应该从中得到什么?比如,什么。你能给人们一些信心,让他们相信你不是为了听起来酷而编造术语吗?对我来说,有一件事是,校准,我确实认为它是一个。对我来说,嗯,很好理解,因为我们在播客里覆盖过它。
Diogo Almeida [00:25:22]: 是的。
Swyx [00:25:22]: 但我不明白你说 RLCD 与人们熟悉的东西相比是什么意思。
Diogo Almeida [00:25:26]: 这是个好问题。
Swyx [00:25:27]: 是的。
Diogo Almeida [00:25:27]: 实际上,我会给一个相关的问题。
Swyx [00:25:29]: 好。
Diogo Almeida [00:25:29]: 什么是 RLHF?
Swyx [00:25:31]: 好。
Diogo Almeida [00:25:31]: 对吧?实际上,RLHF 意味着多个不同的东西,对吧?
Swyx [00:25:34]: 好。
Diogo Almeida [00:25:34]: 比如,有最初的 RLHF。我想是,像 Paul Christiano 教机器人后空翻之类的。是不是有这么回事?
Swyx [00:25:42]: 是那个吗?
Diogo Almeida [00:25:43]: 那是原始的。
Swyx [00:25:44]: 我引用了 PPO 论文,但我不知道。
Diogo Almeida [00:25:46]: 所以,如果我没记错的话,PPO 不一定来自人类反馈。
Swyx [00:25:51]: 好。那是真的。
Diogo Almeida [00:25:52]: 但我相信,那是 OpenAI 对齐工作的一部分,可以教难以指定的输出,比如后空翻。我不是 100% 确定。然后实际上还有学习摘要。这是工作,由一群帮助了 instruct——并共同撰写了指令遵循论文的团队完成的,那是在语言模型上做 PPO。
Swyx [00:26:15]: 这是,抱歉。我在试图,试图。
Diogo Almeida [00:26:19]: 是的。
Swyx [00:26:19]: 试图操作这个东西。这是 2017 年。
Diogo Almeida [00:26:23]: 是的。
Swyx [00:26:23]: 对。
Diogo Almeida [00:26:23]: 我不是 100% 确定,但看起来相当正确。
Swyx [00:26:26]: 是的。
Diogo Almeida [00:26:26]: 如果它有,像机器人做后空翻之类的,可能就是它。是的。好,酷。我想我搞对了。太棒了。
Swyx [00:26:35]: 这就对了。
Diogo Almeida [00:26:36]: 是的。
Swyx [00:26:36]: 就是那个。
Diogo Almeida [00:26:36]: 所以当时的想法是,你能不能用它来做一些定义不明确的事情?所以那就像是第一版。第二版是那个学习总结的工作,就是OpenAI做的那个,实际上就是在语言模型上使用PPO来做一些定义不太明确的事情。这是人们称之为RLHF的另一件事,而我没有参与合著。
Diogo Almeida [00:26:57]: 哦,Dario在那儿。酷。太棒了。
Swyx [00:27:01]: 还有Radford。
Diogo Almeida [00:27:02]: 是的。向Alec和Ryan致敬。爱他们。
Swyx [00:27:04]: 是的。
Diogo Almeida [00:27:05]: 但我所指的RLHF是那个,哦,天哪。
Diogo Almeida [00:27:13]: 我会讲到
Swyx [00:27:14]: 你对此有评论,是的。
Diogo Almeida [00:27:15]: 我对那篇论文有评论,但我们已经深入太多题外话了。
Swyx [00:27:18]: 是的。
Diogo Almeida [00:27:18]: 所以真正让我。对我来说,我所称的RLHF是指令遵循的任务。它不是关于PPO的。那部分不重要。它是关于设定一个北极星,指明这是一个有价值的方向。这有点像Bitris教训的北极星。
Diogo Almeida [00:27:34]: 对我们来说,RLCD是这个新任务。它不是。我不把它看作行话。就像,我试图精确地沟通。只是说,“嘿,这是另一个北极星。”就像DPO及其所有后代也做RLHF一样,尽管没有使用那篇论文中的算法。
Swyx [00:27:55]: 所以清晰地陈述北极星是,可编程AI是一个,我真正抓住的词,移除人类在环中,Diogo Almeida [00:28:06]: 是的
Swyx [00:28:06]: 从。因为RLHF是调优
Diogo Almeida [00:28:09]: 是的
Swyx [00:28:09]: 为了这个,以便你可以自动化一切。
Diogo Almeida [00:28:11]: 是的。一切使得
Swyx [00:28:13]: 我在这个,在这个论点中,比如,北极星是什么,我漏掉了什么吗?
Diogo Almeida [00:28:17]: 有。那是。那是正确的。我在沟通中过于细致。一个细微之处是我们需要务实。我们需要意识到语言模型能做得非常好的事情。就像AI能做什么。
Diogo Almeida [00:28:30]: 对吧?就像,可能有程序化类型,它们酷毙了,但如果你。如果技术还没准备好。如果那没有出现在世界上,也不是悲剧。
为什么可编程AI重要
Swyx [00:28:41]: 是的。
Diogo Almeida [00:28:42]: 但对我来说,就像,前Jev世界是一个悲剧,因为——听起来很傲慢。听我说完。
Swyx [00:28:49]: 不。我强烈相信你。
Diogo Almeida [00:28:50]: 酷。听起来很傲慢,但就像,我在甚至拥有公司之前很久就有这种感觉。
Swyx [00:28:54]: 是的。我可以,我可以证明,Diogo Almeida [00:28:56]: 是的,我已经谈论这个很久了
Swyx [00:28:57]: 你在All Around Her说了这个,大概三年了。
Diogo Almeida [00:28:58]: 是的,我已经谈论这个很久了。我一直在说,因为我认为它会更容易。他们说他们不做事情是因为它们。它。它们容易。它们。是因为他们认为它容易,所以
Swyx [00:29:08]: 是的,没错
Diogo Almeida [00:29:09]: 类似那样。我认为它。整个项目会花一周。
Diogo Almeida [00:29:13]: 而我错得离谱。所以我非常抱歉,对 OpenAI 的每一个人,我当时是这么想的。我当时想,“天哪,我现在就要解决这个问题。”但就像,我觉得悲剧的地方在于。嗯,我觉得过度承诺、交付不足也是悲剧。而且,AI 在这个维度上极其极端。我认为 RLVR 是,主要的。嗯,RLVR 和 RLHF 都是这一点的极端肇事者。
Diogo Almeida [00:29:40]: 但对我来说,就像,那里就是有太多潜力了。就像,AI 显然非常聪明。我——聪明。我在我的演讲里很喜欢这一点,当我问人们,比如,“AI 怎么能聪明得如此难以置信?我们怎么能,比如,解决数学里的千禧年大奖难题,却仍然连最基础的工作都无法自动化?”就像,真正基础的机械性工作,那种。它并不需要,比如,极其聪明的人来做这个。这不是一份令人满足的工作。就像,这些人本可以做其他事情,但我们却需要他们做,比如,这种基——就像,超级基础——不令人满足的东西,因为,比如,我们还没法把它自动化,但我们有这台,比如,超强马力的自动化引擎,只是没有,比如,合适的插头之类的东西,去接入所有这些有经济价值的工作。而且,比如,如果 TypeSafe 整个公司消失了,也许人们要花,比如,一两年才能真正追上。我其实不知道要花多久。如果模型质量重要,那么我们会在很长一段时间里处于非常有利的位置。但它,就像,已经完成了,对吧?就像,那里,就像,这已经改变了,比如,技术史的路径。
Swyx [00:30:49]: 是的。
Diogo Almeida [00:30:49]: 而且,比如,我们会作为一个领域去探索那个空间。
Swyx [00:30:53]: 是的。我觉得,我绝对同意这一点。你创造了可能性。所以我觉得,如果我可以转述一下,好让人们也能理解,你不应该把 TypeSafe 和 Jev 的成功仅仅当成,“好吧,那是一种新的模型类型。现在我们做完了。我们回去照常营业。”就像,不。就像,实际上,还有,比如,另外五种模型类型你应该去探索,而且,比如,让一千朵花绽放。
Diogo Almeida [00:31:15]: 绝对。
Swyx [00:31:16]: 对吧?
Diogo Almeida [00:31:16]: 就像,早期互联网
Swyx [00:31:17]: 而且其中一些,其中一些你大概也会构建。
Diogo Almeida [00:31:18]: 当然,是的。
Swyx [00:31:19]: 是的。
Diogo Almeida [00:31:19]: 早期互联网的能量。我觉得这回到了技术乌托邦。它不再是那种,“哦,天哪,比如,有时候我的编码智能体能用,但,所有最好的那些都被内部囤起来了。”
Swyx [00:31:29]: 是的。
Diogo Almeida [00:31:30]: 对吧?就像,创造又回到了菜单上。
Diogo Almeida [00:31:34]: ?尽管这会是一个疯狂的世界,系好安全带。
Diogo Almeida [00:31:38]: 就是。而且我对此兴奋极了。
宣言、发布策略与早期互联网能量
Swyx [00:31:42]: 是的。而现在你有了资金和势头,可以去做你在那里设想的任何事情,我觉得,我觉得,在说了这么久这些事情之后,看到你拥有这些,是非常令人欣慰的
Diogo Almeida [00:31:53]: 是的
Swyx [00:31:54]: 但实际上是向世界展示。
Diogo Almeida [00:31:55]: 我知道。我只是。这样一直吊人胃口,真是件非常有趣的事。就像我的演讲,感觉像是个悬念,因为我没有说明自动化将如何发生。
Swyx [00:32:05]: 是的。
Diogo Almeida [00:32:06]: Sean 审阅了我们的宣言,他说:“这些部分有点模糊。”
Diogo Almeida [00:32:12]: 还问:“第一步是什么?智能模型是什么?”
Swyx [00:32:16]: 嗯,我问过你模型的事,你当时说:“是的,模型即将推出。”
Diogo Almeida [00:32:18]: 是的。
Swyx [00:32:18]: 而且,我主要反对的是“可组合”这个词,但“构建 prod.god”太棒了。
Diogo Almeida [00:32:24]: 谢谢。
Swyx [00:32:24]: 是的。
Diogo Almeida [00:32:25]: 我。我们真的团结一致。我想认为我们并不完全是像某些公司那样的邪教。
Diogo Almeida [00:32:32]: 但是,我们对我们正在做的事情感到兴奋,而且我们确实如此。就像,我的品牌是实用主义,我们所有人都非常非常实用。
Swyx [00:32:42]: 是的。
Diogo Almeida [00:32:42]: 这真的很棒。
Swyx [00:32:43]: 是的。所以这里。顺便说一下,这里是步骤,秘密大师计划,对吧?
Diogo Almeida [00:32:47]: 对。
Swyx [00:32:47]: 塑造,机器原生可组合 AI 的形态。
Diogo Almeida [00:32:49]: 制作秘密大师计划是你的主意,所以
Swyx [00:32:51]: 这是,这是埃隆那套。当他创办特斯拉时
Diogo Almeida [00:32:53]: 是的
Swyx [00:32:53]: 他说:“这就是我们要做的。”
Diogo Almeida [00:32:54]: 但我做了。是的。我给你官方认可。
Swyx [00:32:56]: 哦,谢谢。谢谢,谢谢。
Diogo Almeida [00:32:56]: 是的。
Swyx [00:32:56]: 谢谢。但是,你应该告诉我你还要做这个模型发布,因为你,就像,你告诉了我一半的故事,然后另一半,你当时没有末日演示。
Diogo Almeida [00:33:08]: 对。
Swyx [00:33:08]: 你没有任何数字给我。
Diogo Almeida [00:33:10]: 对。
Swyx [00:33:10]: 我当时想,“什么?”
Diogo Almeida [00:33:11]: 嗯,问题是我并不相信基准测试。
Swyx [00:33:13]: 没错。
Diogo Almeida [00:33:14]: 对吧?
Swyx [00:33:14]: 没错。
Diogo Almeida [00:33:14]: 所以,这是你需要去感受的东西,我认为这是建立长期信任的方式,即使它,就像,伤害了我们,伤害了我们很多?就像去年我们融资时,没人相信我们。
Diogo Almeida [00:33:27]: ?就像,他们只想要基准测试之类的,我们说:“我们不会那样做。我们有原则。我们会坚持我们的立场。那会奖励不良行为者。我不在乎你想要什么。这就是我们,我们坚持这一点。”所以抱歉。这不是
Swyx [00:33:43]: 不,是的。嗯,在某种程度上,我认为,就像,选择艰难的道路,它。但最终你会创建你想要工作的公司。
Diogo Almeida [00:33:49]: 对。
Swyx [00:33:50]: 对吧?否则,如果你出卖了,那么你只是在工作,就像 OpenAI 但和我的人一起,对吧?这就像。
Diogo Almeida [00:33:56]: 是的。是的。就像,我,显然我对此没有太多遗憾。
Swyx [00:34:01]: 是的。
Diogo Almeida [00:34:01]: 就像,结果好得令人难以置信。而且,我,那个。昨晚我谈到我离开 OpenAI 的原因时,情绪很激动,因为,实际上在发布之后我不得不改变了我的措辞。我原来的说法是:“如果真的发生了 AI 寒冬,而我没有尽我所能去避免它,我会认为自己负有个人责任,既对 RLHF 方向负责——我认为它确实加剧了过度承诺与交付不足之间的落差——也没有全力投入这件事,因为我认为这才是价值将会被大量印出来的地方。”所以。这真的很酷,因为我觉得
Diogo Almeida [00:34:47]: 我所担心的 AI 寒冬已经被避免了。就像,AI 会变得有用。它会被用于自动化。
Diogo Almeida [00:34:53]: 还不到一周,数据就已经无可辩驳了
Swyx [00:34:57]: 是的
Diogo Almeida [00:34:57]: 它确实被用于真正的工作,而且,这,这就是蛮荒西部。是的。
发布势头、Token、速率限制与开发者使用情况
Swyx [00:35:03]: 是的。你能——如果你脑子里有印象的话,你看到了什么数字?比如,注册量是多少?就是,你能分享的任何东西。
Diogo Almeida [00:35:11]: 其实我对所有事情并不是特别了解。团队才是告诉我这些事情的人。
Swyx [00:35:16]: 是的,而且我确信它每天都在变,对吧?
Diogo Almeida [00:35:17]: 它,它,Swyx [00:35:18]: 但是
Diogo Almeida [00:35:18]: 这有点疯狂
Swyx [00:35:19]: 如果有某个里程碑让你觉得,“嗯,对,这就是我们一直期望的一件事。我们达到了。”
Diogo Almeida [00:35:23]: 我会说我们通过的一个里程碑是每日 Token 量。
Swyx [00:35:27]: 不错。
Diogo Almeida [00:35:27]: 而且这不是那种转瞬即逝的每日 Token 量。
Swyx [00:35:32]: 是的。
Diogo Almeida [00:35:32]: 这是,即使在夜间,它也在持续训练,所以是机器在调用它,而不仅仅是人们在试用。
Diogo Almeida [00:35:39]: 所以这,这太酷了。每天一万亿 Token 是很大的量。
Swyx [00:35:45]: 是的。
Diogo Almeida [00:35:45]: 所以超越那个数字太棒了。注册量对我来说并不重要。而且实际上,如果我完全诚实的话,这是我们犯的一个小错误。Twitter 上的人称我们是营销天才之类的,但那只是我们自己。我们没有营销人员。招聘也是。我们只是做真实的、傻气的、不羁的自己,而且我们,我们只是,在拼命地把人们从等待名单中放出来。——我们的平台团队简直强得不可思议。我认为我们的正常运行时间比 Anthropic 有更多的九个九,同时还拥有史上最前所未有的发布。就像,这有点疯狂,所以
Swyx [00:36:21]: 是的
Diogo Almeida [00:36:21]: 就像,向他们致敬。
Swyx [00:36:22]: 是的。
Diogo Almeida [00:36:23]: 还有我们没意识到的事情。所以第一,等待名单,等待名单注册对一个开发者平台来说并不重要,在我看来?我猜其中很大一部分甚至不是开发者。所以他们进去,尝试一些查询,很多人不理解,因为他们不是在编程,对吧?就像,他们只是说,“什么?这不是聊天机器人。我的 ChatGPT 2 在哪里?”
Diogo Almeida [00:36:45]: 对吧?但如果,就像。我并没有精确计算过这个。我的感觉是,如果世界上每一个人,就像,只写几个查询,那和,就像,一个高级用户为了创造价值而写的 for 循环相比,那只是个舍入误差。
Swyx [00:37:01]: 是的。
Diogo Almeida [00:37:01]: 而我们在候补名单上没意识到的事情是,就像,我们可以直接把任何人从候补名单上移除。这没关系。可怕的部分是速率限制。然后一旦人们开始从中获得价值,他们就会想要越来越多的速率限制,因为这就是软件的本质,对吧?就像,你前期投入精力来指定你的例行任务,然后这个例行任务创造的价值超过投入的成本。然后现在你有了这个
Swyx [00:37:25]: 设置好就不用管了,是的。
Diogo Almeida [00:37:26]: 没错,是的。你在后台运行它。你把它变成其他东西的依赖项。你可以构建更高层次的东西。然后就像,你在世界上创造了如此多的价值。早期互联网的人可能没有想象到,就像,2000 年代初期互联网的奇妙之处,那还不算早期互联网。但就像,它是,它是通过,无意冒犯,可组合性
Swyx [00:37:47]: 不
Diogo Almeida [00:37:47]: 所有疯狂的事情都发生了,我真的想在我们的宣言中强调这一点。我们追求的是涌现。我们追求的是,就像,成为催化剂。我们想要赋能人们,我们会为此尽我们所能,不管是我穿着垃圾袋在我们的市政厅里开 Discord 也好,还是不开也好。
Swyx [00:38:05]: 还有播客和 Diogo Almeida [00:38:08]: 当然啦
Swyx [00:38:09]: 把这些都做了。
Diogo Almeida [00:38:09]: 绝对的。
Swyx [00:38:09]: 就像,因为我想要长内容,对吧?
Diogo Almeida [00:38:11]: 是的。
Swyx [00:38:12]: 就像,是的,我们会越过那些,一些表面的东西,然后我们会深入
Diogo Almeida [00:38:15]: 当然啦
Swyx [00:38:15]: 然后人们会真正信任并理解你的使命,就像,那些会产生共鸣的人最终会加入你或者,收购你。或者不,抱歉,作为,作为客户。
Diogo Almeida [00:38:27]: 哦,作为客户。
Swyx [00:38:28]: 作为客户,作为客户。
Diogo Almeida [00:38:28]: 好的,是的。那挺好笑的。抱歉。
Swyx [00:38:30]: 抱歉。我不是,我不是故意那么说的。但不,任何——一个版本,一个非常讨喜的版本,就像,你发布视频的 3600 万次观看。
Diogo Almeida [00:38:37]: 酷。现在到 3800 万了。
Swyx [00:38:39]: 是的,舍入误差。
Diogo Almeida [00:38:40]: 是的。
Swyx [00:38:40]: Navio 还有 74。Fable 5 有 57。所以就像,就,而且我没有,我没有做,就像,原始 ChatGPT 的统计,就像
Diogo Almeida [00:38:48]: 是的
Swyx [00:38:49]: 那个没有视频。
Diogo Almeida [00:38:50]: 是的。
Swyx [00:38:50]: 所以就像,排在那上面,对吧?
Diogo Almeida [00:38:52]: 是的。
Swyx [00:38:52]: 就像,就,就,就像,如果你要在 2026 年发布一个 Neolab,我觉得你现在,就像,排第一,这,就像,相当疯狂。
Diogo Almeida [00:38:58]: 是的。嗯,我其实更愿意。我确实有那件 T 恤,就像,你最喜欢的 Neola——最喜欢的 Neolab 最喜欢的 Neolab。
Swyx [00:39:05]: 哈。
Diogo Almeida [00:39:05]: 我他妈才不在乎是不是什么新实验室(Neolab)。我觉得当个新实验室……其实,我们有很多那种,呃,拿“新实验室”当梗来玩的调调。其中一个,我有的一个梗就是,像是有产品的新实验室,可实际上那根本不算新实验室。反正,我压根不在乎这个。
Swyx [00:39:20]: 对。
Diogo Almeida [00:39:20]: 我在乎的是成为一个可靠的开发平台。所以 Swyx [00:39:23]: 是的
Diogo Almeida [00:39:24]: 感谢这个比较,但就像
Swyx [00:39:25]: 嗯
Diogo Almeida [00:39:25]: 希望我们能超越它们,回到那种,像是,对开发者来说的革命性时刻,以及那种人们可以依赖和信任的稳定状态。
可靠性、稳健性与确定性
Swyx [00:39:35]: 对。为此,我觉得有一件事让我对你们印象深刻,就是,没错,你们确实谈论可靠性。我原以为主要是关于校准,就像我们谈论的 RLCD 那样。但实际上,它还关乎正常运行时间、可扩展性等等,对吧?这些都是同一类的东西。
Diogo Almeida [00:39:55]: 还有几个九。
Swyx [00:39:56]: 还有几个九。
Diogo Almeida [00:39:56]: 就像
Swyx [00:39:57]: 在我看来,正常运行时间就是。
Diogo Almeida [00:39:58]: 哦,但那只是其中一部分。但就像,可靠性还体现在这东西有多智能上。比如,它做你想让它做的事有多一致?我认为,那些大型推理模型非常聪明。在我看来,它们仍然缺乏可靠性。我觉得有很多用例,你——它们看起来应该足够聪明,能自动化它们的工作。自动化那项工作有经济激励,但它们仍然不够可靠,连实习生都不如,因为它们是为不同的事情优化的。所以,我认为存在能够信任输出的可靠性。而且我们也是。就像,有些可靠性维度我们还没达到,但我对此非常兴奋。
Swyx [00:40:38]: 是的。
Diogo Almeida [00:40:38]: 就像,我想在困难的工作之前先自动化简单的工作?我觉得这不过是常识。但对我来说,我们会足够。我不知道是否存在“足够可靠”这回事,但我想做到如此之好,以至于人们甚至不需要试模型就知道它能行。就像,那就像编程中的心流状态,对吧?就像,我只是在写查询,因为我需要这里的智能。而且,当遇到非平凡的分支时,我可以直接把它写成一个类型安全的系统1查询,然后从中得到结果,它就能准确分支。那该多好啊。那就是。那就是梦想。
Swyx [00:41:12]: 是的。
Diogo Almeida [00:41:12]: 而那将是,一场漫长的跋涉。
Swyx [00:41:16]: 是的。我们待会儿会聊聊你的 API 设计
Diogo Almeida [00:41:19]: 哦
Swyx [00:41:19]: 只是为了给大家举些例子,也许还有那些没走的路之类的。
Swyx [00:41:23]: 一开始我就在想的一个关于可靠性的问题是,我注意到没有种子。没有,所以基本上,同样的输入,我总能得到同样的输出吗?
Diogo Almeida [00:41:34]: 所以
Swyx [00:41:36]: 如果不能,为什么不能?
Diogo Almeida [00:41:37]: 哦,好问题。这其实是我们之间常见的问题。所以可靠性其实是个笼统的说法。就像,每当 AI 无法自动化某件事时,都是因为某种形式的可靠性问题。可能是类型安全。可能是确定性。也可能只是,它是不规则的,对吧?所以可靠性是个笼统的说法。我只是觉得它也是个笼统的说法,比如,什么是北极星。重新-确定性就是,相同的输入,相同的输出。我确实相信这对单元测试来说有点意思,但我认为那是错误的北极星。我相信鲁棒性才是人们
Diogo Almeida [00:42:16]: 我不想告诉人们他们真正想要什么,因为那样我会有点傲慢。
Diogo Almeida [00:42:19]: 我相信那是更重要的属性。你想要的是,给定相似的输入,得到相似的输出。而 LLM 有多么不可靠,真是有点疯狂。
Diogo Almeida [00:42:31]: 比如,我们测试这个的一种方式是,你把 UUID 放进,像小
Swyx [00:42:36]: 是的
Diogo Almeida [00:42:36]: 我想它们被称为 nonce 在提示中。你想要的是从所有这些中得到相似的输出,因为它在语义上确实是同一个问题,而那才是你真正想要的部分。那-就像,那种鲁棒性正是人们被 AI 做决策烧伤的地方。所以我认为那是。一个超级重要的属性。我们也可以有确定性。那是,那是可以实现的。就我所能,像,在脑海中为程序员建模的那样,它,我-它可能对某些用例有价值,所以请教育我,在评论或观点中。但我的。总的来说,这很容易。确定性是你可以,像,为了更好的成本而权衡的东西。就像,我们,我们一直想要处于智能每美元的前沿。我们正在做,像,绝对恶心的事情来达到那里。就像,这是,Diogo Almeida [00:43:32]: 我不该说这个,但没人在这里阻止我。
Swyx [00:43:37]: 如果你-你批准你自己的 PR。
Diogo Almeida [00:43:40]: 这家公司不是这样运作的。我相信这周,我的幕僚长 Kay 是科技界最有权势的人。
Swyx [00:43:49]: 是的。向 Kay 致敬,感谢组织这个。
Diogo Almeida [00:43:50]: 天哪
Swyx [00:43:51]: 是的。
Diogo Almeida [00:43:51]: 天哪。她真是太他妈能干和强大了。她太不可思议了。
Diogo Almeida [00:43:58]: 她很烂。别挖她。但所以我试着稍微过滤一下,但就像,人们告诉我,“别叫它模型的弗兰肯斯坦怪物,”但那有,像,负面含义。我认为弗兰肯斯坦怪物是,像,整个故事中的好人。它是无辜的,对吧?我没读过。好吧。
Diogo Almeida [00:44:18]: 我会,我会坦白。好吧。那。嗯,一个面部表情,我
Swyx [00:44:21]: 这是一个
Diogo Almeida [00:44:21]: 我的牌在桌上
Swyx [00:44:21]: 体面的 Jacob Elordi 电影,如果你想看
Diogo Almeida [00:44:24]: 我
Swyx [00:44:25]: 改编版。总之。
Diogo Almeida [00:44:26]: 那。你不知道我现在时间有多少。
Swyx [00:44:28]: 是的。
Diogo Almeida [00:44:29]: 我的优先事项是睡觉?
Swyx [00:44:31]: 开发者们。
Diogo Almeida [00:44:32]: 开发者,是的。开发者。但是,是的。它。我们确实会做一些绝对令人不齿的事情,以便在每美元智能的帕累托曲线上占据位置,而且我们会继续这样做。
Swyx [00:44:47]: 是的。
Diogo Almeida [00:44:47]: 我们会做一些疯狂的事情,我认为人们真的需要跳出框框思考。比如,我们之所以令人惊讶,部分原因就是,人们是在框框内思考的,而我们继续这样做。截至目前,我们显然在这方面是最好的,我们想继续在整个事情上保持最好。
Swyx [00:45:05]: 是的。
Diogo Almeida [00:45:05]: 所以等等,我们是从哪里跑题的?
Swyx [00:45:07]: 不。所以
Diogo Almeida [00:45:08]: 是的
Swyx [00:45:08]: 我问你的是,你们会有种子和确定性吗?
Diogo Almeida [00:45:11]: 哦,是的。所以
Swyx [00:45:11]: 然后你基本上定义了可靠性,还有
Diogo Almeida [00:45:14]: 还有鲁棒性
Swyx [00:45:15]: 你是怎么看的。是的。
Diogo Almeida [00:45:16]: 但是就像,确定——就像
Swyx [00:45:17]: 我有一个鲁棒性的例子,很,很快,我可以给你看。
Diogo Almeida [00:45:19]: 我很乐意。我只说一件事。
Swyx [00:45:21]: 是的。
Diogo Almeida [00:45:21]: 我们可以做一个确定性模型。
Swyx [00:45:22]: 没错。
Diogo Almeida [00:45:23]: 就像,我们很乐——如果人们能说服我们这是一件有价值的事情
Swyx [00:45:27]: 是的
Diogo Almeida [00:45:27]: 而且我们没有巨大的 GPU 短缺
Swyx [00:45:29]: 是的
Diogo Almeida [00:45:29]: 我们可以很乐意地做出所有这些模型。我们活着就是为了取悦。还有革——还有反抗,革命,Swyx [00:45:38]: 你会推翻一切,只不过你会以一种友好的方式来做。
Diogo Almeida [00:45:41]: 是的。
Swyx [00:45:41]: 然后找到
Diogo Almeida [00:45:42]: 所以就像,确定性是有可能的。
Swyx [00:45:44]: 是的。
Diogo Almeida [00:45:45]: 它只会让你得到更少的每美元智能。
Swyx [00:45:46]: 是的。好吧,只要看看 OpenAI 和 Anthropic 的轨迹,你就会。现在相信我,你会在同侪压力下被迫这样做。所以就像,即使人们。即使你告诉他们他们不需要它。他们仍然会想要它。所以就像,是的,这就是那件事的 TL;DR。
Diogo Almeida [00:46:01]: 好的。
Swyx [00:46:02]: 是的。
Diogo Almeida [00:46:02]: 我很乐意。也许有一天我们会看到那是怎么发生的。
Swyx [00:46:07]: 是的。
Diogo Almeida [00:46:07]: 有人告诉过我,他们说我们品牌的一部分就是不可动摇
Swyx [00:46:13]: 哈
Diogo Almeida [00:46:13]: 他们说那只是说固执的好听说法。
Swyx [00:46:15]: 固执,是的。
Diogo Almeida [00:46:16]: 是的,没错。而且我是一个非常固执的人。我不认为我们能做成这件事。
Swyx [00:46:19]: 是的。
Diogo Almeida [00:46:19]: 是的。
Swyx [00:46:19]: 不,但是。所以就像,我。好吧,但是我曾——我,就像,以前和你争论过。
Diogo Almeida [00:46:23]: 是的。
Swyx [00:46:24]: 而且我知道
Diogo Almeida [00:46:24]: 而且你在开发者这件事上每次都是对的。
Diogo Almeida [00:46:25]: 所以好吧,我放弃。你赢了。你赢了。我被说服了,我以前和你争论过。
Swyx [00:46:31]: 不,我只是说,就像,我认为你可以坚持自己的立场,同时,如果我给你正确的证据,你可以,不。你可以抛弃你的先验,然后说:“是的,就像,这对我来说确实有道理。”
Diogo Almeida [00:46:41]: 是的。
Swyx [00:46:41]: 所以就像,就相信你自己的直觉吧。
Diogo Almeida [00:46:44]: 是的。是的。
Swyx [00:46:44]: 我会提出一些
Diogo Almeida [00:46:45]: 但我怀疑,我们会长期受到 GPU 的限制。
Swyx [00:46:50]: 非常长。是的。
Diogo Almeida [00:46:50]: 任何每美元智能较低的东西意味着它消耗更多的 GPU
Swyx [00:46:56]: 是的
Diogo Almeida [00:46:56]: 为了相同的智能,这就像,我们的目标不是让公司加入。就像,这很有价值,但就像,我们的目标是让人们,就像,实验和做奇怪的事情。我们需要,就像。我们需要,就像,把它交到尽可能多的人手中,就像,为此开始,就像,加利福尼亚淘金热。
模型版本控制、LTS 和保持 API 稳定性
Swyx [00:47:14]: 我认为现在有。是的。
Diogo Almeida [00:47:16]: 是的。
Swyx [00:47:16]: 只是提醒一句。我就直说了
Diogo Almeida [00:47:19]: 哦,好的
Swyx [00:47:19]: 因为现在有人正在考虑这件事。
Swyx [00:47:21]: 那就是当你说“我们不会承诺确定性模型。我们会,我们会不惜一切代价追求每美元智能,而且我们一直——我们面临 GPU 限制”时,人们会认为你可能会量化你的模型,对吧?就像,无论你在发布时有什么,你可能会量化降低。为了降低质量,以释放内存或带宽或其他什么,对吧?
Swyx [00:47:42]: 所以你应该可能,有某种承诺,你不必现在做出
Diogo Almeida [00:47:47]: 是的
Swyx [00:47:48]: 关于,就像,“我们将在发布时保持模型质量。”人们,就像。所以就像当人们。当我们。你在 OpenAI 时,你发布了
Diogo Almeida [00:47:55]: 是的
Swyx [00:47:55]: 所有这些,所有这些 API,甚至 Claude 也是。就像,当他们首次发布模型时,模型字符串,并不总是保持相同的模型。
Diogo Almeida [00:48:04]: 是的。
Swyx [00:48:04]: 对吧?你的模型有版本控制。那很好。
Diogo Almeida [00:48:06]: 是的。
Swyx [00:48:06]: 但就像,你应该,你应该公开承诺某种,就像,一旦某个东西发布,我们就不改变它。
Diogo Almeida [00:48:11]: 我们部署模型时不会更改它们。那太疯狂了。我们在乎开发者。就——比如,如果你……如果……所以——做那样的事情,再说一次,这就是第一方产品和 API 的问题所在。这让你……在第一方产品里你想怎么做都行,对吧?比如,随他们去,只要能带来那种体验,那都没问题。但对于 API,你显然不能那么做。不过我要说,我们计划比许多人习惯的模型提供商快得多地推进事情。所以我们会以比人们想象中快得多的速度发布新模型,而且我们不承诺对模型提供长期支持,因为我们认为还有大量改进空间。所以存在这样一种可能:我们可能会暂时对当前的 Jev 1.13.0 提供 LTS。我们可能会这么做,因为用的人太多了,而且我知道开发者讨厌破坏依赖关系。另一种选择是让我们的机群碎片化,那对所有人来说都是一种非常糟糕的氛围。那会
Swyx [00:49:12]: 是啊,你可能会有一百个不同版本的模型。
Diogo Almeida [00:49:13]: 没错。而且如果我们迭代得非常快,那样的版本也会有很多。
Swyx [00:49:17]: 是啊。
Diogo Almeida [00:49:17]: 所以我们确实想要最终不仅有一个 LTS 支持的东西,长期支持。我们想要一种非常酷的方式来实现它。我们在这方面有一些研究性的东西正在酝酿,我认为那将会是有史以来最亲开发者的做法。
Swyx [00:49:34]: 是啊。
Diogo Almeida [00:49:35]: 但它还不是我们当前的模型,而且我不承诺我们能够保持完全相同的模型。它们每次都会变得更聪明,这是肯定的。
Swyx [00:49:43]: 是啊。
Diogo Almeida [00:49:43]: 而且我的感觉是,即使是我们已经足够聪明的模型迭代,在模型版本之间,变化往往比把模型调用两次的差异还要小。但当我们从那种参差不齐的状态跃升到令人惊叹的状态时,那才是巨大差异所在。
每美元智能 vs. 每秒智能
Swyx [00:50:01]: 是啊。有一点,对模型做 LTS 的一个美妙之处在于,实际上你还可以把它们移植到其他芯片上。
Swyx [00:50:08]: 我,我不知道你有没有想过这个。
Diogo Almeida [00:50:11]: 无可奉告。
Swyx [00:50:12]: 好吧。
Diogo Almeida [00:50:12]: 所以我关心的是每美元智能。
Swyx [00:50:14]: 是的。
Diogo Almeida [00:50:15]: 对吧?
Swyx [00:50:15]: 但还有速度。
Diogo Almeida [00:50:16]: 什么?
Swyx [00:50:17]: 速度也是。
Diogo Almeida [00:50:18]: 我们走着瞧。
Swyx [00:50:19]: 是啊。
Diogo Almeida [00:50:19]: 我们走着瞧。我
Swyx [00:50:20]: 这是。这是推理技术树的一整个部分,在过去一年里像爆炸一样发展,对吧?
Diogo Almeida [00:50:24]: 是啊。
Swyx [00:50:24]: 比如,你可以,你可以迁移到,比如,Cerebras
Diogo Almeida [00:50:27]: 是啊
Swyx [00:50:27]: 一个 Etched 或者别的什么,然后获得,比如,十万倍的加速。
Diogo Almeida [00:50:32]: 是的。我觉得,每秒智能是一个不同的指标,我们甚至讨论过像每美元每秒智能这样的东西,以及类似的指标。我对杰文斯悖论是否会出现,或者至少杰文系列模型的猜测是,我在内部追着人们问的事情是,我不在乎它聪明多少,它必须处于帕累托前沿。所以,这就是杰文这个品牌的定位。它是在每美元智能方面最好的东西。至于每秒智能,我们拭目以待。我觉得这是一件很有趣的事情。我知道有很多行业极度依赖实时性的东西,对他们来说,每秒智能意味着大量的金钱。但是
Diogo Almeida [00:51:20]: 我们拭目以待。我很想两者都做,让市场以任何方式纠正我。
Swyx [00:51:26]: 是的。
Diogo Almeida [00:51:26]: ?
Swyx [00:51:26]: 是的。
Diogo Almeida [00:51:26]: 比如,我很想从人们那里获得信息。
Swyx [00:51:30]: 是的,完全同意。而且这不仅仅是关于实时,对吧?还关于规模,因为在规模上,每一微秒都会被乘以数十亿和数万亿倍。
Diogo Almeida [00:51:41]: 这取决于它在后台运行的程度,对吧?
Swyx [00:51:42]: 是的。
Diogo Almeida [00:51:42]: 比如,如果它是一个大的后台,比如数据库 MapReduce 查询,延迟可能不像从中获取智能的成本那么重要
Swyx [00:51:49]: 是的
Diogo Almeida [00:51:49]: 但是,如果它实际上是更实时性的东西,比如面向用户的,你有预算,比如在 100 毫秒和 1 毫秒之间,那完全是神奇的。实际上,即使你在 100 毫秒以下,如果你能把时间减半,那意味着你可以获得双倍的智能或顺序智能调用,从而获得一种非凡的体验。
内部评估与更快更便宜的前沿
Swyx [00:52:10]: 是的。
Diogo Almeida [00:52:10]: 所以没错,这现在肯定在发生。这超级酷。我喜欢每秒智能的用例,但我不认为那会是杰文的利基市场。
Swyx [00:52:21]: 好的。是的,有道理。
Diogo Almeida [00:52:22]: 是的。
Swyx [00:52:22]: 当思考更快更便宜的承诺时,通常其他模型提供的权衡是更快但更贵。
Diogo Almeida [00:52:32]: 是的。
Swyx [00:52:33]: 对吧?所以你。比如,我思考为什么杰文如此引起共鸣的原因之一是,你已经完成了象限中更快但更便宜的那一侧
Diogo Almeida [00:52:41]: 是的
Swyx [00:52:41]: 那是非常未被占据的
Diogo Almeida [00:52:43]: 是的
Swyx [00:52:43]: 同时保持智能,比如,某种程度上恒定。
Diogo Almeida [00:52:45]: 是的。它——我——那是一个非常关键的陈述,同时保持智能恒定。那是困难的部分,对吧?比如
Swyx [00:52:53]: 不幸的是。比如,基本上,你拒绝拥有,比如,做任何公开基准测试,或者你不喜欢任何关于它的公开基准测试
Diogo Almeida [00:52:59]: 但我会的。我实际上尝试过
Swyx [00:53:00]: 但你需要一些内部感觉。
Diogo Almeida [00:53:02]: 再说一遍?
Swyx [00:53:02]: 你需要对这一点有一些内在的感觉——这个
Diogo Almeida [00:53:03]: 哦,那当然。
Swyx [00:53:04]: 是的。
Diogo Almeida [00:53:04]: 当然。我们有自己的内部评估,这是肯定的。
Swyx [00:53:08]: 是的。
Diogo Almeida [00:53:08]: 但要做到不钻这些评估的空子,需要极大的自律,而且这必须是一个最高级别的优先事项。
Swyx [00:53:14]: 是的。
Diogo Almeida [00:53:14]: 我们当然会这么做,对吧?
Swyx [00:53:15]: 是的。
Diogo Almeida [00:53:15]: 不然我们怎么能保证我们的模型处于每美元智能的帕累托前沿上呢?
Diogo Almeida [00:53:20]: 对吧?我们又不是在盲目飞行,对吧?如果我们用不同的成本或者其他什么做出完全奇怪的东西,我们怎么比较它们呢?我们把它们画出来然后得到。你。我们试着弄清楚,什么对用户来说是最好的。
Swyx [00:53:32]: 是的。
Diogo Almeida [00:53:32]: 所以我们肯定会衡量它们。我并不反对衡量。但当你存在任何其他激励因素时,这就极其危险,而这是我唯一铁腕统治的事情。好吧,也许我的同事们会觉得我对很多事情都铁腕统治,但对我来说,不欺骗自己关于我们的模型有多聪明,是其中最重要的事情之一。
Swyx [00:53:57]: 是的。
Diogo Almeida [00:53:57]: 我们需要追求真相。
Swyx [00:53:58]: 是的。是的。同意,同意。好的,我想过一下一些关于 API 选择的细节。
API 原语:Choice、Score 和 Noulli
Diogo Almeida [00:54:04]: 哦。
Swyx [00:54:04]: 主要是因为这是唯一一个会问你这类问题的播客。
Diogo Almeida [00:54:07]: 哦,太对了。太对了。
Swyx [00:54:08]: 所以你有三个原语。
Diogo Almeida [00:54:10]: 是的。
Swyx [00:54:10]: Choice、score、know。首先,know,这是从哪来的?
Swyx [00:54:14]: 这是文献里的一个术语还是什么?
Diogo Almeida [00:54:17]: 现在是了。
Swyx [00:54:18]: 是的。
Diogo Almeida [00:54:19]: 我们为此争论了很多。我们为此争论了很多。它是它是布尔式的,对吧?就像真、假。它是
Swyx [00:54:32]: 但它是连续的。
Diogo Almeida [00:54:33]: 是的,没错。所以首先,这个名字的来源是 Bernoulli。
Diogo Almeida [00:54:39]: 是的。所以它——这就是为什么它甚至拼写得那么奇怪。那是 Bernoulli 这个名字的一个子集,来自伯努利概率,对吧?这实际上就是它。所以这就是它的来源。我们为此争论了很多。我们喜欢 PBool,我们喜欢 Pool。我们想——我们想叫它 pool party,但后来没人让我这么叫。我们为此还有一堆其他的争论。
Diogo Almeida [00:55:04]: 而 Noulli,我们认为是最好的。我们的理由是,这实际上和 Jev 也是一样的,我们认为我们是一群不羁、疯狂的人,而程序员不在乎。就像如果 Jev 只是一个字符串,我们没指望它能流行起来,甚至没指望有双关语之类的,对吧?实际上,内部对这个名字有很多厌恶。他们都道歉了,除了一个人。
Swyx [00:55:33]: 还在坚持。
Diogo Almeida [00:55:33]: 是的。我们共同的朋友。
Swyx [00:55:36]: 好的。
Diogo Almeida [00:55:37]: 是的。
Swyx [00:55:38]: 我为此尊重她。
Diogo Almeida [00:55:39]: 是的。是的。她希望 Jev 被称为 Meow。
Swyx [00:55:44]: 她当然会。
Diogo Almeida [00:55:45]: 是的,当然。
Swyx [00:55:46]: 好的。
Diogo Almeida [00:55:46]: 就像她的父亲一样,是的。
Swyx [00:55:47]: 你在那里赢了,你在那里赢了。
Diogo Almeida [00:55:49]: 但是,是的,Noulli 是。我们必须为这个东西做一个新的概念,因为如果它是一个 Bool,对人们来说会令人困惑。所以实际上,这三个都是新概念。这些不是编程中存在的类型,这是有意的,因为它们非常接近类型,但并不完全是。分数不是整数。所以如果你有,比如,Instructor 或 Pydantic 或其他什么将整数或浮点数映射到分数,你会有点被搞糊涂?而且,我们真的在清晰度方面犯了错误,而不是在让人们容易理解发生了什么方面。
Swyx [00:56:24]: 你不担心这个吗?你不希望事情直接集成到人们已经在使用的东西中吗?
Diogo Almeida [00:56:30]: 是的。是的,我们确实希望。而且实际上,我认为,Swyx [00:56:34]: 你有与其他 SDK 等的集成。
Diogo Almeida [00:56:36]: 是的。
Swyx [00:56:36]: 但是你有——抱歉,你有自己的 SDK。
Diogo Almeida [00:56:38]: 是的。
Swyx [00:56:38]: 但通常,例如,作为一个开发者关系人员,我会非常执着。就像,是的,这里是如何使用 Jev 与 Instructor。
Diogo Almeida [00:56:46]: 是的。
Swyx [00:56:46]: 这里是你如何。那种东西。
Diogo Almeida [00:56:49]: 我们可能在某处有那个。我在所有事情上都落后了。
Swyx [00:56:53]: 社区里有人会为你做的。
Diogo Almeida [00:56:54]: 哦,是的。是的。
Swyx [00:56:54]: 不是因为你成功了。人们会说,“哦,那很酷。”
Diogo Almeida [00:56:57]: 酷。
Swyx [00:56:57]: 但是,无论如何
Diogo Almeida [00:56:59]: 我也不认为那是二元的。
Swyx [00:57:00]: 是的。
Diogo Almeida [00:57:01]: 我实际上把成功看作一个分数,总有更多可以攀登
Swyx [00:57:04]: 是的
Diogo Almeida [00:57:04]: 在,比如,我们能多大程度地,比如,为我们的社区在那里,只是为了清楚。而且我。这一部分很有压力,因为我没有审查文档,而且它们不断变化。
Swyx [00:57:15]: 好的。但是
Diogo Almeida [00:57:16]: 但对我来说,分数确实存在。所以分数类似于,比如,LM 判断。
Diogo Almeida [00:57:21]: 对吧?所以就像,如果你想称之为,比如,一个判断,我想你可以。但是,就像,那是,就像,人们已经使用这种类型的东西的方式,对吧?就像,也许一个 Noulli 可以,比如,是一个概率,但对我们来说一切都是概率。而一个选择实际上最接近函数调用,但函数调用是,比如,一个极其恶心的东西,如果你想要 OpenAI 的汁、酱、茶,那个。我们稍后应该回到那个。就像,一个选择只是,比如,暴露,比如,一个 switch match 语句的正确方式
Swyx [00:57:57]: 是的
Diogo Almeida [00:57:57]: 在代码中。
Swyx [00:57:57]: 所以它,比如,干净地映射到一个枚举。
Diogo Almeida [00:58:00]: 是的。
Swyx [00:58:00]: 而且你可以选择将它水合为一个函数,如果你愿意。
Diogo Almeida [00:58:02]: 是的。而且就像,在枚举中,choice 是其中重要的部分。
Swyx [00:58:06]: 是的。
Diogo Almeida [00:58:06]: 而且实际上,我认为这些都映射到编程原语,比如 choice 映射到枚举上的 switch 语句。
Swyx [00:58:13]: 哈。
Diogo Almeida [00:58:14]: Noulli 映射到 if 语句。
Swyx [00:58:15]: 是的。
Diogo Almeida [00:58:16]: 而分数映射到排序或大于/小于的阈值处理。
Swyx [00:58:21]: 好的。
Diogo Almeida [00:58:21]: 这一直是愿景所在。就像,会有更多类型,它们将映射到编程原语。
Swyx [00:58:28]: 是的。还有其他。所以你想讨论任何细微差别吗?实际上,这是为那些决定真正投资 Jev 的人准备的。你是专家,对吧?我只是想为他们提供更多关于 API 选择、如何使用这些内容的背景,比如 legends、confidence,在你的测试中有多关键,如何。就像,任何你想提供给人们的专业提示
结构化输入和 AI 原生编程
Diogo Almeida [00:58:56]: 是的
Swyx [00:58:56]: 当他们处于这个层面时。
Diogo Almeida [00:58:58]: 谢谢。我喜欢这个。不。这是
Swyx [00:59:00]: 这就是我们在这里的原因。
Diogo Almeida [00:59:01]: 当然。我没想到这个。而且实际上,我。没有人问过我这个问题,大概几个月了,当我正在入职我们的 DevRel 时。
Swyx [00:59:10]: 好的。
Diogo Almeida [00:59:10]: 太棒了。所以我们的模型设计是为了在未来深入计算机程序的内部。我们真诚地相信这将比人们今天考虑的任何东西都要庞大得多。我们的模型可能还没有准备好,但我们正在为那个未来不断努力。它在这些浅层任务上永远不会足够好。抱歉。它永远不会——就像,我们不会只是继续攀登浅层任务。我们想要深入程序的内部,因为那是使软件强大的方式。所有——所有类型在我们的,这实际上是一个输出。
Diogo Almeida [00:59:47]: 但是所有,所有部分,比如输入,比如状态、指令、标准,所有这些都可以是结构化的 JSON 对象。
Diogo Almeida [00:59:58]: 这样一来,程序就能把它们插入到正确的位置,你就不需要把东西塞进模板里了。没错。所以如果有的话。我觉得人们没有充分理解这一部分,他们以为全都是字符串。这也没关系。但这些都是有意义的。我想说,如果你在使用模板,比如把它变成系统消息之类的,那你就是在用旧的方式思考?我们应该让东西更容易被计算机理解,因为那种结构是真实存在的,对吧?就像在编程语言里,如果你把所有的数字都放进去,然后把它传进去,再把它变成字符串,那会很奇怪。通常,你这么做是为了打印输出,因为有人的参与,对吧?但在计算机内部,你希望传递的是语义完整的嵌套结构。我们真的会优化我们的模型。模型在这方面已经相当优化了,但问题是每一个不同的嵌套层级都更难推理,我们真的在朝这个方向努力。我认为人们应该继续朝这个方向努力,因为这让代码更加易读、优美,而且对实现细节保持不可知。就像,这是我的状态,这是我的函数状态。把它想象成一个 AI 函数。我的状态的哪些子集——也就是你可用的所有变量——应该传进来?系统消息就像恶心的全局变量,你把所有东西都塞进去,然后你把所有这些
Swyx [01:01:21]: 垃圾,是的
Diogo Almeida [01:01:22]: 指令一次性放进去。然后你希望每一条指令都能被准确执行,而不是并行地提出问题。
Swyx [01:01:29]: 好的。
Diogo Almeida [01:01:30]: 而且,我建议——我说这话真的不是从赚钱的角度。我真的建议问很多很多问题。把它们拆开,让它们更小,真正地分解。不管模型今天能不能做到,我相信这周发生的事情最大的救赎将是人们的代码库、AI 代码库会变得好得多。如果你把问题分解成简单的决策,每一件事都是极其可评估的。就像,之前的 AI 是一个大的系统消息,然后也许你有另一个大的 AI
分解、验证与小型语义单元
Swyx [01:02:09]: 大的输出,是的
Diogo Almeida [01:02:10]: 来看看它是否真的做到了这一点。这太疯狂了?这有点疯狂。就像——那是我们的斯德哥尔摩综合征,对吧?但这有点疯狂。就像,如果你想说的是,“嘿,不要读这个子目录”,或者“不要把任何 API 密钥传给 DeepSeek”,或者其他什么,那应该基本上可以通过程序来保证。你永远无法对任何机器学习模型有保证,但通过分解,你实际上可以——你实际上可以测量它,对吧?就像
Swyx [01:02:37]: 是的,你可以验证它确实被调用了
Diogo Almeida [01:02:39]: 是的,而且就像,我们的模型,我们的模型——接口本身是如此可验证。这应该让人松一口气。
Diogo Almeida [01:02:46]: 就像,这,这,这,这只会带来好得多的工程实践。
Swyx [01:02:50]: 是的。我想我明白了。所以过去人们不这么做的原因之一,就是他们只会去调用一个小型的 LLM,对吧?
Diogo Almeida [01:02:59]: 对。
Swyx [01:02:59]: 而且相比把所有东西都分块处理,它仍然太慢,仍然太贵——我自己就完全这么做过。
Diogo Almeida [01:03:03]: 对。
Swyx [01:03:04]: 对吧?就像,我做过基准测试。这里有一个流水线,把所有东西都塞进系统提示里,然后只得到一个大的输出,对比把它拆分成一百个不同的东西。前者更慢、更贵
Diogo Almeida [01:03:13]: 是的
Swyx [01:03:13]: 效果也没那么好。
Diogo Almeida [01:03:13]: 对。
Swyx [01:03:14]: 对吧?
Diogo Almeida [01:03:14]: 而且这种情况会发生——是的。它,而且它,就像,超级不方便。它很笨重。为什么不干脆把它全都放在一起呢?你最终会在
Swyx [01:03:22]: 是的
Diogo Almeida [01:03:22]: 问题之间重复一些东西,所以它就像,也许,就像,效率低下之类的。但这样做的结果就是,它变得非常难以依赖。
Swyx [01:03:30]: 是的。
Diogo Almeida [01:03:30]: 而软件不需要在后台运行。如果我们的东西不能在后台运行,那会让我很伤心。
Swyx [01:03:37]: 你们有没有找到一种拆分东西的方法,是确实有效的,对比你们原本以为有效、但实际上无效的方法?
Diogo Almeida [01:03:45]: 有意思。
Swyx [01:03:46]: 因为,就像,既然你这么说了,人们现在就会去探索这个。就像,他们会把这个当作参考,然后说:“好吧,就像,这就是我应该使用 Jev 的方式。”
Diogo Almeida [01:03:53]: 对。
Swyx [01:03:53]: 那么问题就是,你如何拆分东西?
Diogo Almeida [01:03:57]: 有意思。我喜欢把东西拆分成它,就像,它最小的语义单元。
Swyx [01:04:03]: 是的。
Diogo Almeida [01:04:04]: 就像,最低层级的东西是什么?我尽量从不。我大概是所有人当中查询模型最多的。
Diogo Almeida [01:04:13]: 而且就像,我尽量。第一,在我的,在我的查询中,这,这更像是,更像是我提示东西的方式。就像,我把它做得非常结构化和明确。而在问题中,我总是。我喜欢反引号,但就像,它对所有情况都适用吗?就像,非常清楚地说明我指的是什么,因为我们希望模型非常字面化,因为当你编程时,你想要那些能被很好地遵循的指令。这就是编程的艺术所在,而 AI 所做的就是扩展那些可以被遵循的指令的种类。所以我是这么做的粉丝。我。
Diogo Almeida [01:04:47]: 有时候我会有点懒,我,就像,我有,就像,更多,就像,混合的东西,但就像,我认为对于,就像,真正大型的生产环境的东西,你就想,就像,不断添加更多问题,而你想让添加更多问题变得非常容易。对所有这些拆分都非常精确,然后让代码具有你想要的确切行为。如果我可以给,就像,一个很小的例子,就是,就像,拒绝,对吧?就像,我不会去谈我们为什么不拒绝。我可能已经谈过了。
Swyx [01:05:15]: 是的,你已经谈过了。
Diogo Almeida [01:05:15]: 就像一片模糊。但比如说,对于拒绝,我不认为你应该问,“我应该在这里拒绝吗?”?那真的很。它——我认为答案会相当不错,因为,就像,那是一个系统1兼容的任务。但我认为你最好,就像,问许多不同的独立问题,关于,就像,你可以拒绝的不同情况。因为与其必须,就像,仅仅基于你可以实际指定你想要的东西来猜测。而且美妙的是,我认为这,就像,真正非常美妙,如果你发现一种情况,就像,“哦,它没有因为这个原因拒绝。我没有指定任务的这一部分,”那太棒了。这就是软件工程的意义所在。就像,你通过添加那个问题、添加阈值来修复错误,也许记住那个作为测试用例,现在它就永远解决了。就像,你的软件不能忘记那个,就像,在提示中因为上下文腐烂。它就在那里,你可以,就像,永远继续测量那个。而且如果模型在某些这些事情上不完美,你可以根据真实例子为所有这些因素选择你想要的阈值。就像,就像没有机器学习的机器学习,你可以为任何事情做。而且就像,可能有一些事情模型还不够好,对吧?就像,我会。当我看到人们用模型做交易时,我有点害怕,就像,Diogo Almeida [01:06:28]: 自动交易。看起来很酷。我——我只是认为人们应该把它留给专业人士。
Diogo Almeida [01:06:35]: 而且就像,那只是一个非常困难、高层次的任务,也许模型还不够好来弄清楚。
Swyx [01:06:40]: 是的。
Diogo Almeida [01:06:41]: 嗯,我,就像,即使它们是的,那么它们会——它突然不会是因为有效市场。但就像,那是那些事情之一,你可以,就像,把它分解成事情并只是评估它们,你可能就像,“它在这个上不够聪明。也许我们还不为这个版本部署它。”
Swyx [01:06:56]: 是的。
Diogo Almeida [01:06:56]: 或者我们做一个权衡,或者我们偏向安全,或者就像,“嘿,模型不够好,就像,检测,就像,这种奇怪的组合,就像,讽刺与VIP客户,这就是我们升级到人类的时候。”那也是置信度估计的意义。
置信度、阈值和微调
Swyx [01:07:11]: 好的。非常好的答案。我认为,有一件事我会,我会很快提到,我不期望你有一个——太长的答案,是,Diogo Almeida [01:07:19]: 你没有。
Swyx [01:07:20]: 嗯,不。只是,只是具体来说,就像,你仍然依赖阈值作为,就像,用户可以拉的杠杆。
Swyx [01:07:28]: 但如果只是校准错了呢,对吧?就像,你只是说你的校准是完美的,但
Diogo Almeida [01:07:33]: 我没有说那个。
Swyx [01:07:33]: 我,就像
Diogo Almeida [01:07:34]: 是的。我没有说那个。
Swyx [01:07:35]: 所以就像校——完美校准——而且就像,好的校准意味着,就像,较低的值是较低的,就像,概率较低,较高的值是概率较高。但它可能是错的。它可能是
Diogo Almeida [01:07:44]: 当然,当然
Swyx [01:07:44]: 完全错位。
Diogo Almeida [01:07:45]: 是的。
Swyx [01:07:45]: 所以那时我会想对它进行微调之类的,对吧?你们不提供这个功能,但你们可以。我
Diogo Almeida [01:07:50]: 我们可以。
Swyx [01:07:51]: 你看,这又是一个简短的回答
Diogo Almeida [01:07:52]: 是的
Swyx [01:07:52]: 也就是说你们现在还没有这个功能。
Diogo Almeida [01:07:54]: 哦,我们是否想提供微调功能,这才是问题所在?
Swyx [01:07:56]: 那可能是一种方案,或者你们可以设置一个不同的调节参数,对吧?
Diogo Almeida [01:08:00]: 是的。
Swyx [01:08:00]: 因为,就像。因为,就像,现在你们——你们所说的只是,如果出了问题,那是技能问题,你应该,你应该再次修改提示词,或者把它拆解得更细,或者你调整置信度。
Diogo Almeida [01:08:09]: 没错。
Swyx [01:08:09]: 这就是我的两个选择。
Diogo Almeida [01:08:11]: 没错。
Swyx [01:08:11]: 对吧?如果你的模型就是出错了,这感觉不太令人满意。
Diogo Almeida [01:08:14]: 没错。而且说清楚,它确实会,它确实会在很多事情上出错。
Swyx [01:08:18]: 对。
Diogo Almeida [01:08:18]: 我们有,比如,一个“报告问题”按钮。在 Discord 上向我们抱怨。我们想让它变得好得多。每一个模型版本都会,比如,明显更好。
Swyx [01:08:25]: 是的。
Diogo Almeida [01:08:25]: 如果它们没有取得大的改进,我们就不会快速发布它们。所以第一,这,比如,完全合理。我认为承认 AI 在某些事情上不完美是务实的,对吧?我确实认为我们会找到它们,比如,足够好的用例,而足够好某种程度上取决于用例,对吧?就像,人类可以做很多工作,尽管他们不擅长那项工作,因为他们的期望值相当高。而且想必有了正确的阈值等等,即使会犯错,大概也有,比如,大量工作可以完成。关于微调的问题,我可以想象,我可以想象它是有可能的。我确实有顾虑,因为,比如,在人们需要什么与人们想要什么这个类别中,Diogo Almeida [01:09:09]: 比如,我认为通用模型往往真的很。比如,再次,通用性有一种难以言说的特质,让它擅长,比如,一百万项其他任务而非这一项狭窄任务,可能会让它在那个任务的边缘案例上表现更好,这是我,我会有点担心的?
Swyx [01:09:25]: 是的。
Diogo Almeida [01:09:26]: 我可以想象它,这是我的回答。在这些事情上我无比务实。我想要一切。比如,我对世界的愿景是。我——有,有太多我们想要构建的东西。
Swyx [01:09:38]: 是的。
Diogo Almeida [01:09:38]: 但同样,比如,我不想发布一个,比如,巨大的自伤武器,就像其他一些 AI 公司会发布的那样。
Diogo Almeida [01:09:46]: 是的。
Swyx [01:09:47]: 嗯,所以 OpenAI 和 Claude,我想甚至 Gemini 都推出了微调功能,然后又收回了。
Diogo Almeida [01:09:53]: 没错。
Swyx [01:09:53]: 这是一个有趣的观察,基本上微调现在属于开源模型的领域了。
Diogo Almeida [01:10:02]: 是的。我确实知道那件事。而且,它有点糟糕,所以,他们把它下架了可能更好。
Swyx [01:10:10]: 是的。是的,所以这可能就是个坑,告诉大家微调它很可能是错误的方向,这很好。另一个有趣的回答可能是,嗯,我们的模型是如此不同,就像量化不适用于我们一样
Diogo Almeida [01:10:21]: 是的
Swyx [01:10:21]: 输出 token 不适用于我们,微调也不适用于我们。
Diogo Almeida [01:10:24]: 嗯,实际上,我,我对这种可能性非常开放。
Swyx [01:10:28]: 是的。
Diogo Almeida [01:10:28]: 就像,我的。这不是承诺。这是愿望。为了说清楚,我喜欢非常诚实。就像,我认为,随着每美元智能变得更便宜,我认为我们可以得到非常,就像,小的近似的东西,希望是智能的代理。就像,有没有一个世界,人们不再写正则表达式了?因为,就像,使用 AI 的每美元智能比正则表达式的复杂性更便宜。那会很酷。我会喜欢那样?而且它可能需要微调一些狭窄的用例才能真正越过阈值。我们会看到的。我的希望是校准能做到这一点。校准加上模型级联。就像,如果它超级自信,那么也许它是对的。如果它在中间,那么你就用下一个更大的模型,然后从那里链接下去。我不太知道那会怎么发展,但是是的。我可以想象它。我也可以想象的是,就像,想象你有一系列。就像,我们拥有整个帕累托前沿。企业可能想做的事情,或者,我认为黑客会愿意处理模型的帕累托前沿。也许企业想要更动态的东西。你可以想象,就像,有,就像,不同大小的模型,并根据它在你的堆栈的不同部分有多聪明来动态选择哪个模型。你甚至可以想象,因为我们的东西有多简单,你可以想象,就像,一些自动微调。
未来模型、帕累托前沿和智能的新形态
Swyx [01:11:53]: 是的。
Diogo Almeida [01:11:54]: 一点也不是承诺。我只是,就像,在烹饪科幻。
Swyx [01:11:57]: 但你会考虑不同大小的 Dev 模型来提供这种差异?
Diogo Almeida [01:12:01]: 绝对。是的。就像,我们。就像,我怎么知道人们需要多少智能?
Swyx [01:12:06]: 我不知道。
Diogo Almeida [01:12:06]: 对吧?是的。我也不知道。
Swyx [01:12:08]: 需求是,需求是,无限的。
Diogo Almeida [01:12:10]: 嗯,是的,人们告诉我们现在不要发布东西,因为我们不需要发布东西,因为,再次
Swyx [01:12:16]: 它足够好了,是的。
Diogo Almeida [01:12:18]: 是的,但那有点逊。我真的很喜欢这句话。这是我希望人们让我坚持的,因为会很难
Swyx [01:12:27]: 收回
Diogo Almeida [01:12:27]: 退一步说。对。就像,那个。我不确定是不是。确切地说,文化就是当市场不奖励它时你所做的事。我真的很喜欢这句话,因为我认为我们是在为某种东西而坚持。也许在未来——我们所坚持的东西会变得如此显而易见,以至于我们就相当于无聊的、像 Visa 之类的东西。就像我们只是一个没人会真正去想的实用工具,而我会穿着非粉色的西装或者其他什么。
Diogo Almeida [01:12:54]: 但我真的很想,比如,把全世界召集到这件事上?就像,我想继续做酷的东西,不——不是因为我们必须要做,而是因为我想要,比如,让人们意识到这只是一个开始?就像,那甚至都不是有意作为开场的一击。那更像是,一种低调的研究预览,或者你想怎么叫都行。
Swyx [01:13:14]: 对。
Diogo Almeida [01:13:15]: 而且我们还能做更多。
Swyx [01:13:17]: 对。
Diogo Almeida [01:13:17]: 有了。就像,机器原生智能会变得非常疯狂。
Swyx [01:13:21]: 所以不是唯一的——可能不是唯一的规模,可能不是你们发布的唯一模型。你想要打开人们的思维
Diogo Almeida [01:13:28]: 绝对不是其中任何一个。
Swyx [01:13:29]: 对。
Diogo Almeida [01:13:29]: 我想要,我想要,比如,满足我们能满足的任何需求。
Swyx [01:13:33]: 对。
Diogo Almeida [01:13:34]: 对吧?就像,在。但有一个,一个巨大的前提,我不想变成 OpenAI 的产品团队那样,比如,把东西往墙上扔。就像,我想要它,比如,在一个,在一个统一的愿景之下。就像,如果你回到那份宣言,比如,一切都必须归在这三件事之一下面
Swyx [01:13:48]: 对
Diogo Almeida [01:13:48]: 在我看来。
Swyx [01:13:50]: 我不
Diogo Almeida [01:13:50]: 对。
Swyx [01:13:51]: 我还没准备好做这个,Diogo Almeida [01:13:52]: 哦,抱歉。抱歉,Francis。对,我可以直接聊这个。就像,我们的东西里有,比如,三个步骤。
Swyx [01:13:57]: 是的。
Diogo Almeida [01:13:57]: 听起来像是在吊胃口。我想要一切都归在这三件事之一下面
Swyx [01:14:02]: 好
Diogo Almeida [01:14:02]: 继续推动边界等等。就像,这不是。这些不是,比如,清单。这些是,比如,我们认为能构建,比如,一场新技术革命基础的轴。我想要所有的。我们所做的所有押注都落在其中的某个位置。而且我们会在模型层面做一些奇怪的东西。
Diogo Almeida [01:14:23]: 所以因为是机器原生的,对吧?就像,人类不需要完全理解它。它只需要有价值。
Swyx [01:14:30]: 就,给大家一个吊胃口的东西或者提示。比如,奇怪看起来是什么样的?什么是奇怪?
Diogo Almeida [01:14:35]: 我会给大家一个提示。
Swyx [01:14:36]: 对。
Diogo Almeida [01:14:36]: 有些人试图把它们叫做决策模型。
Swyx [01:14:40]: 好。
Diogo Almeida [01:14:41]: 我们的原语是决策。我不会那么叫,因为我认为还有其他机器原生的类型不是决策。
Swyx [01:14:54]: 好,我们就到此为止
Diogo Almeida [01:14:54]: 这是个有趣的提示,一个有趣的提示。
Swyx [01:14:55]: 让大家猜吧。对。
Diogo Almeida [01:14:56]: 是的。我觉得这是个,我觉得这是个挺有趣的提示。
Swyx [01:14:58]: 是的。有人。你看,有人会说,“我以前做过这个。我一年前就做了一个决策模型。”就像,Jev 并不新鲜,Jev 也不酷。
Diogo Almeida [01:15:04]: 是的。
Swyx [01:15:04]: 但就像,我觉得,有那种分类式的,就像,你在这里确立的是什么是可能的。还有那种,性能表现,就像。嗯,实际上。对于你得到的基准测试和数字,据我所知,你仍然击败了每一个——据我所知,你仍然击败了外面每一个你的克隆体。
Diogo Almeida [01:15:19]: 我不在乎基准测试
Swyx [01:15:20]: 正是如此
Diogo Almeida [01:15:20]: 说清楚一点。
Swyx [01:15:21]: 正是如此。
Diogo Almeida [01:15:21]: 所以就像,即使我们在赢或输,我想做公告。
Swyx [01:15:24]: 你已经确立了这个类别,对吧?
Diogo Almeida [01:15:26]: 是的。
Swyx [01:15:26]: 是的。
Diogo Almeida [01:15:26]: 是的。
Swyx [01:15:26]: 但同——但同时我也觉得,决策模型和 System 1 之间的这种细微差别,我觉得实际上正是你想要
Diogo Almeida [01:15:32]: 是的。我只是想让软件工程师变得超级强大
Swyx [01:15:36]: 是的
Diogo Almeida [01:15:36]: 对吧?就——就像用 AI 一样。就像,而且或者,就像,对我来说悲剧性的事情是,
经济影响、TFP 增长与背景中的 AI
Diogo Almeida [01:15:42]: 在那个 AI 寒冬的方向上,我觉得,就像,就是,就是,AI 如此强大却如此未被充分利用,这太令人悲伤了。就像,这是让我情绪激动的事情,但是天哪。
Diogo Almeida [01:16:03]: 就像,我觉得那就是。我不想,就像,只是成为,就像,纯粹的技术乐观主义者,就像所有技术都是好的。我觉得现在正在发生的事情,就像,是一场闹剧。就像,它是。而且就像,有。我只是想,就像,为人们打开那些可能性。
Diogo Almeida [01:16:19]: 是的,我就说到这里吧。我,我这些天哭得太多了,不想在录音里再哭。
Swyx [01:16:26]: 是的。不,Diogo Almeida [01:16:27]: 是的
Swyx [01:16:27]: 我很感激你分享了一点这些,我觉得人们能看出你非常真诚,而且
Diogo Almeida [01:16:31]: 是的
Swyx [01:16:31]: 对此充满热情。这——你——你不一定能从名字里看出来,就像,TypeSafe AI,但就像,我觉得一旦人们足够沉浸其中,就像,这里是你希望世界走向的真正不同的方向,而且就像,实际上你已经完成了,就像,从零到一的艰难部分,在那个东西上,那么,就像,现在让我们大家一起走向——一起走向,就像,新的方向,对吧?
Diogo Almeida [01:16:51]: 是的。是的。
Swyx [01:16:52]: 是的。
Diogo Almeida [01:16:52]: 我不——我不确定我会不会这么想。也许我会认为艰难的部分已经完成了,也许吧。我觉得还会有很多更艰难的部分。就像,如果,各种各样的事情都被自动化了,我们终于看到了 GDP 增长,而且就像,就像,一场 Jev 派对
Swyx [01:17:12]: 是的
Diogo Almeida [01:17:12]: 每天都是,那么也许艰难的部分就完成了。但就像,我不——不这么认为。而且就像,我真的觉得人们太关注速度和成本,而对可靠性关注不够。
Swyx [01:17:23]: 好的。
Diogo Almeida [01:17:23]: 就像,可靠性才是让它令人愉悦的东西。就像,可靠性才是让你能够信任它的东西。
Swyx [01:17:28]: 你有这么一句话,Diogo Almeida [01:17:29]: 是的。
Swyx [01:17:30]: 全要素生产率增长在五年内超过 3%。
Diogo Almeida [01:17:32]: 那必须的。
Swyx [01:17:32]: 我从没见过
Diogo Almeida [01:17:33]: 那必须的。冲啊。
Swyx [01:17:35]: 我从没见过
Diogo Almeida [01:17:36]: 是的
Swyx [01:17:36]: 一个实验室会关心全要素生产率增长。
Diogo Almeida [01:17:38]: 但就像,那正是经济革命的含义,对吧?就像,这实际上与 OpenAI 章程过去所代表的东西极其一致。
Swyx [01:17:45]: 是的。
Diogo Almeida [01:17:45]: 它当时谈的是,就像。我觉得章程还是一样的,但他们有点试图把定义挪来挪去,比如挪到 1000 亿美元利润之类的。倒不是说我对 OpenAI 有什么恨意。
Swyx [01:17:54]: 它并不是一个。是的,AGI 是什么,它并不是一个定义明确的术语,对吧?
Diogo Almeida [01:17:57]: 他们试图这么做
Swyx [01:17:58]: 不,是的
Diogo Almeida [01:17:58]: 对吧?就像,完成世界上大部分有经济价值的工作,而他们本该回答这个问题:它怎么能解决数学领域的千禧年大奖难题,却在世界上有经济价值的工作中贡献为零,到处都一样。就像,我觉得现在所有模型大致都并列在零这个位置。有可能,就像,我们已经开始了,但就像,我猜它还没到 1%。而且我觉得这会体现在。就像,当它真的发生时,它会体现在经济统计数据里。
Diogo Almeida [01:18:28]: 那会他妈的太棒了。它不会造成大规模失业,但它会造成,就像,一大堆很棒的转变,而且世——世界会好得多。而且,就像,我真的厌倦了 AI 总是成为事情的前景主角。就像,我觉得——世界就应该更令人愉悦,而 AI 就应该只是帮忙做到这一点。
Diogo Almeida [01:18:48]: 而我
Swyx [01:18:49]: 就像,消失在背景里。
Diogo Almeida [01:18:50]: 正是如此。
Swyx [01:18:51]: 是的
Diogo Almeida [01:18:51]: 就像,那——我在我的演讲里说过这个。就像,怎么会这样:2019 年的软件,比如软件、SaaS 之类的,超级超级有价值,对吧?现在是 2026 年了。尽管 AI 他妈的这么厉害,软件怎么基本上还是一模一样,除了有时候旁边有个聊天框,对吧?那,就像,那种东西勉强能用,但并不能让你做出公司有切身利益相关的决策,因为它们不能被信任来做决策。这对我来说,简直疯了。就像,这里面有那么多经济激励,而我觉得这将会是,就像一场,就像一场反向的 SaaS 末日。我觉得 SaaS 会被这个超级加速。他们才是那些,就像,最了解哪些东西值得自动化的人,而那将会是,就像,一个疯狂的时代。
系统 1 与系统 2,以及推理的局限
Swyx [01:19:37]: 是的。我觉得,我也这么觉得。这是你解锁的一件,一件美妙的事情?
Diogo Almeida [01:19:41]: 是的。
Swyx [01:19:41]: 你在这里提到了一件事,我不确定它是不是直接就在这里,那就是,什么是 System 1 问题,什么不是。什么是 System 2 问题?比如,Diogo Almeida [01:19:50]: 操。这可真难。这可真难,我的朋友。
Swyx [01:19:55]: 因为现在人们只是想对一切 Jev,对吧?
Swyx [01:19:57]: 而这,大概会失败,对吧?但有些东西会变得不错。
Diogo Almeida [01:20:02]: 对一切 Jev 还挺好笑的。
Swyx [01:20:04]: 是啊。
Diogo Almeida [01:20:04]: 这是一种挺好笑的做法,这么说的话。那个。所以我会跟你说实话。
Swyx [01:20:08]: 好。
Diogo Almeida [01:20:09]: 事实是,这是一个经验性问题,就像缩放定律是一个经验性的东西一样。比如,为什么机器人技术现在实际上并不怎么行得通,尽管有那么多钱花在上面?
Diogo Almeida [01:20:21]: 我不认为这必然是关于花更多钱。经验结果可能就是不成立,对吧?所以从经验上看,我相信这些,比如,预训练的超级智能浓缩物,从根本上说是 System 1 思考者。我认为它们确实如此。比如,System 1 是描述 LLM 擅长什么的最接近的东西。RLVR 为 System 2 思考做出了不可思议的事情。我惊叹不已。这真是太他妈酷了。比如,我不认为这会在哪怕一丁点程度上导致 AI 末日。当然不是 0%,因为我认为 0% 是校准错误的。但比如,他——他们所做的真的很酷,而且他们真的把它推到了极限。好吧,也许他们不这么认为,不认为是极限。但比如,这对模型来说是一件奇怪的事,而且它们在这方面非常脆弱。比如,想想人们在 ChatGPT 时代是怎么谈论 AI 的。比如,“哇,它真的很通用。它能做很多通用的事情。”然后。但它在数学问题和比如 GSM8K、小学数学上很差。然后现在看看人们是怎么谈论 RLVR 的。“它太脆弱了。它太参差不齐了。”?比如,它能。“为什么它能做这个,比如,非常奇怪的事情?”而实际上,数学不只是尖刺状的,它是分形的,对吧?这是因为 RLVR 是。比如,如果我们谈论,比如,每件事的北极星是什么?RLHF 是取悦人类,对吧?这就是人类反馈的含义。RLVR 是优化基准。那个——所有归入 RLVR 类别的东西,按定义字面上就是一个基准,因为基准是可编程验证的、简单的输出,可以,比如,表现良好。而 RLCD 是让它对,程序化使用可靠。而 Diogo Almeida [01:22:09]: 是啊。那,我会
Swyx [01:22:11]: 是啊。是啊,它,这个。也许我会,我会提供一些想法,然后你可以某种程度上,Diogo Almeida [01:22:15]: 哦
Swyx [01:22:15]: 如果我错了就纠正我。一。比如,我一直在思考的一件事也是。我,所以当你给我访问权限时,我把 Jev 扔给了一堆东西
Diogo Almeida [01:22:23]: 哦,是啊
Swyx [01:22:23]: 在第一天。还有多跳推理,对吧?比如
Diogo Almeida [01:22:27]: 是的
Swyx [01:22:27]: 所以单跳,太棒了。比如
Diogo Almeida [01:22:29]: 是啊
Swyx [01:22:29]: 最先进的。单跳你绝不应该用 Jev 以外的任何东西。
Diogo Almeida [01:22:32]: 是的。
Swyx [01:22:33]: 多跳会。它开始下滑。而且它
Diogo Almeida [01:22:34]: 是啊
Swyx [01:22:34]: 就像,随着跳数增加,它几乎是单调递增的。
Diogo Almeida [01:22:38]: 是的。
Swyx [01:22:38]: 对吧?
Diogo Almeida [01:22:39]: 哦,是的。回到那个经验性问题,这取决于我们能从模型中提取出什么。
Swyx [01:22:44]: 是的。
Diogo Almeida [01:22:44]: 对吧?所以我们想要一切。就像,我们想要挖掘尽可能多的智能,就是这样。这些模型。就像,我把我们看作是在解锁、平滑和雕琢智能,同时添加新能力并填补其中的空白。随着时间的推移,我们会填补越来越多的这些空白。但现实是,我们从事的是发掘属性的业务。这些属性实际上取决于从这些浓缩核心中可获得的东西,并将它们像科学怪人一样拼凑在一起,以拥有所有事物的所有属性。
Swyx [01:23:21]: 是的。
Diogo Almeida [01:23:21]: ?但现实是,我们从事的是发掘尽可能多能力的业务。而系统1恰好是对有效方法的描述。在那个范式中有效的一切都会是系统1式的。就像,我。
Diogo Almeida [01:23:38]: 就像,我们不做所谓的字符串中的潜在推理是有原因的。
Swyx [01:23:43]: 是的。
Diogo Almeida [01:23:43]: 我认为推理。就像,模型真正擅长的是模型内部的推理。它并不完全完整。它在所有方面都不出色
Swyx [01:23:49]: 等等,潜在推理是字符串中的推理?我以为潜在推理是在模型权重内部的推理。
Swyx [01:23:55]: 那个
Diogo Almeida [01:23:55]: 我认为
Swyx [01:23:56]: 我不知道
Diogo Almeida [01:23:56]: 人们过去称之为
Swyx [01:23:57]: 我只是想澄清一下
Diogo Almeida [01:23:57]: 连续推理。
Swyx [01:23:58]: 好的。
Diogo Almeida [01:23:58]: 我不完全确定。
Swyx [01:23:59]: 好的。
Diogo Almeida [01:24:00]: 它被称为潜在推理是因为,就像,过去推理痕迹是秘密的。
Diogo Almeida [01:24:04]: 所以它们有点像答案的潜在变量。
Swyx [01:24:06]: 哈。
Diogo Almeida [01:24:07]: 是的。
Swyx [01:24:07]: 所以秘密的东西现在已经转移了。
Diogo Almeida [01:24:09]: 嗯
推理、视觉、上下文长度和未来能力
Swyx [01:24:10]: 是的
Diogo Almeida [01:24:10]: 对 OpenAI 和 Anthropic 来说,它仍然是秘密的,对吧?
Swyx [01:24:12]: 所以没有推理 Jev
Diogo Almeida [01:24:14]: 是的
Swyx [01:24:14]: 就你所能做的而言,对吧?因为那,就像,违反了系统1的整个承诺。
Diogo Almeida [01:24:21]: 我。我的承诺是做任何必要的事情来实现机器原生的事物。
Swyx [01:24:28]: 是的。
Diogo Almeida [01:24:28]: 我可以想象有一些。就像,有一些形式的推理不那么慢、低效和脆弱,我。这些是完全有可能的,只是说清楚。所以作为一个务实的人,我不是在承诺方法。我是在承诺我的投资回报率北极星是什么,我会为此而战,就像这次发布没有发生,我们仍然渴望在世界上的位置。
Swyx [01:24:53]: 那太好了。是的。
Diogo Almeida [01:24:54]: 是的。
Swyx [01:24:54]: 我觉得另一件事,视觉是另一个,就像,一个大的,就像,你没有的能力,但也许它永远不属于系统1?
Diogo Almeida [01:25:04]: 我觉得我有很好的视觉。
Swyx [01:25:05]: 什么,抱歉?
Diogo Almeida [01:25:06]: 我觉得我有好的视觉。
Swyx [01:25:07]: 不,抱歉。视觉
Diogo Almeida [01:25:08]: 我在开玩笑。我在开玩笑。是的。
Swyx [01:25:09]: 我的天啊。
Diogo Almeida [01:25:10]: 是的。
Swyx [01:25:12]: 因为人们显然,他们想要的第一件事是视觉,因为Doom演示,但也只是,就像,一切,除了文本就是视觉。
Diogo Almeida [01:25:19]: 一切都在计划中
Swyx [01:25:21]: 是的
Diogo Almeida [01:25:21]: 在我看来。
Swyx [01:25:22]: 好的。
Diogo Almeida [01:25:22]: 就像,实际上,这是,就像,我们有的一个辩论。这个。天啊,你的观众可能是,就像,在这个辩论中最好的。有一个问题关于,就像,我们尝试多少,就像,给人们他们认为他们想要的,这是我们在隐身模式下两年所做的。我们只是知道这显然会有价值, versus 给他们他们说的他们想要的,对吧?而且就像,这有很多维度,对吧?而且就像,上下文长度是一个例子,对吧?每一个模型,包括我们的,我实际上认为据我所知,我们的,就像,远远是最好的
Swyx [01:25:58]: 最长的上下文,是的
Diogo Almeida [01:25:58]: 在长上下文中不退化。
Swyx [01:26:01]: 是的。
Diogo Almeida [01:26:01]: 但就像,其他提供商只是像,“无论人们想要什么,我们就给他们那个愚蠢的东西。”而且就像,我们需要为此找到一个平衡,因为,就像,如果你把前者推得太远,给人们他们想要的,你最终会像,人类保姆国家风格的思维,这非常,就像,反开发者。而,就像,亲开发者的路线会是像,给他们他们想要的,但开发者是。就像,我们不想把负担放在他们身上去弄清楚智能的难以言喻之处。所以我们正在尝试,就像,弄清楚这个导航,就像,多快发布东西,仍然,就像,有我们的,就像,信任品牌,也,就像,教我们的——对待我们的用户像成年人,可以做出明智的决定,不需要,就像,在这东西上面保姆国家。
Swyx [01:26:46]: 是的。我觉得那是公平的。
Diogo Almeida [01:26:48]: 是的。而且我们不知道答案,说实话。就像,我们会,我们会必须弄清楚。它会是的。那可能将会是,就像,我接下来几天最大的辩论之一
Swyx [01:26:57]: 是的
Diogo Almeida [01:26:57]: 因为,就像,我们有很多东西。再次,我们没预料到它会火起来,所以我们就像,“我们需要一些后续发布。”但是的。
Swyx [01:27:05]: 我不知道,我不知道如果你没预料到它会火起来。就像,我,你——我看到了你投入的工作。就像,我从未见过你如此专注,就像,基本上过去两个月,对吧?就像
发布教育、食谱和产品市场契合
Diogo Almeida [01:27:13]: 嗯,那也是因为我的幕僚长让我专注。
Diogo Almeida [01:27:18]: 是的。
Swyx [01:27:18]: 所以
Diogo Almeida [01:27:20]: 就像,就像,我从未。我以为我以前工作很努力
Swyx [01:27:24]: 是的
Diogo Almeida [01:27:24]: 而且
Swyx [01:27:25]: 不,但是就像,你出现在我们的写作工作坊里,我当时就想,“你在这儿干嘛?”然后就像,哦
Diogo Almeida [01:27:30]: 这很有用。太棒了。
Swyx [01:27:31]: 你显然,就像,对你的发布非常有心。
Diogo Almeida [01:27:34]: 是的。
Swyx [01:27:35]: 而且成果也显现出来了,就像
Diogo Almeida [01:27:36]: 是的
Swyx [01:27:36]: 恭喜。就像,你得到了赞扬。
Diogo Almeida [01:27:37]: 谢谢,谢谢。我希望继续保持专注
Swyx [01:27:41]: 是的
Diogo Almeida [01:27:41]: 这是我的,这是我的感觉。
Swyx [01:27:42]: 是的。
Diogo Almeida [01:27:42]: 我想。就像,呃,就像,我认为我们已经通过了许多科技界的伟大筛选,我们想要的,但就像,还会有更多。
Swyx [01:27:53]: 是的。
Diogo Almeida [01:27:53]: 而且就像,天哪,我多么兴奋能打这场美好的仗。
Swyx [01:27:56]: 是的,这很令人兴奋。在我们扩展到 TypeSafe 之外的话题之前
Diogo Almeida [01:28:01]: 哦
Swyx [01:28:01]: 我只是想提供,任何其他你认为,就像,被低估或被误解的关于你发布的东西。
Diogo Almeida [01:28:09]: 被低估或被误解?
Swyx [01:28:11]: 是的。你有 pan outs。抱歉,这里的模式。也许你想深入探讨。模型的不平整性,任何东西。
Diogo Almeida [01:28:20]: 给我一个
Swyx [01:28:21]: 是的
Diogo Almeida [01:28:21]: 思考一下。哦,天哪。我会对这些都大发牢骚。我真的不应该。我真的不应该。
Swyx [01:28:29]: 好的。而且就像,人们可以来,去你的 Discord,如果他们
Diogo Almeida [01:28:32]: 是的。人们在食谱上投入了很多爱
Swyx [01:28:34]: 是的
Diogo Almeida [01:28:35]: 这是我要说的。食谱里有,就像,一些火爆的东西。我们曾考虑把一堆这些东西,就像,放在主要的发布博客文章里,但它变得有点长和笨重,而且像,非常高级用户向。但就像,我们真的。我直说。就像,在发布之前,每一个。就像,我们说的听起来,就像,听起来像这个奇怪的外星工具。为什么有人会需要这个?这是一个非常奇怪的东西。我们非常担心教人们关于,就像,这个新前沿。它显然成功了,但就像,我们投入了很多工作,因为我们认为教育会是我们巨大的瓶颈。我。
Diogo Almeida [01:29:14]: 它可能有效,而且它不再——可能不再是个问题,因为人们在做的事情,就像,远远超出了我们所能预料的。
Swyx [01:29:20]: 他们会展示给你,就像,如何使用你的模型。
Diogo Almeida [01:29:21]: 是的,但是。没错。但就像,他们。是的,而且他们的用例,就像,比我们的更酷。就像,有一堆东西让我想,“天哪,如果那是我们的演示,天哪,那比我们展示的要酷多了。”就像,计算机使用的东西,天哪,太酷了。但就像,我们在这上面投入了很多爱。这不是,就像,AI 生成的垃圾,据我所知。
Swyx [01:29:41]: 是的。
Diogo Almeida [01:29:41]: 我们投入了很多——就像,这里有很多爱。
Swyx [01:29:45]: 是的。说得对。
Diogo Almeida [01:29:45]: 而且就像,每一个都是。就像,这里有真正的优势。
Swyx [01:29:49]: 好的。
Diogo Almeida [01:29:49]: 比如,这些都是受解决真实存在的客户问题的启发,我们花了功夫去帮助他们做出很酷的东西。
Swyx [01:29:58]: 是的。多少。当你在讲这个的时候,对吧,你在发布前做了多少验证?比如,那是什么。那个过程是什么样的?
Diogo Almeida [01:30:06]: 那个过程是什么样的?
Swyx [01:30:08]: 比如,很明显你做了一些,但显然你当时接触的人没有今天这么多。
Diogo Almeida [01:30:14]: 是的,当然。
Swyx [01:30:15]: 但就像
Diogo Almeida [01:30:15]: 我其实觉得反响相当糟糕。而且,实际上对于团队里非技术背景的人来说,他们真的很担心。
Swyx [01:30:24]: 是的。
Diogo Almeida [01:30:24]: 比如,有很多恐惧。就像,没人真正理解这个。而且,他们不想要它。我们就像在卖维生素,而不是止痛药。比如,我们是不是应该有 FDE 来围绕解决那个问题写软件?
Swyx [01:30:37]: 是的。
Diogo Almeida [01:30:38]: 我们在发布前几乎没有收入。有点像。就像,我们。比如,技术人员显然是真信徒,对吧?比如,我们知道这玩意儿很牛。它的计算属性在,比如,很多维度上都爆表,所以我们觉得,“是啊,显然它会变得巨大。”我肯定超级害怕,这就是为什么我拼命地投入。但比如,最常见的情况是——我会说,超过一半我们让其试用的人就是没搞懂。而那些搞懂的人,比如,会说,“天哪,这真的很酷,但我们怎么让它通过采购之类的流程?”这就像,这就像一场相当、相当艰难的战斗,而我们就知道,好吧,我们的目标市场会是开发者。人们会找到用例,那样所有人都会 FOMO 进来。而且,Diogo Almeida [01:31:32]: 我不想拿人们随着事实改变而改变想法这件事来挖苦人。
Diogo Almeida [01:31:36]: 我确实想质疑一下,比如,产品市场契合这个概念?是的,但比如,因为,比如,有产品,有市场。就像,我们说,“嘿,你想用这个吗?”而人们说,“我不知道,真不确定它能不能解决我们的问题。”它爆火了,然后每个人都说,“我们需要尽可能多的速率限制。我们能直接给你们 GPU 吗?因为我们现在受限。”
Swyx [01:31:59]: 是的。
Diogo Almeida [01:31:59]: 所以当然,比如,营销是其中的一个元素,当然,但我甚至不觉得这是关于营销。我觉得这是关于,比如,充满热情的开发者,他们的灵魂基本上以相同的频率共振,而那个频率,也让其他所有人都兴奋起来。
Swyx [01:32:14]: 是的。
Diogo Almeida [01:32:14]: 我也希望,比如,我们作为一家公司会永远感激那些开发者。比如,不只是——不只是那些,比如,从开发者起步然后走向大企业的公司。
Swyx [01:32:30]: 他们走向市场,是的。
Diogo Almeida [01:32:31]: 没错。而且,我甚至在想,比如,我们怎么能发布对……更好的东西。哦,天哪,我不知道我该不该说这个。
Diogo Almeida [01:32:39]: 但我会说的。
Swyx [01:32:39]: 对开发者来说比对企业更友好。
Diogo Almeida [01:32:41]: 正是如此。
Swyx [01:32:41]: 好的。
Diogo Almeida [01:32:41]: 我们该怎么做?比如,我们如何赋能他们?而且我有厨师。我有厨师。但这是一件非常奇怪的事。而且,我不知道还能怎样表达我的感谢和忠诚。就像,这就是为什么我昨天去染了头发。就像,我想和他们交流,因为在我们公司最重要的时刻不和他们保持交流,让我觉得很肮脏。
Swyx [01:33:07]: 好。嗯,这就是你头发的原因。
Diogo Almeida [01:33:09]: 是的。请监督我做到这一点。
Swyx [01:33:11]: 是的。我们会的,我们会的。
Diogo Almeida [01:33:11]: 我努力做到有原则。
Swyx [01:33:13]: 是的。
Diogo Almeida [01:33:13]: 把这话记下来。如果我变了,就指出来。准-准备好干草叉。
Swyx [01:33:18]: 我本来想简单展示一下计算机使用的东西。
计算机使用与新兴用例
Diogo Almeida [01:33:21]: 哇。
Swyx [01:33:21]: 这,这就是你提到的吗?
Diogo Almeida [01:33:22]: 我从没见过——我没——我见过。我见过,比如,一个航空公司浏览器使用的东西。
Diogo Almeida [01:33:29]: 在这个新笔记里,让标题显示你好。
Diogo Almeida [01:33:33]: 哇。太好了。好的。我们继续,你能打开 Arc 浏览器吗?到了那里之后,你能谷歌搜索 Norbert Wiener 吗?
Diogo Almeida [01:33:43]: 现在你能打开 x.com 吗?
Swyx [01:33:46]: 是这种用例吗?
Diogo Almeida [01:33:48]: 哦,语音用例。这实际上是我第一次见到。这是
Swyx [01:33:51]: 哦,好的。
Diogo Almeida [01:33:51]: 打开照片查看器。哇。哦,等等。哦,你能-你能回退一秒吗?你能回退一秒吗?
Diogo Almeida [01:33:58]: 有传言称 Anthropic 的工程师们崇-崇拜 Claude 如神。哇。哇。
Diogo Almeida [01:34:03]: 天哪。这挺搞笑的。
Swyx [01:34:06]: 而你在这里构建生产环境。
Diogo Almeida [01:34:07]: 绝对——哇,这太酷了。
Swyx [01:34:12]: 是的。所以很明显,它可以用语音操作整台电脑,以 Jev 作为决策模型。
Diogo Almeida [01:34:17]: 所以就像我反对基准测试一样,我也反对演示。我想确保它能可靠地工作。我喜欢人们在玩它。这他妈的太酷了,毫无疑问。我想看到这个。我想看到它被使用。我想让我们的团队玩它。我想找到弱点,我想解决它。
Swyx [01:34:35]: 是的。
Diogo Almeida [01:34:35]: 而且我会很——天哪,那看起来真的很酷。
Diogo Almeida [01:34:37]: 那看起来真的很酷。我想要那个。我想要那个。比如,当我的,当我的手腕酸痛时,我就,比如,用 Whisper Flow 处理一切。那就太酷了。
Swyx [01:34:44]: 嗯,那么,只是为了完善用例方面
Diogo Almeida [01:34:47]: 是的
Swyx [01:34:47]: 因为我得让你走了。谁,谁是,有哪些更大的公司联系过你,并且他们想做的事情让你感到惊讶?
Swyx [01:34:56]: 只是。
Diogo Almeida [01:34:57]: 我对此太脱节了。
Swyx [01:34:59]: 好的。
Diogo Almeida [01:34:59]: 人们给我看过公司的截图,从我所看到的,所有公司都是。
暗数据、实时智能与验证
Swyx [01:35:05]: 是的。主要是,对于那些在大公司工作、不做这类工作的人,我只想给大家举些例子,比如,你应该去查查这个,查查那个,查查那个。
Diogo Almeida [01:35:13]: 哦。所以就像,我觉得演示超级酷。显然,编码智能体是巨大的用例。
Diogo Almeida [01:35:21]: 就像,它们也超级酷。
Swyx [01:35:23]: 哦,Cog 现在全是关于 Jev 的。
Diogo Almeida [01:35:25]: 哦,当然。哦,我能,我能稍微岔开一下讲讲编码智能体吗,如果这——或者
Swyx [01:35:29]: 是的,请讲。
Diogo Almeida [01:35:30]: 哦,让我
Swyx [01:35:31]: 我们这里喜欢编码智能体。
Diogo Almeida [01:35:32]: 给我一秒。给我一秒。好的,其实,我回头再讲编码智能体。让我描述一下,用例的大类。
Swyx [01:35:37]: 好的。
Diogo Almeida [01:35:38]: 就像,我们从第一性原理出发规划了这些,早在发布之前很久。它们就是我们所说的暗数据。就像,人们囤积大数据,但不会把语言模型扔上去,因为太贵了。所以大公司非常喜欢这个。他们有,就像,成堆的数据,希望能分析,这就像数据科学家的美梦。所以这就像。这是一个巨大的。就像,我认为这个加上,编码智能体是最大的赚钱机器,因为那就是它们全部。所有量都在那里,对吧?还有实时类的东西。就像需要,在环智能的人。他们。就像,我猜那些公司的每个 CEO,如果不是 CTO 的话,都知道他们的产品每减少 10 毫秒会好多少。
Swyx [01:36:23]: 是的。
Diogo Almeida [01:36:23]: 还有就像
Swyx [01:36:24]: 尤其是电子商务,是的。
Diogo Almeida [01:36:25]: 是的。哦,或者,就像,助手类的东西。有很多 AI 助手类的东西。而且就像,据我所知,他们真的很喜欢。再说一次,我现在不在客户前线,所以我只是。知道我的团队告诉我的。但就像,这个。我对此太兴奋了。我真的很期待这个用于游戏。我真的很想玩,就像,超酷的自走棋,你在那里,就像,指挥你的队伍,或者,就像,半自走棋。我觉得那会太酷了。但在我还有工作的时候别做得太好。还有。就像,有。我们所说的,就像,验证一切。就像,验证所有 LLM 调用,有点像可观测性。我认为,实际上关于文档,人们应该做的是,就像,并行问题非常便宜。所以如果你有,就像,大状态,你想问很多问题
Swyx [01:37:08]: 这个,是的。
Diogo Almeida [01:37:09]: 给每个,就像,消息放上 ID,然后问关于每个 ID 的问题。所以就像,当你有一个,就像,长状态。
Swyx [01:37:16]: 嗯。
Diogo Almeida [01:37:16]: 这样你就可以,就像,为状态付一次钱,然后问很多很多关于其中每条消息的问题。我认为那是,就像,一个,就像,节省金钱的好方法,而且。
Swyx [01:37:25]: 顺便说一句,我总是觉得,就像,把系统 1 和系统 2 这样框定很有趣,因为它基本上说明了,你每做一次推理调用,就应该总是做 1 次或 10 次或 100 次 Jev 调用。
Diogo Almeida [01:37:37]: 嗯,也许吧。可能
Swyx [01:37:38]: 对。
Diogo Almeida [01:37:38]: 嗯,我不会。我希望人们少花点。
Swyx [01:37:42]: 是的。
Diogo Almeida [01:37:42]: 也许你可以,比如,把推理调用减半,然后每个大概 10 次 Jev 调用之类的,或者随便什么能解决那些本来不可能存在的问题的方法。等等,第四个用例是我描述的那种,智能软件。就像那种本质上可组合的软件,能做以前从未有过的、奇怪又有趣的事情。就像把编程语言当作 Jev 那样。我不知道你有没有见过那个。那太酷了。天哪,如果我们知道怎么发放积分的话,因为我们现在还处在基础设施的早期阶段,我真想给所有这些项目发积分。
Diogo Almeida [01:38:16]: 而且我觉得那些就是我们梳理出来的主要用例。计算机使用也朝着实时方向靠拢了,那真的很酷。如果它可靠的话,我会超级兴奋。我怀疑我们可以让模型在这些用例上表现好得多,因为那有点像是突然冒出来的,所以那真的很酷。关于编码代理这件事,这是现在正在发生的一件非常令人惊讶的事情。
多模型世界中的编码代理
Swyx [01:38:47]: 好的。
Diogo Almeida [01:38:49]: 我相信 Claude Code 和 Codex 是赢家,就是第一名和第二名。我不完全确定。我没有密切关注
Swyx [01:38:56]: 大致上
Diogo Almeida [01:38:56]: 但大致就是这样。但它们是围绕单一模型世界构建的?而且这对它们来说很合理,对吧?因为一直以来都是一模型游戏,就像你在挑选的其实是同一个模型但不同智能水平。
Diogo Almeida [01:39:09]: 但所有开放的编码代理现在都他妈兴奋得不行,因为它们正在搞自己的 Jev。而且问题是,有——我敢肯定它们在尝试很多奇怪的东西。但所有编码代理大致上都处于差不多的水平,对吧?因为用 while 循环你能做的事情就那么多。但一旦有人找到了一个杀手级用例,一个只有那个编码代理才能做的用例,所有人都会涌向它,因为它们对那个东西有垄断。但所有开放的编码代理都能复制那个,对吧?就这样。但我不知道 Claude Code 和 Codex 会怎么做,因为它们是围绕那个单一模型世界构建的。
Swyx [01:39:48]: 单一模型,是的。
Diogo Almeida [01:39:48]: 而且,我觉得那会是一件非常有趣的事情。就我个人而言,我非常希望能与他们整合。我想和所有人整合。他们最终可能会做出竞品。我不知道。但这不是我——我作为 Songfire Infrastructure 的职责不是对此持有偏见,对吧?我只想服务整个世界。但我不知道他们会不会那么做。而且我觉得这会让编程智能体的竞争变得超级诡异。我对此非常兴奋。而且我确信。我现在正让我的团队审阅我写的一份内部文档,内容是关于我怀疑会对编程智能体有用的设计模式。所以希望我能在我走回家之后马上分享出来。但我觉得,这个世界上有太多值得探索的成熟领域了。而且,这,这。天哪,如果我没有这个,我现在会非常想去实验编程智能体。
Swyx [01:40:41]: 是的。而且我相信编程智能体公司也会很乐意与你们合作来弄清楚这一点。是的,我确实认为 Claude Code 和 Codex 对你们来说仍然有使用场景
Diogo Almeida [01:40:49]: 当然
Swyx [01:40:49]: 在那里探索很容易。好的。我们——你,你一直非常配合,纵容我们聊所有这些,所有这些事情。我只想把你从 TypeSafe 里拉出来
前沿节奏、RLVR 与替代研究方向
Diogo Almeida [01:41:00]: 哦,是的
Swyx [01:41:00]: 就泛泛地聊聊。而且你,你已经非常清楚地表明了你在 AI 现状上的立场。在对齐安全方面给你更多空间。
Diogo Almeida [01:41:08]: 哦,我完全没聊安全对齐吗?
Swyx [01:41:11]: 哦。哦,你聊了,你聊了。
Diogo Almeida [01:41:12]: 我觉得我没聊。我觉得也许我没聊。
Swyx [01:41:13]: 你聊了。
Diogo Almeida [01:41:14]: 哦。
Swyx [01:41:14]: 我只是,我觉得有,有很多,你有很多研究者的讨论。我们每次
Diogo Almeida [01:41:20]: 当然
Swyx [01:41:21]: 每次 NeurIPS 都有。
Diogo Almeida [01:41:22]: 是的。
Swyx [01:41:22]: 人们在聊什么?比如,我。举个例子,我最近参加了,其中一场研究者聚会,人们真的在担心节奏问题,对吧?比如,这整个话题,比如,我们应该放慢速度,因为公众,显然还没准备好。而且我确信你有强烈的感受。
Diogo Almeida [01:41:47]: 我觉得这是那种危险的
Swyx [01:41:51]: 好的
Diogo Almeida [01:41:51]: 话题。我很乐意聊。我为危险而活。
Swyx [01:41:55]: 好的。
Diogo Almeida [01:41:56]: 我们公司的品牌是混乱。不是 Jev。是不敬与混乱。
Swyx [01:42:00]: 而且是的。而且,你当时在 OpenAI,正值,那。最早的一批,非常引人注目的事件之一,就是那个小插曲,对吧?就是
Diogo Almeida [01:42:09]: 哦,那个
Swyx [01:42:09]: 那个,比如。而且,你。多米诺骨牌现在已经倒下了,现在每个前沿实验室都联署了一份文件,说他们想要控制节奏。
Diogo Almeida [01:42:18]: 有意思。我。所以这——这是一件非常复杂、微妙的事情。我其实想更正式地写一篇回应。我确实有,一个我回应的简短版本
Swyx [01:42:31]: 是的
Diogo Almeida [01:42:31]: 那就是,随着你进行更多的 RLVR,就像,RLVR 就像是。
Diogo Almeida [01:42:38]: 所以 RLVR 实际上并不是关于可验证奖励的。就像,这在推理革命之前就已经失败了。就像。而这就是任务奇怪的地方,对吧?就像,回到当时。哦,有趣的历史。回到 RLHF 刚开始成为一件事的时候,有三种不同的东西,就像,现在被称为后训练,不同的努力。而指令遵循是迄今为止,就像,那个更庞大的孩子。就像,人们不喜欢它。他们不想把它考虑进去。它很烦人。就像,我和预训练团队谈过。我说,“伙计们,这就是魔法。”而他们说,“我们跑了这么多模型扫描。你想让我们等人工评估来确定用哪些模型?”而且就像,每个人都在,就像,给代码生成团队提供大量,就像,资源,那个团队,就像,他们确实取得了一些成功,但他们非常努力地想在代码上做 RL——就像,单元测试。但这显然没有成功,对吧?就像,你需要推理才能做到。所以,所以只是为了明确,RLVR 并不纯粹是关于奖励的。它也是关于,就像,一切的形态。而其中一部分是推理被包含在这里,就像这个潜在变量,你正在做的事情。而当你做事情时,你只是让模型做它们想做的任何事情,以便让它们尽可能强大,以回答最难的问题。而这整个“跟上前沿”的讨论,我认为,就像,是一个非常狭隘的焦点,因为它假设每个人都需要做更多的 RLVR,对吧?这,就像,我显然不认为我需要在我们的模型上做更多的 RLVR。
Diogo Almeida [01:44:10]: 我认为零是我们这种形态的最优数量。嘿,对吧?就像,拜托。
Swyx [01:44:14]: 是的。
Diogo Almeida [01:44:14]: 。所以我认为这真的有点像是一种障眼法,他们在说我们实际上想继续做看起来危险的事情,因为它会做危险的事情。就像人们说,“哦,也许沙箱化是个问题,”或者其他什么。是的,显然它是,他们本可以轻松解决那个问题,对吧?但他们选择不这样做,因为在这个“做任何事情”的类别中,你让模型做的事情越多,它就越强大,对吧?所以就像,那里——我认为有一些,就像,责任的幻灭,在那些他们有意或无意试图做的事情上,只是一个假设。我们必须做 RLVR,不仅仅是必须做,我们必须做越来越多越来越多,同时给模型,就像,在中间做强大事情——做任何它们想做的事情的权力,因为这教会它们在它之外变得强大。而我们不想限制那些事情,因为那会让它们在这些事情上稍微不那么强大。
Diogo Almeida [01:45:24]: 所以就像,如果你假设所有这些,他们就像,“哦,是的
Swyx [01:45:28]: 那是一个逻辑结论
Diogo Almeida [01:45:29]: 我们正走向一个危险的世界,伙计们。”
Swyx [01:45:31]: 对。
Diogo Almeida [01:45:31]: 就像,“每个人都会这样做,而这是让 AI 生病的唯一方法。”所以 Swyx [01:45:37]: 所以基本上就像,就像,它——这些都是内部一致的,但实际上从一个前提开始,如果你
Diogo Almeida [01:45:45]: 当然
Swyx [01:45:45]: 想一想的话,是有替代方案的。
Diogo Almeida [01:45:45]: 当然。我觉得——就像在苦乐参半的教训方向上,我认为很少有人真正做出了正确的任务。比如AI的新方向。那就是——或者新的北极星。这很罕见。再说一次,就像,我认为LLM本身大概是2.2倍左右,比如RLHF然后是RLCD。
Swyx [01:46:04]: 哦。
Diogo Almeida [01:46:04]: 在我看来,RLVR大概是0.2,我觉得这已经很慷慨了。
Diogo Almeida [01:46:09]: 但或者0.5,或者,就像,它可能是一整个。我真的不在乎。但我确实认为人们在这类事情上思维非常狭隘。而这——这里唯一该受责备的是研究人员,因为肯定不是大众。他们只是假设OpenAI和Anthropic已经在尽力而为,而他们并不是了解真正可选性的专家。
Swyx [01:46:34]: 是的。这很公平。而且就像
Diogo Almeida [01:46:36]: 是的
Swyx [01:46:36]: 你也在尽自己的一份力来唤醒他们。
Diogo Almeida [01:46:38]: 是的。好吧。我在尽力,但就像,我的目标不是,就像,说服实验室还有其他方向
Swyx [01:46:43]: 是的
Diogo Almeida [01:46:44]: 可以走。我的目标是——就像在软件工程师心中点燃希望,让他们开始,就像,真正自动化他们一直想要自动化的东西。我写过这样一篇文章,我的团队不让我写,不让我发表,关于,就像,我想要的AI未来。而且就像,有很多,就像,小事情。就像,记得do what吗?想象一下如果一切都能做do what,因为,就像,那个演示就是do what。
Diogo Almeida [01:47:10]: 就像,你可以。就像,有层次
Swyx [01:47:11]: 是的,不要按我说的做。
Diogo Almeida [01:47:12]: ?
Swyx [01:47:12]: 是的。不要按我说的做,做do what。
Diogo Almeida [01:47:14]: 是的。而且就像,我们还不能做do what,因为,就像,计算机太基础太字面了,但那个computer use就是那样。我认为世界上会出现一些人们根本不理解的流畅度层次。而且就像,智能无处不在的承诺是。它,它,它——我不想过度承诺。我不认为它现在就会发生,但就像,我们会尽我们所能让它发生。
中期训练、预训练和模型缝合
Swyx [01:47:40]: 是的。关于后训练的总体形态还有其他事情吗?你显然非常深入地参与其中。中期训练,那是,你有什么评论吗?我不认为我们曾经谈论过它。
Diogo Almeida [01:47:53]: 中期训练。这都是一个谱系。
Swyx [01:47:57]: 是的。
Diogo Almeida [01:47:57]: 对吧?就像,我是
Swyx [01:48:00]: 这就像课程,但就像,更花哨。
Diogo Almeida [01:48:02]: 是的。就像,它,它,它就像,它是一种节省成本的东西。
Swyx [01:48:06]: 是的。
Diogo Almeida [01:48:06]: 而不是,就像,必须再次预训练。就像,有有趣的东西。我实际上认为,就像,智能在每一个层次都有一种难以言说的特质,而且它总是超级迷人。就像,我是一个形状旋转者,所以我不喜欢发现它,但我喜欢别人发现它并教我。但看数据,这件事,我们的数据团队非常擅长,而我不擅长。
Diogo Almeida [01:48:31]: 我觉得这真的非常吸引人。我其实很喜欢思考,比如,能力是如何在短期内被注入模型的。比如,有那种非常快速的微调对齐,以及长期的。在反复看到一次又一次之后,这些东西会越来越深、越来越深、越来越深、越来越深地被烘焙进模型里,直到它变得稳健。而那就像是北极星一样浮现出来,而 System 1 的东西就是最终变得稳健的东西。所以我觉得中期训练是一件非常吸引人的事情。我是所有形式训练的粉丝。我是所有形式浮现新型智能的粉丝。我不会全部自己做,因为那很昂贵。而且我私下说过,也。
Diogo Almeida [01:49:20]: 我该说这个吗?哈。哈。比如,我的哲学是,任何我应该在私下和投资者说的话,我都应该公开和人们说,因为那就像是
Swyx [01:49:32]: 权力归于人民
Diogo Almeida [01:49:32]: 我的东西。
Swyx [01:49:33]: 是的。
Diogo Almeida [01:49:33]: 是的。所以我之前说过的事情是,如果你给我十亿美元,我不会做预训练。我仍然相信这是真的。这是一件非常昂贵的事情,当。如果你是,比如。比如,如果你是一名 AI 工程师,你可以,比如,切片切块,做各种事情。比如,弗兰肯斯坦式的拼接不是最优雅、最美丽的东西,但它能解决问题,宝贝。
Diogo Almeida [01:49:57]: 所以——除了预训练之外的任何事。
Swyx [01:50:00]: 是的。太棒了。我认为我确实认为有趣的一个方向,就是,综合你所有关于这些模型事情的评论,就是,我们是否有一个超级模型,包含了所有这些能力,还是我们把它们进一步拆分出来?我想,一种说法是,OpenAI 曾经朝着全能模型的方向发展,对吧?4o 就是其中之一。然后有一小段时间,总是有,比如,有一种主分支——这是聊天调优模型,这是编码调优模型。
Diogo Almeida [01:50:35]: 那些是完全不同的东西。那些是极其不同的概念。我会,比如,稍微分解一下。所以多模态有点不同
多模态、后训练与碎片化智能
Diogo Almeida [01:50:44]: 因为有时其他模态有帮助,有时它们有害。
Swyx [01:50:47]: 是的。
Diogo Almeida [01:50:48]: 比如,人们正在移动。他们似乎正在远离语音,这与音频不同,因为它似乎不能很好地泛化到其他东西上。
Diogo Almeida [01:50:57]: 这个问题可能会被解决。我是这一切的粉丝,但这些是经验性的、真实的问题。就像,缩放定律并不是说只要砸钱就能变好。缩放定律实际上是在问一个东西有多好?就像,有些世界里,无论你怎么缩放,可能都不够好。所以,Y- 就像,据我所知,计算机使用目前还没有被解决。就像,我希望我们能成为……就像,在解决这个问题中发挥作用。但就像,它。可能无论我们收集多少数据都无法解决这个问题。我们可能需要更好的方法或其他类似的东西。所以 Diogo Almeida [01:51:33]: 就像,我们。你需要在这一切中非常务实。我是全模态模型的粉丝吗?我是所有形式智能的粉丝,但我会直接进入你谈到的一个与预训练不同的东西,那就是后训练,因为我讨厌分裂智能。那对我来说是坏事。而这整个,就像,聊天优先的推理模式,是因为它迫使智能被分裂。就像,当你为聊天进行优化时,这往往是纯粹的 RLHF,而 RLHF 中很内在的一点就是做人们自然会抱怨的事情,对吧?就像,哦,我要
Swyx [01:52:07]: 你完全正确。而且
Diogo Almeida [01:52:08]: 是的
Swyx [01:52:08]: 。
Diogo Almeida [01:52:09]: 谄媚,心理谄媚
Swyx [01:52:10]: 是的
Diogo Almeida [01:52:11]: 我- 不管什么词
Swyx [01:52:11]: 是的
Diogo Almeida [01:52:11]: 怎么- 或者怎么发音。过度自信,幻觉。就像,即使在 LM Arena 中表现出色的那种风格,粗体、斜体、表情符号?就像,它不会简单地回答问题。它会给出,就像,一篇长篇大论,然后问你一个后续问题,这样感觉更像是一个人在和你说话。所有这些东西,都是因为字符串非常奇怪?它们就像,奇怪的东西,你需要被错误校准。你需要,就像,模式崩溃。你需要极度自信,以免失控,因为当这种情况发生时,奖励模型会非常严厉地惩罚你,因为那是显而易见的。Y- 然后这,就像,完全扭曲了概率空间,并且它与推理模型的概率空间相互作用,对吧?因为,就像,它。这些模型就像,这些简单的线性东西,倾向于稍微作弊。所以我认为这与暴露智能非常不同,这是我的猜测。而智能的很多艺术在于研究这种微妙之处,我认为,至少当我在 OpenAI 时,人们并没有真正研究这个,因为,就像,他们只是说,“聊天”,就像人们现在对 Jev 那样。
Swyx [01:53:19]: 是的,你给我一个终极目标。你给我一个目标,我就会全力优化它,对吧?就像,而且它
Diogo Almeida [01:53:23]: 是的。但如果你在那里尝试。就像,俗话说,你可以有,就像,两个目标,你可以只是,就像,同时优化两者,但那实际上就是分裂的行为,对吧?所以是的。
Swyx [01:53:33]: 所以在某些方面,你- 你也将智能分裂为系统 1、系统 2,但你只是不同意其他人的分裂,这没关系。
Diogo Almeida [01:53:41]: 哦,它
Swyx [01:53:41]: 这没关系。
Diogo Almeida [01:53:42]: 这有点不同。不。如果我可以,如果我可以补充,如果我可以辩护
Swyx [01:53:46]: 是的
Diogo Almeida [01:53:46]: 系统2任务,第一,我们并不是要抛弃系统2任务,对吧?你可以试着让Jev去处理它,而且确实存在一个智能的答案,那就是未知。就像,我的。就像,那里。就像,在系统2任务中,有更好和更差的行为,这应该是,非常低的置信度,大量的不确定性。也许一些启发式方法可以,稍微推动一下,但我们也关心它们,只是要说清楚。我只是认为那不是。什么是。智能是天生属于。所以我们并不是试图去分裂任何类似的东西。而且所有的分裂都会让模型变笨。就像,如果人们,让模型说,它是OpenAI或Qwen或,Claude或其他什么,我不太清楚现在它说什么。我不会在模型中放入你是来自TypeSafe的Jev。那会分裂它,对吧?就像,它。我不想要那样。就像,代表互联网认为的东西,对吧?就像,要正确。这就是我想要的,因为这样你才能得到平滑、可预测的智能。
Swyx [01:54:50]: 我,身份是一个东西,我想,那是
Diogo Almeida [01:54:53]: 我- 对于,它- 对于
Swyx [01:54:54]: 有点特别的
Diogo Almeida [01:54:55]: 对于第一方产品,是的。
Swyx [01:54:56]: 是的。
Diogo Almeida [01:54:56]: 但就像,对于API,我不这么认为。
Swyx [01:54:58]: 是的。好的。
Diogo Almeida [01:54:59]: ?
Swyx [01:54:59]: 是的,那很好。
Diogo Almeida [01:54:59]: 就像,我不。我。就像,人们不想要。如果他们用ChatGPT制作聊天机器人,他们不希望它说它是ChatGPT。他们想说它是,比如,Chipout AI或其他什么,对吧?
身份、API和Jev技能
Swyx [01:55:09]: 嗯,所以你也必须弥补的方式是你有技能,对吧?那个
Diogo Almeida [01:55:13]: 是的
Swyx [01:55:13]: Jev技能,是用于编码代理与Jev一起工作的。
Diogo Almeida [01:55:16]: 是的。
Swyx [01:55:16]: 好的,几个结束问题
Diogo Almeida [01:55:19]: 当然
Swyx [01:55:19]: 因为我确实想,让你离开。一个是,就像,只是反思你的两年旅程。大约两年?两年多?
Diogo Almeida [01:55:25]: 与公司
Swyx [01:55:26]: 是的
Diogo Almeida [01:55:26]: 我认为这更像是四年的旅程。
Swyx [01:55:29]: 是的。
Diogo Almeida [01:55:29]: 但是
Swyx [01:55:29]: 嗯,是的。实际上,就像,我在想,记得,你有一个,就像,感恩节前后的英雄跑。你就像。你取消了所有事情,因为,你就像,“伙计们,大家都在度假。我要拿走所有开放的边缘GPU去做这件事。”
Diogo Almeida [01:55:42]: 是的。那是个好时光。
Swyx [01:55:44]: 那就像是,TypeSafe之前
Diogo Almeida [01:55:46]: 是的
Swyx [01:55:46]: 的时刻,对吧?
Diogo Almeida [01:55:47]: 我。那可能是。那是政变发生的时候吗?我不太清楚。
Swyx [01:55:50]: 是的,实际上。
Diogo Almeida [01:55:51]: 是的。听起来对。是的。我记得。哦天哪,我不想。我不。我现在没时间八卦政变的事,但那真的很烦人。
Swyx [01:56:04]: 政变很烦人还是跑步很烦人?
Diogo Almeida [01:56:06]: 那场政变很烦人。
Swyx [01:56:07]: 政变。好吧。
Diogo Almeida [01:56:07]: 是的。
Swyx [01:56:08]: 是的。
Diogo Almeida [01:56:09]: 它。我会
Swyx [01:56:10]: Safia 接管了公司。是的,不管怎样。
Diogo Almeida [01:56:14]: 也许下次我们聊天
Swyx [01:56:16]: 好的。好吧,好吧
Diogo Almeida [01:56:16]: 我会,我会爆料。关于政变的爆料。是的。实际上,这个问题在 ChatGPT 发布之前就一直在我脑海里。我当时想,“天哪,ChatGPT 团队正在酝酿大招。他们正在做正确的任务。”他们正在做 AI 研究人员不擅长但成功的产品人员擅长的事情,那就是非常关注体验。这非常罕见。他们。就像,OpenAI 里很少有人这样。而那些家伙在这方面做得非常好。
从 InstructGPT 到 TypeSafe
Swyx [01:56:50]: 明确一下,这是从 GPT-3 到 3.5 的整个历程,其中包括你提到过的 AI Dungeon
Diogo Almeida [01:56:55]: 是的
Swyx [01:56:55]: 就像。是的。嗯,那是,那是我们从未预测过的用例的一个例子。
Diogo Almeida [01:56:59]: 是的,没错。
Swyx [01:56:59]: 没错。
Diogo Almeida [01:57:00]: 嗯,哦,是的,那是一个。另外,我曾为部署 InstructGPT 而非常努力地争取。
Diogo Almeida [01:57:07]: 就像,实际上它的早期版本甚至是用一种我们没有发表的算法训练的,那是我自己做的,因为清理 PPO 数据太慢了。我当时想,“去他的。这玩意儿太他妈好了。我们需要把它交到用户手中。”
Diogo Almeida [01:57:21]: 而且基本上它立刻占据了当时 LLM 市场 50% 的份额。但是。我们认为它。我做了。我费了很大劲确保我们发布视频中的一切都是真实的。我们。我真的在想,“这是 AGI 吗,因为它在指令方面是超人的,在指令输入输出方面?”你。显然,它不是,但就像,我认为每个人都应该对为什么那不是 AGI 有一个答案,因为它看起来非常聪明。而我的答案最终,就像,最终只被用于文案写作。Jasper AI、Copy.ai,就像写作,就像现在网页上所谓的垃圾内容。我们担心我们把互联网变得更糟了,对吧?我回到绘图板,我想,“缺少了什么?我们显然很聪明。它缺少了某种东西,比如创造价值。那是什么?”就像,我当时实际上在做更多的哲学思考,比如,“到底发生了什么?”答案是,“哦,机器。”我问自己的问题是,“让我们从基于 AI 的经济革命倒推。当那发生时,会是什么。如果 AI 是一个 API,我们会称 AI 为什么?会是人类还是代码?”我推断会是很多个九的代码。但是,所有的优化都进入了人类部分。然后我恍然大悟。我想,“天哪,这就是北极星。”我想,就像,我写了一份文档。我,就像,和 Sam 谈论这个。Sam 说,“这太他妈好了。你应该去做这个。”我们说,“是的,Sam,我有工作。”就像,它。我当时在
Swyx [01:58:51]: Sam 只是告诉你去做了。老兄,去做吧。
Diogo Almeida [01:58:54]: 但就像,我当时猜测是,这太明显了。就像,这简直难以置信地明显。Anthropic 肯定已经在研究这个了?而且就像,我们已经被煮熟了,而且实际上 OpenAI 在追赶方面比在真正创新方面做得更好。所以就像,ChatGPT 是 Claude 的复制品,对吧?就像,他们内部有个东西。他们只是没有发布出来。
Swyx [01:59:13]: 是的。对。Claude 和 Slack。但推理,我会说是第一个左右的。
Diogo Almeida [01:59:17]: 对。
Swyx [01:59:18]: 对。
Diogo Almeida [01:59:18]: 但那个产品有多好是有争议的。
Swyx [01:59:21]: 对。
Diogo Almeida [01:59:21]: 不过研究很棒。超级棒的研究。我只是不确定人们是否有那个产品需求。而且 Claude 也做了编码代理的东西。所以 Sam 这么说,我就回去干我的活一段时间。最终,就像,指令遵循团队就说,“我们赢了。我们解决了指令遵循。我们不需要再做东西了。”我就像,试着想我接下来做什么。我就像,“也许我就,开始玩玩这个。”我,做更多哲学和设计和思考。我以为开始训练模型时会花一周时间。结果花了,Diogo Almeida [01:59:58]: 很多年。某个时候我就像,“天哪,这里有生命的迹象。”这个。它显然没成功,对吧?否则,我们就部署它了。但就像,我想探索从研究角度全力投入这个会是什么样。就像,我真的想看看,就像,如果你,就像,绝对疯狂地全力投入这个方向会是什么样。而且因为我说的话,就像,如果 AI 寒冬发生了,我会。我会怎么感觉?我会认为我个人有责任。我当时和其他公司谈过,我就像,“嘿,我想在这个方向开个实验室。”而且就像,有感兴趣,我就跟他们谈,“多快。什么会更快?这个还是创业公司?”他们就说,“创业公司。”我就说,“去他的,伙计。我们干。”
Swyx [02:00:44]: 对。
Diogo Almeida [02:00:44]: “我猜我们在搞些疯狂的东西。”而且
Swyx [02:00:47]: 而且你打电话给 Eric 和 Sasha 还有
Diogo Almeida [02:00:48]: 对。嗯,我先打电话给 Eric。对于 Sasha,我实际上没试图招募她。我试图做好,我就说,“嘿,我疯了吗?这里缺了什么吗?不是有,就像,我是不是太在 OpenAI 泡沫里了,以至于没意识到这肯定有解决方案?”然后 Sasha 就说,“我加入。”我就说,“Sasha,你在创业公司工作。”她说,“我现在就把它关了。”我就说,“你想考虑一下吗?”她说,“哦,对。好点子。让我想想。”然后她就加入了。
Swyx [02:01:19]: 对。
Diogo Almeida [02:01:19]: 然后,两周内我们就有了资金。我们-我们有,就像,人们搬进我的公寓。那是最糟糕的,因为我是个有洁癖的人。我们就继续搞,最终我们得到了研究,
创办 TypeSafe 和对前沿研究者的建议
Diogo Almeida [02:01:34]: 那显示了生命的迹象?
Swyx [02:01:37]: 对。
Diogo Almeida [02:01:37]: 那是,那是一段疯狂的时间。
Swyx [02:01:38]: 所以问-问题是。那都是长上下文。
Diogo Almeida [02:01:41]: 哦,对。
Swyx [02:01:41]: 然后现在问题是,像你这样的人
Diogo Almeida [02:01:43]: 是的
Swyx [02:01:43]: 现在就在前沿实验室里,因为拿不到资金或资源,或者关注度什么的而感到沮丧。你对他们有什么建议?他们应该做你做过的事吗?
Diogo Almeida [02:01:54]: 他们应该这么做吗。哦,这是个很有意思的问题。
Diogo Almeida [02:02:03]: 哦,天哪。我怎么才能做到不烧断后路呢?
Diogo Almeida [02:02:08]: 我——我的感觉是,大多数新——除非存在某种我真正不理解的经济学逻辑,我认为大多数新实验室都是垃圾。我不想看到自己把那些人当作同行。就像,我真的不理解那里在发生什么。就像,是不是因为——就像,第一,我并不真正看重研究者。我看重的是那些……就像,看看我的苦涩教训,对吧?
Swyx [02:02:33]: 数据,任务。
Diogo Almeida [02:02:34]: 我想要。嗯,不只是那个。
Swyx [02:02:35]: 是的。
Diogo Almeida [02:02:35]: 我,就像,我们需要研究者,但我们需要他们对正确的任务极其在乎,这才是重要的,对吧?所以这实际上,就像,那个。这,这有点本末倒置,当人们看重纯粹的研究血统时,因为那通常不创造价值。所以它。就像,第一,我相信北极星任务,做酷的、真正有用的东西。第二,因为我不看重研究者,我不,我不建议走那条路。嗯,它显然对某些人是有利可图的,或者在这个环境中可能是。所以就像,从纯粹务实的角度来看,我不认为创建新实验室是想要——是创造价值的东西。它似乎是在摧毁价值,因为,就像,他们,就像,从头重做工作,而且,就像,真正推动前沿的概率很低。而且就我和大多数新实验室聊过的来看,他们并没有真正的方向。他们往往想要钱来玩他们的实验。如果他们有一个方向,我超级支持,说清楚。所以我对某人的建议是,这真的取决于你为什么做这件事?如果你是一个想玩研究的研究者,说实话,实验室可能是做那件事最好的地方。就像,可能还有其他地方。我并不真正关注那些政治,但我个人只会建议不要那样?就像,我认为人们被驱动去解决真正的问题对世界更好。那些问题可能是探索性的。那没问题。但就像,理想情况下要有你支持的原则。但如果你认为你想做正确的任务,就像,绝对他妈的去做。就像,请做吧。就像,请打破这个,就像,单一心智,单一模态,就像
Swyx [02:04:21]: 蜂巢思维。
Diogo Almeida [02:04:21]: 是的,没错。就像,每——就像,再说一次,这种给前沿定节奏的做法来自,就像,对AI的这一种看法,看起来像,AI超级天才,极其参差不齐,而且那是,Swyx [02:04:36]: 可解决的。
Diogo Almeida [02:04:37]: 它是可解决的,而且它很奇怪,而且它,就像,与现实不符。而且它就像。这很悲剧,对吧?就像,我认为,就像,所有这些。就像,那个。就像,真正发掘技术,我认为,就像,就是好事。
Swyx [02:04:51]: 是的。不管怎样,再说一次,我是在试图准——准确代表我聊过的Anthropic、OpenAI那些人的立场,顺便说一下,还有SpaceX,就是,它是。这更多是一个政治问题,而不是纯粹的Xris问题。
Diogo Almeida [02:05:05]: 是的。
Swyx [02:05:06]: 所以是的。政治定位是
Diogo Almeida [02:05:08]: 还有那个。那超出了我的职责范围。
Swyx [02:05:10]: 没错,是的。
Diogo Almeida [02:05:10]: 那远远超出了我的职责范围。
Swyx [02:05:12]: 一旦他们,一旦他们告诉我那件事,我就想,“我明白了。这是关于2028年选举的。”
Diogo Almeida [02:05:18]: 哦,不。
Swyx [02:05:19]: 是的。
Diogo Almeida [02:05:19]: 哦,我真希望我没听到那个。那感觉太糟糕了。
Diogo Almeida [02:05:22]: 所以
Swyx [02:05:23]: 不。这不是整个公司。
Diogo Almeida [02:05:24]: 是的。
Swyx [02:05:24]: 这只是那个房间里的讨论。
Diogo Almeida [02:05:26]: 不。那说得通。
Swyx [02:05:28]: 是的。是的。
Diogo Almeida [02:05:28]: 那让我对人性有点失去信心,但也许我只是个天真的技术专家。
Swyx [02:05:33]: 这真的开始变得重要了
Diogo Almeida [02:05:35]: 是的
Swyx [02:05:35]: 谁,谁在掌管政府,那将有助于在这些事物出现时进行监管。而且,作为一个实验室
Diogo Almeida [02:05:41]: 我觉
Swyx [02:05:41]: 你可能应该好好考虑一下。
Diogo Almeida [02:05:43]: 不。不。说清楚点,我完全同意那个。就像,我认为对此有明确立场非常重要。我个人害怕试图误导人们,因为我认为那会让人吃大亏?就像,我认为,人们试图过度自信,就像,我显然只是。我实际上不会谈论政治。我认为在新冠疫情期间发生的事情是,人们过于倾向于诉诸权威和过度自信,试图让人们以某些方式行事。而且,显然我们的应对极其不理想,那产生了连锁反应,我认为现在对世界极其糟糕。就像,也许我天真。我认为误导人们,即使是为了更大的利益或他们认为的更大利益,也只是,只是。我不喜欢。
Swyx [02:06:41]: 是的。
Diogo Almeida [02:06:41]: 我宁愿,我宁愿不做。
Swyx [02:06:42]: 不管怎样,我。这不是一个。我不认为这是误导。就像,这就是为什么是现在。
Diogo Almeida [02:06:46]: 是的。
Swyx [02:06:46]: 为什么。是的。为,就像,为?
Diogo Almeida [02:06:49]: 那个。我认为那件事
Swyx [02:06:50]: 就像,Dario Rodas在五月说的,就像,“我们现在他妈的在干什么?”
Diogo Almeida [02:06:52]: 我认为这就是为什么现在有点,误导性,关于,风险和,目标。它。有,就像
Swyx [02:06:58]: 是的
Diogo Almeida [02:06:59]: 某种程度的,狡猾潜伏其中
Swyx [02:07:02]: 是的
Diogo Almeida [02:07:02]: 那值得指出,我认为值得承认。嗯,显然他们想要。如果他们想要操纵,那么他们不应该承认那一点。那似乎是个糟糕的策略。
Swyx [02:07:11]: 不。
Diogo Almeida [02:07:11]: 但对我来说,那对世界来说只是可悲。
Swyx [02:07:14]: 是的。
Diogo Almeida [02:07:15]: 希望我永远不会。我已经。是的。希望,就像,我们永远不会卷入任何
Swyx [02:07:21]: 是的
Diogo Almeida [02:07:21]: 像那样的事情。随着我们变大,这可能不可避免,但我想。我想尽可能保持,像,纯粹的技术专家本色。
Swyx [02:07:29]: Jev 当总统。为什么不呢?我可以。我。比起我自己的决定,我更信任 Jev 的决定。好了,少点废话贴,多聊聊
Diogo Almeida [02:07:39]: 少点废话贴。
Swyx [02:07:40]: 不。对我来说。
Diogo Almeida [02:07:41]: 你只是好心
Swyx [02:07:42]: 我在发废-我在发废话贴。
Diogo Almeida [02:07:42]: 哦,你只是在粉碎我的希望
Swyx [02:07:43]: 不。我不会发废话贴的
Diogo Almeida [02:07:44]: 关于,比如,当下美国在世界上的处境。
Diogo Almeida [02:07:46]: 哦我的天。
Swyx [02:07:47]: 是的。就像,有。我有点。我觉得我看了太多关于,比如,阴谋论的电视节目,才会去思考总统职位的事。
Diogo Almeida [02:07:52]: 哦,不。
Swyx [02:07:52]: 那个,你已经选好了你的北极星。你已经选择了可靠性。你身处一个可编程且可组合的 AI 之中。
Diogo Almeida [02:07:59]: 而且便宜。
Swyx [02:07:59]: 而且便宜。
游戏、KV 缓存,以及重新思考编码智能体
Diogo Almeida [02:08:00]: 是的。
Swyx [02:08:00]: 那第二个或第三个你想抛给别人、你自己不会去做的,是什么?你想让别人去做、而你自己不会去做的事?
Diogo Almeida [02:08:06]: 噢。
Swyx [02:08:07]: 就像,基本上就是给大家派任务。
Diogo Almeida [02:08:10]: 给大家派任务?
Swyx [02:08:11]: 是的,就像,那是你的任务
Diogo Almeida [02:08:12]: 哦,我想做的太多了。哦,什么?
Swyx [02:08:13]: 你已经选好了你的任务,对吧?什么?
Diogo Almeida [02:08:15]: 什么?等等,我。这问题太好了。我的天。哦,天哪,我太兴奋了。
Swyx [02:08:19]: 因为你会,你会,接下来大概 50 年,你都会忙着做你自己的事。
Diogo Almeida [02:08:23]: 那当然。好吧,那让我给出一个有趣的,和一个不那么有趣的。再-然后,也许一个既有价值又有趣的。
Diogo Almeida [02:08:32]: 我觉得有趣的,是我认为游戏如果能变得智能,那会酷得不得了。就像,当我看到人们玩,比如 Ali 的 Doom 演示,在那里,你可以,比如,让 NPC 控制东西,就像,那真的只是,就像,一个概念验证。我觉得可以做出真正酷的东西。它看起来真的很酷。就像,我是 Stardew Valley 的超级粉丝?而且它,它真的很静态,却依然引人入胜。就像,我觉得可以发生很多很酷的故事。你不需要,比如,在游戏循环里调用 Jev。那样可能太贵了。但即便是,比如,简单的,比如,给 NPC 用的状态机,我觉得你就能做出,比如,一个如此引人入胜的世界。哦,天哪。
Diogo Almeida [02:09:13]: 而且,天哪,有点难过,我没法做这类事情。
Swyx [02:09:17]: 是的。
Diogo Almeida [02:09:18]: 我的人生道路现在有点定下来了,而我,Swyx [02:09:22]: 是的,但你可以叫别人来做
Diogo Almeida [02:09:23]: 是的。那很酷
Swyx [02:09:23]: 然后你可以,比如,给它反馈。
Diogo Almeida [02:09:25]: 而我真正想探索的东西是,比如,摆脱 KV 缓存暴政的编码智能体。就像,它可能不如真正的编码智能体那么好,但我觉得有太多奇怪的东西值得思考。这-这就是我写那篇《KV 缓存统治着我周围的一切》文章的原因。
Diogo Almeida [02:09:46]: 信不信由你,我谷歌搜索时,觉得网上没人用过“缓存统治我周围的一切”这个说法,C-A-C-H-E,当我,当我谷歌它的时候。
Swyx [02:09:57]: 好的
Diogo Almeida [02:09:57]: 所以,我写这个是因为我想告诉人们,这就是编码代理——代理是如何工作的,以及 KV 缓存是如何工作的等等。我觉得。我不知道。是的。
Diogo Almeida [02:10:13]: 就像,它解释了很多东西,比如为什么路由真的很难,为什么子代理似乎不起作用,比如,为什么压缩是一个如此困难的问题。我打算尝试发布一份文档。我的团队可能会否决我,因为信不信由你,我不是负责人。
Diogo Almeida [02:10:29]: 但我希望是。但我想发布一份文档,像是“这是我的想法。请试试看,请找出所有我们可以用编码代理做的事情,比如,一旦你从 KV 缓存的暴政中解放出来。”
Swyx [02:10:46]: 这是它锁定你并且
Diogo Almeida [02:10:48]: 嗯,不是。它锁——它把你锁定到一个模型上,对吧?为了高效地做这件事,你需要,比如,不断追加到它。所以现在你没有在做最佳软件实践,比如状态管理、抽象、分解。为什么你不能给一个更简单的任务一些。是的,为什么你不能给子代理一个更简单的任务?因为你传递的状态。哦,我碰了这个。因为你传递的状态,你需要——需要比用来阅读这个的智能便宜得多的智能来传递这个状态。为什么你不能聪明地处理它,对吧?我认为那里有,比如,大量非常酷、有趣的研究可以做,比如,不同的编程模式。有点像人们正在玩的东西,比如,递归语言模型。就像,我觉得这里有很多酷的东西,当你想到,比如,“哦,我想明确地标记一切的状态。”或者想象你有一个,比如,子任务。就像,编码代理,我认为公平地说,它们一次处理一个子任务,从分解的角度来看。为什么你需要把所有这些状态传回父任务?
Swyx [02:11:49]: 是的。
Diogo Almeida [02:11:50]: 为什么你不能在这方面做些聪明的处理呢?而且,如果你有一个带标签的子任务层级结构,为什么不能在需要相关上下文时,在那个子任务树中进行搜索呢,对吧?然后,还有另一件你可以做的事。哦,天哪,我忘了写点关于这个的东西。我这里有一些真的很酷的想法。希望能发表出来。我很乐意聊聊这个,但是,这会是一份很长的文档。而且,如果上下文变得廉价了,那为什么不能做一些很酷的模式,比如非常廉价地查看你的历史上下文呢?你每次都从零开始,还需要解决一个叫持续学习的问题,这是不是有点奇怪?那其实是一个内存管理问题,因为你没有一种智能的方式来查找内存,对吧?但如果你能做到呢?如果你能一直这样做呢?或者,如果你有并行的子代理,它们能读取彼此的状态,因为所有这些都在你的计算机内存里,而且你能智能地处理同时进行的读写,你的编码代理集群之类的对事物加锁,并且能智能地协调,而不是用那种很基础的锁。比如,“你在干什么?我在干什么?”“Jev,谁应该先写?”之类的。而且,我觉得那里的未来是
Swyx [02:13:04]: 我的天啊
Diogo Almeida [02:13:05]: 太疯狂了。是的。
Swyx [02:13:06]: Jev 来解决锁的问题。
Diogo Almeida [02:13:07]: 对于多个代理协同工作来说,这可能会非常酷。或者,如果你考虑状态
Swyx [02:13:12]: 是的
Diogo Almeida [02:13:12]: 比如,你有
Swyx [02:13:12]: 代理集群之类的。
Diogo Almeida [02:13:13]: 是的。
Swyx [02:13:13]: 是的。
Diogo Almeida [02:13:13]: 而且有些事情,例如,是只读进程。有些人喜欢获取代理正在做什么的摘要。
Swyx [02:13:20]: 是的。
Diogo Almeida [02:13:21]: 为什么它们不能轻松地共享状态呢?因为,比如,一个只读代理需要读取上下文的一部分,并弄清楚什么值得说,比如,实际上正在写入什么,因为探索并不是特别重要,或者这里是子任务树。我觉得,如果一个真正聪明的人,比如,投入大量时间重新思考编码代理体验,那可以做出很多不同的有趣事情,而那会超级超级棒。
Swyx [02:13:46]: 是的。
Diogo Almeida [02:13:47]: 天哪,我。那会是我的梦想。
Swyx [02:13:48]: 如果你还没看过的话,我会把你引向 PrimeAgent。所以这个,和 RLM 的工作一起运作。我们刚刚在你前面那位椅子上,和 Alex 聊过,他是 Ellen 的朋友。
Diogo Almeida [02:13:59]: 哦,酷。
Swyx [02:14:00]: 而且,是的,这个正在被推进,但还没有特别流行。
Diogo Almeida [02:14:04]: 是的。
Swyx [02:14:04]: 而且如果,是的
Diogo Almeida [02:14:05]: 嗯,是的。但希望如此。是的,我希望每个人都能,比如,随便玩玩
Swyx [02:14:08]: 是的
Diogo Almeida [02:14:09]: 那些奇怪的东西。我不能保证它会成功,但从技术角度来看,它看起来真的很有趣。所以是的,那看起来很酷,很酷。
Swyx [02:14:18]: 看起来很酷。
Diogo Almeida [02:14:18]: 比如说,我。比如说,一旦我们弄清楚如何发放积分,我会很乐意,比如说,把积分发放给这样的人。
Swyx [02:14:23]: 是的。你肯定会有能力资助研究的。
Diogo Almeida [02:14:26]: 是的。
Swyx [02:14:26]: 不。总之,恭喜你取得的所有成功。你,比如说,从我第一次见到你以来,你已经走了,走了这么远,比如说,整个团队也是。
智能体状态、记忆与多智能体协调
Diogo Almeida [02:14:32]: 我愿意认为我还是同一个人。
Swyx [02:14:34]: 是的。是的。我想。但我觉得,比如说,你身上有一种我从未见过的活力,因为你找到了你的使命。
Diogo Almeida [02:14:40]: 不。那是真的。那绝对是真的。
Swyx [02:14:41]: 而且
Diogo Almeida [02:14:42]: 我本来
Swyx [02:14:42]: 你在清晰地阐述你的使命,因为你,很多年来你一直在抱怨这些问题,但你还没有解决方案,对吧?而你,比如说,你有了,你有了大致的轮廓,然后你必须去做,投入工作。
Diogo Almeida [02:14:55]: 我要说这在一定程度上是因为我把自己描述为 0% 的创业型。
Diogo Almeida [02:15:03]: 我不喜欢初创公司。我这辈子从来没想过要当 CEO。我无法想象有人会做这种事两次。这看起来太可怕了。说实话,做一次就已经够糟了。我们最初融资的时候,有个投资人问我,比如说,“你敬仰哪些 CEO?”我当时就想,“呃,我为什么要敬仰那些人?”
Diogo Almeida [02:15:22]: 无意冒犯任何人。我在努力做到,比如说,我在努力做到真诚和善良。我遇到过,比如说,很多非常好的人,但比如说,那些出名的人似乎,比如说,有很多,比如说,不可告人的秘密。而且我觉得我在 OpenAI 的时候确实感到很无力。比如说,我感觉,是的。比如说,现在说实话稍微容易一点了,因为,比如说,我至少有一些证据表明这个方向是行得通的。比如说,我只是觉得在那座疯狂的房子里,每个人都只是说,“ChatGPT,是的。比如说,我们把 ChatGPT 放到所有东西里的哪里?我们怎么让 ChatGPT 对,比如说,开发者之类的人好用?”而我就想,“你在说什么?比如说,函数调用接口简直疯了。你为什么要部署这个?”比如说,这,这太反开发者了。
Swyx [02:16:04]: 这算是一种在补丁之上打补丁再打补丁的取巧方式。
Diogo Almeida [02:16:07]: 嗯
Swyx [02:16:07]: 是的
Diogo Almeida [02:16:07]: 不只是那样。比如说,我经常说的是,如果有一个,你——这也可能是我现在没时间聊的八卦,但我总是说,比如说,“如果你想让我参与任何涉及,比如说,函数调用的项目,除非你为每个函数都拿到了 logit bias。”比如说,所以对我来说这是非常非常简单的请求。因为
Swyx [02:16:32]: 这有点像一种置信度,但没有经过校准。
Diogo Almeida [02:16:34]: 哦,或者说是它的一个概率,对吧?
Swyx [02:16:36]: 是的。
Diogo Almeida [02:16:36]: 比如说,我们需要给用户控制的能力,比如说,假设他们有动作
Swyx [02:16:42]: 哦,是的
Diogo Almeida [02:16:42]: 或者拒绝,或者允许。是的,迪士尼需要设定一个与 AI Dungeon 不同的拒绝阈值。目前用函数调用控制这一点的唯一方法就是说,比如,“求求你了”?这太疯狂了。对开发者来说,这是一个疯狂的接口,而且人们已经为此纠结了好几年,对吧?就像他们在技能方面仍然存在这个问题。比如,现有的编码代理高度过拟合于它们现有的框架,因为它们参差不齐。由于过拟合,它们往往不能很好地使用外部工具和 MCP。而且,为什么大公司不能允许这些轻微的推动,比如,“多调用这个。它真的很有用。”
Diogo Almeida [02:17:22]: 对吧?而解决方案就是在系统消息里乞求。这太疯狂了。
Swyx [02:17:29]: 但是不,好吧。我想我明白你的意思了。而且,天哪,谈论所有这些事情真是太令人兴奋了。
Diogo Almeida [02:17:35]: 谢谢。
Swyx [02:17:35]: 能请你来播客真是太酷了。
Diogo Almeida [02:17:37]: 耶。
Swyx [02:17:38]: 你会去做惊人的事情,伙计。比如,我对你的下一次重大发布感到兴奋,不管是什么。
Diogo Almeida [02:17:43]: 哦,当然。
Swyx [02:17:44]: 是的。
Diogo Almeida [02:17:44]: 你就等着吧。
Swyx [02:17:45]: 是的。
Diogo Almeida [02:17:46]: 你就等着吧。可能比你想象的更快。
Swyx [02:17:48]: 所以招聘数据人员、基础设施人员,我猜还有营销人员。
Diogo Almeida [02:17:51]: 100% 感觉。取决于你问谁。
Swyx [02:17:53]: 社区人员。
Diogo Almeida [02:17:54]: 如果你问我
Swyx [02:17:55]: 是的
Diogo Almeida [02:17:55]: 我觉得我是一个相当不错的创始营销人员。但如果你问我团队里的任何人,他们会说,“闭嘴,Diego。你需要做 CEO 的事情。”所以是的,创始营销人员
Swyx [02:18:03]: 而且这不仅仅是关于香料。比如,我认为你非常注重香料,这是你的独特才能。但有时你只需要说
Diogo Almeida [02:18:10]: 我知道,我知道
Swyx [02:18:10]: 比如,是的。
Diogo Almeida [02:18:11]: 我真的很想
Swyx [02:18:11]: 做团队、多团队的事情。是的。
Diogo Almeida [02:18:12]: 是的,我。没有什么比有一大堆事情要做更能教会你授权了。招聘数据人员,或者我们称他们为模型能力人员,但他们是数据人员,因为数据在这个行业里有点像贬义词。而且我想确保他们
Swyx [02:18:28]: 我不这么认为。我们这里非常支持数据。
Diogo Almeida [02:18:29]: 是的,但我希望他们成为最高地位的,实际上在模型上工作的人,这听起来有点奇怪。我希望每个人都有平等的地位,但我想平衡这一点,我想知道这真的很有价值。
Swyx [02:18:40]: 这些人比其他人更平等。
Diogo Almeida [02:18:42]: 好吧。我不喜欢奇怪的等级制度,我认为在公司里我最自豪的事情之一就是他们不太尊重我,或者他们不表现出来。他们捉弄我,和我开玩笑,有时对我不好,所有这些。我认为这是一个文化的好迹象。我们正在招聘平台人员,比如到处构建 Jev 的人。比如,我们对位置更加敏感,因为光速更是一个瓶颈。
Diogo Almeida [02:19:09]: 对吧?就像,我为欧洲用户感到非常难过,我们只是快了大概三倍,而不是快100倍,因为我们现在在那里没有服务器。而且就像,这太疯狂了,对吧?但就像
Swyx [02:19:20]: 没关系。欧洲的生活节奏也慢一点。没关系。
Diogo Almeida [02:19:24]: 哇,我真不敢相信你。是你说的,不是我说的。或者说到处都一样。
结尾:招聘与智能的 AWS
Swyx [02:19:30]: 是的。
Diogo Almeida [02:19:30]: 就像,如果每秒智能是一个重要的指标,就像,我们会在各地推出这个。就像,我们在乎。就像,如果他们是基于我们构建的开发者,我非常在乎你们。而且我们正在招聘人员来继续构建更多——就像,不只是。就像,目标不只是成为像 Jev 这样的公司。目标是,就像,在那之上交付更多形态的智能。所以我们也在招聘人员来构建这些东西。就像,我们不想只是,就像,是的,就像,那个简单模型的单一招数。但就像,我认为会有一个,就像,智能的 AWS?而且
Swyx [02:20:07]: 顺便说一句,那会是你,对吧?是的。
Diogo Almeida [02:20:09]: 就像,那是我想要走的方向。
Swyx [02:20:11]: 是的。好的。
Diogo Almeida [02:20:11]: 说它会是我,那就太傲慢了。
Swyx [02:20:13]: 是的。
Diogo Almeida [02:20:13]: 就像,我们。就像,我会尽我所能确保那发生。
Swyx [02:20:18]: 是的。
Diogo Almeida [02:20:18]: 就像,我认为那会非常酷。就像,我们现在正在玩的是,就像,System 1 智能。想象一下那些层?就像,这就像是它的 TCP。
Swyx [02:20:30]: 是的。还有好几层要走。
Diogo Almeida [02:20:33]: 是的。
Swyx [02:20:33]: 谁知道还有什么?顺便说一句,我也推销过 Temporal。我不知道。我们需要把 Temporal 当作第八层来谈谈
Diogo Almeida [02:20:38]: 哦
Swyx [02:20:39]: 在七层之外。
Diogo Almeida [02:20:40]: 哦。
Swyx [02:20:41]: 但无论如何,我们可以永远聊下去。
Diogo Almeida [02:20:43]: 当然。
Swyx [02:20:43]: 你得回去工作或睡觉了。
Diogo Almeida [02:20:44]: 是的。
Swyx [02:20:45]: 谢谢你来。
Diogo Almeida [02:20:45]: 哦,天哪。是的。酷。非常欢迎。这是我的荣幸,伙计。
Swyx [02:20:48]: 是的。
Diogo Almeida [02:20:49]: 太兴奋了。
Swyx [02:20:50]: 是的。
Diogo Almeida [02:20:50]: 太兴奋了。
Swyx [02:20:50]: 不是最后一次。
Diogo Almeida [02:20:50]: 你第一次来。它
Swyx [02:20:51]: 不是最后一次。
