迄今为止,第37届Hot Chips大会上最重磅的消息是OpenAI在其自研芯片上取得的惊人进展——距离博通公告还不到一年……而且它不是ASIC,而是一款全面超越Blackwell的替代方案。
如今的关键指标正转向每瓦性能,而Jalapeno做到了:
完整的Hot Chips演讲尚未发布,但各方观点如下。如需更全面的解析,请与OpenAI的其他内容一同观看:
2026年8月24日至8月25日AI新闻。我们检查了12个subreddit、[544个Twitter账号],没有发现更多Discord。[AINews网站]可让你搜索所有过往期号。提醒一下,[AINews现已成为Latent Space的一个栏目]。你可以[选择订阅/退订]邮件频率!
AI Twitter回顾
OpenAI的Jalapeño推理芯片与推理技术栈的转变
Jalapeño 公布的各项数据是当天最大的技术新闻:OpenAI 发布了其自研推理芯片 Jalapeño 的首批基准测试细节,声称在真实模型工作负载上,其能效和延迟均显著优于 NVIDIA GB200/GB300 系统。在 OpenAI 的测试中,Jalapeño 在峰值吞吐量下实现了每瓦 1.5–1.9 倍的工作量,端到端延迟降低 1.7–3.6 倍,对于高度交互型工作负载,性能提升 2.1–4.1 倍;该芯片额定功耗为 700W,但据报道在测试运行中保持在 550W 或以下。OpenAI 表示,将在年底前开始部署到其自有基础设施中,第二代已深入研发,第三代也已启动(OpenAI 公告、部署路线图、Sam Altman)。工程师为何关注:这一声明不只是原始性能,而是一种更均衡的推理架构,减少了通常的吞吐量/延迟权衡。多位技术人士的反应强调,一些对比点尤其值得注意,因为据报道,Jalapeño 在某些配置下即使没有采用激进的预填充/解码分离或推测解码等技巧也表现出色,同时击败了使用了这些技巧的系统(gdb、kimmonismus 总结、eliebakouch 分析、You Jiacheng)。SemiAnalysis 将其描述为第一代 ASIC 中异常强劲的表现,并直接将其与 Blackwell 和 Rubin 级系统进行了对比(SemiAnalysis、dylan522p)。第二个层面的故事是模型辅助的系统优化:OpenAI 的帖子还表示,GPT-Astra + Codex 帮助编写和优化了底层内核,在大约两个月内将三个此前未计划的开放权重模型在 Jalapeño 上带到高性能水平;对于选定的注意力块和 MoE 块,这些实现据报道比现有的人类专家编写的代码快 1.5–1.8 倍(kimmonismus、eliebakouch)。这是一个有意义的信号,表明编译器/内核工作正日益被纳入模型改进循环,而不仅仅是应用层编码。更广泛的基础设施影响:多篇帖子将 Jalapeño 与更大的行业转型联系起来,即前沿实验室在推理经济性上可能不再严格处于 NVIDIA 的下游,尽管封装和代工产能仍是硬瓶颈(Liam Fedus、teortaxesTex 反应、LearnOpenCV 关于台积电/CoWoS 产能的提醒)。
Agent Harnesses、记忆系统与评估工程正成为一等公民
测试框架的质量正变得与模型选择同等重要:多篇论文和产品发布都指向了同一个主题:智能体的表现很大程度上取决于其周边系统。微软主导的一篇关于 AutoSaddler 的新论文将测试框架视为代码,利用失败轨迹在离线状态下修补提示词、工具配置和控制逻辑,报告称相较于基础测试框架取得了 GAIA2 上 +9.0、SWE-Bench Pro 上 +9.6、Terminal-Bench 2.0 上 +10.0 的提升(论文摘要)。与此同时,另一篇论文直接量化了测试框架的方差,发现更换测试框架对分数的影响可能远大于更换模型,模型配对排名在不同脚手架之间会发生翻转;其提出的解决方案是一套结构化的 Harness Card 披露标准(分析、“There Is No Neutral Harness”)。长周期软件工程仍然远未解决:SWE Refactor Bench 衡量的是整仓库迁移任务,例如 C→Rust、Maven→Gradle 和 POSIX→WebAssembly,覆盖包括 SQLite、zlib 和 libsodium 在内的真实项目。在 520 次运行中,只有 28 次通过了全部三个阶段,存活率为 5.4%,且有 13/20 个任务无人解决(EinsiaAI)。这对于更局部的编码基准上那些亮眼的 bug 修复数字来说,是一个有用的纠偏。记忆系统正被重新设计为可编程状态,而非压缩的聊天历史:DAIR 总结的一篇阿里巴巴论文用仅追加事件日志加上持久化 Python 内核来支撑智能体会话,将工具输出和派生状态绑定到带类型的变量上,而不是不断将它们序列化进提示词。报告的结果包括 LongMemEval_S 上 94.8%、BEAM_10M 上 73.1%(比此前已发表的最佳记忆系统高 5.1),以及使用 Qwen3.8-Max 在 LOCA_256K 上 86.7%(摘要)。关于知识分诊的相关工作表明,朴素的上下文压缩会破坏精确规则的保留;经过五轮压缩后,一种设置仅保留了 10% 的安全规则,而类型感知的保留策略则多保留了 2–4 倍(摘要)。实用的评估工程正从临时做法转向产品化工作流:LangChain 及其合作伙伴分享了一个具体循环,用于将轨迹和人类反馈转化为任务规格、合成环境和评估,从而可以随时间推移衡量和后训练智能体(Vtrivedy10、hwchase17)。LangSmith Engine 也在关键内部基准上实现了 >2 倍的性能提升,具备更好的问题检测/聚类、SaaS 和自托管支持、Slack/Linear 集成,以及按成本分层的分析模式(LangChain)。
本地优先智能体、端侧推理与新型个人计算栈
Perplexity 的可携带计算机是当天最清晰的本地智能体产品发布:Perplexity 在 NVIDIA DGX Spark 上推出了 Portable Computer,将其定位为 Perplexity Computer 的完全本地版本,其中编排器 LLM、子智能体 LLM 和智能体框架全部在本地硬件上运行,不依赖云端(Perplexity 发布,模型详情,NVIDIA,Arav Srinivas)。初始本地技术栈使用经过后训练的 PPLX 27B,同时也可选用 Qwen 3.8 27B;Nemotron 3.5 Lightning 支持即将推出。更深层的趋势是持久、常驻的本地智能体:Srinivas 明确描绘了一个未来图景——后台进程持续从连接器摄取上下文,在永续循环中执行多跳推理,并在你自己的硬件上运行(Arav Srinivas)。社区反应分为两派:一派为隐私/控制权而兴奋,另一派则质疑“本地优先”是否应该意味着 5000 美元的 DGX Spark,而非普通消费级设备(theo 批评,theo 后续)。Apple/macOS 本地 AI 工具链也在成熟:exo 表示 Apple 在全新的 M5 Ultra Mac Studio 和 M6/M5 Pro Mac Mini 页面上对其进行了展示,强调通过 Thunderbolt 5 上的低延迟 RDMA 来集群 Mac,并以接近 API 的速度运行 Kimi K3 和 GLM-5.3 等模型,其中 4× M5 Ultra 可扩展到约 4.8 TB/s 的聚合内存带宽(exo)。相关帖子指出,Apple 更快的 PCIe 存储和基于 ANE 的视觉流水线,使小型本地集群以及 CPU/ANE/GPU 混合推理更加实用(anemll,onirenaud)。围绕本地运行时的工具链持续完善:Ollama v0.33 新增了一键集成,让 Claude Desktop 可将 Ollama 用作云端和本地模型的第三方网关(Ollama);OpenCode v2 被展示为运行在 Cloudflare Durable Object 内部,说明小型智能体运行时正变得可嵌入边缘环境(fayazara)。
模型、检索与搜索基础设施
Qwen 3.8 正在整个技术栈中崭露头角:围绕 Qwen3.8 发布的热情在部署和评测帖子中都清晰可见,Together 为 Qwen3.8-27B 新增了微调与专用推理支持(Together),而 Unsloth 则声称在免费的 2× Tesla T4 Kaggle 实例上,利用优化内核实现了对 27B 模型的完整 QLoRA 微调(danielhanchen)。在应用层面,Qwen3.8-27B 在 Image-to-WebDev Arena 中位列开源模型第 1 名、总榜第 7 名,而其定价为每百万输入/输出 token 0.40 美元 / 3 美元(arena)。搜索与检索基础设施获得了多项实质性更新:Hugging Face 发布了 Papers with Code 搜索引擎的详细架构说明:PostgreSQL + pgvector、Qwen 3 Embedding 0.6B、混合检索、通过 Hugging Face Jobs 在 NVIDIA L4 上生成嵌入、将产物存储在 bucket 中,并通过 Inference Endpoints 进行实时服务;同一套技术栈也为论文页面上的“相关论文”提供支持(Niels Rogge)。Keenable 结束隐身模式,推出了面向 AI 的 Web Search API 和 Web Query Language,由前 Yandex Search 负责人打造,并获得 2600 万美元种子轮融资,明确瞄准智能体规模的网页检索(styskin)。检索模型设计仍是活跃领域:围绕后期交互 / 多向量检索再次展开讨论,有人声称扩展行为终于在检索工作负载中变得可见,并且模型与数据库的协同设计与存储格式至少同等重要(mixedbread 观点、Silvio Martinico)。
机器人技术、物理世界模型与具身数据
Figure 的“Index”是一项重大的机器人数据发布:Figure 推出了 Index,被描述为全球规模最大、最多样化的机器人数据集,据报告其数据摄入速度达到每秒上传 30 分钟视频、1600 万次视频上传、已为数据支付1500 万美元,以及26.4 万次下载。该公司还表示,将在未来 12 个月内投入 10 亿美元用于数据和算力(Brett Adcock,后续)。这一规模之所以重要,是因为许多机器人实验室的瓶颈似乎仍然更多在于演示和感知数据,而非架构上的新颖性。大规模物理/世界建模持续突破上下文限制:Anima Anandkumar 重点介绍了 Accelerated Understanding,这是一家构建跨模态和四维时空物理仿真大型 AI 模型的初创公司,声称在预训练阶段达到1 万亿参数、训练期间1 万亿上下文,并在推理时达到超过 5 万亿上下文,且无需下采样或分块(Anima Anandkumar)。细节较为稀少,但该帖值得注意之处在于,它陈述了某些前沿非语言建模工作的方向:大规模上下文的多模态仿真,而不仅仅是文本/视频生成。具身策略泛化仍是活跃的基准目标:另一篇机器人相关帖子介绍了 S1,这是一个操作模型,能够在其训练分布之外仅凭单次演示完成任务(anag004)。Google Research 还分享了 AgentHands,这是一个 XR 系统,通过同步手势增强对话式智能体,在物理任务期间提供空间引导(Google Research)。
热门推文(按互动量)
OpenAI 芯片发布:@sama 谈 Jalapeño、@OpenAI 基准发布引发了迄今为止规模最大的技术讨论。本地智能体发布:@perplexity_ai 推出 Portable Computer是芯片事件之外最大的产品发布。开发者平台 / 智能体原生网络:@OpenAIDevs 宣布 WebMCP 挑战赛以及ChatGPT 桌面端支持 WebMCP,表明 OpenAI 正推动网站走向显式的智能体接口。开源本地任务智能体:@AndrewYNg 谈 OpenWorker因结合开源框架、本地模型和以安全为重点的工作流而引人注目。编码智能体的基准真实性:@EinsiaAI 谈 SWE Refactor Bench是本组中较为有用的基准发布之一,因为它针对的是整仓库迁移,而非局部编辑。
