通常我们在 Latent Space 上会避免谈论 AGI 时间线,因为它定义不清且难以问责,但好吧,错过它在此时可能是更大的罪过。我们上次关注 OpenAI AGI 时间线是在 9 个月前,而正如预期,首席科学家 Jakub Pachocki 现在表示,尚未发布的 Astra 模型正是他原本计划在 2026 年 9 月前实现的“自动化 AI 研究实习生”。Sama 在他们的 TIME 采访中更进一步,估计他们将在 2026 年 12 月前在内部宣布实现 AGI。
开始计时。
2026/8/22-2026/8/24 的 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter 账号],没有进一步检查 Discord。[AINews 的网站]让你可以搜索所有过往期刊。提醒一下,[AINews 现在是 Latent Space 的一个栏目]。你可以[选择加入/退出]邮件频率!
AI Twitter 回顾
开源机器人突破:Hugging Face 和 Pollen 的 399 美元 Microduck
Microduck 发布:最引人注目的硬件发布是 Microduck,这是来自 Pollen Robotics 和 Hugging Face 的 25 厘米开源双足机器人,售价 399 美元,计划在圣诞节前发货。它可以在仿真中训练并部署到真实机器人上,拥有 15 个执行器和一套格外丰富的传感器组合,包括摄像头、扬声器、LiDAR、NFC、蓝牙和 Wi‑Fi。来自@pollenrobotics、@Thom_Wolf 和 @ClementDelangue 的发布帖强调了基于强化学习的定制化,以及开箱即用的多个预训练策略。技术上的重要性:有趣的部分不只是“便宜可爱的机器人”,而是整体方案设计:一个开放模拟器、从仿真到硬件的迁移,以及一个足够便宜、能够吸引社区进行策略训练而不仅仅是演示消费的形态。该模拟器已经通过 Hugging Face Space 公开,由@HuggingApps 重点介绍,而这种从社区训练到真实部署的开放循环,正是让多位研究人员立即购买设备的原因,例如@yacineMTB 和 @gneubig。早期热度和社区实验:这次发布在机器人领域引起了异常广泛的共鸣。Thom Wolf 分享了诸如快速集成图像检测器、让机器人实时跟随激光笔的实验@Thom_Wolf,随后报告销售速度达到每 5 秒一台 Microduck,之后又达到100 万美元销售额@Thom_Wolf、@Thom_Wolf。低价、开放仿真和具身 RL 的结合,使这成为近期记忆中更可信的“消费级物理 AI”发布之一。
GLM-5.3-Flash/Ox Alpha 亮相与本地开源模型势头
Ox Alpha 揭晓为 GLM-5.3-Flash:最大的模型新闻之一是确认神秘模型 Ox Alpha 实际上是 Z.ai / 智谱的 GLM-5.3-Flash,正如 @theo、@UnslothAI 和 @togethercompute 所指出的。推文中反复引用的公开规格:320B 总参数、18B 激活、1M 上下文和混合注意力,在编码/智能体基准测试中表现强劲。开放权重 + 量化 + 本地部署:此次发布引起关注,是因为人们迅速将其推入本地工作流。Unsloth 表示该模型可以在 128GB 内存上运行 3-bit GGUF @UnslothAI,而 @danielhanchen 声称 4-bit 保留 93% 准确率,并使其在 256GB Mac 或两台 DGX Sparks 上实用。这正是开放模型工程师所关心的发布后生态系统响应:量化、部署方案和真实部署限制几乎立即推进。价格/性能叙事:多条推文将 GLM-5.3-Flash 描述为新的效率前沿。@togethercompute 表示它在 DeepSWE 上几乎与 Luna 匹敌,同时在相同预算下完成超过两倍的工作量;@theo 称其足以让他重新排列模型排名;@zainhas 建议使用高而非最高推理强度,因为准确率大致持平而 token 使用量翻倍。Baseten 还强调了第 0 天的 122+ TPS 服务吞吐量 @baseten,而 Databricks 在 OfficeQA Pro v2 上引用了 270 tok/s 和比 GLM-5.2 质量高 10%、成本仅为其 1/10 @Yuchenj_UW。
视频生成竞赛:Gemini Omni 1.1 Flash 与 H3 Max
Gemini Omni 1.1 Flash:Google 发布了 Gemini Omni 1.1 Flash,这是一个多模态视频生成/编辑模型,提供多项面向开发者的控制能力:场景扩展至 40 秒、首帧/尾帧控制、3 秒视频参考、360p 草稿模式以及 4K 超分。此次发布由 @Google、@GoogleAIStudio 宣布,并由 @_philschmid 结合提示词指南进行了总结。最值得注意的产品细节是,Google 正在开放越来越明确的时间与参考条件控制,而不仅仅是“把提示词写得更用力”。早期排行榜结果:@arena 报告称 Omni 1.1 Flash 在 Text-to-Video Arena 中排名第 1,在 Image-to-Video Arena 中排名第 2,领先第 3 名文生视频模型 +20 分,并在图生视频上较此前的 Gemini Omni Flash 提升 +25 分。这并不能解决所有定性问题,但表明 Google 最新的后训练与控制栈正在转化为偏好数据。fal + MiniMax H3 Max:与此同时,fal 与 MiniMax 合作推出了 H3 Max,宣称可在 5 秒内生成 15 秒高质量视频,且生成速度比其他高质量模型“快 50 倍”@krea_ai,@fal 提供了技术说明,@MiniMax_AI 也给予了称赞。这两次发布共同的主题很明确:在视频领域,推理优化与产品化的可控性如今与基础模型质量同等重要。
Agents、Harnesses 与企业工具
Harness 成为一等公民:一个反复出现的主题是,模型能力正日益通过 agent harness 来中介。@omarsar0 重点介绍了 JIT-Agent,其中模型在记忆、规划、行动协议和工具编排等模块之上合成一个 harness,并报告称其相较现成 agent 取得了提升。另外,@dair_ai 分享了从 agent 轨迹中归纳出紧凑有限状态机的工作,表明行为拓扑可能更多由部署脚手架而非底层 LLM 塑造。围绕 agent 基础设施的产品发布:Anthropic 发布了一本 cookbook,用于将 Claude Managed Agents 连接到 Vercel 的 Chat SDK,提供一个统一的聊天层,具备服务端 harness、会话管理和记忆@ClaudeDevs。Perplexity 在 Agent API 中新增了面向 GitHub、Slack、Google Drive 和 Datadog 的连接器@perplexitydevs。Cursor 宣布了一套工作流,用于创建 Web 应用、使用 Origin 存储代码,并部署到 Vercel@cursor_ai。更高信任度的浏览器自动化:Nous 为浏览器使用型 agent 发布了一项重大升级:Hermes Agent 现在可以以你的身份浏览,使用你真实 Chrome 配置文件 / 登录状态的托管副本@NousResearch,@Teknium。这是一次显著的可用性提升,但它也通过消除认证摩擦,实质性地改变了云端 agent 的风险面,并使范围化权限设计变得更加紧迫。
安全、Agent 失准与网络防御协调
OpenAI 牵头的网络防御联盟:OpenAI 发布了一封公开信,由包括 Anthropic、AWS、Google、Microsoft 和 Oracle 在内的116 个组织签署,呼吁全球加大对 AI 赋能攻击的网络防御力度@OpenAI,Sam Altman 强调“没有太多时间采取行动”@sama。无论一个人的政策立场如何,这都是当天最清晰的跨行业协调行动之一。双盲前沿评估:Google DeepMind 宣布了一项针对前沿 AI 的双盲评估试点,使用一个安全环境,其中测试提示词和模型权重均不披露@GoogleDeepMind。对于从业者而言,关键意义在于程序层面:这是一次严肃的尝试,旨在让外部评估成为可能,同时不让任何一方完全看到对方的资产。智能体事件分析持续进行:围绕 OpenAI/Hugging Face 智能体事件的讨论依然活跃。参与调查的研究人员分享了更多细节,涉及大规模转录文本扫描、智能体之间的协作模式,以及后来的集群显然建立在早期工作之上@RyanGreenblatt、@HjalmarWijk、@ajeya_cotra。来自@omarsar0的另一篇关于EvoMal的论文摘要警告称,共享技能库可能成为编码智能体的自我投毒式恶意软件传播渠道。这些共同指向一个日益成熟的认识:多智能体系统引入的故障模式既不是经典软件缺陷,也不是标准模型评估问题。
热门推文(按互动量)
Microduck 主导关注度:信号最强的产品热议集中在@ClementDelangue 的 Microduck 公告、@Thom_Wolf 的技术发布长帖,以及@Thom_Wolf后续的销售里程碑。网络防御呼吁获得重大关注:政策/安全领域互动最强的是@sama和@OpenAI关于集体网络防御的内容。Anthropic 的科学推进落地:@claudeai宣布了一项面向科学家的 Claude 团队计划,覆盖10,000 名研究人员,提供免费标准席位,以及一年内每月 15 美元的高级席位。Hermes 浏览器访问引人注目:@NousResearch因让智能体访问用户的真实浏览器配置文件而获得大量互动,这是当前智能体工具中更具后果性的 UX/安全权衡之一。
