AI 智能体正在改变你与 PC 交互的方式。创作者、开发者和 AI 爱好者已经在广泛使用这些智能体来协助完成编码、视频编辑和内容管理等日常任务。
NVIDIA 与 Microsoft 正在携手合作,让下一代开发者能够在 Windows 平台上构建端侧智能体,具备更简便的设置、原生安全性,并与开发者已在使用的应用和工具集成。
本文详细介绍了 NVIDIA 与 Microsoft 在 COMPUTEX 2026 期间的 NVIDIA GTC 台北和 Microsoft Build 2026 上发布的新工具,以满足对智能体激增的需求。这些工具包括在原生 Windows 上的开箱即用智能体沙箱、快 2 倍的智能体推理、来自 Nous Research 和 H Company 的新智能体应用与工具,以及 llama.cpp 和 ComfyUI 上增强的多 GPU 支持。本地 AI 开发栈现已准备就绪,可与用户一同运行复杂的智能体 AI 工作流。
如何使用 Microsoft eXecution Containers 和 NVIDIA OpenShell 保护本地智能体
在 Microsoft Build 上,Microsoft 宣布了一组安全原语,使智能体能够执行代码、操作文件,并通过内置的身份和策略执行跨系统编排任务。Microsoft eXecution Containers (MXC) 构成策略层,定义并实施隔离与遏制,同时依赖原生 Windows 操作系统构造来应用这些策略。
对开发者而言,这降低了一个关键门槛:智能体与个人文件和应用交互会带来真实的提示注入风险,而 MXC 确保它们无法访问整个系统。
NVIDIA 也在与 Microsoft 合作,将基于 MXC 构建的 NVIDIA OpenShell 运行时引入 Windows。通过 OpenShell 集成 MXC,为开发者提供了一个易于集成的包,以安全地部署自主、常驻的智能体,同时提供策略创建与管理、推理路由以及个人身份信息 (PII) 混淆等额外能力。
顶级智能体应用正寻求利用 MXC 和 OpenShell 来加强其在 Windows 中的安全性,包括流行的开源智能体 OpenClaw 和 Hermes Agent。
NVIDIA RTX Spark 如何为个人 AI 智能体提供动力?
本周早些时候在 GTC 台北,NVIDIA 发布了 NVIDIA RTX Spark 产品系列,包括为个人助理时代打造的小型台式机和笔记本电脑。这些台式机和笔记本电脑提供 1 petaflop 的 AI 算力、高达 128 GB 的内存,以及 CUDA 加速的 AI 框架,可在日常工作的同时运行大型模型。
Microsoft 正在打造 RTX Spark 特别开发者版——Surface RTX Spark Dev Box——预装了为开发者配置的修改版 Windows 以及入门所需的顶级开发者工具。欲了解更多信息,请参阅 为开发者打造下一代设备:Surface RTX Spark Dev Box。
NVIDIA NemoClaw、Hermes Agent 和 H Company 如何扩展智能体能力?
NVIDIA NemoClaw 用于构建自主 AI 智能体,现已通过 Linux 和 Windows Subsystem for Linux (WSL) 支持所有 NVIDIA 客户端系统——GeForce RTX、NVIDIA RTX PRO、NVIDIA DGX Spark 以及 NVIDIA DGX Station for Windows。这使您能够轻松设置智能体并将其沙盒化,同时使用为您的硬件精心挑选的优化本地模型。此次更新还包括对安装程序的增强,使其更简便、更无缝。NemoClaw 现在还支持将 Hermes Agent 作为可选项运行。
本周,Hermes Agent 还发布了原生 Windows 支持,包括命令行界面以及一款时尚的新桌面应用程序。这简化了用户体验,同时使智能体更容易与原生 Windows 应用、API 和文件进行交互和使用。
此外,AI 研究与产品公司 H Company 发布了其全新的 Holo 3.1 系列模型。这些模型针对 Computer Use 进行了调优,该模式使智能体能够通过查看屏幕并点击来执行操作,从而将智能体能力扩展到更广泛的应用中。它们包含量化检查点,与 FP8 相比内存占用降低 35%。该公司还宣布即将推出支持本地模型的新 Computer Use harness。NVIDIA 帮助 H Company 优化了其新模型和 harness,在 NVIDIA GPU 上实现了超过 2 倍的性能。
NVIDIA 和开源社区如何加速本地智能体 AI 的推理?
随着智能体每周 7 天、每天 24 小时运行日益复杂的任务,高效的本地计算变得更加重要。NVIDIA 与开源社区合作,增强了面向智能体的顶级推理后端 llama.cpp 和 vLLM。
llama.cpp 现在在 Qwen 3.5 和 3.6 27B 稠密模型上实现了 2 倍性能,在 Qwen 3.5 和 3.6 35B 混合专家 (MoE) 模型上实现了 1.6 倍性能。以下两项技术使之成为可能:
多 Token 预测 (MTP):一种先进的推测解码技术,由较小的草稿模型提前提出若干 Token,目标模型在单次前向传播中进行验证,在相同输出质量下提供更快的吞吐量。MTP 对开发者来说最为实用,因为对于已支持它的模型无需额外训练。程序化依赖启动 (PDL):此更新提供了更快的解码性能。依赖内核可以在同一 CUDA 流上并发执行。在此之前,单个 CUDA 流中的依赖内核必须顺序执行。
vLLM 已经采用了 MTP,但正在接受额外优化,将推理性能提升 2.6 倍。这些优化包括为 MoE 模型提供更好的 BF16 内核选择,以及通过改进 CUDA Graphs 减少运行时开销。
您现在可以通过 LM Studio、llama.cpp 和 vLLM 开始探索这些更新。

图 1. 在 NVIDIA DGX Spark 和 NVIDIA RTX 5090 上,本地代理式 AI 部署的整体吞吐量性能得到提升
多 GPU 支持如何为 RTX PC 扩展 AI 性能?
在本地运行 AI 的一种流行方式是使用多个 GPU 来获得更多内存和算力。虽然像 vLLM 这样的云框架由于在数据中心中的使用而针对多 GPU 进行了良好优化,但像 llama.cpp 和 PyTorch 中的 ComfyUI 实现这样的 PC 框架并未针对其进行优化。
为了解决这一挑战,NVIDIA 与 llama.cpp 和 ComfyUI 合作,提升了配备两个同等 GPU 的 RTX PC 的性能。这使你能够运行更大的模型,并利用两个 GPU 的算力获得更好的性能。
llama.cpp 现在支持张量并行(TP),可充分利用两个 GPU,实现高达约 2 倍的内存容量和高达约 1.8 倍的算力性能。LM Studio 已通过其应用程序使这些更改可供更广泛地使用。要开始使用 LM Studio,请打开 LM Studio 应用,选择 Settings,然后选择 Runtime 以启用 TP。

图 2. 张量并行多 GPU 技术相比 llama.cpp 上的流水线并行和单 GPU 推理,将 token 生成性能提升高达 1.8 倍
ComfyUI 集成了无分类器引导(CFG)方法,可在两个 GPU 上实现高达 2 倍的算力。用户还可以跨 GPU 拆分模型链,将其完全加载到内存中,从而能够运行高 VRAM 模式。这消除了低 VRAM 模式的内存交换开销,带来额外的性能提升。

图 3. ComfyUI 上多 GPU 技术在不同 RTX 5090 配置下的生成时间性能提升
要开始使用多 GPU 推理,请查看 llama.cpp GitHub 仓库和如何构建多 GPU AI PC。
媒体和视频开发者有哪些新内容?
NVIDIA AI for Media SDK (AI4M) 现已面向构建 AI 驱动的视频和广播管道的开发者提供私有访问。它包括以下功能:
LipSync 正式发布: 随着语言优化模型现已支持法语、德语和西班牙语,LipSync 能够实现更高质量的配音和内容本地化,并且相比基础模型具有更好的发音清晰度。主动说话人检测(ASD)正式发布: 增强的多摄像头和多麦克风支持,加上跨视频说话人 ID 关联,解锁了此前需要人工操作的自动化工作流——唇形同步配音、视频编辑和高级日志记录。
更多用于在 Windows 上进行 GPU 加速 AI 开发与部署的工具
由 NVIDIA GPU 上的 NVIDIA TensorRT for RTX 提供支持,包含 Windows ML 的更广泛 Windows AI 平台持续成熟。开发者现在有多种途径在 Windows 应用程序中交付 GPU 加速的 AI。
Windows AI Foundry 和 Windows AI API 现已支持 GPU 加速。当你在 RTX 硬件上调用受支持的 API 时,工作负载会被路由到 NVIDIA GPU 上,以实现更高性能的本地推理。首个受支持的模型是 Phi-Silica,这是一个 3.3B 的小型语言模型(SLM),用于摘要、改写、代码生成以及其他设备端 AI 任务。
Windows ML 和 TensorRT for RTX 的采用持续增长。最近有四家合作伙伴从 DirectML 升级:
- Voicemod 实现实时 AI 语音转换速度提升 42%
- Topaz 将 1080p 到 4K 的超分速度提升 20%,同时将引擎存储占用减少 3-4 倍
- DxO PhotoLab 9.7 提供更快的 AI 照片处理
- Camo Streamlight AI 自动调优功能可实时智能调整光照水平
对于有兴趣在 Windows 中运行 Linux 应用程序的用户,新的 Windows Subsystem for Linux Containers(WSL-C)是一种内置方式,可从原生 Windows 应用程序创建、运行 Linux AI 容器并与之交互。应用程序用户无需自行安装和管理 WSL 系统资源,开发者可以使用 C/C++ 库将此功能构建到他们的应用中。WSL-C 将复杂的专业级开发环境直接带到 Windows PC 上,使你能够更快工作、在本地迭代,并与生产工作流保持一致。
开始在 Windows PC 上构建个人 AI 代理
AI 代理正在重塑软件的构建、使用和部署方式——而 NVIDIA RTX 上的本地 AI 堆栈已准备就绪。借助安全的代理沙盒、更快的推理、多 GPU 扩展以及日益成熟的 Windows AI 平台,面向全球超过 1 亿台 NVIDIA RTX PC 进行开发的开发者拥有交付下一代 AI 应用所需的基础设施。
了解更多并开始为 NVIDIA RTX AI PC 开发。
