返回 文章 build CMS 文章

NVIDIA 与微软发布新工具:在 Windows PC 上构建个人 AI 智能体

NVIDIA 与微软联手为 Windows PC 带来端侧 AI 智能体开发栈,从安全沙箱到推理加速全面就绪。

NVIDIAMicrosoftAI智能体Windows
成长分 / 100 72 综合收获、行动、留存与影响

NVIDIA 与微软发布新工具:在 Windows PC 上构建个人 AI 智能体
为什么值得读了解 NVIDIA 与微软在 COMPUTEX 2026 和 Microsoft Build 2026 上发布的最新端侧 AI 智能体工具。

掌握在 Windows 上安全部署自主智能体的关键方案,包括 MXC 和 OpenShell 沙箱机制。

关键洞察
  1. Microsoft eXecution Containers (MXC) 提供策略层,定义并实施隔离与遏制,降低智能体与个人文件交互时的提示注入风险。
  2. NVIDIA OpenShell 运行时基于 MXC 构建并引入 Windows,提供策略管理、推理路由和 PII 混淆等能力。
  3. NVIDIA RTX Spark 产品系列提供 1 petaflop AI 算力、高达 128 GB 内存,Surface RTX Spark Dev Box 预装开发者配置的 Windows。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:12466

AI 智能体正在改变你与 PC 交互的方式。创作者、开发者和 AI 爱好者已经在广泛使用这些智能体来协助完成编码、视频编辑和内容管理等日常任务。

NVIDIA 与 Microsoft 正在携手合作,让下一代开发者能够在 Windows 平台上构建端侧智能体,具备更简便的设置、原生安全性,并与开发者已在使用的应用和工具集成。

本文详细介绍了 NVIDIA 与 Microsoft 在 COMPUTEX 2026 期间的 NVIDIA GTC 台北Microsoft Build 2026 上发布的新工具,以满足对智能体激增的需求。这些工具包括在原生 Windows 上的开箱即用智能体沙箱、快 2 倍的智能体推理、来自 Nous Research 和 H Company 的新智能体应用与工具,以及 llama.cpp 和 ComfyUI 上增强的多 GPU 支持。本地 AI 开发栈现已准备就绪,可与用户一同运行复杂的智能体 AI 工作流。

如何使用 Microsoft eXecution Containers 和 NVIDIA OpenShell 保护本地智能体

在 Microsoft Build 上,Microsoft 宣布了一组安全原语,使智能体能够执行代码、操作文件,并通过内置的身份和策略执行跨系统编排任务。Microsoft eXecution Containers (MXC) 构成策略层,定义并实施隔离与遏制,同时依赖原生 Windows 操作系统构造来应用这些策略。

对开发者而言,这降低了一个关键门槛:智能体与个人文件和应用交互会带来真实的提示注入风险,而 MXC 确保它们无法访问整个系统。

NVIDIA 也在与 Microsoft 合作,将基于 MXC 构建的 NVIDIA OpenShell 运行时引入 Windows。通过 OpenShell 集成 MXC,为开发者提供了一个易于集成的包,以安全地部署自主、常驻的智能体,同时提供策略创建与管理、推理路由以及个人身份信息 (PII) 混淆等额外能力。

顶级智能体应用正寻求利用 MXC 和 OpenShell 来加强其在 Windows 中的安全性,包括流行的开源智能体 OpenClawHermes Agent

NVIDIA RTX Spark 如何为个人 AI 智能体提供动力?

本周早些时候在 GTC 台北,NVIDIA 发布了 NVIDIA RTX Spark 产品系列,包括为个人助理时代打造的小型台式机和笔记本电脑。这些台式机和笔记本电脑提供 1 petaflop 的 AI 算力、高达 128 GB 的内存,以及 CUDA 加速的 AI 框架,可在日常工作的同时运行大型模型。

Microsoft 正在打造 RTX Spark 特别开发者版——Surface RTX Spark Dev Box——预装了为开发者配置的修改版 Windows 以及入门所需的顶级开发者工具。欲了解更多信息,请参阅 为开发者打造下一代设备:Surface RTX Spark Dev Box

NVIDIA NemoClaw、Hermes Agent 和 H Company 如何扩展智能体能力?

NVIDIA NemoClaw 用于构建自主 AI 智能体,现已通过 Linux 和 Windows Subsystem for Linux (WSL) 支持所有 NVIDIA 客户端系统——GeForce RTXNVIDIA RTX PRONVIDIA DGX Spark 以及 NVIDIA DGX Station for Windows。这使您能够轻松设置智能体并将其沙盒化,同时使用为您的硬件精心挑选的优化本地模型。此次更新还包括对安装程序的增强,使其更简便、更无缝。NemoClaw 现在还支持将 Hermes Agent 作为可选项运行。

本周,Hermes Agent 还发布了原生 Windows 支持,包括命令行界面以及一款时尚的新桌面应用程序。这简化了用户体验,同时使智能体更容易与原生 Windows 应用、API 和文件进行交互和使用。

此外,AI 研究与产品公司 H Company 发布了其全新的 Holo 3.1 系列模型。这些模型针对 Computer Use 进行了调优,该模式使智能体能够通过查看屏幕并点击来执行操作,从而将智能体能力扩展到更广泛的应用中。它们包含量化检查点,与 FP8 相比内存占用降低 35%。该公司还宣布即将推出支持本地模型的新 Computer Use harness。NVIDIA 帮助 H Company 优化了其新模型和 harness,在 NVIDIA GPU 上实现了超过 2 倍的性能。

NVIDIA 和开源社区如何加速本地智能体 AI 的推理?

随着智能体每周 7 天、每天 24 小时运行日益复杂的任务,高效的本地计算变得更加重要。NVIDIA 与开源社区合作,增强了面向智能体的顶级推理后端 llama.cpp 和 vLLM。

llama.cpp 现在在 Qwen 3.5 和 3.6 27B 稠密模型上实现了 2 倍性能,在 Qwen 3.5 和 3.6 35B 混合专家 (MoE) 模型上实现了 1.6 倍性能。以下两项技术使之成为可能:

多 Token 预测 (MTP):一种先进的推测解码技术,由较小的草稿模型提前提出若干 Token,目标模型在单次前向传播中进行验证,在相同输出质量下提供更快的吞吐量。MTP 对开发者来说最为实用,因为对于已支持它的模型无需额外训练。程序化依赖启动 (PDL):此更新提供了更快的解码性能。依赖内核可以在同一 CUDA 流上并发执行。在此之前,单个 CUDA 流中的依赖内核必须顺序执行。

vLLM 已经采用了 MTP,但正在接受额外优化,将推理性能提升 2.6 倍。这些优化包括为 MoE 模型提供更好的 BF16 内核选择,以及通过改进 CUDA Graphs 减少运行时开销。

您现在可以通过 LM Studio、llama.cpp 和 vLLM 开始探索这些更新。

柱状图展示吞吐量性能提升。比较了三种配置:在 DGX Spark 上使用 vLLM 运行 Qwen3.6-35B 提升了 2.6 倍,在 RTX 5090 上使用 llama.cpp/LM Studio 运行 Qwen3.6-27B 提升了 2 倍,在 RTX 5090 上使用 llama.cpp/LM Studio 运行 Qwen3.6 35B 提升了 1.6 倍。

图 1. 在 NVIDIA DGX Spark 和 NVIDIA RTX 5090 上,本地代理式 AI 部署的整体吞吐量性能得到提升

多 GPU 支持如何为 RTX PC 扩展 AI 性能?

在本地运行 AI 的一种流行方式是使用多个 GPU 来获得更多内存和算力。虽然像 vLLM 这样的云框架由于在数据中心中的使用而针对多 GPU 进行了良好优化,但像 llama.cpp 和 PyTorch 中的 ComfyUI 实现这样的 PC 框架并未针对其进行优化。

为了解决这一挑战,NVIDIA 与 llama.cpp 和 ComfyUI 合作,提升了配备两个同等 GPU 的 RTX PC 的性能。这使你能够运行更大的模型,并利用两个 GPU 的算力获得更好的性能。

llama.cpp 现在支持张量并行(TP),可充分利用两个 GPU,实现高达约 2 倍的内存容量和高达约 1.8 倍的算力性能。LM Studio 已通过其应用程序使这些更改可供更广泛地使用。要开始使用 LM Studio,请打开 LM Studio 应用,选择 Settings,然后选择 Runtime 以启用 TP。

柱状图展示两个 RTX 5070 GPU 在 llama.cpp 上运行张量并行,相比单个 RTX 5070 可提供高达 6.5 倍的生成吞吐量,在所有四个测试模型——Qwen3.6-27B、Gemma-4-31B、Qwen3.6-35B-A3B 和 GPT-OSS-20B——上均优于流水线并行。

图 2. 张量并行多 GPU 技术相比 llama.cpp 上的流水线并行和单 GPU 推理,将 token 生成性能提升高达 1.8 倍

ComfyUI 集成了无分类器引导(CFG)方法,可在两个 GPU 上实现高达 2 倍的算力。用户还可以跨 GPU 拆分模型链,将其完全加载到内存中,从而能够运行高 VRAM 模式。这消除了低 VRAM 模式的内存交换开销,带来额外的性能提升。

标题为 ComfyUI 上多 GPU 创意 AI 性能的柱状图,比较了使用一个 RTX 5090 与使用带 CFG 和设备选择的多 GPU RTX 5090 时各模型的生成性能。

图 3. ComfyUI 上多 GPU 技术在不同 RTX 5090 配置下的生成时间性能提升

要开始使用多 GPU 推理,请查看 llama.cpp GitHub 仓库和如何构建多 GPU AI PC

媒体和视频开发者有哪些新内容?

NVIDIA AI for Media SDK (AI4M) 现已面向构建 AI 驱动的视频和广播管道的开发者提供私有访问。它包括以下功能:

LipSync 正式发布: 随着语言优化模型现已支持法语、德语和西班牙语,LipSync 能够实现更高质量的配音和内容本地化,并且相比基础模型具有更好的发音清晰度。主动说话人检测(ASD)正式发布: 增强的多摄像头和多麦克风支持,加上跨视频说话人 ID 关联,解锁了此前需要人工操作的自动化工作流——唇形同步配音、视频编辑和高级日志记录。

更多用于在 Windows 上进行 GPU 加速 AI 开发与部署的工具

由 NVIDIA GPU 上的 NVIDIA TensorRT for RTX 提供支持,包含 Windows ML 的更广泛 Windows AI 平台持续成熟。开发者现在有多种途径在 Windows 应用程序中交付 GPU 加速的 AI。

Windows AI Foundry 和 Windows AI API 现已支持 GPU 加速。当你在 RTX 硬件上调用受支持的 API 时,工作负载会被路由到 NVIDIA GPU 上,以实现更高性能的本地推理。首个受支持的模型是 Phi-Silica,这是一个 3.3B 的小型语言模型(SLM),用于摘要、改写、代码生成以及其他设备端 AI 任务。

Windows ML 和 TensorRT for RTX 的采用持续增长。最近有四家合作伙伴从 DirectML 升级:

  • Voicemod 实现实时 AI 语音转换速度提升 42%
  • Topaz 将 1080p 到 4K 的超分速度提升 20%,同时将引擎存储占用减少 3-4 倍
  • DxO PhotoLab 9.7 提供更快的 AI 照片处理
  • Camo Streamlight AI 自动调优功能可实时智能调整光照水平

对于有兴趣在 Windows 中运行 Linux 应用程序的用户,新的 Windows Subsystem for Linux Containers(WSL-C)是一种内置方式,可从原生 Windows 应用程序创建、运行 Linux AI 容器并与之交互。应用程序用户无需自行安装和管理 WSL 系统资源,开发者可以使用 C/C++ 库将此功能构建到他们的应用中。WSL-C 将复杂的专业级开发环境直接带到 Windows PC 上,使你能够更快工作、在本地迭代,并与生产工作流保持一致。

开始在 Windows PC 上构建个人 AI 代理

AI 代理正在重塑软件的构建、使用和部署方式——而 NVIDIA RTX 上的本地 AI 堆栈已准备就绪。借助安全的代理沙盒、更快的推理、多 GPU 扩展以及日益成熟的 Windows AI 平台,面向全球超过 1 亿台 NVIDIA RTX PC 进行开发的开发者拥有交付下一代 AI 应用所需的基础设施。

了解更多并开始为 NVIDIA RTX AI PC 开发