企业工作涵盖消息、决策、项目以及随时间变化的义务。一个在缺乏这些背景信息的情况下启动的 AI 智能体 必须先重建这些背景信息,才能做出贡献。
为了向智能体提供这些必要的背景信息,我们的团队使用 NVIDIA NemoClaw 构建了一个记忆驱动的幕僚长。它维护一个名为自我模型的人类可读知识层:即关于相关人员、项目、优先级和工作模式的智能体记忆。定时任务会定期审查新活动、跟踪义务,并随时间推移纳入用户的决策。我们的经验表明,有用的智能体记忆需要结构、选择性检索和治理——而不仅仅是存储。
本文展示了使用 NVIDIA NemoClaw 构建的记忆驱动智能体如何提升真实企业工作流程中的生产力。它还分享了五条可应用于你自己智能体的设计经验:
- 在日常工作中保持上下文,以提升任务质量
- 将证据、知识和行动分离,帮助智能体做出更好的判断
- 设计记忆驱动的智能体,使其能够将用户意图置于短期紧迫性之上
- 允许用户纠正智能体的决策,以建立信任
- 使用 NVIDIA OpenShell 强制执行安全与授权边界
在日常工作中保持上下文
对话历史提供了短期连续性,但它将当前优先级与过去的决策和临时请求混在一起。检索可以找到相关的源材料,但智能体仍必须跨时间连接信息。
考虑一个项目状态问题。答案可能取决于早先的一项决策、后来消息中的一次更正、一项未解决的义务,以及两个不同名称指向同一项目这一事实。
为了解决这些问题,你可以使用自我模型,它在结构化的 Markdown 页面中维护这些关系。它组织关于人员、项目、优先级、目标、概念和重复性工作模式的信息。其模式定义了索引、交叉引用、来源和增长限制。
自我模型存储的是派生解释,而不是取代源证据。将两者分开有助于你(开发者)判断错误答案究竟来自证据、记忆维护、检索,还是模型的最终决策。
分离证据、知识和行动
你可以使用记忆驱动幕僚长的三层调优能力:
证据 → 知识 → 受治理的执行
证据支持对自我模型的更新。对于每项任务,智能体检索一组有界的相关上下文。然后智能体在 NVIDIA NemoClaw 示例中使用该上下文。该架构如图 1 所示。

图 1. NVIDIA NemoClaw 使用持久化上下文来执行受治理的智能体操作
该示例存储两类信息:
知识:人员、项目、优先级和工作模式判断:某项内容是否需要关注、其排序位置,以及用户是否忽略了它
Markdown 智能体记忆存储知识。SQLite 账本存储义务、排名、更正和审计事件。这种设计保留了智能体的判断,而无需将其作为已读标记、标签或文件夹写入源消息中。
一个记忆页面可能会说某位协作者偏好 Slack。智能体可以利用该上下文来推荐 Slack,但发送消息仍然取决于凭据、工具权限、运行时策略和用户批准。
上下文可以为操作提供信息,但不能授权操作。
优先考虑用户意图,而非短期紧迫性
传入的请求常常自称紧急,但紧迫性不一定反映用户的优先级。因此,意图门控将最高层级保留给与用户所述优先级相关的义务。
在所提供的公开配方中,一项紧急的费用政策证明仍然可见,但排名低于一项与所述优先级相关的更安静的请求。你的 NVIDIA NemoClaw 可以解释这种关系,而确定性代码则强制执行层级大小、溢出行为和排名顺序。
允许用户纠正智能体
持久化记忆可以同样容易地保留错误判断和正确判断。使用该配方,你可以将某项义务移动到另一个层级或忽略它,之后的智能体运行会保留该决定。每次更改都会在仅追加的审计跟踪中记录一次。
重复的纠正模式可以更新一个小型、可读的偏好策略。用户可以检查、编辑或删除该策略,而不是让偏好隐藏在模型状态中。
反馈循环保持可见:
智能体判断 → 用户纠正 → 审计事件 → 偏好更新
添加记忆以提升智能体任务表现
将记忆驱动的 Chief of Staff 添加到 NemoClaw 后,在多个智能体任务上产生了可衡量的改进,如表 1 所示。Agent Memory Benchmark 和评估示例包含在示例仓库中。示例仓库将执行多轮检索的智能体式检索增强生成(RAG)基线与该自我模型进行了比较。
| 指标 | 问题数量 | 智能体式 RAG 基线 | 自我模型 | 差异 |
|---|---|---|---|---|
| 总体准确率 | 186 | 82.8% | 90.9% | +8.1 个百分点 |
| 困难问题 | 31 | 67.7% | 87.1% | +19.4 个百分点 |
| 跟踪随时间变化的事实 | 5 | 60.0% | 100.0% | +40.0 个百分点 |
| 时间点推理 | 6 | 33.3% | 66.7% | +33.3 个百分点 |
| 实体消歧 | 15 | 66.7% | 86.7% | +20.0 个百分点 |
| 多源综合 | 73 | 87.7% | 94.5% | +6.8 个百分点 |
| 基于语料库的忠实回答 | 13 | 100.0% | 92.3% | -7.7 个百分点 |
| 单跳查找 | 30 | 86.7% | 83.3% | -3.3 个百分点 |
| 引用覆盖率 | 186 | 92.5% | 97.8% | +5.4 个百分点 |
表 1. 示例仓库中智能体式 RAG 基线和自我模型的评估指标。两种配置均使用 NVIDIA Nemotron 3 Ultra
在运行时强制执行边界
这种隔离通过 NVIDIA NemoClaw 和面向自主代理的 NVIDIA OpenShell 安全运行时来实现。NemoClaw 将该示例与 NVIDIA OpenShell 集成并管理其生命周期,而 NVIDIA OpenShell 在沙箱中运行代理,并为文件系统、进程和网络访问提供治理与策略执行。对于托管推理和 MCP 连接,凭据保留在沙箱之外。
这一点很重要,因为记忆和检索到的内容是模型的输入,而不是受信任的安全策略。如果代理误解了该上下文——或遵循了恶意指令——它仍然在操作员定义的运行时边界内运行。这些边界限制了代理的访问权限以及故障可能造成的影响。
开始构建代理记忆
要将本文介绍的记忆设计适配到你自己的 NemoClaw 示例中,请查看 NVIDIA/nemoclaw-community GitHub 仓库中的开源 记忆驱动的幕僚长配方 及其设计提案。
该配方将该示例打包为 NemoClaw 的可部署 Hermes 配置文件:
- 结构化记忆模式
- 持久义务账本
- 有界排序逻辑
- 用户纠正与审计路径
- 计划性记忆维护
- 合成消息与记忆页面
- 离线演练
- 一套单元测试
示例中的人物、组织、项目和消息均为虚构。在离线演练中,记录下来的模型决策代替了推理过程。随后代码会应用排序、纠正、持久化和验证行为。
当前配方侧重于记忆基础。它不会发送消息或修改源系统。这一范围让你无需连接工作场所账户即可审视该设计。实时连接器需要单独处理凭据、隐私、保留和删除。
进一步了解 NVIDIA NemoClaw 和 NVIDIA OpenShell。
