工业机械产生的警报数量超出了技术人员能够分诊处理的能力。对于每一个需要跟进的重要警报,技术人员需要调取历史背景信息、确定正确的处理流程、检查专家信号是否确认了故障模式,并撰写建议报告。这一流程保持一致,非常适合由 AI 智能体 来执行。
本文讨论的是一个逐警报分析的 AI 智能体,它基于 NVIDIA NeMo 库构建,使用 NVIDIA Nemotron 开放模型提供智能,并运行在 NVIDIA OpenShell 安全运行时之上。给定一个警报及其传感器数据帧,该智能体将:
- 收集上下文信息(历史记录、操作手册、相似的历史案例)
- 运行专家检查(例如,使用 NVIDIA nv-tesseract进行异常检测指标分析,使用NeMo Retriever对扫描版操作手册进行 OCR 识别)- 输出结构化的证据包:观察结果、根因假设、补救措施、建议行动
该智能体端到端由 GPU 加速,并部署在单个 HTTP 端点之后。任何上游调用方(流内过滤器、操作员 UI 中的点击按钮)都以相同方式调用它。工具与大脑同样重要。
为什么工业和基础设施领域的逐警报处理工作具有挑战性?
机器正变得越来越互联,从汽车、火车到电梯和工业电机。随着这种互联互通,服务人员和工程团队面临着越来越多的可用数据,用于排查问题和了解机器中正在发生的情况。
与此同时,技术人员还需要从 SCADA 或 IoT 系统不断推送的信息中筛选和评估,以找到真正重要的信号。通常每小时有数百条警报、数千个传感器读数需要考虑,以及各种不同格式的文档说明每条警报的处理方法。
例如,当警报触发时,技术人员往往必须查阅多个数据源、工具和文档来回答以下问题:
- 该资产或同类资产之前是否触发过此警报?当时做了什么?什么措施解决了问题?
- 针对此错误代码、工厂和位置,具体的操作手册是怎么说的?
- 信号是真实的吗?对于一个提示高温的通用警报,它是异常还是趋势的一部分?是否有维护操作正在进行?
在解决这些问题之后,技术人员还必须撰写建议报告(通常是工单),以便其他人可以据此行动并从中学习。
总而言之,这是一项劳动密集型的工作,需要广泛的经验以及与多种不同系统交互的能力。因此,一个能够处理通用步骤的助手可以大幅加速这一流程。筛选相关信号、收集相关知识并起草可复用的建议报告可以释放时间,使人类能够专注于更复杂的问题,并更快地处理其他未解决事件。
AI 分析智能体如何帮助解决这些挑战?
当人类针对特定报警请求上下文时,AI 分析代理会连接到不同系统以收集知识,可能借助专家进行更深入的分析,并最终起草一个有效的行动方案。整个代理运行在沙箱中(图 1)。

图 1. 逐报警分析 AI 代理工作流
代理的工作描述和规定起来很简单:
输入:一个报警负载,包含其传感器帧和资产元数据输出:一个证据包(观察、根因假设、补救措施、建议行动)以及支持性追踪延迟预算:秒级,而非分钟级;操作员正等待这一行变绿,因此每一步都需要尽可能快
为完成这项工作,代理需要:
- 关于做什么的指令(图 1 中标记为 1)
- 智能或推理能力,由 NVIDIA Nemotron开放模型提供(图 1 中标记为 2) - 用于与其他系统交互的编排工具(图 1 中标记为 3-5)
指令是一批报警,结合一个制定代理目标的提示,发送给 Nemotron,这是一个开放模型系列,具有开放权重、训练数据和配方,为构建专用 AI 代理提供领先的效率和准确性。具体来说,助手使用 Nemotron 3 Nano 处理简单的编排任务,使用 Nemotron 3 Super 进行复杂推理。这些模型以优化的 NIM 容器形式托管在靠近工厂产线的地方,以实现低延迟推理,或托管在云端。
按照模型的指示,代理朝着目标推进。它检索信息,评估相关性,使用不同工具进行过滤和分析。为了满足用户的延迟预算,重要的是每一步都尽可能快地执行。
代理使用哪些工具,它们如何被加速?
代理主要需要在广泛的上下文中迭代地组装和推理。因此,对于任何给定的报警,它有三个自然的子阶段:收集证据(图 1 中标记为 3)、运行专家检查(图 1 中标记为 4),然后生成并验证行动(图 1 中标记为 5)。每一步都使用通过 GPU 加速的工具,这些工具使用 CUDA-X 库或 Nemotron 系列的其他专用模型。
结构化信息的加速检索
默认情况下,代理通过配置具有合适时间间隔和相关传感器过滤条件的 SQL 查询,来检索可能相关的报警和传感器读数。这些查询通常针对近期报警和传感器帧的已清理入站流运行。为了快速响应,这些帧使用 NVIDIA cuDF 进行聚合和解析,该库可在 GPU 上加速数据处理和过滤。
如果需要历史信息或更广泛的信息,智能体可以使用其 Text-2-SQL 工具从更广泛的数据仓库中检索。使用 Apache Vanna 结合 Nemotron 模型来管理可用表的上下文,可将问题转换为查询。例如,“在过去几个月中,特定序列号组下的资产上普遍存在哪些报警类型?”同样的方法可以处理关于资产层级和传感器拓扑中父/子组件关系的复杂前置问题,这些通常用于过滤。
使用 NVIDIA NeMo Retriever 加速 RAG
解决报警所需的大量相关信息隐藏在非结构化数据中,例如程序手册、特定地点的操作手册、工单模板和操作员流程说明。NVIDIA NeMo Retriever 加速了相关信息的过滤。它编排了 Nemotron Parse 或 Nemotron RAG 等专用模型,以加速复杂信息的提取和索引。更多详情,请参阅 NVIDIA AI Blueprint for Retrieval-Augmented Generation。
迭代构建解决知识
最后,智能体的关键上下文是其自身半结构化数据的记忆——特别是过去的补救工单和解决策略。使用 cuVS 可以加速这些内容的搜索。这使智能体能够从过去学习——例如,回答“这个特征以前见过吗?修复有效吗?”
专家分析
通常,** **通用报警(例如“温度过高”或“振动尖峰”)需要在特定上下文中由专家确认:轴承是真的失效了,还是传感器伪影?为此,领域特定的专家工具或子智能体与智能体一起部署。
例如,在检索结构化传感器时间序列后,智能体可能需要调用一个分析智能体,对数据执行采样或傅里叶变换、执行预测,或使用合适的库(如 NVIDIA cuFFT、NV-Tessaract 或 NVIDIA cuML)过滤异常值。
动作生成与验证
一旦信息收集和专家分析完成,Nemotron 模型会迭代地将收集到的证据综合为结构化观察 + 根因假设 + 补救措施 + 推荐动作记录。之后,智能体根据策略和置信度门限测试输出,同时使用 Nemotron 3 Content Safety 对其安全性进行审查。高置信度且符合策略的获得自动派发标志;低置信度或不符合策略的则升级给技术人员,并预先附上证据。
Nemotron 模型提供智能体智能
Nemotron 模型在智能体的多个环节中提供智能。它们提供推理大脑、NeMo Retriever 中的文档解析,以及用于搜索的高质量嵌入。仅使用可用的检查点,它们就能开箱即用地表现出色,使部署在几分钟内成为可能。
使用开放模型的另一个优势是,你可以轻松地针对自己的任务对其进行调优。例如,使用配方将你的 Nemotron 嵌入模型微调到你的操作手册和技术领域的内容,将使其能够更可靠地检索到良好结果。在更高级的情况下,微调将使推理模型在针对你的告警上下文中使用的特定语言、行业领域和描述进行推理时更加有效。
总之,这种能够在任何地方(配备合适的 GPU)部署模型并针对智能体上下文精确调优模型的能力,使 Nemotron 模型成为该智能体的关键组件。
分析智能体取得了什么成果?
这里描述的分析智能体加速了向用户提供告警证据的每一步。这正是使得从用户界面(通常是第三方应用程序)针对告警调用智能体并在相关时间内获得答案变得可行的原因。为了从给定设置中获得更多性能,可以将关键事件批次自动发送给智能体进行预分析。这利用了可用容量,并进一步减少了人类原本必须查看或分析的告警。
为什么编排、安全和智能体演进很重要?
将智能体与其工具和大脑连接在一起的是编排(提示组装、工具调度、重试、追踪)。此外,智能体应该学习和改进。按照设计,它将通过不断增长的“过往补救措施”知识库变得更加智能。然而,即使这些信息不断增加,智能体偶尔也会选择错误的工具(或者选择了正确的工具但传递了错误的参数)。
为了简化这些任务,你可以使用 NVIDIA NeMo Agent Toolkit,它是 NVIDIA NeMo 的一部分。它有助于将智能体暴露为单个端点,生成可用 NeMo Evaluator 评估的追踪,并处理许多使智能体达到生产就绪状态的小细节。
对于像该智能体这样经常处理敏感数据或有权访问生产相关系统的企业部署,安全至关重要。特别是,有必要控制智能体可以执行哪些操作、可以调用哪些模型以及可以使用哪些工具。因此,对于任何智能体,建立沙箱都是合理的。NVIDIA OpenShell 是自主 AI 智能体的安全运行时,提供沙箱化执行环境,保护你的数据、凭据和基础设施——由声明式 YAML 策略管理,防止未经授权的文件访问、数据泄露和不受控制的网络活动。
开始构建分析智能体
如果你大规模运行机械设备,那么每次报警所对应的技术人员工作,正是适合由智能体承担的那部分任务。本文所描述的流程,正是 NVIDIA 技术栈为此整合而成的:一个由 Nemotron 驱动的智能体,配合 OpenShell 安全运行时,以及 GPU 加速的上下文与专用工具,并作为一个 HTTP 端点对外暴露,供你现有的报警管理界面或流水线调用。
你可以使用 NVIDIA Agent Toolkit 的构建模块来组装该解决方案:
NVIDIA AI-Q Blueprint for intelligent agents:一个参考技术栈,使用上述同一套工具链对企业数据进行连接、检索和推理。从这里开始。NVIDIA NeMo Agent Toolkit:编排层之下的库。你用它来编写智能体的工具、追踪其调用,并将其暴露为 HTTP 端点。NVIDIA OpenShell:智能体的运行时,适用于任何你希望实现受控工具调用和可重放追踪的部署场景。NVIDIA Nemotron:智能核心。在 build.nvidia.com 上注册获取免费开发者访问权限,并下载优化后的 NIM 容器,或使用 Hugging Face 上的检查点合集。NVIDIA NeMo Retriever:一个库,可将企业文档转换为结构化知识层,供专用智能体进行推理,基于你独特的企业数据提供有依据、准确且快速的答案。NVIDIA CUDA-X Libraries(cuDF、cuVS、cuGraph):处理归档、向量和图工具。NVIDIA NeMo Evaluator:根据基准真值对工具使用和答案质量进行评分;在第一天就将其接入 NeMo Agent Toolkit 的追踪日志。
准备好开始构建你自己的智能体了吗?请遵循以下步骤:
- 智能体的关键组件需要 GPU 才能运行。如果你没有可用的 GPU,可以先使用托管的 NVIDIA NIM 开发者端点来运行 Nemotron 模型,之后再切换到自己的环境。 - 克隆
NVIDIA AI-Q Blueprint,并让它针对合成报警流运行起来。 - 先将其接入技术人员现有的工具,只有在不得已时才构建新的界面。
- 与你的 NVIDIA 客户经理讨论适合你站点的部署形态。初创公司可以申请 NVIDIA Inception以获得 credits 和支持。
这个智能体是系统中随着更多报警经过它处理而在成本和性能上不断改进的那一部分。
