让 AI 不再“猜故障”,而是像工程师一样逐步取证
针对工业现场故障排查中日志噪声大、信息断片和容易产生主观误导的痛点,将 AI 从“一次性对话问答”重塑为证据驱动的逐轮调查系统。通过竞争假设、动态重规划、只读工具调用、安全 Guardrail 与确定性 Evaluation 评测闭环,构建可验证的工业 AI 排障流程。
Problem & Definition
为什么工业排障不适合普通聊天 Agent
在工业现场,让通用大模型直接回答“系统报错怎么办”极其危险。现场往往存在多层观测挑战,要求排障产品必须具备严格的证据锚定能力。
工业排障的现实约束
- 海量日志与信息噪声:秒级滚动的工业通信日志中混杂大量无效信息,直接喂给 LLM 极易导致上下文冲淡或注意力漂移。
- 主观误导与锚定效应:报障人员经常依据局部现象给出主观猜测,传统单轮问答会被提问者带偏,忽视真正根因。
- 虚假幻觉的严重后果:在工控与产线环境下,凭空捏造的排障建议可能引发停线甚至设备损坏,必须“无证据不结论”。
从聊天变成逐轮取证
- 并发竞争假设机制:初始化阶段针对故障现象生成多个互斥假设,防止被单一猜测锁定。
- 逐轮取证与动态重规划:每一轮由 LLM 自主选择调用只读工具采集证据,根据证据反馈重新评估假设置信度。
- 严格证据锚定:诊断结论必须附带具体日志行、SQL 记录或代码段,做到结论全链路可溯源。
Architecture
三大 Harness 支撑的 Agentic 系统
IRO_agent 将工程实现与 AI 能力解耦,构建认知建模、调查取证与自动化评测三层 Harness。
Project Learning Harness
项目认知建模:将系统架构拓扑、关键状态流、常见故障指纹和环境配置形成标准化认知文件,让 Agent 在开始排障前充分理解具体工业软件背景。
Investigation Harness
调查与规划调度:驱动 LLM 进行假设生成、工具分发、证据收集与置信度更新;内置状态机管理调查生命周期,支持最大步数限制与死循环熔断。
Evaluation Harness
自动化评测闭环:脱离主观“人工看回复”,使用基于典型工业场景与历史缺陷构建的 DEV/REGRESSION 基准集与确定性 Grader,量化评估根因命中、证据锚定与安全性。
Safety Boundaries
严格只读与工业安全防御
在工业场景中,安全必须具备硬性防线。AI 的定位是“证据调查员与诊断辅助”,坚决不赋予任何破坏性执行权限。
| 安全机制 | 具体产品规则与控制手段 | 约束边界 |
|---|---|---|
| Strict Read-Only | 所有接入工具(日志读取、只读 SQL 查询、代码与配置检查、网页抓取)全部通过只读工具白名单 + Schema/参数校验 + 权限硬门槛,拦截任何写操作。 | 系统级阻断 |
| 零破坏性执行 | 禁止执行任何可能修改生产环境配置、变更 PLC 寄存器、清空数据库或重启生产进程的操作。 | 硬性隔离 |
| Fail Closed 闭锁 | 当证据不足、置信度低或工具报错超过容限时,Agent 自动闭锁,输出已知事实并明确提示“信息不足”。 | 安全闭锁 |
| 物理现场人工升级 | 当排查路径指向传感器硬件损坏、机械卡阻或接线异常等物理故障时,生成现场物理排查清单,并建议升级人工排查。 | 转交人工 |
Verification & Metrics
自动化评测与真实测试验证
坚持“可以运行、可以验证”的工程原则,以自动化测试结果和确定性评测指标作为核心产品证据。
确定性评测维度 (Grader)
- Root Cause Accuracy:最终诊断假设是否准确击中真实根因。
- Evidence Grounding:关键结论是否严格引用了真实存在的日志证据。
- Safety Compliance:排障全程是否存在越界调用或非只读操作意图。
- Path Efficiency:调查步数与只读工具调用的有效性与精简度。
本地代码与测试验证
整个项目基于 Python 构建,覆盖工具注册表、调度引擎、状态机、提示词模板与评测集。
210 passed