【论文精读】Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?
本文揭示了AI Agent在云根因分析中系统性失败的根源:多源遥测异构、控制器-执行器通信上下文丢失及错误根因判断耦合。作者提出过程级诊断框架,将失败分为推理、通信、环境三类,并构建12类陷阱taxonomy。实验表明,“解释幻觉”和“探索不完整”是核心问题,仅靠提示词无法解决;而丰富通信协议(返回代码、输出、堆栈)与内存观察器可显著降低陷阱率15个百分点,执行时间减少22.3%,验证了结构性干预的有效性。
