AI连续出错难察觉?中科院RUPA新框架:从关系图里揪出隐藏风险
当人工智能助手从单纯回答问题进化为能自主完成复杂任务的“智能体”时,一个新问题浮现出来:它可能在执行过程中逐步偏离目标,最终导致任务彻底失败。中科院软件所团队提出了一种名为RUPA的新型框架,通过分析任务执行过程中各步骤间的依赖关系,提前识别潜在风险,有效解决了这一难题。
传统方法主要依赖模型对当前回答的“自信程度”来判断可靠性,例如观察模型对每个词的预测概率或直接询问其对答案的信心。这种方法在单轮问答中表现尚可,但面对需要数十甚至上百步交互的复杂任务时,其局限性暴露无遗。研究人员发现,智能体可能在执行初期就埋下错误种子,但直到任务后期才显现问题,此时纠正已为时过晚。
研究团队通过实验揭示了这一现象的普遍性。他们使用Qwen3.5-27B模型测试航空和零售客服场景,发现传统方法在预测任务失败时的准确率甚至低于随机猜测。例如,在航空客服场景中,基于序列生成概率的方法准确率仅为0.205,远低于随机猜测的0.441。这表明,仅靠模型“说话时的语气”无法准确判断任务整体可靠性。
进一步分析显示,高风险步骤并非集中在任务后期,而是均匀分布在执行轨迹的各个位置,中位数出现在任务进度54%处。这些步骤的共同特征是出现重复动作、停滞不前或与前期观察结果冲突。研究团队将此现象比喻为装修房屋时贴错瓷砖:若后续施工完全依赖错误位置,整个工程都会偏离轨道;若忽略该错误,影响则有限。这凸显了追踪步骤间依赖关系的重要性。
RUPA框架的核心创新在于将执行过程建模为有向图,其中节点代表具体执行事件,边代表步骤间的依赖关系。研究团队定义了七种关系类型,包括顺序关系、重复关系、反馈关系等,并通过确定性规则检测这些关系。例如,通过匹配“接下来”“因此”等词汇识别进展关系,通过检测报错信号识别反馈关系。这些规则不依赖任务最终结果标签,完全基于当前可见信息,确保了框架的实用性。
在风险传播机制上,RUPA为每条边计算权重,考虑关系类型可靠性、关系强度和时间衰减因素。当前步骤的风险值由所有相关历史步骤的风险加权平均得出,同时结合整条轨迹的长期风险趋势。这种设计使框架既能捕捉局部异常,又能识别系统性风险。例如,即使某步骤模型输出看似自信,但若其与前期错误步骤存在依赖关系,RUPA仍能识别出潜在风险。
实验结果显示,RUPA在多个基准测试中显著优于现有方法。以MiniMax-M2.7模型为例,RUPA的平均AUROC达到0.718,较最强基线提升3.2个百分点;在任务成功率提升实验中,使用RUPA指导决策使Terminal-Bench-2场景的成功率从10.5%提升至21.3%。特别值得注意的是,RUPA在任务早期就能准确预测失败风险,为及时干预提供了可能。
消融实验进一步验证了框架各组件的必要性。移除图建模或传播机制后,性能出现明显下降,而随机图结构则导致性能接近无图模型。这表明,RUPA的优势源于对步骤间真实依赖关系的捕捉,而非单纯增加信息量。研究团队还通过熵值控制实验证明,即使模型输出自信程度相同,RUPA仍能通过分析关系结构区分成功与失败轨迹。
目前,RUPA依赖的关系检测规则仍相对简单,主要基于关键词匹配和语义相似度。未来研究可探索自动学习关系类型和检测规则的方法,以适应更复杂的任务场景。如何将RUPA集成到现有智能体架构中,实现实时风险监测与干预,也是值得深入研究的方向。这项工作为提升智能体可靠性提供了新思路,标志着人工智能从“会说话”向“会做事”迈出了重要一步。
