AWS 机器学习博客介绍 Agent Evaluation Metric(AEM),针对多轮智能体对话中早期错误沿后续轮次级联、整体评分无法定位根因的问题,把正确性拆解为真实性与完整性两个子指标,按轮次评估并组合为单一分数。该框架还给出失败分类法,用 prior_action_failed 区分根因与继承性失败,并说明
AWS 提出 AEM:面向多轮智能体的逐轮正确性评估指标