[AI]《Fantastic Adaptive Taxonomies and How to Use Them》M Cemri, A Cojocaru, M Pan, S Liu… [UC Berkeley] (2026)
在 LLM 智能体(Agent)优化领域,如何从执行轨迹中提取有效反馈是一个悬而未决的难题。过去的方法受困于“标量评分太稀疏”与“自由文本批评太琐碎且不可复用”的权衡,本质原因是缺乏一个既能像分数一样持久、又能像评论一样具有诊断意义的结构化反馈接口。
本文的核心洞见是:把智能体的失败反馈重新看作一种从自身行为中归纳出的、动态演进的“故障分类分级体系(Taxonomy)”。由此,AdaMAST 这一关键操作使问题得以解开:它从原始轨迹中自动诱导出一套覆盖系统级、角色级和领域级的命名故障代码,将冗长的轨迹压缩 18 倍,并作为统一的反馈接口供搜索、监控和筛选程序复用。
这项工作真正留下的遗产是证明了“自适应词汇表”在闭环优化中优于固定模板或纯自由文本。它为后来者打开的新门是建立了一种可审计、可进化的智能体诊断基础设施,显著提升了代码生成与数学推理任务的成功率;但尚未跨过的门槛是该体系仍高度依赖强模型(如 GPT-4o)作为诱导器和标注员,且在极低频故障的捕获上仍存在长尾效应。
arxiv.org/abs/2607.16387 机器学习 人工智能 论文 AI创造营








