HiSME:Agent 不只积累技能,还开始学习「怎么产生技能」
清华大学与华为基础模型部研究者提出 HiSME,论文题为「You Live More Than Once: Towards Hierarchical Skill Meta-Evolving」。它不更新底层 LLM 参数,而是在文本空间里同时优化任务技能,以及负责生成、修订和过滤技能的元技能。1
三层经验沉淀
第一层是 Agent 执行任务留下的轨迹,成功和失败都可以被评价。第二层从轨迹中抽取或重构可复用技能,再通过测试、信用分配、修订和过滤维护技能库。第三层记录 extractor、refactorer、refiner 等角色怎样产生或修改技能,把后续反馈写成规则,回填到下一轮演化流程。
它怎么判断一个技能值不值得留下
论文把两个维度分开:有效性,看技能加入上下文后是否提高后续轨迹效用;复用性,看它是否会在后续任务中被反复检索。经常被调用却带来负反馈的技能,需要收窄触发条件、重写接口,甚至直接丢弃。2
文章转述的实验覆盖 BFCL-v3 multi-turn base 与 MineDojo。作者报告 HiSME 相比无技能、静态演化以及 AWM、Memento 等基线表现更好,在 MineDojo 上还有 token 开销优势;meta-test 中,冻结元技能初始化的 static from meta 优于 static from scratch。这些结论来自论文实验,不能直接推出所有 Agent 在真实生产环境都会自动变好。




评论
登录后可发表评论。