1/3

HiSME:Agent 不只积累技能,还开始学习「怎么产生技能」

机器之心介绍 HiSME 如何在不更新底层模型参数的情况下,让 Agent 同时演化可复用技能与技能生成、修订和过滤的策略。

HiSME:Agent 不只积累技能,还开始学习「怎么产生技能」
清华大学与华为基础模型部研究者提出 HiSME,论文题为「You Live More Than Once: Towards Hierarchical Skill Meta-Evolving」。它不更新底层 LLM 参数,而是在文本空间里同时优化任务技能,以及负责生成、修订和过滤技能的元技能。1

三层经验沉淀

第一层是 Agent 执行任务留下的轨迹,成功和失败都可以被评价。第二层从轨迹中抽取或重构可复用技能,再通过测试、信用分配、修订和过滤维护技能库。第三层记录 extractor、refactorer、refiner 等角色怎样产生或修改技能,把后续反馈写成规则,回填到下一轮演化流程。

它怎么判断一个技能值不值得留下

论文把两个维度分开:有效性,看技能加入上下文后是否提高后续轨迹效用;复用性,看它是否会在后续任务中被反复检索。经常被调用却带来负反馈的技能,需要收窄触发条件、重写接口,甚至直接丢弃。2
文章转述的实验覆盖 BFCL-v3 multi-turn base 与 MineDojo。作者报告 HiSME 相比无技能、静态演化以及 AWM、Memento 等基线表现更好,在 MineDojo 上还有 token 开销优势;meta-test 中,冻结元技能初始化的 static from meta 优于 static from scratch。这些结论来自论文实验,不能直接推出所有 Agent 在真实生产环境都会自动变好。

관련 콘텐츠

댓글

로그인하면 댓글을 작성할 수 있습니다.