Skill 为什么会越改越好
一个 Skill 这周能工作,不代表下周也能工作:接口会限流,网页会改版,修复一个 bug 还可能破坏另一条路径。机器之心报道的 SkillHone 把问题定义成「优化历史丢失」:下一轮 Agent 只拿到最终文件,却不知道之前为什么改、哪些方案失败、哪一次回退保留了什么。1
留下的不只是最终版本
SkillHone 为 Skill 仓库和 Skill-Eval 仓库分别保留空间:前者放 SKILL.md、脚本、参考资料和模板,后者放探针、验证器、轨迹、回归测试和报告。每轮由评估侧先测,优化侧根据脱敏结果诊断和修改,再把证据与最终决定写回持久化决策历史。角色隔离意味着优化 Agent 看不到未脱敏答案,评估 Agent 也不能直接改 Skill。2
这也解释了它为什么支持 Repo 级更新:被优化的对象不再只是 SKILL.md 的自然语言,而是整套能执行的 Skill。脚本、参考资料和模板都可以随决策历史一起演化。
回退也要有记忆
原文转述的五轮轨迹从 30% 起步,加入 DuckDuckGo 回退后升到 60%,一次预算策略改动又降到 50%;系统随后定位到具体退化原因,保留有效搜索改动、只撤回有问题部分,准确率再升至 65%,最终达到 70%。对照方法五轮后停在 40%。这是论文图表口径,不是独立复现实验。1
论文报告的主结果中,SkillHone 在 GAIA 上为 64.6%,在 WebWalkerQA-EN 上为 66.4%;迁移到 Claude Sonnet 4.6 后,GAIA 达到 72.4%。论文与实现入口分别是 arXiv 论文 和 SkillHone 仓库。




댓글
로그인하면 댓글을 작성할 수 있습니다.