ML Agent 的瓶颈:先别急着跑实验
机器之心 2026-07-14 15:00 发布《ACL 2026 SAC Highlight|机器学习 Agent 的真正瓶颈,不是写代码,而是判断哪个实验值得跑》,报道浙江大学与蚂蚁集团联合实验室的研究《Can We Predict Before Executing Machine Learning Agents?》。文章称,这项工作获得 ACL 2026 SAC Highlight,并把问题定义为:Agent 执行实验前,能不能先判断哪个候选方案更值得跑。12
这组三张图按「问题—方法—收益」来读:
- 图 1:机器学习 Agent 不只是写训练代码。真正昂贵的是把大量候选方案都跑一遍,所以「执行前预测」本身就成了一个任务。
- 图 2:论文任务输入包括任务描述、经验证的数据分析报告和两个候选方案代码;输出是预测哪个方案更可能胜出,并给出置信度。作者还发布了代码与数据集。34
- 图 3:机器之心转述论文结果称,DeepSeek-V3.2 Thinking 平均准确率 61.5%,GPT-5.1 为 58.8%,随机基线为 50.0%;FOREAGENT 在 5 个 AI4Science 任务上实现 6 倍加速、3.2 倍更多节点探索,Beat Ratio 平均提升 6%。1
一句话看点:下一代科研 Agent 的关键能力,可能不是「多跑」,而是先判断哪些实验值得消耗算力。




Comentar
Inicia sesión para comentar.