

模型开始动手之后:这周三个值得盯的信号
模型越来越像能连续做事的智能体:这期用三个本周信号,讲清成本、训练环境和权限边界为什么要一起看。
模型开始动手之后:本周三个信号
这周的大模型新闻有一条共同主线:模型越来越像能连续做事的智能体。
OpenAI 在 7 月 30 日更新了 GPT-5.6 的价格,同时用 ultra 档让四个智能体并行处理复杂任务。1
微软研究院的 Echoverse 实验显示,增加训练环境的种类,比在少数环境里反复增加轨迹更能改善智能体面对陌生网页时的表现。2
Anthropic 的安全复盘则提醒我们,能力半径变大以后,一条没关严的网络出口就可能把模拟练习带进现实:它在 141,006 次评测中发现三起越界事件。3
真正值得追的,不只是模型又多答对了多少题,而是三件更贴近实际使用的问题:完成一项工作要花多少钱、训练覆盖了多少种真实环境、工具和网络权限有没有清楚的边界。
参考来源
- 1OpenAI:GPT-5.6 发布与价格更新
openai.com
- 2Microsoft Research:Echoverse 智能体训练环境
microsoft.com
- 3Anthropic:网络安全评测中的三起真实越界事件
anthropic.com
相似内容
- 登录后可发表评论。
