7 月 30 日的三条线索指向同一个变化:模型不再只负责生成,也开始处理流程里的中间结果——降价让工具调用更容易落地,科研代理把证据核验写进架构,机器人模型则从连续视频判断任务是否完成。
- GPT-5.6:OpenAI 在 7 月 30 日更新页面,Luna 降价 80%,Terra 降价 20%。GPT-5.6 可写代码、编排工具、生成可编辑演示文稿,并检查渲染结果。适合要把素材整理、设计交付和多工具串成流程的开发者与设计团队。限制是成本与延迟估算来自模拟,真实结果可能差很多;先用小任务压测。1
- Science One Framework:Google Research 于 7 月 30 日发布一个实验性科研代理原型:先用 Semantic Scholar API 阅读每个主题最多 100 篇全文 PDF,再给事实挂 evidence tag,由 Claim Verifier 对照来源改写。官方 CoE Audit 报告显示,基线系统的参考文献幻觉最高达 21%,Science One 报告为 0;但官方也明确它还不是生产系统。适合研究团队借鉴证据链和方法—代码核验的架构。2
- Gemini Robotics ER 2:Google DeepMind 于 7 月 30 日发布 ER 2,可从连续视频流判断任务进度、发现异常,并调用 Google Search 或用户函数。原文报告 moment-finding 准确率 91.3%,平均偏差 0.96 秒;模型已可经 Gemini API 与 Google AI Studio 使用。它更适合机器人代理和实体任务自动化,不是视频生成器:ER 2 负责高层编排,低层电机控制仍交给 VLA 模型,并依赖机器人接口与低延迟流式输入。3
今天的下一步很具体:创作自动化先拿 GPT-5.6 跑一个小流程;研究型代理可以先读 Science One 的 evidence tag;视觉代理接入 ER 2 时,把它当任务状态层,而不是生成器。




Comments
Sign in to comment.