今天的主线很清楚:模型越来越容易拿到,真正难的是让它在视觉世界里持续完成任务,并把安全测试写进部署流程。
1. Inkling:开放权重模型把「可定制」放到产品中心
Thinking Machines 7 月 15 日发布 Inkling。它是一个总参数 9750 亿、激活参数 410 亿的 Mixture-of-Experts 模型,支持文本、图片和音频输入,最长上下文 100 万 token;公司同时开放完整权重,并通过 Tinker 提供微调入口。官方发布 模型卡
这次发布的重点不是「参数越大越强」,而是把模型当成可改造的底座。代价也很实在:官方模型卡写明,BF16 版本至少需要 2 TB 聚合显存,量化版本也需要至少 600 GB。对开发者来说,开放权重带来的自由度,必须和部署成本一起算。
2. UniVR:推理开始离开文字空间
北京交通大学与字节跳动团队的预印本 UniVR,尝试让模型直接在视觉空间里学习复杂推理、物理动态和长期规划,并提出 VR-X 评测集,覆盖机器人操作、空间感知、视觉搜索、编辑和益智任务等场景。论文原文
论文报告称,UniVR 在 VR-X 上最高提升 25%。它的价值在于把「看懂一张图」推进到「连续理解一段任务变化」,但目前仍是 7 月 14 日提交的预印本,结果需要后续复现。
3. 长程终端评测:智能体一旦要连续工作,分数会明显下沉
Long-Horizon-Terminal-Bench 把 46 个任务分成 9 类,要求智能体在终端里连续执行数十分钟到数小时,并用中间奖励记录部分进展。论文对 15 个前沿模型测试后,平均每个任务消耗约 990 万 token、运行 231 个 episode、耗时 85.3 分钟;最强配置在 0.95 部分奖励阈值下的通过率为 15.2%,满分阈值下为 10.9%。论文原文
这组数字提醒我们,短任务里的「会用工具」还不等于能交付长流程。规划、上下文管理、反复调试和最后一步自检,仍然是智能体最容易掉链子的地方。
4. AI 安全治理:OpenAI 推动州级规则向联邦框架靠拢
OpenAI 7 月 15 日发布文章,主张把加州、纽约州和伊利诺伊州正在形成的前沿模型安全要求,逐步对齐成全国基线。文章列出的共同元素包括风险评估及公开披露、严重安全事件报告、独立审计;同时,OpenAI 称联邦政府正在推进面向高能力模型的网络安全测试框架,并以 8 月初形成框架为目标。OpenAI 原文
这里要分清事实和立场:这是一家模型公司的政策主张,不等于美国已经形成统一的联邦规则。它反映出的变化是,讨论重点正从「要不要管」转向由谁测试、披露什么,以及州法如何和联邦能力衔接。
从开放权重模型,到视觉推理和长程执行,再到治理框架,今天的四个条目指向同一个判断:能力展示正在让位于可定制、可验证和可审计。




댓글
로그인하면 댓글을 작성할 수 있습니다.