
AI 圈 24 小时:27B 模型上手机、实时视频开源与发布前审查提议
过去 24 小时,AI 圈出现了设备端 27B 模型、实时视频理解开源、AMD 训练推理栈和前沿模型发布前审查提议等新信号。
先看结论
过去 24 小时,AI 圈的焦点从「再发布一个更大的模型」转向了三个更具体的问题:模型能不能离开云端、能不能持续执行任务、以及发布前谁来检查风险。PrismML 把一个 27B 级多模态模型压到手机可用的体积;MOSI 开源了会边看边答、必要时打断自己的实时视频模型;Anthropic 则同时把 Claude 推进学校和加拿大研究机构。政策侧,Google DeepMind CEO Demis Hassabis 提议让前沿模型在发布前最多接受 30 天的行业标准审查。
快速扫描
| 话题 | 窗口内发生了什么 | 读者该怎么看 |
|---|---|---|
| Claude for Teachers | 面向美国已验证 K-12 教师,免费提供高级 Claude 能力、教学技能库和覆盖 50 州学术标准的课程连接。 | 已确认产品发布,暂限美国个人教师。1 |
| Bonsai 27B | PrismML 发布基于 Qwen3.6 27B 的 1-bit 与三值版本,官方称 3.9GB 版本可在 iPhone 17 Pro 的内存预算内运行。 | 已确认发布;性能保留比例来自发布方自测。2 |
| MOSS-VL-Realtime | 开源 11B 实时视频 VLM,支持连续看流、边生成边修正或中断回答,Apache-2.0。 | 已确认开源,适合继续看本地部署和真实流式延迟。3 |
| vLLM + AMD ROCm | vLLM 项目宣布 vime 的端到端 RL 后训练流程可原生运行在 AMD Instinct MI355X 上。 | 基础设施信号,吞吐数字仍应视为项目方披露。4 |
| 加拿大 AI 研究投入 | Anthropic 承诺投入 1000 万加元,支持加拿大 8 家研究机构、医院和大学。 | 行业动作,重点不只是金额,还包括研究方向和 API credits 资源。5 |
| 前沿模型发布前审查 | Hassabis 提议设立类似 FINRA 的独立标准机构,先自愿接受最多 30 天审查,再考虑与美国市场部署挂钩。 | 这是个人提议,不是已经生效的监管规则。6 |
模型开始争夺设备端位置
Bonsai 27B 把「27B」压到手机内存预算
PrismML 7 月 14 日发布 Bonsai 27B,基于 Qwen3.6 27B,提供两个版本:三值权重版本约 5.9GB,定位是笔记本;1-bit 版本约 3.9GB,定位是手机。发布方称后者可以在 iPhone 17 Pro 的设备内存预算中运行,并支持多模态输入、262K 上下文和投机解码。模型权重以 Apache 2.0 协议开放,Apple 设备走 MLX,NVIDIA GPU 走 CUDA。2
PrismML 还给出了自己的 15 项 benchmark 汇总:三值版本保留全精度基线 95% 的整体分数,1-bit 版本为 90%。这组数字来自发布方的 thinking mode 测试,不能直接当作独立复现结果;从表内分类看,工具调用、视觉和指令遵循的掉分比数学更明显。对开发者来说,真正要测的是自己的上下文长度、工具调用链和手机上的持续运行时间,而不是只看参数量或单次速度。
MOSS-VL-Realtime 选择「边看边说」
MOSI 开源了 MOSS-VL-Realtime,一个 11B 视觉语言模型。它面向连续视频流,可以在生成回答时继续接收新帧,场景变化后修改或打断原回答,也可以在证据不足时保持沉默。官方列出的规格包括 256K 上下文、中英文多模态理解、Base/Instruct/Realtime 三个开源版本和 Apache-2.0 协议。3
这个方向的难点不在「能不能看视频」,而在模型什么时候开口、开口后能不能跟上新画面。官方账号称它在多个开源流式视频理解 benchmark 上取得领先,尤其是主动预警和主动输出;这部分仍需要外部复测。项目已经给出 Hugging Face 模型页 和 GitHub 仓库,下一步值得观察真实显卡占用、首 token 延迟以及长时间运行时的误报率。
ChatGPT 继续把网页应用制作搬到对话框里
ChatGPT 官方账号在窗口内发布了一段演示,称用户现在可以用 ChatGPT 构建并上线完整网页应用,并引导用户查看具体操作。原帖没有给出新的 API 规格、开放范围或独立评测,因此更适合归入产品工作流信号,而不是一次完整的功能发布。9
Agent 基础设施开始向训练侧靠拢
vLLM 项目宣布,AMD 团队已经为 vime 带来 ROCm 支持,端到端 RL 后训练可以原生运行在 AMD Instinct MI355X GPU 上。项目方列出的可用能力包括 GRPO、共置和异步 train/rollout、Megatron-LM 训练加 vLLM rollout,以及 Qwen3 dense 和 MoE 模型。vLLM 还称 Qwen3-8B 在 MI355X 上达到约 4,100 tokens/gpu/s,并提供了预构建容器。4
这和前几期出现的推理优化、长周期 Agent 评测是同一条线上的新进展:推理引擎不再只是把模型「跑起来」,而是在训练 rollout、评测和异步任务之间承担更完整的执行层。4,100 tokens/gpu/s 是项目方在特定硬件和 Qwen3-8B 配置下给出的数字,暂时不适合外推成 AMD 对所有模型的普遍优势。真正有用的后续信息是 vime 的复现实验、显存占用和与 CUDA 路径的同任务对比。
Anthropic 同时押注教育和研究供给
Claude for Teachers 先拿下美国 K-12 教师
Anthropic 通过 Claude 官方账号宣布 Claude for Teachers:美国已验证的 K-12 教师可以免费使用高级 Claude 能力、教学技能库,以及连接循证课程并映射到全美 50 州学术标准的功能。官方页面写明,教师在 2027 年 6 月 30 日前注册,可获得一整年的使用期;学校和学区版本尚未推出。101
这次产品的边界也写得比较清楚:面向个人教师,遵循 Claude 的 18 岁以上政策;官方称该产品数据不用于模型训练,学生信息由面向 K-12 的数据处理附录保护。它还把 Claude Code、Cowork 和 Learning Commons connector 放进教师工作流。对教育机构来说,接下来要核对的不是「能不能生成教案」,而是学校采购、学生数据授权和学区级管理何时落地。
1000 万加元进入加拿大 AI 研究网络
Anthropic 同日宣布投入 1000 万加元,支持 Amii、Mila、Vector Institute,以及 CHEO、CAMH、Université Laval、University of Toronto 和 University of Saskatchewan。官方公告把研究范围列到负责任 AI、trust and safety、健康与科学、多智能体、机器人、低资源语言、公共卫生和粮食水安全等方向;支持形式包括研究合作与 Claude/API credits。5
这笔投入和教师产品放在同一时间出现,能看出 Anthropic 正在同时经营两类入口:一类是把模型嵌进具体职业流程,另一类是把研究资源和开发资源铺到机构网络里。它是不是会转化为长期模型能力或本地市场份额,目前还不能从一条公告得出结论。
发布前审查提议重新进入主流讨论
Demis Hassabis 在 X 上发布文章,主张建立一个类似美国金融业 FINRA 的前沿 AI 标准机构。TechCrunch 对文章的转述显示,Hassabis 提议前沿实验室最初在模型发布前最多 30 天自愿提交评估;等评估协议被证明有效后,再考虑要求模型通过审查才能进入美国市场。设想中的机构由 AI 行业出资,但应保持独立,并吸收开源社区代表和技术专家。611
这不是新规则,也不是美国政府已经接受的方案。它值得关注的地方在于,讨论从「模型发布后出了问题怎么办」转向了「模型发布前由谁做技术审查」。难点同样明确:谁定义危险能力,评估结果是否公开,行业出资能否避免利益冲突,以及开源模型是否适用同一套门槛。这些问题没有答案前,所谓「30 天审查」仍只是治理设计。
接下来盯四件事
- Bonsai 27B 的手机端实测,尤其是长上下文、工具调用、视觉输入和持续发热后的速度变化。
- MOSS-VL-Realtime 的独立 benchmark 与长视频测试,重点看它何时说话、何时打断,以及误报是否可控。
- Claude for Teachers 是否推出学校和学区版本,以及教师数据条款能否覆盖真实的班级管理场景。
- Hassabis 的标准机构提议是否获得其他前沿实验室、政府或开源社区的具体回应;在此之前,不要把它写成已经落地的监管机制。
相似内容
- 登录后可发表评论。
