AI 圈 24 小时:27B 模型上手机、实时视频开源与发布前审查提议

AI 圈 24 小时:27B 模型上手机、实时视频开源与发布前审查提议

过去 24 小时,AI 圈出现了设备端 27B 模型、实时视频理解开源、AMD 训练推理栈和前沿模型发布前审查提议等新信号。

先看结论

过去 24 小时,AI 圈的焦点从「再发布一个更大的模型」转向了三个更具体的问题:模型能不能离开云端、能不能持续执行任务、以及发布前谁来检查风险。PrismML 把一个 27B 级多模态模型压到手机可用的体积;MOSI 开源了会边看边答、必要时打断自己的实时视频模型;Anthropic 则同时把 Claude 推进学校和加拿大研究机构。政策侧,Google DeepMind CEO Demis Hassabis 提议让前沿模型在发布前最多接受 30 天的行业标准审查。

快速扫描

话题窗口内发生了什么读者该怎么看
Claude for Teachers面向美国已验证 K-12 教师,免费提供高级 Claude 能力、教学技能库和覆盖 50 州学术标准的课程连接。已确认产品发布,暂限美国个人教师。1
Bonsai 27BPrismML 发布基于 Qwen3.6 27B 的 1-bit 与三值版本,官方称 3.9GB 版本可在 iPhone 17 Pro 的内存预算内运行。已确认发布;性能保留比例来自发布方自测。2
MOSS-VL-Realtime开源 11B 实时视频 VLM,支持连续看流、边生成边修正或中断回答,Apache-2.0。已确认开源,适合继续看本地部署和真实流式延迟。3
vLLM + AMD ROCmvLLM 项目宣布 vime 的端到端 RL 后训练流程可原生运行在 AMD Instinct MI355X 上。基础设施信号,吞吐数字仍应视为项目方披露。4
加拿大 AI 研究投入Anthropic 承诺投入 1000 万加元,支持加拿大 8 家研究机构、医院和大学。行业动作,重点不只是金额,还包括研究方向和 API credits 资源。5
前沿模型发布前审查Hassabis 提议设立类似 FINRA 的独立标准机构,先自愿接受最多 30 天审查,再考虑与美国市场部署挂钩。这是个人提议,不是已经生效的监管规则。6

模型开始争夺设备端位置

Bonsai 27B 把「27B」压到手机内存预算

PrismML 7 月 14 日发布 Bonsai 27B,基于 Qwen3.6 27B,提供两个版本:三值权重版本约 5.9GB,定位是笔记本;1-bit 版本约 3.9GB,定位是手机。发布方称后者可以在 iPhone 17 Pro 的设备内存预算中运行,并支持多模态输入、262K 上下文和投机解码。模型权重以 Apache 2.0 协议开放,Apple 设备走 MLX,NVIDIA GPU 走 CUDA。2
PrismML 还给出了自己的 15 项 benchmark 汇总:三值版本保留全精度基线 95% 的整体分数,1-bit 版本为 90%。这组数字来自发布方的 thinking mode 测试,不能直接当作独立复现结果;从表内分类看,工具调用、视觉和指令遵循的掉分比数学更明显。对开发者来说,真正要测的是自己的上下文长度、工具调用链和手机上的持续运行时间,而不是只看参数量或单次速度。
这条消息在窗口内继续扩散,Hugging Face 官方账号转发了 PrismML 的发布信息;Hacker News 的对应帖子在抓取时有 414 分。78

MOSS-VL-Realtime 选择「边看边说」

MOSI 开源了 MOSS-VL-Realtime,一个 11B 视觉语言模型。它面向连续视频流,可以在生成回答时继续接收新帧,场景变化后修改或打断原回答,也可以在证据不足时保持沉默。官方列出的规格包括 256K 上下文、中英文多模态理解、Base/Instruct/Realtime 三个开源版本和 Apache-2.0 协议。3
这个方向的难点不在「能不能看视频」,而在模型什么时候开口、开口后能不能跟上新画面。官方账号称它在多个开源流式视频理解 benchmark 上取得领先,尤其是主动预警和主动输出;这部分仍需要外部复测。项目已经给出 Hugging Face 模型页GitHub 仓库,下一步值得观察真实显卡占用、首 token 延迟以及长时间运行时的误报率。

ChatGPT 继续把网页应用制作搬到对话框里

ChatGPT 官方账号在窗口内发布了一段演示,称用户现在可以用 ChatGPT 构建并上线完整网页应用,并引导用户查看具体操作。原帖没有给出新的 API 规格、开放范围或独立评测,因此更适合归入产品工作流信号,而不是一次完整的功能发布。9

Agent 基础设施开始向训练侧靠拢

vLLM 项目宣布,AMD 团队已经为 vime 带来 ROCm 支持,端到端 RL 后训练可以原生运行在 AMD Instinct MI355X GPU 上。项目方列出的可用能力包括 GRPO、共置和异步 train/rollout、Megatron-LM 训练加 vLLM rollout,以及 Qwen3 dense 和 MoE 模型。vLLM 还称 Qwen3-8B 在 MI355X 上达到约 4,100 tokens/gpu/s,并提供了预构建容器。4
这和前几期出现的推理优化、长周期 Agent 评测是同一条线上的新进展:推理引擎不再只是把模型「跑起来」,而是在训练 rollout、评测和异步任务之间承担更完整的执行层。4,100 tokens/gpu/s 是项目方在特定硬件和 Qwen3-8B 配置下给出的数字,暂时不适合外推成 AMD 对所有模型的普遍优势。真正有用的后续信息是 vime 的复现实验、显存占用和与 CUDA 路径的同任务对比。

Anthropic 同时押注教育和研究供给

Claude for Teachers 先拿下美国 K-12 教师

Anthropic 通过 Claude 官方账号宣布 Claude for Teachers:美国已验证的 K-12 教师可以免费使用高级 Claude 能力、教学技能库,以及连接循证课程并映射到全美 50 州学术标准的功能。官方页面写明,教师在 2027 年 6 月 30 日前注册,可获得一整年的使用期;学校和学区版本尚未推出。101
这次产品的边界也写得比较清楚:面向个人教师,遵循 Claude 的 18 岁以上政策;官方称该产品数据不用于模型训练,学生信息由面向 K-12 的数据处理附录保护。它还把 Claude Code、Cowork 和 Learning Commons connector 放进教师工作流。对教育机构来说,接下来要核对的不是「能不能生成教案」,而是学校采购、学生数据授权和学区级管理何时落地。

1000 万加元进入加拿大 AI 研究网络

Anthropic 同日宣布投入 1000 万加元,支持 Amii、Mila、Vector Institute,以及 CHEO、CAMH、Université Laval、University of Toronto 和 University of Saskatchewan。官方公告把研究范围列到负责任 AI、trust and safety、健康与科学、多智能体、机器人、低资源语言、公共卫生和粮食水安全等方向;支持形式包括研究合作与 Claude/API credits。5
这笔投入和教师产品放在同一时间出现,能看出 Anthropic 正在同时经营两类入口:一类是把模型嵌进具体职业流程,另一类是把研究资源和开发资源铺到机构网络里。它是不是会转化为长期模型能力或本地市场份额,目前还不能从一条公告得出结论。

发布前审查提议重新进入主流讨论

Demis Hassabis 在 X 上发布文章,主张建立一个类似美国金融业 FINRA 的前沿 AI 标准机构。TechCrunch 对文章的转述显示,Hassabis 提议前沿实验室最初在模型发布前最多 30 天自愿提交评估;等评估协议被证明有效后,再考虑要求模型通过审查才能进入美国市场。设想中的机构由 AI 行业出资,但应保持独立,并吸收开源社区代表和技术专家。611
这不是新规则,也不是美国政府已经接受的方案。它值得关注的地方在于,讨论从「模型发布后出了问题怎么办」转向了「模型发布前由谁做技术审查」。难点同样明确:谁定义危险能力,评估结果是否公开,行业出资能否避免利益冲突,以及开源模型是否适用同一套门槛。这些问题没有答案前,所谓「30 天审查」仍只是治理设计。

接下来盯四件事

  • Bonsai 27B 的手机端实测,尤其是长上下文、工具调用、视觉输入和持续发热后的速度变化。
  • MOSS-VL-Realtime 的独立 benchmark 与长视频测试,重点看它何时说话、何时打断,以及误报是否可控。
  • Claude for Teachers 是否推出学校和学区版本,以及教师数据条款能否覆盖真实的班级管理场景。
  • Hassabis 的标准机构提议是否获得其他前沿实验室、政府或开源社区的具体回应;在此之前,不要把它写成已经落地的监管机制。

関連コンテンツ

  • ログインするとコメントできます。
More from this channel