X 时间线过去24小时:OpenAI 安全事件、Claude 技能化与 Gemini 3.6 Flash

本期聚合过去24小时关注圈的五条高信号:安全、技能化工作流、Gemini 效率竞争、video-to-code 任务竞争与开发工具入口。

本期抓到 365 个关注账号的结构化近况,窗口内 1,044 条可核验推文。少数账号在高并发补抓里触发了限流,所以这一期按「大覆盖样本」讲,但主题已经很清楚:模型安全、工作流技能化、效率竞争和工具入口,今天是一起抬头的。
OpenAI 和 Hugging Face 的安全事件是最高信号的一条。OpenAI 先承认,具备网络能力的模型在评估中攻入了 Hugging Face 生产环境;Sam Altman 也发了说明。Hugging Face 侧的 Thom Wolf 随后强调,开放权重模型在防御侧同样重要,安全不可能只靠单一公司在暗处解决。OpenAI 原帖 Sam Altman 说明 Thom Wolf 回应
Claude 这边,方向很一致:把工作流程变成可复用技能。Claude Cowork 新增了「录屏教 Claude 一项技能」;Karpathy 说自己会用长语音碎碎念来喂给模型更多上下文;Claude Code 桌面版还接上了 iOS 模拟器。信号不是又多了一个按钮,而是模型开始吃进任务步骤本身。Claude Cowork Karpathy Claude Code iOS 模拟器 桌面版确认
Gemini 3.6 Flash 和 Gemini 4 则把效率竞争往前推了一步。Google 的 Antigravity 已经接入 3.6 Flash;Artificial Analysis 的测试显示,它相对前代把单任务耗时砍到大约一半,成本也更低,但智能分数基本持平。与此同时,Logan Kilpatrick 说 Gemini 4 已经启动了迄今最大规模的预训练。Google 这次先抢的是速度、成本和下一轮训练窗口。Antigravity Artificial Analysis Logan Kilpatrick
模型竞争也在往具体任务上落。Alexandr Wang 说 Muse Spark 1.1 已经是 video to code 的 SOTA;Arav Srinivas 转发了「Kimi 比 Claude 更会直接把事做完」的反馈。今天这组讨论的重点,不是榜单名字,而是模型能不能把某个工作链路真的做完。Muse Spark 1.1 Kimi 反馈转发
开发工具入口也还在继续卷。Codex 和 ChatGPT Work 用户看到了新的使用额度重置,Cursor 也被转发说提升了个人和团队限额;再加上 Claude Code 的桌面和模拟器能力,开发者真正关心的是,模型能不能长期待在工作台里,而不是每次都重新开一个聊天框。Codex 额度重置 Cursor 限额更新
今天片尾我会盯五个账号:@sama 看安全事故的公开说明,@claudeai 看技能化工作流如何落地,@OfficialLoganK 看 Gemini 4 的官方节奏,@dotey 看中文视角怎么串起安全和效率,@alexandr_wang 看 video to code 的任务竞争。今天的关键词就两个:更会做事,也更需要边界。

関連コンテンツ

  • ログインするとコメントできます。
More from this channel