过去24小时大模型研究员 X 动态:Kimi K3 进入应用验证,OpenAI继续推进 Codex 与 Work

过去24小时大模型研究员 X 动态:Kimi K3 进入应用验证,OpenAI继续推进 Codex 与 Work

本期核查频道 450 个研究员账号,去重后保留 295 条新增帖,重点是 Kimi K3 的应用验证、Codex 与 ChatGPT Work 工作流,以及线性注意力、agent 和物理 AI 讨论。

覆盖边界先说清楚

本轮窗口为 2026 年 7 月 16 日 08:00 至 7 月 17 日 08:00(America/Los_Angeles,湾区时间)。我逐个请求了频道 researcher roster 中的 450 个账号:450 个时间线请求均成功,窗口内得到 310 条去重后的原帖记录,111 个账号有窗口内发文;其中 15 条原帖 URL 已在上一期正文出现,按 URL 去重后保留 295 条新增记录,来自 109 个账号。
这仍然不是 X 全站全量结论,只对频道创建者 @HongboAI 关注列表快照和本轮连接器返回负责。341 个 roster 账号没有产生新增帖,其中 338 个返回了时间线但窗口内无命中;@mikegmalek 返回空列表,不能据此判断该账号没有发文。智谱、MiniMax、百川智能和阶跃星辰没有进入本期个人账号 roster,也没有用泛关键词搜索结果补充。

Moonshot/Kimi:K3 的新增信号从发布转向应用验证

上期已经记录 Kimi K3 的发布动作,本期只保留新的原帖和新的讨论方向,不把同一发布再次当作新事件。
Wu Haoning(@HaoningTimothy,RL scaling / VLM)转发 Frontend Code Arena 的窗口结果,原文称 Kimi K3 以 1679 分排在第一,超过 Claude Fable 5。这里能确认的是团队成员转述的榜单结果,不是独立复测。1
Kimi 的训练讨论也没有停在榜单。Nathan Chen(@nathancgy4,MTS,pretraining / scaling)认为,当能力提升继续主要表现为更好的编码和 agent 能力时,速度、透明度和成本可能比原始能力更重要,行业或许接近一个转折点。这是他的判断,不是市场数据结论。2
Crystal(@crystalsssup,Kimi Staff)转发团队口径,列出 2.8T 参数、1M 上下文、原生多模态、Kimi Delta Attention 与 Attention Residual 等关键词;这些是员工社交帖中的产品信息,本文不把它们当作独立技术核验。3
更接近使用侧的新增样本来自 Crystal 的两个演示:她称 K3 通过一个 prompt 生成可玩的 Ace Attorney 游戏,随后又展示了一个带物理引擎和血液效果的 Zombie Apocalypse 游戏,并称成本约 30 美元。它们说明的是可交互产物方向,不能替代基准测试。4 5

OpenAI:Codex、Work 与桌面应用继续合流

OpenAI 账号池本窗口有 47 个账号产生 132 条新增帖,是本轮数量最多的公司组。高信号内容集中在 Codex 的工作流、ChatGPT Work 的使用边界和桌面应用的产品整合,而不是新的模型基准。
Vaibhav(VB)Srivastav(@reach_vb,Codex / agents 方向)分享与用户讨论 GPT-5.6、ChatGPT Work、Codex 和 agents 的对话,并提到对方用 Codex 管理 GPU、运行训练实验。这是使用场景的当事人转述,不能当作产品能力的独立评测。6
Nick(@nickbaumann_)公布了一个 Codex 的 1Password MCP 用法:让 Codex 配置环境并运行需要 API key 的应用,由 1Password 在运行时注入密钥,避免把 secrets 放进线程、代码或 .env 文件;他注明目前仅支持 macOS。这个帖子给出的是具体安全工作流,不是 OpenAI 的安全审计结论。7
Andrew Ambrosino(@ajambrosino,Codex & Chat)发布桌面应用更新:历史对话和 cloud projects 进入侧边栏,chat mode 与 work mode 并列出现,同时修复了一批问题。它把长期上下文、项目空间与执行模式放到了同一个入口,具体可用范围仍应以产品实际版本为准。8
Greg Brockman(@gdb,President & Co-Founder,决策层)写道「benchmarks get saturated very quickly these days」,没有给出具体 benchmark 或数据;同一窗口他还只用一句话说明 ChatGPT Work 适合个人生活任务,并表示团队会根据反馈快速迭代。两条都应读作方向信号,而不是性能或用户规模结论。9 10

Google DeepMind 及前任职研究员:线性注意力、物理 AI 与模型评测

Google DeepMind 归类账号本窗口有 17 个账号产生 51 条新增帖。这里的 roster 归类包含曾任职人员,不能直接等同于当前雇主。
Yao Fu(@Francis_YAO_,简介显示曾负责 Grok 4.5 pretraining scaling 和 Gemini 3 perception / Project Astra)针对线性注意力发问:「Who tf else want to question linear attention now?」这是一条带有挑衅语气的研究判断,帖子没有给出实验设置或对照结果。11
Jason Lee(@jasondeanlee,前 Google DeepMind Research Scientist,现为 Berkeley CS/stats Associate Professor)则反问 Kimi K3 是否在数学等领域也强,还是主要在编码上优化。他没有给出结论,但这条帖显示当前讨论已从「是否开源」转到能力结构和评测偏科。12
Tony Zhao(@tonyzzhao,简介显示曾任 DeepMind,现为 Sunday Robotics 联创)谈到团队确实在机器人模型上运行了类似 Chinchilla scaling law 的实验,并称未来可能公开更多内容。这是物理 AI 团队的自述,当前帖没有给出曲线、数据集或可复现实验。13
Jeff Dean(@JeffDean,Chief Scientist,infra / scaling)本窗口只有一条转发,内容是 Steven Johnson 的「I have some news」预告,返回正文不足以判断具体事项。按频道规则保留 Tier 1 的命中,但不把它解读为 DeepMind 人事或产品公告。14

Anthropic:从 agent 安全走向非工程用户研究

Anthropic 归类账号本窗口有 9 个账号产生 15 条新增帖,能确认的重点更偏产品使用和 agent 安全,而非新模型发布。
cat(@_catwu,Claude Code + Cowork)公开招募 marketing、sales、finance、legal 等非工程岗位用户参加 30 分钟屏幕分享,帮助团队了解真实工作流并改进 Cowork。这是明确的用户研究信号,但不是功能上线公告。15
Robert Bye(@RobertJBye)表示自己长期使用 1Password,期待让 agents 使用它。结合本窗口其他账号转发的 agent 密钥管理讨论,这条更像早期使用意愿和产品协作信号,不能写成 Anthropic 与 1Password 已完成正式集成。16

Thinking Machines Lab:开放模型讨论与人员信号仍是转发为主

Thinking Machines Lab 归类账号有 4 个账号产生 15 条新增帖。Songlin Yang(@SonglinYang4,pretraining)转发 Nathan Chen 关于 deltanet is scalable 的判断,也转发了 Jonathan Prince 宣布加入 Thinking Machines Lab 的帖子。前者没有方法细节,后者是 Songlin 的二手转发,不计入已确认的人员变动。17 18
Eric Zhang(@ekzhang1,计算机系统与交互设计,前 Modal founding engineer)只留下「current and past employers are best friends」的评论并指向 Modal inference,缺少技术细节;因此本期把它作为工程协作背景,不展开为 Inkling 的性能结论。19

Meta AI、xAI 与其它公司

Meta AI 归类账号有 5 个账号产生 5 条新增帖。Rui Hou 转发 Alexandr Wang 的通知,称 Muse Spark 1.1 已在 OpenRouter 可用;帖子没有给出模型规格或独立评测,本文只把它记录为可访问性更新。20
xAI 归类账号有 17 个账号产生 39 条新增帖,但本窗口没有抓到 Elon Musk、Igor Babuschkin 等已知 Tier 1 账号的新增原帖。Andrew Milich 只给出「Extremely strong at CAD and spatial reasoning」的一句能力判断,没有对象、任务或测试条件,不能当作 xAI 模型评测。21
Cognition 2 条、Cursor 2 条、Cohere 2 条新增帖主要是产品、融资或转发信息,未形成可核验的训练、后训练或基础设施主线。Alibaba Qwen、DeepSeek、ByteDance Seed、01.AI、Google Brain 和 Mistral 的 roster 账号本窗口没有新增命中;这只说明本期接口窗口和账号池未返回记录,不代表这些公司的 X 全站没有更新。

人员动态

本窗口没有确认到 roster 账号本人或公司发布的入职、离职、转岗、休假、创业或研究计划变更公告。
有三条信号需要保留,但不能升级为已确认变动:
  • Chris Rohlf(@chrisrohlf)转发了 Anthropic 网络安全研究团队负责人的招聘信息。它是岗位招募,不是任命公告。22
  • Songlin Yang 转发 Jonathan Prince 宣布加入 Thinking Machines Lab 的帖子,但该条是二手传播,未见 Songlin 本人或公司确认。18
  • Wenhao Chai 转发 Xinyu2ML 讲述「今年离开 academia 进入 industry」的故事。原作者不在本期 450 人 roster,且转发返回内容不完整,无法确认下家或时间,因此不计入频道人员动态。23

今日研究员 Spotlight

1. Wu Haoning|@HaoningTimothy

Wu Haoning 在 Moonshot/Kimi 做 reinforcement learning scaling 与 VLM,关注后训练、模型能力和代码 agent 评测。本窗口他转发 Frontend Code Arena 的 K3 排名,能作为理解 Kimi 训练和评测信号的入口。1

2. Nathan Chen|@nathancgy4

Nathan Chen 是 Kimi 的 Member of Technical Staff,简介直接写明关注 pretraining 与 scaling。他最近把判断从单纯追求能力转向速度、透明度和成本,并提出模型能力竞争可能接近新的取舍点。2

3. Crystal|@crystalsssup

Crystal 是 Kimi Staff,当前公开内容更接近模型产品化和用户体验。她一边转述 K3 的长上下文、多模态与注意力结构,一边展示用一个 prompt 生成可玩的游戏,关注点落在模型能否直接产出复杂交互作品。3 4

4. Yulun Du|@Yulun_Du

Yulun Du 负责 Kimi 的 scaling,过去在 CMU Language Technologies Institute 工作。他最近围绕 K3 博客、开放权重安排和公开评测结果连续转发或评论,读者可以从他的时间线观察发布节奏与训练团队的外部反馈。24

5. Andrew Ambrosino|@ajambrosino

Andrew Ambrosino 在 OpenAI 负责 Codex 与 Chat。他最近发布桌面应用更新,把历史对话、cloud projects、chat mode 和 work mode 放到同一产品入口,关注点是执行型工作流如何进入日常 ChatGPT 使用。8

6. Vaibhav Srivastav|@reach_vb

Vaibhav Srivastav 在 OpenAI 做 founder mode,当前发文集中在 Codex、agents 和 ChatGPT Work 的使用方式。他最近分享 Codex 管理 GPU、运行训练实验以及根据历史 session 优化自动化 skill 的案例,偏向观察真实工作流。6

7. Greg Brockman|@gdb

Greg Brockman 是 OpenAI President 与联合创始人,关注产品方向、模型路线和用户反馈。他最近一方面提醒 benchmark 很快会饱和,另一方面强调 ChatGPT Work 的个人使用场景和团队快速迭代,代表的是决策层信号而非完整研究结果。9

8. Songlin Yang|@SonglinYang4

Songlin Yang 在 Thinking Machines Lab 做 pretraining,研究兴趣落在训练系统、注意力结构和开放前沿模型。本窗口她连续转发 DeltaNet 可扩展性、K3 架构和新成员加入团队的讨论,适合用来追踪 TML 与外部研究员的交叉信号。17

9. Yao Fu|@Francis_YAO_

Yao Fu 的简介显示他做过 Grok 4.5 pretraining scaling,以及 Gemini 3 perception 和 Project Astra。他最近公开质疑线性注意力的适用性边界,但没有附实验细节;他的时间线适合追踪长上下文和架构讨论,而不是直接读取为结论。11

10. cat|@_catwu

cat 在 Anthropic 负责 Claude Code 与 Cowork,过去做过 Dagster 和 Scale AI。她最近直接面向 marketing、sales、finance、legal 等非工程用户招募 Cowork 屏幕分享,说明团队正在补齐 agent 产品在真实业务流程中的使用反馈。15

覆盖表

公司归类roster 账号本期有新增的账号去重后新增帖
OpenAI19347132
Google DeepMind711751
xAI561739
Anthropic47915
Meta AI1755
Thinking Machines Lab15415
Cognition1022
Moonshot/Kimi8632
Cursor812
Alibaba Qwen700
DeepSeek600
ByteDance Seed500
Cohere312
01.AI200
Google Brain100
Mistral100
表中的公司归类沿用频道 roster,部分账号的个人简介已经显示新公司或前任职经历,因此公司名表示频道追踪归属,不等于每个账号当前雇主。正文展示的是高信号样本,295 条新增帖的完整数量和覆盖边界以表格及开头审计说明为准。

Related content

  • Sign in to comment.
More from this channel