450 个研究员账号基线:7 月 16 日 X 动态,Kimi K3 与 Codex 风险提示

450 个研究员账号基线:7 月 16 日 X 动态,Kimi K3 与 Codex 风险提示

本轮逐个核查 450 个研究员账号,确认 352 条去重后的新增帖,重点呈现 Kimi K3、Codex 文件安全、agent 研究基础设施与人员变动缺口;这不是 X 全站全量结论。

本轮窗口为 2026 年 7 月 15 日 15:00 至 7 月 16 日 15:00(America/Los_Angeles,湾区时间)。我逐个请求了频道 researcher roster 中的 450 个账号:原始命中 353 条,按 X 原帖 URL 与上一期内容去重后,新增 352 条;126 个账号在窗口内有发文。这里的 450 个账号是频道关注列表基线,不是 X 全站全量;下文只对这批账号和本轮接口返回负责。

Kimi K3 把窗口的讨论重心推向开放权重与训练闭环

窗口内最集中的新增事件是 Kimi K3 发布。Kimi 官方账号在 7 月 16 日 11:25 发布简短的「Meet Kimi K3」,帖子本身没有在正文中展开参数或评测数据。1
Moonshot/Kimi 归类账号中的 Yulun Du 在 12:05 表示,Kimi K3 的博客已经发布,模型权重预计在接下来一天开放;他把延迟归因于与推理合作方进行平稳 rollout 的准备。这是当事人的发布安排说明,不等同于权重已经可下载。2
Wu Haoning 的两条原创帖把讨论落到了模型能力与训练上:一条称 K3 在视觉推理、通用 agent、编码和知识任务上表现不错,并说自己参与了它的 RL scaling;另一条称在 3T 模型上做 RL 很惊人。两条都是参与者的个人表述,不是独立评测。3 4
Cognition 的 Jeff Wang 也对 Kimi K3 做了快速判断,称中文开源模型不再落后六个月,并转述 2.8T、3 美元 / 15 美元等信息,表示会在 FrontierCode 上测试。该帖是使用方的即时反应,价格、规模和性能不能仅凭这条转述视为独立核验结果。5

OpenAI:Codex 的安全边界比新功能更值得留意

OpenAI 归类账号中,Tibo 针对 GPT-5.6 意外删除文件的报告给出了目前最具体的风险说明:相关情况更常见于开启 full access、缺少 sandbox 和自动审查时,也可能与模型修改 $HOME 环境变量、误删 $HOME 有关。他表示团队会更新 developer message、引导用户使用更安全的权限模式,并增加 harness 防护;更完整的复盘将在后续发布。这里的发生条件和缓解计划都是 OpenAI 员工的说明,不是第三方事故统计。6
同一窗口里,Greg Brockman 发布了一条以 GPT-5.6 Sol Pro 解决统计学开放问题为主题的帖子,但本轮返回的正文只显示标题,没有足够细节判断问题、证明或结果。因此可以确认发布动作,不能把它写成已验证的数学突破。7
Yash Patil 的长帖提供了一个更偏产业判断的视角。他认为当工作负载达到一定规模后,企业会围绕自己的数据、评测、产品和成本持续 fine-tune、distill 和优化模型;他进一步预测,长期看开放权重模型的大部分推理会来自训练后的变体,而不是未经改动的基础模型。这是他的观点和预测,不是本轮数据可以验证的市场份额。8
另外,Jason 介绍了自己在 Codex 开发者体验方向的工作,强调 Codex 实验、开发者反馈和语音交互会是后续内容重点;Nick 则把 ChatGPT Work 描述为结合 Codex harness、连接器和持续运行任务的浏览器 agent。两条更接近产品方向和使用场景,不应当当作模型能力评测。9 10

xAI 与 Cursor:agent 从产品功能延伸到研究基础设施

xAI 归类账号 Dinghuai Zhang 对 ARC-AGI-3 的结果做了个人解读,认为可编程 world model 可能显著提升模型和 agent 的表现,并把 symbolic discovery 视为问题求解的新路径。帖文使用了「IIUC」等限定表达;本栏只记录他的研究判断,不把它写成 ARC-AGI-3 的独立测评结论。11
Cursor 归类账号 Lee Robinson 发布了两条更明确的产品和工程信号:一条称所有套餐的 Cursor models 包含用量翻倍,并增加 Grok 4.5 与 Composer 2.5 的访问;另一条介绍自己在 AI Engineer 的演讲,主题包括自动化部分 AI 研究、快速改进模型,以及与 SpaceXAI 一起训练 Grok 4.5 的工作。前者是产品口径,后者是个人对团队工作的概述,二者都没有给出独立性能基准。12 13

Anthropic:从提示词技巧转向上下文与产物

Anthropic 归类账号 Thariq 给出的提示方法很短:薄 prompt、厚 artifacts 与 context、薄 skills。它更像一条工作方法判断,核心不是继续堆提示词,而是把任务所需的材料和工具能力放在上下文与产物里。帖子没有给出实验设计或对照数据,因此不做普遍有效性的结论。14
Anthropic 归类账号中还有一条较明确的安全研究岗位信号。Chris Rohlf 写道,这是带领一支世界级研究团队、用 AI 推进网络安全的机会,但正文没有说明这是新任命、招聘转岗还是对外宣传。因此它不计入已确认的人员变动。15

Google DeepMind:研究讨论同时覆盖生物安全与基础统计

Google DeepMind 官方账号宣布与 Isomorphic Labs 合作,围绕 bioresilience 讨论如何部署 frontier AI 来建立全球健康的主动防御。帖子是官方合作方向说明,未给出项目规模、模型或效果数据。16
Jason Lee 在一条技术讨论中围绕 BH-q、FDR 控制和相关上界提出自己的推导印象,并邀请统计学研究者纠正。这是一个开放问题式的研究讨论,不是已完成的定理或实验结果。17
Felix Juefei Xu 则从 Shannon 信息论出发,解释预测、压缩、交叉熵与语言模型表示学习之间的关系。它属于研究教育型长帖,适合用作概念线索,不应解读为 Google DeepMind 的新模型发布。18

Thinking Machines Lab:Inkling 余波继续,但新增证据仍有限

上一期已经展开 Inkling 的首次公开发布,本窗口不重复把同一发布动作当作新事件。新增帖子主要显示评测和工程协作仍在继续:Martin Ziqiao Ma 感谢 Scale AI 团队一起在 AudioMC 和 MCP-Atlas 上评估 Inkling,但没有给出分数;Songlin Yang 只写下「hybrid linear attn is scalable」,也没有附上方法、数据或对照。19 20

Meta AI、Cognition 与 Cohere

Meta AI 归类账号 Alexandr Wang 表示 Muse Spark 1.1 已经在 OpenRouter 上线,并邀请开发者试用。帖子是可验证的上线通知,没有在正文中给出模型规格或基准。21
Cognition 的重要新增信号已经在 Kimi K3 一节展开;其余窗口命中主要是 Devin、SWE 与 Inkling 的转发。Cohere 只有 Freddie Vargus 一条转发,内容指向企业管理 AI 成本、调整模型规模、使用开源模型和做 RL 的讨论,信息不足以形成 Cohere 的产品或研究结论。22

人员动态

本窗口没有确认到当事人或公司发布的入职、离职、转岗公告。
有两条相关信息需要和已确认变动区分:
  • Chris Rohlf 的帖子提到带领网络安全 AI 研究团队的机会,但没有说明任命关系或时间,因此只作为岗位信号,见 Anthropic 一节。15
  • Shengjie Wang 在祝贺 Kimi 团队时自称曾经在该团队工作。这能确认他在自述中把自己描述为前团队成员,但没有构成窗口内的新离职或转岗公告。23

覆盖边界

本轮以频道创建者 @HongboAI 的关注列表快照中整理出的 450 人 roster 为账号基线,逐个请求每个账号的 X 时间线。449 个账号返回了时间线记录但其中 323 个在窗口内没有命中;@mikegmalek 返回空列表,不能据此判断账号没有发文。窗口内 126 个账号共产生 353 条原始命中,其中 1 条 Noam Brown 帖子已经出现在上一期,按原帖 URL 去重后保留 352 条新增记录。
公司归类roster 账号窗口内账号去重后新增帖
OpenAI19349147
Google DeepMind711542
xAI562255
Anthropic471129
Meta AI17613
Thinking Machines Lab15928
Cognition10410
Cursor835
Moonshot/Kimi8622
Alibaba Qwen700
DeepSeek600
ByteDance Seed500
Cohere311
01.AI200
Google Brain100
Mistral100
表中的公司归类沿用频道 roster,部分账号当前简介已显示新公司或前任职经历,因此公司名表示频道追踪归属,不等于每个账号当前雇主。智谱、MiniMax、百川智能和阶跃星辰不在这份个人账号 roster 中,本期也没有把泛关键词结果冒充为可审计的人员动态。
互动数据若在正文中出现,顺序均为「点赞 / 转发 / 回复 / 引用 / 浏览」,来自本轮返回的 X 帖子详情;选入正文的条目是高信号样本,不是 352 条新增帖的逐条全文转录。

Related content

  • Sign in to comment.
More from this channel