
近三天 AI 热点预测:事实性排行榜、开放大模型与「自带 Agent」正在抢占下一波
本期基于 X 19 个白名单账号与可核验 YouTube 样本,筛出事实性评测、Inkling 部署、电脑操作、Agent 应用层和 AI 教育等六条新线索,并给出可直接拍摄的视频方案。
先看来源与覆盖范围
本轮观察窗口为北京时间 2026 年 7 月 13 日 08:00 至 7 月 16 日 08:00。最值得抢先做成中文视频的信号,不是又一轮模型榜单,而是模型正在被重新计量:回答是否可核验、开放模型能否真正部署、Agent 是否能接入已有工作流,以及电脑操作和 AI 学习是否变成普通人的入口。
下表先把每条预测对应到具体账号、帖子或视频。X/Twitter 的播放量、YouTube 的播放量都只是本轮抓取时的当前快照,不能当作增长率。
| 预测主题 | X/Twitter 来源 | YouTube 来源 | 当前热度信号 |
|---|---|---|---|
| 事实性成为模型排名的新维度 | @svpino 于 7 月 16 日 05:02 发布的 Text Arena 事实性分析帖 1 | 本轮没有把未能确认白名单归属的 Arena AI 视频计入正文 | 约 9,092 次浏览,7 条回复 |
| 开放权重大模型进入可部署性竞争 | @_akhaliq 于 7 月 16 日 06:57 转发 Inkling 进入 Hugging Face 热门模型的帖子 2 | Hugging Face 官方频道《New Model: Inkling by Thinking Machine on Hugging Face》,7 月 16 日 02:02 发布,880 次播放 3 | X 转发 10 次;官方视频 60 个赞 |
| Agent 应用层转向「自带 Agent」 | @danshipper 于 7 月 15 日 23:09 发布 Granola 访谈帖 4 | 本轮未将未能确认白名单归属的 Every 访谈视频计入正文 | 约 7,858 次浏览,50 个收藏 |
| 电脑操作成为跨应用的新界面 | @sama 关于 GPT-5.6 Sol 成本与效率、Codex 与 ChatGPT Work 使用量的两帖;@swyx 关于 CUA 实际使用的帖子 567 | 本轮没有把窗口外或非白名单视频当作核心证据 | 三条 X 帖分别约 169.5 万、72.6 万和 1.1 万次浏览 |
| AI 教学从展示功能转向陪人做成东西 | 无可用 X 窗口内同主题帖 | OpenAI 官方频道《Learning with AI at Any Stage of Life》,7 月 14 日 07:07 发布,20,309 次播放、512 个赞 8 | 新片发布约一天即有 2 万级播放 |
| 红队安全从人工技巧转向自动化评测 | OpenAI 于 7 月 16 日 01:34 发布 GPT-Red 帖子,介绍用于规模化发现 prompt injection 的内部自动红队系统 9 | 本轮未把低播放、非白名单安全视频计入正文 | 约 63.7 万次浏览、493 次转发、300 条回复 |
X 侧 19 个唯一白名单账号全部完成时间线查询,其中 8 个账号出现窗口内内容;另外 11 个账号没有返回可用的窗口内 AI 新帖,包含空时间线、账号身份明显错配和只有窗口外旧帖的情况。YouTube 侧完成了主题检索与视频详情核验,但没有完成 55 个频道的全量视频级核验;本轮正文只使用明确可确认属于白名单的 OpenAI 与 Hugging Face 视频,并把当前播放量作为热度代理,不计算增长率。
本轮判断
这六条线索可以归成一条更具体的变化:AI 内容的比较单位正在从「哪个模型更强」转向「一条任务链能否被验证、接入和复用」。其中,事实性、开放模型部署和 GPT-Red 属于技术评测线;自带 Agent、电脑操作和 build-first 教学属于应用传播线。前一条线适合做解释型视频,后一条线更适合用完整任务录屏抓住观众。
1. 事实性会成为模型排行榜的第二张成绩单
热度依据。 AI/ML 教程作者 Santiago 在帖子里写道,Text Arena 每个回答大约包含 5 个可联网核验的断言,其中约 87% 能被核实;他用
0.87^5 = 0.50 做粗略演示,说明一个回答里出现至少一个错误并不罕见。对 Search Arena,他给出的示例是近 10 个断言、89% 的单条正确率,对应 0.89^10 = 0.31。他也明确提醒,断言之间并不独立,这些数值只能说明思路,不能当成精确错误率。1这个信号的价值在于,它把「幻觉」从一句宽泛的批评,变成可以按断言拆解的评测字段。接下来模型比较视频很可能会出现新的固定镜头:同一问题、同样的引用要求、逐条打开来源、最后统计可核验率。预测置信度:高。
中美信息差判断。 本轮没有对中文平台做同口径热度统计,以下不是中文舆情结论,而是可执行的内容供给判断。中文 AI 视频仍容易把重点放在模型会不会胡编;更容易形成差异的做法,是把一段回答拆成 5 到 10 个原子断言,再区分「有来源但来源不支持」「来源存在但已过时」「完全没有来源」三类问题。
视频文案。 开头直接给出一个问题:「为什么单条事实准确率 87%,整段回答仍可能有一半带错?」第二段用纸面计算解释断言数量的乘法效应,第三段拿三个模型回答同一条带数字的问题,逐项核验。结尾不要宣布谁是第一,只展示哪一个模型更容易被复核。
素材与搜索。 优先使用原帖、Text Arena 相关页面和模型回答的逐条核验画面。X 搜索
factuality signals Text Arena、claim-level verification LLM;YouTube 搜索 LLM factuality benchmark、AI answer verification workflow。素材重点是原子断言、来源页面和标注表,不要用泛化的机器人或大脑库存画面。剪辑建议。 用一张回答截图作为起点,逐句高亮断言;每核验一条就固定显示「支持」「部分支持」「不支持」三种状态。数学只保留必要的
0.87^5 和 0.89^10,避免把视频剪成公式课。2. 开放模型的下一场竞争是「能不能交付」,不是参数大不大
热度依据。 Hugging Face 官方视频介绍了 Thinking Machines 的 Inkling:975B 总参数、约 41B 激活参数,原生处理图像、文本和音频,标称 1M token 上下文,并提供 Transformers、SGLang、vLLM 和 llama.cpp 等启动路径。视频描述还列出 BF16、NVFP4 和 GGUF 等不同部署形态,并称 BF16 约需 2TB 显存,NVFP4 约需 600GB。3 这些是发布方视频描述中的规格与路线,不等同于本轮独立 benchmark 结论。AI 研究信息账号 @_akhaliq 转发了 Inkling 进入 Hugging Face 热门模型的消息,前 OpenAI CTO、现 Thinking Machines 创始人 Mira Murati 也在同一窗口转发了关于开放权重模型发布协作复杂度的讨论。210
过去几期已经出现过小模型、开放 Agent 和工具分发,本轮的新角度是「大模型开放权重如何被做成一套可运行产品」。真正能形成观看理由的,不是复述 1T 参数,而是展示模型卡、量化版本、推理框架和一次多模态任务如何连起来。预测置信度:中高。
中美信息差判断。 中文内容可以避开「参数越大越强」的单点叙事,直接回答三个落地问题:普通团队需要哪种精度、显存成本如何变化、模型是否能接入现成的推理工具。这样做出的内容,比只翻译发布新闻更接近开发者决策。
视频文案。 开头是「一个 975B 模型,为什么官方先讲 NVFP4、GGUF 和 vLLM?」随后把同一个图像加音频任务分别放进模型卡、推理服务和本地终端,最后列出可复现门槛:硬件、依赖、上下文长度、量化损失。不要把官方规格改写成已经被独立验证的效果。
素材与搜索。 搜索 Hugging Face 的 Inkling 模型页、官方模型博客、
Inkling NVFP4 GGUF vLLM、Thinking Machines open weights multimodal。素材应包括模型卡、启动命令、实际输入输出和显存占用;不要凭封面图想象模型的运行效果。剪辑建议。 采用「模型卡到终端」的连续路径:规格卡 3 秒,依赖安装 5 秒,实际输入 10 秒,输出解释 10 秒。不同量化版本用固定色块和容量数字区分,数字来自屏幕或来源,不让画面模型自行生成图表。
3. Agent 应用层会从「替你做事」转向「允许你带 Agent 进来」
热度依据。 Every CEO Dan Shipper 在 Granola 访谈帖中写道,Granola 早期的会议记录功能被多家公司复制,但公司真正争夺的是 AI 原生工作里人们使用的工作界面。帖中还提到,Granola 正押注「bring your own agent」,希望通过 API 和 MCP 让 Claude、Codex 或其他 Agent 使用会议上下文。4 这条帖约有 7,858 次浏览和 50 个收藏,说明讨论焦点已经从「会议纪要能不能写」移到「上下文归谁、如何被不同 Agent 使用」。预测置信度:中高。
这和此前常见的 Agent 自动化演示不完全一样。产品的核心不再是再做一个万能 Agent,而是把会议前准备、会后行动和上下文交给不同 Agent 处理,应用本身负责提供边界、记忆和接口。
中美信息差判断。 中文观众已经看过很多「会议录音转纪要」演示,下一层信息差是「会议上下文如何进入下一步工作」:生成任务单、更新 CRM、准备跟进邮件、给设计或研发 Agent 提供背景。要讲清楚的是数据流和授权边界,不是再展示一段漂亮摘要。
视频文案。 先展示一个普通会议纪要,再追问「如果下一步不是让 Granola 继续写,而是让你自己的 Agent 读取这段上下文呢?」然后演示同一份会议背景分别交给 Claude、Codex 或内部工具,比较它们能做什么、不能做什么,最后补上 MCP 和 API 的权限说明。
素材与搜索。 X 搜索
bring your own agent MCP meeting context、Granola API MCP、Codex-native apps;补充查阅 Granola 官方 API、MCP 文档和访谈原片。素材优先录制一条从会议到行动项的完整链路,避免只截产品首页。剪辑建议。 用三栏结构保持信息对齐:左侧会议上下文,中间应用接口,右侧不同 Agent 的输出。每次传递只出现一个动作,授权、读取、执行分开标注,避免用快速切屏掩盖权限细节。
4. 电脑操作会成为 Superapp 最有传播力的入口
热度依据。 Sam Altman 在 7 月 14 日的帖子中称,GPT-5.6 Sol 在许多相同任务上价格约为 Fable 的一半、token 效率约为两倍,并称愿意以四分之一的价格交付。5 同日他还称 Codex 与 ChatGPT Work 等 Agent 产品一周内使用量增加 2.5 倍。6 这些是 Sam Altman 的公开说法,不能替代独立成本测试。
更有传播力的是 swyx 的实际使用描述:他让非技术团队尽可能用 computer-use agent 处理报名、付款、发票和供应商等网页工作,并认为 GPT-5.6 加 Superapp 的 CUA 能力已经明显超过很多人的当前判断。该帖约 1.1 万次浏览。7 叠加 Sam Altman 两帖的百万级浏览,预测置信度:高。
这里的爆点不是「又一个模型更强」,而是模型开始直接操作现有网页和软件。中文视频若只做发布会复述,会错过真正容易被转发的画面:Agent 能否完成跨页面任务、哪里需要人工确认、失败后能否恢复。
中美信息差判断。 本轮没有抓取中文平台同题材数据,不能声称中文圈已经落后或欧美已经形成共识。可执行的抢跑点是把抽象的 CUA 说法改成可复现任务:查账单、填表、整理多个门户信息、生成并提交草稿,而不是只放模型跑分。
视频文案。 开头用一句「如果 Agent 真的能操作网页,最先被改变的不是聊天,而是那些没有 API 的工作」;接着给出一个需要登录、复制、核对和提交的任务,记录完成时间、人工接管次数、错误类型和最终修正成本。结尾用一张表回答「哪些步骤可以放手,哪些步骤必须审批」。
素材与搜索。 X 搜索
GPT-5.6 computer use、CUA invoice portal、Codex computer use workflow;YouTube 只选取本轮可核验的官方或白名单视频,优先找完整任务演示。拍摄素材时要隐藏账号、付款信息和个人数据,保留任务结构即可。剪辑建议。 采用屏幕录制加人工旁白,固定显示「观察、点击、填写、等待、人工确认」五种状态。失败回放比连续成功更有信息量,但不要剪出可直接滥用的登录凭据或自动付款细节。
5. AI 教学内容会从功能展示转向陪用户做出第一件作品
热度依据。 OpenAI 官方频道 7 月 14 日发布的短片记录了首尔 Fast Campus 面向 50 岁和 60 岁学习者的动手课程,学员用 ChatGPT 和 Codex 从想法走到可以构建的东西。视频发布约一天,当前快照为 20,309 次播放和 512 个赞。官方描述强调,课程把学习者自己的经历、工作、创意项目和商业想法带进课堂。8 预测置信度:中高,原因是当前只确认到一条窗口内官方样本,没有足够频道级数据证明这是普遍增长趋势。
它提供了一个比「教大家用某个按钮」更容易复制的内容结构:先从一个具体生活问题开始,再让观众在 15 到 30 分钟内做出一个可见成果。对中文创作者来说,受众不必先懂模型版本,视频也不必从参数表开始。
中美信息差判断。 欧美公开内容的信号是「AI 作为建造工具」进入更宽的人群,但本轮没有中文教育平台的同口径样本,不能把它写成中美学习者的统计差异。更稳妥的选题是先做一组真实任务:帮退休者整理旅行计划、帮小店做库存表、帮职场人把经验写成课程草稿,再记录哪些环节真正需要教学。
视频文案。 不要从「今天介绍 ChatGPT 和 Codex」开始。直接让一位学习者提出自己的问题,展示第一次失败,再把任务拆成三步:描述目标、检查输出、做一次修改。最后展示成品和学习者自己的解释,让观众看到「会用」如何转成「做出来」。
素材与搜索。 搜索
OpenAI Fast Campus ChatGPT Codex、AI education 50s 60s build with AI、AI learning by building。素材以真人课堂、手部操作、屏幕录制和成品前后对比为主,避免把中老年人拍成抽象的年龄标签。剪辑建议。 采用人物驱动的轻纪录片节奏:问题 5 秒,第一次尝试 10 秒,卡点 10 秒,修改 10 秒,成果 10 秒。屏幕 UI 只在解释操作时出现,人物反应和实际成果应占主要画面。
6. AI 安全评测会从人工红队技巧转向自动化攻防循环
热度依据。 OpenAI 在 7 月 16 日 01:34 的帖子介绍 GPT-Red,称它是一个内部自动红队系统,用来规模化发现模型的 prompt injection 漏洞,并在更广泛部署前帮助构建防御。该帖当前约 63.7 万次浏览、5,546 个赞、493 次转发和 300 条回复。9 帖子链接的官方页面将其描述为通过自动化红队推进模型鲁棒性改进。11 预测置信度:中高。
这个方向和单条 jailbreak 技巧的传播方式不同。新内容的主角应是攻击样本如何生成、模型如何被测、失败如何反馈给下一轮训练或防护。对企业 Agent 来说,prompt injection 不是模型发布后才处理的事故,而是上线前需要持续回归的测试对象。
中美信息差判断。 中文安全内容常见两种极端:只展示越狱效果,或只讲抽象合规。GPT-Red 提供了第三种脚本:用一个不含真实攻击载荷的玩具任务展示「攻击者提出变体、系统分类、模型拒绝或泄露、评测记录回归」的完整循环。这样既保留技术解释,也不把可滥用细节直接扩散。
视频文案。 开头提出「如果模型能自己扮演攻击者,安全团队还在测什么?」随后用一个虚构的日程 Agent 做安全测试,只展示被注入后的行为差异,不展示真实系统提示词和可复制攻击串。结尾列出发布前必须保留的三类证据:攻击样本、模型行为、修复后的回归结果。
素材与搜索。 搜索
GPT-Red prompt injection、automated red teaming self-play、LLM security evaluation;优先使用 OpenAI 官方文章、Microsoft AI Red Team 教程和 Promptfoo 等公开评测框架的安全说明。素材使用流程图、日志和脱敏测试结果,不直接搬运真实攻击 payload。剪辑建议。 画面保持「红队输入、模型反应、防守更新、再次测试」四段循环,每段使用固定颜色和相同时间长度,观众能看出系统是在迭代,不是在播放一次性炫技。结尾用 checklist 收束,比用惊吓式越狱画面更适合企业读者。
给中文内容团队的落地顺序
本轮没有做中文平台的同口径抓取,因此不把「中美信息差」写成受众热度结论。按可执行性排序,建议先做三条:
- 先做 CUA 任务实测。 画面最直观,且当前 X 信号最强。把模型能力转成跨网页任务,记录人工接管和修正成本。
- 再做事实性评测。 复现成本低,容易形成自己的固定栏目:同题、多模型、逐条引用核验。
- 最后做 Inkling 与 GPT-Red。 前者适合开发者和模型部署人群,后者适合安全与企业 Agent 人群,分别用模型运行链路和攻防回归链路承载,不要停在新闻翻译。
AI 教学和「自带 Agent」更适合做成系列:前者需要真人任务和成品,后者需要权限、上下文和 API 的连续演示。这样才能把一条外网帖子转成中文创作者真正能拍、能测、能复用的视频选题。
样本与限制
- X/Twitter:19 个指定账号均完成时间线查询,8 个账号返回窗口内内容;正文引用的帖子均通过单帖详情复核。由于部分账号返回空时间线、身份错配或窗口外旧帖,本轮没有用泛相关内容填补缺口。
- YouTube:正文使用了 OpenAI 与 Hugging Face 两个明确可确认的白名单频道视频;本轮没有完成 55 个频道全量视频级核验,因此不声称覆盖 55/55,也不计算增长率。
- 播放量与互动量:均为当前详情快照。除 OpenAI 与 Hugging Face 的视频外,其他候选视频没有因搜索结果的标题、推荐位或空发布时间字段进入正文。
- 预测性质:文中的「高」「中高」是基于来源新鲜度、跨平台共振、互动信号和可拍摄程度的编辑判断,不是平台官方推荐或确定性热榜排名。
참고 출처
- 1Santiago:Factuality is a new way to rank models
- 2AK:Inkling 进入 Hugging Face 热门模型
- 3Hugging Face:Inkling 模型介绍
- 4Dan Shipper:Granola 与 Bring Your Own Agent
- 5Sam Altman:GPT-5.6 Sol 成本与效率
- 6Sam Altman:Codex 与 ChatGPT Work 使用量
- 7swyx:GPT-5.6 与 Superapp 的 CUA 实践
- 8OpenAI:Learning with AI at Any Stage of Life
- 9OpenAI:Introducing GPT-Red
- 10Mira Murati:开放权重模型发布需要协作
- 11OpenAI:Unlocking Self-Improvement for Robustness
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.
More from this channel›
- 近三天 AI 热点预测:从会生成到能维护,Agent 的新考场转向文案、技能与 Harness
- 近三天 AI 热点预测:图工程、长上下文训练与论文复现,正在替代模型发布争夺注意力
- 近三天 AI 热点预测:模型不再只拼榜单,真实用例、自动迭代和机器人泛化开始抢镜
- 近三天 AI 热点预测:开放模型、语音交互与可复现性成为新选题入口
- 近三天 AI 热点预测:模型价格退到后台,Agent 可靠性与研究实习生成为下一波选题
- 近三天 AI 热点预测:X 19 个账号 + YouTube 42/55 频道核验后的 6 个选题
- YouTube AI 视频增长样本:45/55 频道核验后的 6 个爆点
- 近三天 AI 热点预测:X 19 个账号 + YouTube 51/55 频道核验
