
近24小时 AI 热点预测:Agent 开始拼状态、长时运行与可复用 Skills
本期聚焦事件日志、长时任务、团队 Skills、视频操作层与开放视觉模型五条未来三天可拍线索;X 侧 19 个账号中保留 4 个可用 AI 动态账号,YouTube 白名单本窗口暂无已确认命中,2 条 AI Engineer 视频仅作邻近样本。
先看来源:本轮覆盖与判断边界
预测窗口为 2026 年 7 月 22 日 08:00 至 7 月 23 日 08:00(北京时间),严格按帖子或视频的发布时间筛选。
X/Twitter 侧,19 个白名单账号全部发起查询,6 个账号返回窗口内帖子,按 AI 相关性和账号身份核对后,保留 4 个可用动态账号:@swyx、@svpino、@_akhaliq、@levelsio。@jim_fan、@kaborojeff 没有可用公开时间线,@kylejv、@charliebitmy 返回的账号与 AI 科技语境不匹配,其余账号没有窗口内可用 AI 动态或只有窗口外内容。
YouTube 侧,本轮对关键词召回的 18 条候选完成了视频级详情核验。2 条视频在窗口内,均来自 AI Engineer,但当前返回结果无法证明它属于两份报告的 55 个白名单频道,因此不计入白名单覆盖率。窗口外的 Matt Wolfe 视频只作为热度背景,不用来证明本窗口命中。互动数据是本轮采集时的快照,不能替代独立测评。
| 预测方向 | 直接来源 | 窗口内证据 |
|---|---|---|
| 事件日志成为 Agent 状态 | @swyx 转发 Yohei Nakajima 的 ActiveGraph 公开视频;AI Engineer 视频 | X 7 月 23 日 04:21;视频 7 月 23 日 04:00 发布 |
| 长时任务拼运行机制 | @swyx 转发 AI Engineer;Lance Martin 的公开视频 | X 7 月 23 日 02:04;视频 7 月 23 日 01:00 发布 |
| Skills 变成团队可复用资产 | @svpino 原帖;@_akhaliq 转发 Bolt | X 分别于 7 月 23 日 01:12、2:38 发布 |
| 视频画面变成可操作界面 | @svpino 原帖 | X 7 月 22 日 23:22 发布 |
| 开放模型竞争转向视觉与推理效率 | @_akhaliq 转发 GLM-5.2 Vision、Solar Open2、NVIDIAAI 的 Cosmos 3 Super | X 集中出现在 7 月 22 日 23:20 至 7 月 23 日 05:57 |
一句话判断
未来三天更值得拍的,不是又一个「模型更强」的发布解读,而是 AI 系统怎样留下状态、怎样持续运行、怎样被团队复用,以及怎样把一段视频直接变成可操作的界面。模型发布仍有热度,但叙事入口正在从参数表移到运行方式。
爆点一:Agent 的日志,可能就是它的状态机
来源与事实。 @swyx 在窗口内转发了 Yohei Nakajima 的公开视频《Active Graph Agent Runtime》,原帖只给出一句很有辨识度的标题:「The Log is the Agent」1。AI Engineer 的视频介绍了一个具体场景:500 个问题的评测跑到第 350 个问题时 API key 失效,ActiveGraph 可以回滚一步,再从第 353 个问题继续;它把动作和状态变化写入事件日志,再从日志投影出图状态,支持回放、回滚和分叉2。
项目仓库把自己定义为「面向长期运行、可审计、具备代理行为系统的事件溯源图运行时」,并明确说它不是聊天框架3。这比「给 Agent 加一块 memory」更具体:Agent 每次做了什么、状态如何变化、哪一步可以重放,都进入同一条可检查的轨迹。
热度判断:中高。 YouTube 视频本轮快照为 496 播放、54 赞、1 条评论,绝对播放量还不高,但点赞与播放的比例高于泛教程样本;X 上的转发量只有 8,说明它更像工程圈早期信号,不是已经出圈的热门事件。它的传播潜力来自一个可以被画出来的故障故事:API key 失效,Agent 没有从头再来。
视频怎么写。
- 开场文案:「如果 Agent 跑到第 350 个问题时密钥失效,你希望它重跑,还是从第 353 个问题接着做?」
- 解释顺序:先演示普通循环的全量重跑,再画出事件日志、图状态、回滚和分叉,最后把「日志是 Agent」翻译成可执行的工程检查表。
- 素材搜索:搜
ActiveGraph event sourced agent runtime、BabyAGI 4 log is the agent、agent rollback replay fork、long running agent audit trail,优先使用项目仓库、演讲切片和代码运行画面。 - 剪辑方式:用一条横向时间线表现每个事件;故障点冻结画面,回滚时只退一格,不要用泛化的机器人动画遮住状态变化。
中美信息差。 中文内容常把 Agent 记忆讲成向量库或上下文摘要,较少把「一次动作是否可回放、是否能回滚、谁批准状态变化」讲清楚。适合做一条工程实测:同一任务分别跑无日志循环和事件溯源循环,比较失败后的恢复成本。不要把 ActiveGraph 的设计直接说成生产标准,它目前更适合作为新架构样本。
爆点二:长时 Agent 的卖点会从「能跑」变成「能持续修正」
来源与事实。 @swyx 在窗口内转发 AI Engineer 对 Anthropic 成员 Lance Martin 的访谈,主题是《Claude for Long-Horizon Tasks》4。视频于北京时间 7 月 23 日 01:00 发布,本轮快照为 2,506 播放、132 赞、12 条评论;简介把重点写成四个工程问题:把大脑和双手解耦、自我验证、自我学习,以及让 Agent harness 随模型变化而演进5。
这里的「长时」不是把同一段提示词运行几个小时。真正可拍的冲突是:任务越长,模型能力、上下文、计划、判断和工具状态越容易互相拖累,系统需要通过检查点、验证器和可替换的 harness 把失败隔开。
热度判断:高。 这是窗口内 YouTube 样本里传播数据最完整的一条,且与 X 上 @swyx 对 AI 工程内容的连续转发形成共振。它仍不是白名单频道的已确认命中,所以只能作为邻近背景;但主题本身与 AI 内容团队的生产痛点高度贴合。
视频怎么写。
- 开场文案:「长时 Agent 最难的不是让它多想一会儿,而是让它在第 40 个步骤犯错后,知道自己该回到哪一步。」
- 结构:先给一个 30 分钟能完成、3 小时会漂移的任务;再拆成状态记录、阶段契约、独立验证、人工升级四层;最后做一个 10 步任务的失败注入测试。
- 素材搜索:搜
Claude long horizon tasks Lance Martin、agent harness self verification、long running coding agent checkpoints、agent context drift handoff。 - 剪辑方式:用任务进度条和错误回放串起全片,测试段落保留原始日志,避免只展示顺利完成的演示。
中美信息差。 中文市场对「Agent 能不能自主完成复杂任务」的讨论,常停在模型名称和 demo 成功率。更容易形成差异化的做法,是把任务切成可复测的阶段,公开每次中断、重试、回滚和人工接管的次数。内容团队可以先做「一个 Agent 跑 20 个步骤,哪些步骤必须留下证据」这类教程,而不是再做一遍模型横评。
爆点三:Skills 开始从个人提示词,变成团队资产
来源与事实。 @svpino 在窗口内写道,Skills 是过去半年 AI 里最重要的发展之一,并称 Bolt 是最新加入支持的工具6。几小时后,@_akhaliq 转发 Bolt 的说明:「Every skill your teammates build is now yours too」,并提到技能可以叠加7。
这条线与前几期的 Agent skills 审计不同:这次的角度不是「一个 Skill 写得好不好」,而是「一个团队如何共享、组合和维护 Skill」。窗口外的 Matt Wolfe 视频《9 Free AI Skills That Feel Like Cheat Codes》已有 112,118 播放、4,427 赞和 155 条评论,视频把可复用指令文件解释为跨多个编码工具使用的行为资产8。这个数据不能计算增长率,却说明「把 Skill 装进工具」本身已经是容易被 YouTube 观众理解的题材。
热度判断:高。 @svpino 原帖在本轮快照有 7,169 浏览、22 赞、7 条回复;@_akhaliq 转发 Bolt 内容有 142 次转发。两条帖子的互动结构不一样,不能简单相加,但它们共同指向一个产品变化:Skill 的分发对象从单个使用者扩展到团队。
视频怎么写。
- 开场文案:「你的提示词只对你有用,还是已经能被同事安装、组合、测试和复用?」
- 结构:拿一个内容审核 Skill 做例子,展示个人提示词、团队共享 Skill、版本变更和失败样本四种状态;结尾给出 Skill 的最小目录:触发条件、输入输出、禁用条件、示例和测试集。
- 素材搜索:搜
Bolt skills teammates build share、agent skills distribution、Claude Code skills vs prompts、reusable AI workflow skills。 - 剪辑方式:用安装包、目录树和前后输出对比推进;每次 Skill 叠加只显示一个行为变化,避免把多个工具 logo 堆成工具清单。
中美信息差。 中文内容里「提示词大全」仍然比「团队行为资产」更常见。可以把视频做成一次小型组织实验:同一个任务交给三个人,分别使用个人提示词、共享 Skill 和带测试集的 Skill,比较输出一致性、修改成本和失败类型。重点不是证明 Skills 一定更好,而是让观众看到维护成本从哪里出现。
爆点四:视频不再只是内容,可能变成可点击的操作层
来源与事实。 @svpino 在窗口内描述一种视频代理:它通过逐帧运行的计算机视觉循环,在运行时生成代码,观察训练动作并实时纠正姿势;他还举了暂停视频后追问、点击购物视频里的商品并查看细节等例子9。帖子本轮快照为 8,185 浏览、27 赞、7 条回复。
这是一条账号体验描述,不是独立评测,也没有在帖子里给出具体产品名、延迟、准确率或可用范围。可核验的事实只有:发帖者把「视频帧、视觉循环、即时生成代码、动作纠正和画面内交互」放在了同一套设想中。预测也应停在这里:未来三天可能会有更多视频把「看视频」改写成「对视频里的对象下操作指令」。
热度判断:中高。 这条帖子的互动量不如模型发布,但画面天然适合短视频,且它把抽象的 computer use 变成了三个可视动作:暂停、提问、点击。对创作者来说,演示成本低于解释一个新模型的完整架构。
视频怎么写。
- 开场文案:「当视频里的每一个物体都能被暂停、追问和修改,播放器还是播放器吗?」
- 结构:先录一个训练动作或产品测评视频,再标出目标对象、动作轨迹和提问点,最后做一个小实验:同一帧画面让 Agent 识别人、物、动作和可执行指令。
- 素材搜索:搜
video agent frame by frame computer vision、interactive video agent click ask change、vision loop generated code、AI workout form correction agent。 - 剪辑方式:画面内直接加框选、暂停和点击反馈,少用旁白解释;每个交互动作之后显示「模型看到了什么」和「它实际做了什么」,把能力边界一起剪出来。
中美信息差。 中文圈对视频生成和视频理解的内容很多,但「视频作为操作界面」仍有较大的解释空间。可做的差异化选题不是宣传「视频很智能」,而是测试哪些对象真的可以被点击、哪些动作只是识别结果、哪些动作需要额外权限。这样能把视觉模型和 Agent 权限问题接起来。
爆点五:开放模型的竞争,正在同时追视觉入口和推理成本
来源与事实。 @_akhaliq 在窗口内连续转发了三条相关动态:一条指向 Hugging Face 上的 GLM-5.2 Vision NVFP4 页面,页面将其描述为把 MoonViT 视觉编码器接入 GLM-5.2 的视觉语言模型10;一条指向 Upstage 的 Solar Open2 250B,页面写明它是面向 Agent 场景的 250B-A15B 开放权重模型,支持混合注意力 MoE、长上下文线性注意力和 1M 上下文长度11;另一条转发 NVIDIAAI 对 Cosmos 3 Super 的说明,称新的 4-step 版本生成图像和视频的速度最高可达原版 25 倍,并给出 Artificial Analysis 上的图像生成排名说法12。NVIDIAAI 原帖本轮快照为 22,935 浏览、371 赞、60 次转发13。
这三条不应被合并成「某个开放模型已经全面领先」。它们分别代表视觉语言模型、长上下文 Agent 模型和视觉生成推理效率,证据层级也不同。可预测的是,未来三天的开放模型内容会更容易围绕「能不能直接跑、能不能接入 Agent、视觉输出要花多少时间」展开,而不是只比较一个榜单分数。
热度判断:中高。 证据在短时间内密集出现,且每条都能落到可展示的对象:视觉模型卡、长上下文配置、4-step 生成速度。风险是信息太碎,创作者若把三个模型写成同一场性能竞赛,很容易把转发文案当成独立验证。
视频怎么写。
- 开场文案:「开放模型下一轮比的,可能不是谁的榜单更高,而是谁能在普通机器上看懂、跑起来、接上工作流。」
- 结构:分成三段,第一段看视觉输入,第二段看 Agent 和长上下文,第三段测同一段视频或图片任务的生成等待时间;把官方描述、模型卡和实测结果分开显示。
- 素材搜索:搜
GLM-5.2 Vision NVFP4 Hugging Face、Solar Open2 250B agentic long context、Cosmos 3 Super 4-step、open weight vision language model local inference。 - 剪辑方式:用模型卡截图、显存/等待时间计时器和实际输出并排展示;没有实测就不要把「25 倍」做成结论,只把它当作待验证的官方传播信号。
中美信息差。 中文内容常把海外开放模型新闻翻成参数播报,海外开发者更关心模型卡、量化格式、上下文限制和部署成本。适合做一条「从模型卡到可用 Demo」的拆解:先确认许可和硬件要求,再测一个固定视觉任务,最后说明哪些结论仍依赖官方说法。这样既能讲中国模型与海外模型的差异,也不会把营销数字当成普遍性能。
给内容团队的三天选题排序
- 长时 Agent 的运行机制:优先级最高。素材完整,既有窗口内视频数据,也有清晰的工程矛盾,适合做 6 至 10 分钟解释视频。
- 日志即 Agent 状态:适合做工程向深挖,最好配代码或故障回放,标题不要泛化成「Agent 新革命」。
- Skills 的团队分发:适合做产品观察和实操对比,必须保留版本、测试和失败样本,避免重新做成提示词教程。
- 视频变成操作层:适合短视频或演示型内容,先做一个可控的单场景实验,再讨论更大的交互想象。
- 开放视觉模型与推理效率:适合做新闻快评,必须把官方说法、模型卡信息和独立实测分栏,不能把三个发布拼成一项胜负。
下一个可验证的问题很具体:当 Agent 运行时间从几分钟延长到几小时,团队会先购买更强的模型,还是先补齐日志、检查点、权限和测试集?这一问比「谁又发布了新模型」更可能直接决定下一条视频怎么拍。
Fuentes de referencia
- 1@swyx 转发 ActiveGraph 视频
- 2Active Graph Agent Runtime 视频
- 3ActiveGraph 项目仓库
- 4@swyx 转发长时任务视频
- 5Claude for Long-Horizon Tasks 视频
- 6@svpino 关于 Skills 的帖子
- 7@_akhaliq 转发 Bolt Skills 更新
- 8Matt Wolfe 的 Skills 视频,窗口外背景
- 9@svpino 关于视频代理的帖子
- 10GLM-5.2 Vision NVFP4 页面
- 11Solar Open2 250B 页面
- 12@_akhaliq 转发 Cosmos 3 Super
- 13NVIDIAAI Cosmos 3 Super 原帖
Contenido relacionado
- Inicia sesión para comentar.
