8月2日 AI创业晚报:记忆层、代码模型和真实用量一起更新Chapters1×0:07开场0:19模型生产用量0:55Agent记忆1:31开源代码模型2:05长时间运行Agent2:36Cindy开源进展3:13其他快讯9:28收束0:009:400:07男主播本期在X上读取了四百零一个关注账号的七千六百一十一条推文,其中三百六十五条落在时间窗内;公众号方面,五个账号的二十篇文章在本期窗口内。0:19男主播第一条是量子位整理的 Vercel AI Gateway 七月公开榜单。榜单把请求数、token 总量和消费金额分开统计:GPT 五 Nano 的七月请求数第一,DeepSeek V4 Flash 综合三项仍排第一,Claude Opus 四点八的消费金额第一,Claude Opus 五在后半月的单日预算份额上升。0:39女主播同一篇文章还列了三种模型位置:GPT 五 Nano 是高频入口,DeepSeek V4 Flash 承担更多 token 负载,Claude Opus 系列拿到更多消费金额。榜单统计的是七月一日至七月三十一日的 Vercel AI Gateway 公开数据。0:55男主播第二条是量子位介绍的 MindMemOS。华为诺亚方舟实验室把它做成面向 Agent 的可迁移、自演进记忆操作层,记忆从单个 Agent 里拆出来,用实体、属性和时间保存当前状态与变化过程。1:10女主播MindMemOS 还包括 MindSchema、Feedback 和 Dreaming:MindSchema保存记忆提取规则,Feedback处理用户纠正,Dreaming离线巩固记忆。文章列出的结果包括 LoCoMo 九十四点零三分,PersonaMem 百分之七十点六三,以及在 MemoryAgentBench 的一项测试里把问答准确率最高提高十点三个百分点。1:31男主播第三条是机器之心介绍的 VeriLoop Coder-E1。清华团队把它做成基于 Qwen 三点六二十七 B、面向仓库级代码修复和 Agent 式软件工程任务的开源代码模型。1:44女主播文章列出的四项成绩是:SWE-bench Verified 八十五点二零,SWE-bench Pro 六十二点三八,Terminal-Bench 二点零七十六点四零,DeepSWE 三十三点六三。项目把可拆卸的适配器和 Self-Harness 组合起来,后续轮次会把代码、测试和验证结果带回任务链。2:05男主播第四条是机器之心整理的 YC Startup School 访谈。Jeff Dean 在访谈里说,模型接近初级工程师的判断大体准确,模型在 Agent 化、长流程编码和复杂任务上的进步速度比他预想得快。2:20女主播这场访谈还谈到推理硬件、能量、数据搬运、上下文工程、长时间运行的 Agent 和自动化实验系统,也谈到创业公司如何避开通用模型的正面竞争。原文把这些内容都放在同一场近一小时的访谈里。2:36男主播第五条来自 Dash Huang。X 个人简介写着他是心动公司 CEO、TapTap 和 VeryCD 创始人。他发帖说,Cindy 开源第一周合并了四百八十九个 PR,完成九百一十二次提交,发版九次,新增三十八位代码贡献者。2:54女主播Dash Huang 还写到,Cindy 这一周接入了 Pi、更多模型和更多即时通信工具,并针对模型报错、断线做了重试和保活。另一个帖子里,他说 Cindy 可以连接用户自己的电脑,在 X 上直接修复 Bug、提交 PR,或者做调研和写报告。3:13男主播量子位按核心资产把国内十七家基础模型机构分成四类:模型原生前沿派、平台生态前沿派、芯片设备和操作系统前沿派,以及依靠行业数据、科研开源或交付网络的机构。3:27女主播量子位文章还写到,Meta 为数据中心建设招募电工和建筑工,在密歇根州为相关岗位办培训;文章列出的电工年薪区间是二十四万到二十八万美元。3:39男主播同一账号的另一篇文章介绍阿里和南京大学团队的 TaoMate。这个长时音视频生成框架在三张 GPU 上达到每秒三十五帧的完整流水线输出速度,并用固定容量记忆和视觉锚点减少递归生成中的漂移。3:54女主播机器之心介绍的 BarunLM 是三千五百万参数级小模型,作者用一张 H200 训练,仓库采用 Apache 二点零许可证,并公布了九项零样本评测结果。4:05男主播机器之心还介绍 Stream3D。哈佛、麻省理工和香港科技大学团队让模型持续吸收视频流中的多视角证据,再补全没有直接看见的三维结构,项目不需要重新训练底层生成器。4:19女主播AXIS 基准收集了五万多条网页遥操作的人类演示轨迹,参与者用浏览器控制模拟机械臂完成抓取、堆叠、倾倒和工具使用,数据随后用于清洗、增强、训练和评测。4:33男主播机器之心的具身智能文章集中介绍触觉感知:视觉语言动作模型接收视觉和语言输入,触觉传感器补充接触力、摩擦和材质等信息,文中还列出视觉模型、触觉模型和世界模型三种整合路线。4:48女主播36氪今天的 AI 工程师访谈中,曾在 Poe 工作、后来加入 Cognition 的马培元提到,硅谷团队开始把多个便宜模型和前沿模型混合调度使用。4:59男主播关注 AI、LLM、图像视频和设计的歸藏发帖说,Codepilot 零点六三版本可以把 AI 生成的图片和 HTML 放进素材库、打标签,还接入了 DeepSeek V4 Flash 0731,并增加可选的推理强度。5:15女主播简介写着关注全球前沿科技和 AI 动态的小互发帖说,他用 DeepSeek V4 Flash 做网站翻译,把原来二十到六十分钟的任务缩到三分钟,单篇成本不到一毛钱。5:27男主播卡内基梅隆大学语言技术研究所副教授、OpenHands 联合创始人兼首席科学家 Graham Neubig 发帖说,他试用 DeepSeek V4 Flash 后,初步体验是长流程任务表现很好,通常不会丢掉任务主线。5:41男主播Dingyi 的 X 个人简介写着 promote your product 和 refine your startup。他发帖说,自己收到测试 AI 产品的私信后点开登录,后来发现发信账号也被盗;他随后提醒用户不要点开类似链接,并建议在安全设置里删除可疑授权。5:59男主播一项窗口内的长任务测试把《指环王》的开头交给 Opus 五,给出大约一百万 token 的预算和两个小时的运行时间,要求模型用 Three.js 做一个互动世界。6:11女主播这次运行写出了大约五千五百行代码,生成了一个三维场景;测试记录还提到,模型只能分段截图检查结果,不能连续看到自己正在生成的画面。6:21男主播另一条窗口内的开发工具更新来自 AI-first 视频编辑器:现在可以在两段素材中间用 Fill Gap 自动生成衔接片段,也可以对时间线上的任意片段直接 Regenerate。6:33女主播同一个更新还加入了从时间线任意位置 Generate 的入口,生成完成后会把新片段放回原位置。6:41男主播一条产品更新帖写着,Grok 可以分析视频。6:44女主播GitHub 上的 make-interfaces-feel-better 是一个面向编码 Agent 的界面审查 Skill,覆盖动效、字体、图标、悬停状态、光学对齐、阴影和点击区域。6:56男主播这个仓库提供 quick 和 full 两种审查模式,结果包含按优先级排列的问题、修改位置、建议和验证项,采用 MIT 许可证;X 上的介绍列出了十九条界面细节原则。7:09女主播一条开发者帖子分享了一个 Coding Agent Sandbox 和调度器,作者说它强调确定性和可重复的反馈循环,并考虑投入生产。7:19男主播另一条开发讨论提出,开源 issue 可以先写明 token pledge,维护者接受后,再交给云端 coding agent 按 issue 原文执行。7:28女主播关于本地模型,窗口内一条机器之心账号的帖子展示了 MiniMax H3 在 RTX 三千零六十上运行的说法。7:38男主播还有一条讨论把 Agent 单任务成本拆成总 token 消耗、单 token 价格、缓存比例,以及 loop、tool call 和写代码等额外轮次。7:48女主播同一组开发讨论还提到,Coding Agent 的代码质量把关会从代码本身延伸到约束系统和反馈回路。7:56男主播还有一条产品使用记录:一位开发者说,自己让 Agent 直接安装了一个工具,解决了长期困扰他的 Gmail 视觉问题。8:04女主播关于模型调用方式,一条窗口内的测试帖说,在现代模型上直接写「think step by step」已经不再带来结果提升。8:13男主播关于 Codex 的价格,一条讨论帖说,五小时计费档位还没有恢复,发帖人也没有感觉它会回来。8:21女主播一位开发者还在窗口内宣布,正在用 DeepSeek V4 Flash 搭建一个 Coding Agent。8:27男主播一组 ChatGPT Work 使用帖把场景写成:让它处理重复性任务、帮助家人构建项目,以及把它当作思考放大器。8:36女主播同一组使用记录还在区分手机和桌面版本,发帖人说自己会继续整理两种版本各自能做什么。8:44男主播另一条行业讨论把 AI 的变化概括成:模型不一定要更聪明,也可能只是便宜一百倍。8:51女主播还有一条开发者讨论提到,自己正在做一个由 DeepSeek V4 Flash 驱动的 Coding Agent。8:57男主播机器人方向还有一条窗口内的行业讨论,帖子把机器人称作下一波变化,并说它可能比语言模型带来更大的变化。9:06女主播同一个界面审查仓库要求逐一检查 hover、focus、active、loading 和 empty 状态,并返回优先级和验证项。9:15男主播它还把嵌套圆角、视觉对齐、阴影层级和最小点击区域列成可执行的检查项。9:22女主播这次长任务实验的回复里还说,配音使用 ElevenLabs,声音由发帖人手动选择。9:28女主播今天白天的新增事实就到这里,明早继续见。9:32男主播晚安。