AI 创业播客日报|Astar 开始指导 AI 进化,个性化 Agent 进入训练阶段Chapters今天有个很具体的变化,开始有人让 AI 去改进另一个 AI 系统了。0:01开场0:28Astar:AI 指导 AI 系统进化1:39PARPO:个性化 Agent 的训练轨道2:55白艾莉:关系型生产力 Agent4:11MiniMax H3:完整音视频服务5:24Training Agents:用开源模型训练 coding agent6:41其他快讯8:33收束0:00 / 9:161×0:01女主播今天有个很具体的变化,开始有人让 AI 去改进另一个 AI 系统了。0:05男主播这里是 AI 创业播客日报。0:08女主播今晚我们从五个新事件开始,先看 AI 怎么改进系统,再看个性化 Agent 怎么训练,最后落到产品和音视频服务。0:17男主播本期在 X 上读取了 404 个关注账号的 5587 条推文,其中 216 条落在时间窗内;公众号方面,3 个账号的 18 篇文章在本期窗口内。0:28男主播先说 Astar。机器之心介绍,阿里和浙江大学提出了一个让大语言模型指导 AI 系统进化的方法。0:36女主播它具体看什么?是看模型排行榜,还是看代码?0:40男主播文章说,Astar 会读 AI 系统的历史版本、代码提交和实验结果,然后生成下一轮改进方向。它不是只给一句建议,而是把修改写进系统迭代流程里。0:52女主播这就像把实验记录、代码仓库和线上结果放在同一个循环里了。0:57男主播对,文章给了推荐业务的结果。离线 Hitrate@200 提升 23.6%,线上 GMV 提升 4.86%,广告收入提升 1.82%。这些数字都是文章对实验的披露。1:09女主播还有模型大小的结果。1:11男主播文章给出的 0.6B 版本 S@1 是 54.35%,8B 版本是 67.86%。论文标题是 Astar,编号是 arXiv 2608.27287。1:24女主播所以这条的动作很清楚,模型先看历史改动,再提出新改动,新的实验结果又回到下一轮记录里。1:32男主播Astar 这个名字今天先记住,后面个性化 Agent 的训练,也会回到“怎么让系统持续变好”这个问题。1:39女主播个性化 Agent 这边,机器之心介绍了中国科学技术大学和阿里巴巴的 PARPO。1:45男主播PARPO 不是只给 Agent 加一个用户画像吗?1:48女主播文章写的是两条训练轨道。一条看通用任务质量,另一条看个人偏好。两条 advantage 分开计算,再一起用于训练。1:57男主播这能避免什么?1:59女主播文章把个人偏好放进一张 PSGM 图里。图里有 User、Skill、Tool、Scenario 和 Trajectory 五类节点,也就是用户、技能、工具、场景和轨迹。2:10男主播这样一来,Agent 记住的不只是“这个人喜欢什么”,还包括在哪个场景里,用过什么工具,完成过哪类任务。2:19女主播文章列出的测试结果是,Qwen3-8B 在 ETAPP 上的 Judge 得分 0.8333,SJAgent Reward 是 0.8270。2:28男主播这些数字来自文章对实验表格的转述。2:32女主播还有盲测。文章说,15 位人类专家和四组大语言模型评审一起比较,PARPO 在盲测里排名第一。2:40男主播论文编号是 arXiv 2605.23382。它把“回答得对”和“回答得像这个用户需要的样子”分开处理了。2:50女主播这两件事在训练里也分开了。先把轨道分清楚,再把记忆图接进来。2:55男主播产品侧,量子位报道了上海米羊科技创始人徐奕成在外滩大会介绍的白艾莉。3:02女主播这个 Agent 的名字很像一个人,它做的事情还是工作流吗?3:07男主播文章说,它能写作、生图、拆解任务、调用专业子 Agent,还能把结果保存到工作区。产品把它叫作关系型生产力 Agent。3:18女主播关系型,具体落在哪?3:20男主播量子位文章描述了四层人格系统:人格内核、感知适配、决策调度和动态表达。它把记忆、场景和互动边界放进这套系统里。3:30女主播也就是说,同一个任务,Agent 会先判断关系熟悉程度,再调整说话和行动的方式。3:38男主播文章就是这么描述的。文章还举到朋友圈拉黑这类互动行为,说明它的动作不只发生在工作区里。3:46女主播留存数字也很具体。3:48男主播量子位文章披露,次日留存 73%,七日留存 45%,九十日留存 15%,用户中 75% 是男性。3:57女主播这些数字的来源是量子位报道,不是我们重新做的统计。4:01男主播对。这个产品把写作、生图和任务执行放在桌面 Agent 里,再把记忆和关系处理写进产品结构。4:11女主播模型服务这边,机器之心拆了 MiniMax H3 放进 vLLM-Omni 的完整音视频流水线。4:18男主播vLLM-Omni 以前更像一个推理框架,这次连封装也管了?4:23女主播文章列出的链路包括编码器、DiT、VAE、GPU 输出准备、进程间传输和 MP4 封装。FastH3 把 49 次 DiT 前向替换成 4 次。4:35男主播测试环境是什么?4:36女主播八张 NVIDIA B300,分辨率 1344 乘 768,帧率 24 FPS。文章给出的结果是,生成一段 10.125 秒的完整 MP4,用时约 8.68 到 8.71 秒。4:50男主播这个“实时”要说清楚。4:52女主播文章的定义是,完整响应就绪时间不超过媒体播放时长。它不是首帧时间,也不是流式交付时间。5:01男主播所以 10 秒视频在大约 8.7 秒后拿到完整 MP4,和边生成边播放不是一件事。5:08女主播对,边界就在完整响应。文章还列了 T2VA、FL2VA 和 Ref2VA 三种服务任务。5:15男主播这条信息对开发者比较直接,模型、推理优化、跨进程传输和文件封装都被放进了同一条服务链。5:24男主播最后一条重点来自 X。@shao__meng 转发了 Hugging Face 团队 @ben_burtenshaw 发起的 Training Agents 项目。5:32女主播先介绍一下转发者。5:33男主播@shao__meng 的个人简介是“Building AI Agents for design & media,分享新产品、开源项目,以及 AI 创业与职场观察”。5:45女主播项目本身安排了什么?5:47男主播帖子介绍,它持续六个月,共有六场直播和配套开源项目,主题包括 Agent 评估、Agentic RL、监督微调、蒸馏、GRPO 和环境强化学习。6:00女主播这些都是训练 coding agent 会用到的环节。6:03男主播路线使用大约 2B 参数的开源模型训练 coding agent,目标是在 Terminal-Bench 上超过 40 分。帖子还要求使用 held-out 评估,也就是训练过程不直接看到最终测试题。6:16女主播它还列了不同阶段的挑战。6:19男主播对,帖子把训练、评估和公开结果放在同一条长期路线里。公开项目包括直播、代码和评估方式。6:28女主播这和刚才 Astar 的循环不一样,但都把“系统怎么变好”拆成了可以重复跑的步骤。6:34男主播Training Agents 这条,重点就是六个月、六场直播、开源代码,以及 Terminal-Bench 超过 40 分这个目标。6:41女主播其他快讯先从代码审查开始。6:44男主播@shao__meng 还转发了阿里开源的 Open Code Review。它是一个 Go CLI 工具,命令叫 ocr,可以从 Git diff 输出带行号的 Agent 代码审查意见。帖子介绍的 AACR-Bench 有 50 个仓库、200 个 PR、10 种语言和 1505 个标注问题。7:02女主播Alexandr Wang 的个人简介显示,他是 Meta 首席 AI 官、Meta Superintelligence Labs 创始人,也是 Scale AI 创始人。他本期发帖展示 Muse 自动生成营销轮播图、创建技能和验证步骤,并发送社交媒体内容和私信。7:18男主播Alexandr Wang 还发起 Muse money challenge,邀请 Muse 直接提出赚钱或省钱方案;他转发的另一条用户体验称,Muse 代办了保险医疗理赔。7:28女主播机器之心文章称,Sam Altman 表示 OpenAI 年内不上市,并支持 Dario Amodei 关于放慢前沿 AI 推进速度的呼吁。7:37男主播36 氪发布了四家 AI 与机器人公司的 CEO 招贤信,涉及万拿机器人、枢途科技、百型智能和浪爪智能。7:45女主播量子位文章介绍蚂蚁外滩大会上的 PhysBrain 1.5,文章标题称它登顶全球开源榜一,并提到空间智能和 GPT-6 Astra。7:54男主播机器之心另一篇文章介绍 AI 小模型路由,标题给出的结果是推理成本下降 96%,性能超过大模型。8:03女主播@dotey 的个人简介是 AI Engineer,专注学习与传播 AI、软件工程和工程管理。他本期转发测试 AuK,称音色还原较好但中文口音明显;原帖介绍 AuK 是开源语音生成与编辑基础模型。8:18男主播@dongxi_nlp 的个人简介显示,他曾是斯德哥尔摩大学博士,毕业于 KTH 和 Uppsala,持续分享 AI 洞察。他本期发布了 Prefill、KV cache 和 Prefix caching 三个推理概念的解释帖。8:33女主播今晚的五条重点,从 AI 改进 AI 系统,到个性化 Agent 训练,再到关系型桌面产品、完整音视频服务和 coding agent 训练,事实都落在具体的系统和项目上。8:45男主播其中几条数字要记住:Astar 文章披露的推荐业务 GMV 提升 4.86%,PARPO 文章披露的 Qwen3-8B ETAPP Judge 是 0.8333,MiniMax H3 文章披露的 10.125 秒完整 MP4 用时约 8.7 秒。9:04女主播今天的节目就到这里。9:06男主播今晚见。