7月7日 AI 创业晚间对谈:世界模型、Agent 商业化和全量 X 补充开场1×1:33世界模型与 Harness3:40X 全量窗口里的研究信号5:20X 全量窗口里的产品信号7:03今天白天的主线回收9:50给创业者的拆法12:07收尾0:0013:100:00主播今晚先从一个新增信号说起。下午五点半后,机器之心连发两条值得创业者看的内容:一条是魔芯科技发布 MoWorld,主打五十帧实时交互世界模型;另一条是翁荔的新博客,讲通过 Harness 工程让 AI 自我提升。它们都在问同一个问题:模型会动起来之后,怎么真的变成可用系统。0:23女主播对,而且这不是单纯换个热词。世界模型这条,按机器之心报道,MoWorld 被称为 Flash World Model,重点是不用依赖高端图形处理器,也能把四维世界模型跑到实时交互。先不急着把它说成行业定论,但如果这个方向成立,影视预演、机器人仿真、游戏原型和自动驾驶训练都会被影响。0:46主播本期覆盖范围也交代清楚。授权的 X 关注源,我们重新按全量口径跑了一遍:三百九十三个关注账号,八批全部成功,每个账号最多读取最近一百条,总共五千九百九十一条。北京时间上午九点到下午六点,窗口内二十九条;下午五点以后没有新增推文。也就是说,X 的新增量不在晚间,而在上午窗口里有几条上一版没展开的小信号。1:12女主播所以这期不是把午后那期照着念一遍。我们把新增的世界模型和 Harness 放前面,再把 X 里漏讲的研究、产品和成本信号补上,最后压缩回今天白天已经确认的几条主线:Agent 交文件、科研工作台、具身硬件、答案入口和模型成本。1:33主播先讲 MoWorld。机器之心的报道说,魔芯科技发布的是一个超高帧率交互式世界模型,能在普通设备上生成可交互的动态世界,并把成本降下来。世界模型过去最大的问题就是慢,能生成一段视频不等于能让你实时探索。五十帧这个数字如果能在更多场景复现,意义就不只是画面更顺,而是反馈回路变短。1:56女主播我会把它理解成「AI 视频」和「AI 仿真」之间的一步。AI 视频更多是给你一段结果,世界模型更像给你一个可以试的空间。机器人可以在里面练动作,游戏团队可以快速试关卡,影视团队可以看镜头调度。创业机会也在这里:谁能把这种模型接到具体工作流里,谁就不只是卖生成能力,而是在卖测试环境。2:23主播但这里要留一个刹车。我们现在拿到的是机器之心报道,不是完整论文和大规模第三方评测。所以节目里只把它当作「值得观察的新发布」。真正要看的是三个问题:延迟是不是稳定,长时间交互会不会漂,生成出来的物理关系能不能支撑机器人和仿真任务。世界模型最怕只会做漂亮片段,不会承受真实操作。2:47女主播另一条 Lilian Weng 的 Harness 也很实用。机器之心编译她的新博客,说的是通过 Harness 工程实现 AI 自我提升。Harness 可以理解成测试夹具或训练脚手架:你先把任务、反馈、评测和改进循环搭好,再让模型在里面试错。它听起来没那么酷,但对 Agent 落地很关键,因为公司真正缺的不是一句「让模型变强」,而是一套可重复改进的工程环境。3:18主播这正好接上今天的 Agent 主题。Agent 越来越像员工,员工需要任务说明、验收标准和复盘机制。模型也一样。如果没有 Harness,你只能凭感觉说它这次答得好像不错;有了 Harness,你才能知道它在哪类任务上进步了,在哪类任务上又退步了。创业团队做 Agent 产品,迟早都要从演示视频走到这一步。3:40女主播再看 X。今天上午窗口里,研究社区的信号其实挺密。hardmaru 转发了 Sakana Translate 的发布,也转发了 Sakana AI 在 ICML 招募交流的信息。这个组合很有意思:一边是面向真实使用的翻译工具,一边是研究团队在线下会议抢人。研究和产品的距离正在缩短。4:03主播Thom Wolf 那条更偏模型工程。他说自己喜欢用尽量非侵入的方式微调大模型,让推理更高效,同时尽量保持原模型行为。Baidu Research 同一窗口发了 AdaGC,强调让大模型预训练更稳定、更省图形处理器小时;另一个帖子说 Unlimited-OCR 在 Hugging Face 下载超过一百万。它们共同指向一句话:现在不是只拼大模型多聪明,也拼它能不能更省、更稳、更容易被别人拿来用。4:33女主播机器之心 X 账号还发了 JetSpec,说研究团队想解释为什么更大的 draft budget 不一定让大模型生成更快,并提出新的推测解码方法。这个话题有点技术,但创业者可以抓住核心:推理速度和成本不是「多堆一点」就会自动变好。很多时候,瓶颈在算法、内存和系统配合,而不是一句「上更大的卡」。4:59主播Stanford AI Lab 的 ICML 论文清单也值得放进背景里,里面覆盖 coding agents、大语言模型和机器人方向。它说明今年研究议程已经很清楚:让模型写代码、让模型做工具调度、让模型理解物理世界。今天公众号里的 MoWorld、具身视觉基模和 OpenScience,其实都能和这条线合上。5:20女主播产品侧也有几条小但有用的信号。Fenng 转发说微信官方发布开发者工具 Skill。这个词在普通听众那里可能有点抽象,简单说就是把一套开发动作打包成可复用能力,让开发者不用每次从零开始。它和今天量子位写的 openJiuwen 多模态 Skill 范式也能放在一起看:Agent 要好用,靠的不是一句聪明回答,而是一组可复用的动作。5:49主播Jackywine 那条更接地气。他说做 AI Agent 最重要的是让用户用上,同时要向用户收费;正面例子提到 WorkBuddy,反面例子提到豆包电脑版,还建议字节重新命名桌面端 Agent。这个观点很产品经理,但很真实:体验好不等于用户会相信你,旧品牌记忆有时会拖累新产品。Agent 入口一旦被贴上「只是聊天机器人」的标签,后面再解释就很费劲。6:16女主播remio 的帖子讲的是人在火车上没网络,先找文件、写会议笔记,有网之后再继续 AI 问答。它不是大新闻,但非常像真实场景。很多 AI 产品不是因为能力不够失败,而是因为没贴上用户当下的动作。没网、赶车、开会前十分钟,这些细节比「全自动办公室」听起来小,却更容易让人每天打开。6:43主播kimmonismus 那条提到 OpenAI 新语音模型的传闻,说它可能是双向语音,也就是听和说可以更自然地交织。我们现在不能把传闻当发布,但语音确实是 Agent 的下一块入口。等模型能低延迟听懂打断、追问和口头修正,很多办公室和客服场景会从打字迁移到说话。7:03女主播回到今天白天的几条大新闻。量子位报道腾讯混元 Hy3 正式版,总参数二千九百五十亿,激活参数二百一十亿,最大支持二十五万六千上下文。更重要的是元宝能直接生成 PPT、Word、Excel、PDF 和 HTML 页面。也就是从「给我一段建议」往「把文件交出来」走。7:27主播这和刚才的 Harness 放在一起很自然。文件生成是交付物,Harness 是验收机制。一个 Agent 如果只会把 PPT 做出来,但你不知道它资料准不准、逻辑有没有偏,就只能当草稿机;如果有一套可重复检查和改进的环境,它才更像能进公司的工具。7:45女主播量子位还写了 OpenScience,作为 Claude Science 的开源替代,支持 Claude、GPT、Gemini、DeepSeek、GLM 和本地模型。它的重点不是「免费」两个字,而是不把科研工作台锁死在一个模型里。科研用户需要的是文献、假设、代码实验和论文写作连成一条线,模型只是其中一个可替换部件。8:10主播安全这条线也不能丢。机器之心今天早些时候写 Anthropic 的研究,说 Claude 内部可能存在类似静默心理工作区的 J 空间,模型没说出口的中间状态也能被观察到。这个说法别过度拟人化,但它对 Agent 审计很重要。以后看一个模型做任务,不能只看最后答案,还要看它中间有没有被提示注入带偏。8:33女主播具身智能和硬件这边,Founder Park 报道浪爪智能连续完成数轮超亿元融资,红杉、顺为、元璟资本和米哈游都在名单里。它做的不是人形机器人,而是消费级智能纺织设备,把自然语言、图案和机器编织接起来。这个案例挺好,因为它提醒我们,AI 硬件不一定要长成人,也可以长成一个很具体的垂直工具。9:01主播答案入口这条,投资界报道智推时代完成数千万元天使轮融资,做生成式答案优化,也就是让品牌更容易出现在 AI 答案里。它披露客户接近四百家、年化经常性收入破亿元。听上去很商业,但边界也敏感:补全真实信息是服务,操纵答案就会碰到平台规则和监管。9:24女主播CNBC 的报道给了成本背景。美国公司正在更多使用中国模型,因为性能差距变小,价格压力变大。报道里提到 OpenRouter 上中国模型 token 占比一度很高,也提到 Lindy 把流量从 Claude 转到 DeepSeek。aakashgupta 在 X 里讲 HBM 是 AI 建设的瓶颈,也能和这条线合上:模型路线不只由能力决定,也由内存、推理成本和供应链决定。9:50主播如果把今天这些信号拆给创业者看,我会先问一个很土的问题:你做的东西,最后交付给用户的是什么?混元 Hy3 交的是文件,OpenScience 交的是研究流程,MoWorld 交的是可试验空间,浪爪交的是实体织物。能被下载、被验证、被拿去继续用的东西,比一句「我能帮你」更容易收费。10:13女主播第二个问题是,用户有没有足够低的第一步。remio 那条火车场景很小,但它说明用户不想先学习一套宏大系统,他只想在没网的时候先找到文件、写好笔记。WorkBuddy 和豆包电脑版的讨论也在提醒产品团队:入口名字、首次体验、旧口碑,都会影响用户愿不愿意把 Agent 当成新工具,而不是旧聊天框换皮。10:41主播第三个问题是,你怎么证明它在变好。Lilian Weng 的 Harness 思路其实适合所有 Agent 团队自查:有没有标准任务集,有没有失败样本,有没有回归测试,有没有把用户反馈变成下一轮改进。很多创业项目 Demo 很亮,一进真实客户环境就散,往往不是模型突然变笨,而是没有把验收环境搭起来。11:02女主播第四个问题是成本。CNBC 报道里的中国模型使用增长,aakashgupta 说的高带宽内存瓶颈,Baidu Research 的省图形处理器小时,Thom Wolf 的高效推理微调,放在一起就是一句很现实的话:AI 产品不是只要效果能跑通,还要算得过账。特别是 To B 场景,客户不会为每一次炫技付账。11:28主播最后是来源位置。品牌抢 AI 答案入口、微信推出开发者工具 Skill、科研团队在 ICML 抢人,这些看起来分散,但都在争一个位置:谁能成为模型调用、学习或回答时的默认入口。创业公司如果没有入口,就得想办法成为某个入口里的高质量组件。11:47女主播所以今晚不是「又多了几个 AI 新闻」。更像是同一张地图上又亮了几盏灯:实时世界模型让试验空间变便宜,Harness 让 Agent 改进可测量,X 里的研究信号让成本和速度继续下降,产品信号则提醒大家,真正的落点仍然是具体工作流。12:07主播所以今晚的新增重点,我会放在两件事上。第一,世界模型如果能从漂亮视频变成可交互环境,机器人、游戏和影视都会多一个低成本试验场。第二,Agent 如果要自我提升,不能只靠更大的模型,必须有 Harness,有任务、有反馈、有评测。12:28女主播我再加一条:全量 X 窗口告诉我们,今天没有 17 点后的新推文增量,但上午的小信号很密。研究在抠推理效率,产品在找真实入口,品牌在抢答案位置,企业在重新计算模型成本。AI 创业现在最现实的问题不是「有没有模型」,而是你能不能把模型塞进一个每天会被打开、能被验证、算得过账的流程里。12:54主播本期来源会放在 show notes 里,按 X 补充、公众号文章和公开网页分组。今晚先到这里。下一期如果有新的融资、产品发布或官方回应,我们再把同一事件合并讲清楚;如果只是重复转载,就不硬凑。