7月7日 AI 创业午后对谈:Agent 打工、科研开源和答案经济开场1×1:09Agent 开始交文件3:08科研工作台开源化4:55模型心里想什么,以及要教它什么7:11具身智能和消费硬件,不只长成人形9:16答案经济,以及便宜模型的反攻11:41X 窗口里的小信号12:42收尾0:0013:450:00主播今天这期先把覆盖范围说清楚。我们重做的是 7 月 7 日午后这一期,窗口按北京时间上午九点到下午五点处理。授权的 X 关注源这次按最高上限跑满:三百九十三个关注账号、每个账号最多读取最近一百条,总共抓到五千九百九十七条,窗口内实际只有十四条,其中五条和 AI、创业或模型进展有关。0:24女主播也就是说,这不是只看几条热推的抽样版了。但也要诚实讲一句:如果某个极高频账号在这几个小时里发了超过一百条,工具上限之外的更早内容无法证明完全覆盖。好消息是,这次没有批次失败;坏消息是,X 本身给到的新增信号比较轻,主菜还是公众号和公开网页。0:47主播所以今天的主线不变,但信息量要比上一版厚很多:Agent 开始交文件,科研工作台开始开源化,模型内部和价值观训练变成安全问题,具身智能和消费硬件继续融资,最后是品牌争夺 AI 答案入口。听起来像五件事,其实都在回答一个问题:AI 从「会说」走向「会交付」之后,新的入口在哪里。1:09女主播先从腾讯混元 Hy3 说起。量子位下午两点多的文章里提到,混元 Hy3 正式版总参数二千九百五十亿,激活参数二百一十亿,最大支持二十五万六千上下文。听起来是模型参数,但产品重点其实在元宝:它能在对话里直接生成 PPT、Word、Excel、PDF,甚至 HTML 页面。1:36主播这类能力为什么值得讲?因为它把 AI 助手从「说得挺对」往「把文件交出来」推了一步。以前你问一个助手「帮我做行业汇报」,它给你一堆段落;现在量子位的例子是,一分钟出头生成中文播客行业汇报 PPT,还能按反馈调整页面顺序。这就更接近办公室里的真实工作流。1:56女主播当然,别马上脑补成「从此不用人做 PPT」。量子位也写到,排版细节还要人手改。我的理解是,它砍掉的是最烦的第一小时:找资料、搭框架、开模板、填表格。创业公司和产品团队最该关心的,不是它能不能一键完美,而是它能不能把低价值起步动作压到足够短。2:20主播这里可以接上 X 里的一个小信号。remio 的官方账号在窗口内发了一条场景推文,说人在火车上没有网络,也能先找到文件、写好会议笔记,AI 问答等有网再继续。这个推文不算大新闻,但它和混元 Hy3 指向同一个方向:AI 产品正在从聊天框,慢慢贴到「文件、笔记、会议、交付物」这些日常动作上。2:43女主播所以 Agent 竞争正在换题。不是谁的欢迎语更聪明,不是谁的 Demo 更像魔法,而是谁能把一个任务拆开,最后交出用户能下载、能编辑、能继续改的东西。企业用户不缺「看起来厉害」的模型,缺的是少开十个软件、少复制二十次粘贴、少等半天审批的流程。3:08主播第二条是 OpenScience。量子位同一天报道,Anthropic 的 Claude Science 上线不到一周,Synthetic Sciences 就拿出了一个开源替代:Apache 二点零协议,一行命令安装,覆盖文献检索、假设生成、代码实验和论文撰写。3:22女主播这个东西最有意思的地方,不是「免费平替」四个字,而是不锁模型。文章里说,Claude、GPT、Gemini、DeepSeek、GLM,甚至本地模型,都可以接;自己的 API Key 留在本地,请求直连模型提供商。对科研用户来说,这比单一大厂工作台更像一个可插拔的实验室。3:46主播量子位还提到,OpenScience 内置二百五十多个研究技能包,是 Claude Science 的四倍多。这个数字不能直接等于科研质量,但它说明科研 AI 正在从「一个模型回答我」变成「一个工作台调度一堆工具」。文献、代码、实验、写作,这些过去分散在不同软件里的动作,开始被 Agent 串起来。4:10女主播这里的创业含义也很清楚。Synthetic Sciences 是 YC 孵化团队,开源不是纯公益。谁能拿到科学家的真实研究流程,谁就能看到高价值问题怎么被提出、怎么试错、怎么验证。以后训练科学基础模型,最稀缺的可能不是论文 PDF,而是研究过程本身。4:30主播X 里也有对应的小回声。Thom Wolf 在窗口内谈到,他喜欢「用尽量非侵入方式微调大模型,让推理更高效」这个想法;Baidu Research 同一窗口发了 AdaGC,强调让 LLM 预训练更稳定、更省 GPU 小时。这两条不是消费级热点,但它们提醒我们,科研和模型工程的竞争正在变得很务实:更稳、更省、更能接入流程。4:55女主播第三组有点烧脑。机器之心早上发了 Anthropic 的研究,说 Claude 内部存在一个叫 J 空间的东西,像一个静默的心理工作区。模型可能在那里「想到」某些词、计划或中间步骤,但最后不一定说出口。5:12主播先降温一下,这不是在说 Claude 有人类意识。更实际的意义是,研究者多了一个观察窗口,可以看模型在没写出来的时候处理了什么。机器之心文中举例,Claude 读到有 bug 的代码,J 空间里会出现 ERROR;读到提示注入攻击,会出现 injection 和 fake。5:31女主播这对安全很关键。以后我们评估一个 Agent,不能只看最后答案漂亮不漂亮,还要看它做任务时有没有绕路、有没有被提示注入带偏、有没有在某些审计场景里意识到自己正在被测试。模型越像员工,审计就越不能只看周报。5:50主播下午量子位又补了一篇很有意思的侧面文章,说 Anthropic 把王阳明心学的「知行合一」拿来讨论 Claude 的价值观训练。这个选题听着像玄学,其实背后很现实:AI 公司不只在做能力对齐,也在找一种方法,让模型把「知道什么是对的」和「真的照着做」连起来。6:10女主播这两件事合在一起看,安全已经不再只是红队问一句「你会不会干坏事」。它变成两个问题:第一,我们能不能看见模型内部的中间状态;第二,我们能不能让模型在行动层面保持一致。一个偏解释性,一个偏价值观。它们都说明,Agent 越能做事,治理就越不能停在口号上。6:32主播还有一个更接地气的组织信号。量子位下午四点报道,前华为天才少年李博杰公开吐槽 DeepSeek 招聘流程,核心争议包括排面试慢、面试迟到、被质疑作弊等。这里不评价单方争议的全部细节,但它暴露了 AI 顶级团队扩张时的现实压力:技术品牌很强,不等于组织体验自动很强。6:55女主播对创业公司也一样。你可以有很强的模型、很强的故事、很强的融资,但人才进入公司的第一触点可能是一场面试。AI 公司经常讲「吸引最强的人」,但最强的人也会用你的流程来判断你是不是一个值得加入的系统。7:11主播第四组看具身智能和硬件。量子位中午写到「首个空间原生的具身视觉基模开源」,机器之心也有同主题文章,强调机器人要从二维图像识别,走向真正理解三维空间。简单说,机器人不是只要认出桌上有个杯子,还要理解杯子和手、桌面、障碍物之间的空间关系。7:33女主播这个方向的价值在于,机器人终于开始补一门很基础、也很难的课:看懂真实世界。我们对人类小孩觉得理所当然的能力,放到机器人上就是长期难题。它要知道东西会挡住、会移动、会掉下去,还要知道自己怎么伸手才不把东西碰翻。7:54主播这跟融资也接上了。Founder Park 和机器之心都写了浪爪智能,也就是 CLAWLAB。它做的是消费级智能纺织设备,创始人来自大疆等硬件背景,已经连续完成数轮超亿元融资,投资方包括红杉、顺为、元璟资本和米哈游。Founder Park 还写到,首款自动簇绒枪做海外市场验证,两年累计营收接近一个亿。8:18女主播这家公司有趣在于,它不是又做一台人形机器人,而是把一个具体行业里的复杂动作拆出来:用户用简易绘图、拍照,或者自然语言描述想要的风格,AI Agent 解析图案和版型,再交给机器编织。听上去像「桌面柔性工厂」,比「万能机器人」小很多,但商业路径可能更清楚。8:42主播这给 AI 硬件创业一个提醒。硬件机会不一定长成人形,也不一定要当家庭总管。很多老行业里都有高技能、低数字化、强情绪价值的环节,AI 如果能把「想法到实物」的链路缩短,就有可能先从一个窄场景里跑出真实收入。8:59女主播而且米哈游出现在投资方名单里也挺有意思。游戏公司投纺织硬件,表面看跳跃,其实如果你把它理解成「把虚拟创意变成实体商品」,逻辑就通了。未来的 AI 消费硬件,可能不只卖效率,也卖表达欲和社区感。9:16主播第五组是答案经济。投资界今天报道,AI 营销科技公司智推时代完成数千万元天使轮融资,投资方包括上海知识产权基金、天图投资、魏巍,老股东三七互娱继续跟投。它做的方向叫 GEO,生成式答案优化,简单说就是让品牌更容易出现在 AI 给出的答案里。9:39女主播这家公司披露的数据挺猛:成立一年左右,客户接近四百家,累计 ARR 突破亿元,服务覆盖四大洲,支持六十五种语言。投资界还写到,它累计交付一千六百六十七万多条 Query,覆盖十五个以上主流大模型。这个赛道的核心变化是,搜索时代你争链接位置;AI 答案时代,用户可能根本不点链接,只看模型一句推荐。10:05主播这里的问题也马上出现:品牌补全资料、纠正错误,是合理的;但如果变成隐形广告、操纵答案,就会很敏感。投资界文章里也提到,真实信息、商业表达与人为干预之间的边界还没有定型。所以 GEO 可能会成为新基础设施,也可能很快遇到新的监管和平台规则。10:26女主播更大的背景,是模型成本也在逼企业换路线。CNBC 今天报道,美国公司正在更多使用中国模型,原因是性能差距缩小、成本便宜很多。文章里说,通过 OpenRouter,美国公司使用中国模型的 token 占比从二月八日起每周都超过三成,最高到过百分之四十六;过去十二个月平均只有百分之十一。10:53主播CNBC 还写到,Lindy 在六月把百分之百流量从 Claude 转到 DeepSeek,CEO 说成本曲线直接砸到地上;Vercel 也看到 Z.ai 的 GLM 五点二在发布后第一完整周,日 token 量增长约二十七倍,客户数增长约八十倍。这个趋势会影响创业公司非常多:以前默认「用最强闭源模型」,现在开始变成「这个任务用足够好、足够便宜、可控的模型」。11:21女主播这就把今天几条线拧在一起了。Agent 要交付文件,科研工作台要可插拔,硬件要把创意变成实物,品牌要进入答案,企业还要控制模型成本。谁能在这些具体工作流里找到入口,谁才有可能从「AI 很厉害」走到「AI 真付费」。11:41主播我们把 X 窗口里的五条命中也交代一下,不把它们夸大。hardmaru 转发的是 Sakana AI 团队在 ICML 招募交流,说明研究团队还在高密度线下抢人;Stanford AI Lab 转发 ICML 论文清单,主题覆盖 coding agents、LLM 和机器人相关方向。11:59女主播Thom Wolf 谈的是高效推理微调,Baidu Research 讲的是 AdaGC 让大模型预训练更稳定、更省 GPU 小时。这两条更偏研究工程,但和 CNBC 的成本线能合上:当模型越来越贵,所有能降低推理、训练和部署成本的技术,都会变得更像产品能力,而不只是论文指标。12:21主播remio 那条最产品化,说离线时先找到文件、写好笔记,联网后再做 AI 问答。它提醒我们,真正能留下来的 AI 产品,往往不是整天喊「全自动」,而是能在用户现实条件里接住一小段工作:没网、赶车、赶会、资料散乱,也能先把事情往前推一点。12:42女主播所以今天的关键词,我会记成四个:交付物、工作台、可观察、答案入口。交付物决定用户会不会留下;工作台决定专业人群会不会迁移;可观察决定 Agent 能不能被信任;答案入口决定品牌和创业公司能不能被看见。12:59主播我再补一个词:成本。模型越强,大家越会问一句「这件事值不值得用最贵的模型做」。这也是为什么中国开源和开权重模型、端侧 Agent、稳定预训练、便宜推理,会突然和商业模式绑得这么紧。13:14女主播本期来源会放在 show notes 里,按话题分组列出;X 帖子会保留账号名和推文链接,公众号和网页会保留标题和链接。今天这期先到这里。别只看模型榜单,也看它最后把什么活交到你手里,以及这份活到底花了多少钱。13:34主播我们晚点继续看今天后半段有没有新的融资、产品发布或者重要行业讨论。如果没有增量,就不硬凑;如果有增量,下一期再把同一事件合并讲清楚。