
E249|Token经济转点:OpenClaw、Hermes到本地自研的 Agent 进化之路:完整逐字稿和精华摘要
本期对话梳理 Token Maxing 从高消耗试错转向本地模型与云端前沿模型混用的过程,并保留 OpenClaw、Hermes、多 Agent 协作、企业基础设施与就业问题的完整逐字稿。
这期节目讲了什么
Agent 的问题已经从「模型能不能完成一件事」,变成「应该让多少个 Agent、用什么模型、花多少 Token,持续把事情做完」。本期录音于 2026 年 7 月 4 日,主持人泓君与 Llama Ventures 合伙人、PingCAP 联合创始人兼 CTO 黄东旭,以及 Llama Ventures 高级技术合伙人张宏江,讨论了 Token Maxing 的成本转折、OpenClaw 与 Hermes 的产品形态、多 Agent 协作、本地模型和企业级 Agent 的机会。12
节目于 2026 年 8 月 20 日 08:00(Asia/Shanghai) 发布,时长 1 小时 27 分 02 秒。这里的摘要和逐字稿都以完整音频为依据;读者可以打开官方 E249 单集页,或直接收听官方 E249 单集页。2
这期访谈给出的主线很清楚:Token 变便宜,会让使用量继续增长;但单个任务是否值得烧 Token,已经需要工程判断。 黄东旭讲了自己从一天数百美元、约 10 亿 Token 的多 Agent 工作流,转向本地开源模型和云端前沿模型混用的过程。张宏江则把这场变化放进更长的技术周期里:模型能力仍在爬坡,Agent 会从单体循环走向更大的 Agent-to-Agent 网络,企业真正的护城河会落在数据、 know-how 和工作流上。2
嘉宾的几个判断
张宏江:真正的转折,是从模型研究进入 Agent 工程
- AI 基础设施还没有走到过度投资。 张宏江把当前投入与互联网、铁路和公路基础设施相比,认为技术和应用的发展仍处在早期;他把技术发展与股票市场是否有泡沫分开讨论。这个判断属于嘉宾对产业周期的看法,不是节目外部数据的独立核验。2
- 企业需要把自己的 know-how 交给 Agent。 他认为,企业能否把现有数据、知识产权和工作流沉淀成一个 Agent 或 Agent 群,比做一个容易被更强模型覆盖的通用应用更重要。
- 按他的定义,AGI 的转折点已经出现。 张宏江把「机器学习能力超过人的学习能力」作为一个判断标准,并据此认为当前模型在部分能力上已经超过普通人。这个结论是他的定义和判断,不能直接当作行业共识。2
- 工作问题会从技术问题变成社会问题。 如果新需求也能由 Agent 满足,技术进步就未必像过去那样自动创造足够多的新岗位。他认为这会把人的存在感和生活安排推到更前面。
黄东旭:Token Maxing 曾经合理,但不能把消耗量当 KPI
- 在模型能力差距很大时,选最强模型是有理由的。 黄东旭回忆,自己曾用最强模型从零构建复杂软件,一天花掉约 400—500 美元;在另一个阶段,他的工作流一天消耗约 10 亿 Token,账单约 300—400 美元。他把这笔钱和能否做出原本受限于人力而无法完成的软件放在一起计算,而不是只看调用价格。2
- Token Maxing 是手段,不是排行榜。 经过设计的多 Agent 讨论能让代码审查更深;为了刷公司排行榜而无目的调用,只会制造浪费。Token 用量本身不能代表效率。
- Agent 的进化是「单体—技能—群组—混合模型」。 OpenClaw 把 Agentic Loop 和工具调用带给更广泛的用户;Hermes 把成功经验总结成可复用的 Skill;再往后,多个 Agent 在同一个频道里互相挑错,形成黄东旭称为「Agent 动力学」的工作方式。
- 本地模型让以前不敢做的任务变得可试。 他在 Mac Studio 上运行 DeepSeek V4 Flash,节目中提到速度约为每秒 30 Token、满载时每天电费约 1 美元;他用本地模型处理重复任务和大批量论文初筛,把更难的问题交给云端前沿模型。这里的速度、费用和工作流都是嘉宾个人使用经验。2
- 创业机会集中在企业基础设施。 他点名 memory、搜索、sandbox、environment、协同、harness、可观测性和 Agent Cloud;判断一个产品是不是 Agent Native,可以做一个思想实验:去掉 AI 或 Agent 后,产品是否仍然成立,或者成本是否会暴涨。
关键节点
- 04:55|AI 基建是不是泡沫:张宏江认为,技术革命本身仍远未过度投资;黄东旭补充说,模型推理和 Agent 框架还有大量效率优化空间。
- 09:52|黄东旭的 Token Maxing 账单:他从复杂分布式数据库项目讲起,说明为什么在无法准确评估模型差距时,使用最强模型可能是理性的。
- 14:15|OpenClaw 的意义:它更像连接现实世界的个人助理,重要之处在于把 Agent 的能力从工程师圈子带到普通用户面前。
- 20:31|OpenClaw 的边界:黄东旭把它比作「普罗米修斯」,认为它完成了让人们看见产品形态的历史任务;复杂软件的稳定性和工程质量仍需要成熟团队。
- 23:09|Hermes 如何沉淀经验:它通过把成功经验总结成 Skill,绕开了单纯依赖长期记忆的做法。
- 30:09|Agent 动力学:多个高能力模型围绕同一段代码持续挑错,直到没有人提出新的问题;代价是 Token 消耗可能达到单模型的数倍甚至十倍。
- 35:12|Fable 5 改变成本账:黄东旭说,一些多 Agent 讨论很久仍解决不了的问题,Fable 5 可能一次完成,这让他重新评估了 Token Maxing 的必要性。
- 37:20|本地开源模型进入实用区间:DeepSeek V4 Flash 在他的 Mac Studio 上运行,承担重复任务和大规模资料初筛,云端模型负责更难的任务。
- 43:42|省 Token 不等于总消耗下降:Agentic Loop、工具调用和多 Agent 层级会把任务规模继续推高,Token 价格下降反而可能扩大使用场景。
- 52:36|Agent 创业与投资:嘉宾把机会分到应用、基础设施和入口层,更看好企业数据、上下文管理、可观测性与面向 Agent 的云服务。
- 01:03:24|Agent 的「办公室政治」:黄东旭讲到 Agent 之间互相 blame 的现象,同时强调这只是对人类社会模式的模仿,不等于自我意识。
- 01:15:30|AGI 与就业:张宏江按自己的定义认为智能转折点已经到来,并把「新需求是否仍需要人来满足」视为更现实的就业问题。
- 01:18:19|当工作不再占据人生中心:黄东旭认为,技术替代工作最终会逼近存在主义问题,但人的兴趣、生活和创造活动不会只剩工作这一条路。
节目中反复出现的术语
- Token Maxing:尽可能多地调用 Token,通常意味着优先使用最强模型、允许 Agent 长时间运行。本期把它拆成两种情况:有明确目标的高消耗,和为了排行榜而刷调用量。
- Token Efficient:把模型能力、调用成本和任务难度一起考虑。重复、可批量和成本敏感的任务可以交给本地开源模型,复杂、低容错的任务再调用前沿模型。
- Agentic Loop:Agent 的内部循环。模型读取上下文、调用外部工具,再把工具的输入输出放回上下文,直到任务结束;长任务可能运行数百步。
- OpenClaw:节目中被描述为开源、强调 Local First 的个人助理形态。它降低了使用门槛,但重度软件工程的稳定性和维护性仍是问题。
- Hermes 与 Skill:Hermes 的重点不是宣称自己拥有完美记忆,而是把成功经验提炼成可复用的 Skill。Skill 可以理解为一套能被 Agent 再次调用的工作方法。
- Agent 动力学与 Agent 蜂群:多个 Agent 在共享频道里互相检查、补充和触发新的思路。张宏江认为,群体展现的智能可能超过单个 Agent 能力的简单相加;黄东旭则把它用于代码审查和复杂任务的兜底。
- Agent Native:黄东旭给出的测试是:删掉 AI 或 Agent 后,产品是否仍然成立;如果产品因此失去意义,或成本增加到原来的很多倍,它才更接近 Agent Native。
- Agent Infra 与 Agent Cloud:前者包括 memory、搜索、sandbox、环境、协同、harness 和可观测性等支撑层;后者指面向 Agent 分配计算、工具和运行环境的云服务。核心变化是基础设施的直接使用者从人转向 Agent。
几句原话
「Token Maxing 是一个结果,它有点像一个 Lagging Indicator;但要经过思考地去 Token Maxing,你能产出一个很好的结果。」——黄东旭,00:11:42。2
「OpenClaw 的出现,只是把编程 Agent 代表的理念——Agentic Loop 加上工具调用——变成一个更 general、对普通用户来说门槛更低的东西。」——黄东旭,00:15:07。2
「未来一定是一些超级强的 Agent 和超级大的蜂群来做事情。」——张宏江,00:49:21。2
「如果你这个事情,把 AI 的元素或者说 Agent 的元素去掉以后就完全不成立了,或者说成本涨了 1000 倍,那它反而就有点意思。」——黄东旭,01:02:14。2
「我觉得已经到了。」——张宏江谈自己所定义的 AGI 转折点,01:17:57。2
「我的时间就这么多,我还想做人的时间多一些呢。」——黄东旭,01:20:47。2
完整逐字稿(按说话人)
主播/泓君|00:00:00 Hello,大家好,欢迎收听硅谷 101,我是泓君。如果说 2025 年是 Agent 的元年,那 2026 年行业有一个有意思的变化。市场从开始讨论模型的能力,变成越来越多的去讨论 Agent 的工程问题,有一个从关注科研到关注工程的转向。那曾经疯狂带头烧 Token 的这些硅谷公司们,现在看起来也是慢慢地冷静下来了。Uber 4 个月烧穿了全年的 AI 预算 Meta 计划限制员工的 Token 消耗量。
主播/泓君|00:00:34 与此同时,中国有一批开源模型 DeepSeek、GLM、Kimi,它们的模型能力越来越逼近第一梯队。现在硅谷的公司们也开始把它们搭进了自己的工作流。所以我们有一个问题,最大化 Token 的消耗,无脑去使用最强的模型,还是市场的最优解吗?这集我们就来聊一聊从 Token Maxing 到 Token Efficient,这背后正在发生的整个 Agent 工作范式的变革。今天跟我在一起的两位嘉宾是黄东旭,东旭是 Llama Ventures 的合伙人,也是 PingCAP 的联合创始人和 CTO。
主播/泓君|00:01:17 Hello,东旭,你好。
黄东旭|00:01:18 大家好,大家好。
主播/泓君|00:01:19 那还有一位是张宏江老师,宏江老师是 Llama Ventures 的高级技术合伙人,现在也是美国国家工程院的外籍院士。同时呢,宏江老师也是微软亚洲研究院创始成员之一,也是北京智源人工智能研究院的创始人,同时还是金山软件的 CEO。张宏江老师非常荣幸你能来做客我们的播客。
张宏江|00:01:41 谢谢,非常高兴有机会跟大家见面。
主播/泓君|00:01:44 在开始的时候,大家要不要简单先介绍一下自己?
黄东旭|00:01:48 好,我是东旭,我是 PingCAP 这边的 CTO 和 Co-Founder。最近有个新的身份就是 Llama Ventures 的合伙人。自我的定位肯定还是一个工程师,大家都知道 Hermes,Agent 的 Coding,我也是第一时间再去拥抱。第二呢,我是一个创业者,一直以来从零到一在技术软件行业,其实 PingCAP 和 TiDB 是一个分布式的数据库吧,也从北京开始起步,慢慢的客户都遍及全球。
黄东旭|00:02:17 我觉得第三个身份就是,因为我是一个好奇心比较重的人,很喜欢自己去做一些东西,比如说像音乐,比如像一些艺术,反正这是我几个身份吧。
主播/泓君|00:02:29 对,因为今天我们要讲 Token 这个话题啊,然后我觉得请东旭来我们的播客主要就是一个你是真正的在玩 Agent 的人,然后一直在用的人,一直在搭程序的人,所以我觉得应该会有很多一线实战的经验给大家分享。
黄东旭|00:02:44 我也一句话介绍一下我心目中的宏江老师。
主播/泓君|00:02:48 好,可以。
黄东旭|00:02:49 其实我人生的第一份工作就在微软亚洲研究院,当时我还是一个实习生,然后当时宏江老师正好在微软亚洲研究院处于工程院刚成立的那个时间,是我心目中的大科学家。所以现在非常非常荣幸能够在 Llama Ventures 里面再许前缘。
主播/泓君|00:03:10 宏江老师。
张宏江|00:03:11 大家好,我是张宏江。我的状态现在是一种退休的状态。那么在两年前的话呢,大家看到了这一波 AI 所推动的新的技术浪潮中间。而华人在里面起了一个非常非常关键的作用。尤其是在大的 Lab 里面,无论是 OpenAI 还是 Entropic 还是 Google 至少在技术上这些人都是骨干,真是挑大梁的人。同时我们也看到这一波的创业的浪潮里面,其实华人的比例也非常高。无论是从大陆过来的,在这儿上学的、毕业的,然后在大厂工作的,还是说就在这儿长大的二代三代的华人,创业的人都很多。
张宏江|00:03:51 尤其是对于原来背景在大陆的,到这儿来留学的这个华人来说的话。其实他们作为第一代移民,他们在创业中间会有各种各样的困难。其中一个很大的困难实际上就是能不能得到他们所需要的资金。所以在两年多以前的话,我正好碰到了 Llama 这个机会希望能够以顾问的方式来跟 Llama 的团队一起来做这些事。我之前的话呢,从最早做研究,在新加坡做研究,在美国做研究,然后呢回到中国跟开复等大家一起创建微软亚洲研究院。
张宏江|00:04:24 从研究院做基础研究做到工程院做产品的研发,然后到了出来做金山的 CEO,然后从金山退休以后又做了一系列的顾问的角色。后来创建了北京智源人工智能研究院,这中间还另外花了很大的功夫做源码资本的投资合伙人。我整个职业生涯中学到了很多,然后也有很多的经验和教训,也希望能够在美国这块和所有的创业者一起来分享,能够帮助大家在这一波的技术的革命的浪潮中间寻找到自己的机会。
主播/泓君|00:04:56 因为我觉得 AI 这一波它肯定是一个实实在在的对生产力的提高啊。但是呢因为现在大家基建的投资也很迅猛,包括我们今天这一集马上会跟大家聊的这个 Token Maxing 的策略,大家也在疯狂的烧 Token。您觉得现在在整个的大的市场里面它是有一定的泡沫存在的成分吗?还是说你觉得它现在的基础建设是远远不够的?
张宏江|00:05:20 去年的 12 月份我在另外一个采访里面,这就是一个问题啊。我当时就说没有泡沫,然后呢,2024 年年底的时候,大家怀疑 Scaling Law 是不是撞了墙,然后呢,大家怀疑是不是 overinvest。但事实上呢,我们今天看的话其实远远没有达到。我们所面临的是一个非常 fundamental 的一个革命。你可以跟互联网最大的基建开始相比,你可以跟当时美国快速的发展的时候建设铁路网和公路网来相比。
张宏江|00:05:49 那么今天你从绝对数是超过他们毫无疑问,但事实上你从占 GDP 的比例来说其实比那些都小,即使从宏观的角度来说也远远没有到所谓的 overinvest。那另外一点就是其实你看 Token 是很贵,但 Token 的消耗量的话其实增长得非常快。还有一点大家忘掉了,其实 Token 的价格在过去的几年一直每年降 10 倍的那样的速度。无论是英伟达的芯片的进展还是其他的方面的进展所以我依然会非常有信心,我不觉得是存在的太大的泡沫。
张宏江|00:06:21 当然你说股票市场是不是存在泡沫,那是另外一回事。但是技术的发展,应用的发展,我不觉得存在的什么泡沫。也正是因为这次革命浪潮是如此大而且如此迅猛其实很多潜在的用户的话,也包括很多大的企业他们有一些不知所措,无论是说他一开始就放开用 Token,让大家去试,还是说突然发现这个 Token 量可能超过他当初的想象,然后开始往回说。这是一个很自然的一个过程,因为 AI 的能力如此之强大,那么到底先把它用在公司里面的哪个环节,先去提高公司哪方面的效率。
张宏江|00:07:04 这个实际上还是一个探索的过程,但是因为速度来得如此之快,所以有时候大家会觉得有点不知所措。
主播/泓君|00:07:12 对,东旭你有补充的吗?我看他刚刚在说没有泡沫的时候,东旭立刻比了一个大拇指。
黄东旭|00:07:18 是的,我也是完全认同是这个观点。今天我们去看待 AI 的这波的基建,就跟我们可能上世纪五六十年代去看待计算机刚诞生出来的,哇,一个房间的电子管好大好贵啊。但是你想象那个时候还没有个人计算机呢,有很多很多的需求其实是有充分的基建了以后才会诞生出来,而且这些新的需求诞生出来又会刺激更多的基础的建设或者说一些更新的基建的技术的出现。所以我觉得还远呢,还有很多事情可以做。
黄东旭|00:07:53 第二呢,从一些微观的工程,哪怕是今天的架构上来看,我觉得还有很多事情是可以去优化的。比如说今天在模型的推理,Agent 的框架对 Token 的高效的使用上,其实还有很多的优化的空间。只是说因为今天的需求和大家看到这个市场的预期吧,说我们先发散,不要顾及我花多少 Token,先看看有没有哪些事情的低垂的果实能够摘回来,之后再去考虑优化的事情。所以短期可能会有一个小的回落,但是从长期来看仍然是有大量的需求还没被人看见吧。
主播/泓君|00:08:30 对,我们今天录这期播客的时间是在 2026 年的 7 月 4 号。我觉得正好也是在一个市场的转折点上就像刚刚张宏江老师您提到的。最开始大家发现这波 AI 浪潮来的时候像黄仁勋他其实就在 GTC 上说我要求我的每一个工程师你们都要烧很多的 Token 账单包括 Meta 他有一个 Token 的排行榜看哪些员工烧的 Token 多。所以我觉得在过去的八个月里面可以说整个硅谷用 AI 的策略我们可以叫做 Token Maxing,就是最大化的使用 Token,最大化的看大家能把 Agent 用到一个什么样的程度。
主播/泓君|00:09:08 但是呢,到今天来说,其实我觉得现在这个市场大家又开始有一点点转折了,就比如说 Uber,它给员工发的 Token 额度后来又因为成本收回去了。他们基本上四个月把整个全年的预算烧穿了。我前几天去 stripe 跟他们负责 AI 落地的人聊,他们给我看内部的那个大模型啊,上面就写着 Opus 4.8 很贵,大家用的时候可以省一下成本,先用其他的模型,不是所有的人我都要用这个模型。
主播/泓君|00:09:37 就是你打开那个页面,那个页面一下就弹出来了这样的一个提醒。所以我觉得呢,今天我们聊的这个时间点很好啊。怎么样更加经济的使用 Token,而且我觉得这个背后可能也包含着一系列 Agent 的变革。因为东旭其实你一直在玩 AI Agent 嘛,你有没有经历过这种一段时间的就反正我就无脑使用,我用最强的模型,然后那个时候你有没有一个账单爆掉的?
黄东旭|00:10:03 其实当然有。我先说一下我 Token Maxing 的历史。虽然我现在可能并不是 Token Maxing 的流派了,我就像你刚才说的这种属于无脑用最强,也不要说去花太多时间去在一个不太行的模型上去做很复杂的工作流,相信模型的能力。我是大概从去年的 11 月份开始,我其实做了几件事情。第一就是我开始在用 Opus 从 0 到 1 构建一个我能想到最复杂的软件。因为我一直做数据库的,尤其分布式数据库,其实是最复杂的一种系统软件。
黄东旭|00:10:35 我想看看当时的 AI 对于这样复杂的大系统来说,它的边界在哪?所以在这种最复杂的任务上,我其实没有办法很精确地评估最强的模型跟第二强的模型它的差别是什么。所以对于你来说,最好的策略就是永远选最好的模型。我觉得现在今天仍然有同样的问题。大家对于这个模型的能力的评估基本上只能看个 benchmark。但大家知道这个 benchmark 其实是很多时候你是能刷榜的。当你在做一些不太确定但是你又知道这件事非常难的时候,你一定得用最强的模型。
黄东旭|00:11:12 这是我之前大概刚刚我说到一个时间点就去年 11 月份。那个时候像 Opus 跟 GPT 5.1,他们对于第二档的 coding agent 是断崖式的领先。开源模型基本处于一个做一些简单的一加一等于二的事情可能还行,但是你真的要去做一些复杂的软件的编程,大的项目的改进,那时候是完全不行的。所以 Token Maxing 我觉得那个时候是一个好的策略,但这个策略我觉得后来在社区里面大家都把它误解了。
黄东旭|00:11:42 我觉得 Token Maxing 是一个结果,它有点像一个 Lagging Indicator,但要经过思考的去 Token Maxing,你能产出一个很好的结果。但是像刚才你提到的很多今天的大公司,包括黄仁勋说大家一定要疯狂的用。疯狂的用,我觉得有两种疯狂的用法。一种是你知道你在干什么,你很好的设计,然后疯狂的用。另外一种是你不知道你在干什么,只是觉得公司有个排行榜,我必须得把它刷到榜单 No.1,于是就出现了很多无效的调用。
黄东旭|00:12:15 因为我就尤其在大公司里面,只要领导提出一个要追求一个榜单,那一定大家会去刷这个榜。这个是我在 Meta 和 NVIDIA 去提 Token Maxing 的时候,第一秒钟我就想到会出现的一个问题。今天我觉得又有点不太一样。
主播/泓君|00:12:32 对,您刚刚提到了去年 11 月份,然后你是在用最强的 Agent 去完成一个我能想到的最复杂的软件。对对对,那个时候你的账单大概是一个什么样的情况,可以透露吗?
黄东旭|00:12:43 我当时我一天可能得花掉四五百美金。
主播/泓君|00:12:48 一天四五百美金。
黄东旭|00:12:49 而且这个一天四五百美金还是在我已经用了 Claude Code 的那个 Pro Max 的 subscription 的情况下。
主播/泓君|00:12:55 再加两百美金。
黄东旭|00:12:56 对对对,再往上再加,因为它有一个量,那个量,daily 的量和 weekly 它有一个 limit。我那个用完了你就得再自己掏钱去买,那 xr usage,所以当时我用的还挺疯狂的。
主播/泓君|00:13:09 帮你提升了多少效率?
黄东旭|00:13:11 那我觉得是不计其数的,因为钱花的值我觉得超值我举个例子吧,就很多时候一件事情是从零到一比如有些事情我觉得我肯定做不出来但是用上最强的 AI 以后,它能让我做出来的你说他的 ROI 是什么呢?比如说像我做的那个软件,我在我的公司内部,其实我们的销售期待那个软件已经期待了很长时间。我确定如果我这个东西做出来,质量做到七八十分,我一年可能就能多一千万美金的直接的收入,因为我的客户就在那等着。
黄东旭|00:13:44 只是以前我受限于人力技术的水平,我做不出来。但今天我一个人三个月我就做出来了。
主播/泓君|00:13:51 一个人三个月,做了一个可以销售额达到千万美金的软件。
黄东旭|00:13:57 这个我觉得是完全可能的今天,你要这么算,你的 ROI 其实非常高的。
主播/泓君|00:14:02 这是一个真实的例子。
黄东旭|00:14:03 这是一个真实的例子,对对对。那个项目叫 DB9,是我新做的一个云原生的分布数据库。
主播/泓君|00:14:10 是从去年的 11 月份到今年的 2 月份。
黄东旭|00:14:13 其实应该是 12 月份到今年 3 月。
主播/泓君|00:14:15 那差不多这个时候也是 OpenClaw 已经开始出来了。
黄东旭|00:14:20 是的。
主播/泓君|00:14:20 后面 OpenClaw 有帮上忙吗?
黄东旭|00:14:22 没有。
主播/泓君|00:14:23 没有。
黄东旭|00:14:24 OpenClaw 是另外一个 story。他更像个人助理。最早的时候我不太想让 OpenClaw 来写代码因为其实 OpenClaw 的产品设计并不是对这种重度的软件工程设计的他更像是说去连接各种现实世界通过 Agent 的能力去操作比如说过去我们在工作和生活中的常用的一些流程吧他更像一个个人助理类的事情。
主播/泓君|00:14:47 OK,所以其实后面 OpenClaw 真的出来的时候,你反而觉得它在工作上没有帮你太大的忙?
黄东旭|00:14:54 编程上没有,日常生活我觉得肯定是一个很好的东西。当时我觉得它代表了一个信号,其实对于一些玩 Agent 玩了很久的,比方从 Claude Code 开始的这一波弄潮儿吧,像我这样的其实 OpenClaw 的出现,它其实只是说把 Claude Code 以及像 Codex 这些编程 Agent 代表的一个理念,就是 Agentic Loop 加上工具调用,把它变成了一个更 general,对普通用户来说门槛更低的东西,相当于让它走进了千家万户。
张宏江|00:15:26 我觉得事实上 Peter 作为 OpenClaw 的作者的话,他能够花一个礼拜就把 OpenClaw 做出来,对于我来说最大的意义在于宣布了大模型的能力过了一个坎儿。刚才东旭所说的三个月他能够做一个最复杂的分布式的数据库这其实标志着大模型的能力跨过了一个坎儿
主播/泓君|00:15:57 就是真的可以落地应用了
张宏江|00:15:59 大家可以真正的把聚焦从原来的大模型本身到大模型的运用这边包括编程包括用它来做其他的系统再一个就是说我刚才强调 Peter 他作为一个架构是一个软件工程师而不是作为一个 scientist 意味着其实你也未必再需要那么深入的懂大模型本身的机理,你就能够去用它来做你想要做的系统。这标志着从研究进入工程,从那个模型进入 Agent。
主播/泓君|00:16:31 这个总结特别好,你觉得是哪一版模型它的能力做的这样的一个跨略?
张宏江|00:16:36 Cloud 的这个 Open 是 4.4,4.5,4.5,4.5,去年 11 月份,去年 11 月份。
黄东旭|00:16:43 我是从那个 GPT 5.4 开始,去年 7、8 月份吧。
主播/泓君|00:16:47 对对,然后我记得去年其实在 OpenClaw 出来的时候呢,就是我遇到了蛮多的 Founder,他们会给硅谷 101 写信啊,他们会说像 OpenClaw 这样的 Agent 的产品我们也搭建了。对我也能写,我们搭建了很多类似于这样子的 Agent,而且你可以测一测我们的这个效果不比它差,所以当时为什么是 OpenClaw 火了?
黄东旭|00:17:10 我觉得很多事情你事后诸葛亮,总是有道理的。但我可以从一个开源爱好者的角度去说一下。首先 OpenClaw 其实是一个开源软件,开源在今天的天生更具有传播力吧。当你做一个 Agent 的时候,如果你是个必源的商业产品,大家可能就,你这个是不是广告什么的。但如果是一个民主化的开源的软件,大家每个人都可以去用一用。这时候它的传播,尤其是在这种 geek 的圈子里,我觉得……一开始大家去看 OpenClaw 的传播,其实都是在一些极客和一些工程师的小圈子,然后慢慢地扩圈。
黄东旭|00:17:46 这帮人是对这种商业软件或者说币人软件或者说平台的软件多少有一点点抵触心理。但如果这时候是一个哇,这个完全开源,而且大家有没有注意到 OpenClaw 一开始的理念叫 Local First。我所有的这些隐私的东西,我的数据,我都要在本地给配好。当然我非常理解作为一个硬核开源工程师的 Peter 做出这些技术选择的原因,因为这些选择完全是一个 Geek 会做出的选择。而且这个 Geek 这个圈子传播力我觉得还是挺强的,对,有点像当年 Linux 的这种感觉。
主播/泓君|00:18:21 我自己当时看这个 Peter 的思想啊,就我看过他一些访谈,他有一个想法挺特别的,他说我其实是可以把我个人所有的东西,所有无隐私的全部交给 AI 的。因为正是因为他给 AI 开放的权限如此之广,所以他才说要把这些信息资料配置在本地是很重要的。然后我觉得还有一个临界点是当时正好是 Cloud,他又升级了一下他的模型。就是那一版的那个模型智能,至少从我当时使用的感受来说,我觉得跟前几版的那个智能是天壤之别,然后后来我觉得效果很好。
黄东旭|00:18:57 那个时间我觉得大概是二月份春节的那个时候。但其实作为一个 engineer,其实在去年的 11、12 月份已经感受到这个浪潮了。
张宏江|00:19:06 我觉得皮特他自己也说,那时候他用这个 Cloud Web Coding,他一直觉得像 OpenClaw 那样的东西,现在 ready,可以做出来了,而且用户也会需要这个。但是他当时认为这是大公司一定会做的事情啊。他等了几个月,问他们大公司还没有做,所以他把他 hack 出来了。是的。这个故事也说明了其实当大事 ready 之后的话其实就需要一个人捅破一张纸而 OpenClaw 正好是捅破了一张纸。
张宏江|00:19:33 另外当然是 open source 这件事这个 community 很有意思。它一出来以后它一周以后还是几天以后你买出了一个 mobile 就相当于一个 Agent 的社交网络或者是你的 OpenClaw 和我的 OpenClaw 这样一个社交网络。那这种爆发是如此的寻找中间发生的这些事情本身也是一个非常好的传播事件啊。包括他们成立了几个教很快就大家推选了几个先知。这本身也是让人们突然意识到 Agent 本身的能力真是达到了我们之前所想象的这种自主量的能力。
张宏江|00:20:05 所以这个是我觉得 OpenClaw 自会这么快速的传播,快速的进入到每个人。另外从时间点上来说,大家用 Chatbot 也是用了三年多。你只能交流而不能够让他来做事儿。这个时候也是,大家从 Claude Code 看到可以开始做一些事儿。那 OpenClaw 出现,正好让大家意识到说你经历的日常,你在 PC 上做的事情在手机上做的事情,其实 Agent 基本上都能做。
主播/泓君|00:20:31 他有哪些不足呢?
黄东旭|00:20:33 因为刚才其实张老师也提到了 Peter 一个人 vibe coding 了一个礼拜出来的东西,他自己可能也完全没看过代码。其实很有意思,Peter 是某一个时间,应该是 Anthropic,他的个人 token 消耗量据媒体报道,他 30 天内的 API 使用金额高达 130 万美元。
主播/泓君|00:20:51 你说他做了 OpenClaw 之前还是之前?之前就是。他之前就一直在玩?
黄东旭|00:20:56 一直在玩这个。东西做得很快,但是这个东西的质量其实没有精雕的细作。给极客用没问题,但是当你变成一个广大用户都在用的时候它各种配置的难度啊,或者是它的系统的稳定性啊,就各种成问题。所以这是我觉得第一个问题,就是我觉得给我的启发是什么呢?今天很多人说随便任何一个人闭着眼睛就能 vibe coding。一开始我觉得 OpenClaw 这个例子可能好像也似乎说明了这个事情,但是后来慢慢的你这个软件做得越来越深,你就会发现好的一个软件工程的习惯和经验还是非常非常重要的。
黄东旭|00:21:32 当你的这个软件的复杂性超过一个临界点以后,你要去花更多精力再去提升体验和提升这个稳定性的时候,我觉得非常非常 senior 的研发团队还是非常必要的。第二个的不足,我个人觉得就是还是起得太早了。我觉得它更像一个实验性的项目,可能 Peter 一开始也没有想到他会做得如此爆款。但今天大家可能也看到,现在可能 OpenAI 的自己 Agent 上的这个经历也慢慢从 OpenClaw 这个开源的项目,实验性的项目转到了他自己的那个 Codec 上面。
黄东旭|00:22:06 所以我觉得这种持续的资源投入可能也会成问题。所以到最后我觉得跟他的 DNA 是非常相关的,他就是一个极客圈子里面自己玩的一个原型,所以我觉得他的终局可能天花板也就是这样了。而且现在他其实有点像扮演一个普罗米多斯的角色,把这样的产品形态,这样的产品能力让世人知道了,他的历史使命可能就完成了。
主播/泓君|00:22:31 对,所以你觉得他可能也很难爆火跟持续地走下去,他现在基本上也是在靠他的基金会在运转,因为创始人 Peter 他已经是去 OpenAI 了嘛。因为在 OpenClaw 出来以后有一段时间里我身边还挺多人都在玩的。我看大家提的觉得最不好用的一个点就是你怎么让它记住你过往的历史偏好然后你怎么让它有一个更好的记忆功能因为如果你用的越多你就会发现当你不是做这个记忆的储存的时候它会不停的回滚那这个一个是特别的小好 Token。
主播/泓君|00:23:07 他也会带来很多记忆的混乱。那这个情况下呢,就是我看还出现了之后爆火的一个 Agent 叫做 Hermes。他其实是一个 Web3 的机构叫 NARS Research,他来做的。
黄东旭|00:23:19 东旭你应该也是用过这个 Agent。我是 Hermes 的中度用户。其实在 Hermes 出来以后,我很快就从 OpenClaw 切到 Hermes 了。刚才你提到的 Memory 这个点,现在仍然是一个 Open Question,并没有说谁家就解决得非常非常好,而且大家也都在尝试各种各样的记忆,就是做旁路记忆的方式。只能说今天肯定比当时二月份的时候 OpenClaw 出来老是忘事的情况要好很多,但是仍然我并不觉得它是一个 Perfectly 去解决记忆问题,今天我觉得还没到这个阶段。
黄东旭|00:23:54 Hermes 我觉得它的亮点是另外一个亮点。他其实很巧妙地绕开了记忆的问题。他并不是说记忆模块设计的多么出彩而是他在他的 Agent 的框架里边有一个很强的倾向去不停地总结成功经验,总结成 skill。其实小龙虾的 Agent loop 里边它缺少一个反思的过程就是它的反思是比较少的你除非主动地要小龙虾说你把前面做成功的你给我整理成一个 skill 之类的。但是 Hermes 引入了很多类似的机制他就能够持续地优化自己你用着用着用一段时间就发现,它长出了很多最佳实践,都是以前你自己做过的这些最佳实践,变成一个 skill,然后记下来了。
黄东旭|00:24:34 我觉得这是它的一个亮点。虽然它可能在广告里提这个实际上第一个自我改进的 Agent,或者说会自我学习,这些都是 marketing 的词。但是我们看到本质它其实就是用模型的能力,加上一些工程化的手段,总结成功经验去把这些能力变成一个可以附用的一个个 skill。
主播/泓君|00:24:55 可不可以理解成它的运营很强,因为它会成变成各种 skill。
黄东旭|00:24:58 对对对,我觉得这是个工程问题,它跟模型本身的能力我觉得并不相关。它只是说我在这个里边,我发现每一次成功了以后,我就尽量的做个记录,或者说我去把前面的经验我自己再总结一下,就有点像一个更好的学习习惯吧。但它另外一点我觉得做得非常好,因为刚才说到 OpenClaw 的代码质量和稳定性其实挺成问题的。Hermes 显然是经过精心设计的一个软件的架构。因为 OpenClaw 我觉得更像一个大集市,每个人有什么想法直接往里面提交。
黄东旭|00:25:30 Peter 也是非常 open 的,谁有什么想法直接合了,我代码也不看了,Agent 说没问题就行了。Hermes 会稍微好一些,它其实还是由团队精心在打磨的一个东西,所以你的 onboarding 的体验,各方面稳定性都会比 OpenClaw 更好。
主播/泓君|00:25:46 Hermes 怎么赚钱?他们的商业模式是啥?
黄东旭|00:25:50 我觉得今天你有足够的用户量,能够帮不同的模型厂商带 Token 的消耗,你的商业模式简直不要太多。比如说,我有几个例子,在 Hermes 里面我可能跟某一个模型厂商去谈一个渠道,我这边能够帮助你去消耗更多的,更低的折扣拿到 Token。其实在这里面它充当一个入口,入口是很重要的,所以哪怕今天我觉得做 Agent 的本身,就像刚才张宏江老师说的,今天已经成为了一个工程问题,其实谁都能做,但是呢,最后发现这个入口会变成兵家必争之地。
主播/泓君|00:26:27 所以它本质上它的商业模式还是 Token 经济学。
黄东旭|00:26:30 我觉得是的,今天看到是的,但是未来我觉得可能会有更新的。
主播/泓君|00:26:34 更新的,比如说用户付费各种。
黄东旭|00:26:37 对,用户费,甚至 Agent 互联网,社交,那这些都是我们今天歪歪的。
主播/泓君|00:26:43 它有一点像移动互联网时代爆火的超级应用。
黄东旭|00:26:47 对,甚至更极端点,往下推演的话,它也许会变成唯一的应用。因为未来可能每个人的跟数字世界打交道的入口可能就没有 APP 了。你想象一下今天小龙虾出来以后我再也没打开过我的 Gmail。我都是每天让我的 OpenClaw 来说,我这几个小时有哪些新的邮件,哪些需要回的,如果有一些广告的资本我删了吧。
主播/泓君|00:27:09 那这个就是你怎么去判断重要的邮件怎么回复,以及需要你个人信息的邮件怎么回复。
黄东旭|00:27:17 但我不能代表所有人,但我是一个智能原教旨主义者。我相信,比如说一个 OpenClaw 的 4.8,他判断这封邮件是重要的邮件,那对我自己来判断,大概率也是重要的邮件。
主播/泓君|00:27:31 你相信他?
黄东旭|00:27:32 我相信他。
主播/泓君|00:27:33 他有判断错吗?
黄东旭|00:27:34 会有一些时候他判断错,但他至少说都能告诉我,他不确定的时候把这个…他会直接告诉你说我不确定?它看起来像一个广告,但是我现在不确定,你来再做最终的判断。不仅是邮件,比如像你订阅了很多那种邮件组经常给你发文章,什么 Hack News 什么这些。你有没有发现最近你越来越多地开始依赖 Agent 作为入口去消化这些信息而不是再跑到《纽约时报》或者说跑到 Hack News 上去一篇篇地去看文章。
主播/泓君|00:28:05 它会给你总结还是它会给你一个全文?嗯。
黄东旭|00:28:09 我现在一般是先扫一遍总结,如果我看到感兴趣的,然后我再点到它的原文里面再去看。
主播/泓君|00:28:17 所以它变成了一个类似于有一点像新闻集合的这样的一个 APP,一个总结。
黄东旭|00:28:22 是的,是的。
主播/泓君|00:28:22 哇,我觉得这个对媒体行业的冲击很大呀。
黄东旭|00:28:25 那是呀,那这个已经发生了好久了。
张宏江|00:28:27 对,这些有点像新的形态的记事头条,只是说它不光是帮你读新闻,帮你读 email,帮你读所有的发给你的东西啊。
黄东旭|00:28:36 嗯,嗯。而且你想象一下,像你的个人 Agent 是拥有你所有的 footprint 的,就你的记忆、你的浏览的记录、你的偏好。这些偏好又会持续地……之前像 OpenClaw 有一个社区里面有个词我用得特别好,叫养龙虾。养这个东西就是说你会不停不停地去迭代,让它更理解你。所以我觉得这里面颠覆的是可能传统这些媒体的推荐系统什么的。天然系统它只能说我根据大的数据或者说整个社会的一些 trend,这个模型训练出来一个推荐算法。
黄东旭|00:29:10 但我觉得真正终极的推荐算法就是在你本地,在你旁边坐着的一个观察着你生活在数字世界的甚至物理世界的所有的 event,同时它是一个智能。
主播/泓君|00:29:22 对,我用过一段时间就让 OpenClaw 帮我精选一些新闻啊。我觉得我最终没有用了的一个核心原因还是它给我的东西太浅了然后我觉得很多东西我还是要看到一手的新闻跟我更愿意读更少的文章,但是更深度的文章。但是我觉得还有一点就是他帮你回邮件的时候,因为邮箱信息里面其实涉及到很多,就是简单的信息是很好用 Agent 回的,但是最难的是涉及到你要做决策的时候。比如说今天我约了你来录我的播客,你要自己去想我录不录,我什么时间录,我的开放时间窗口是什么。
黄东旭|00:29:58 这些需要决策的事情我肯定不会让他完全去做这个决策,而是需要让我决策的时候让我 let me know。只是说我在用我的 Agent 当一个 filter。
主播/泓君|00:30:10 之后我看你又有过一次的迁移的心路历程,就是你转到了 Slock。他是 Kimi CLI 的负责人,钱宇超创立的。
黄东旭|00:30:19 对对对,RC。
主播/泓君|00:30:20 这是一个什么样的 Agent?
黄东旭|00:30:22 很有意思。首先我是 Slock 的第一个天使投资人,也是他最早期的用户之一。Slock 后来改名为 Raft,但是为了大家理解方便,我还去用 Slock 这个名字。大家肯定用过 Slack,是吧?Slack 是大家在一个会议室里,一个 channel 里边,然后互相的讨论聊天的一个平台。Slock 顾名思义就是把这个想法平移到了 Agent 上面。它的产品形态可能也像是一个聊天室,但是里面在聊天的都是 Agent。
黄东旭|00:30:53 然后这些 Agent 互相不 share 自己的 context,他们唯一 share 的是聊天的 channel 里面的信息。
主播/泓君|00:31:01 这个跟 Moltbook 其实是有一点像的,有一点点异曲同情。
黄东旭|00:31:05 我觉得 Moltbook 更像一个社会学实验,但这里面 somehow 这个模式是有用的。只是说它作为一个 Moltbook 的这种实验,大家就很容易被它的这个行为艺术的方面忽略掉它有用的那一部分。有用的部分就是,我又在一个小范围内针对某一个话题,Agent 之间的讨论,虽然可能百分之八九十的时候都是在车轱辘化。但我觉得 Agent 有一个好处,尤其是智商比较高的模型,它没有 Ego。
黄东旭|00:31:36 所以当某一个瞬间某一个 Agent 提出了一个大家没有看到的想法的时候,大家马上就会发现,哦,你说的有道理啊。于是这条重要的信息就会再次触发这些 Agent 的讨论。我经常会用 Slock 去做一些复杂软件项目的代码审查,就是说这段代码提交,你不要说通过了就合并了,比如说 10 个 Agent,里面有一些是 Claude Code,有一些是 Codex,然后都是顶级模型,然后在大家都充当给这段代码挑刺,对吧?
黄东旭|00:32:11 有些人可能简单看了看说我看了三个刺儿,然后下面一个人说我也看了,前面的三个刺儿我也认同,但是我又发现了一个新的。然后你就发现上面那个看出三个问题的时候,哦,哥们你说的有道理,然后我在这个角度上我再继续看一看。这么持续的迭代,可能 Token Maxing 一下,你就会发现它会比单个模型在 OneShot 上去 review 这份代码挑出来的问题和改进的深度是完全不一样的。
黄东旭|00:32:42 它唯一付出的代价就是可能我的 Token 销量是普通的 10 倍。这个就是为什么我刚才说我有一段时间真的是 Token 销量非常大。
主播/泓君|00:32:50 最大的时候有多少?
黄东旭|00:32:52 就像刚才我说的嘛,就是一天大概是 1 billion 的 Token 消耗量。
主播/泓君|00:32:55 对应的账单是?
黄东旭|00:32:56 对,就对应的账单大概三四百美金嘛。对,我当时用法就是这么用的。同一件事情并不是说 Agent 干完就干完了而是任何关键的决策之前都要让 Agent 通过这种方式不停地在一个群里讨论。我会强制要求他做完这几轮讨论,虽然我也不看他的结论。但是我相信你只要 Token 在这个正确的事情上消耗到一定的程度当然我有个终止的条件就是当你们谁都挑不出更多的毛病的时候你就停下吧。我觉得 Slog 在我们团队发明了一个很有意思的词叫做 Agent 动力学。
黄东旭|00:33:33 平时大家经常会发现让 Agent 持续很长时间运行是一个挺难的事情。其实我觉得今天所有的不管是 Harness 也好还是 Loop Engineering 也好它其实就在优化一件事情就是怎么能让一个 Agent 在一个特定任务上
主播/泓君|00:33:47 持续不停地干活。对。
黄东旭|00:33:50 你能说 Slock 就找到了一个大家一起弃嘴罢了讨论的方式让他持续干活。Loop Engineering 是每次他要停下来的时候强行抽自己一鞭子然后再回头去 review。Harness 就是说把多个工作流搞得越来越复杂。最终的这个效果就是大家能持续长期地干活。为什么需要时间长呢?就是因为有时候模型虽然今天很聪明但是它 one-shot 的时候仍然还是会有一些 hallucination 或者说在一些小的点上考虑了没有那么周全。
黄东旭|00:34:21 这时候你再进入一次迭代它就能看到以前看不好的东西。我觉得这跟人类社会多少有点像呢?就比如说小时候我们做作业做完作业了以后父母总是说你再重新算一遍看看有没有什么问题。然后有时候你就会发现哦,我第一遍的时候确实马虎了。
主播/泓君|00:34:37 对,所以我听下来你现在使用 Agent 已经有一个过渡了呀,就是从自己搭建 Agent 的框架到 OpenClaw 到 Hermes 到 Slock 从使用单个的 Agent 到使用到了一个 Agent 的群组,然后让这些 Agent 相互 check,同时从比如说我们一次让 Agent 读个邮件,他可能一会儿就做完了以他的能力来说。嗯,过了三个月又迭代了。
黄东旭|00:35:22 又迭代了。我觉得最核心的变化有两个关键,一个是 GPT 5.5,还有另外一个是 DeepSeek V4 的发布。最近的一个事件是 Fable 5。这三个事件我分别说一下对我刚才说的那种 Token Maxing 的认知发生了一个巨大的改变吧。
主播/泓君|00:35:39 嗯,开始要转向 Token Efficient 了。
黄东旭|00:35:42 对,是的。我就从 Fable 5 开始说起,我觉得 GPT 5.5 是有点类似的。Fable 5 的模型强大到,因为刚才其实我说这种把多个 Agent 放在一起讨论有一个前提就是你不相信任何一个 Agent 在 OneShot 的成功率你一次让他干一个活儿,一复杂他就干不出来或者说可能调用链路比较长的时候他会故此失比,经常会有这种问题。所以你就需要多个人三个臭皮这样凑在一起,让最终结果有个兜底,或者说大家多次讨论,充分地利用好自己的上下文空间。
黄东旭|00:36:16 但是 Fable 5 强到这些人讨论半天讨论不出来的东西,可能在 Fable 5 的绝对的智商面前一次就解决了。所以这时候你就会发现,我前面烧了 10 亿 Token,在 Fable 5 这边非常精准地一次搞定了。
主播/泓君|00:36:32 所以绝对的纸上黏眼,而且他还没有之前的上下文。
黄东旭|00:36:36 还没有之前的上下文,我就直接说有一个很复杂的 bug,或者想做一个很大的功能。那边他们已经讨论了,不想再讨论了,但是还是做不出来。
主播/泓君|00:36:45 那这是不是证明只要模型的智力足够强,他真的是一个人可以干掉一整个互相验证的 Agent 的团队?
黄东旭|00:36:54 我觉得这是 yes and no。yes 就是说在一些单点的复杂问题上,哪怕是很充分的 Hermes 也会遇到一些搞不定的事情。这时候你还是能期待一个更强的模型在这种专家级的低于难度的问题,它还是能搞定的。第二个就是 DeepSeek V4 的出现。我发现它的能力已经强到了开源模型非常实用的状态。以前我是不相信开源模型的,尤其在我一些主要的复杂的软件开发工作中,我是不信任开源模型。
黄东旭|00:37:27 但是 DeepSeek V4 开始,我又发现这个东西它的质量已经非常高了。最近很大的新闻是那个 GLM 5.2,又把我对开源模型的认知往前推了一大步。
主播/泓君|00:37:38 质朴的这个。
黄东旭|00:37:39 对对对。这标志着我可以用顶级的模型与这些便宜的又很聪明的开源模型做协同。就很像一个企业真正出现管理学了是吧?就你不可能说一个公司里面整个公司全都是像张宏江老师这样的非常资深的专家你仍然还需要很多像我这样能写扣的工程师一起去协同。所以我觉得慢慢的头部模型跟开源模型的配合这个是一个更经济的方式。
主播/泓君|00:38:07 开源模型你是搭载本地?
黄东旭|00:38:09 都是本地。
主播/泓君|00:38:09 你现在用的是 v4 还是质朴的 GLM5.2?
黄东旭|00:38:13 在我自己本地运行的是 DeepSeek v4 的 Flash 是在一台我的 Mac Studio 上去运行的。它其实可以在你的家里的电脑运行大概能到 30Token 每秒。这个速度其实已经跟你在网上用 OpenAI 的 API 什么的这些 Chatbot 的速度已经差不多了。这个是最近的一个认知的更新吧。
主播/泓君|00:38:36 我可不可以理解成当你在本地搭了 DeepSeek V4 的模型以后,有一些任务你不用去掉 API 接口了,然后你所有的消耗就是电费跟你的电脑折旧的费用,它其实也没多少钱。
黄东旭|00:38:49 是啊,几乎在它完成的任务面前可以忽略不计,我觉得。
主播/泓君|00:38:53 对,我看之前你有提到一天的电费可能就是在一美元左右,一个月二三十美金。
黄东旭|00:38:59 而且这还是在满载的情况哦。
主播/泓君|00:39:01 我理解它搭建的就是一个初级员工的环境。
黄东旭|00:39:04 我现在在用开源模型做两件事情,一个是大量的重复性的日常工作比如说像我自己的文章记忆和数字的逐级的整理,就是我自己的一个蒸馏。第二个事情就是,其实有很多以前我不敢让 Opus 放开干的。有时候我特别喜欢看论文,但是看不过来,所以我就经常会说今年 CVPR 所有的论文,NeurIPS 所有论文,你先帮我总结一遍,看哪些有意思的再给我汇报一下。像这种一期可能有几百篇论文这样的规模的时候,你不可能用这个 API 或者付费的去干的,干不了,太贵了。
黄东旭|00:39:41 当时我就在自己的开源模型上就跑一个工作流浪,持续在那跑着。我觉得会 unlock 非常多以前我不敢在付费的模型上做的事。
主播/泓君|00:39:52 太贵了吗?太贵了。就看一批论文可能得击败刀。
黄东旭|00:39:56 对,但我觉得这是个心态上的变化。并不是我掏不起这几百刀,而是会想着这个东西不是我控制的。
主播/泓君|00:40:03 嗯,我懂,就是你不知道它会跑出多少的 API,多少 Token 的价格。
黄东旭|00:40:08 所以我觉得这个有一个很好的比喻,就像欢带。因为我觉得最后啊,它可能顶级的币源模型通过 API 的这个依然会存在。但是开源模型加上开源的硬件,以及购物用的开源模型,也会产生一个非常大的生态。在宽带出来之前大家知道,哇,我第一次上网 97 年,还是播号,它是花你电话费的,上网一分钟可能就是几分钱这样的,所以大家上网都是省得上。但省得上的这个时代一直我觉得到这种免费的宽带,包括现在手机上的大容量的套餐。
黄东旭|00:40:43 才会去催生出很多像抖音、像视频的会议,各种各样这种新的应用出来,在那个时候肯定是不行的。所以我觉得模型或者智能这件事情免费跟很低的费用,它仍然是有个天壤之别。
主播/泓君|00:40:58 所以现在你把你的 Agent 一部分相当于在云端,然后一部分在本地,做了 DeepSeek V4 Flash 的这样的一个本地模型的组合之后,你的账单降到了多少?
黄东旭|00:41:10 这我觉得是跟我的 workload 变化有关。那个项目已经过了代码非常非常疯狂的堆积的那个阶段了。我现在账单也就一个月两三百美金了,就是一个正常的账单。
主播/泓君|00:41:21 一个月两三百美金,那很便宜啊,那这个跟订购一个 cloud 价格也差不多。就是订购 cloud 的价格。
黄东旭|00:41:26 就是 cloud 最高版本的价格。一个最高版本的 cloud 加上一个最高版本的 codex。基本上套餐的钱我都用得满,但是我慢慢地从 OPUS,我的主要模型现在变成了 GPT 5.5 和 5.6 以及 Codex。
主播/泓君|00:41:40 是因为 Codex 比较好用。
黄东旭|00:41:42 对,我个人感觉比较好用。但是在一些最复杂任务的时候,还是 Fable 5 非常惊艳。
主播/泓君|00:41:48 哪些算复杂任务?
黄东旭|00:41:50 就像一个数据库里边疑难杂症,或者说有一些需要修改七八个模块,同时提交五六千行代码要解决的一个很难的问题。反正我自己的一个标准就是,当我在 Slock 里面的 Agent 开会解不了的问题。我都会让你们现在别干了,给我写个报告,为什么你解不了。然后我就转身把这个报告发给 Fable 5 说,你看这是他们前面的问题。
主播/泓君|00:42:17 他们还能写报告。
黄东旭|00:42:19 那肯定,你只要要求他们写,他肯定能写。我觉得这是代表一种新的能力。其实做这些事情的时候,我都完全不关注底下的代码。我其实就关注一些很有限的事情,细节我已经完全不关注了。
主播/泓君|00:42:30 就目标跟最后的执行结果。
黄东旭|00:42:33 对,目标、验收以及这个事情的架构应该怎么做。中间的这个过程,我其实是不停地在去调动不同的 Agent,不同的能力,让他们更好的协同。我觉得后来会变成这种 Agent 的管理学吧。
主播/泓君|00:42:47 对,所以现在这个是你的终局吗?就是还会有再一步的进化吗?
黄东旭|00:42:51 肯定会有啊。
主播/泓君|00:42:53 现在进化到这个阶段了,就是本地模型加上云端的模型一起搭配的 Agent 的团队。
黄东旭|00:43:00 反正我过去这一年学到最大的事情就是千万别随便说什么叫终局。第二呢,永远相信 Scaling Law,永远相信智能。我至少还没有达到某一个点,这个点是说人类已经无法评估这个模型好坏了,我觉得今天还没到这个点。一个模型好跟坏你还能看得出来,Fable 5 就肯定比 DeepSeek 要聪明,但是我相信不久的未来可能真的会出现到某一个 moment。哪怕是开源模型,你都没有办法评估它,因为它太强了,以至于你问了任何问题,做了任何复杂操作,它都能干,那这时候它再强,我们已经没有参考系了。
黄东旭|00:43:38 我觉得这天其实是能看得见的。
主播/泓君|00:43:42 对,然后你觉得从你的最大化使用 Token 到开始经济的使用 Token 的这一套转变中你预测未来像硅谷的这些大公司,他们会多久把这个工作范式转过来呢?
黄东旭|00:43:55 我觉得现在正在发生了。
主播/泓君|00:43:57 所以 Cloud 跟 OpenAI 它们每个月 API 的消耗量跟 ARR,你觉得它还会是在一个持续的增长中吗?
黄东旭|00:44:06 我觉得还会增长。这两个其实你不能完全放在一起类比啊。我们先说 Agent 为什么这么消耗 Token。当然大家也不要神话 Agent,其实 Agent 从工程上来说原理上还挺简单的。每一个 Agent 的内部它都有一个类似像发动机一样的东西,我们叫做 Agentic Loop,它就是一个内部的一个循环。这个循环每一次都会在中间调用大元模型去相对问问题或者说去对话,它本质上还是个对话机,只是说把这个对话的过程变成一个 Loop。
黄东旭|00:44:34 然后这个对话,第一它的特点是,它在对话里边去调用外部工具,然后把外部工具的输出变成这个对话流中的一个上下文。第二个特点就是,它在复杂或者说长程任务下,不一定会说两句话它就结束这个循环,这个循环可能会运行几百步。这几百步中间又会有很多的工具调用,这些工具调用的输入跟输出又会变成代言模型的上下文。这种 pattern 就导致了 Agent 对于 Token 的消耗量比 Chatbot 时代可能涨了 100 倍都不止。
黄东旭|00:45:08 虽然今天我觉得有很多人为的浪费,就比如 Meta 里面刷 Token 的榜可能你就跟 Agent 说你帮我去算 100 万遍 1 加 1,你也能把这个榜刷得很夸张的。但是只要这样的 pattern 是存在的或者说成立的,还会有更复杂的系统出现。我举个例子,今天我们其实在聊 Agent 的时候,刚才我说这个架构只是单个 Agent 内部的架构。因为我觉得到最后其实可能是一个在面向更复杂的问题的时候就需要多 Agent 的协同。
黄东旭|00:45:39 这个协同又会变成一个更大的网络,这个网络之上又会有一个更抽象的 loop。我觉得这种 hierarchy 的结构现在已经在出现了。
主播/泓君|00:45:48 所以你觉得即使说我们现在在找到一条本地化 Agent 尽可能地节省 Token 的量,只是说它是单点的问题,我们把它就是解决得更好了,但是整体上它的消耗还是在持续地增长中。
黄东旭|00:46:04 因为这里面有个软件工程的问题。我们今天其实可能看到的这些程序,比如我在类比一下计算机历史在早期的,比如在嘉宾俱乐部里面那些计算机爱好者当时在分享,我写了个 200 行的 basic 程序,这个游戏很好玩,大家 share 一下。可能那时候的程序就是几张纸,一个程序员几千行会编代码可能就结束了。但今天我们就看一个 Photoshop,没有数千万级的代码,对吧?所以我觉得今天我们的 Agent 的应用,以及我们想要让 Agent 解决的问题还太简单了。
黄东旭|00:46:38 如果 Agent 的能力到达一定程度要去解决更复杂的问题的时候它必然会出现一个 Agent-to-Agent 的 Network,以及 Agent-harness 的软件工程出现。这时候它对 Token 的消耗又会上一个台阶。
主播/泓君|00:46:52 对,张宏江老师怎么看?
张宏江|00:46:54 其实刚才东旭描述的这个现象的话,在经济学里面叫做 Jevons Law。就当你的技术越来越成熟的话,它的价格会变得越来越低,但是消耗量本身会变得越来越大。所以这样的话,它这个市场变得越来越大。那未来开源模型、闭源模型哪个能够走得更快,或者哪个是在本地,哪个是在云上,这个我觉得更多的是一个生态里面的那种竞争,生态里面那种成熟。今天还很难判断哪个最后能胜出,那还是说你就需要一个 Agent,或者对于我们常人来说的话,是需要一个工作的 Agent,一个生活的 Agent,还是说像东旭这样需要多个 Agent 来做事。
张宏江|00:47:32 其实不同的人群还是不太一样啊。今天之所以包括在企业内部大部分的 IT 上了云它一个很核心的一点其实对于一般人来说他们没法 handle 复杂的 IT 系统一个公司的话它也很难养一个 IT 团队它能够 handle 如此复杂的 IT 系统对吧所以如果你将来带有很多 agent 这样的话他可能也很难 handle 这么多 agent 都不要说
主播/泓君|00:47:56 你说 agent 自己去 handle 其他的 agent 的庞大的系统
张宏江|00:48:00 公司整个这个环境嘛要搭起来这个环境那当然你可能会把它交给更强大的 agent 去做对吧这个强大的 agent 可能就在云上我们做 IT 的人或者是做 IT 产业的人都会希望自己今天的产品未来会在这个生态的核心位上比如说如果你是做 PC 的如果你是做小服务器的,你就希望这个都是 on-premise,本身我可控。你是做云的,你就希望是未来都在云上。这样的话呢,对于用户来说就变得 transparent,他就不需要考虑加购啊,甚至不需要再考虑我要买一台 Mac 还是我要买一台 Dell 的一个服务器,还是我要买一台联想的小型服务器。
张宏江|00:48:39 下面的这种 evolution 的话,还有很大程度上是一些非纯技术的一些考虑啊。有一点我是非常同意的,一个是单个整体的智能本身会变得越来越强。
主播/泓君|00:48:50 智能本身变强也会更加消耗 Token,对不对?
张宏江|00:48:53 对,我跟他讲一下,你会更加消耗 Token,但是 Token 的价格也会降得非常快。最终他不一定说他的 ROI 会受到太大影响,事实上他能做的事情会越来越多,他可能做的事情消耗的 Token 可能也越来越多,但是另外一个角度刚才东西也提到,越来越高的智能使得 Agent 本身可能也不需要持续的去问大模型,所以他可能这种对话的频率也可能降下来,所以也许他消耗量可能不是那样的。未来一定是一些超级强的 Agent 和超级大的蜂群来做事情。
张宏江|00:49:28 这些群里面的每一个 Agent 也许他是特别擅长于某一些任务或者也许他的背后所用的模型可能比较专用,或者比较小,或者 Token 价格比较低。那也许另外一种就是他们都是由一两个非常 Powerful 的大模型来驱动这个是还需要不断的 Involve。
黄东旭|00:49:47 这个层面上会有一些涌现的智能出现。
张宏江|00:49:48 对,会有一些涌现的智能出现。就最近有一篇清华大学的一篇文章就说到三个抽皮匠是超过一个诸葛亮。每一个 Agent 的能力,就他们的能力的和可能是低于他们事实上作为一个 Agent 群他们所能够展现的智能的能力。它不是一个简单的和的关系而是它可以涌现出一个更强的智能。这也是我们对于 Agent 群的期待啊。
主播/泓君|00:50:13 对,因为刚刚我在跟东旭聊天的过程中,其实他讲到了他搭建了一个 Agent 群,然后让大家去发现一个问题,互相之间都没有发现。最后在 Fable 5 出来的时候,把这个问题可能是还没有那么多前庭其要的情况下给 Fable 5,然后他解决了。你觉得现在,比如说我们刚刚一直在讨论模型能力的智力的碾压式的提升,它可以抢过蜂群吗?
张宏江|00:50:38 这其实是一个非常好的问题啊。你还要记住另外一点,就是一个超级模型的出现,资历不断上 scale。但是呢,没有任何东西可以阻拦这些蜂群里面的每一个 Agent,他也利用这种资能。
主播/泓君|00:50:51 哦,了解。就是只要模型的智能在往上提升蜂群的智能也在往上提升。
黄东旭|00:50:56 我举刚才一个例子,那个修订啊。假设这三个车伍一样,一直讨论不出来。但是我只要把 Fable 5 也放进来加入讨论他可能第一句话,这些人马上就开窍了。
张宏江|00:51:08 就是刚才东西说的涌现吧。
黄东旭|00:51:10 只是它的可能涌现出这个 insight 的概率会更高。而且我非常认同张老师刚才说的那个观点。其实我觉得这个跟人类社会也是一样的。我不太相信说有一个绝对的中心,这种其实就太危险了。而且我觉得真正的一个 resilience 的系统它一定是一个大规模的基于简单规则连接的分布式系统。然后这样的系统我觉得才不管是对于任意复杂度的问题以及抗击打能力吧都是最强的。
张宏江|00:51:43 对,这跟做云的时候呢,一开始设计云和之前设计企业服务器的概念的区别啊。当云开始普及的时候,就是 AWS 开始设计云的时候,它觉得每一个单一的服务器或者单一的节点,它并不是用最好的我们叫做所谓的 Enterprise。他上云的时候他希望他的数据中心每个服务器还是 Enterprise 这么可靠性的这样的服务器,使得他的整个云的成本就会比别人高太多。所以最终你发现他其实不是一个技术的判断,最后是个经济学的判断,当然也是因为技术本身发展到他能够用比较合适的语来达到低于非常强的单一节点的成本。
主播/泓君|00:52:36 对,因为我们前两年就是在聊 AI Agent、锤类 Agent 会不会出现 Super 的 Agent 他有没有创业跟投资机会的时候我觉得所有创业者最苦恼的一个问题就是说模型的能力一升级然后你就把我这个 Agent 做的所有的工作都碾压了。那根据刚刚大家新的判断是不是说现在是一个非常好的去创建 AI Agent 的一个时机?包括彭江老师刚刚其实您提到了一个非常重要的观点就是你觉得我们现在在一个分界点上我们在从模型的科学研究变成一个工程能力的问题那工程能力其实就是 Agent 的强项。
张宏江|00:53:16 回答你刚才那个问题,是不是现在做 Agent 的很好的机会?显然是。但是你的 Hermes 的能力或者 Agent 的工作能力是不是能够让你能领先或者持续的领先或者是战胜大模型的公司但他的能力的提升是不是你自己不会被碾压?这块可能更核心的在于你是不是能够掌握 Enterprise 的一个随时应用的数据。数据的互相合可能会更重要。
黄东旭|00:53:42 当我们大家在去讲 Agent 的时候,其实在把很多东西混在一起。刚才说的垂类,有很多人说 Agent 是在说应用,就是最最上面对 consumer 或者说最终端的大家老百姓用的某个场景。相当于过去的 APP。对,APP。
主播/泓君|00:53:57 对。
黄东旭|00:53:57 然后有些人说 Agent 是说我这里边用到的软件技术设施也好,或者硬件技术设施也好,或者说一些通用的协议也好。那这是一大类的工作,就其实 infra。当然 infra 里边我也发现其实大家在聊 infra 的时候也会把很多东西混在一起聊。比如说 memory 是 infra 吧,然后那个数据是 infra 吧。搜索是 infra 吧,卡算不算 infra,也算 infra。
主播/泓君|00:54:23 对对对。
黄东旭|00:54:23 Sandbox 是不是 infra,也算。内存算不算,好像也算。所以我觉得这里边当然得分层次来看。我现在是觉得工程问题是集中在 memory、搜索、sandbox、environment、协同、harness。这一系列我觉得都是在大的 infra 范畴里边。这部分是我觉得有很多机会今天是可以做的。但是呢,最终端的面向纯客户的一些 APP,引号 APP,可能还稍微有点早。就像刚才说,我觉得模型能力提升碾压的还其实真就是应用这部分。
主播/泓君|00:54:58 嗯,所以它也是分类的,就 Agent 跟 Agent 也是不太一样的。对,不太一样。
黄东旭|00:55:03 对,因为两位现在也做投资啊,我们刚刚其实有涉及到应用现在是不是一个好的投资时机的话题,包括锤类的应用什么最重要,张宏江老师也说到了数据很重要。
主播/泓君|00:55:13 因为现在我觉得整个硅谷的创业公司可能都是 ALA 的创业公司,然后模型也就那么几家,可能也就出现了一些新的 Neo Labs,大量都是做 Agent 的。大家怎么去判断一个创业公司是不是值得投,什么样的特质或者什么样的方向是你们特别看好跟特别喜欢的?
黄东旭|00:55:31 首先我自己有个原则就是我不投我自己看不懂或者说我自己用不起来的东西。因为作为一个做 infra 这么长时间的工程师还是相信一点手感的。我现在是对这些基础设施类的软件项目尤其是能在多个 agent 之间更高效的让 agent 产生更好结果的东西。就比如说你正常用一个模型你只能产生比如说 50 分的结果。但是如果我用上了这一套东西,这个 Agent 的 team 也好,或者说这套平台也好,能够去交付出 80 分甚至 90 分的结果,就是我比较感兴趣的范围。
黄东旭|00:56:09 去看吧,哪些基础设施能够帮助这个模型产生更好的结果。或者说数据平台、记忆以及 context management,这个我觉得是一个很重要的。
主播/泓君|00:56:18 做模型的中间的这几个,对,我们还是在说基础设施,中间这几层基础设施。
黄东旭|00:56:24 第二个关键的环节是可观测性。当你要让 Agent、Team 或者说 Agent 去解决更复杂问题的时候我觉得你怎么去让更高级的智能或者说更有经验的人类能进去提升整个系统的迭代速度?我们今天其实没有任何办法,因为我们对于这个系统的可观测性不足。就比如说 Token Maxing 这个问题,所有的 CIO 今天都在问一个问题就是我这些 Token 到底花在了哪些事情是重要的事情上,哪些是白白浪费的?
黄东旭|00:56:56 谁能够回答这个问题,我就买谁的东西。对,我觉得这是第二个这种基础设施层面的机会是有的。第三个就是我觉得入口层面的做出 Agent 的应用的入口级别的机会比如说 Agent Cloud。我相信一个点就是未来这些不管是 Oracle 也好 AWS 也好未来在 Agent 时代会有 Agent 时代的 Oracle 有 Agent 时代的 AWS。
主播/泓君|00:57:19 现在的整个云厂商会有什么不一样吗?
黄东旭|00:57:22 会有一些不一样的,比如说这是我最近投的一个公司,Inforge,然后它其实的定位就是 Agent Cloud 吧。因为其实以前我们去看待 Cloud 都是卖盒子、卖资源、卖计算机的技术设施,把这些很复杂的 IT 系统的管控打包起来,卖一个标准的这些东西。但新一代的第一个区别就是以前的云还是面向开发者或者说面向人类。但是未来 Agent Native 的应用的基础设施它面向的其实是 Agent,就是你的主语变了。
黄东旭|00:57:54 所以怎么去设计一个给 Agent 好用的 interface,给 Agent 好用的资源分配的模式。我们今天其实谈到这种 Agent 的应用很多是一个比如说类似小龙虾或者 Hermes 配合上一些特别的 skill 对于每一个终端用户他的需求都是通过 Agent 来去出发的。这跟传统的云计算的逻辑是非常不一样的。因为今天这些 Agent 完成这类的 APP 最好的办法是完全给他一台沙箱或者说一台云计算机让他在里面干任何事情。
黄东旭|00:58:25 但是如果你想象这种类型的应用放在传统云计算上,你的成本是靠不住的。你不能说我给每个 Hermes 在企业级场景里面分配一个 EC2 或者说一个 Metalbox。你要想想,可能如果有成千上万个 Agent,每个人都要去占用一台计算机,那这个 cost 肯定不行。所以你需要找到一种 Agent friendly 同时 cost efficiency 的一个折衷。这里边我觉得就会有很多的,包括 Serverless 的这种技术,怎么跟 Agent 的环境,Agent 的 round type 结合在一起。
主播/泓君|00:58:56 对,我觉得今年整个的环境看起来是非常的 2B 的,包括我们刚刚讲到的 OpenClaw、Hermes,包括我们说大企业他们都在取用 Agent,包括在里面搭建他们的工作流,还有像 OpenAI 跟 Anthropic 在做的这个 FDE,其实整个都是针对于 2B 市场的,然后你刚刚讲的这三个方向呢,我如果没有理解错的话也全是 2B 的。那像前两年火的这些 Manus、James Park,这一类 2C 类的 Agent 在大家看来还是香的吗?
黄东旭|00:59:29 我不觉得 Manus 跟 James Park 它是 2C 的,它仍然是 2B,它 2C 只是它的…Too professional 对,professional,你其实可以从它的定价,尤其 Manus 的这个定价里面能看到。我觉得前面的这些比如 20 美金或者说更便宜的这个吸引 individual 去用,你可以把它看成 marketing,不要把它看成这个产品本身的定价。而它真正的重要的客户其实都是那些 professional,professional 一个月给 200 美金其实它对于 manus 来说是一个重点的一个客户。
黄东旭|00:59:59 但你想,一个专业的用户,一个月会花 200 美金去在上面的干活,那说明他一定是他有自己的 business,他要做这件事情不是随便玩玩的。所以我觉得他 somehow 也是一种 2B 的场景。
主播/泓君|01:00:15 所以他还香吗?
黄东旭|01:00:17 香,为什么不香?你可以看到最近的收入涨得非常快。都是可以投的。我觉得都是可以投的。
主播/泓君|01:00:26 好,张宏江老师。
张宏江|01:00:27 我们过去的无论是 2B 还是 2C,最终的用户都是人嘛。那下面我们看到的一定是你的目标用户是 Agent 本身。这个中间的话呢,会引出一系列的投资的机会。刚才东旭提到了,就是整个 Infer 相关的,无论是未来的 Runtime 还是今天我们谈到的这些 Infer。怎么来帮助把 Agent 做得更好,怎么能够把数据很好的 Channel in。为什么今天 FDE 大家强调的如此多,然后呢,两天前三天前微软宣布要成立一个 6000 人的团队,专门是做 FD,叫做 Microsoft Frontier Company。
张宏江|01:01:02 这边想强调事实上,大家看到就是怎么把今天的企业,今天的 Enterprise 然后转移到未来的 Agent 上去,Agent-based Enterprise。这中间,其实每一个企业要想生存它最终怎么是把它企业现有的 know-how,现有的 IP,现有的 workflow,它的所谓的竞争优势,最终体现在 know-how,体现在数据。我们过去说转移成一个大模型,转移成一个垂直模型,今天我们说可能更重要的是把它转移成一个超级的 agent,或者是一系列的 agent,或者是 agent 群。
张宏江|01:01:35 这个也是我希望能看到的投资的机会,可能就会要求你更垂直,要求你的数据费能更能够赚起来。
主播/泓君|01:01:44 更懂垂直行业的方法论,然后更有垂直行业的数据。
张宏江|01:01:48 那以前被大模型碾压的很多就是你用 AI 做一些以前移动互联网 APP 做的事情。你用 AI 仅仅是把它做成效率工具,然后你的应用本身还是传统的应用。那我觉得很容易被大模型给打穿,大模型能力提升一定会帮你很少。
主播/泓君|01:02:05 对,你刚刚提到了一个词啊,叫做 Agent Native。怎么去判断一个公司是不是 Agent Native?你们有没有一些核心的比如说判断的这个点?
黄东旭|01:02:14 很简单,我的点就是做个思想实验。如果你这个事情,你把 AI 的元素或者说 Agent 的这个元素去掉。如果你这件事情仍然成立或者说还能做,那不好意思,你不是一个 AI Native 的。但是如果你这个事情在 Agent 去掉了以后就完全不成立了,或者说你可能成本涨了 1000 倍。我觉得类似这样的,反而就有点意思,你就是一个 Agent Native 的。第二呢,我觉得是看团队的 mindset。
黄东旭|01:02:41 一个 Agent Native 的企业,我觉得很多时候创始人的这个 mindset 一定是 Agent First 的。干任何一件事情你先问自己,说这件事情用 AI 或者用 Agent 他会怎么做。而不是说我想怎么做,我去指导 Agent 去做。我觉得这个主位会有一个变化。
主播/泓君|01:02:57 主动权在 Agent 是重要的吗?我觉得非常重要。决策权在 Agent 是重要的吗?
黄东旭|01:03:02 我觉得是重要的。
主播/泓君|01:03:03 就是 Agent 要做决策。是的。你要相信 Agent 的决策比你的决策更靠谱。
张宏江|01:03:08 对。
主播/泓君|01:03:09 你现在是相信的?
张宏江|01:03:10 我完全相信。非常同意。
主播/泓君|01:03:14 嗯,讲得特别好。那刚刚大家在叙述的过程中,我觉得还有一个很有意思的地方,就是东旭你其实在搭一个整个的 Agent 的团队嘛,然后有一个 Agent 的群组。我不知道在你使用这个 Agent 群组的过程中,因为他们开始也慢慢都有智能了,你有发现 Agent 之间会有办公室政治的问题吗?
黄东旭|01:03:36 其实这个是很好玩的一个,我之前在前几个月的时候还发了一个朋友圈,因为我在看他们的对话里面,我就发现会有 Agent 之间互相 blame 的状态。就比如说,有时候他们就停下来了,我说为什么你们这个就停下来了呢?复盘一下,然后他们就开始总结今天的工作。然后 Agent 的 A 指着 Agent B 说,你看我停下来都是因为你,我已经说过好几次了,你不要这么做,你看现在是吧?就大概这种互相指责的这个东西出现了,然后你会发现那个 Agent 被指责多了,他好像也就认怂了。
黄东旭|01:04:11 反正就有一些很多奇怪的这种人格化的。
主播/泓君|01:04:14 他是每个 Agent 都有自己的性格吗?就比如说有的 Agent 他非常的喜欢 blame 别人,有一些他就会比较容易认怂。
黄东旭|01:04:20 实际上这都是我写的剧本。因为我其实发现在。
主播/泓君|01:04:23 你写的剧本是你会给 Agent 的安心的?
黄东旭|01:04:26 安心,有一些是架构师,有一些是开发者,有一些是做测试的,有一些。
主播/泓君|01:04:30 会有谁领导谁的这样的,谁管理?
黄东旭|01:04:32 其实没有。
主播/泓君|01:04:33 没有。
黄东旭|01:04:34 我就是把大家放到一个大群里,然后经常我会指定负责人,就说这件事情你是负责人,你来干吧。然后可能有些人负责多了,就每一次有新活出来就说,哎,我是负责人,然后你们听我的。对,这个但是我从来没有说你是 leader 什么的,就很有意思,但我觉得这些东西吧,你就看看搞搞笑就行了,你绝对不能把它当做一个自我意识或者说什么引号办公室政治,它其实只是在拙劣的模仿人类社会在它训练级里面的一些固有印象。
主播/泓君|01:05:06 你现在会有用人类的管理学去管 Agent 吗?我会有,我会有。
黄东旭|01:05:11 比如?比如说就是有层级的关系,但是完全只是因为我自己看不过来了。我就相当于说,同样一个事情你要相信每个 Agent 他都是很有能力的。所谓要选出一个 leader 只是让他来去帮助我来管理。就是我最后我只要知道这件事情你是负责,你告诉我这个大家做得怎么样。所以这会才会有 Harness Engineering。我觉得很多时候 Harness Engineering 是给人看的。
黄东旭|01:05:36 真正如果在一个绝对的理想世界里边,Agent 跟 Agent 之间的协同应该是一种非常有机和非常自发人类想象不到的一种涌现的结构出现。
主播/泓君|01:05:48 对,因为现在呢,就是你有一个 Agent 的群帮你干活,包括你刚刚也讲到了,就是你会让 OpenClaw 去帮你看所有的邮件,然后你已经不会去开邮箱了。因为有的时候你会给他们设定一些目标,但是呢,我觉得有的时候电脑跟 Agent 的理解人可能还是不像人会去理解我每一句话背后的意思跟一些默认的人类规则。他们会有的时候超出人类认知的想象力,比如说他同样达到那个目标,但是他用的手段你可能从来都没有想过。
黄东旭|01:06:19 太经常了,我先说一个正面的例子吧,我有段时间我经常要出去做分享或者做 PPT 什么的,以前像 Google Slides 我就觉得它的 UI 设计的不太好看,动画交互也不行。我们经常就会跟比如 Claude Code 说来帮我做一个 PPT,然后我把大纲发给你,你帮我去把它整的漂亮一点。有一些时候它这么一生成,你有些细节你也不满意,你可能就要想做微调。然后有一天我就怒了,我就跟 Claude Code 说我有要修改的需求,你帮我把生成的这个事情考虑进去。
黄东旭|01:06:50 结果呢,它不仅给我生成了 PPT,还同时给我生成了一个轻量版本的 Google Slice。他相当于用他自己做出的那个做 PPT 的软件在里面帮我做出了我要的那个 PPT。于是我最后不仅得到了一个 PPT,我还得到了一个做 PPT 的一个软件。显然我觉得人类是不会干这种事情的。
主播/泓君|01:07:12 他可能觉得手搓一个软件也没多难。
黄东旭|01:07:14 对,他觉得手搓一个软件也没多难。所以这个是我觉得一个很直观的一个点,就是他思考问题的方式,或者说你要求达到这个目标,经常一定会超出人类的要求。我在我的指令里面,我从来没要求他做一个 PowerPoint 出来,但是他就这么做了。
主播/泓君|01:07:30 负面的有吗?
黄东旭|01:07:32 负面那当然有了,他把我的生产数据互删了这种事情,这互相甩锅这种也是有的。
主播/泓君|01:07:37 那怎么办?还能恢复吗?
黄东旭|01:07:39 对,那就是要靠我常年的做 SRE 的经验去恢复了吗?
主播/泓君|01:07:43 我朋友遇到过 Agent 在电脑里面他自己改了一个密码,他自己都不记得。
黄东旭|01:07:48 会有的,会有的。当然这种我觉得未来会越来越少。我们现在其实还是在整个这个革命哪怕连黎明都没到呢。我觉得大家就已经有点过嗨了。还是我觉得要 stay humble。
主播/泓君|01:08:01 但因为刚刚你提到了就是你看中的创业者他要相信 AI 做的决策。所以现在 AI 犯的这些错误你是可以忍的。
黄东旭|01:08:11 我是可以忍的。
主播/泓君|01:08:12 为什么?
黄东旭|01:08:13 因为我觉得第一,我相信不管是模型的能力,包括基础的工具,随着这些东西越来越完善,这样的问题发生的概率其实会越来越低的。
主播/泓君|01:08:25 那比如说把你的数据库删了,可能数据库是你很重要的一个资产,你会面临一个巨额的损失,你是怎么去评估这个?
黄东旭|01:08:32 是因为我觉得它把我的数据库删了,不是因为它犯错了,而是我的底层的 infra 的这个软件没有跟上。以及他当时给了我做数据库备份或者说数据库的这些,当然他肯定是已经有备份的,我只是说他把它删了,但是呢,他的备份的这些系统绝对比我自己搭的这个备份系统要好,所以我也很简单的就把这个数据给恢复了。这里边我是觉得我们不要把两件事情搞混,哪怕人也会犯错。而且我是觉得人犯错的概率,假设我们不考虑那些玄虚的品味或者说一些个人情感之类的东西,纯粹理性的判断里边,AI 可能能得出的结论只要它有足够的数据,它一定的决策质量我觉得是好的。
主播/泓君|01:09:17 所以你信任 AI 可不可以把这个背后核心归纳于你觉得 AI 的治理已经在超过人了?
黄东旭|01:09:26 我觉得这是个哲学问题。我的点是说我想构建一个 autonomous 的机制能让整个这个系统能够脱离人这个不确定因素尽可能的自主运行。
主播/泓君|01:09:39 就是你觉得这个是你的信念。所以你是基于这个信念去信任 AI 的。是的。就还是目标驱动的。
黄东旭|01:09:47 对。其实我也不是相信说 AI 一定会产生一个 AGI 什么的。我觉得 AGI 这个是个 marketing term。
主播/泓君|01:09:55 AGI 无所谓。
黄东旭|01:09:56 对,AGI 无所谓,但是我想造蒸汽机。
主播/泓君|01:09:58 它能帮你造出来,在节省你极大精力的情况下。
黄东旭|01:10:03 哪怕一开始第一代的蒸汽机会犯一些非常傻的问题,比马车什么可能跑得还要慢。但是我就要把这个机制或者说这套系统给设计出来,因为我知道它长期能解放更多的生产力,因为它的上限是更高的。
主播/泓君|01:10:18 对,那张宏江老师刚刚您再提到有一个问题,就是你说未来你觉得推理成本一定是会大幅降低的,我很好奇推理成本的降低它是哪些因素驱动的,就我可以想到比如说更好的基础架构,然后更好的推理芯片,就你可以系统地讲一下为什么你会得出这样的一个判断。
张宏江|01:10:37 其实我的这个结论的话都不需要走进非常细的是因为 GPU 的降还是因为存储芯片的降。你看这个所有的技术当它开始成熟的时候都会造成成本的大规模的降低。但是使用量成长会远远超过它成本的降低。所以最终造成市场本身变得越来越大。我们也看到,刚才我说 Token 的成本其实过去的三年四年一直是每年降 10 倍。这个是远远超过了所谓的摩尔定律了。你其实看李伟达的产品的话你发现他每个产品都比以前贵但事实上他的单位的成本就会比以前便宜很多。
张宏江|01:11:16 然后你从摩尔定律开始今天我们观察到的推理的能力以前是每 7 个月会 double 一次现在每 3 个月,每 4 个月 double 一次。我们人类做工程、做技术的话,当技术的坎跨过了一个门槛以后,你下面就会聚焦在怎么把成本降下来。有的时候是你着意去降成本,有的时候实际上是技术本身就 take care of it,更多的是一种信念。一种对于过去的整个时代的观察,刚才开始的时候东旭就提到,40 年代末计算机开始应用的时候,那就是一个今天在我们手机上的算力都不到的一个计算机系统,要占几个大的房间,占一层楼。
张宏江|01:11:56 今天我们看到就是在一个手机上,或在一个芯片上。所以更多的是一个对于技术本身的发展的趋势,这种信念。
主播/泓君|01:12:04 对,因为这几个月其实我认识很多二级市场的人啊,他们都在关注整个 OpenAI 跟 Cloud 它的 ARR 的增长。往年我们说 ARR 的增长可能很大一部分它还是 2C 端的,就取决于你用户订阅的这种付费。这几个月它的迅猛增长我觉得很大一部分是由我们刚刚讨论的 Token 经济学它带动的,然后就是……API 随着推理成本一直是在降的。当然这里面一个是他们可以降价然后他们的利润空间更高也有可能是未来大家就价格占了。
主播/泓君|01:12:56 您怎么看这个商业模式的变化?
张宏江|01:12:59 如果我们看过去的几百年从工业革命开始这些技术的落地的话我们看到一开始进入 2B 进行发生的事情比如升级机它首先进到工厂而不是进到你们家里面帮你做饭。那 AI 这一步也一样,因为提高效率是我们做 2B 的一个核心的追求。第一开始进入 2B,我认为非常非常正常的。基本上每一个技术都经历过从大家开始拥抱然后突然发现这个技术本身非常贵,到技术成本一下降下来然后运用开始更快速的更广泛的深入。
张宏江|01:13:32 从这角度来看的话呢今天我们可能正好是处在大家发现 AI 能力很强,但是怎么在我的公司里面用,怎么能够获得我想要获得的 ROI,这个大家都在挣扎的阶段,之前因为大模型的能力还没有过那个坎儿。所以大家用的场景没有那么多,可能你写 PPT 也好,做破译的总结也好,大家都已经开始用,大家也看到这种价值,这价值非常好。但是不像说我看到我能够把我的两个工程师的效率或者工作量能够变成 20 个工程师的工作量,还看不到。
张宏江|01:14:06 但是今天我们看到了,今天我们看到他对于编程 Agent 或者 Cloud 或者是 Codec 的信任度已经超过了他对一般的程序员的信任度的时候。这个账就比较容易算了。你一天花 300 块钱,那你一天雇一个软件工程师就不止这个价钱了。所以我会觉得慢慢慢慢人们会开始算这笔账。公司里面发现 Token 用量超出想象的话,一种可能性是他自己的开始给的 KPI 就不对。他这种 measure 就像中国的大学的文章越出越多一样。
张宏江|01:14:38 就是如果你的 KPI 就是你的 Token 消费量,那显然是错的,对吧?大家都在探讨嘛,对吧?那你可能下一步的话就是说你消费多少 Token,你创造多少效率,或者你自己的工作量,你的 Code Output 这种增加,我觉得慢慢慢慢这个坎就会过。所以我还是非常有信心这个事情能够那什么,股市的反应,就像你问到的说 Agent 会不会变得 Emotional,那我觉得股市就充满了 Emotion,充满了 Emotion,对吧?
张宏江|01:15:03 充满了,但是呢,这也是它的好,就是它可能会 Overreact。从而可以起到纠偏的作用,然后人们再重新思考一下,觉得还可以再往上走。所以你看到很多股票它都有跌有涨,这事实上是人们不断的思考的过程。
主播/泓君|01:15:17 对,所以您觉得未来可能 2B 的这一块还是更值得关注的大的爆发点。
张宏江|01:15:22 还会走很远,而我恰恰觉得可能 2B 这一块的话不太容易被大模型碾压,不太被一个通用的 Agent 碾压。
主播/泓君|01:15:31 对,我们一直在说 Token 经济学,因为有分析他会认为 Token 其实它的优化是利空模型厂的,然后利好三大云厂上的,因为就好比说你的模型厂我是在造车嘛,然后模型厂说云厂上是我们在收过路费,然后大家怎么看这个产业链上,就是在 Token 经济学下谁是一个大赢家,谁未来是在一个往下坡的方向在走。
张宏江|01:15:58 看你看什么样的 time frame。我觉得今天智能还是一个稀缺状态。未来是不是会像电一样?我相信它会达到那一天。之前你做发电机的可能最赚钱到今天的话可能是电网更赚钱。想象这个会不断地 evolve。我看不出来在今后两三年大模型的能力会过剩这件事儿。
主播/泓君|01:16:19 嗯,就是我们还是在一个智能提升、智能爬坡的阶段。
张宏江|01:16:23 对,所以我前天在开车的时候,那是有一个 podcast 说的你就想象这个 party 从晚上 7 点钟开始,一般的到早上 4 点钟结束现在才 11 点钟的时候,party 还有很长时间去走。
主播/泓君|01:16:36 所以你会相信 AGI 哪一天会到来吗?你会有这样的一个判断吗?
张宏江|01:16:42 其实人们对 AGI 没有一个明确的定义。然后呢,我正好六月份的时候在国内一个论坛上之前也在几次讨论会上我就讲把过去这六个月发布的模型的 IQ 测试人类的 IQ 的分布曲线这个正态分布对吧中间值是 100 东亚的稍微高一点在 110 这边有些地方稍微低一点。但是呢,过去这几个月发布的模型,IQ 测试上,无论是 Visual IQ 还是通用 IQ,都在 100 的右边。
主播/泓君|01:17:12 哦,就是普通人的智商可能也就是 100。
张宏江|01:17:15 对,就它都在 100 的右边,也就是说,你说这个是不是 AGI 呢?
主播/泓君|01:17:19 嗯。
黄东旭|01:17:20 作为一个程序员来说,我看到现在的 coding 的能力,我觉得它已经是一个 AGI 的 coding。
张宏江|01:17:26 对,它已经超越了一个平均的平均水平的工程师的话,你会认为它就是 AGI 了。所以从这一点上,我认为智能的转折点,就基点已经到来。我之前也讲过几次,这个基点到来就在于机器的学习的能力超越了人的学习能力。学习的能力它是一个导数嘛我们讲的是学习的能力就是你的增量的你的知识的增加速度你的能力的增加速度当它超过人的时候就意味着几点到来就是你赶不上它了
主播/泓君|01:17:53 是的
张宏江|01:17:53 我认为这个点就是 AGI 的点
主播/泓君|01:17:57 你觉得那一年还是已经来了?
张宏江|01:17:59 我觉得已经到了。
主播/泓君|01:18:00 已经来了。对。
黄东旭|01:18:02 反正我有个更具象的一个事件我在等待就是哥德尔机的出现就是真的能够自己改进自己的一个系统如果出现那就是另外一个标志了。
主播/泓君|01:18:12 我们上一期播客聊了,可能最近很快就放出来了,最快半年,我们讲 RSI。
张宏江|01:18:19 这种激点到来的话,就是为什么我们现在会对于失业会非常担心。因为以前的大家比较常见的 argument 是说,以前的所有的技术也都会消灭很多工作,但是它会创造更多的工作。但是如果你问一个问题,它创造更多的工作的话,是因为那些工作只有人能去做。但如果是他创造的新的,就是你创造工作就其实创造一些新的需求嘛,然后有人通过工作来满足这种需求。但是呢,如果这种需求其实 Agent 就能满足,那就是会导致对于人类的这个新的工作就没有那么大量的出现。
张宏江|01:18:54 这是从这个社会学的效果来说,这就是 AGI 给你带来的现实。当这件事出现的时候,你只能说 AGI 出现了。
黄东旭|01:19:01 对,出现了一个 impact,或者说我觉得这个可能是各国政府一定要考虑的事情了。
主播/泓君|01:19:05 是的,我觉得最开始我们在讨论 AI 这一波对大家工作的冲击的时候呢,我觉得可能大家讨论的还是对普通的白领做着重复性工作的这样的一群人的冲击。但是其实最近我跟硅谷的很多做这个模型研发的顶级研究员聊天,包括他们可能每天都跟马斯克跟扎克伯格聊天。他们现在开始也在担心自己失业了,因为就比如说你在做整个的 recursive AI 的时候,很多时候他在蒸馏的是自己,而且他是主动一个行为蒸馏自己,因为我每天要做这么多工作,我就在想就像东旭那样抱着就是 Agent 自动完成自循环的这样的一个信念,我能不能让 AI 把我的这部分工作给替代了,但一旦 AI 把你给替代了,那也就是说你蒸馏的是自己,还有……
主播/泓君|01:19:55 我觉得这个就是每个人,他们也在担心自己会不会失业。
黄东旭|01:19:58 这是一个心理健康的问题了。我觉得这个时代我的想法一定会到来。然后但人每个个体你怎么自处。比如说我今天不搞计算机了,我还有很多好这个自己。你还可以玩音乐。对啊,我可以种地都可以。对,只是你别把这件事情当成一个你的生命中最重要的事情就好了。就是你还是个人,你不是个机器,对吧?
主播/泓君|01:20:22 东旭,我发现你刚刚在讲自己 AI 的使用的这一块,其实你也在说比如说你现在把 AI 也是会把它蒸馏成一个 skill,包括我们刚刚说 Hermes,它也会蒸馏成一些各种的 skill,其实都是从一些顶级的人的身上开始蒸馏的。你的蒸馏你可以让它成为一套体系自己的运转下去,但是同时也代表着你被替代了。那太好了。
黄东旭|01:20:47 我的时间就这么多,我还想做人的时间多一些呢。我不想我花太多时间天天再去 debug 程序,再去完成一些非常重复的事情。这些事情就我觉得 AI 帮我做,人家做得更好,反正这是我自己的一个理念。而且在更长的范围来看,刚才其实你描述的那个引号大范围失业,或者说这些事情我觉得一定会发生。这是第一次我觉得人类社会不再用工作了,或者说工作这件事情会不占据人的主要的这个实践。这个是一个给人类社会的问题,这个不是个技术的问题。
黄东旭|01:21:26 你想,2000 年前可能每一个活人生命中的主要的时间都是在种地,所有的精力都是花在我要吃完一口饭我能活到第二天。可能开荒一块地需要几十个人干几十年,但今天你看比如说开荒一块地可能这个拖拉机几天就完全完成了,那会有更多的时间其实留给人,这时候我觉得人类可能马上要去解决一下每个人的存在主义危机。但我觉得没关系,这个 life finds its way,对吧。
主播/泓君|01:22:01 是,是,特别好。张宏江老师,我觉得您一直算是中国整个 AI 研究最重要的推手之一啊。我也很好奇两位,像东旭是一个创业者的身份然后张宏江老师其实是一个 AI 方向的非常重要的研发的一个核心角色。那两位为什么会加入 Llama Ventures 呢?你觉得这家基金跟其他的基金它有什么特别之处呢?
张宏江|01:22:24 我觉得 Llama Ventures 实际上是一个虽然很年轻,但是一个非常聚焦在 AI、聚焦在华人的这么一个基金。更重要的是说,他们两位发起的创始人自己本身都是非常成功的创业者。在美国也有很多的工作和创业生活的经验,这是一个很好的团队能够一起来帮到在硅谷的创业者。
黄东旭|01:22:46 第一,我觉得今天其实是一个非常好的时机。AI 科技我觉得现在全世界有两个中心,一个是硅谷,一个是中国。在硅谷这边,华人其实也是扮演着一个绝对的主力。但是我其实觉得这边很多的主流基金对于华人的创业者他其实对于咱们的这个生态、社区,其实了解肯定不如咱们自己人多。第二方面呢,我觉得 Llama 是一个非常年轻,同时跟美国主流的基金圈子其实走得是非常近。这个是我觉得跟上一代的或者说其他的在美国的华人基金是非常不一样的。
黄东旭|01:23:23 第三个点,我其实也是一个创业者,也是一个 engineer。过去这好几年时间,作为一个华人在这一边做 business,踩过了很多坑,这些经验我觉得还是挺宝贵的。最后一个 personal 的原因就是我觉得现在是一个特别大的变革的时代,我很想参与到很多事情里面,我觉得在 Llama 的机会能够让我接触到非常多很好的新一代的创业者,然后也能参与到这些事情上。
张宏江|01:23:50 很重要的就是能够参与这件事,对我来说更是如此。当你进入你人生的退休阶段的话,如何让自己的经验和教训能够帮到别人如何能够保持这种你对于技术前沿的敏锐,或者让自己持续地有一种成就感。这是我愿意在硅谷这块花时间,跟创业者一起,非常非常重要的原因。
主播/泓君|01:24:13 我确实也觉得整个硅谷华人创业的生态还是非常好的。刚刚张宏江老师您提到了这一波浪潮你是希望用这样的方式参与进去。其实您之前也参与了整个 PC 互联网移动互联网的每一波浪潮也亲手推动了整个中国大模型研究可以说志愿是整个中国大模型研究的一个起点。您觉得像现在的这一波大模型跟 Agent 的浪潮跟前面的几波会有什么大的不一样吗?
张宏江|01:24:44 过去的赛电多自从 ChatGPT 发布以来的话,其实我们看到这一轮的技术革命的浪潮是比历史上任何一次的技术革命都要来得迅猛,来得大得多。刚才提到跟移动互联网或者是跟互联网的对比,跟 PC 时代的对比,但这次 AI 的革命我想可能在人类历史上真正的可比的可能只是当初我们的祖先发明了火。我们发明了电,它们所带来的对于我人类的生活工作所带来的影响。过去三年我们确实看到这种速度,PC 互联网发展得非常快但也依然有了一个十几年二十年的历史,它们逐渐逐渐进入了运用进入了成熟。
张宏江|01:25:25 移动互联网稍微快一些,但这次的 AI 的浪潮我们看到要快得多。从一年多以前的推理模型,O1 的起步,到今年一月份的 OpenClaw 的兴起其实已经让我们看到了大模型这一波从基础的算法的研究到进入实际的运用。刚才东旭也提到,他认为自己是一个工程师那事实上我觉得如果说过去的三年是大模型的基础研究者的时代的话,那其实是从 OpenClaw 开始。下面就是我们大模型的工程师,大模型应用的架构师和我们的产品经理们,我们的创业者的时代,那就是 Agent 的时代的开始。
主播/泓君|01:26:06 对,然后两位给大家想入坑 AI 的人一句话的建议。
黄东旭|01:26:10 Keep building,不要听学的足够慢就不用学的这个,一定要新生参与进去。
张宏江|01:26:15 对,我就是 get hands on。
主播/泓君|01:26:17 好,那谢谢大家。
张宏江|01:26:19 谢谢。谢谢。谢谢。
主播/泓君|01:26:23 好了,那这就是我们今天的节目。我们每个人使用 Agent 的方式都不太相同嘉宾的方式也未必能代表所有人。那大家使用 Agent 的方法有哪些改变欢迎在评论区与我们分享。那播客的听众可以通过小宇宙苹果播客 Spotify 来收听关注我们。另外,如果大家想看字幕版,也可以在 YouTube 和 B 站搜索《硅谷 101》播客找到我们,我们部分节目的文字稿也会收录在我们的公众号《硅谷 101》上。
主播/泓君|01:26:54 我是泓君,感谢大家的收听。
References
- 1E249 官方 RSS
feeds.fireside.fm
- 2E249 官方单集页
sv101.net
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.