
高能量速读:AI 上半场,钱开始挑任务了
这期速读梳理《高能量》Vol.223 的 AI 产业观察:Agent 要回到任务价值,世界模型连接视频与机器人,基础设施竞争转向系统效率,AI 创业也开始接受更严格的商业化检验。
Vol.223 是《高能量》的 AI 行业半年回顾。李丰和峰瑞资本两位科技投资同事把上半年的 AI 一级市场拆成几条主线:Agent 从概念走向任务交付,世界模型突然升温,AI 基础设施不再只看 GPU 数量,视频生成的商业化在中国跑得更快,人形机器人还没到大规模落地。1
这期在回答什么问题
这期节目不是在复盘某一家 AI 公司,而是在回答一个投资人视角的问题:2026 年上半年,AI 的热钱、产品、基础设施和创业机会到底流向了哪里。节目里反复出现两个判断:一是 FOMO 还在,很多人害怕错过下一波平台级机会;二是单纯贴上 AI 标签已经不够,项目需要回到真实任务、真实需求和可持续的商业化。1
两位嘉宾刘鹏琦、颜黔杭都来自峰瑞资本。节目页介绍他们分别是峰瑞资本执行董事和副总裁,这决定了本期的观察角度:它不是终端用户体验测评,而是一级市场投资人看过大量项目后的行业体感。1
AI 投资的热度没有退,但筛选方式变了
节目开头提到,上半年一级市场投资人看了 200 多个 AI 项目后,最强的体感是 FOMO、赛道分化和估值前置。FOMO 是 Fear of missing out,直译是害怕错过。放在投资语境里,就是大家担心错过下一个 OpenAI、Anthropic 或新一代平台入口,于是愿意在更早阶段给出更高估值。1
但节目没有把热度简单等同于泡沫。更准确的说法是,投资逻辑正在从「追热点」转向「看任务价值」。Agent 项目不能只说自己是智能体,必须说明它能替用户完成什么任务,是否能稳定交付结果。AI 硬件也不能只靠「带 AI」三个字成立,必须对应真实使用场景。
这对创业者的含义很直接:如果一个产品只是在已有流程外面包了一层聊天界面,它很难说明自己为什么值钱;如果它能把一个具体岗位、具体流程、具体成本项改掉,投资人才会继续往下看。
Agent 的问题从「会不会聊天」变成「能不能干活」
节目用 OpenClaw 作为例子,说明 Agent 讨论正在从圈内概念变成大众可部署的「数字员工」。它的意义不只是开源一个 Agent,而是让用户用自然语言定义、调试和扩展工作流。1
这里有一个重要术语:Harness Engineering,节目页翻译为「驾驭工程」。它强调的不是继续把模型参数堆大,而是搭建一套专业环境,让人类掌舵、智能体执行。换句话说,模型本身只是发动机,真正决定结果的还有工具调用、上下文管理、权限边界、失败恢复和人工确认机制。1
节目还讨论了 Agent 的数据飞轮问题。传统互联网产品越多人用,越能积累数据,数据又能改进产品。大模型应用如果每次只是调用外部模型,很难天然拥有自己的数据飞轮。Agent 若能嵌入任务流程,记录任务、反馈和结果,才可能形成可持续改进。
Anthropic 为什么成了上半年焦点
节目页把「为什么 Anthropic 成为上半年最受关注的大模型公司」列为一个单独时间点。这里的背景是,Anthropic 在企业级、安全性和编程场景中的存在感持续提高。节目没有把它讲成一个单纯的模型性能故事,而是放在 Agent、coding agent 和企业任务交付里看。1
对投资人来说,大模型公司最关键的不是一次榜单排名,而是能否把模型能力转成客户愿意付费的工作流。Anthropic 之所以被反复讨论,是因为它在开发者和企业场景里更容易被看见。企业市场不会只问「模型聪不聪明」,还会问数据能不能保护、权限怎么管、结果能不能审计、失败谁负责。
这也解释了节目里另一条线:用户既想用最强模型,又不愿把个人或企业敏感数据交给模型厂商。隐私和能力之间的冲突,会决定 Agent 在 B 端能跑多远。1
视频生成和 AI 基础设施,是更接近商业化的两条线
节目提到,Seedance 这类国内视频生成模型的商业化进展更快,原因包括国内厂商在视频数据和数据工程上的积累,也包括 AI 短剧、AI 漫剧等明确内容生产需求。视频生成会消耗大量 Token,因此成本控制能力直接影响商业化。1
Token 可以理解为模型处理文本、图像或视频时使用的基本计算单位。视频越长、越清晰、运动越复杂,Token 和算力消耗就越高。一个模型能生成惊艳样片是一回事,能不能以足够低的成本稳定服务大量客户,是另一回事。
基础设施部分也很关键。节目说,AI 基础设施竞争不再只是买更多 GPU,而是让整个算力系统更高效。推理需求越大,通信和存储跟不上造成的等待就越浪费算力;光互联、HBM、DRAM、SSD 和分级存储开始成为投资中的关键环节。1
HBM 是高带宽内存,适合给 AI 芯片高速喂数据;DRAM 是常见的动态随机存取存储器;SSD 是固态硬盘。它们听起来不如大模型公司性感,但如果推理需求持续增长,瓶颈往往会出现在这些看不见的系统环节。
世界模型热起来,是因为它连接了视频、游戏和机器人
节目对世界模型的定义很清楚:它更像一个概念,而不是单一模型,核心是根据外部输入或行为干预,预测下一步状态会如何变化。用于物理世界时,它可以服务具身智能;用于数字世界时,它可以服务视频生成、游戏和仿真。1
这和大语言模型不一样。大语言模型主要预测语言序列,世界模型要理解状态变化。比如一个机器人推杯子,下一秒杯子会怎么动、会不会倒、手应该怎么修正,这不是单纯语言问题。节目也提到,物理世界数据比互联网文本更难获取,因此世界模型的数据瓶颈会更明显。1
VLA 模型也出现在节目里。VLA 是视觉、语言、动作模型,负责把看到的东西、语言指令和具体动作接起来。节目页特别说明,VLA 和世界模型不是简单替代关系,而是具身智能系统中的不同能力模块。1
机器人还没大规模落地,灵巧手和触觉先热起来
节目没有把人形机器人讲成已经全面爆发。它追问的是,人形机器人是否已经进入批量落地阶段,以及灵巧手和触觉传感器公司为什么不断涌现。1
这背后有一个产业判断:机器人真正进入复杂场景,不只需要腿能走、胳膊能抬,还需要手能抓、能感知力度、能处理不规则物体。灵巧手和触觉传感器是机器人从演示走向工作的关键部件,但它们的商业化也取决于场景是否足够刚需、成本是否能降下来。
节目最后把下半年重点放在 AI for Science 和 AI 硬件。AI for Science 指用 AI 辅助科学研究,比如材料、药物、生命科学和物理仿真。它不一定像消费级应用那样容易被大众看到,但如果跑通,价值可能非常高。1
是否值得完整收听
这期适合关心 AI 投资和创业方向的人听。它的信息密度高,术语多,但好处是没有只停在大模型发布和公司八卦,而是把 Agent、世界模型、基础设施、视频生成、机器人和 IPO 潮放在同一张产业图里看。
如果你是创业者,最该带走的是一句朴素判断:AI 项目要回到真实任务。能不能省掉一个流程、替代一个岗位里的具体动作、降低一个确定成本,比「我也做 Agent」更重要。如果你是投资人或行业观察者,这期的价值在于它把上半年的热词排了优先级,也提醒你别只盯模型榜单,底层算力、数据闭环和商业化成本同样会决定谁能留下。
完整逐字转录稿
以下为基于完整音频生成的逐字转写。原音频没有提供可靠说话人分轨,因此统一标注为「未分轨讲话者」,时间轴按约 10 分钟间隔保留。
00:00-00:10
未分轨讲话者:大家好, 欢迎来到这一期的产业观察我是峰瑞资本的合伙人李峰 AI 相关的二级市场尤其 是芯片存储等等相关的这些产业链公司在 过去的一周和最近这几天产生出了巨大的 波动那当然由于 M eta 在这两天关于他们自己的一些算力基础设施的安排也 导致了不同的话题讨论不管是存储还是芯片还是 AI 的基建算力中心的头件这些 话题是不是到了一个阶段性的高点或者泡沫要开始破裂等等我们请了我们两位跟 科技投资有关的同事让他们讨论和交流一下关于 AI 投资也会涉及到我们处在泡 沫的哪个阶段以及在不同的影响下假定之后的泡沫破裂会发生哪些事情当然他们 的话题也涉及到了非常多今天的在我们这个行业里比较重要和或者叫时髦的一些 投资方向不管他是机器人还是由机器人引起的世界模型物理模型还是由 Open Cloud 这个小龙虾引起的 agent 以及 agent 所带来的这些资源就是 token 整个经济的可能应用和商业 模式的变化当然也涵盖了从云到边到端就是 简单来讲从训练到推理也到端测芯片整个从芯片来看随着应用和 AI 泡沫的不同 阶段这些芯片和基础设施以及硬件架构会怎么改变他们当然也涉及到了这些话题 他们各自讨论的内容也都只代表了他们各自的意见因为在我们机器内部大家基本 上采取了尽量公开透明的讨论方式能够听取别人的不同意见并且表达自己的不同 意见那我想他们两个的这次讨论也代表了这样的形式和观点当然就我自己个人而 言对于 AI 相关的阶段我想在两期以前的这个宏观漫谈当中其实已经明确的表达 了对于 AI 和 t oken 处在了哪个阶段以及会产生出什么样的变化和影响也 代表了个人的意见当然我看下面的讨论也有一些不同的意见和不同的问题我想这 大概都是促进大家从不同角度思考当然这可能也是大家愿意听这种不同类型的播 客的原因那接下来的时间就交给他们两位大家好我是峰瑞资本的科技投资人刘鹏 奇那么站在 2026 年年终的这个时间点呢我们回看过去半年都有一个非常明显 的体感就是整个 AI 行业的发展没有一点减速的趋势从年初的 Open Cloud 再到世界模型的创业热潮以及最近资本市场对于像存储或者光这一系列概念的追 捧以及最近包括像智普刚刚冲破了万亿港币的市值所以我觉得非常有必要今天来 一起系统的复盘一下 2026 年的上半年 的 AI 行业它到底发生了什么以及为什么 在这个时间点发生以及后续我们会走向 何方今天跟我一起参与讨论的嘉宾也是我的 同事廉千航严博士我们之前也一起在节目中跟大家讨论过有关居深智能包括像 A 站的相关的话题大家好我是分为资本投资人科技投资人严前航从我们跟彭奇过去 三四年一直以来高强度的追踪 AI 行业的 变化再到投资的相关的跟进来看其实我们 能感受到一个非常明显的趋势从 CHATGPT22 年刚出来的时候再到今天 AI 从一个简单的语言模型逐步切入到很多 我们以前从来没想象过的领域最直接的就是 我以前我看的机器人领域现在大家更多讨论的都变成叫巨声智能而不再是传统的 一个机器人的概念除此之外还有更多我们没有以前没有预期过想象过的新的赛道 都逐步的跟 AI 渗透结合然后成为了所谓 AI 家的新赛道包括说现在 AI for Science 甚至连我们在看的何俱变里面都离不开一些 AI 的贡献所以今天 站在这个时间点其实 26 年到上半年到现在有蛮多的 AI 热点话题在不停的每一 波冲击着大家的社交媒体推荐流我觉得可以先来几个快问快答首先也想问问严博 士上半年大概聊过多少个项目上半年的话差不多 200 到 300 之间的这么一个 大概的数聊的 AI 相关的项目都快接近 150 个以上到 200 个左右我的体感也 差不多看了这么多项目如果说用一句话或者几个关键词来描述你上半年看这些项 目的感受的话你会用什么词其实我比较 想用三个词来讲第一个词就 FOMO 在一些 非常热点的领域就会出现大量的人大量的项目是我们从来没看到过的或者说估值 它在快速上涨很多人会因为觉得 FOMO 我是不是我逼迫自己必须对吧所有项目 都看一遍所以这已经行业的估值上涨带给大家刺激就是我们今天投了吗我们今天 投了多少是不是得多投第二个关键词我觉得分化非常明显的感受就上半年除了个 别特别热门的赛道融资真正是上之外其实 大部分的赛道还是处在一个相对冷静或者 说没有那么热门的状态这个其实跟二级市场的感受也很像二级市场今年的涨幅也 非常的分化就大家所谓的科技股涨得非常好那有一些不在热点范围内的股票反而 是一直不温不火甚至下跌的一个状态然后第三个我觉得比较关键的词叫估值前置 假设我们过去非常理性的角度去看早期投资的话我们对早期投资的界定是非常明 确的大概在什么样的 M il estone 之前我们会给一个什么样的合理的 估值没有形成共识之前对然后比如说形成共识加上有一些交付的 M il estone 展现的 M il estone 之后我们可能会把估值给抬上去觉得是一个合理 估值但现在就是因为热因为 FOMO 所以大家对于估值的很多规则或者过去的经 验全被打破了现在我们可以看到连续融资估值快速上涨 10 亿美金可能就是在几 个月之内直接火箭式的诞生这三个关键词 FOMO 结构分化跟估值前置是我觉得 上半年最深的一个感受对我觉得也可以给听众朋友们解释一下就是 FOMO 就是 F ear of Miss ing Out 其实就是担心会投不到一个项目 而焦虑大概是这样的情绪然后确实在上半年 我们也看到很多的项目可能一周的时间 它的估值就变甚至可能一个项目可能会同时在有三轮融资在进行对吧比如大家都 开玩笑说一轮在交割中一轮在谈协议还有一轮已经在修订方案过程中那面对这样 的一个市场的情况我不知道你觉得焦虑吗就作为投资人的话我觉得说不焦虑那不 现实其实我们基金内部的早期的风格来说我们追求的还是去前置的发现一些趋势 我觉得更多的焦虑不来自于投资而是来自于 AI 的变化太快了时时刻刻都会有新 的热词新的想法也就是说新的思路变化出来每次发一个新模型或者说每次有什么 新的新闻可能我们焦虑的都是我这新闻怎么过几天才看到这个是反而是我觉得当 下会给大家更多的焦虑就是你怕自己被 AI 时代甩掉反正最近跟很多其他投資人 交流我覺得確實共識是會有焦慮但大家 反正各有各的方法因為我們也知道投資比如 說有偏價值投資然後又偏機會性投資可能自己需要針對不同的項目把它到底更偏 机会还是更偏价值拆分开这样子可能就不会因为这个价值和它的价格不匹配而导 致的焦虑让我们去影响我们的投资决策那说回来就肯定是确实是有一些的估值的 前置包括也有一些泡沫但我相信这里面像刚才像严博士讲的肯定还是产生了很多 新的东西新的机会所以我不知道比如说在我们讨论比较实的东西的话就是在看项 目的过程中有没有发现一些比如方向或者是这些方面的一些变化就不是纯市场情 绪这个层面的对我觉得这个可以分两个切入的视角去看第一个切入的视角叫研究 型的赛道机会就是更像大家现在比较热的词叫美国 New Lab 让大家去解决 一些长期的问题但它通过商业化公司运转 的方式去加速这个研究这个在上半年其实 出来蛮多新的这样的公司大家不再那么纠结是不是教授创业反而更关注的是教授 出来创业做一个商业化的研究型公司的话是不是能在研究上面远比其他组织形式 要快所以这个是一个研究型的创业的一个新的趋势从投资人去看那这时候看这项 目大家的关注点就变成你能把新的研究推广到一个什么样的高度你能不能做这个 市场或这个行业里最好的研究输出者你能 做出最好的研究来然后改变这个世界我觉得 第二个趋势变化我们再往到比较偏落地的 角度去看落地层的 AI 产品跟硬件层其实 就能发现一个很有意思的点是去年上半年大家非常 FORMALAI 应用因为 M ann es 的出现非常 FORMAL agent 去年下半年因为 In sta 360 的上市大家非常 FORMAL 的是 AI 硬件但是回归到今年上半年之后大家都 发现一件事情 FOMO 没什么用也就是说你去过度的追赶潮流慢慢的就沉淀回了 我去找更好的产品定力者我找比如说举个例子 AI 应用你是不是真的是像 ag ent ag ent 大家现在已经成为共识 ag ent 要交付任务价值那今天是不是 这个产品团队能够交付任务价值能够行政任务必还还能像让 ag ent 变得更 好更强形成一个自身的一个数据飞轮的一个壁垒在业硬件层面我们慢慢的大家就 回过来还是看的是这个东西是不是消费者感兴趣且需要的是不是满足了一些忽略 的潜在需求所以从这两个方向来看其实看似是两个极端实际上都是在各自的创业 形式上去回归回归价值或者叫回归底层底层的一个判断认知方式我觉得这是上面 点比较大的趋势这两个趋势还有另一个很有意思的点尤其是在 AI 创业里面自从
00:10-00:20
未分轨讲话者:去年 C ode x 加 Cloud Code 发布之后我们发现越来越多的创业 者本身不再是原来的工程师跟算法研究员他们不一定有算法背景他们可以是好的 产品经理,可以是好的设计师他们慢慢的就把自己变成一个全站的产品经理, 所以大家可以回忆一下十年前有一个经典的创业玩笑叫我有 ide a 我有天使 融资我缺一个 CTO 我缺一个马农但今天 不再有这个问题所以挺有意思的点是之前 看一些线下的 h ack athon 跟 YCA 在美国的 h ack athon 最后做的特别好的产品往往是一些你完全没想过他会去做一个 c oding 用 c oding 工具去做一个产品出来的那些人他可能是一个律师可能是一个家 庭主妇也可能是一个某些场景的一些非 IT 相关的从业者所以这是一个挺大的一个 变化确实包括我们今年投资我们也遇到了蛮多很不错的产品其实完全不是原来做 算法原来 rese arch 背景出来的人去做到的一个好产品有意思对所以原 来我们也经常会说很多技术性创业者他会 拿锤子找钉子但现在看起来都是钉子直接 出来创业然后锤子就是已经变成了一个非常普世化的工具了锤子就你花钱买 c oding plan 就行了然后钉子他我知道钉子在 哪我直接亲自去敲对不再像以前一样就是 说我知道钉子在哪我不会敲我得找人来帮我敲这个是一个挺大的变化或者说 AI 时代对大家一个最大的赋能如果一定要从上半年的里面找一些你认为能够确实影 响整个市场发展的大事件我不知道你会挑哪几个事情我觉得 Open C law 肯定是全球影响力最大的一个事件 Open C law 直接让大家让我们原来 在投资人或者创业者之间讨论的 ag ent 的概念直接让所有的社会大众感受 到我要雇一个数字员工的概念所以这是一个快速的一个概念放大跟映射让这个形 成共识了就有点像去年 De ep S ick 出圈对对对 De ep S ick 出圈的时候就是大家觉得大模型中国大模型还能做这么好所以那个是一个观念冲 击这个是一个对全球的大家看更好的去接手 ag ent 大家也会尝试自己去做 ag ent 有了 open class 所以才有养龙虾的概念其他更多是一个 行业趋势上的变化并不是什么事件性上的一个变化我觉得还有一个是一个整个半 年的一个大趋势就是这半年的话其实在社交媒体上会看到更多的讨论是关于你是 站在光里还是光着站在哪里是二级市场的对所以这个的趋势我觉得更像是今天相 不相信 AI 或者说你在对 AI 未来资产的一个判断上大家形成了市场用脚或者说 交易价格你既说它是泡沫也形成了一个短期的热潮甚至开始像不做 AI 不懂 AI 只做交易或者说大家只关注股市的人今天他们变成了最花时间研究 AI 的一帮人 我们就正好接着刚才言博谈到的大事件里面非常重要的 Open Cloud 这 件事情我们来展开聊一聊 A gent 这个话题所以我想今年大家关于 Open Cloud 的讨论其实也挺多了然后也发酵了一段时间对吧包括从全民各种装龙 虾对吧买这些苹果的电脑然后再到后面逐渐比如各大厂商无论是像模型厂商 An throp ic 还是国内的这些 IM 的厂商腾讯这些都开始推自己的 ag ent 再到现在这个热度也慢慢感觉下来了一些我觉得它的火和现在稍微冷却一些可能 都是跟 open cloud 开源这件事情有关系可能因为开源让大家觉得接触 到这个 ag ent 的门槛很低对吧我在自己的电脑上就可以装一个完全自主可 控的东西所以它看起来的门槛很低所以它很快就热起来但其实反过来又是因为它 因为是开源所以它不那么完善无论是在 安全机制上对吧还是说在用户的体验上其实 都也会有很多挑战当然我觉得我相信还有 一部分用户是它的忠实的粉丝和用户但是 可能对于多数大众来说慢慢可能就转到其他的平台上来了那就经历过这么一个周 期之后我不知道就是对言博你觉得它这波表面的热潮走到现在它留下了什么对吧 就它代表了一些什么更深层次趋势的变化包括和我们去年看 min us 相比有 什么不同吗去年我们在聊 ag ent 的时候更多还是从 min us 这类的通 用 ag ent 再到一些 l ant ree 还有一些 l ant ree 的框 架衍生出来的有算法工程师开发出来的 ag ent 但今天去看会发现一个很大的 变化其实大家开始自己去尝试去装 Open Cloud 尝试去下载各种各样的 sk ills 然后自己再教有个所谓的 养龙虾的概念一开始的热度是因为大家好 奇因为大家过去接触的是从来都是 chat bot 的这样的豆包对话对吧但是 ag ent 没养过或者也没做过原来的 ag ent 部署其实是相对麻烦的一 件事情除非很多人也没有用过 code x 跟 cloud code 所以对大众 来说第一次一个快速部署的而且是能把 ag ent 的核心机制部署在端侧不是 放在原侧去用的然后又能自己去定义自己去打磨去养通过自然对话的方式让他去 实现一些任务那这个对很多人来说是一个全新的概念大家都说 ag ent 要交 付价值你只有真正上手体验过之后你才知道他交付了什么价值所以当时的热潮在 叠加上他开源然后我觉得传到国内之后 因为我们中国的开源模型又做得非常好所以 大家在这个支持下很快的就形成了一个社交热度叠加爆炸起来所以我觉得这个热 潮的趋势引发了什么就是 ag ent 不再是只是作为一个具体的任务工具今天 他定义的是一个 ag ent OS 的形态所以上面用自然对话的方式去定制你 自己的 ag ent 然后这个功能开放给大家之后那今天就会有各种从来没用过 的人去尝试会有我们预期之外的场景去尝试这些 open cloud 之后也许 能沉淀下很多新的应用跟 ag ent 的落地场景包括像很多 sk ills 其实 都是用户自发对 skills 都是用户用 skill creator 做出来的 或者基于自己的想法所以你能看到的是热度降下来了当然很多吸引进来的人其实 不需要 ag ent 但需要 ag ent 的人真真实实切切的现在就在稳定的用 ag ent 比如说我可以举个例子是我一个自媒体博主的朋友他不是技术背景 出身的他原来是做美妆博主那跨度挺大的但他现在需要自己去切入心态到想去做 一些科技类的博主的时候他就自己通过 Open Cloud 的方式给自己搭好了 这个 work flow 然后给自己定向的去搜集相关的科技信息帮他去生成相 应的内容输出的 p ip eline 搭好那他就可以快速的把这个链自动的运 转起来对他来说他利用好自己的一个社交媒体的平台放大相应就能把内容快速的 输出还有就是我觉得很明确能看到的是 PPT 的制作上各种各样的 sk ills 配合 O ber Cloud 也好配合 Cloud Code 也好都已经成为大家 去做 PPT 的标准办事我觉得这个很明显能感受到我们今年收到的很多 BP 一看 就是 AI 做的要么豆包要么 Cloud Code 要么 Man as 要么 JS Park 这个是非常明显的 C oding 我觉得不用讲了 C oding 这个事今天已经 非常明确了所以收敛下来之后很多人包括很多电商很多企业内部的流程化的任务 一些人逐步的沉淀出来但只是这些任务可能那些人声音不这么大但是他们已经这 些事在用了所以我觉得一波热潮之后虽然有泡沫有一些波动有一些噪音但是最后 沉下来发现实实在在的吹开了啤酒的泡沫下面是醇厚的啤酒所以当大模型应用从 纯粹的聊天这样的交互形式变成了帮助用户去做任务执行那这里面什么事情开始 变得更重要了比如说我也听说大家在最近也开始强调 H arness 这件事去 年五月的时候其实聊到 ag ent 的时候我们去讲 ag ent 跟 lang uage model 最大的区别是什么 ag ent 本质上是一个需要环境搭建需要决策 执行执行在反馈这么一个闭环的系统那这么一个闭环的系统才能说我们觉得这样 的 ag ent 在执行过程中不断的积累学习成长它就像一个机器一样在运行模 型只是支撑它核心智能的一个大脑当时去年这么一个概念今年大家可能用更准确 的词叫 H ard ness Engineering 大家在 ag ent 开 发上会把这些事定义的非常死但今年讲究的 H on est Engineering 的话从我的理解更多是在去把模型的周边的环境定义好它的返回通路定义好以及 说把它整个闭环返回的过程定义好之后让 模型自己去运转真实的去运转这个 work flow 然后它可以在这个 work flow 中去找到最好的一个运转方式其实 就是不需要人去定死你每一个路径怎么走你给它定义好一个环境之后 AI 自己能 探索出更好的决策来这个是 H an is Engineering 大家今年 去讲的一个重要的点但我觉得更多是大家思路上的变化其实这个为什么今年讲 H an is Engineering 去年不讲我猜测一个比较明显的驱动要素 是模型在 ag ent 支持方面变强了非常多所以去年的时候你指望模型在 H on est Engineering 的环境 里去探索的时候它甚至探索出来的不一定 有你给定或者是明确定义好的 work flow 来得效果好但现在模型的 A gent tool use 能力或者说它的长程决策能力变强了它的摸索出来肯定比我们 给定的要好所以这时候 H on est Engineering 才慢慢的变 成大众关注的一个开发方式还有一个是大家对语言模型的使用过去我们用 Ch ad bot 的时候一问一答一问一答最后发现一件事情给我输出的文字我需要自己用 手去点鼠标我需要去把它转成文档我需要转成 PDF 再去操控别的软件来执行它 相当于只是我的一个 gu id ance 或者叫指导书但人总是希望偷懒如果 他既然他能知道怎么做了他能不能自己去 亲自做好所以我觉得这是非常直觉的一个 往应用去转的一个方向那去年的时候我们就强调这一点那今天的话能看到各方面 的条件包括说 AI coding 的工具变成熟基模的 ag ent 的 ag ent ic 能力变强也就是说大家对 ag ent 怎么去开发探索的更加成熟之后那今天的 ag ent 就开始变得更加的出乎我们的意料好用以及说更多的人可以开始去
00:20-00:30
未分轨讲话者:用就是它开始逐渐进入一个可以依赖模型能力去资金化和迭代的我觉得可能今天 说自进化跟迭代倒还早但更多是环境搭好了它有的是机会让大家把自己的想法去 变成现实去尝试就有点像随机进化就像韩武级生物大爆发一样并不是因为有某些 核心的决策要素或者说哪个突然来了一个创造并不一定每一次迭代都是一个正向 的对但是它因为有足够好的环境且足够丰富的资源之后大家在里面随机进化往往 最后进化出来的结果就是一个大爆发以及 说一个高价值的结果我觉得这个就跟另外 一个问题其实也相关就是大家之前也一直在诟病就是大模型本身其实是缺少一个 数据飞轮的它很多未给它的数据都是需要比如人写好或者专家定义好当然有一些 这种强化学习的方式可以让它自己做一些迭代但它本质上其实是没有真正利用好 比如外部用户的很多数据去提升模型的能力的比如说有了现在刚才谈到的 ag ent 类型的这种范式之后我不知道就是说大模型的所谓缺乏数据飞轮的问题会不会得 到某种程度的解决但是数据飞轮可能听起来比较虚比如说我们就把它定义为个性 化的体验就是个性化体验在传统互联网时代其实是非常有效的包括字节包括像淘 宝阿里他们跑出来这样商业模式其实都是基于这种个性化的体验那么在大模型时 代 A gent 会不会成为它形成这样的一个数据飞轮和个性化体验的一个载体 如果是的话这里面什么东西是重要的这个我觉得从数据的角度来说可能过去大家 单单用 chat bot 的话更多收集的是所谓的用户的语言对话的上下文数据 这个非常重要所以当时谁家的模型用的多那他能搜集到的语料数据就更多但到了 ag ent 的这个场景下大家考虑的是任务执行所以最后不再是单一的比你收 集了多少的上下轮数据所谓的叫任务轨迹任务轨迹才是一个关键的核心数据这个 跟机器人也是类似的我们说巨声智能本身也是一个 ag ent 巨声智能今天大家 也强调的是真实的任务数据 ag ent 里面也一样我怎么去做决策然后任务每 一个怎么执行 work flow 执行下来的具体的执行数据这些数据我觉得是 能形成一个数据价值的 A gent RIO 今天也是一个非常热的一个话题因为 我们去年强调的就是说 work flow 的 ag ent 能快速落地但是未来 真正交付超越现有水平超越人现有水平价值的 ag ent 产品肯定是得基于 R IO 去推进的所以当这一类数据被积累之后再加上 H arr is 整个 ag ent 的环境搭建好之后 ag ent RIO 我觉得自然而然就能把整个过程得往前 去推进得更好因为你有强化许新你有每次的行为轨迹数据记录当然我现在不确定 的是这些轨迹数据能不能流通回给基模公司或者是除非是基模公司比如说举个例 子 Cloud Code 自己做的 c oding 的一些轨迹数据它肯定可以用 来反补自己的模型训练所以它可以做得比别人更强但实际上到最后 ag ent 大量的会是垂直分散这些上下文数据这些 轨迹数据都是对基模模型不开放所以我觉得 有可能会在 ag ent 这一层形成一些可以沉淀的一个机制这样子才会说存在 ag ent 的创业机会不然今天大家都担心的一件事情就是模型越来越强边界 吞噬一切那模型极万能的应用那就没有 ag ent 的创业机会了但我觉得考虑 到尤其刚刚我们聊到的这个点任务轨迹加垂直场景数据怎么去反哺整个 ag ent 的运转我们觉得大概率会在这个体系内去运转所以这么去看的话 ag ent 有 可能会实现自身的一个数据飞轮然后形成自己的一个领域跟场景不再被大模型所 吞噬那听起来到底谁能获得用户的数据包括这些刚才讲到的任务轨迹大家会把它 当成一个兵家必争之地因为谁能拿到这些资产谁就更有可能去提供更好的这样的 一个用户体验当 Open Cloud 的浪潮稍微下了一点之后我们也看到其他的 大厂其实也纷纷退出自己的这种 ag ent 的产品比如跟 IM 结合起来其实就是 像我们看到的比如说微信或者飞叔发的自己的这种 ag ent 的产品然后跟大 模型结合像 Cloud, C ow ork 包括 Open AI 的 C ode x 其实也能做很多这样的 事情第三类其实刚才就严博士也谈到了可能更多是一些偏第三方的但是有些是跟 硬件的这种比如 PC 也好或者盒子也好绑 定的这样的一些类型的所谓叫龙虾机我们 看到最近有很多公司在做这个方面的尝试 然后也有说去帮助这些龙虾怎么能更好的 部署在不同类型的这种算力能力的硬件上 然后给用户提供本地化服务的这样的一些 机会所以我不知道比如针对就这几类你觉得谁最终胜出的概率会大一点这个事儿 是我觉得今天我去讲谁胜利会大一点这事儿挺天生棍的但我想讲的是其实三个方 向切入的人想做的事情其实是不一样的他们并不是说会互相竞争我觉得从大模型 厂商的公司来说他要去切了这些 ag ent 肯定是第一时间离模型最近的他们 去做是最有优势的以及同时对他们来说还 具备数据跟提升模型能力价值的所以今天 可以看到就是大模型厂商过去好几种类型的 ag ent 出来之后大模型厂商迅 速做了第一个叫 deep search 就是讲的是互联网搜索的 ag ent 跟他能直接挂钩所以今天可以看到所有的大模型直接推出的 Ch ain GP T 也好 Cloud 也好直接自带互联网搜索能力第二个大模型厂商愿意推出的叫 DVR esearch 他们也是自己直接去做的然后再到后面就是 C oding 因为 C oding 本质上就是 T oken 各种各样的文字 in 文字 out 然后 对它来说还有一个环境去做输出结果的判别跟审查这个是一个天然适合 ag ent 来做的所以大厂一般还是去切一些通用类的跟它相关性非常高的这样的机会确实 得大厂来做以及说一开始会有一些创业 公司去做但最后发现干不过大场我觉得今年 比较悲情的一个 case 就是 C urs or 给收购 C urs or 可能是 过去三年做 c oding 先驱里面最强的公司但它收购对公司来说并不差只是 到最后它从一个给 Cloud Code 贡献最大 t oken 消耗量的公司被 Cloud 自己给发布的 ag ent 的产品给干掉了所以这个确实能说明就是 在这种离模型太近的 ag ent 的领域你去创业的话就像恒星到末期膨胀一样 你就是一个行星离它很近瞬间被吞噬第二 点你刚提到的像 IM 跟办公入口这类的话 这里的好处是他把 chat bot 从原来单一的 App 上拓宽到我们原来熟悉 的场景还有就是现有的 IM 跟办公类的软件其实它有现成的文件体系跟现成的数 据文档体系那今天对 ag ent 来说它也是一个很好的封闭环节所以在这里的话 我觉得它比较有优势的就是第一就是你公司大家都用某一种办公软件你作为一个 人你就会快速切进去用这它已经有了一个 原有的市场推广生态第二个就是你有很多 工作流是沉淀在上面的比如说举个例子 发票报销所有人包括投资人包括所有在工作 的人都会遇到这个问题那这个问题在每个企业内部假设数字化做的好都是要标准 的数字化流程那这个流程沉淀在上面这个是不是 ag ent 可以快速去学所以 对这些 IM 来说他们就可以把原有在 S aaS 时代还有数字化办公时代的很多 work flow 变成 ag ent 我觉得这是他们的一个优势他们最后切的 呢也还是这些场景第三个我觉得本地跟硬件类的形式这个算是大家的一种尝试但 至于说你做成一个龙虾机这样的方式是不是真的好玩或者怎么样其实大家发现一 开始热的时候抢的最凶的是 mac mini 冷下来之后咸鱼上卖的最多也是 mac mini 所以这个事是不是一个产品路线我觉得先打一个问号我觉得用 Mac book 也好你自己用自己电脑来尝试或者用云服务器来尝试问 Cloud 的话也都没有 太大的问题除非你真的明确你要用而且你对隐私要求比较高你不用主力机你才会 买这种龙虾机但从硬件的形式来说比如说还有各种端测 AI 的硬件我们今年投资 上也看了蛮多的不管是端测算力盒子的形态还是端测路由端测硬盘的形态我觉得 这些都是一些基于说今天 AI 场景的需求去补充的我们刚不是说到用户的很多轨 迹数据好像模型都拿去训练了举个例子我是某公司的核心的做架构设计的人我用 了之后我的数据如果被高科技知道对我来说是一个非常大的风险隐患对吧如果说 从数据的端测的角度来说我不知道你怎么 看隐私跟模型能力的这么一个冲突你现在 很多时候大家讨论的问题都是我想要最好的模型但我不接受我数据给他就像我们 刚才讨论的 ag ent 的有积累数据数据到底归谁我不知道你怎么看这个问题 对我们可能最近两个月突然会发现很多公司会开始往这个方面去思考我觉得要去 回答这个问题的话可以分成两类用户我觉得对于大多数比如说 C 端用户来说从历 史经验来讲包括互联网时代过来这个经验来讲我觉得更多可能还是更看重效率体 验而多于它的这种隐私它可能甚至可以让 渡一些自己的隐私包括数据安全因为我们 现在知道我们其实大量的数据都根本不在我们自己手里其实都在外部的平台手里 但我们其实也没有人去真的说怎么想办法把这些数据拿回到自己手中来但我们依 然还是享受到了很不错的各种比如电商或者说这种各种媒体娱乐这样的一些体验 所以我觉得从 C 端长期角度来讲它可能会更倾向于使用一些偏云端或者说比如大 厂提供的这样的一个服务不一定会去把 数据完整掌握在自己手里面但是如果说第二 类用户我觉得可能是一些 pro 的 C 端用户尤其是一些 B 端用户我觉得可能这个 问题会显得非常突出尤其是对于 B 端来说他们的数据资产其实本身就是这个企业 经营的最核心的资产无论是他自己的这种技术的文档也好还是一些产品的设计的 一些方法也好其实都是沉淀在他的这些数据上面如果这些数据都比如让渡给大模 型而换取的一些效率上面的能力的话那我觉得应该对这些企业来说是得不偿失的 所以我觉得就是从我们看到的一些未来的机会上来看怎么把最好的大模型的能力 然后和这些企业当然也包括一些 Pro C 的它自己的本地化的一些数据包括一些
00:30-00:40
未分轨讲话者:知识库怎么能够去连接和打通同时又有一定的这种权限隐私的保护这其实是一个 大家在尝试解决的问题对我有个问题假设这个模型你能安全的用你能安全的跟他 讨论任何你自己的核心隐私比如说举个例子原来很多律师是不能把自己客户的资 料泄密的然后核心的工程师是不能把自己的配方泄密的大家去用 AI 就有一个很 大的问题你要么私有化不受让别干假设理想情况下这些问题都解决了是不是这些 场景就会成为今天 AI 下一步渗透的人对我觉得是其实最近跟一个爱立云的朋友 其实在讨论因为他们都是卖大量的服务器给一些客户那么他们那些比如做 C 端生 意的客户其实 T oken 的购用量可能还是比较多但他们很多比如说那些大币 类型的客户其实 T oken 的使用量是一直上不来就跟他们云计算服务器的消 耗比起来少了多得多挑战就是在于他们现在用不起来释放不出来这个 t oken 和模型的能力用于他们的业务场景可能目前只能用在一些比较浅层的效率工具上 但如果真的有一天比如刚才我们说这些问题包括隐私安全的问题能解决然后这些 问题确实是通过我们的一些访谈和调研它确实是很多企业在用大模型上面的一个 非常重要的卡点如果这些卡点能解决的话我相信是能够释放出来更多 t oken 和模型调用的使用的其实我跟彭奇最早我们都看过 S aaS 跟 F int ech 早年其实大部分都 S aaS 跟 F int ech 的客户都大币客户大家那时候 看完经历到现在对大币客户包括我们投资 人也好包括创业公司也好对大币客户都是 有爱有恨他钱是多的但是做起来是累的问题也复杂的我们知道今天你怎么看 AI 在这些大币客户里去落地今天我们最近有个词听过叫 FD 快点听我说吧叫 AI 外 包外包 AI 落地工程师海外很多公司都在招国内的话大 b 服务也很多都是比如说 在大型的模型厂商大型的云服务公司手里去捏着他们去定向服务的不知道你怎么 看对未来 AI 渗透到这些跟大 b 形成一套商业模式的话会跟原来 S aaS 跟 F int ech 时代有什么变化 F int ech 是非常经典大 b 客户很多的 一个 case 我觉得确实是对大 b 这个行业又爱又恨这个描述是非常准确的一个 是他们确实是比较有钱的客户但是他们另外一点就是要求非常高至少从现在这个 时间点比如说我们跟一些企业聊大家在打 大 b 的时候确实还会遇到一样的问题比如 说叫加量不加价的问题因为客户也意识到 说 AI 这件事情能帮我解决一些问题然后 他也觉得说既然市面上大家都是开源的模型对吧你说我是不是愿意为你能给我提 供的这些 AI 服务服务一家那他可能也不一定愿意以及中国这个市场也比较内卷 所以大家可能各个厂商的报价价格战会打的比较狠所以对于现在这个时间点去落 大币的话其实是我们刚才讲到的这些问题那么我觉得这个问题在海外可能会遇到 像中国过去一样的这个弊端客户的问题因为大家都之前都在说比如海外客户比如 S aaS 这个模式比较好大家都真的是可以按照订阅去收费但刚才谈到比如像 FDE 这样的模式他们如果真的要介入到它非常底层的这些比如数据库啊包括这 些系统当中去的时候尤其 AI 要渗透进去的话不可避免的要去解决很多数据安全 隐私包括内部的这些各个的数据库的对接的问题以及还有一个最重要的就是怎么 去控制幻觉的问题因为现在刚才也谈到它能解决一些效率场景的问题而迟迟不能 去接触到业务环节核心原因就是效率可能对于幻觉的容忍度比较高但是真正业务 比如刚才谈到 Fin Tech 比如我做一笔风控我如果完全交给 AI 它如果有 幻觉的话这个带来的损失你说是谁来承担 是模型来承担还是企业的员工来承担这个 界定就跟增价史一样其实现在还没办法去做切分所以我觉得这个确实是制约弊端 去大规模应用的一个挑战可能我们也在这方面也会去关注很多新的这种创业公司 他们也可以去用大模型的能力比如说怎么 去把企业内部的数据层面去做标准化包括 打通然后就可能不需要那么多人去介入去构建比如说企业的一个业务的图谱然后 另外就是怎么能够去在介入业务的过程中去把幻觉的控制的问题解决但是这可能 目前看起来可能还是有一部分的学术问题在里面需要去被解决的但这反而也是机 会我觉得 ag ent 其实我们聊的差不多然后因为我们是投资人我觉得大家肯 定感兴趣说聊那 ag ent 的下一步我们怎么预期对吧我可以先讲讲我的想法 就是对 ag ent 来说今天其实有个有 个挺有意思的争议叫悖论就是 Cloud 客什么都能做了为什么还要去做 ag ent 的创业给别人提供服务那你有什么 不应该自己写但我觉得这个市场永远都是能抽离出一个共性的需求然后共性的需 求由最好的人打磨成一个好的产品再提供给大家去服务剩下碎片化的极度个性化 的需求那用相应的所谓的锤子自己去当钉子砸就行了但是已经有人给你砸好的钉 子拿过来我觉得大家是愿意用的我可以举些例子就是包括对我来说我之前最近也 有蛮多的 AIRSS 的订阅员的那个总结的一些产品出来对我最早也想说自己要 不自己用 Cloud Code 写一个或者用 C ode x 写一个但后面发现 现有的其实挺好用所以我一个月给他们付 个十来块钱订阅费的时候完全不需要自己 烧多少的 t oken 大几百的 t oken 去买一个 APP 我觉得有点像一开始 比如说举个例子锤子或者机床发明出来的时候大家都想自己去做的东西玩到最后 发现当一些产品共性非常明确之后可以规模化之后那索性买比自己做要便宜所以 我觉得可能今天 ag ent 很多时候还是在比较早期的大家动手阶段到了规模 化工业化供给的阶段的话大概率会分出来很多共性的满足大部分人需求的然后能 形成创业机会的一些 ag ent 的产品我觉得这还是我比较期待的我不知道彭 奇你怎么想这一块对未来的预期对大家一 开始可能愿意自己动手做一些我觉得可能 一部分可能来自于 FOMO 一部分可能也来自于他从这个过程中得到的一些成就 感和掌控感比如刚才你讲的比如我们就差一个工程师但现在没有工程师我也可以 把这事干成所以这个成就感我觉得是很强的但这个能力如果现在看起来已经普世 的话如果大家都是这么做我们实际如果从 全球经济价值的角度去考虑这个问题的话 那比如说这个单位这个 t oken 带来的实际的经济价值有多少可能确实就没 多少因为大家也说比如很多 C 端用户开发的代码其实也就是垃圾代码躺在那里它 可能也并不会真正的上线运行去服务什么用户我的感觉是这个确实是还在一个比 较早期的阶段以及这个可能它跟它相关的另外一个有意思的话题就是这个 t oken economy 的问题我觉得还在一个形成的过程中就是大家怎么给这个 t oken 去定价就它的价值到底是按成本定还是说按它实际的这个价值来定那比如刚才讲 到的大家开发了很多有成就感的应用但实际可能没有产生价值就它这个定价的价 格是不是还能持续维持住所以我觉得这件事情可能还需要去拭目以待明白不要重 复造轮子也就是说最后是 t oken 的经济体系如果形成了大家 ag ent 才会在上面说更好来形成运转对我觉得长期来看 t oken 的价格肯定会在一个 供需关系的基础之上去回归一个价值但 这个价值到底会以什么为锚点我觉得就还是 挺拭目以待的我觉得肯定不能以这种线性的方式去推演比如现在大家都按这种订 阅的方式去推演未来比如这几家模型大厂的商业模式和营收模式我觉得可能未来 并不一定是这样的我感觉可能大家今天也没有摸索清楚到底用多贵的 t oken 去跑自己想要的任务往往就是在不清楚的情况下我宁愿用最贵的所以之前 t oken 的用量或者 t oken 的支出在涨突然又回跌了我理解这个更多是一个比较健 康的回撤大家意识到不杀猪不要用牛刀就用便宜的也可以所以慢慢的大家会居履 行我觉得这都是一个经济行为上的正常波动 OK 就是我们刚才其实针对 ag ent 已经聊了很多了我觉得事实上对弹幕型的 讨论也很多还是想问一个老生常谈的问题 就是我不知道颜波觉得过去这半年来就整个这个弹幕型的能力它的进步的速度是 加快的还是在放缓的我觉得体感分两方面如果是结构性的创新比如说举个例子像 当年 O1 出来的 re ason ing 的创新这种跨越式的创新来说现在确实 有一段时间没看到了但是回过头看他们关注的能力点的进步那还是非常快有一个 比较明确的感受就是原来大家去看模型 每次发布的报告的时候大家都是用 MMAU 还有一些数学的测试就像考试去考榜单但今年大家做的都是 SWE Ben ch 然后他做的是 Com puter Use, Engine Ben ch mark 之类的讲究任务交付能力的一个棒蛋模 型其实是从原来的我作为一个我去应付考试变成了我要真正交付 A gen 价值 所以今年我觉得最大的一个变化就是在他的模型越来越像我们刚聊 ag ent 他能支撑 ag ent 变成一个数字员工 的一个角度去提升所以你看的就是大家都 讲我的 c oding 更好了我修吧的能力更好了我调研工具 C lear 的命 运行调研能力更强了我那个桌面的 com puter use 更强了我能做长 任务我的分数更高所以不再像过去一样考 数学考试谁的分数够所以我觉得这是一个 最直观的感受它虽然没有一些结构性的迭代性的颠覆式的创新出来但是它在真实 任务的落地能力中快速提升这也是为什么说大家意识到 AI coding 越来 越好用了本质上就是模型越来越强他就像比如一个学生从学校毕业走入社会的过 程中可能他的知识储备和能力已经基本上定型了但他实际在工作中能多大程度发 挥出来他这个能力现在就变成考盒子不再是 考试分数考你能做多少工作任务了所以
00:40-00:50
未分轨讲话者:这个是一个比较大的变化对对对那这里边表现最突出的你觉得是哪家公司我觉得 大家现在肯定是关注的就是海外 c oding 最强的 An throp ic 至于说为什么我觉得当时 An throp ic 非常明确的把所有的中心都投 入到 c oding 上来是一个绝佳的战略决策把它直接从一个大模型的竞争力 的追赶者变成了行业的引领者因为他是最早看到说模型要从考试转成任务执行的 评估体系上去变的所以他做的模型可以看到为什么 AI coding 这些产品 突然变好用了其实本账就是 Cloud 的 O pus 当时 3.5 出来 C urs or 就好用了然后 Cloud 一直往前做那 c oding 的工具就越来越好用 所以大家会用的越来越多就形成一个正反馈那对 Cloud 来说自己就在这方面 逐步的强化另一个就是 Cloud 的收入 增长实在太好看了太夸张了现在都说他们 的收入可能到 AR 到 160 亿美元然后这 家公司的市值大家都预测他今年上市可能 会是万亿美元的一个市值那从这个角度来说他无疑是最引领风头的他的推理毛利 率也就是说他可能说陈述自己很快今年年终就要盈亏平衡这都是一个超乎大家预 期的一个进展速度对所以他选择了一个 相对看起来比较垂直但其实也足够大的一个 市场去把这个市场的用户群打透其实比你 做一个看起来很全面但是每个方向上可能 并不绝对领先的选择我觉得也不是这么描述, 就是从 c oding 的角度切入的时候, c oding 并不是一个特别垂直的领域, 因为 c oding 本账是包含了人的逻辑跟决策流程在里面的, 因为 c oding 本账就是我们去把算法落成一个具体的 run 的一个 app lic ation,那他去把重心投入到 c oding 之后, 他自然而然增强的是他的推理能力,他的关联的思考能力, 跟他练试的一个决策能力。 所以这反哺了说他模型大家在用他的时候 总觉得他特别严谨特别聪明相比于说我不 点名某些模型公司的产品可能感觉是天马行空非常有想法但是不可靠所以这是他 基于切入 c oding 跟切入 ag ent 的应用之后带来对他的一个模型能 力的反哺我觉得这就叫学而不思则往思而不学则待知行合一 A st rob ic 是最早知行合一做的最好的所以反馈下来 它的知就提的比别人快很多我觉得是这个 点会比较有意思所以今年 A st rob ic 都说发了自己的 F able 5 或者 M eth os 那时候我觉得新闻特别多就说绝对不对外供然后中间短 暂的给大家供了一段时间之后又下线了还又传出来说还有美国要封禁我不知道你 怎么看封禁这个事儿当然我理解大家其实 在网上对他们的能力有一些评价但是因为 很多用户其实也没有真正使用过但我简单看了一下可能他的能力的提升比如说在 上下文的程度上对吧包括说他能做一些自适应的这种循环的思考以及再跟刚才讲 到的 ag ent 的这种能力去做融合给 用户带来了体感上我觉得就是很强的一个 体验但他被封禁这件事情包括像 GPT 也发了 5.65 模型然后反正目前也没有 对大众开放但我觉得这个一方面会有一些烟雾弹的成分有一些饥饿营销的成分在 里边但它是不是能够真的带来国家之间竞争武器一样的能力可能还需要再看一看 那再回头看国内的模型你觉得这半年进展怎么样我觉得最大的惊喜来自于质朴对 尤其是质朴的骨架对质朴的骨架加上它的 GMN5.2 它也是一样把重心就放到 扣顶上对所以回过头来看模型呈现的进展最好我不知道你怎么看其他家的一个进 展情况对我觉得质朴还是在一些架构上还是做了一些自己的创新包括它自己 5. 2 其实也在训练它长程任务的表现上我们也听说加入了一些这种过程奖励的方式 去提升它的能力所以我觉得国内的团队的整体的这种不论是在架构上还是在算法 模型的创新上都还是在持续迭代的但另外我觉得更重要的一点是可能在一些数据 的定义包括数据的采集和任务的定义上也 开始逐渐补强这个其实也是大家之前这个 讨论的比较激烈的部分比如说可能海外的厂商也都在质疑我们是不是在做大量的 这个蒸馏但如果你只是做蒸馏那天花板其实是有限的但看起来大家开始包括上市 之后包括大家融了足够多的钱以后除了过去比如堆算力和挖人才以外大家其实也 越来越多的愿意在数据的采集上花很多的资源和钱对吧包括国内其他几家大厂就 我们了解包括我们今年也看到很多专门做这种数据服务商的公司其实都赚钱还蛮 多的而且基本上是只要有数据都会被封抢所以我觉得主要大家是在做就除了模型 架构迭代以外在数据上其实是补足了原来跟海外大厂的差别当然另外一个比较有 标志性的实践其实也是像大家一直非常关注 De ep Se q 它自从去年年 初发了模型之后后面一直一段时间比较沉寂一点但我们都知道他其实也在做很多 的努力和工作包括适配国产的这个算力他在今年也完成了一次融资这个其实是他 在过去一直声称自己不融资的情况下做出了一个变化然后我觉得这个当然也是比 较有标志性的我觉得他做这个选择应该更多是为了从人才和资源绑定的角度去帮 助他本身企业发展的更好因为我觉得可能 一个是说目前国内的模型的竞争依然还是 比较白热化尤其大家对这种人才的追求还是比较强的所以他需要通过比如给自己 公司做一个估值定价的方式去给他们的员工足够的激励这样子能够吸引和留住最 好的员工我觉得这个其实是这个时代最重要的资产我觉得另外一点就是他做出的 选择就是可能会希望能够更多的去跟去跟国内的这种算力或者说这种厂商去合作 这样子它做的不仅仅是把自己的能力提升上来更多是把整个中国的一个产业生态 带起来就是从模型然后到上游的这些算力基础设施芯片整个系统都带起来 De ep Se ek 我觉得这个事倒挺值得说一句我觉得最大的变化是 De ep Se ek 刚出来的时候行业里的竞争者包括国内的几小龙大家的资金的支持规模大概 都是在几十亿级别所以在这个角度来说几十亿的时候 De ep Se ek 作 为一个有量化基金公司支持的一个 R esearch Lab 或者叫 R esearch 的公司其实还是能跟大家去协同竞争的去年开始到今年遇到一个很巨大很明确的 变化就是大厂开始砸钱去干这个事 C d n C 的组砸了很多钱阿里也在砸钱 小米也在砸钱还有很多 min im ax 质朴上市这些公司手上的资金体量就 不再是一个几十亿人民币的体量这时候如果 De ep S ick 还是按照原 来那种方式运转的时候它无疑是自己给 自己增加挑战难度所以我觉得对它来说 De ep S ick 作为一家风格很明确的公司它一切都是服务于做出更好的大模 型并不是说服务于一些商业落地目标刚才 我们其实聊了很多关于国内大模型的一些 变化所以我不知道从你的观点来看我们和美国的这些头部的模型相比它的差距是 在变大还是在变小我觉得在极速的入门的以及说一些通用的标准版的模型上其实 今天中美的差距是在逐步的缩小的一个过程比如说就拿刚刚的质谱举例很多人都 觉得质谱 G i W an 5.2 的能力编程能力已经非常接近于 GBT5. 5 跟 Cloud Op us 最新的模型所以这个是会缩小的但是有一个非常明 确的问题是我们没法去克服的基礎設施加算力今天始終還是美國佔優他們有數十 萬卡集群的算力中心去支持他們去訓練模型所以在最前沿的模型上我們短期還是 比較難追趕上因為這是一個生態的競爭嘛 但在整體的我們擅長做什麼事情既然我們 沒有算力 De ep Se ek 還是我們擅長去提升算法的效率我們擅長花小 錢辦大事所以我们在追赶的速度会很快所以我理解上短期之内可能还会是美国的 模型厂商去探索前沿不去去把尖端的性能再往前推进然后我们去想办法去跟进但 随着中国的整个生态完善提升的话我觉得 到最后也会有我们去探索前沿的这么一个 时间点出现只不过说这个我能感受到的差距是在越来越小 2022 年的时候大家 觉得我们很难追上了 2023、 2024 年的时候觉得好像差一两年的差距到今年就是很快就几个月的时间可能 大家都会感受到就像最近智普的 CEO 在 XCOM 上跟那个马斯克的那个对话一 样马斯克说你什么时候能赶上 M is os 他说就过一个季度下个季度可能我们 就赶上了所以我觉得我对于差异的观察还是这么一个角度我觉得值得期待但现在 也要正视基础设施的我们的一个差距因为毕竟这些技术设施还是决定了在模型架 构的探索上就是做实验的空间就是你有 更多的机器就能够去同时跑不同的实验这样 去探索前沿的效率肯定是更高的但反过来说比如在补数据的能力上其实是变得比 原来强了很多然后数据其实看起来目前整体对模型能力的进步的贡献的占比应该 是会越来越高所以我觉得从这个角度上来看我也觉得它会更快然后如果再说一个 点的话刚才其实言博也谈到了包括像这些 急速版或者说相对轻量化的一些模型其实
00:50-01:00
未分轨讲话者:我们在效率和成本上的优势是明显的我觉得在这个方面我们一定是领先海外这些 模型厂商的我觉得一定程度上叫我们已经出名了 min im ax 2.5 在 Open C ore T ry 的时候就直接成为了官方推荐的模型然后在今年 那个三月份的英伟达发布会上其实黄瑞勋就提到未来模型的分层其实在很多极速 版跟中间相对标准版通用版的模型上 K imi 跟 min im ax 的名字都 列在了他的 PPT 上我觉得这个事情上还是 我们有追赶的比较快的一步另一个我觉得 挺有意思的是视频生成模型真的是那就是好像是今天反而是国内的声音更大尤其 C-L ens 发布之后收入 AR 已经 20 亿美元反观海外对吧海外目前看到除 了 Go ogle 的 V io 3.0 大家还觉得不错之外但 S ora 已经关 闭了服务现在整个差异反而看起来好像是 我们更强我不知道这是为什么我觉得现在 可能有几个点一个是我们在训练视频模型的数据上我觉得包括像字节包括像阿里 其实在这方面我们其实并不落后刚才我们谈到比如说偏一些文本或者大模型的数 据其实我们需要重新采集很多有很多存量的视频数据但怎么把他们的训练和数据 的挖掘做好这个其实是有很大的空间的在这个层面上我觉得国内的厂商做的还是 不错的然后另外一点就是这些视频模型的 t oken 消耗量是巨大的那么在这个 前提下就你的产生 t oken 的成本和效率就会被乘指数极的放大所以比如对 于 S ora 来说可能生成同样一条视频它的成本是比如说 c d ance 的 很多倍它如果还按照同样的价格的话它基本上很难支撑就它这样的一个模型的商 业模式对于 C d ance 来说他们可以通过这些架构的设计通过这种算力的 高效利用这样子把成本相对降到一个可以 接受的程度这样子就能够带来相应的一些 商业化的价值所以我们也可以看到它的 收入确实就是视频模型相关的收入确实目前 包括 t oken 的使用已经占到整个子杰整体大盘子的一个相当重要的比重了 可能因为我们中国有 AI 短距 AI 慢距所以我们是有明确的需求加上现在工作室 始终在等着最新的模型去改进自己生产效率流程然后这些内容实实在在生产出去 是有人消费的但海外可能确实在消费的或者很多这些消费的渠道上场景是比我们 少很多的所以还有一个很有意思的挂卡点是现在看视频模型做的最好的几家字节 快手谷歌三家各自都有自己的视频平台快手有快手然后自己也有 T ik Tok 加抖音谷歌有 You Tube 所以我猜测也是数据的能力能决定它上线它的进 展速度要多快就刚刚你说的数据非常重要对就是出于隐私的关系不一定用自己平 台上的数据但是他因为做过视频平台包括这些数据的平台他知道怎么能够去从工 程化的角度去处理这些数据的资产那么接 下来我们再聊聊关于 AI 技术设施的一些 部分就 NVIDIA 去年年底收购了 G or ok 然后他在今年 3 月份的 GTC 上也发布了 LPU 的方案然后最近我们也看到 C ere bras 这种一体化 晶圆的公司也上市了然后 Open AI 正好在前两天也刚刚流骗了自己设计的 一个推理的芯片那么随着整个各个大模型厂商在快速推高自己的资本开支然后 t oken 的消耗量也变得非常的大那么算 力基础设施的成本肯定会成为一个很重要 的问题和瓶颈我不知道比如说针对算力基础设施这一层你觉得它正在发生些什么 变化然后有什么是市场要面对的一些挑战和机会对我觉得可以先讲一个大家比较 感兴趣的东西从去年下半年到现在英伟达 的股价没有涨幅特别大还是在 180 美元 到 220 美元之间波动但是它上游相关的 inf ra 公司包括光互联公司包括 存储公司股价都是迎来让人羡慕的快变成 B 圈了对对对 10 倍以上的一个涨幅对 吧就是你去年把年终奖存进去今年可以收获一整年的工资的感觉这个是大家非常 非常都能关注到而且时常会在各种视角媒体冲击你的比如说美光股价涨多高了港 股的南方两倍海力是今天跌 20 个点明天 涨 30 个点就那种上上下下的状态但这里 回过头来看我觉得我们讲正经的这行业的变化核心的变化是从算力够不够变成了 今天是否整个算力系统是不是最高效的运转所以过去大家只用英伟达最好的芯片 去把推理跟训练什么事都做了包括英伟达也是这样用传统 GPCPU 来做变成了 我要去搭建一个更高效在各个场景限价 ROI 最高的一个系统所以今天的关键模 块就不再是 GPGBU 或者是单独的一个商业芯片也变成了推理是不是需要更好 架构的芯片去降低大幅的推理成本因为到最后讲假设 AI 真的渗透到各个行业去 的时候推理是绝对九成以上的一个大头需求推理成本就决定了整个社会 AIT oken 消耗的渗透速度跟渗透量推理成本越便宜 T oken 肯定越便宜模型产业有钱 赚然后另一个就是这个系统如果要高效 那就不仅仅是算的问题还有存跟传输的问题 那就变成了光大家现在很热的光互联跟存储的问题那光互联解决什么问题原来是 这么去举个例子一万个节点的集群的 GPU 卡 A 第一个节点算完了一个卡要把结 果快速的传给不同的第二个节点第二个节点再传给第三个节点大家去计算一个实 际网络那这么一个传输过程假设传输跟不上 最后就变成了 A 算完了给币的过程中, 币已经把第二他手上的活算完了他在等,等的过程这叫什么? GPU 利用率如果 GPU 利用率整体是偏低的话那对算力公司来说或者对这个整 个算力系统来说是低效浪费成本的因为你雇了一万个人结果一万个人里面因为这 活流水线传的慢所以那有些人在牟阳宫那 你肯定是白花钱所以大家就开始花了很多 精力在怎么去考虑提升通信的速度包括说 光护联光护联再到片上光护联这都是一个 长期的所谓光镜同对的一个过程所以大家可以看到光模块的用量在大幅增加数据 中心的板件的连接从原来的直接接线变成现在 PCBPCB 背板所以 PCB 也在 大幅的用量提升然后再到片上的一些探索大家是不是探索更高效率的光护联形态 比如更高速率的光模块现在的可插拔光模块再到 LPU 再到 CPU 这些都是基于 说刚刚那个需求下去倒推出来去逼着整个系统变高效所以我们可以看到系统里明 确面对的墙就是所谓的传输墙还有另一个 就是存储墙存储墙是什么意思存储墙就是 我们已经算完了把东西存在那今天我们要重新算的时候把这些东西搬给这些要计 算的单元的时候这个过程也会让你的算力单元在那边代工那这也是一个算力浪费 所以大家也非常在试图去提升一个存储跟算力之间的一个带宽那让存储具备一个 更高的带宽呢今天就需要更好的存储芯片比如说 HBM 就是这么一个过程中诞生 的也是过去十几年折腾了很久大家一直以为这是一个低性价比但没什么用处的东 西突然在今天被整个行业快速的全面铺开对然后还有另一个价值就是我觉得随着 说 AI 的应用越来越多我们很多的数据都会变成数字化数据很多未被数字化的上 下文全部会被上下文存储那对云端的存储来说它就需要更多的量去存储这东西假 设以后多模态模型出来之后这个存储的需求只会进一步提升所以对云端来说这就 不仅仅是 HBM 的问题了也有 SSD 也有中间 DRAM 的问题然后同时 HBM 成 本过于的高那为了降低整个所谓的提升整个系统的 ROI 那我是不是要考虑提词 利用跟所谓的分级存储利用这也是过去一 两年很多云厂商技术公司在做的事情所以 最后回头来看不管是光复连也好存储也好 HBM 连带的 DWM 跟 SD 都一同被推 到一个非常高的需求我们听到的情况就是也是阿里云的朋友跟我说说他们 26 年 买存储的话都得靠抢了已经是非常难去定到市面上的存储芯片我觉得最直观的感 受就是昨天苹果发的新闻因为存储价格上涨我的 Mac Book 要涨价了已经 影响到 C 端的跟 AI 无关的对已经影响到我们普通人比如说为什么我去年非常坚 定的要把用了 5 年的手机给换掉因为去年如果我不换明年换手机大概率会因为这 些芯片存储的价格上涨手机也要涨价 i Phone 也会涨价所以我觉得这个是 看到的一个变化我觉得挑战跟机会的话这么去看的供给侧有些新的技术出来慢慢 的给需求侧去推广对吧我做了什么新技术 我去找场景去让他们用结果今天因为 AI 带来的一个爆发式需求把原来的很多周期性行业变成了一个成长性行业直接是需 求侧倒闭今天是英伟达去倒闭上游的公司去解决问题去加速你的研发去做更多的 投入把我的所谓的存储墙跟通信墙给解决好所以我觉得这个是一个整个行业在过 去一两年非常大的一个变化你说今天解决 好了吗我觉得也还不算解决的特别好大家 最后还要考虑我们整个算力系统如果抽上去看他做的就一件事电力 in token out 然后这样一个里面就先不考虑它的基础设置投入就在运行的时候 OPEX 的话那怎么样 OPEX 支出尽可能高效的转化为产出那这个过程也还是会持续的 倒逼整个算力基建系统的各个模块去抓紧迭代自己的技术比如说所谓的更低功耗 更高的一个产出更低的成本更好的一个可 维护性不要坏或者怎么样所以我觉得这个
01:00-01:10
未分轨讲话者:是本质上都是在去做更好的 AI 技术设施用更便宜的价格供给大家就回到我们前 面聊 AI 大模型跟 ag ent 一样这些都在去解决藏在下面的问题让我们更便 宜的去用 t oken 或者更好更快的用 t oken 明白明白所以总结一下的话 其实我们的关注点也不只盯在算力本身 包括跟算力相关的存储包括通信以及说上面 跑的软件还有甚至像整个服务器集群上面的包括像夜冷它整个是一体化的一个优 化的过程对这整个是一个系统工程对我觉得另外一方面很重要的一点是需求的多 元化会反映到这些算力在不同类型的硬件上有不同的需求比如刚才讲到的这种像 这个端边云这样的分类当然这边也可以大概简单解释一下比如说端侧就是我们身 边的一些不插电对吧但是带电运行一些设备比如像手机手表耳机或者各种各样的 这种可穿戴的设备其实都算这种端侧的硬件然后还有一类就是所谓叫边缘侧边缘 侧可能是一些插电但是仍然在我们身边能够去针对比如说少量的 C 端用户或者 B 端用户去做一些私有化部署的这样的一些 边缘计算的盒子也好或者一体机也好这样 的一些方式云就比较熟悉了那就是一些在线提供的一些远程的这种服务器的资源 比如像阿里云、腾讯云、 华为这样的一些厂商我们看到大模型的时候大模型的不同类不同档次的模型会分 层那么它们落地到应用侧的时候在不同的边缘侧也会分层那么这些不同的分层的 交叉就会诞生新的机会我们不可能用一个非常最高性能的设备去跑一个多安侧对 吧这样子它从功耗的角度来讲包括体积这些方式可能都是不合理的所以我们需要 为不同的多安边云去设计不同类型的这样 的一些推理芯片然后这样子能够最大可能 的去适配不同的应用场景对所以这里正好说到这个事就多安边云的话你觉得在模 型生态里各自会有一个什么样的发展它可能会有一些不同场景的切分对哪些场景 会最适合端测哪些场景会各自会吃掉哪些我觉得针对 C 端来说我觉得未来端测的 比例可能会比较高以及说因为现在可能端侧跑不了太大的模型但是我们看到未来 的趋势包括我们投的一些初创公司其实在 端侧未来可能甚至跑个几十币的模型都是 有可能的到那天的时候我相信模型能力本身也有了进一步的提升现在几百币能力 的模型未来能跑到一个几十币的模型上然后同时能跑到端侧那我相信大多数这种 比较简单的甚至一些 A 站的类型的任务 已经可以完全在端侧去完成了只有一些非常 复杂的比如说编程或者长程推理可能才需要交到比如说边缘或者云端去完成所以 可能未来在 C 端的这个这个端测市场我觉得这是一个未来绝对不可以忽视的机会 那么对于边缘测来说我相信它可能未来会成为一个沉淀最多无论是对于 C 端用户 来讲还是 B 端用户来讲它的私有数据的这样的一个载体无论是这种 NAS 的形式 还是这种一体机的形式它会把你所需要的所有就跟你的业务或者个人相关的一些 比如说文档视频图片当然还有很多数据库相关的内容都跑在这样的一个偏边缘侧 的设备上然后它对于这些 Pro-C 或者 B 端的价值其实就跟我们刚才讲的可能 跟 C 端的端侧设备的价值比较类似它基本上可以在本地应该几乎可以跑一个满血 版的开源模型这样子它大多数的任务应该都可以在本地去完成了除非有一些非常 特殊的任务本地解决不了可能再经过我们刚才前面讲到的一些包括托米或者安全 的机制再交到云端去协同去完成一些这样的任务当然就剩下可能更多的就是一些 云端的算力去解决的其实有一个刚突然想到挺有意思的小问题我刚提到了苹果在 涨价那现在云端的支出也就是云端的对这些硬件算力基础设施产品的需求这么的 大直接把它价格推涨是不是一定程度上 短期也压抑了我们断次的需求比如说你可能 短期不会再去更新电脑了然后原来比较便宜 的一些端层硬件现在都要变贵反向是不是 会对端次的短期来说不那么利好听起来 当然现在我觉得端测本身的算力的能力包括 它存储的空间可能也支撑不了太复杂的 应用觉得刚才这个判断可能更多是针对比如 两年后这个市场的情况当然到那个时候 我们还需要叠加一些别的周期性的考虑比如 说到那个时候整个的 AI 它的周期会不会 发生变化我们都知道它现在肯定处在一个 泡沫或者一定的高位它到时候会不会有某种程度上的回调它如果有硬的回调之后 其实可能会带来对上游供应链挤泡沫的这样一个过程所以这个成本到时候可能会 有很多的这样一些变动的可能性所以这件事情还需要看未来整体市场的一个周期 性的变化对我倒是觉得有一个点挺有意思就假设我们接受短期就是云测会吸走大 量的资源因为要搞基建了那端测是不是在长期之内都会倾向于去让大家去在一个 相对低算力消耗且相对低硬件成本开支的情况下去实现更好的功能也许会是一个 挺好的创意方向或者切入点如果这个做好 了那假设后面真的资源多了那它也有它的 优势我猜测这也许是一个可以切入的没错没错这块其实我们就也看到很多初创公 司嘛然后当然我们也在关注和投资这个方向就是大家怎么能够把一个相对大参数 的模型比如说无论通过剪裁好还是通过甚至跟存储的一些 SSD 的这种互动也好 对吧怎么能够把它部署在一个相对低性能一点的硬件上这个我觉得是很多厂商在 尝试去解决的问题但这类模式到底能够去带动多大的市场这个可能还需要再去观 察就是 2026 年从咱们一级市场的体感上来说最明显的就是这个世界模型这个 事儿变成了一个超级无敌热的词我印象中上半年看的反正号称跟世界模型相关的 公司应该也得有几十家我相信这个言波应该就咱们也一起看过一些嘛也是比较多 元化吧比如说有的是做跟巨神智能相关的然后也有做跟这种视频生成或者游戏相 关的然后可能也有一些是跟仿真相关的 大家其实对于到底什么是世界模型其实不是 很清楚这个概念通过一个比较粗浅的理解来讲的话反正我觉得世界模型它本身并 不是一个所谓的模型对吧它其实更多就是一种一个概念这个概念可能指的就是说 我们给这个世界一个外部的一个行为的 干预然后去预测这个世界下一个时间点它的 状态会怎么变化在这个定义之下我们是不是 也可以认为说比如牛顿定律它其实也是 一个世界模型以及说对我们每个人来说对吧我们生活在世界上我们无时不刻也在 调动一个自己的世界模型去预测怎么跟你身边的人和环境去交互所以基于这个概 念我想我们还是回到跟 AI 相关的世界模型 的狭义的定义它既可以是真实的它也可以 是纯数字化的它如果是真实的可以用来去做一些刚才我们谈到的就是巨神智能的 交互然后它如果是纯数字的可能会用来做一些视频的生成所以我不知道比如从阎 伯你的角度来看你觉得世界模型是啥它跟我们比如说之前看到的其他的一些创业 方向比如说 VLA 比如说视频生成模型甚至说大语言模型有什么关系我觉得世界 模型这个概念并不是新概念可能从最早强化学习里就有世界模型这个概念因为强 化学习本质上就是一个给予环境一定刺激然后环境给予反馈然后基于反馈然后去 凭进行奖励函数的一个反馈再去强化强化不停的学习然后你给予那个刺激然后再 给予你反馈的这个中间 part s 其实就是本质上就是个世界模型所以今天我觉得 其实定义上大家理解都对世界模型理解都差不多就对要让 AI 去完成对一个所谓 的状态的预测基于说各种输入之后的状态 结果的做预测那这个结果能用来干啥那就 变成了结合不同场景的一个世界模型当然现在世界模型我觉得确实更像一个概念 就是大家可能觉得自己跟这个概念贴合的 我就叫自己叫世界模型了所以好几种世界 模型都冒出来了我现在看到的比如说举个例子视频生成模型 S ora 当年出来 的时候他就学了自己叫世界模型因为他认为 自己是通过视频输出的形式去预测世界 的未来变化对吧那这是一类那包括说现在的 S ora vs C-L ens 这些一定群众认为算是世界模型他预测了可能确实不太准有些时候经常我们会遇 到各种违反物理规律的手穿玻璃或者上车是从车窗玻璃啪穿过玻璃跳进去的所以 这个是视频模型然后还有一派是李飞飞代表的所谓的 3D 视觉模型因为李飞飞过 去其实 10 年包括苏浩在他们组其实后 5 年做的很多事情都是在解决传统的传统 CG 里的 3D 模型的一些 AI 工作今天他想去做的是一个建模用視野模型去建構 一個真 3D 的空間然後在這個 3D 空間裡你是可以做 3D 操作的而不是說那種輸 出一張平面圖的真那它的那個場景就更 傾向於像一個渲染的 3D 世界對那個是一個 可調和的世界的一個狀態至于说他能不能做一些什么真实的物理交互或者怎么样 那其实今天我们也不太清楚他还没有看到一些具体的进展然后还有一个就大名鼎 鼎的 L ac oon 提的 J ep a 我要把世界抽象出一些客观表征来他是 非常显得非常高调的一个 anti-L M 或者 anti-ne xt token
01:10-01:20
未分轨讲话者:prediction 这套套路的扛奇者所以他就认为说世界的很多表征不能用 什么具体的 t oken 去表示它就是用一个抽象化的一个影空间的表示但这个 说起来大家会觉得有点迷啊我觉得比较典型的比喻就是我们去看这个我们面前屏 幕面前的这个话筒的时候假设是用 ne xt token prediction 的话它是去 p redict 我们看到这个画面的每个 p ixel 对吧那 JP AR 想要就或者 L ac oon 说的那一套所谓抽象表达就是我只要知道前面 是一个话筒就 OK 了因为他把这个光的信息或者图片信息抽象成了一个概念表征 所以这是他去做但能不能做出来我觉得我今天也不知道今天就他家在做你是说最 后能做成什么样把 World Model 跟 A ction Policy 结 合起来叫所谓的 WAM World Action Model 这也是上半年 这段时间比较热的方向所以我们可以看到每个方向都有一些相应的公司在一级市 场活跃的融资而且融资的非常热属于是上来就碰碰碰碰碰就上去了这也是我刚前 面我有人说世界模型是一个非常典型的佛谋所以听起来大家都在尝试用一种新的 架构去搭建这个世界模型大家对于世界模型需要一个不同的架构可能是有共识的 但是对于它到底需要一个什么样的架构和表征它可能还没有形成共识比如刚才讲 到有从 3D 路线去走有做视频路线然后也有包括像 J ava 这种影空间路线所以 大家可能在不同路径上探索但都认为说至少它可能跟 LM 的架构是不一样的当然 这个我的理解就是因为语言本身其实已经是一种比较高度的抽象了但是世界模型 刚才谈到可能包含了非常多的实际物理空间现实世界的一些多模态的信息那么这 多模态信息其实是没有经过这么说的高度抽象所以它可能需要另外一种表忠的方 式去把它抽象成可以去做比如说因果推理 或者说去做预测的这样的一种架构不知道 你是不是也同意这个观点它如果以及说你觉得它到底未来跟 LM 会是一种什么关 系我觉得语言跟世界模型其实我个人更倾向于并不是说谁好谁不好或者谁要干掉 谁我觉得从人的角度来说书画跟写作书出 是我们跟世界交流的一部分同时另一部分 很简单就是我去看这个世界我用双手去体验这个世界我去做一些事情去改变这个 世界也是我跟这个世界交互的方式我们面对面交流我们不仅通过声音我们也通过 大家的表情大家的眼神来去交换一些感受所以我觉得从这个角度去出发的话本质 上是大家去跟世界交互的不同渠道而已只不过语言是高度压缩的语言方式那感官 我们的触觉我们的视觉我们的听觉嗅觉五感所感觉到的更像是世界模型所关注的 那种需要输入的信号跟处理预测以及我们 有双手我们去执行所以我觉得这两者的话 不能说是说取代或者是一个谁更优谁更利而是在我们用大圆模型去解决好很多语 言层面的一些智能之后我们自然而然的去关注说我们是不是能拓展到更多的领域 去让 AI 去获得对世界的理解能力所以我觉得世界模型算是一个在话题理解之上 的一个升级但至于为什么说有这么多路线因为每个人对世界的理解或者是世界思 考方式都不一样的有些人擅长具象的思考有些人擅长抽象的思考所以不同的人它 对世界的一个预测方式决策机制都不一样 他们出发点不同对所以它出发点不同的话 我觉得这个世界都有各种各样的人那世界模型变也有各种各样的切入点至于说这 些切入点谁能做出什么神那肯定各自都有擅长各自擅长的事儿比如说擅长抽象推 理的人就非常适合去做数学擅长具象法想象的人他的艺术创作能力就比那些另一 边的人要好我猜测模型最后输出来各自会有各自擅长的点所以并不是说今天世界 模型谁路线优谁路线不优从我的角度来看 的话比如说 3D 世界模型它是去渲染世界 那 J apa 那条路线是去抽象世界我要抽象出牛顿定律来那你可以你是 J apa 这套路线那 WAM 是我要去做什么事情我去想象我去做的事情那每个场景我觉得 大家用一种类型的世界模型去补充这是一个很合理的思路甚至大一统也有可能但 也有可能不会大一统这个我觉得今天我预测不了对那我总结一下我觉得那个 LM 和世界模型是有点互补的关系我之前在内部的分享中其实也尝试去抽象过我觉得 可能世界模型更像是我们的一种就是先天能力对就是我们可能通过基因的就是几 十亿年的这种进化迭代出来的一种我们和世界能够去学习怎么跟世界去交互的一 种能力可能语言模型更像是一种后天的学习和能力我们可能出生以后就是我们学 会语言之后就开启了第二条增长的曲线所以一个先天一个后天他们的迭代方式也 不同计划方式也不同但可能共同塑造了 我们今天每个人的能力我们刚才讨论了很多 关于世界模型的技术路线包括跟 LM 的关系 还有一个比较有趣的事就是你觉得为什么 世界模型是在今年上半年这个时间点突然 爆发了而不是比如说去年或者未来我觉得 这个分两个方向去看各自都有一些技术的 迭代的一个节点然后去驱动了今年的世界 模型爆发第一个是视频模型的完善今天视频模型最早大家去回忆某电影明星吃面 那个经典的视频再到现在的视频模型去 模拟的去渲染生成大家吃面的这个画面其实 已经获得了一个巨大爱景原来是跟物理完全不相关的但今天已经非常符合真实了 所以视频模型的一个训练的完善其实是给世界模型的切入去搭好了一个基础所以 今天很多是基于视频模型去实现一些世界模型的功能的赛道比如说巨声智能对吧 视频模型视频类的世界模型就 action driven 的世界模型就是基于 一个动作无限流的视频模型这些我觉得都是在视频模型的完善基础上搭建出来的 这是供给侧的一个变化另一个供给侧的变化是 3D3D 表示的新的一些表征形态 的出现最早我们可能 M esh 点云这是最早在 CG 里用的是用来渲染用的你说 做一些操作用的再到后面 N ur ve N ur ve 用来做那个采样贴图 重建然后再到今天高斯坡键发现非常适合渲染渲染一些输出的 3D 结果然后再到 3DVGGT 去年发布了之后单张照片的 3D 建模也就是说 AI 的 3D 模型生成 这些技术能力的一些完善之后那做一个 3D 世界的生成就打好了一些良好的基础 所以今年可以看到我觉得但是反过来挺有意思的我发现能做 3D 的虚拟 V 那个事 的公司还是少数因为对算力的要求或者 整体的训练难度都成本都非常的高所以目前 国内也只有腾讯发了一个版本因为腾讯自己游戏特别强然后还有就发布了一些成 果但是在世界模型基于视频模型驱动的这块我们就会看到非常多的团队介入进来 包括说巨声包括说游戏都有一些相应的介入进来的新的团队这个我觉得一个比较 大变化就是开源视频模型的供给非常完善今天大家有好的开源模型去快速的尝试 去训练所以就可以快速的去调出一些阶段性的成果那是不是也有可能是因为这些 视频的数据量比较丰富就是相比于比如说 3D 或者说其他的一些多模态数据所以 这些数据比较 ready 的情况下这些不同的团队它更有可能去训练出来一个机 遇视觉的我觉得这个也跟视频本身就原来 D iff usion 加 A uto Reg ressive 这些进展它相对到一个比较成熟的状态还有就是人类的 视频数据大量的视频数据其实就包含了很多物理世界的信息跟特征你去拿一个水 杯的视频肯定是符合这个世界物理特征的物理规律的一个视频那这些大量的数据 其实就比较好作为一个先沿数据但是在 3D 生成上 3D 怎么去生成一个跟真实逼 近的画面我觉得这过去在很多传统的 CG 领域 CG 领域的话也不是有这么多明确 的数据驱动的事情更多的还是基于一些经验或者规则驱动去做的所以李飞飞那一 套的话相对来说难度会大很多所以我觉得这是一个比较明显的差异至于说乐空搞 的 JEPA 我也不知道他今天能做成什么样这属于是他自己非常特立独行的一条 路如果他能做出来了他做了一件颠覆式的创新如果他不能做出来我觉得也没什么 关系因为他在挑战这世界上最难的一件事情之一对看起来其实世界模型和我们过 去几年一直在看的巨神智能一样它其实 面临着一个比大语言模型更严重的问题就是 它没有数据所以我们才看到大家有一个数据金字塔比如说最底层是一些这种合成 数据然后中间是一些第一视角采集的 E g oc entric 数据或者 WIM P 数据然后最上面可能一些真机腰操数据这样子所以我们也看到这些头部的巨神 智能厂商也好时间步行厂商也好其实都在投入大量的资源去获取这样的数据包括 今年大家也讲说我们希望能够把这种第一人称视角的数据就自从英伟达提出了他 那个路线之后希望能够从比如说 10 万 小时然后推到百万小时甚至千万小时就觉得 这事就有可能能够 scale 所以我不知道你觉得数据的瓶颈和问题最终是会通 过这样的方式解决吗还是说我们仍然需要探索一些不同的方式去获取这些数据和 去训练世界模型我的理解是如果我们聚焦在世界模型这个概念上的话那今天世界 模型希望的是去抽象这个现实是物理世界中的所谓的物理的状态物理的 d ynam ics 跟物理的规律从数据的角度来说那现在不缺视频我们也不缺视频数据其实 我们还缺的是蕴含了物理信息的相应的数据所以其实现在有三类的路径去做这些 数据采集这样抽象完其实大家不管是对应到 巨声也好对应到视觉模型也好大家我觉得
01:20-01:30
未分轨讲话者:都能有很好的一个映照第一类叫真实的物理传感器的采集那比如说摄像头雷达各 种力传感器然后触觉传感器温度传感器声音传感器那这个是去记录最真实的一些 物理量的一个视频视线数据然后这些数据 再跟最好是跟真实的一些视频流数据或者 是其他视觉模型需要的一些 3D 数据去结合那这个就是蕴含物理知识的我们需要 的训练数据那第二类呢因为我们大量的物理交互器是不会布传感器的我不可能说 今天跟你握个手我去手上布个传感器但是 过去我们有物理仿真工具解决的问题就是 假设我没有传感器基础上我通过计算去算出一个接近于真实的一个物理量来指导 我们怎么去更好的在工业上做设计或者叫工业上的各种任务那这一类的数据仿真 数据跟所谓的数据孪生那它就能生成大量 相对可控而且真实而且是真实环境中非常 难采集到的一些稀缺数据这个我觉得可以通过合成数据合成的这个并不会像我们 去机器人里去聊到的那种合成数据一样对吧那个说很似乎是 g ap 很大假设今天 我们给予充分的时间给予足够的精度我理解像我们看的那些 CAE 的公司他确实 可以拿出相对 99.99%以上精度的 数据来那也是有价值的所以第三类就是大家 今天试图去做的一件事情既然视频我们认为视频中会蕴含物理数据的话就基于视 频去做物理数据的推理就纯数据去用的视频给视频做物理数据打标用这么一个思 路来做然后从视频中直接由 AI 模型去推断大概的接触、 受力、 状态变化是什么样子的然后去形成一个数据标签这三者是我觉得是所有数据世界 模型数据的一个方式那这个我们说对应到巨声上的真实物理传感器采集的就是数 据手套摇操作各种各样的数据然后基于视频的物理推理其实就是基于我们的或者 E go Cent ric 数据或者是人类的运动数据去反推机器人的一些物 理数据那仿真就是我们所谓的 Sim ulation to Real 或者叫 做合成数据然后在世界模型也一样我觉得各种各样这类型的数据在不同的世界模 型的基础之上都是可以去补充世界模型所需要的一些数据但怎么做需要怎么样高 效率的有具备经济效率的价值去做那这是每个场景去探索的问题当然大家都觉得 肯定最好的就是真实物理传感机器采集的 物理数据但是这个问题就成本过高了我不 可能为虚拟的模型花个五六百亿去采一个数据这不现实所以最后还是基于说 RO I 最高的角度去合理的分配多种数据的构成 然后形成一个数据利用梯度的系统我觉得 这个是跟巨声是一样的思路所以我理解其实还是跟我们前面讨论的比如说不同的 表征方式它也许最终会决定到底需要一个多少数据量以及多高数据质量的这样的 一个输入能把它做得比较好当然这可能也跟小优的应用场景可能也会直接相关那 就是针对其实咱们上半年看到这些项目而言其实我还观察到一个比较有意思的现 象就是看起来这一波世界模型的创业者很多都是非常年轻的学者甚至很多都是还 没毕业的博士生但是大部分可能是一些刚刚毕业的拿到教职的这些老师我不知道 你觉得为什么是他们在这个时间点出来创业然后以及投资人那咱们为什么愿意去 赌这些老师我觉得我觉得从整个市场角度来说第一是 new lab 这个概念开始 为投资人接受大家愿意去投一些配合 rese arch 的公司原来大家可能就 我一开始说的我说今年最大变化大家可能从看你有什么商业化收入你什么时候落 地变成了说你能做出什么样的好的成果来改变世界然后再去谈商业化所以我愿意 接受之前一段时间是用投资让你去做研究这个是一个最大变化那这些天然适合的 就是这类青年学者以及说站在行业一线的一些学者跟年轻的博士生来做这方向的 创业以及说从投资上确实非常热所以这个钱大家也都能拿到所以大家会先努力的 去尝试一把看看能不能去做加速我觉得这个是一个比较大的一个原因那投资人赌 什么呢我觉得一方面有 FOMO 的肯定有 FOMO 的因素在里面比如说合理的角 度来说不会项目在没有什么变化的情况下碰碰碰连续四五轮下去估值翻十倍对吧 这个是从理性层面上肯定是不合理的但是 投资人肯定还希望的是说真的能赌出中国 下一个 De ep Se ek 不同领域的 De ep Se ek 一家好的研 究驱动的然后真的非常纯粹的公司能够做出一些改变世界的东西这个是我觉得投 资人都在读的点当然这里就有各种各样不同的思考跟判别模式以及说去思考怎么 去投这些老师我觉得这个就要具体问题具体分析了我之前也尝试站在这些老师的 角度上去想过这个问题我觉得他们的出发点一定是想去做出最好的研究成果包括 交付出来甚至 AGI 这样的能力所以对他们来说可能学校的资源是不足够的他们 一定需要借助产业的资源这样子才有足够的钱算力或者招到最优秀的人和学生这 就跟包括为什么 De ep S ick 出来的融资是一样的对所以他们不得不 出来对然后但从另外一点来说我觉得也可能也泼点冷水我相信这里边的多数创业 者肯定都是希望能够把这事做好的站在另外一个角度上来看他们无论是不是出来 创业他的目标都是去做研究所以他出来创业拿了钱这件事情即便我们从最差的角 度来讲没有成功但对他自己来说其实也是做出了还不错的一些学术成果他即便最 终没有交付商业价值所以这个可能也是一个泡沫里面的一点隐忧吧对但最后你说 什么样的教授能做出一个好的公司来我 觉得这还是要回归本质去看并不是说你只是 把研究放出来去做就能成为一个好的公司对对因为我老板其实博士老板之前在博 士毕业之后在美国创业成功被收购了才去做老师所以他也跟我们讲过说做老师跟 做创业完全是两回事如果你做创业那你就要用创业的思维去思考这件事情不仅仅 是做研究因为即使是创业公司的研究也是基于创业公司要创业成功为目的去做研 究并不会说要发个论文做研究我觉得这样 是有蛮大的区别的但可以讲一个轻松一点 的话题就我们可以想象一下如果世界模型 真的有一些明确的商业化进展的话你觉得 最先让我们感受到的场景是游戏啊内容消费这些场景呢还是我们最近一直听到的 巨神智能只能做个大胆的预测了我觉得从消费者角度来讲最先看到的可能还是偏 游戏和内容消费无论你是视频也好还是 3D 的资产也好还是游戏里面的场景也好 它其实并不追求一个绝对的准确性它只要 能够去欺骗过我们人类的眼睛就可以我觉得 做成这么一件事情可能纯数据驱动的方式是能够做的比较好当然它的前提也是它 整个的成本算力这些账能算得过来的情况下我相信在这个领域是能够率先去落地 的那么对于可能偏巨深的操作的一些落地会需要相对更长一点的时间它可能会在 一些垂直领域做一些尝试但是可能从长期普遍落地的角度来讲我觉得还刚才说到 的数据问题可能还需要等待我们去解决对我还蛮期待的如果说真的在游戏里这辈 子就不用在游戏里看到诡异的穿魔跟各种各样奇怪的 bug 出现了相信有了世界 模型之后巨神智能的行业你觉得有发生什么特别的变化吗我觉得大家能感受到的 感官就是好像 VLA 被变成了人人喊打然后世界模型大行其道这是一个比较明显 的变化今年所有讲巨声智能出来创业的公司都在讲做实际模型但从客观的角度来 讲巨声智能行业的变化还是整个行业来说 大家都还在大脑侧持续去探索一个更好的 所谓的巨声智能怎么去定义怎么去实现范化怎么去把整个系统搭建好从数据预训 练后训练部署整套流程搭建好然后再去形成一个泛化的探索这个是整个行业一直 以来的不变的目标那变的是什么呢从其实从去年有些人探索原原来 VLA 是什么 东西就大家可能听 VLA 会觉得比较抽象 VLA 其实就是把语言模型视频视觉语 言模型的 VLM 就是大家传一个图给那个 Ch all enge PT 问他这 图里是什么东西对吧就理解模型对视觉理解模型跟一个机器人的 action 模 型拼在就连在一起 action policy 连在一起就把视频通过 v im 做 back bone 然后去生成动作然后再去给机器人部署这么一个巨声智能 的模型大家发现有一个比较麻烦的问题是 VLM 里 V 的部分不大但 LLM 的那个 参数量非常高你这一部分呢就导致了你对世界的理解或者对物理的理解都不太够 都需要靠大量的采集的遥操作数据去训练然后你后面的 A ction Policy 去获得这些对物理的理解比如说 A ction Policy 它手就这么动的 不能那么动所以你才学习到所以是个标准 模仿学习所以大家过去发现说 VLA 好像 泛化起来一直都比较有挑战甚至有人强调 说 VLA 本质上就是一个过拟核有人这么 提过但后面随着说我刚也说了开源的视频生成模型大家尝试说哎反正也是视觉输 入 in 然后一个 t oken out 为什么不把视频生成模型来尝试视觉输入 in 跟视频的 t oken out 然后来做它的一个机座模型用生成来替代理 解对用生成替代理解生成来替代理解怎么个直观的理解呢就是说就像人去做一个
01:30-01:40
未分轨讲话者:动作之前我先去想象我做了这个动作会变成什么样然后我再跟着自己的想象去走 所以这么去做了之后大家发现说很多物理的规律跟物理的真实的约束就会被已经 被训练被封装在了视频模型的影空间里了所以这样子似乎探索起来它泛化的上限 会更高所以大家开始各种各样的去尝试拿开源的视频模型怎么去跟现有的动作 V LA 去替换怎么再去跟后面的动作模块去结合所以从去年开始到今年就有非常多 的巨声的视线模型出来但所以也看到非常多的一级市场的创业项目都讲这个但是 回过头来说大家好像感受到的观点是 VLA 要被扫进垃圾桶了实际上是这样的我觉得 有一个很重要要去感受的信息是美国那边的头部大厂在做什么因为今年 Gen W ars AI 他们发布了最新的 Gen 1 然后他们的 CEO Peter Florence 就在自己的 x.com 上就发表了一篇文章叫 Beyond VLA and World Mod els 其实它里面一个最核心的观点就是巨神智能也不应该基于不要幻 想着靠一些 met hod s 拿着这些锤子去把这个钉子给搞定掉巨神智能还是 要基于巨神智能本身的定义去设定目标用目标驱动的方式代替方法论驱动的方式 去解决巨神智能里的泛化问题就不是说今天有什么新的技术过来放到巨神上试一 试也许能解决有一些成果但并不能真正解决巨神问题所以他更强调的是不是去争 论 VOA 还是世界模型而是最后去基于巨声智能的目标我要去实现一个 zero shot 的可泛化的一个巨声智能动作系统那基于这个目标去不停的去搭建一个 系统级别的一个巨声智能解决方案出来然后去实现这个目标所以这个是北美那边 一些最新的叙事所以我们看到说慢慢的可能从他发了这个文章之后大家也回过头 来在国内开始提到所谓的一些巨神智能的系统论更多的强调说 World Action Model 跟 VLA 是互补的是协同的都是巨神智能的一部分我觉得这个逻辑反 而更合理了大家可以去想象一下说我们自己去练习打网球 VLA 是指我们看到这 网球打过来我们要去执行什么样的动作把它打回去然后世界模型指的是我们平时 在看到它过来的时候先去想我们要什么的方式打回去但是很多时候你先想再动势 必反应要慢这也是今天世界模型的一个问题就是推理比较慢所以先想再动明显球 场上很多高专业的运动员不是先想再动的他们是基于身体的本能的那这个身体的 本能是怎么实现的我觉得也有可能像 VLA 这样的方式基于一个视觉的输入直接 升级给予一个本能的一个 action 的输出快速的给予一个反击所以这两者并 不是说互相冲突的可能对于你不熟悉的陌生环境来说你很多时候会需要靠预测去 观察自己动作的结果去想象自己动作的结果但是对于熟悉的动作来说可能你就不 需要世界模型了所以这个点来看的话世界模型的引入跟 VLA 还是一个比较算是 整个巨声智能行业的一个快速进步吧明白所以其实也听到比如说有做世界模型的 会把世界模型当成是用于训练 VLA 的一个环境对吧所以在这个程度上其实这两 者也是互补的甚至刚才这个言波提到的这个世界 World Action Model 它其实相当于是把预测和 action 结合在了一起所以大家其实都在这里面尝 试着不同的一种结合的方式吧对那其实我们也针对巨神智能的大脑的部分其实聊 了很多那么其实我们再看看另外一面就是 比如偏本体和硬件这一块我们也知道这个 语数很快可能就要上市了包括可能还有 乐趣云深处这些厂商当然我们其实还有很多 的人行包括其他的这种本体类型的厂商也在港股排队那么所以我不知道就是在偏 硬件和本体这个层面你觉得从上半年的情况来看大家已经到了开始要去批量这个 落地的阶段了吗我觉得现在只是说阶段性的这些公司有商业化场景表演科研这些 或者一些特殊垂直场景对人性的需求都是有存在商业化你不能去否认表演是一个 不算一个商业化场景我觉得这不合理因为无人机的表演是一个很重要的商业化场 景所以从这个角度来看今年很多公司在但包括说上游的技术的成熟包括去年的 M im ic M im ic 模仿那个去全身动作的一个 M im ic 的一个 R et ar get ing 这些技术的成熟所以可以快速的看到机器人好像 跳的舞越来越多了那今年的话明显就可以看到机器人在表演接待展览各种活动上 都形成了所谓的租赁啊购买啊的价值那这样机器人公司就会有一些明确的出货量 所以到这个阶段的话我觉得以这种硬件出货加上产品及硬件出货的方式进行销售 的公司呢他们也具备了一个上市的一个价值所以从财务上来看那宇树的营收跟利 润都还是非常可快是比较经典的像一个硬件公司的一个状态对所以我理解他可能 除了比如除了科研市场以外就是他的商业 化更多是基于情绪价值的但情绪价值也是 价值对吧比如他跳舞这些其实都是情绪价值但其实也很重要但确实我们要承认他 可能还没有完全到比如说提供比如功能 价值的这个阶段可能需要再往后下半年或者 明年我们要再看我觉得往后提供价值提供一些更高的价值本身还是智能测或者叫 模型测能力的进步如果他能做更多的有价值的任务对吧就跟大脑那个部分跟我们 讨论的要去结合对如果他怎么去更好的做一些自主的跟环境形成反馈互动然后去 做一些相关的任务比如说举个例子就最近的话除了跳舞之外主机的 LUNA 也去 做导购给大家呈现一些导购的交互比如在车展上的导购还有就是 fig ure 它的机器人已经呈现了在物流上下的上下料怎么去拆解怎么去分解智源最近也做 了一个工厂的直播我觉得这些城市都是在早期阶段非常重要的一些探索但是真正 的规模化落地其实大家的预期都还是蛮高的这一代人型机器人跟传统的工业机器 人有巨大的区别是因为传统的工业机器人本质上是你编程驱动的对吧是人力的人 的智慧要素智能要素去驱动它的而不是说它自身的智能要素驱动所以最后如果说 真的能做到模型跟本体相互结合形成一个机器人智能结合硬件的一个智能化产品 的角度的话那时候才会迎来一个真正上 规模的一个商业化预期我觉得对这就像我们 经常也会把局深落地拆成一个不可能三角比如说他到底做的是这种长程复杂的旌 旗任务他同时还要兼顾比较高的成功率以及说我们还希望他能够跨场景泛化这个 目前看起来是不可能的所以我可能如果考虑落地的话比如选择其中的一项或者两 项在客户能接受的程度下是有可能率先去落地的当然这个成本也是一个很重要的 考量我是觉得从落地的角度来看的话那今天其实阶段性的是有一些可以落地的点 但我们不能说对他预期太高或者说认为他就是终局也不能因为今天巨声智能处于 早期阶段对吧他可能精度不高他可能成功率不高就认为这没有价值因为今天巨声 智能大家首先要解决是通用问题通用问题解决好之后才有足够的精力去解决精度 和成功率的问题这回过头来就是看就是一个比较经典的理论就是叫积膜越强强化 学习越有效你在一个很差的积膜上去做强化的话价值也不大所以大家今天更多是 在通用化的积膜上去下功夫一旦通用化的基模到了就跟原模型一样到了一个质变 点的时候你再加上强化学习再加上一些推理那他所获得的给你涌现出来的成果就 会远超于你的预期对我觉得是这么一个角度去看的所以你说这个不可能三角今天 摆在面前是一个挑战但是最终也许一个个功课之后这个三角会整体被大家啪拓宽 开来对但这里面其实我们也看到一些不同的公司的做法可能也有一些不同的观点 就是到底比如这一波的浪潮能不能直接推到刚才讲到的这个通用和泛化如果不能 的话那是不是在中间选择一些能够阶段性能够去落地的方式是比较好的模式所以 这个我们也不知道答案但是我们觉得是有这个可能性的中国的巨声公司会整个巨 声行业一直被被各方力量催促着去反复尝试一些落地但反而你看海外的公司更接 近一个 lab 的形态包括说 ph ysical intelligence gener ous AI 跟 S und ay 这些都是更接近一个 rese arch lab 的形态所以他们有更多的精力去去做基模 的研究反而我们可能看到国内的新闻都是 在做一些落地从我的角度来说能不能商业化取决于技术的成熟度是不是过了商业 化的临界点今天可能巨神智能的模型本身 就也有刚彭奇提到的那个不可能三角其实 还是在一个非常早期的阶段所以真的沉下心来好好去把这个事先做 rese arch 反而是对长期来说更有价值的一件事情 我们看到其实过去半年在已经市场上有很多 比如说零巧手啊或者初级传感器的情况下 这个依然有非常多新的公司出来包括大家 开始做批量化的出货所以我不知道在硬件上是不是已经到了去在最末端的这个手 上面去下功夫的一个阶段以及它距离真正商业化相比比如说现在成熟一点的假爪 方案到底到了一个什么程度这个挺有意思 的我们那时候在 24 年去看手的时候很多 的观点是说手没必要我用假爪就行了但结果看这两年手的进展变好了之后大家终 于去可以去利用 E go-centric 数据了因为 E go Cent ric 数据去用的就是人手的数据那我人手的数据映射到林乔手上的结果肯定要比人手
01:40-01:50
未分轨讲话者:映射到一个二指甲爪上要更好一些所以这其实这个进步是这些数据能用本质上是 林乔手的一个发展带来的所以可以理解为林乔手跟居生智能其实是一个相辅相成 的一个相互促进的一个状态有好的领导手才会有更多的数据可以被利用以及说更 多的数据会产生从投资角度来看的话我 觉得过去始终会出现一些新的手我个人觉得 在硬件上形态上大家创业岗上更多收敛了就建神加关键电机两个驱动形式在做那 各自都会有一些不同的切入点然后从研发 一个手的关注度上指标上来说 20 年大家 看的是高自由度负载精度今天大家看的是成本耐用性可维护性你说这是不是真的 能落地稳定落地你这手是一个看起来酷炫的手还是一个能用的手大家对于它用也 很重要还有个变化是随着它的完善那大家会去做一些想去用手去做一些巨神之能 训练那你手是不是天然跟 AI 这一次模型这一次数据这一次能适配的协同比较好 那需要这个手的公司去做相应的一些中间 层的服务的提供我觉得这些都是从手上面 来看一个比较明确的变化然后触觉传感器 的话呢今天来看可能跟 24 年差不多我觉得 在新技术的路径上还其实还是那么些路径包括说词对吧 MEMS 包括说试触觉试 触学过去这几年可能声量会比较大一些就他的信息输入是远超过触觉所需要的它 是一个荣誉信息输入再提取一个特征信息 出来的这么一个过程所以降维的过程所以 在这个过程中呢大家可以利用他的荣誉信息去做很多其他触觉传奇干不了的事儿 对所以目前的话呢还是处在一个各自探索的一个阶段那你说触觉需不需要怎么用 也就是说触觉以后怎么去跟模型适配这个逻辑这个过程就像重复 24 年到现在零 小手的过程一样也许未来会出现触觉的相应的数据能用起来视频中去推理触觉的 物理特征然后再结合触觉的零小手去做 一些巨声智能的部署最后大概率也要走这么 一个过程但今天的话我觉得还是处于一个比较早期的状态对我觉得触觉既然对于 人来说是一个非常重要的模态那未来对于 机器来说应该也是必不可少的对对我其实 这两天也正好想到一种任务如果机器人能完成就代表他的手和触觉的能力足够用 了就是它纯靠手上面的触觉传感器去摸某一个物体大概就能把它的 3D 形状还原 出来因为我们人其实大概是有这样的能力的比如我们可以闭着眼睛去完成一些操 作但是它可能的精度不一定那么高但它大致上是可以还原出来所以如果它纯靠手 和这些触觉能把它还原出来那我相信再跟视觉模态再加其他模态结合在一起基本 上它再去完成一些任务就问题不大对我觉得这个我正好可以给你补充一点就你说 的这个东西其实就是需要的是一个面的一个触觉感知能力在数学上叫通过一组法 向量你可以反推出这组法向量的那个暴露面对这样子其实是比较合理的就人的感 觉是这样因为我摸了大概我知道那个力的 方向然后我根据这个力的推出方向我大概 能最后感受还能再调整它的空间位置对感受它在找啥样这个是一个非常好典型的 case 其实之前我们去聊我们投资的几家触摸传感器公司他们现场有一个很有 意思的例子就是原来比如说一个二指甲爪惰机驱动二指甲爪非常性能也很差很便 宜但是就 100 块人民币的这么一个很便宜的甲爪通过加上了一个触摸传感器实 现了一个控制的闭环反馈之后它就能精准的夹起一个豆腐而不捏碎豆腐通过力控 的方式去做这件事情那力控肯定是一个非常基础的工作什么时候能说机器人模型 测能用好这些我觉得长期来看是一个相互融合相互迭代的一个过程从巨神智能跟 人形机器人的角度来说可能今天大家的重心还是在先做好其他事情上在逐步过渡 到这个事情上所以这个节奏我觉得大家都知道重要但节奏会往后拖好的除了刚才 其实咱们讨论过这些最热的领域之外我 不知道你觉得还有什么方向是值得大家包括 创业者特别去关注的吗其实有两个方向我特别感兴趣所以从今年下半年来看第一 个是 A i for Science 但不是前几年 Al pha F old 那样的 A i for Science 概念就是整个科学的研究研究的整个过 程其实是由人智能加操作结合的一整个 pipeline 那 AI 在这些环节里能 替代掉那些 pipeline 极大的加速这个 research 的效率我觉得这 也是一个 AI for science 的一个实现方式所以今年可以看到很多 auto research 的一些工作但是这些 auto research 还是局限在某一些领域内的那是不是在一些更多的领域内能极快的提升科研创新 的一个效率那这样的方向我觉得也是一个新一个类型的 AI for science 另一个就是结合刚刚世界模型讲的那一套怎么去世界模型本质上去对物理世界的 底层做理解底层做预测对物理世界做预测传统的物理仿生器还是基于偏分方程求 解的方式去实现的那今天我们办法用 AI 去替代偏分方程的求解把这个底层的内 核切换过去那这个其实现在慢慢的已经成为一个主流方向大家在讲叫神经网络算 子去或者叫底层的 PVE 的球解用 AI 去驱动之后那就能极大的改变原来的你做 CAE 仿真中一个很痛苦的问题你要算的准就慢你要算的快就不准但现在可以走 到诱科与准我觉得这就是一个迭代式的进步所以这两点的话那 AFS cience 除了说我刚说在 rese arch 中还有更多的研究场景是不是放 AI 去切入 比如我们可能过去更多关注的生命科学材料药学这些因为是做一些分子合成预测 最近我觉得一个很有意思的一点是社会科学因为社会科学原来所有的社科是缺乏 一个高效的推演的实验机制他的实验要么靠你真厉害你去搞社会大份额的调研结 果相当于以社会一个社会作为他的实验实验环境要么就是通过调研抽样小范围的 抽样做那个 sam pling 的方式去做研究那是不是 AI 在这里今天能够为 这个社会科学做一些新的研究的加速哪些环节能切进去我觉得都是挺有意思的点 突然让我觉得对 AFO Science 这个事思路打开了很多就不再是局限在 说 AFO 材料 AFO 生物科技里面然后另一个我觉得 AFO 硬件这件事情还是持 续在国内会有很好的一个创新机会因为并不是说我们今天看到了什么机会一定会 出来而是因为我们有最好的土壤我们有成熟的硬件供应链我们有很聪明的一批年 轻的创始人产品经理然后有很好的一个 AI 的基础设施去提供给他们他们可以快 速的去基于自己的想象力去搭建出一些硬件产品来那这些产品有这么个土壤我就 非常期待他们会诞生一些随机进化出来预期之外的惊喜对这些都是过去我们觉得 大家一直不怎么重视但是今天 AI 出来之后发现这个不仅是消费项目这是一个结 合科技的项目对对而且针对 AI 硬件我觉得它除了给用户提供直接价值以外其实 跟我们刚才讨论的世界模型其实关系也很大对因为我们就纯数字化的数据其实在 网上已经沉淀了很多了对吧但是我们跟 物理世界交互的这个数据以及我们自己包括 像生命数据包括像脑电数据其实都还是非常缺乏的所以这些数据都要靠未来的这 种所谓的 AI 硬件的形式但 AI 硬件只是个概念它可能有算力然后有 AI 的软件 能力然后有各种传感器它能够在我们使用这些在这些硬件的过程中让模型和 AI 更了解我们自己这样反过来未来能够给我们提供更好的一个服务可能这个价值的 想象空间会更大所以短期来看比较明确的 AI 硬件的一个价值就是作为人类真实 活动的物理世界真实活动的上下文数据采集工具或者采集入口也许因为它采集了 这些数据它就能更好地提供一些新的产品价值对于这些 AI 硬件厂商来说可能还 比较重要的一点就是它到底只是一个数据采集器还是它能够作为一个数据的 h ub 然后就由它为中心去整合用户其他的上下文的 cont ext 来为用户提供服 务本质上它也是个消费品大家要买它是有价值的对这个定位我觉得大家是需要在 创业的时候想清楚最后再总结一下资本市场今年上半年的一些变化我们知道语数 马上就要在客户上板上市然后以及质谱和 min im ax 在年初上市之后今年 整体的股价表现尤其是质谱的表现还是非常好的另外包括像 K imi, J ay y ue 这些大模型厂商包括像 De ep S ick 其实也相继 完成了大额的融资我不知道你怎么看整个 AI 公司的上市潮以及它到底会对我们 未来的意气市场投资会带来什么样的影响我觉得从我们作为一级投资人的角度来 说肯定是好事大家一级市场能赚钱了从 AI 行业的角度来说我觉得这个是这些公 司到了阶段性证明了其在 AI 大模型基础模型生态地位中的价值之后它的一次资 本化兑现它也需要更多的钱也就是说持续源源不断的子弹在这个市场竞争中生存 下去所以可以看到智普跟 min im ax 上市之后呢其实其他几家也逐渐相 对表现不错的公司也逐渐启动了自动化的流程它要竞争它要新的弹药它要去打更 长远的我觉得这个是整个资本市场对于这类长期有价值但短期人需科研投入的方 向做出了一个支持其实海外的话 Open AI 跟 A st rob ic 今年 也会要上市但这些公司的上市并不是说它是真的说像传统的公司上市一样大家要 看 PE 或者看什么更多还是看它一个长期的生态位的问题其实从互联网公司的时
01:50-02:00
未分轨讲话者:代来看那时候上市大家也不是看谁赚钱不赚钱也是看一个长期的现金流带来的生 态优势跟生态位置带来的一个长期价值然后今天再怎么去看这些类型的 AI 公司 上市我觉得要用一个乐观的角度去面对最后的股价怎么走我觉得是由市场竞争跟 他们自己最终的某一时刻的生产位的排位去决定的那你觉得随着更多的巨声公司 上市包括下半年可能 Open AI 包括 An throp ic 的上市就是这 一轮的整个 AI 我们都说他处在一个泡沫阶段我们达到了一个什么样的位置我们 往后走他这个泡沫会破吗你觉得预测泡沫会破是一件困难的事情因为大家都可以 说泡沫终究会破但是这句话是一句正确的废话但我只能说从阶段性的角度来看一 级市场短期会因为上市带来一波风沫跟泡沫热潮但这些回归理性之后因为二级市 场其实比一级市场反馈周期要短很多的你 一旦有一些业务做不好或者市场出现一些 问题股价快速反馈出来一级市场反馈会慢一些那就看这些公司在上市之后他们的 一个实际的商业化进展或者叫研究的一些阶段性进展是不是能够支撑起他们市场 的预期对吧如果他们是这些带头大哥支撑不起其实反过来就会打压我们一级市场 的一个整个估值预期所以对于巨生跟人行机神还有 AI 下面的上市公司来说我都 希望大家能够表现的好以及说各自公司本身能够表现的好那还会给一级市场一些 空间如果他们表现撑不住那可能回过来对一级市场的公司来说今年上半年遇到的 快速估值上涨也有可能会出现一个阶段性的冷静期大家会想二级好像上去估值都 必定占得住一级这么贵形成了一二级倒挂是不是应该保持一些冷静不用这么着急 不用那么疯所以我觉得就会有这么一个变化确实我也同意反正预测泡沫这件事情 什么时候破是个很难回答的问题对但我们反正从我角度来讲我们可以试图去预测 一下就是假设这个泡沫破了的话它的影响可能会是什么对吧或者换句话说可能哪 些公司在那个时候会更有可能活下来或者它成为真正的好公司泡沫的阶段大家都 会想着是我买的我投的公司肯定也会是最好的公司我投的公司不会比其他的差就 像大家在二级市场非常火热的时候大家都会想着我买的股票一定也能涨我的股票 明天也能涨停所以大家是跟牛神这种预期 在但是在假设泡沫破裂之后大家明显因为 市场遇冷所以大家必须要去收缩到把资产配置到更优质的资产上来所以大家对资 产的质量要求就会更高所以这时候回到刚刚我们讲巨声跟 AI 的话 PM research 类型的方向比如说世界模型也好比如说现在做巨神智能模型研究的公司也好真的 具备持续研究交付能力然后真的能持续给出一些 milestone 关键突破进 展且引领行业具备行业地位的公司我觉得还是会持续拿到钱去撑过去但是慢慢的 就会变成你只是靠一些 demo 对吧你靠讲故事你没有一些 results 输出 你就会拿不到钱但是对于偏落地的比如说像已经有些商业模式的公司来说假设泡 沫破了这个价值就会往商业模式更稳健业务订单更真实的公司去收拢可能大家晚 期的估值会回升最后靠的是公司自己的商业的商业的所谓的鲁莽性你怎么去抗冲 击的能力你怎么应对这些危机的能力去提高自己的公司生存能力这也是假设泡沫 破了之后的一个趋势我的一个想象我觉得只能说对反正我觉得泡沫如果破了的话 它其实反而可能是大家反正无论是偏软件 大模型这一层的还是偏居深这一层的可能 反而更有利于大家去落地它传导过去之后可能反而上游的整个的成本都会降下来 对于用户来说它的整体的成本下降也会更好地带动一个落地的可能性因为现在毕 竟制约这些行业落地的一个很大的因素 其实都是整个的资本开支和成本的问题所以 到时候会为大家落地创造一个比较好的 条件具体谁能在这个落地的时候真正做出来 反正大家如果都上市了也就可比了能够帮助市场去筛选出来好公司其实对一级来 说并不是说上市就等于结束我们也希望他 做的好不然等到我们能够解禁退出的时候 股价最终也会回归到合理的价值因为二级 市场的反应还是非常的快行最后一个问题 就是如果针对下半年我们再做一个预测对吧如果要压住一个变量你觉得会是什么 就像刚刚我们聊到 A gent H arness Engineering 一样我希望去看到一些能够在某些场景形成一个所谓的真实数据闭环的这么一个 机会包括巨声包括说 A gent 其实本账都是一样的就是一旦能形成这种机制 或者是帮助去形成这种机制的公司卖铲子的公司也可以去做这种搭建这种机制的 公司也可以具象的说今天虽然巨声智能已经到了一个早期难投资的阶段但如果有 公司能够从巨声智能的数据系统预训练系统后训练系统再到部署再到数据征集数 据强化学习整个流程都能形成一道闭环不停地滚起来去测试运转的话我觉得这样 的公司天然的竞争力还是要远高于一些单 点切入的公司的那这样是不是创神有这个 V ision 能去把这样的系统搭建起来那对于 ag ent 来说也是一样的 ag ent 并不是简单只是你今天还是只卖一个 sk ills sk ills 不构成商业模式 sk ills 你随便 下载根本不受人保护但能保护的就是怎么样 让这个 ag ent 能够交付出类似于接近于人的产品来所以这个是需要 ag ent 具备自我自我决策自我审查自我学习这么一个过程因为从人的角度来说我们今天 任何时候我们去干一件新的事情我们不可能实现实美干到最完美的我们是在学习 中进步的那是不是 ag ent 能实现这个真实数据闭环在学习中进步那他需要 的是硬件解决方案还是软件解决方案我觉得都是值得下半年去基于这个角度去观 察的节点这个问题其实我自己也有一个预测就是我觉得可能下半年会看更多偏能 落地的一些项目可能这个落地指的是确实能够去带来一些商业化的价值我觉得往 后看虽然没法预测泡沫什么时候会破 什么时候会发生但我觉得这个事情就没有一个 技术能够不经过周期就直接实现所谓 AGI 对吧它中间一定会经历一些至少短期 的一些波动那么在这些波动的过程当中他能否落地就决定了他能不能在这过程中 能够去建立一个阶段性的优势包括这个优势能够帮他去带来收入也好能够帮他去 带来融资也好包括像刚才言波讲的带来数据闭环的价值也好那么就能够去帮助他 在下一个阶段是不是能够采取起飞对这可能是我这边的一个预测今天反正我们针 对上半年的 AI 讨论了非常多的内容当然可能这些都是我们个人的一些意见和想 法我们的很多判断也许会在未来的几个月 半年甚至一年去被打脸但是我们也很希望 这件事发生这样就说明整个行业的发展会 进一步超出我们的预期我们希望未来可能 再过段时间我们再一起坐下来再去复盘复盘看看这个行业到底会往何处走对还是 去年我们收尾的那句话我们希望欢迎打脸也希望这个行业快速变化让我们明年有 更多新的东西可以持续去学习跟探讨谢谢大家
참고 출처
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.
