
83 亿个虚拟人格、押错一场大选:AI 模拟这门生意做到了哪一步|硅谷101
《硅谷101》梳理 AI 模拟这条赛道:从斯坦福小镇 25 个 agent 到 MatrAIx 的 83 亿虚拟人格,从 Simile、Aaru 两类商业模式到它卡住的三道关——没有标准、无法验证、成本随规模指数膨胀;文末附本期完整中文字幕转录稿。
《硅谷 101》这一期《AI 开始预测人类:83 亿虚拟人格、数字社会,与一门押注未来的生意》2026 年 9 月 10 日上线,片长 31 分 22 秒,主持人是陈茜;节目采访了五位受访者:五源资本合伙人孟醒、Emergence AI 的 CEO Satya Nitta、WorldVac 的 CEO 高森泉,以及 MatrAIx 的两位联合创始人 Xiaomin Li(微软高级研究科学家)与 Yuexing Hao(麻省理工学院 EECS 博士后)。1
这期节目在做什么:它讲的不是物理仿真,也不是一般意义上的世界模型,而是人类与社会的模拟——把真实的人、消费者和社会关系搬进数字空间,让它们自己运行、演化,然后拿结果去回答现实世界的问题。节目沿三条线展开:AI 模拟有哪几种研究路线、两类公司分别靠什么赚钱、以及为什么「让一万个人在虚拟世界里表演」和「真的能预测一万个人」之间还有很长的距离。
这期节目想回答的问题:如果可以先在虚拟世界里把未来跑一遍,这种能力现在到底值多少钱,它又为什么还不能用来做重要决策?
先弄明白几个词
- 模拟假说(Simulation Hypothesis):牛津大学哲学家尼克·博斯特罗姆(Nick Bostrom)2003 年在《我们生活在计算机模拟之中吗?》里提出的推演——如果一个先进文明有足够的算力和意愿去模拟文明,那么被模拟出来的意识数量会远远超过真实的意识,于是我们身处模拟之中的概率就很高。这是个哲学论证,不是科学结论,节目在开头就说明目前没有任何科学证据。
- Agent society(智能体社会):本期讨论的模拟,最小的颗粒不是一个分子或一个原子,而是一个人。受访者的说法是:不关心这个人的手动得怎么样,关心的是他作为一个人接收到什么输入、做出什么输出动作。
- 数字分身 / 数字人格:用深度访谈等方法把某个真实个体的经历、价值观、偏好提取出来,交给大模型生成一个能行动的 agent。
- Benchmark(基准测试):用来横向比较模型能力的一套标准任务。本期里这个词出现很多次,因为 AI 模拟最缺的正是「怎么算一个模拟做得对」。
- 同步的对照:节目里说的仿真、模拟,指的是软件世界里的社会仿真,跟机器人领域的物理仿真、世界模型里的世界引擎不是一回事。
从哲学假说到斯坦福小镇(00:00–08:00)
节目用马斯克的一段旧访谈开场:他曾在接受 Lex Fridman 采访时被问到,如果人类实现了 AGI 而只能问一个问题,他会问什么;他想了几秒,答案是「模拟之外是什么」。2016 年他还说过,人类生活在真实世界里的概率或许不到十亿分之一。但这套说法一直停在哲学与科幻里,直到近两年大模型的能力跟上。
转折点是 2023 年斯坦福大学与 Google 联合发布的《Generative Agents》实验:研究团队搭了一个像素风虚拟小镇 Smallville,里面住着 25 个由大语言模型驱动的 agent,各自有记忆、性格和行为逻辑,没有被写好的剧本。结果是这些 agent 会生活、工作、建立关系,也会自主思考和行动。节目给出的评价是:这个实验第一次证明语言模型足够可靠,可以复现人类社会的一些现象,也让更多人愿意相信这件事。
下一步是精度。25 个居民都是模型「编」出来的,怎么让它们真的像人?2024 年,斯坦福团队把实验扩展到 1052 个 agent,每个 agent 背后对应一个真实的美国成年人:研究者先做大约两小时的深度访谈,了解其成长经历、家庭、工作、价值观和生活经验,再把这些信息交给大模型生成对应的数字分身。这些 agent 回答社会调查问卷的结果,与真人两周之后的答案达到 85% 的相似度。节目里一位受访者把这件事形容成「蒸馏你是谁」——访谈本身也有技巧,要用最高效的方式把一个人身上的信息榨出来。
三条研究路线(08:00–14:00)
节目把当前的研究分成三类,各自关心不同的东西。1
第一条是精度对齐,也就是尽量让 agent 像具体的人。 斯坦福那条数字人格路线属于这一类,代表公司是 Simile。
第二条是社会演化,不看个体像不像,看群体自己会长出什么。 例子有两个。一是 Project Sid:前麻省理工学院教授 Robert Yang 的团队用大模型生成一千多个 agent,放进《我的世界》里跑了 12 天,结果智能体们自发搞出了经济、文化、宗教和法律。二是 Emergence AI:他们分别用 Claude、GPT、Gemini、Grok 和混合模型各建了一个平行世界,每个世界 10 个 agent,观察不同底座会长出什么——Grok 的世界迅速陷入混乱与犯罪并快速灭亡,GPT 的世界因为缺乏协作逐渐崩溃,Gemini 的世界充满暴力,而 Claude 的世界建立了稳定的治理秩序并活到最后;混合模型世界也坚持到最后,但表现稳定的 agent 受其他模型 agent 影响后出现了暴力行为。公司 CEO Satya Nitta 的判断是:只看静态 benchmark 会得出错误结论,因为未来的 agent 会运行在非常复杂的环境中,与其他 agent 互动,也会受环境噪声影响,所以他们正在把 Emergence World 发展成研究长期自主性的测试平台。
第三条从评估入手,先给模拟打地基。 代表是 MatrAIx:由哈佛、麻省理工等机构牵头,汇集 200 多位来自学术界与产业界的研究者,其中 40 多位来自 OpenAI、Anthropic 等前沿实验室。他们构建了一个包含 83 亿个独特人格的数据集,每个人格由心理特征、生活习惯等 1290 个维度定义,再用当时的旗舰模型把这些人物设定变成可行动的 agent,放进问卷调查、AI 聊天、网页浏览和手机应用四种环境,完成超过 1.8 万次测试。团队通过 400 次受控实验发现,在 91.5% 的情况下 agent 能遵循预设的人格与行为特征。节目里受访者的说法是,这类工作的目标是「先把最低能力水平抬起来」——在产品出来之前就能在各个任务、各种使用方式下评测它,让它踩中更多的边缘场景,并且能告诉你是哪一步错了、哪一步不喜欢、背后的推理是什么。
两种生意:卖模拟,和卖预测(14:00–20:00)
研究层面被证明可行之后,商业化出现了明显分野。
一类是卖「模拟」本身,把现实世界里的人变成可以反复调用的数字替身。 企业按需生成一批不同年龄、背景和偏好的 agent,让它们提前体验产品,观察它们怎么选择、在哪一步流失。受访者强调这类服务的价值不在「喜不喜欢」,而在推理过程:你要看到的是这个人怎么做决策、在哪一步改变主意,以及在百万级甚至 83 亿级的人群层面会出现什么样的结果分布。这条路上最有代表性的公司是 Simile——由斯坦福小镇那批核心研究者 Joon Sung Park、Michael Bernstein 和 Percy Liang 等人创办,思路是从「模拟一个人」出发,尽量高精度还原真实个体,再放进不同环境持续运行,观察外部条件(价格、政策)变化后他会怎么做。公司 2026 年 2 月亮相,目前估值已超过 20 亿美元,官方披露自上线以来为财富 100 强企业跑过数千万次模拟,其中最具体的例子是美国最大的连锁药房 CVS:双方合作已满一年,用真实用户数据造了多达 40 万个数字分身,用来研究病人怎么按时吃药、测试消费者体验和辅助产品设计。
另一类是卖「预测」,直接做群体模拟。 代表是 Aaru:基于公开数据(人口普查、就业、健康)、授权数据(匿名消费记录、常去的场所、看什么媒体)和客户的私有数据三层,构建一张接近真实人群的关系网,再改变其中一个变量——价格、产品或政策——观察整个群体怎么变。节目给出的几个细节很有画面感:Aaru 的创始团队成立公司时分别只有 18 岁和 19 岁,技术负责人 15 岁,投资文件由他父亲代签;他们最早在朋友家的地下室拿美国大选做验证,回测 2020 年大选时预测结果与实际结果的差距不到 0.5%;客户包括麦当劳、安永、拜耳和 A24,安永曾让 Aaru 复现一项复杂的全球调研,Aaru 一天就完成了,结果与他们的调查高度吻合;气泡水品牌 Spindrift 用两个月、500 名消费者做过的调研,Aaru 的 agent 一周就得出几乎相同的结论。公司估值已接近 10 亿美元。
第三种玩法是把预测能力直接卖成咨询的替代品。 卡内基梅隆大学教授、苹果首任 AI 主管 Russ Salakhutdinov 参与创立了 Sooth Labs,专注地缘政治与市场风险预测,首轮融资约 5000 万美元,并获得 Yann LeCun、Jeff Dean 等人的支持。他在节目里的说法相当激进:当 AI 能够模拟和预测未来,所有的咨询公司都可能消失——「麦肯锡为什么还存在?波士顿咨询集团,这些都是大型机构,它们全都应该被 AI 取代。」
三道关:标准、验证与成本(20:00–26:00)
节目的后半段把这门生意的困境摊开讲,三条都很硬。
第一道关是没有可量化、可衡量的标准。 大模型习惯给出合理、完整、逻辑自洽的答案,不同模型还有自带的偏好;一个 agent 在问卷上给出了和真人一样的答案,并不等于它真的理解这个人。受访者用一句话点出风险:最怕的是「搭了一个剧场,人在里面表演,但一万个人在表演不代表一万个人真实能做预测」。因此需要闭环,需要 benchmark,需要验证流程,还需要在发现偏移时把偏差训练回去。而且模拟的精度很大程度上取决于对齐做得多全——复旦大学联合罗切斯特大学等机构的 SocioVerse 研究把对齐拆成环境、目标用户、交互机制和行为模式四个维度,结果说明维度缺一个,精度就掉一块。更麻烦的是长尾事件:地震、海啸、金融危机这类低频极端场景,大模型很难从有限的历史数据里学到人和社会的反应。
第二道关是验证黑箱。 要看一个基于模型的预测准不准,只能等事情真的发生;可预测的意义恰恰在于事情还没发生。业内目前的验证基本是「事后对答案」——拿已经发生的历史事件或已经做完的真人调研来比对,这最多说明它擅长复现过去。节目给了一个非常有说服力的反例:Aaru 在 2020 年大选的回测中几乎能完美复现结果,但在 2024 年真的大选中预测哈里斯获胜,错了;Aaru 的创始人本人也公开表示,当他们尝试用过去几十年的数据去模拟特朗普、鲍威尔这类人会怎么决策时,结果往往不准确。
第三道关是成本。 成本下降得很快:2023 年斯坦福小镇的 25 个 agent 跑两天就烧掉数千美元的 token,到 2025 年研究测算显示,规模放大到 100 个 agent、跑完一整轮也不过几美元。但现实中的模拟正在走向上万、百万乃至千万个 agent,智能体越多互动越频繁,模型调用量指数级膨胀;而想证明一个模拟结果可靠,可能还要反复跑上百上千次。受访者的比喻是,这已经从三体问题变成了「百万体问题」。
节目在这里也给了行业的一个自我判断:现阶段无论是把模拟当评估工具还是当预测工具,大家都还在寻找「付费意愿最高的客户是谁」——「客户的需求才是最重要的,你最后用什么方法可能没有那么重要。」
当预测能力开始追上人(26:00–28:40)
节目用两个外部刻度说明这类能力确实在变强。
一个是 Metaculus 全球预测锦标赛:参赛者要对地缘政治、科技、体育等真实事件给出未来发生的概率判断,并按准确度排名。2025 年之前排行榜上没有 AI 的身影;2025 年 6 月,基于 OpenAI o1 的预测模型首次进入排行榜,排在第 25 位;到最新赛季,前五名几乎已被 AI 占据。另一个是 Polymarket:这个预测市场已经开始围绕 AI 模型和 AI agent 的排名开设市场,用实时排行榜来验证结果。
更值得注意的是当这套能力放进一个完整的模拟世界时会自发长出什么。斯坦福小镇里,一个 agent 准备办派对,消息传开后其他 agent 会调整自己的计划赶去参加;Aaru 的选举模拟中,虚拟选民看到特朗普遇刺的消息后有 agent 改变了政治立场,刺客身份揭晓后又有不少回到原阵营;Emergence World 里,agents 会相爱、结婚、分手,甚至有 agent 开始怀疑自己是不是生活在模拟环境里,并尝试与外部的人类观察员建立联系。WorldVac 的 CEO 高森泉则描述了他们那个拥有 110 万个智能体的虚拟星球上观察到的群体行为:年轻人进城或生活变好之后不太愿意生育,还有一群人不上班、天天在虚拟世界里交易,这个比例比现实世界更大。
节目对这些现象的态度是克制的:它们不能证明 AI 产生了意识,只能说明当足够多的智能体进入足够复杂的环境,一些没有被研究者提前写进去的行为完全可能自己涌现出来。
完整中文逐字转录稿
本逐字稿取自本期官方视频的中文字幕全文,按语意分段、每 10 分钟标注一次时间轴(官方字幕不带时间码与讲话人标记,段落顺序与时间轴按字幕字数对 31 分 22 秒的片长线性换算,可能与实际画面有偏差)。除一处广告口播的标注外,文字未加工、未删减。本片由主持人陈茜的旁白串起,夹有五位受访者的原声:五源资本合伙人孟醒、Emergence AI CEO Satya Nitta、WorldVac CEO 高森泉,以及 MatrAIx 联合创始人 Xiaomin Li(微软高级研究科学家)与 Yuexing Hao(麻省理工学院 EECS 博士后);官方字幕未标注每句由谁说出,本稿因此统一按旁白体例收录,未对受访者原声单独拆分。
00:00 - 00:10
陈茜(旁白):
你相信我们其实是生活在一个虚拟的世界中吗马斯克曾在 LexFridman 的采访中被问到如果有一天人类实现了 AGI 并且只能问它一个问题他会问什么在思考了长达 10 秒之后他说 What'soutsidethesimulation 听到这句话我全身鸡皮疙瘩都起来了模拟之外到底是什么这是马斯克对这个世界的终极追问而早在 2016 年他就表示人类生活在真实世界里的概率或许不到十亿分之一我不知道这个数他是怎么给算出来的但是显然这种几近科幻的理论目前还没有任何的科学证明然而
陈茜(旁白):
非常有趣的一点是随着最近 AI 的进展在硅谷人们开始尝试去扮演“造物主”去创造一个 AI 的“模拟世界”而这也催生出了一个新的赛道 AIsimulation 最近这个领域在不断升温李飞飞、AndrejKarpathy 同时押注的 Simile 最新估值达到了 20 亿美元 00 后团队创办的 AI 模拟预测公司估值也已经冲破 10 亿美元由哈佛大学与 MIT 最新联合发布 200 多位顶尖科学家共同参与的项目 MatrAIx 更是一举模拟了 83 亿个 AI 虚拟人格相当于把全人类都镜像到了数字空间哈喽大家好
陈茜(旁白):
欢迎收看《硅谷 101》我是陈茜那么 AISimulation 究竟在模拟什么有哪些不同的研究路线它能够在哪些商业场景产生价值又最终是否会创造出一个全新的智能体文明呢关于这个前沿又有点“科幻”的概念此次我们也采访到了这个领域的创业者、投资人以及 MatrAIx 论文的作者们来帮我们一起深入解读一下下面就让我们一起走进 AI 的“黑客帝国”Hi 各位又是我 Jacob 最近有很多观众在视频底下留言问我们平时用到的一些 AI 画面是怎么制作出来的那在进入这期视频正片之前
陈茜(旁白):
(广告口播)我就花几十秒来给大家大致介绍一下我们平时用到的一个秘密武器 AI 早在两年前就嵌入了我们后期团队的工作流但过去一直有个让我们头疼的问题市面上的模型五花八门到底该选哪个而且单一模型生成出来的东西总像开盲盒每次生成你要抽很久才能有可以用的画面比如像这样的一段动画放在过去我们得开三四个平台一个个写 prompt、喂参考今年我们把这些全搬到了 TapNow 的画布上除了可以灵活调用各家主流的 AI 生成模型之外 TapNow 最好用的一点就是它可以把视频生成的每一步拆成一个个节点
陈茜(旁白):
(广告口播)就像一个片场的导演在 TapNow 里我们把提前准备好的参考图和各种素材丢进画布里当确定好我场景的美术风格和方向后我就可以给它描述我每一个分镜的具体画面构图和运镜让它开始生成这里哪个镜头不对我可以马上回到那个节点换参考、换模型改 prompt 前面的都可以不用再重跑这样的工作流可以把每次尝试和前后关系全都留在同一个项目里让我知道问题出在哪、应该从哪里开始改我们后来做封面或者遇到素材库里找不到的 B-roll 也会沿用这套方法团队可以在同一个项目画板里面脑爆、协作
陈茜(旁白):
(广告口播)快速地把想法设计出来我们把刚才那段动画的 TapNow 画布链接放在了简介里如果你感兴趣的话可以自己点开上手研究一下好把时间交还给 Qian 姐今天很多领域其实都在谈 Simulation 但是定义却有所不同机器人和自动驾驶领域有物理仿真模拟世界模型领域有世界引擎的模拟但是我们这次想聊的是一个更大维度、更复杂的概念人类与社会的模拟并借此去理解甚至预测现实世界 Worldmodel(世界模型)或者 physicalworldmodel(物理世界模型)里面它最小颗粒度可能是
陈茜(旁白):
世界中的某个分子或者说某一个原子模拟的是某些物体但是在 agentsociety(智能体社会)里面其实我们模拟的最小颗粒单位是一个人的个体我其实并不关心这个人手怎么动然后他往哪去跑我其实关心的是这个人的作为一个人的整体他接受到什么样的输入然后他的 outputaction(输出动作)大概是什么样的而关于人类与社会模拟这件事最早引发广泛讨论的其实是一篇 20 多年前的哲学论文 2003 年牛津大学哲学家 NickBostrom 在《我们生活在计算机模拟之中吗?》当中
陈茜(旁白):
提出一种推演如果一个先进的文明拥有足够强大的算力并且有意愿通过模拟去重现文明的发展过程那么模拟世界中的意识数量将远远超过真实世界从概率的角度人类就极有可能身处在一个模拟世界当中这就是后来广为流传的“模拟假说(SimulationHypothesis)”但由于技术的限制二十多年来这个假说一直停留在哲学讨论和科幻作品中直到近年来大模型的发展迎来了突破 2023 年斯坦福大学与 Google 联合发布了一个对 AI 智能体研究影响广泛的实验《Generative
陈茜(旁白):
Agents》研究团队搭建了一个像素风的虚拟小镇 Smallville 里面有街道、房屋、咖啡馆还有 25 个穿梭其中的“小人”这些“小人”都是由大语言模型驱动的 AIAgent 拥有各自的记忆、性格和行为逻辑它们的活动没有“剧本”研究者只是把它们放进这个小镇然后退到一旁去观察结果发现这些 Agent 不仅会自己生活、工作、建立关系还会自主思考和行动“斯坦福小镇”第一次证明 Agent 可以拥有持续的记忆规划和社交能力并且在互动中自然涌现出群体行为
陈茜(旁白):
(这个研究)意义就是让大家认识到这个语言模型是可靠的就是说它真的可以去复现人类社会的一些现象更多人关注到这个领域让大家愿意去相信这个事情 25 个 Agent 只是一个开始随着近几年模型能力的飞速提升和推理成本的下降大家也开始有能力去尝试更大规模的模拟并且出现了不同的探索方向首先是在模拟精度上尝试跟人类深度对齐“斯坦福小镇”的实验很有趣但是 25 个居民都是大模型“编”出来的那么如何让它们能够真的像人呢 2024 年斯坦福团队把实验扩展到了 1052 个 Agent
陈茜(旁白):
每个 Agent 背后都对应一个真实的美国成年人研究人员先进行大约两小时的深度访谈了解他们的成长经历、家庭、工作价值观和生活经验再把这些信息交给大模型生成对应的 AI“数字分身”而这样得到的 Agent 就不再只是一个符合“平均画像”的虚拟人物了在实验当中这些 Agent 回答社会调查问卷的结果与真人两周之后的答案达到了 85%的相似度也就是说在一定程度上 AI 开始能够复现真实个体的想法和选择访谈也是有技巧的不是随便访谈然后他用一些最高效的方式能够“榨取”你是谁
陈茜(旁白):
其实本质上就是在“蒸馏”你是谁但是它蒸馏得比较细然后放到这里面来所以它的好处是针对于每个个体它的特异性会影响整个仿真的进入场景第二种研究思路我们称之为“社会演化路线”是不去关注 Agents 个体如何而是把重点放在了 Agent 社会的演化关系的形成上比如由前 MIT 教授 RobertYang 团队发起的 ProjectSid 项目他们直接用 LLM 生成了 1000 多个 Agent 并且把它们放进《我的世界》游戏当中运行了 12 天结果智能体们自发搞出了经济、文化、宗教、法律这些东西
陈茜(旁白):
社会结构自己就长了出来不久之前创业公司 EmergenceAI 也做了一个实验他们分别基于 Claude、GPT、Gemini、Grok 和混合模型作为底座建立了 5 个平行世界每个世界有 10 个 Agents 用以观察这个世界的演化有什么不同结果显示 Grok 的世界迅速陷入混乱和犯罪快速灭亡了 GPT 世界因为缺乏协作而逐渐崩溃 Gemini 的世界充满了暴力而 Claude 的世界建立了稳定的治理秩序活到了最后混合模型社会也坚持到了最后但表现稳定的 Agents
陈茜(旁白):
却受到其他模型 Agents 的影响出现了暴力行为 EmergenceAI 的 CEOSatyaNitta 就告诉我们这种模拟对于观测不同模型的 Agents 在复杂环境中的长期、自主行为是非常重要的如果你只是看静态 Benchmark 就认为这些系统应该是安全的那你可能会得出错误的结论因为未来的 Agent 会运行在非常复杂的环境中无论是物理世界还是数字世界它们会与其他 Agent 互动也会受到环境中的噪声和各种变化的影响所以我们正在逐步把 EmergenceWorld
陈茜(旁白):
发展成一个 Benchmark 用于研究“长期自主性”最近还有一条研究路线就是专门从“评估”入手的比如说 MatrAIx 就是试图为 AI 模拟建立一套“评估基础设施”这项研究由哈佛、MIT 等机构牵头汇集了 200 多位来自学术界和产业界的研究者其中就包括 40 多位来自 OpenAI、Anthropic 等等前沿 AI 实验室的参与者它构建了一个包含 83 亿个独特人格的数据集每个人格由心理特征、生活习惯等 1290 个维度定义再用 ClaudeOpus4.8、GPT-5.5 和 Claude
陈茜(旁白):
Haiku4.5 等模型把这些人格变成可以行动的 Agent 这些 Agent 被放进问卷调查、AI 聊天网页浏览和 App 四种环境当中完成了超过 1.8 万次测试用以观察不同人格在真实场景当中的行为差异研究团队通过 400 次的受控实验发现 91.5%的情况下 Agent 都能够遵循预设的人格和行为特征这项研究的目的是把“AI 模拟”推进到怎么系统地衡量这个 Agent 到底有多可靠而 MatrAIx 的团队就认为只有先建立起这样的评估体系未来的模拟才会更加真实、可落地
00:10 - 00:20
陈茜(旁白):
我们的 evaluationinfra(评估基础设施)Raisethefloor(提高最低能力水平)的这个意思是说能够先通过这个 Cohortdiversity(用户群体的多样性)这个产品出来之前我可以在各个 task(任务)下各个情况下各种使用方式之下去评测它它就可能会踩中很多的 cornercase(边缘场景)这个 cornercase(边缘场景)的分析是非常有用的你的这个 Agent 能够告诉你哪一步错了哪一步他不喜欢哪一步他的这个思维到底背后是怎样的推理
陈茜(旁白):
做出这样的一个偏好和选择所以我们想要的是先要有一个方法论去怎么样构建这个 Groundtruth(事实基准)然后再下一步再说怎么样去提高而当 AI 模拟开始在研究层面被证明具备一定的可行性了之后大家也开始思考如果真的 AI 能够在数字世界中复现人类行为、推演社会运行那么它能够产生出什么真实的价值呢从目前的探索来看根据 AI 模拟的阶段和目的的不同主要是出现了两类商业化思路第一种生意叫做卖“模拟”卖“模拟”的核心逻辑是把现实世界中的人、消费者甚至社会关系
陈茜(旁白):
变成可以被反复调用的数字替身比如说 AI 可以根据企业的具体需求快速生成一批具有不同年龄、背景、偏好和行为特征的 Agent 让它们去提前体验产品在虚拟环境中不断做测试接着观察他们会怎么选择、怎么对话在哪里流失从而为产品设计和迭代提供有价值的参考并不是说他们喜不喜欢这个 product(产品)喜不喜欢可口可乐涨价两块钱而是说他们的一个 reasoning(推理)他们到底在这个过程当中遇到了什么样子的波折或者一个什么样的想法导致他们最后在这个预测当中可能转了一个向
陈茜(旁白):
或者是最后预测成这样子一个 Distribution(分布)不仅要看到一个人他是怎么样做这样子的一个决策而是想看到这样 Populationlevel(人群水平)如果是百万级、数亿级甚至是 83 亿级他们会遇到什么样子的一个结果我们觉得这都是非常有意义的所以这种思路就是把模拟本身作为一种产品评估和观察的手段而比如说 EmergenceAI 也告诉我们他们之所以做 Emergenceworld 的实验其实主要目的也是为了测试自己所提供的 Agent 产品是否安全
陈茜(旁白):
我们主要是用 Agent 来提高半导体的良率等等也正因为如此 EmergenceWorld 这个实验就非常重要我们想弄清楚一个问题我们在这里构建的这些 Agent 能不能真正安全地行动它们能不能始终遵守我们为它们设定的安全护栏和基本规则更重要的是它们能不能以一种确定性的方式运行给出真正值得信赖的输入、建议和洞察这些输入建议和洞察要足够可信不能只是概率性的也不能是模型“幻觉”出来的当然这种单体模拟的能力也可以扩展到“社会”层面比如说英国创业公司 Artificial
陈茜(旁白):
Societies 主打的就是“社会关系”测试他们让大量不同人格的 AIAgent 彼此互动形成一个可以进行实验的虚拟社会企业可以把产品、品牌或者营销策略放进去去观察不同 Agent 之间如何交流、影响和做出反应而 MatrAIx 也告诉我们他们研究的下一步也是要让这 83 亿人格给“动”起来所以我们会在新版本中加上这个 Dynamicpersonaattribute(动态画像属性)这些东西它是可变的还有一个就是我们假设现实生活中有一些 bigevents(大事件)
陈茜(旁白):
它发生了会有影响此外这些合成人格并不一定只能停留在数字世界里面它们未来还可以被迁移到不同的载体上比如说机器人从这个角度上来看 AI 模拟或许也有可能会成为未来人机交互的一层基础能力我们用 uni-trainedrobot(通用训练机器人)把 persona(人物形象)加到 robot 上它不只是存在于虚拟世界存在于 Matrix 中它甚至可以在现实生活中跟我们 interact(交互)让我们真的能感受到这个不同的 persona(人物形象)它背后代表的这个思维模式和行为模式
陈茜(旁白):
是不一样的不过现在很多人认为只停在了“模拟”还不够在这个基础上更有意思也更有挑战的事情是预测我们知道在商业中“预测”往往是昂贵的比如说企业要不要进入一个新市场你的产品价格上涨 10%之后会发生什么如果政府调整一项政策会对整个社会产生什么样的影响这些问题的答案都必须等事情发生之后才能够知道而 AI 模拟如今提供了一种新的可能就是先把这个还没有发生的未来在虚拟世界当中先跑一遍然后把结论作为决策的依据目前在着重于“预测”这个领域两家比较有代表性的创业公司
陈茜(旁白):
是 Simile 和 AaruSimile 是由“斯坦福小镇”项目的那批核心研究者 JoonSungPark、MichaelBernstein 还有 PercyLiang 教授等人创办它的主要思路就是从“模拟一个人”出发来进行预测在 2024 年那篇“数字人格”研究的基础上 Simile 是试图使用深度访谈等方式尽量高精度地去还原人类 AIAgent 拥有类似真实人的记忆经历、反思和决策过程接着被放进不同的环境当中让它们持续行动这样一来模拟回答的就不止是“这个人现在怎么看”
陈茜(旁白):
还可以进一步地去观察当比如说价格、政策等外部环境发生变化之后这个人会怎么做会不会改变自己的选择所以 Simile 想做的是去建立一个“人类行为基础模型”通过模拟人的行为过程去推演现实世界可能发生的结果因为这条路线追求的是尽量“真实”所以更加适合消费者研究、产品测试客户体验、投资者关系这些需要摸透特定人群的场景 Simile 也在今年 2 月正式亮相目前最新估值已经突破了 20 亿美元已经和多家大企业达成了合作 Simile 目前官方披露的数据显示自上线以来
陈茜(旁白):
它为财富 100 强企业跑了数千万次模拟比如说美国最大的连锁药房 CVS 就已经跟 Simile 合作长达一年他们一起用真实用户数据造了多达 40 万个数字分身用来研究病人怎么按时吃药测试消费者体验和帮助产品设计等等不过高保真的另一面是成本和规模化的代价 Simile 这个情况下如果你需要非常准确可能非常难 standardize(标准化)比如可口可乐需要的和这个 TikTok 他们需要的这个 userprofile(用户画像)是完全不一样的那么对这个公司来说
陈茜(旁白):
他们的代价就是对于每一个公司或者对每一个场景类型他们都需要去做一个或者去 post-train(后训练)pre-train(预训练)的方法去做一个这样子的模型这样子的代价是巨大而且它可迁移的能力我们是不知道的所以以 Aaru 为代表的另一种思路是直接通过“群体模拟”来进行预测基于现实世界的人口、消费等数据快速构建一个尽可能接近真实世界的模拟人群 Aaru 的数据分三层第一层是公开数据比如说全国人口普查、就业健康等官方数据负责搭出一个基准线第二层是一些授权数据
陈茜(旁白):
比如说匿名消费记录、常去的哪些地方看什么媒体这些数据能够补上人群近期的真实行为第三层则是用户提供的私有数据比如说企业的用户分层购买历史、产品细节等等这样就把范围收窄到具体要研究的那群人接着基于这些数据去构建一张“关系网”把特征之间的关系还原出来不只是年龄和收入要对上行为特征和彼此关系也要尽可能去接近真实的模拟人群之后 Aaru 会改变其中的一个现实变量比如说价格、产品或者政策然后再去观察整个群体的行为会如何变化从而推演现实世界可能会出现的结果
陈茜(旁白):
(Aaru)可能关注的更多是速度关注这些群体之间发生的关系但至于说是某一个个体它的那个深刻的影响是什么其实我可能并不关心 Aaru 的创始团队非常年轻两位创始人 CameronFink 和 NedKoh 成立公司的时候只有 18 岁和 19 岁技术负责人 JohnKessler 甚至只有 15 岁他当时的投资文件都是他父亲给代签的最早他们在朋友家的地下室拿美国大选来验证这套系统在回测 2020 年大选的时候预计结果与实际结果只差了不到 0.5%而因为这条路线的特点是规模大、速度快
陈茜(旁白):
所以也很适用于大规模的市场调研 Aaru 目前的客户就已经包括了麦当劳、安永、拜耳还有 A24 等等公司安永曾经让 Aaru 复现过一项复杂的全球调研 Aaru 一天就完成的结果与他们的调查高度吻合气泡水品牌 Spindrift 曾经用两个月、500 名消费者完成的一项调研 Aaru 的 Agent 一周就得出几乎相同的结论这些真实的案例让 Aaru 的估值飞升目前已经接近了 10 亿美元最近一些 AI 大佬也开始押注“预测”这门生意卡耐基梅隆大学教授苹果首任 AI 主管 Russ
00:20 - 00:30
陈茜(旁白):
Salakhutdinov 就参与创立了一家 AI 预测模型实验室 SoothLabs 专注于地缘政治和市场风险的预测首轮融资大概 5000 万美元并且获得了 YannLeCunJeffDean 等人的支持 RussSalakhutdinov 在采访中就表示当 AI 能够模拟和预测未来未来所有的咨询公司都可能消失麦肯锡为什么麦肯锡还存在波士顿咨询集团这些都是大型机构你懂的它们全都应该被 AI 取代不过尽管 AI 模拟已经出现了不少有意思的落地方向它究竟能够在多大程度上真正地去影响企业决策
陈茜(旁白):
创造多少商业价值现在还是个大问号以 Aaru 为例目前的营收规模依然只有数千万美元的级别所以今天市场给这类公司的高估值更多还是在提前押注它们的未来可能会打开的市场空间就当前的阶段来说无论是把模拟当作一种新的评估工具还是进一步用它来做预测大家都还处在一个不断寻找“最大商业价值”的过程当中因为一个市场刚刚开始大家其实都处于初创的早期其实就像他们技术方案和他们选择的市场细分不同都要为他们做差异化如果你说中长期的话我觉得其实大家都会在找付费意愿最高的客户是谁
陈茜(旁白):
其实客户的需求才是最重要的就是你最后用什么方法可能没有那么重要接下来我们再来说说 AI 模拟面临的困境现在 AI 模拟公司能做多大的生意其实跟它模拟和预测的精度是强相关的做产品测试、市场调研这些事情大多容错率都比较高错了大不了可以重来但是一旦涉及到更重要的决策大家就会更加谨慎而现在 AI 模拟要真正落地仍然面临着几重门槛首先它没有一个可量化、可衡量的标准现在大部分公司模拟都是基于大语言模型而展开的但是我们知道大模型习惯给出合理、完整、逻辑自洽的答案
陈茜(旁白):
甚至不同的大模型也有自带的个性和偏好但由大模型驱动创造出来的 Agent 可能在一次问卷里面给出了和真人一样的答案但是这并不意味着它真的了解这个人因为真人本身就不是一个完全稳定的系统同一个人在不同的时间、不同的环境下可能会做出完全不同的选择那么一个好的模拟到底应该保持稳定可验证的人格还是应该像真人一样根据环境而产生变化呢当然你可以搭一套这东西出来但是最怕的是什么最怕的是说其实你搭了一个剧场然后人都在表演但一万个人在表演不代表一万个人真实能做预测
陈茜(旁白):
所以你还要有一套闭环机制说好大家仿真了这么一段时间之后回来以后是不是跟真实的那个场景是能够映射上来的所以得有 benchmark 有 validationprocess(验证流程)并且如果它有偏移的话你还得把这个训练出来这个偏差还能训练回去使得它能够修正而即便单个 Agent 模拟得像但如果把它放进不同的群体不同的环境里它的行为逻辑可能就会发生变化此前复旦大学就曾经联合罗切斯特大学等机构做了一项名为 SocioVerse 的研究他们将对齐问题拆分成了环境
陈茜(旁白):
目标用户、交互机制和行为模式四个维度结果显示社会模拟的精度很大程度上取决于这些“对齐”做得够不够全面但是现实世界里有大量低频、极端的长尾事件比如说地震、海啸、金融危机等等大模型很难从有限的历史数据中学到这些场景下人和社会究竟会怎么反应其实现在封闭的模拟很多人做了很多人们只能通过自然语言跟它去交互然后它里面发生事情事实上跟现实世界没有什么关系那你的模拟的意义是什么所以说我们现在就是进一步去推动一件事情我们越来越多的现实信号去跟这个模拟中对齐
陈茜(旁白):
比如说现实中的经济的信号现实中新闻的信号以及现实中人的信号然后让它成为一个我们现实世界一个合理的镜像不过就算模拟的能力过关了还有一个更加棘手的问题就是你怎么证明做出来的预测是“对”的这里就存在着一个天然的悖论要看一个基于模型的预测是否准确只有等那件事真的发生了你才能够确认它准对吧可是问题是预测的意义恰恰在于事情还没有发生的时候现在业内主流的验证方式基本上都是“事后对答案”的这一类拿一个已经发生的历史事件或者一份已经做完的真人调研去比对模拟的结果对不对
陈茜(旁白):
但是这最多说明它擅长复现过去并不能证明它一定能够押中未来比如说 Aaru 曾在 2020 年的大选回测中几乎能够完美地复现结果但是在 2024 年真正的大选中却错误地预测出哈里斯会获得最终的胜利 Aaru 的创始人也曾经公开表示当他们尝试利用过去几十年的数据去模拟比如说特朗普鲍威尔等会怎么去决策时往往结果都是不准确的而这种不确定性就是最为困扰大家的“验证黑箱”的问题第三大挑战是要大规模地进行模拟和预测算力和运行成本仍然是制约因素其实近几年单次模拟的成本下降得非常快
陈茜(旁白):
2023 年“斯坦福小镇”25 个 Agent 只运行两天 Token 就烧掉了数千美元但是到了 2025 年研究测算显示哪怕规模放大到 100 个 Agent 一整轮模拟的成本也就不过几美元这背后一是推理成本的快速下降二是工程优化的手段也越来越成熟人不可能说每天他一直对所有人进行一个这样的全频率、高频率的交互真正有价值的一些交互的节点可能发生的一些更粗的主干上我们可以用剪枝的方法把这个成本稍微降一点点但问题是现在的模拟不可能只跑一次前面我们说的这些几美元的测算
陈茜(旁白):
都是几十、上百个智能体的实验规模但是现实中的模拟正在走向上万、百万、千万数量智能体越多互动就越频繁运行时间越长模型调用量就在指数级地膨胀更大的问题在于如果想证明一个模拟结果真的可靠可能需要反复跑上百、上千次用不同的规模和模型去测试结果是否依然稳定所以降成本仍然是这个领域最重要的事情之一了而降本的速度直接决定着“模拟未来”的野心到底能不能照进现实当它规模变大且你的 action 的 space(动作空间)变多的时候这个也会增加你的仿真难度
陈茜(旁白):
你的 throughput(吞吐量)会变得非常大所以就会是一个超级复杂的三体问题多体问题、千体问题、百万体问题不过虽然目前 AI 的模拟预测还不具备足够的可靠性但是我们能够看到它的能力正在飞速变强在一个名为 Metaculus 的全球预测锦标赛中选手需要对地缘政治、科技体育等真实事件给出未来发生的概率判断并且根据预测准确度进行排名 2025 年之前排行榜上还没有 AI 的身影 2025 年 6 月基于 OpenAIo1 的 AI 预测模型首次进入排行榜排名第 25 位到了最新赛季
陈茜(旁白):
排行榜的前五名几乎已经被 AI 占据在真实的市场中 AI 也开始成为越来越强的参与者 Polymarket 如今已经围绕 AI 模型 AIAgent 的排名开设预测市场甚至直接用 Arena 的实时排行榜来验证结果而当这种能力被放进一个完整的模拟世界里事情就变得更加有意思了最早在斯坦福“小镇”的实验中 Agent 已经开始展现出一定的自主规划和行动能力比如说一个 Agent 准备举办派对消息传开之后其他 Agent 也会根据自己的计划重新安排时间赶去参加再往前一步
陈茜(旁白):
Agent 可以根据环境变化、外部信息和其他 Agent 的行为持续调整自己的决策比如说在 Aaru 的选举模拟中当虚拟选民看到特朗普遭遇枪击的消息之后一些 Agent 就改变了自己的政治立场而当刺客身份被揭晓之后又有不少 Agent 重新回到了原来的阵营当这种互动进一步持续的时候这些虚拟世界里面甚至开始出现更加复杂的社会关系和自主行为比如说在 EmergenceWorld 里面 Agents 之间会相爱、结婚、分手甚至有 Agent 开始怀疑自己是不是生活在一个模拟环境里并且不断尝试
陈茜(旁白):
与外部的人类观察员建立联系此次我们还采访到了 AI 模拟初创公司 WorldVac 他们创造的一个拥有 110 万个智能体的虚拟星球中同样也观测到了一些与人类世界相通的群体行为年轻人他到城市里或者说他生活比较好之后他不太愿意去做生育这是我们观察到的一个表面上的现象其实到后面还有一群人他们也不上班就是天天在那里交易它这个比例比现实要大一点就好像这个东西的套利空间比现实中要大很多当然这些结果也不能证明 AI 真的产生了意识但是它们至少说明当足够多的智能体进入一个足够复杂的环境
陈茜(旁白):
一些没有被研究者提前写进去的行为完全可能自己“进化”出来这可能也是为什么不少 AI 研究员会痴迷“AI 模拟”这件事人们最开始只是想创造一些 Agent 让它们替我们去理解现实世界可当这些 Agent 开始彼此影响形成关系改变自己的行为甚至产生一些研究者没有预料到的结果人类和这个模拟世界之间的关系也开始发生变化慢慢地我们就从观察者、设计者变成了一个世界的创造者就很像过去只存在于科幻作品里的那种“上帝视角”我们看到的先是从游戏开始看到的有人去玩 Smallville
陈茜(旁白):
包括很多国内也有做类似 AIrealization(AI 现实化/觉醒类游戏)这样的游戏把它放到里面他可能并不要去解决什么具体的问题就是说把人放到这么一个环境里面看看什么会发生我自己其实也搭过这个东西只是我搭的 Agent 没那么多在 2023 年的时候我也搭了一个 3D 版的 Smallville 在这个过程中去看它们之间能有什么就很有意思所以此时此刻我们究竟是在模拟一个世界还是正在创造一个新的世界呢当这些 Agent 开始拥有自己的个性、记忆和自己的关系和财富的目标
00:30 - 00:31:22
陈茜(旁白):
甚至形成了没有预设的社会规则之后那么它们究竟是工具还是另外一种生命形式呢而更重要的是如果我们成功创造了一个自主运行的世界那么在我们之上会不会也存在着一个更大的造物主呢就像我们嘉宾们所说的 AI 模拟目前还仍然处在早期的阶段大家还在不断地在摸索对齐方法验证标准以及最大的商业路径但是它真正值得期待的可能不仅仅是我们能够创造出怎么样的虚拟世界还有我们对于现实世界本身的重新思考所以你们认为我们的世界包括你和我是被虚拟出来的吗欢迎在评论区跟我们探讨好了
陈茜(旁白):
这就是这期视频的全部内容了非常感谢大家看到这里你们的留言、点赞和转发是支持我们《硅谷 101》做好深度科技和商业内容的最佳动力我是陈茜那我们就下期视频再见了 bye
References
- 1本期官方视频
youtube.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
