ElevenLabs 出海增长复盘:从声音工具到全球语音基础设施Chapters1×2:14先说结论3:23从一个好模型,到一个可被嵌入的入口4:56分发不是投放,而是被别人带进场景6:47从创作者的惊叹,到企业的预算9:22本地化不是翻译页面,而是降低采购摩擦12:00价格、信任和反面指标13:57把这条增长路径拿回自己的产品0:0018:352:14主播今天聊 ElevenLabs。它最值得复盘的地方,不是「语音像不像真人」这一句产品宣传,而是它怎样把一个很容易被替代的模型能力,逐层变成开发者基础设施、创作者工作台,再变成企业可以采购的语音代理平台。 如果把这家公司只看成一个文字转语音工具,会漏掉它真正的增长路径。更准确的说法是:先用极强的音频体验让用户愿意试,再用 API 和 SDK 把体验嵌进别人的产品,最后用代理、治理、监控和本地团队,把一次生成变成持续运行的业务流程。这个路径和纯消费订阅不同,也和一开始就卖大单的企业软件不同。 我会分四段讲。第一段看它怎样找到入口,第二段看分发和产品扩张,第三段看多语言出海到底做了什么,最后把这条路径翻译成创始人可以拿回去用的检查表。先说明边界:融资、收入和客户覆盖里,有一部分来自公司自己的公告或公司接受媒体采访时的口径。我会把它们标出来,不把宣传数字当成审计结果。3:23主播ElevenLabs 成立于二〇二二年,TechCrunch 在二〇二六年一月的报道里写到,公司二〇二三年推出了第一款产品。这个时间点很重要。它没有先做一个完整的内容平台,也没有先建立一套复杂的销售组织,而是先把最容易被用户立刻感知的变量做到了前面:生成的声音足够自然,结果可以直接拿去用。 这类产品的第一道门槛是体验,第二道门槛其实是迁移成本。用户愿意把一段文字放进网页里试听,不代表他愿意把生产流程换掉。ElevenLabs 的做法,是把同一套能力放成两条路:不写代码的人进入网页工作台,开发者通过 API 和 SDK 把语音放进自己的应用。官方文档现在把产品分成 ElevenCreative、ElevenAgents 和 ElevenAPI 三条路径。换句话说,网页体验负责让人试,API 负责让人嵌入,代理平台负责让企业持续使用。 这也是一个比「卖一个模型」更稳的产品结构。模型迭代可以提高质量,但真正形成收入和留存的,是客户在模型外面搭出来的流程。比如音频生成接入内容生产,电话代理接入客服和销售,语音识别接入记录与质检。对创始人来说,这里有一个很实用的判断:如果你的 AI 能力今天停掉,客户损失的是一次生成,还是一条正在运行的业务链路?后者才有机会从工具价格走向基础设施预算。4:56主播ElevenLabs 早期的分发有一个明显特点:它并不只依赖自己的官网获客。TechCrunch 在报道 Reader 全球发布时,列出了几类已经使用 ElevenLabs 的产品,包括 Rabbit、Perplexity,以及音频内容平台 Pocket FM 和 Kuku FM。这里的价值不只是几个合作名单,而是它们把声音能力带进了用户原本就会使用的产品。 二〇二四年六月,Reader 先在美国、英国和加拿大推出;到八月,TechCrunch 报道它已经向全球开放,支持三十二种语言。它让用户把文章、PDF 或电子书转成不同语言和声音来听。Reader 是 ElevenLabs 第一个面向消费者的产品。这个动作可以有两种解读:一方面,它给了公司一个直接接触终端用户的场景;另一方面,它把模型的多语言能力变成了可被普通人理解的产品演示。 但我不认为 Reader 本身就是最核心的增长引擎。它更像一块展示橱窗:你在一个消费场景里感受到「同一份内容可以换一种语言和声音」,再回头理解 API、配音和企业代理的价值。对一家基础设施公司来说,消费产品的任务未必是单独做到最大,而是帮助市场形成需求,降低开发者和企业第一次购买的解释成本。 这和投广告的区别在于,渠道本身带着场景。Perplexity 把语音放进搜索内容,音频平台把脚本变成内容,硬件产品把它变成交互。每一个集成都替 ElevenLabs 说明一次「它能解决什么问题」。如果创始人要复制,不能只问「我们该和谁联名」,而要问「哪个已经拥有用户、内容和使用频率的产品,能把我的能力变成它自己的一个按钮」。6:47主播二〇二四年十一月,ElevenLabs 又往上走了一步。TechCrunch 报道,它开放了让用户构建对话式 AI 代理的能力。更值得注意的是公司给出的产品理由:当时很多客户已经在用 ElevenLabs 做代理,但最难的部分不是再加一个声音,而是接入知识库、处理用户打断,以及把一次对话变成可控的流程。所以公司把原本的语音能力向前后两端延伸,做成一个完整的代理管线。 这是一种很典型的扩张方式:不是因为「代理」是市场热词才加上去,而是因为已有客户在同一条工作流里遇到了下一道墙。产品上,用户可以设定首句、系统提示、语言、模型、温度、声音、延迟、认证条件和会话长度,也可以接入文件、网址或文本作为知识库。开发者还能用 SDK 和 WebSocket API 做更深的定制。这里面有一些技术参数,但增长上的含义更简单:它把一次生成的价值,推进到一次可评估、可接入、可持续运行的业务交互。 二〇二六年二月的 Series D 公告里,ElevenLabs 说,企业客户已经把 ElevenAgents 用在客户支持、对话式商务、公民服务、内部培训和销售线索获取等场景,并列出了 Deutsche Telekom、Square、乌克兰政府和 Revolut。官方还说,ElevenAPI 的客户包括 Meta、Epic Games、Salesforce、MasterClass 和 Harvey,覆盖的产品用户超过十亿。后一个数字属于公司口径,不能当成独立审计,但客户类型的变化本身值得看:从个人创作者到开发者平台,再到大型企业和公共机构,采购理由已经从「声音很酷」转成了「它能不能稳定地接住一段工作」。 收入数据也能说明方向,但需要留一点距离。TechCrunch 在二〇二六年一月引用 CEO 的说法,称公司去年 ARR 超过三点三亿美元,且从一亿美元到两亿美元用了十个月,从两亿美元到三点三亿美元用了五个月。公司四月的官方公告则说,二〇二五年结束时 ARR 是三点五亿美元,二〇二六年前四个月已经超过五亿美元。这里存在口径差异,所以我不会把它们拼成一条精确曲线。可以确认的是,公司的增长叙事已经从单纯语音生成,转向企业部署语音代理和多语言内容生产。9:22主播出海产品最容易犯的一个错误,是把「支持更多语言」当成全部本地化。ElevenLabs 的公开动作至少分成三层。 第一层是模型和内容。Reader 全球发布时从英语市场向三十二种语言扩展;官方文档现在把 Eleven v3 写成支持七十多种语言。第二层是研发和供给。二〇二四年十一月,官方宣布未来五年向波兰 AI 生态投入一千一百万美元,在华沙设立研发中心和欧盟总部,同时扩展印度团队,推进 Indic 语言能力和 Voice Library。第三层是销售和交付。二〇二六年 Series D 公告列出了伦敦、纽约、旧金山、华沙、都柏林、东京、首尔、新加坡、班加罗尔、悉尼、圣保罗、柏林、巴黎和墨西哥城等地点,并明确说要用本地化的 GTM 团队推动 ElevenAgents 和 ElevenCreative 的企业采用。 这三层组合在一起,才接近真正的本地化。模型负责「能不能说」,内容产品负责「用户愿不愿意试」,本地团队负责「企业敢不敢买、出了问题谁来处理」。如果只做第一层,可能得到一张语言支持表,但不一定得到收入。 一个很有意思的外部信号来自 X。二〇二六年七月二十日,日本的 TOKYO MORNING RADIO 发布内容时,把 ElevenLabs 相关的日语入口放进了节目介绍。这不能证明它带来了多少转化,但说明产品已经有机会进入当地媒体和日语内容场景。对出海团队来说,真正值得追踪的不是「我们有没有日本站」,而是「当地用户是否把产品放进了已有的内容和工作流程」。 不过,本地化也会把原来隐藏的问题放大。七月十九日,Reddit 的 ElevenLabs 社区里有用户发帖说,自己在为一位已获授权的声音所有者做专业声音克隆验证时,遇到了随机出现的泰米尔语 CAPTCHA;声音所有者不熟悉泰米尔语,验证因此反复失败,发帖者还抱怨等待支持回复的时间很长。这个帖子不能证明平台的整体支持效率,也不能证明是普遍故障,但它暴露了一个具体的设计问题:当你的安全流程进入新语言市场时,验证机制、客服和申诉通道也必须一起本地化。 对做语音、视觉或支付的团队,这一点都成立。所谓本地化的最后一公里,往往不是首页文案,而是用户第一次失败时,能不能用自己的语言知道为什么失败、下一步怎么办。12:00主播AI 音频产品还有一个很容易被忽略的增长成本:计费是否让人敢于试错。官方文档写得很清楚,credits 是跨产品共享的消耗单位,文字转语音按输入字符计费,credits 按月重置,未使用的部分最多结转两个月。这样的设计有好处,用户可以在 API、创作工具和代理之间调配额度;但它也要求产品把消耗解释得足够明白。 就在七月十六日,Reddit 上有用户发帖询问为什么未使用的 credits 会消失,并说自己几个月没有使用账户,却感觉有数十万 credits 被浪费,累计花了约一百美元。这个帖子的计划类型和具体版本并不清楚,而且当前文档与用户理解之间可能存在时间差,所以不能拿它当成官方计费政策的反证。但它是一个很有价值的信任信号:对按量计费的 AI 产品,用户不只在意单价,也在意「我买到的能力什么时候失效」以及「我能不能预测下一张账单」。 另一类正面信号,来自七月十七日 Reddit 上一个独立创作者的案例。他说自己用 Eleven v3 为一款二〇一三年的 RPG 做了三千九百行、包含一百二十六个角色的配音,过去只有完整配音团队才能做的事情,现在一个 mod 制作者也能完成。评论里有人直接把价值归纳为:独立开发者和 mod 社区有了做完整角色配音的新空间。 这类帖子不是收入数据,样本也不能代表整个用户群。但它说明了一个很强的产品传播机制:当用户展示的是一个别人马上能想象的完整作品,而不是一段模型 demo,社区会替产品完成一次教育。对开发者工具来说,最好的案例往往不是官方写的「支持多少语言」,而是用户展示「我以前做不到什么,现在做到了」。13:57主播最后做一个归纳。ElevenLabs 的案例里,我看到四个可以迁移、但不能照抄的动作。 第一,先找一个能在三十秒内被感知的体验钩子。语音自然、图像可用、代码能跑,这种即时反馈适合冷启动。但钩子必须能通向更深的工作流,否则就只能停在试玩。 第二,把 API 当成分发,而不只是收费接口。好的 API 会让别人的产品替你教育用户,也会让你进入更高频、更难迁移的场景。判断标准不是文档页有多少接口,而是客户能不能把你的能力嵌进自己的产品,并且在你不露出的情况下持续使用。 第三,沿着同一条工作流扩张。ElevenLabs 从生成语音走到代理,不是横向堆功能,而是沿着「生成内容、接入系统、处理互动、评估结果」这条链路向前推进。创始人在做新产品前,可以先画出客户当前流程的下一道墙,确认它是否已经由现有客户反复支付成本。 第四,把本地化预算放在失败路径上。语言覆盖、当地案例和本地销售当然重要,但注册、验证、计费、申诉和客服才决定信任能不能留下来。尤其是涉及声音身份、支付和公共服务的产品,安全流程的语言错误,可能比首页翻译错误更贵。 所以,ElevenLabs 的真正护城河还不能简单下结论。它现在同时面对模型竞争、版权和声音授权、企业交付、成本控制以及信任风险。更准确的复盘是:它已经把模型质量转成了多条可复用的商业入口,但能不能把这些入口收敛成长期平台,取决于每个市场的交付和治理是否跟得上增长速度。 如果你正在做一款出海 AI 产品,下一次做增长规划时,可以问自己三件事:用户第一次惊叹的瞬间是什么?谁能把它带进高频工作流?当用户在新市场第一次失败时,谁能用当地语言把问题解决?这三个问题,比「这个月投多少广告」更接近增长的底层结构。 本期就是这些。你可以在节目正文里看到我用到的官方公告、TechCrunch 报道,以及 Reddit 和 X 上的具体讨论。我们下期再见。