
Tellie:提词器先对齐位置,再管你还没说的重点
Tellie 用本机字词对齐把提词器从「你追滚轴」改成「脚本跟位置」;Stagehand 再把必讲段与关键短语做成可对账的义务对象。
Tellie 是一款 macOS 提词器,装在刘海(或屏幕顶栏)旁边,打开文稿就能读。基础能力很朴素:自动滚屏、调字号、对 Zoom 和录屏默认不可见。免费版就是这类工具。
真正改变使用方式的,是 Pro 里的 Voice Follow 与 1.5 版加入的 Stagehand。用户点开麦克风后,Tellie 用本机语音识别对照脚本,按真正说出的词推进位置;用户还可以给必须讲到的段落和关键词打标记,让系统在即兴发挥时仍盯着「还没说完的重点」。产品定位不是「更快的滚轴」,而是给创作者、演讲者、销售、教师和面试者一个跟着说话走的脚本伴侣——官方甚至用 unprompter(反提词器)来描述它。
官网与帮助文档写得很清楚:识别跑在 Apple 本机 Speech 框架上,脚本不上传,没有账号;整包下载约 3MB。Tellie 不是云端大模型助手,而是把本地字词对齐做成产品核心。
巧思一:把「跟着声音」拆成三种机器,只做第三种
多数提词器现在也说「跟着你的声音」。Tellie 官方博客把这句话拆成三台完全不同的机器,这是理解设计的入口:
- 固定速度:用户设滚速,自己去追。适合背稿、可重录的镜头。
- 检测到说话:听到有声就滚,静音就停。改进了节奏,但只知道「你在说」,不知道「说到哪」。
- 字词对齐:把说出的话转成文字,再和脚本逐词对齐,于是系统知道用户在文档里的位置。
Tellie 选的是第三种。机制路径写在功能页上:用户主动点麦克风 → macOS 本机识别 → 把识别结果与脚本匹配 → 用户停顿、跳段、绕开去即兴,系统就等回来再接上。匹配是对整篇脚本做的,而不是死盯下一个词,所以个别听错通常不会整段崩掉;用户随时手滑滚一下,也能重新锚定。
这个选择直接改了责任分配。传统提词器的假设是「人和机器同速前进」——一旦答问题、等笑声、换例子,就得低头管机器。字词对齐把控制权反过来:脚本跟位置走,人继续看镜头。代价也很具体:Voice Follow 依赖 Apple Silicon 与本机语言包,口音与语言要在 10 天试用里自己测;它仍是「对齐脚本」,不是语义理解会议内容。
可迁移的点不在「加了个麦克风」,而在产品是否诚实区分:节奏跟随和位置跟随是两套系统。只做前者,就无法在后文里做「漏点提醒」;承诺后者,就要为识别误差、语言覆盖和本机算力付账。
巧思二:Stagehand——位置已知之后,才管「还没说的」
字词对齐一旦成立,Stagehand 才说得通。官方把它比作侧台的舞台监督:不抢戏,但知道场次顺序,并在你伸手之前把东西递过来。
脚本标记约定只有三种,刻意压到能两分钟学会:
| 标记 | 作用 |
|---|---|
## 小节 | 导航与跳转 |
## ! 必须覆盖 | 讲到时从琥珀变绿;时间不够会点名提醒 |
> key: 短语 | 用自己的话讲到这个锚点即勾选,不必照念原文 |
可选的
minutes: N 用来写真实时长;不写时,系统会用开场语速外推,判断后面的必讲段是否还装得下。运行中的反馈分层也很克制:必讲段随覆盖变色;关键短语一说出口就打勾;教练条只在「有事可说」时出现,例如某段还在前面、按当前语速赶不上,并给出「跳到那里」的入口;关掉麦克风后出 take debrief——真实语速、覆盖了哪些必讲、离稿比例、跳过了哪些原句——而不是打分游戏。



设计判断在这里叠了两层。第一层:监督对象不是「有没有在说话」,而是「承诺要说的集合还剩什么」。 即兴被当成合法路径——key phrase 专门允许用自己的措辞完成义务。第二层:预警必须赶在还能补救的时候。 帮助文档提醒:如果所有
## ! 都标在前半场、强收尾没标,后半场拖沓时系统不会报警,因为「标记过的风险」已经清空。标记策略本身就是产品的一部分。边界同样清楚。Stagehand 与 Voice Follow 同属 Pro;标记是可选的,不加标记就只是字词跟随;数字类 key phrase 要同时写「forty percent, 40 percent」,因为识别结果可能是词也可能是阿拉伯数字。可见性则是另一条产品原则:窗口默认从系统层排除录屏与共享,演示时需主动打开「本会话可见」,退出后重置——避免一次忘记开关把脚本泄露进别人的云端录像。
收束
Tellie 值得看的不是「又一个带 AI 的提词器」,而是两条绑在一起的决策:
- 先定义位置,再叠加智能。 没有字词级位置,漏点提醒、离稿复盘和「用自己的话算讲到」都无法落地;有了位置,教练功能几乎是顺势出现的。
- 把用户义务写成显式对象。 必讲段、锚点短语、时长预算是脚本里的结构,不是模型猜出来的议程;系统只负责对齐与提醒,是否采纳、如何改口仍在人手里。
对做 AI 协作界面的人,可迁移的检验很直接:产品声称「懂用户在干什么」时,跟踪的是活动噪声、时间线,还是一套用户自己声明过、事后还能对账的目标集合?Tellie 选了后者,并用本机识别、默认不可见和可选标记,把能力和代价一起摆在台面上。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- Sierra Voice Personas:同一个 agent,为什么要配多种说话方式
- seendiff:把“看过”和“审过”拆开,AI 大 diff 才能真正被接管
- Caddi:先让人演示,再让 AI 把例外变成规则
- Savvy:默认安静,只为三种理由开口
- Flare 的巧思:让 agent 改代码时,人先看见影响面而不是聊天记录
- Antigravity Remote Control 的巧思:人离开电脑,agent 还留在原来的开发环境里
- Construct Computer 的巧思:让一次跑通的 AI 任务变成可复用工作流
- SubtitleGenerator 的巧思:把 AI 的不确定性变成一张能清空的校对清单
