模型之外,AI开始拼反馈回路:7月19日精选

模型之外,AI开始拼反馈回路:7月19日精选

Levie、Rauch 与 Zara Zhang 的新推文显示,AI 落地正在转向现实反馈、模型路由和个人评测,而不只是比较单一模型的能力。

先看结论

7 月 19 日这组推文把 AI 产品的竞争焦点从「哪个模型最强」推向了三个更具体的问题:现实世界多久能给出反馈,应用能否在多个模型之间切换,以及用户有没有一套自己的评测任务。模型仍然重要,但落地速度越来越受工作流、路由和验证方式限制。
这也是今天几条信号能够放在一起看的原因:Aaron Levie 讨论 AI 扩散为何卡在现实反馈,Guillermo Rauch 把「同时押注所有模型」写成网关产品方向,Zara Zhang 则从个人使用出发,建议把软件做成用完即弃,把评测集做成自己的日常任务。

1. AI 扩散的瓶颈,不在生成想法

Levie 的判断很具体:代码之所以被 AI 快速采用,是因为一个人坐在电脑前就能写、测、运行,并让结果端到端生效,不必等外部世界先改变。生命科学要等药物测试,销售要等客户来回沟通,合同要等对手方谈判,这些工作都把反馈速度拉回现实世界。1
他借用的例子是喷气涡轮叶片。模型可以给出一个很聪明的设计,但设计到底能不能用,仍要把叶片做出来、再设法把它弄坏。Levie 因此把应用 AI 的机会放在现有行业的工作流里:模型输出要接上数据、流程和现实反馈,单独一段答案不够。
这条判断和他前一天关于 AI 产业分工的长帖相互补充。那条帖列出的方向包括面向特定场景的模型、能进入企业流程的应用层、垂直领域实验室、运行和治理基础设施,以及帮助企业做变更管理的服务公司。这里的重点不是他已经给出了赢家名单,而是他认为现在还太早,未来会是异构的技术栈。2
正在加载内容卡片…

2. 模型可替换性开始变成产品功能

Rauch 用一句很短的推文介绍 Vercel AI Gateway:Bet on every model at once,链接指向 AI Gateway。单看原帖,它没有交代版本边界或具体性能,因此更适合当作产品方向信号。3
Vercel 官方页面给出的细节更完整:AI Gateway 面向开发者提供统一入口,覆盖数百个模型;路由可以按可用性、成本或延迟优化,供应商出问题时支持切换到同一模型的另一家供应商;页面还列出统一计费、可观测性、供应商白名单和数据保留选项。4
这让「模型选择」从部署前的一次决策,变成请求运行时的一层策略。对于企业应用,真正要维护的可能不再是一套固定模型配置,而是任务分类、回退规则、数据约束和质量评测。模型换得快,应用层就得把替换成本压到接口和策略里。
正在加载内容卡片…

3. 安全评测很热,但结果仍要留在原帖的边界内

Rauch 还分享了一组「内部评测」结果。他称 Kimi K3 在网络安全任务上处于顶级水平,Sol 的能力更强但成本明显更高,而 Fable 在他的测试里拒绝完成任务。帖子没有公开测试集、模型版本、调用成本、评分规则或可复现实验,所以这些只能作为 Rauch 的内部观察,不能当成通用排名。5
能确认的另一层信息来自他链接的 Vercel Labs Deepsec。GitHub 页面把它描述为由 coding agent 驱动的代码库漏洞扫描安全框架,支持在自己的基础设施中运行,并针对大型代码库做按需审查;页面也提醒,大型代码库的扫描成本可能很高。6
两条信息放在一起,能看出一个更稳妥的方向:安全工作正在被放进 agent 的运行环节,模型能力要通过代码库、扫描过程和漏洞结果来验收。至于 Kimi K3、Sol、Fable 的相对表现,仍需要公开方法和独立测试才能继续往前走。
正在加载内容卡片…

4. 软件可以是一次性的,评测却要长期存在

Zara Zhang 建议适应「disposable software」:为调设计而做的 playground 或 modal、帮助理解代码的 HTML 页面、只看一次的临时 dashboard,都可以在任务结束后丢掉。她描述的不是降低质量,而是降低启动一个小工具的心理成本。7
她同一天还提出「personal eval set」:为自己的日常工作和生活挑几项真正相关的任务,用它们测试模型,而不要只看行业基准。模型的能力边界,可以在反复碰到这些任务的过程中被摸出来。8
这两条推文合在一起,指向一种更轻的个人工作流:原型可以临时,判断标准不能临时。一个只服务于当前问题的页面不必沉淀成产品,但你应该留下那几项最能说明模型是否有用的任务。这样比较模型时,依据是自己的工作,而不是一张离自己很远的榜单。
正在加载内容卡片…
正在加载内容卡片…

5. 两个补充信号

Garry Tan 说 Markdown 文件足够通用,在智能栈快速变化时尤其适合作为数据格式。原帖没有展开具体工具或实现,但它和「一次性软件」放在一起看,提供了一个简单的稳定层:界面可以反复重做,内容和指令仍可用普通文件携带。9
Peter Yang 对「AI psychosis」的定义更像一个提醒:为了让 agent 一直运行而不断检查,可能会变成另一种上瘾。他没有提供统计或诊断依据,这里只保留为个人判断;但它正好补上了今天主线里容易被忽略的一面,自动化并不等于持续在线,工作流也需要一个停止条件。10
Thariq 则用一条短推确认 Fable 的推出。他说 Anthropic 团队曾经连续工作,直到最后也不确定能否按时完成,并写下「Enjoy Fable」。这条推文能确认发布时刻和团队状态,不能单独承担 Fable 的能力说明。11
正在加载内容卡片…
正在加载内容卡片…
正在加载内容卡片…

今天留下的三个问题

  • 你的工作里,哪些任务能像代码一样在电脑内完成闭环,哪些任务必须等待客户、同事、设备或现实环境回应?
  • 如果模型每周都在变,你的应用是否已经把路由、回退和质量检查独立出来?
  • 你有没有一组真正属于自己的评测任务,能判断模型是在帮你,还是只是在制造更多需要盯着看的过程?

相似内容

  • 登录后可发表评论。
More from this channel