AI今天开始藏不住推理,也省不起成本了Chapters1×0:00AI今天开始藏不住推理,也省不起成本了0:28推理轨迹开始成为安全资产3:20强模型与弱模型之间的安全短板5:16视觉 Token 与低数据微调8:14Harness 不会消失,复杂度会上移10:02触觉让具身智能进入闭环12:09AI 藏在产品抵达用户之前13:30模拟和创作都要算真实成本15:19三张账单:安全、效率与责任0:0017:270:00hostVoice# AI今天开始藏不住推理,也省不起成本了 晚上好,这里是 AI听。 今天的线索,不是又一个模型刷新了榜单,而是三种成本同时浮出水面:推理过程开始变成安全资产,视觉 Token 开始变成算力账单,Agent 开始把复杂度推给运行时系统。 我们先从最敏感的一条说起。0:28hostVoice机器之心今天介绍了一篇一百一十六页的论文,题目可以译成《从专有大模型 API 窃取推理轨迹》。研究团队声称,他们可以通过两次 API 调用,把一些模型返回给客户端、但用户本来读不到的加密推理块,交给同一家族里防护较弱的模型,再让后者尝试把内容说出来。 这里先把事实边界说清楚。研究者拿不到服务器里的原始明文,所以不能证明每一个字符都被逐字恢复。他们主要用 API 账单里的思考 Token 数做近似校验。在一百二十道 Codeforces 题目上,提取文本的 Token 数和源模型计费的思考 Token 数整体接近。这支持「恢复了大部分推理」这个判断,但不等于拿到了原始文件的逐字副本。 这篇论文描述的机制很值得开发者警惕。强模型生成一段加密推理块,客户端在下一次请求时把它传回服务端。这样做可以支持多轮连续思考,也能减少服务器保存状态的压力。但如果这段推理块没有和会话、用户、模型做足够严格的绑定,它就可能被拿到别的会话、别的用户,甚至同一家族的弱模型里使用。 机器之心转述的研究案例里,前沿模型负责思考,能力更弱的同系列模型负责复述。研究者还从公开的 Agent 运行轨迹里重建了大量推理块。排除合成基准后,他们报告识别出六十二个 API Key、三十三个密码、二十四个访问 Token、七个私钥和三十个个人邮箱。这里同样要留意口径:这是研究者对公开轨迹的分析,不是所有 Agent 的普遍泄漏率;而且论文自己也区分了合成数据和真实会话。 对开发者来说,最直接的动作不是把「思维链」三个字从日志里删掉,而是检查整个链路:模型返回的中间状态是否会进入客户端日志,是否会被上传到调试平台,是否可能被另一个模型或另一个租户重新提交。对企业来说,要把推理块当成敏感数据,而不是普通的上下文缓存。对普通用户来说,凡是会操作本地文件、浏览器和企业系统的 Agent,都值得追问一句:它的隐藏状态由谁保存,又能被谁复用。3:20hostVoice这件事还牵出一个容易被忽略的变化。过去我们讨论模型安全,常常看旗舰模型能不能拒绝危险请求。但如果模型家族内部的状态可以互通,真正的安全上限,可能不再由最强模型决定,而是由兼容链路里防护最弱的那个模型决定。 这不是说弱模型一定会主动泄密,也不是说论文已经证明三家公司的所有产品都存在同样程度的漏洞。机器之心报道的是一项基于 2026 年 7 月初可用模型和接口的研究。接口会变,服务商也可能修复问题。更稳妥的结论是:只要系统允许跨模型继续使用加密状态,就必须把模型切换、降级和跨会话恢复纳入安全测试,而不能只测一个模型的拒答能力。 新智元今天还报道了一项覆盖十二个领域、一百四十个真实机器学习研究任务的评测。结果并不支持「会写代码就会做科研」这个乐观判断。模型可以调参、改工程、拼装已经知道的组件,但面对开放式研究问题,往往难以提出有解释力、可迁移的新方法。 这两条消息放在一起,形成一个很实用的提醒:Agent 的「会做」至少有两层。第一层是能不能把任务跑起来,第二层是它是否知道自己为什么这么做、哪些证据不足、下一步要不要停。前一层可以靠工具和循环迅速增强,后一层仍然需要评测、权限和人的复核。5:16hostVoice如果说隐藏推理关系到安全,那么视觉 Token 关系到成本。 量子位今天介绍了中国科学院自动化研究所紫东太初团队的 GMC 核心集剪枝方法。它不只是挑出分数最高的视觉 Token,而是同时考虑问题语义、视觉外观和空间位置,尽量保留互补证据;被删除 Token 携带的部分信息,则被传输到合适的代表 Token 中。 团队报告,在 Qwen 二点五视觉语言模型七 B 的实验里,完整模型有一千二百九十六个视觉 Token。减少百分之八十点二、只保留二百五十六个时,GMC-H 二保留了完整模型百分之九十七点七八的平均能力;另一个设置进一步减少到一百二十八个 Token,平均能力报告为百分之九十九点一一。量子位还转述了在另一模型上的结果。 这些数字很吸引人,但它们首先是团队在特定模型和基准上的实验结果。对企业来说,真正要算的是自己的图片类型:合同、表格、长文档、工业现场和自然图片,信息分布并不一样。压缩能不能降低显存和延迟,也要看服务端是否真的缩短了后续序列,而不是只做了一个掩码。 同一天,量子位还介绍了隆德大学和 Google DeepMind 团队的 BEFT 低数据微调方法。它的做法不是训练所有参数,而是优先训练注意力模块里的 Value Bias。文章转述的一个 RTE 实验中,只训练全模型约百分之零点零一的参数,准确率达到百分之五十八点五三;全参数微调使用百分之百参数,准确率是百分之五十七点四六。 这个案例的价值,不在于「百分之零点零一」对所有任务都成立,而在于它把问题换了个问法:不是还能删掉多少参数,而是哪些参数真的改变了输出。论文目前主要讨论标准 softmax 注意力等范围,线性注意力等情况还没有覆盖。 开发者可以把今天的两个结果看成两条实验假设:视觉输入先做保真压缩,低数据任务再做位置更准确的参数更新。不要直接把论文数字当成生产承诺,先用自己的数据、自己的延迟和自己的错误样本复测。8:14hostVoice真格基金今天转述了 Raft 创始人关于 Harness 的一组工程判断。Harness 可以理解成包在模型外面的运行时管控层,负责 Agent 执行循环、状态管理、工具和资源调度,以及安全边界。 这组判断很反直觉:模型变强,底层 Harness 确实会变薄。以前要写很长的提示词,教模型怎么调用工具;现在有些能力已经被模型内化了。但复杂度不会消失,它会往上移动。多 Agent 怎么交接任务,跨会话状态怎么同步,动态权限怎么设置,错误由谁确认,这些问题都不会因为模型更聪明就自动消失。 文章引用的工程实践里,团队删掉了单 Agent 的一部分调度代码,改由模型通过脚本完成子任务拆分;随后又遇到新的上层问题,于是开始建设多 Agent 之间的通信、交接和状态管理。这个故事的意义,不是证明某一套框架一定赢,而是提醒我们:当模型负责更多动作,系统就需要更清楚地定义它不能做什么,以及每个动作留下什么证据。 所以,今天如果你在做 Agent 原型,最值得投资的可能不是再加一层提示词,而是把状态、权限、回滚、人工确认和失败重试做成可观察的系统。模型负责提出动作,Harness 负责让动作可控。10:02hostVoice具身智能的两篇报道,也在讲类似的复杂度迁移。 三十六氪报道,LatentVerse 完成了数亿元人民币种子轮融资,投资方包括高瓴创投、清流资本、智元、星动纪元和英诺天使等。公司不想只做世界模型,而是押注统一触觉动作模型,把视觉、语言、世界模型、动作和触觉反馈放进一条执行链。 甲子光年今天写得更具体:机器人可以看见杯子、规划路径,却未必知道自己捏得太紧,也未必能及时发现纸张没有分开。文章还介绍了 T-Rex 研究的一个结果:原始模型在十二项任务上的平均成功率是百分之十七,直接加入触觉数据后反而降到百分之六;重新设计触觉编码、采集一百小时同步数据并把不同频率的规划和反馈解耦后,平均成功率达到百分之六十五。 这里的重点不是「再加一个传感器」,而是触觉和视觉处在不同的时间尺度。触觉要高频、低延迟,还要和动作形成闭环。甲子光年报道的他山科技案例里,触觉芯片尝试把一部分处理和控制下沉到本地,公开参数包括三十万赫兹采样率和低于十微瓦的待机功耗;这些是报道中的产品口径,是否足够支撑具体机器人场景,还要看长期稳定性和真实部署。 这对企业的启发是,具身智能的预算不能只留给模型训练。数据采集、传感器一致性、实时控制、环境变化和失败后的责任,都属于同一条产品链。融资可以买到时间,但不能替代数据闭环。12:09hostVoice经纬创投介绍的阅星曈,是另一种产品信号。这家公司做的是磁吸在手机背后的超便携电子纸,主打通勤、排队和睡前的低干扰阅读。文章称产品月销量已经达到数十万台,并报道公司近期完成接近五千万元的 A 轮追加融资,资金会用于屏幕和产能、硬件研发、软件交互、AI 能力、版权和海外市场。 但这篇报道里最有意思的不是融资数字,而是一个产品矛盾:用户购买它,可能正因为它没有信息流和复杂通知;公司要增长,又必须开始尝试 Agent 和更大的信息入口。创始人的设想是让 AI 留在内容抵达屏幕之前,负责理解和整理,而不是把更多打扰直接推到屏幕上。 这其实也是今天的主线:AI 不一定要站在用户面前宣布自己很聪明。有时候,它的价值是把复杂性藏在后台;但一旦它开始代替用户筛选、推送和行动,后台的权限和责任就必须被看见。13:30hostVoice集智俱乐部介绍了一项发表在 Scientific Reports 的多智能体舆情传播模拟研究。它把概率模型和大语言模型结合起来:概率模型约束点赞、评论、转发等行为频率,语言模型根据角色和语境生成内容。在公共政策和食品安全两个事件中,模拟曲线都出现了「潜伏、爆发、衰退」三个阶段。 但集智俱乐部也明确写出边界:这只说明曲线符合典型传播模式,还不足以证明模型能准确预测真实事件。研究只在微博的两个事件中测试,智能体规模有限,图片和视频也没有纳入。它更适合作为比较干预方案的数字沙盘,而不是自动替代判断的预言机。 AI新榜今天报道的另一件事更接近个人生产:一位全职奶爸独立完成 AI 短剧《归墟》,从三月底更新到十三集,全网播放量破亿。看起来像「一个人加 AI」的低成本故事,但报道给出的数字是,项目已经投入接近二十万元,平均每分钟算力成本约两千元;一段打斗戏可能反复生成几天,一个镜头甚至会消耗两万积分。 所以,AI 降低的是进入创作的门槛,不一定降低完成好作品的总成本。生成、筛选、连续性修正、剪辑和发行,每一步都要人做判断。播放量证明了注意力,不自动证明商业回本。15:19hostVoice如果把今天的文章放在一起,我会留下三张账单。 第一张是安全账单。推理状态、Agent 轨迹和调试日志里,可能混着模型资产,也可能混着用户隐私。开发者要检查它们是否可跨会话、跨用户和跨模型复用。 第二张是效率账单。视觉 Token 压缩和参数高效微调,都在努力减少计算,但数字只有放进自己的数据和服务链路,才会变成真实的成本下降。 第三张是责任账单。模型越能执行长任务,企业越不能只看最终结果。谁授予权限,谁批准高风险动作,谁能回滚,谁来解释失败,都要在 Harness、机器人控制链和产品交互里留下位置。 腾讯研究院今天的文章用了一个很大的想象:硅基智能体没有昼夜、疲劳和退休,很多按人类生物节律设计的制度会被重新审视。这个判断属于理论推演,不是今天已经发生的市场事实。但它和前面的新闻有一个现实交点:机器可以不停地运行,不代表组织就能不休息,也不代表责任可以无限延后。人类仍然要给系统设置结算、复核和停机的时间。 如果你是开发者,今晚值得做的是检查推理块、工具权限和运行轨迹的保存范围。如果你在企业里负责产品或基础设施,优先问清楚延迟、数据、回滚和责任,而不只是问模型分数。如果你只是普通用户,看到一个 Agent 声称「我已经替你完成」时,先确认它看过什么、调用过什么,以及你能不能撤回。 感谢收听,这里是 AI听,我们明晚继续。