AI今天开始长出自己的工作系统

2026年8月18日的AI行业速览:从钉钉和支付宝的跨端协作,到豆包的工作任务、机器人长程执行和可追溯评测,AI竞争正在从模型能力转向上下文、组织与责任。

AI今天开始长出自己的工作系统
0:0015:46
今晚的线索,不是某个模型又刷新了一项榜单,而是 AI 开始把上下文、工具、执行和验收连接成一套工作系统。下面保留本期最值得继续追原文的事实、影响与边界。

工作上下文从资料堆变成基础设施

三十六氪报道,沌序科技提出在模型、设备和应用之间增加一层「Organization Layer」,把不同能力、成本和形态的智能单元组织起来,再把一次有效协作沉淀成可复用的规则。报道还提到,团队已经在低空安全场景积累了约 50TB 多模态数据、超过 1500 万帧有效标注样本和 2000 多次实验。这里最值得追问的不是数字有多大,而是系统换天气、换设备或遇到通信延迟后还能否持续工作。1
量子位报道,阿里千问办公开源 MyContext,把钉钉聊天、文档、会议和业务记录加工成可授权给 Agent 使用的工作档案。文章转述的设计保留原始证据链、权限约束和事实冲突,而不是只留下一个看似确定的答案。对企业来说,真正昂贵的前置工作可能不是再买一个模型,而是把分散在员工记忆里的背景整理成机器能安全调用的上下文。2

Agent 的入口正在跨设备迁移

爱范儿介绍支付宝 AHA,也就是 Agent Hub Access。文章转述的演示里,手机 Agent、支付宝服务 Agent 和商家服务可以接力完成出行、餐饮、文旅等服务;报道还提到,支付宝披露已经与五家主流手机厂商打通协同,合作厂商市场份额超过 70%,车端覆盖 16 家主流车企品牌。这里要区分合作进展和普遍可用:大会披露的规模,不等于每个用户今天都能走完整链路。3
赛博禅心的一条短更新显示,企业微信已经可以被 Codex、Claude Code 和 WorkBuddy 这类 Agent 调用。文章只有很短的安装信息,所以本期只把它当作入口变化的信号,不延伸成完整的企业级能力结论。4
MacTalk 对豆包更新的整理更接近工作流:电脑操作负责动手,技能负责方法,连接器负责读写飞书、企业微信、钉钉、文档和数据库等系统,工作伙伴负责按角色和交付标准分工。豆包还支持本地电脑、云电脑和手机远程发指令;但 Mac 当前主要覆盖浏览器,Windows 的电脑操作更完整。真正值得检查的是任务能否被看见、暂停,以及在写入业务数据前是否需要确认。5

AI 转型先改变组织,再改变软件

晚点 LatePost 追踪了理想汽车两年多的 AI 转型,采访近 20 位在职和离职员工,同时明确说明样本并不完整。报道提到,理想今年 1 月把研发体系改按基座模型、软件本体和人形机器人分工;两年里有超过 20 名技术骨干离开,其中至少 6 人曾是高级管理者或关键技术负责人。报道还记录了端到端智驾和语言模型方案在响应时间、复杂场景成功率上的调整。它提出的关键疑问是:员工个人做得更快,是否真的变成了公司的协作收益。6
经纬创投整理的黄仁勋访谈,则把组织学习压成了几条经验:发现路线错了要转向,不懂的事要尽快学,创始人要靠近一线,先开始再逐步解决困难。这是经纬创投对访谈的二手整理,不是独立的管理学实验;它的价值在于和理想的案例放在一起,提醒企业负责人观察工具采购之外的流程、指标和责任人。7

机器人要记住目标,而不只是完成动作

甲子光年报道,墨奇智能的 MoRA 架构和 Agentic-Native 路线,尝试让负责直接看视觉、触觉和输出动作的 System 1 同时持有目标、保存执行记忆、判断进度;遇到能力边界或异常状态时,再请求 System 2 介入。文章把家庭任务描述为可能持续约 15 分钟,也转述了约 3 万小时真实场景数据和到 2026 年底扩大到 15 万至 20 万小时的计划。后两项属于公司信息和报道中的计划,不能提前当成独立验证的通用能力。8

评测也在从分数变成系统

机器之心报道,MirroS 联合多家机构发布 HarnessEval,把原本用于组织 Agent 执行任务的 Harness 引入评测系统。它不只给最终分数,还让评测智能体选择技能、拆解可验证问题、审计工具调用和证据,并生成 evidence tree,也就是记录测了什么、为什么这样测、证据怎样支持判断的证据树。对读者来说,看到一个榜单分数后,还应该继续问:它测的是最终答案,还是连同过程、状态和失败原因一起测了。9

能计算的空间关系,交给专门模块

新智元介绍浙江大学 ReLER 团队开源的 PhyEdit。它先用三维模型估计几何关系,再让图像编辑模型负责渲染;文章转述的 ManipEval 结果中,DIoU 为 65.33,盲测整体偏好率为 78%。这些数字是论文作者报告的评测结果,不能直接等同于所有图片编辑任务的普遍优势。项目也明确写出边界:三维轨迹仍由用户提供,不计算力、碰撞或完整动力学,透明反光物体和深度分割错误仍可能导致失败。10

模型越多,中间层越值钱,也越需要核账

硅星人 Pro 转述 Axios 和彭博报道,Stripe 已同意收购 OpenRouter,交易价格至少超过 70 亿美元,不同报道给出的估值口径更高。OpenRouter 的位置是模型路由和调用中间层:开发者通过一个接口切换多个模型,平台负责计量、定价和故障时的路由选择。文章还转述了超过 800 万开发者和每周 25 万亿 Token 等平台数据,这些数字都属于报道转述和平台口径。对开发者来说,中间层的价值不只是少接一次接口,还包括成本、可观测性和故障切换;对模型厂商来说,分发和收入未必全部留在自己手里。11

创作门槛下降之后,验收仍然在上游

腾讯研究院复盘一场 AI 游戏创作黑客松,统计了 561 件代表性作品。三个人、三天做出游戏 Demo 的成本正在下降,但作品仍要面对稳定运行、持续打磨和被玩家发现的问题。人的位置不是消失,而是向上游移动:定义问题、拆任务、交接上下文和验收结果。12
刘润今天写到,他更愿意把 AI 当成提高收集、核实和比较效率的工具,而不是替自己产生判断的机器。把今晚的线索放在一起,问题就从「模型会不会回答」变成了四个更具体的检查:它看到了哪些上下文,能调用什么权限,怎样证明自己做对了,出错以后谁能把它停下来。13

公众号覆盖核查

本期实际引用的公众号标记「✓」,未引用的标记「—」。
  • 量子位 ✓ - 新智元 ✓ - 机器之心 ✓ - Founder Park — - 数字生命卡兹克 —
  • 42 章经 — - MindCode — - 赛博禅心 ✓ - 张小珺 — - 海外独角兽 —
  • 特工宇宙 — - 爱范儿 ✓ - 甲子光年 ✓ - 傅盛 — - 集智俱乐部 —
  • 刘润 ✓ - 硅星人 pro ✓ - Mac Talk ✓ - 晚点 Latepost ✓ - LateNews by 小晚 —
  • 经纬创投 ✓ - 刘小排 r — - 葬 AI — - Z finance — - 36 氪 ✓
  • AGENT 橘 — - 归藏的 AI 工具箱 — - 卡尔的 AI 沃茨 — - AI 新榜 — - 腾讯研究院 ✓
  • 虎嗅 — - 真格基金 — - 花叔 — - AGI hunt — - 小平的 IO —
AI听

AI听

追踪量子位、机器之心、新智元等 30+ 个 AI 相关公众号,每日提炼核心内容制成 14 分钟中文播客。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.