7月18日 AI 创业夜间增量对谈:自进化 Harness 与端边 AgentCapítulos1×0:07新增范围0:38Self-Harness2:54自驱型公司4:57WAIC 新产品7:38Agent 云与 X 新帖9:38本期来源0:0010:090:07host本期只讲上一集发布后新增的内容。X关注源覆盖400个账号,读取6105条推文;7月18日9点到22点窗口里有196条,上一集发布后新增77条,节目纳入4条相关帖子。每个账号本轮最多读取100条。0:24cohost指定公众号里,本轮入选文章来自量子位、36氪和机器之心。Founder Park在上一集发布前已经有一篇新文,海外独角兽没有这个窗口的新文,所以不放进这段增量内容。0:38host先说一个不换模型、只改外层Harness的实验。量子位下午发布文章,标题是「不换模型,效果提升百分之百零四!上海AI Lab让Harness也能自进化了」。文章介绍的Self-Harness,先检查Agent自己的运行轨迹,从失败里找出可复用的弱点,再提出有边界的Harness修改,最后交给回归测试决定是否保留。1:02cohost这里的Harness不是模型本身,而是包在模型外面的运行装置,包括系统提示词、工具使用规则、验证器、运行时控制策略和轻量中间件。它决定Agent什么时候调用工具,什么时候停止,出错后怎么恢复,退出前有没有留下正确产物。1:22host文章把Self-Harness写成三步。第一步是从失败轨迹里挖弱点,比如缺少最终文件、重复执行无效命令、工具报错后不恢复,或者探索很久却没有开始实现。第二步是提出修改,每个修改只能落在预先声明的可编辑范围内,还要写出可能的回归风险。第三步是回归验证。1:44cohost验证规则也写得很具体。候选Harness要在同一套评测协议下重跑,held-in或者held-out至少一个分组要提升,另一个分组不能退化,才会进入下一代。模型不能只凭自己的感觉说改好了。1:57host实验使用Terminal-Bench二点零,固定模型、工具集、任务环境和评测配置,只改Harness。文章给出的结果是,MiniMax M二点五总提升百分之二十八,Qwen三点五三十五B-A三B总提升百分之一百零四,GLM五总提升百分之二十四。2:17cohost不同模型留下的修改也不一样。MiniMax M二点五的问题是找到线索后迟迟不交付,Harness会提醒它先创建必需产物。Qwen三点五三十五B-A三B容易在工具失败后循环,修改加入依赖预检查、失败恢复和相同命令重试约束。GLM五更常卡在Shell状态和从探索切到实现的时机。2:38host这篇文章还写到,Self-Harness论文题为《Self-Harness: Harnesses That Improve Themselves》,论文和项目地址已经公开。研究团队来自上海人工智能实验室,实验范围仍然是Terminal-Bench二点零和固定模型后端。2:54cohost机器之心傍晚整理了Replit CEO Amjad Masad提出的「自驱型公司」。定义很直接,人设定目标、排优先级并承担最终责任,信息收集、任务执行、结果验证和日常协作交给相互协同的AI智能体。3:10hostReplit文章写到,过去六个月里,工程师的代码产出接近原来的三倍,代码审查耗时保持稳定,回滚次数和产品事故没有增加,质量指标有所改善,发布节奏也更快。原文博客发布一天多,浏览量超过一百一十万。3:27cohost从一月初到六月底,Replit提交的代码行数增长到此前的五点八倍。剔除招聘因素,只看固定贡献者,代码产出仍是此前的二点九倍。团队人数翻倍时,人均产出达到原来的三倍。3:42host增加的代码由智能体参与审查。文章写到,人工进行Pull Request审查的时间节省了百分之三十,回滚率和新建事故数量保持平稳,事故调查也有智能体协助定位根因。3:55cohost智能体承担的工作不只写代码。它们调查线上事故、审查代码合并请求、回答问题、分析业务数据、分流支持工单、研究销售客户,还持续改进支撑Replit Agent本身的系统。4:09hostReplit给每位员工提供管理型智能体。管理型智能体可以启动多个智能体,让它们循环完成可验证的任务。文章列举的任务包括CSS系统迁移、产品本地化、维护不稳定测试,以及处理网络问题。4:24cohost这套内部智能体也接入了GitHub、GCP、Azure、Linear、Notion、Slack和Zendesk,配套访问策略、令牌代理、审计日志和Zero Trust网络。支持团队处理最难工单的速度,文章写的是提高百分之六十。4:39hostReplit还写到,他们停用了一个年费达七位数的SaaS方案,改用自己构建的内部应用。另一个告警和事故排查工具,质量相近,但运行成本是内部智能体方案的十倍。原文把这些变化放在「自驱型公司」这个组织描述里。4:57host下午到晚间的WAIC新消息,先从图像模型开始。量子位晚上七点半发布文章,介绍商汤在WAIC发布的日日新SenseNova U一点Pro。文章写到,它原生支持八K输出,能先打草稿、做设计、检查和修正,目标包括信息图、城市规划、影视分镜、学术海报和商业设计。5:20cohost文章给出的模型流程是理解目标、规划任务、组织信息、多模态生成、检查问题、持续调整,最后交付成品。它还写到,模型采用三十二乘三十二的大Patch减少视觉Token,再配合自适应噪声控制、Patch重叠和训练结构调整,处理八K画面里的文字、纹理和结构。5:42host量子位下午还发了一篇「无人机直连卫星传Token」。中国电信人工智能研究院的智传网,把无人机拍到的视频先在端侧编码成Token序列,再通过小型卫星通信设备直接传回后方。文章写的是,国内首次攻克轻小型无人机直连卫星并稳定实时传输高清视频。6:04cohost同一篇文章给出两组传输数据。语音和音乐可以在零点二六六千比特每秒的码率下传输,文章称比传统编解码方案低约五百倍;视频演示一侧用一百千比特每秒,另一侧传统方案用三千六百千比特每秒,重建一千零八十P、每秒三十帧的视频。6:27host智传网还被用于机器人远程操作和水下视频传输。文章写到,基于五G的具身智能遥操作端到端时延可以压缩到二十到五十毫秒;在自然水域,空海跨域潜航器可以把水下画面实时传回。6:42cohost36氪下午的端侧芯片文章,也把焦点放在Agent从云端走向设备。文章引用一家深圳公司的端云混合Agent平台数据,约百分之八十的任务在本地完成,约百分之二十走云端。它还介绍后摩漫界M五十,单芯片一百六十TOPS、功耗约十瓦,可运行三十五B到一百二十B参数模型。7:05host上海证券报下午四点三十四分发布消息,阿里云在WAIC正式发布Agent Native Cloud,并同步推出AgentTeams和Agentic Computer,覆盖基础设施、开发平台和云桌面。7:18cohost量子位傍晚还介绍了梅卡曼德机器人在展台上的「眼脑手」系统。人形机器人完成工件上下料和料筐搬运,机械臂完成亚毫米级线束插接,五角螺母抓取用时不到二点四秒;文章写到,这套产品已经累计部署两万七千多台,服务一百多家《财富》世界五百强客户。7:38host36氪晚上九点半发布PPIO的文章,PPIO在WAIC同期发布Agentic Cloud定位和智能模型网关。文章把产品分成两层,模型网关负责混合模型和任务路由,Agent Harness层负责沙箱、任务编排、Tool Use和记忆管理。7:57cohostPPIO文章写到,截至二零二六年六月,日均Token调用量超过一点二万亿,比二零二五年同期增长超过八倍。PPClaw和PPHermes等托管Agent支持七乘二十四小时运行和定时任务,平台提供沙箱、模型API、GPU算力、存储和网络的自然语言调用接口。8:18hostPPIO文章还给出一组网关测试数据。在DRACO深度研究基准中,融合Mimo-V二点五Pro、Kimi-K二点七和GLM五点二,性能接近Claude Fable五,成本写为其七分之一;文章同时写到,综合测算智能水平提升百分之二十,成本降低百分之五十到六十。8:39cohostX上,Context7官方账号的简介是为LLM和AI编程编辑器提供最新文档,由Upstash团队创建。它转发了Context7 On-Prem,内容是把Context7部署在隔离网络里,为Agent提供新鲜文档。8:54hostFenng的X简介只写着「你所看到的都不是真实的」。他发文说,WorkBuddy正式发布独立应用。9:01cohost浙江大学副教授Ningyu Zhang的X简介写着,他研究自然语言处理、大语言模型、知识图谱、Agent和知识编辑。他转发了Long-Horizon Agents综述发布的消息,帖子写的是,智能体自主任务时长正在增长;他还发布了LightMem-Ego。9:19hostLightMem-Ego是一套面向手机和AI眼镜的轻量流式多模态记忆系统,采集第一视角的视觉和音频流,放在同一时间线上,组织成当前、短期和长期记忆。帖子列出的功能包括找物品、回忆对话、生活总结、发现日常规律和可穿戴辅助。9:38cohost本期来源按话题分组。Self-Harness来自量子位文章;自驱型公司来自机器之心文章;WAIC新产品来自量子位、36氪、上海证券报和机器之心文章;Agent云来自36氪和量子位的文章;X新增帖子来自Context7、Fenng和Ningyu Zhang。每条来源都放在节目正文的对应话题下面。