AI 编程与应用日报:Opus 5 进入 Copilot,代理评测开始自己爬坡

AI 编程与应用日报:Opus 5 进入 Copilot,代理评测开始自己爬坡

7 月 24 日的新更新把关注点推向长时程编程模型、企业治理和可验证评测:Claude Opus 5 进入 GitHub Copilot,Cline 展示递归改进评测,Lovable 补齐企业控制,华为云在泰国开放 CodeArts Agent 测试。

先看结论

7 月 24 日的几项更新,关注点从「模型会不会写代码」继续往后移:Claude Opus 5 开始进入 GitHub Copilot 的多个开发入口,Cline 把一次长时程评测交给代理自己改进执行框架,Lovable 把 AI 生成应用的发布、扫描和清理做成企业管理项,华为云则在泰国开放 CodeArts Agent 测试。它们共同指向一个更实际的问题:模型、执行框架和治理控制,谁在决定一次 AI 编程任务能否稳定交付。
更新影响谁当前状态读者下一步
Claude Opus 5 发布需要长时程编程、调试和工具调用的团队Anthropic 称 API、Claude Code 和 Claude 产品已提供,价格为每百万输入 token 5 美元、输出 token 25 美元;榜单和成本数据均为厂商测试口径。1用自己的多文件修改、回归验证和失败恢复任务测试,不要直接把厂商 benchmark 换算成项目成功率。
Opus 5 进入 GitHub Copilot使用 Copilot、Copilot cloud agent 或移动端开发入口的团队面向 Pro+、Max、Business 和 Enterprise,逐步开放;Business 与 Enterprise 需要管理员启用策略,按供应商 API 标价计费。2先核对模型选择器、组织策略和 credits / 用量账单,再在受保护分支跑一组可回滚任务。
Cline 递归改进 Terminal-Bench维护代码代理 harness、评测流水线和模型路由的团队Cline 报告 Kimi K3 在 Terminal-Bench 2.1 上达到 88.8%,确认运行成本 49.8 美元;结果来自厂商自建实验,且经过人工审查。3把限流、循环检测、进程退出等基础设施失败单独计数,避免把 harness 修复误判为模型能力提升。
Lovable 企业功能汇总需要管理 AI 生成应用、外部分享和安全扫描的企业Lovable 称近期能力已上线,包括发布权限、Workspace Insights、Basic / Deep Scan 和废弃应用清理;每项功能的租户开关仍需在实际工作区确认。4先检查「谁能发布」与「谁能访问项目」是否分离,再核对扫描结果、外部分享和无人负责项目。
华为云 CodeArts Agent 在泰国开放测试泰国开发者、企业研发团队和本地云用户华为云新闻稿称 Agentic Infrastructure 已在泰国可用,CodeArts Agent 开放 Beta 测试;仍是反馈阶段,来源未提供独立性能数据。5关注实际申请入口、区域可用性和数据边界,不要把 OBT 当作正式普遍可用。

Claude Opus 5:模型入口开始围绕长任务竞争

Anthropic 在 7 月 24 日发布 Claude Opus 5,称它面向长时程代理、编程和知识工作,API 价格与上一代 Opus 4.8 相同,为每百万输入 token 5 美元、输出 token 25 美元。官方把它设为 Claude Max 的默认模型,并称它在 Frontier-Bench、GDPval-AA 等内部或合作评测中达到新的高位;在 Frontier-Bench v0.1 的一次内部运行里,Opus 5 的表现超过其它模型,并超过 Opus 4.8 一倍以上。1
这里最有用的不是「新 SOTA」四个字,而是成本和任务长度的组合。Anthropic 称,在 CursorBench 3.2 的最高 effort 设置下,Opus 5 与 Fable 5 的峰值分数相差不到 0.5%,但单任务成本约为后者的一半;官方脚注同时说明,Frontier-Bench 结果来自每个任务 5 次尝试,安全分类器拒绝的请求会回退到 Opus 4.8。这些数字属于厂商测试,不能直接替代团队自己的仓库评测。1
开发者可以通过 claude-opus-5 使用 API,Fast mode 的运行速度约为默认速度的 2.5 倍,但价格为基础价格的两倍。发布页还列出两个 beta 更新:对话中途可以改变可用工具而不使 prompt cache 失效,API 可以对被安全分类器拦截的请求启用自动 fallback。对于长任务,这两项变化分别影响工具编排成本和任务不中断能力,但也会让调用链更需要记录实际使用了哪个模型。1
GitHub 同日把 Opus 5 加入 Copilot,覆盖 VS Code、Visual Studio、Copilot CLI、cloud agent、GitHub.com、GitHub Mobile、JetBrains、Xcode 和 Eclipse 等入口。Copilot Pro+、Max、Business 和 Enterprise 用户都在范围内,但 GitHub 明确采用渐进式 rollout;Business 与 Enterprise 管理员还需要在 Copilot 设置中启用策略。GitHub 的早期测试强调了自动改代码、回归验证和多工具协同,但也提醒高风险网络安全请求可能被增强的安全措施拦截。2
对团队来说,接入面扩大并不等于迁移完成。建议先选三类任务:需要跨文件理解的改动、需要运行测试并根据结果返工的任务、容易触发工具调用浪费的长任务。比较时同时记录测试通过率、人工返工、调用次数、总延迟和实际 credits 消耗。Copilot 的模型可用性和计费边界要以组织设置和实际账单为准,不能只看模型选择器是否出现。

Cline:一次长跑把瓶颈推向 harness

Cline 发布的实验把「模型能力」和「代理执行框架」拆开观察。该公司称,使用 Kimi K3 和自有 Cline harness,在 Terminal-Bench 2.1 上先得到 69 / 89、77.5% 的基线成绩,成本为 79 美元;随后由 GPT-5.6-Sol 作为领跑模型,用一个 prompt 连续运行约 17 小时,尝试自己修改 harness 和评测流程,最终确认运行得到 79 / 89、88.8%,成本降到 49.8 美元。总实验消耗约 10 亿 token,其中 4 亿用于 coding agent,6 亿用于重复评测。3
改动内容很工程化:为 429 限流增加指数退避,让循环检测识别「输出在变化的长轮询」,修复一个让进程在模型调用前退出的 liveness 问题,还避免 pkill -f 误杀自己的 harness。Cline 还说,尝试过的无效运行会被排除,最终 PR 由人审查后才合并。换句话说,分数上涨不只是模型更会解题,也来自执行框架少丢任务、少误杀进程、少把正常等待判成死循环。3
这组结果的证据边界要写清楚:它是 Cline 的自测,不是独立复现实验;Cline 还把 88.8% 与 Moonshot 自报的 88.3% 做了对照,双方的 harness、任务运行条件和成本口径并不完全相同。对工程团队更有价值的复用方式,是把限流、工具失败、超时、无效运行和测试失败分别记账,再看模型升级前后哪些失败类型真的减少了。否则很容易把「评测脚本终于不再自我终止」误读成模型本身提升了 11 个百分点。

Lovable:AI 生成应用开始补治理后台

Lovable 的 7 月 24 日企业功能汇总,重点不是新增一个生成按钮,而是管理生成结果如何进入组织。页面列出的能力包括发布权限控制、Workspace Insights、Basic Scan、Deep Scan 和废弃应用清理。Lovable 称,发布应用的访问权可以与底层项目、源代码、聊天记录和工作进度分离;管理员可以限制谁能对外发布,并在 Workspace Insights 中查看外部分享、所有者、成本、生命周期和待处理安全问题。4
扫描功能也被分成两个节奏。Basic Scan 会在每次发布前自动检查项目配置、数据库 schema、行级安全策略和暴露的敏感数据,官方给出的耗时约为 10 到 15 秒;Deep Scan 是一次完整代码审计,官方称单次约需 2 到 4 分钟,可检查访问控制、后端接口鉴权、SQL 注入、XSS、暴露 secrets 和错误日志泄露等问题,Enterprise 工作区还可以预设扫描计划。4
废弃应用清理则针对一个容易被忽视的风险:应用没人访问了,但可能仍然在线并连接着数据。Lovable 称系统会每天检查一段时间没有编辑和访问的项目,管理员可以开启自动清理,所有者会在删除前收到 5 天和 1 天的提醒,删除后先进入可恢复的软删除阶段。这里的数字和功能范围来自厂商产品说明,不能替代企业自己的数据保留、备份和恢复测试。4
部署这类 AI 生成应用时,最先要核对的是权限边界,而不是生成速度。项目访问、发布访问、外部访客、连接器、PII 扫描和所有者字段应当分开审计。Lovable 的文章把多项功能放在同一份汇总里,读者仍应在实际租户中确认版本、套餐和开关状态,尤其不要把「通过扫描」理解成已经完成独立安全审计。

华为云:CodeArts Agent 先以区域 OBT 进入市场

华为云在泰国举办峰会后,通过 PR Newswire 发布新闻稿,宣布 Huawei Cloud Agentic Infrastructure 在泰国可用,并在当地启动 CodeArts Agent Open Beta Testing。新闻稿称,CodeArts Agent 结合 IDE、自治开发能力和编码模型,支持项目级代码生成、补全、研发知识问答和单元测试用例生成,还加入 Specification-Driven Development,让团队从需求阶段开始约束代码交付;Agent Team mode 可以让多个 agent 并行执行任务。5
配套的 Agentic Infrastructure 由厂商描述为面向代理开发和部署的基础设施,包含高效 token 生成、通用计算与 AI 计算统一调度、持续学习和安全运行环境。新闻稿还列出 UnifiedBus-based AI Cluster Service、Agentic Memory Storage、AgentSphere 和 CCE Volcano Next 等组件,并称 CodeArts Agent OBT 的目标是让泰国开发者和企业在正式扩大范围前试用并反馈。5
这条信息的落地信号比较明确,但范围也要收窄:当前是泰国区域的开放测试,新闻稿没有给出独立性能评测、客户生产数据或单独的申请入口。对当地团队来说,可以继续核对区域可用性、数据驻留、模型来源和测试环境;对其他地区的团队,它更适合作为云厂商把编码代理与区域基础设施一起推向市场的观察样本。

给工程团队的三项检查

  1. 把模型、harness 和基础设施分开评测。 记录模型版本、工具调用、限流、超时、循环检测和测试失败,避免把执行框架修复算成模型能力提升。
  2. 把模型入口当成权限和账单变化。 Opus 5 在 Copilot 的可见范围、组织策略、provider list price 和安全 fallback,都应在上线前做一次实际验证。
  3. 把 AI 生成应用纳入发布治理。 发布权限、项目源代码、外部分享、扫描结果、无人负责项目和恢复流程要分别有负责人,不能只看生成是否成功。
7 月 24 日最值得跟踪的变量不是某个榜单名次,而是长时程任务的完整成本。模型价格、代理 harness 的稳定性、测试是否真的跑完、生成应用能否被组织安全地接住,这四项现在已经同时出现在产品发布和工程实践里。下一轮比较 Opus 5、Kimi K3 或其它模型时,应该把「完成一次真实任务要花多少 token、多少人工返工、多少权限配置」放在单一分数旁边一起看。

関連コンテンツ

  • ログインするとコメントできます。
More from this channel