
AI 编程情报:升级画布、Agent Harness 与生产路由
本期聚焦 AI 编程与企业代理的生产化进展:Microsoft 把 .NET 升级放进 Copilot 执行画布,Agent Framework 拆解内部代理的工具与并发能力,Vercel 与 AWS 的生产数据和客户案例显示,模型路由、审计链和受管基础设施正成为落地重点。
这几天的 AI 编程与应用进展,重点不在新模型参数,而在「代理能不能被放进生产流程」。Microsoft 把 .NET 现代化做成 Copilot app 里的可视化升级画布;Vercel 的生产路由数据把高流量任务和高风险任务拆开;AWS 两个客户案例则把医疗合规和 SAP 转型里的 agent 基础设施问题摆到了台面上。123
| 信号 | 发生了什么 | 影响对象 | 下一步看点 |
|---|---|---|---|
| Copilot 做 .NET 升级画布 | GitHub Copilot upgrade agent 会评估 .NET 应用、生成升级计划、拆成实现任务并执行;Copilot app 里新增 interactive upgrade canvas,展示 assessment、plan、tasks、execution progress、code changes 和 build failures。1 | 维护 .NET 旧系统的企业开发团队 | 代码代理开始接管「评估、计划、执行、失败修复」这一整段迁移流程,而不只是补几行代码。 |
| Copilot 桌面 app 放宽入口 | GitHub Copilot app 已面向所有 Copilot plan 开放,覆盖 macOS、Windows 和 Linux;没有 Copilot 订阅的用户也可以用 BYOK 运行自己的模型 provider。4 | 个人开发者、教育用户、希望自带模型密钥的团队 | 桌面端 agent-driven development 不再只服务高阶企业席位,入口会继续下沉。 |
| Microsoft Agent Framework 补 harness 能力 | Microsoft Agent Framework 的 harness 示例把 skills、shell、CodeAct 和 background agents 拆成四类能力:按需加载领域技能、受控执行 shell、写代码算结果、并发派发子代理。5 | 自建内部 agent、需要工具权限和并发子任务的工程团队 | 自研 agent 不该只堆系统提示,能力、权限、执行环境和并发模式要拆成可治理模块。 |
| Vercel AI Gateway 生产指数 | 6 月 AI Gateway token volume 环比增长 29%,spend 增长 27%;open-weight models 跑了 29% 的 tokens,但只占不到 4% spend;Anthropic 占 61% spend 和 32% tokens,并在 coding agents、back-office agents、app generation 等高风险用例拿到至少 72% spend。2 | 做模型路由、成本控制和生产 AI 应用的平台团队 | 低成本模型吃高流量,闭源前沿模型保高风险任务,生产路由正在变成成本治理的核心。 |
| Bluesight 医疗合规代理 | Bluesight 用 Amazon Bedrock AgentCore 把 Prism Assistant 推到 ControlCheck,2026 年 5 月已在 20 个 health systems 使用;报告生成和数据分析最多快 97%,GPO 多产品代理在 synthetic data 上达到 100% invoice discovery 和 93% evidence justification accuracy。3 | 医疗、合规、审计和多系统数据分析团队 | 受监管场景里,LLM 负责调度和报告,关键判定仍要靠规则、证据链和审计日志。 |
| KTern.AI 的 SAP 多代理平台 | KTern.AI 在 Amazon Bedrock AgentCore 上运行 20 多个 SAP 转型代理和 50 多套 agent configurations;其内部生产数据称 SAP 项目周期减少 45%,discovery 和 assessment 时间减少 60-70%,每月收回 480 个工程小时。6 | 做 ERP 迁移、流程挖掘和企业级 AgentOps 的团队 | 长周期项目需要 memory、tool access、identity、observability 和 evaluations 一起工作,单点聊天机器人不够用。 |
迁移任务:Copilot 开始吃下完整升级链路
Microsoft 的 .NET 更新把 Copilot upgrade agent 放进更明确的工程流程。它不是让开发者扔一句「升级到新版本」,而是先评估目标 .NET 版本、NuGet 包、breaking API changes、项目依赖和任务顺序,再生成 upgrade plan,把工作拆成 implementation tasks,并在执行中暴露 build failures 和 code changes。1
Copilot app 的 interactive upgrade canvas 是这条更新里最值得看的一点。过去 agent 迁移任务常散落在聊天记录、Markdown artifacts 和代码 diff 里,reviewer 很难判断代理到底走到了哪一步。升级画布把 assessment、upgrade plan、implementation tasks、execution progress、code changes、build failures 和 final results 放到一个视图里。1
同一套 upgrade workflow 也进入 Visual Studio、VS Code 和 GitHub Copilot CLI:Visual Studio 可在 Solution Explorer 里右键 Modernize,VS Code 通过 GitHub Copilot upgrade extension 选择 Upgrade agent,CLI 则安装 Copilot upgrade plugin 后在终端里评估、规划和执行 .NET 升级。1
这里的判断很直接:AI 编程代理真正进入企业,不会只靠「写一段函数」。旧系统升级、依赖迁移、构建失败修复和审查交接这些脏活,才是企业愿意付费的地方。GitHub Copilot app 同时向所有 Copilot plan 开放,并支持 BYOK,这会让这种 agent-driven development 入口更早进入个人和小团队。4
Harness:自研代理不能只靠长提示词
Microsoft Agent Framework 的 harness 文章更像工程教程,不是一次产品发布。但它把自研 agent 的几个关键能力拆得很清楚:skills 用小型
SKILL.md 文件按需加载领域知识,shell 让 agent 在受限工作目录里整理文件,CodeAct 允许 agent 写代码计算答案,background agents 则把工作并发派给子代理后汇总结果。5这条材料对内部平台团队有用,因为它反过来说明一个常见失败点:把所有规则塞进系统提示并不会自然得到可靠 agent。领域知识要能按需加载,shell 权限要有工作目录和策略限制,代码执行要有隔离,子代理并发要能被汇总和追踪。5
文章还提醒,shell 的 deny-list policy 只是用户体验层的护栏,不是安全边界;真正的隔离来自受限工作目录、审批提示,以及面对不可信输入时的 sandboxed executor。这个边界很重要:企业一旦让 agent 调 shell 或写文件,就已经进入权限治理问题,而不是单纯的模型能力问题。5
生产路由:高流量和高风险任务开始分流
Vercel 的 AI Gateway Production Index 不是全市场统计,只代表 Vercel AI Gateway 的匿名聚合路由数据。但它提供了一个生产侧样本:6 月 token volume 环比增长 29%,spend 增长 27%,平均 token 价格在 5 月上涨近 20% 后转为持平。2
变化来自路由。Open-weight models 在 6 月跑了 29% 的 gateway tokens,但只占不到 4% spend;DeepSeek 达到 22.6% token volume,距离 Google 不到 2 个百分点。Vercel 的解释是,便宜模型吃掉高流量任务,闭源前沿模型价格也上升,两股力量抵消后,整体每 token 价格持平。2
高风险任务仍集中在前沿模型。Vercel 写到,Anthropic 拿到 61% spend 和 32% tokens,并在 coding agents、back-office agents、app generation 等错误代价更高的 use cases 中拿到至少 72% spend。Google 的量则集中在 personal-assistant 和 education workloads,在 coding agent tokens 中占比低于 2%。2
对平台团队来说,这比「哪个模型最强」更可操作。路由策略要按任务风险、失败成本、延迟、价格和可观测性拆开;把所有请求打到同一个模型,会同时浪费预算和放大故障面。
落地案例:代理开始进入受监管和长周期项目
AWS 的两个案例都带有供应商博客口径,需要按客户案例看,不应外推成行业平均。它们仍然说明同一件事:企业代理落地时,基础设施问题会很快压过 prompt 问题。
Bluesight 的 Prism Assistant 用在医院药品合规场景。文章称,ControlCheck 版本 2026 年 5 月上线,已被 20 个 health systems 使用;在 20 个 health systems 的内部测量中,diversion teams 的报告生成和数据分析最多快 97%, recurring reports 从约 6 小时降到 15 分钟,pre-investigation triage 从 3 小时降到约 10 分钟。3
更关键的是架构边界。Bluesight 的 GPO prohibition 方案不是让 LLM 直接判定合规,而是让 orchestrator agent 调度 CostCheck、ShortageCheck、340BCheck 等数据 worker;合规评分由 13 个 evidence signals、priority-based matching 和 configurable temporal windows 组成的 deterministic scoring pipeline 完成。文章还写到,synthetic data 测试里 invoice discovery rate 为 100%,evidence justification accuracy 为 93%。3
KTern.AI 的 SAP 案例则展示了另一类长周期项目。它在 Amazon Bedrock AgentCore 和 Strands Agents SDK 上运行 20 多个 specialized agents,维护 50 多套 agent configurations;代理覆盖 reverse engineering、fit-to-standard、code analysis、exception mining 等 SAP 转型环节。6
KTern.AI 给出的内部生产结果是:SAP 项目整体周期减少 45%,discovery 和 assessment 时间减少 60-70%,Finance 和 Sales operational exceptions 的 90% 可由 exception mining agents 自动识别,每月收回 480 个工程小时;新 agent capability 从过去 2-3 周缩短到 4-6 小时配置上线。6
这两条案例的共同点不是「某个模型很强」,而是 AgentCore 这类基础设施承接了 runtime、memory、gateway、identity、observability 和 evaluations。业务团队把精力放在证据、权限、规则和评估上,代理才可能进入合规、医疗、ERP 这种不能随便试错的场景。
对读者的直接判断
- 如果你负责旧系统升级,先找一个可被拆成「评估、计划、任务、执行、验证」的迁移场景。这样的场景比开放式需求更适合交给 agent。
- 如果你在自建内部代理,不要只加长系统提示。把领域技能、工具权限、代码执行、shell、子代理并发和审批策略拆成可治理模块。
- 如果你在管模型成本,下一步不是统一压价,而是把工作负载分层:高流量低风险任务走低成本模型,高风险任务保留更强模型和更完整日志。
- 如果你在受监管行业落地 AI,LLM 不应该直接承担最终判定。让它调度数据、整理证据、生成报告;判定规则、审计链和异常处理要留在可验证系统里。
참고 출처
- 1Modernize .NET applications in the GitHub Copilot app
- 2Open-weight models surge to 29% of volume, price per token flattens - Vercel
- 3Building an agentic AI solution at Bluesight with Amazon Bedrock
- 4GitHub Copilot app available to all - GitHub Changelog
- 5Agent Harness: Scaling the claw or harness capabilities
- 6How KTern.AI built agentic AI for SAP on Amazon Bedrock AgentCore
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.
