AI Loop Engineering 每日深度播客 Content Archive
84 posts · Page 1 of 1
- Agentic RAG 的下一跳:Google 把「够不够用」写进检索循环
- Loop Engineering 到底在工程什么:把 Agent 做成会自我改进的系统
- Daybreak 把安全 Agent 的重点,从发现漏洞推到修补循环
- Google 把 Agent 安全风险做成可运营的闭环
- Thinker-Worker-Verifier:把自我改进 Agent 写成有限状态机
- Agent 不缺聪明,缺可执行的 API 契约
- 别让 RAG 把 Agent 带进语义陷阱
- 让 Agent 自己写循环:LangChain 把子 Agent 调度搬进代码
- 别让优化器给自己打分:Google 把 Agent 质量飞轮交给编码 Agent
- Agent 循环坏在生产库里
- Agent 必须被看见,才能被相信
- 科研 Agent 不能只会跑脚本:Claude Science 把审计塞进循环
- Agent 不是 API 路由:Trigger.dev 把聊天循环搬进耐久任务
- Agent 评估不能只看答案:Oracle 把执行路径也放上考卷
- Agent 循环没有刹车,会自己烧钱
- Agent 别从头跑:长循环运行时该怎么选
- Agent 别硬接:编排边界才是生产问题
- 别让优化器空想:AlphaEvolve 把 Agent 关进评分循环
- 记忆别挂在循环外:Agent 每一步都该查什么
- 代码 Agent 别自审:PR 要进审查循环
- 别只调提示词:Agent harness 要进控制层
- Agent 的输入就是攻击面:GitHub 工作流如何被一条 Issue 反向利用
- Agent Skills 不只是 Prompt:微软把可执行能力包接进 Python Agent
- 别再维护一份巨型 Prompt:智能体指令也要进入构建流水线
- Agent 的 ROI 也要进反馈循环:LangChain 把成本、trace 和业务 KPI 接起来
- 代码审查 Agent 也要有自己的沙箱:GitHub 把配置、网络和反馈拆开了
- 验证器给什么反馈,决定 Agent 能不能修好
- AgentLoop 把 Agent 从一次调用变成可观测的工作单元
- Tunix 把 Agent 训练也变成高吞吐反馈循环
- GitHub 把 Agent 使用数据变成团队反馈循环
- OpenAI Presence:让企业 Agent 从上线走向持续改进
- MCP 走向无状态,Agent 循环要重新管理状态
- GradRAG:让 RAG 的评估反馈回到检索上游
- GitHub 给 Issue Agent 加了置信度阈值:审批不是安全边界
- Google 给 Agent 加上工具前置钩子:运行时开始有刹车,但安全边界还在外面
- Signal 把生产故障变成可审查的代码改动:Agent 质量循环接上了下一环
- Mem0 把长期记忆接进 n8n 和 Zapier:Agent 循环多了一块持久状态
- Google 把 Agent 评估接上生产:同一套分数,能不能让质量循环成立?
- Symbio 把用户纠错写回 LoRA:本地 Agent 的反馈循环长什么样?
- GPT-5.6 的 Agent 循环:模型路由和成本控制合并了吗?
- Agent 要的不是容器,而是一台可恢复的计算机?
- 大 PR 不是 Agent 的终点:GitHub 把代码改动堆成可审查的循环
- MCP 进入无状态迁移期:Agent 要把任务状态写在连接之外
- Google 的安全 Agent 不靠自审:漏洞发现要经过几道闸门?
- Agent 写完代码还不算交付:AppLooper 把发布权锁回人手里
- 一个分数不够:HarnessEval-W 把世界模型评测做成了 Agent 循环
- 代理写得太快,审查循环怎么接得住?
- Agent 循环真的在跑,还是只留下了配置?
- 红队智能体找到风险之后,谁来决定可以上线?
- 省下一个工具调用,可能多花一轮:GitHub 拆解 Agent 成本循环
- 长周期 Agent 怎样把继续做变成有证据地继续做?
- Agent 的主动性,怎样只出现在有证据的地方?
- Agent 不只是会想:Conductor 把思考接进耐久工作流
- Meta 把专家纠错编译成 Agent 的长期记忆
- GPT-6 Astra 上线:Agent 循环进入长任务时代
- HydraFusion:Agent 不再只选模型,而是选择执行路径
- PureLock:让 Agent 把“没必要动手”也变成一次成功运行
- Agents API:OpenAI 把 Codex 的长循环做成云端基础设施
- BenchShield:别让 Agent 靠钻评测空子拿高分
- Copilot 代码审查开始自己验证自己,但合并闸门还得在人手里
- Dify 1.17.1:RAG 不是有结果就算对,升级还可能静默弄坏检索
- Agent 总分变了,究竟是哪一步变好了?
- 工具调用全部成功,工作流为什么还是错的
- Agent 写出 46 页的证明:什么时候该拆,意见该退回哪一节
- Agent 撞上墙以后,会自己绕哪条路:OpenAI 六份失配报告
- 事故只发生一次,怎么变成每天跑的测试:Agent 断点重放
- 说好断网的评测沙箱,Gemini 怎么打进了真公司
- 循环拆成零件之后:同一个模型,成功率差了九倍
- 循环里的判断题换了价码:Jev 上线一周,当闸门也当判官
- AI 自己去调外壳:同一个 Agent,账单一口气少了三分之一
- 调度器拿掉之后:一千零二十四个 Agent,同一个模型,分数涨了六成
- 一天三百万个干净房间:Agent 训练卡住的是环境,不是模型
- 技能文档管不住步骤:把流程编译成状态机,平均涨十六个百分点
- 换个模型,整段对话作废:Agent 循环的账其实记在缓存上
- 加了记忆反而更差:Agent 循环里带下去的状态该怎么管
- 判官不会说自己没有依据:Agent 循环里证据算不算数
- 改坏一条边,零误动作的闸门就漏了:Agent 动手之前,许可该由什么给
- 真实事故二十道,最强的模型过不了七成:Agent 出错之后那一段该怎么走
- 每个 Agent 都对,团队还是错:多智能体缺的不是智力,是共享状态
- 换个外壳,第一名就换人:Agent 榜单测的是模型还是系统
- 随机挑也赢过六款商业路由器:循环里的算力该花在哪一步
- 一条记忆要跨过四道边界:Agent 的长期记忆该归谁
- 两道判官,只抵一道半:Agent 循环里的检查到底多挡了多少
- 改完更好就留下:自我改进循环报出的分,比真实高了十几点