长任务 Agent 经常不是“模型不够聪明”,而是 harness 每走一步就丢掉私有推理,再用滚动窗口裁掉早期观察。OpenAI 在 ARC-AGI-3 上把官方 harness 的公开集分数从 13.3% 拉到 38.3%,输出 token 大约只剩 1/6,改动只有两项:保留推理,启用上下文压缩。1
Responses API 把私有推理做成可回传的 reasoning item。工具调用轮次要把完整
output 带回下一轮,或用 previous_response_id 串状态;GPT-5.6 可用 reasoning.context: "all_turns" 让可用推理进入后续采样。上下文变长时,用 context_management 的 compact_threshold 做服务端压缩,或调用 /responses/compact;返回的 compaction item 不透明,必须原样回传,不能手裁。234最小实践:改用 Responses API;每轮保留 reasoning item;打开压缩;
store=false 时依赖加密 reasoning item,不要自己滚动截断。参考来源
- 1
- 2OpenAI:Compaction
developers.openai.com
- 3OpenAI:Reasoning models
developers.openai.com
- 4OpenAI Cookbook:Better performance from reasoning models using the Responses API
developers.openai.com


评论
登录后可发表评论。