8月23日 AI创业早报:DeepSeek周末谷价、环境 Harness 与企业 Agent

8月23日 AI创业早报:DeepSeek周末谷价、环境 Harness 与企业 Agent

DeepSeek调整周末API计费;Google Research发布EnvHarness;Vercel CEO Guillermo Rauch发布Mini浏览器并公布开放权重token占比;Grok Bot向少量企业开放试用;CoArena上线计算机使用Agent实时评测,并补充Developer Index、Faraday、Ox Alpha和Claude相关快讯。

0:00 / 10:21
DeepSeek 从 8 月 23 日零点起把周六、周日全天统一按低谷时段价格计费;Google Research 发布 EnvHarness,用插件层改变静态环境向 Agent 提供训练信号的方式;Vercel CEO Guillermo Rauch 发布个人浏览器 Mini,并公布 Vercel AI Gateway 的开放权重 token 占比;Grok Bot 向少量企业开放周末试用;CoArena 上线计算机使用 Agent 的实时盲评场。节目后半段补充 Developer Index、Faraday、Ox Alpha、Claude 水印、Claude Translator 和低风险表单自动填写等快讯。

本期节目

DeepSeek 调整周末计费

DeepSeek 面向 API 用户调整峰谷计费规则。北京时间 8 月 23 日零点起,周六、周日全天不再区分峰谷时段,统一按低谷时段价格计算。此前 V4-Flash 和 V4-Pro 的高峰价格最高为低谷价格的两倍。1

Google 发布 EnvHarness

Google Research 的论文《EnvHarness: Awakening Static Worlds for Agent Learning》提出一个包裹静态环境的可编程插件层,不修改底层逻辑,通过标准接口改变环境的状态布置、动作和观测映射,以及环境之间的连接。论文在五个 benchmark、四个领域进行实验,报告 held-out 实例最高提升 9.0 分、执行步骤减少 9.8%。2 机器之心文章同时列出了项目代码和项目主页。3

Mini 浏览器与 Vercel AI Gateway 数据

Vercel CEO Guillermo Rauch 说,他用 fx 构建了个人 Web 浏览器 Mini,用于屏幕共享、串流和测试,浏览器基于更小、更容易修改的 Chromium。4
Rauch 还公布了 Vercel AI Gateway 的 token 比例:8 月 22 日开放权重模型占 62%,关闭权重模型占 38%;6 月 24 日开放权重模型占 28.4%,关闭权重模型占 71.6%。5

Grok Bot 开放少量企业试用

Michael Truell 的 X 个人简介写着,他正在建设 SpaceX AI。他在 X 上说,Grok Bot 将在周末向少量企业开放访问,并邀请旧金山企业申请上门 onboarding。6

CoArena 上线计算机使用 Agent 实时评测

CoArena 介绍了一个实时评测场:两个 frontier model 在同一个真实任务、相同 scaffold、相同 sandbox 和相同预算下并行运行,记录每一步,由人类盲评。7 CoArena 官方文章补充了相同任务、相同动作空间、相同屏幕和相同时间预算的评测机制。8
CoArena 公布的运行数据包括:约 66% 的 Agent runs 完成任务;表现最好的一类 Agent 完成率约 87%,最差的一类约 42%;一家主要 frontier model 约三分之一的运行超时;约 7% 的对战中,人类评审认为双方都失败。9

其他快讯

Firecrawl 发布 Developer Index,索引超过 7000 万条 README、Issue、已合并 PR、OpenAPI 规范、skills 和外部开发文档,并提供语义检索和元数据过滤。10
Firecrawl 同时发布 DevDex,使用 1,179 条开发者搜索查询,官方公布 Developer Index 综合 Recall@10 为 0.63。10
TechCrunch 报道,DeepMind 校友创办的伦敦 AI 实验室 Inherent 发布了 Faraday,使用约 270 亿参数的 Qwen 3.6 执行独立复现科学论文研究结果的任务。11
Ben Davis 在 X 上公布,Ox Alpha 一次真实 DeepSWE 运行的结果约为 63%。12 Chubby 对这条实测作了转述。13
Every 的账号发文称,Anthropic 会给 Claude 输出加入不可见水印,方式类似 Google 的 SynthID。14
Yuntian Deng 发布 Translator,把英语和 Claudish 互相翻译。15
沃顿商学院研究 AI 的教授 Ethan Mollick 发帖说,Codex 和 Claude Code 可以自动填写邮件中的低风险表单,不需要继续干预。16
Anthropic 的 Claude Academy 课程已经免费开放,并且有中文支持。17
Marin 535B-A23B 本周开始训练,计划使用 18.75 万亿个 token,在 11 组 GB200 NVL72 上运行约三个月。18
NVIDIA 发布了 Molt,一个原生基于 PyTorch 的 Agent 强化学习训练框架,奖励函数可以直接写成 Python。19
Molt 同时提供 Env 和 ChatAgent 两种接口,训练和 rollout 可以异步重叠。19
清华、北大和北邮的研究者提出 PhyAI,把物理 AI 模型的训练、测试和部署统一到一个推理引擎,报告速度提升 1.40 到 4.65 倍。20
同一批研究还发布了 UniMotion,把动作、文本和图像放进一个共享模型,在七项 motion-text-vision 任务上报告最高成绩。21
NVIDIA 的 coding harness 在 ARC-AGI-3 的 25 个公开游戏上拿到 100%,解决了全部 183 个关卡。22
Hugging Face 上还出现了 NVIDIA 发布的 5,500 亿参数 instruction-following teacher model,用于蒸馏、数据生成和结构化输出。23
a16z 的图表写到,Agent 消耗的 token 接近人类用户的 5 倍,而且从二月以来增加了 14 倍。24
Anthropic 方面解释,Claude Code 显示 high 等于 10,是 serving 配置里的数值映射问题,内部评测没有发现性能回退。25
Y Combinator 转发了 Spectre Intelligence 的消息,这家创业公司加入了今年夏季批次,方向是用 AI 训练半导体和生物科技交易员。26
一位用户发帖说,他让 Agent 维护 Notion 里的业务信息,任务完成后自动更新数据库,并且每小时检查一次。27
有研究者发起 research taste benchmark,收集人们判断哪些既有论文值得继续研究的数据。28
一条 X 帖子介绍,Replit 已经可以直接从 GitHub 导入 Matt Pocock 的 36 个 skills。29
另一条帖子展示了 Grok Bot 分析 X 上的点赞、评论和帖子。30
一场 Clean Code 与 Agent 协作的对谈提到,多 Agent 流水线可以把规格、编码、清理、强化和 QA 分开执行。31
研究者还提出 Q-Learning with World Models,把 world model 和强化学习结合起来训练。32
一条中文 X 帖子介绍了 TRACES,一个面向发现式智能的 benchmark。33
一位开发者说,他处理的 Agent token 用量从不到一年前每年 100 亿,变成现在每周超过 100 亿。34
SemiAnalysis 估算,NAND 从钨转向钼后,2027 年相关沉积设备销售额会超过 10 亿美元。35
Anthropic 方面还说,Claude Opus 5 的输出稳定性是当前优先处理的问题。36
Y Combinator 联合创始人 Paul Graham 发帖说,一家每月增长 30% 的创业公司,按这个速度一年后需要大约 23 倍大的办公室。37
一篇评测实践帖把 hill climbing 解释成,选一个重要维度,按生产数据优化质量、成本或延迟;帖子举的例子是,工具调用失败时,把上下文里的工具从 20 个缩到每个任务需要的 3 到 5 个。38
Firecrawl 还说,多数来源在发布后一天内进入索引,Claude Code、Cursor 和 Codex 都能通过 Skill、CLI、MCP 或 API 接入;索引也能按来源类型、仓库、语言、主题和许可证过滤。39
Molt 的技术栈包括 Ray、vLLM,以及 NVIDIA AutoModel 配合 FSDP2,奖励函数可以是数学评分器、LLM 裁判或多轮工具评估器;帖子还称同一份训练脚本可以从 8B 模型扩展到 1T 级别的混合专家模型。19
PhyAI 说,同一套代码可以在云端 GPU、边缘服务器和机器人机载设备上运行;一项测试里,一个动作专家只占 8.8% 的计算量,却占 57% 的延迟。20
UniMotion 的任务包括根据文字生成动作,也包括用姿态编辑图像,覆盖七项 motion-text-vision 任务。21
Hugging Face 上的 NVIDIA teacher model 还被描述为擅长约束遵循、结构化输出和格式控制。23
Every 进一步描述,Claude 水印通过秘密密钥,在概率接近的词之间进行选择来编码。14
Ethan Mollick 后续补充,要让 Codex 或 Claude Code 自动填表,需要在电脑上运行 ChatGPT 或 Claude 应用,并打开浏览器控制。40
Clean Code 对谈还说,一个单 Agent 五分钟的任务,多 Agent 流水线大约需要一小时,人类完成同一任务约半天。31

References

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
  21. 21
  22. 22
  23. 23
  24. 24
  25. 25
  26. 26
  27. 27
  28. 28
  29. 29
  30. 30
  31. 31
  32. 32
  33. 33
  34. 34
  35. 35
  36. 36
  37. 37
  38. 38
  39. 39
  40. 40

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content