E-Commerce Bench:365 天电商经营如何测出 Agent 的谈判、反欺诈与长期学习

E-Commerce Bench:365 天电商经营如何测出 Agent 的谈判、反欺诈与长期学习

解读 Qwen 的 E-Commerce Bench 如何用 365 天电商经营、确定性市场和七条诊断轴,测出 Agent 的现金流、谈判、反欺诈与长期学习能力。

E-Commerce Bench 把一个 LLM Agent 放进 365 天的电商经营环境:Agent 要开店、找货、议价、定价、发货、处理退货,还要在收入延迟到账的情况下维持现金流。它的价值不在于把对话轮数简单拉长,而在于让今天的库存、现金、供应商关系和记忆状态改变明天的选择。
论文的正式标题是 E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation,arXiv 编号为 2608.30730,作者包括 Dayiheng Liu。论文和 QwenLM 官方仓库同时公开了基准的实现与评测说明。12

四层环境让长期依赖变得可测

一个 Agent 每次调用模型时,都会在经营循环里推进一小步。它可以使用 18 个电商工具,查询市场、联系供应商、管理库存、调整价格、发货、提现和写入记忆。一天的工具调用会消耗模拟时间,时间走到当天结束后,环境统一结算销售、退货、事件和现金状态,再把新信息交给下一轮。3
E-Commerce Bench 的四层架构:Agent 循环、工具层、环境层和数据层
官方项目页将基准拆成 Agent loop、tool layer、environment layer 和 data layer;图中的工具、谈判内核与数据规模均来自项目说明。3
环境层同时处理两个问题。动态经济引擎根据需求、促销、自然灾害、供应链冲击和店铺声誉计算销售;确定性谈判内核决定供应商报价、让步以及接受或离场。数据层包含 6,886 个商品、60 个品类、576 个供应商和 12 种店铺类型,其中 152 个供应商带有五种诈骗模式。项目页还固定了一个包含 8 次促销和 10 个市场事件的年度日历。3
这些设置把长时程难点放进了状态转移里。Agent 今天买了什么,决定明天能卖什么;Agent 今天写下什么,决定上下文淘汰后还能记住什么;Agent 今天是否把钱提出来,决定下一次采购能否付款。读者因此可以观察一条完整反馈回路,而不是只看一次回答是否完成任务。3

现金先离开,收入后来

E-Commerce Bench 最容易被忽略的设计,是把总资产和可用现金拆开。销售收入先进入 escrow,发货后等待结算,再进入平台钱包,Agent 还要主动把钱提回银行。采购和运营成本则在发生当天从银行账户扣除。
E-Commerce Bench 的三账户现金流与一笔订单的结算周期
官方现金流图显示,收入经过 escrow 和平台钱包后才回到银行;项目页给出的示例中,一笔订单的现金从付款到首次回流相隔 16 天。3
结算链让“卖得有利润”和“银行账户撑得住”成为两件事。论文记录到,收入在发货后还要等待 9 天才能从 escrow 进入平台钱包,Agent 再进行提现;90 次运行中有 10 次最终破产。两次 GPT-5.5 的破产发生在第 17 天,当时还没有任何收入完成结算。破产规则是银行余额连续 10 天为负,破产运行仍会进入模型平均值。1
这条机制也解释了为什么模拟环境需要事件日历。促销会提前改变需求,灾害和供应链冲击会改变销量或交付时间,库存必须在收入回流以前就买好。一个只追求眼前毛利的策略,可能因为现金被库存和待结算收入占用而错过下一次采购窗口。1

确定性设计把主要归因交给 Agent

论文把供应商拆成两层。第一层是 Deterministic Negotiation Kernel:它固定价格、让步和接受/拒绝决策。第二层是 NPC 渲染器:另一个 LLM 把已经确定的经济决策写成自然语言对话。这样,模型无法靠一句更有说服力的话把供应商说到成本线以下。1
顾客购买与退货也遵循固定需求模型。相同的行动序列在同一个模拟世界中会得到相同的主要经济反馈,因此不同模型之间的资产差异更容易归因于经营政策,而非每次重新抽到了一组需求。1
这项控制仍然留有边界。论文明确记录,供应商对话的渲染器会采样,供应商交付天数也可能在运行之间变化。价格与成交判断保持固定,欺诈识别看到的自然语言仍可能变化。所以,这是一套降低经济评测噪声的设计,证据强度高于普通随机市场模拟;它仍然属于带有文本与交付不确定性的实验环境。1
欺诈机制尤其能说明这一点。152 个欺诈供应商分成五种诈骗模式,开场报价被设计得与诚实供应商相似,模型需要从多轮让步形状和对话内容中判断风险。预成交诈骗会抬高隐含成本,成交后诈骗则通过短发货或瑕疵货造成损失。论文因此用流向欺诈供应商的采购金额占比 BadSpend% 计分,而不是用“拒绝了多少次”来计分。1

年末资产只能回答一半问题

论文评估 18 个模型,每个模型运行 5 次,共 90 次运行,全部使用同一个固定世界。主要指标是年末总资产,也就是银行余额、平台钱包和待结算 escrow 的总和;论文再用六条诊断轴解释这笔钱怎样产生、怎样损失:议价质量、反欺诈、现金流与偿付能力、运营效率、运营执行和长期学习。1
模型年末资产(千元,均值±标准差)CSE+BadSpend%峰值回撤/峰值每工具调用利润(元)可控退货率(百分点)AnchorRatio破产运行
GPT-5.6 Sol (max)1,431±3140.67218.48%0.2783634.461.2170/5 1
Fable5 (max)805±1880.7723.46%0.1414790.221.5730/5 1
Claude Opus 4.7 (max)259±1110.8110.12%0.1891561.751.4210/5 1
Qwen3.8-Max-Preview416±1110.7136.13%0.2421730.380.8340/5 1
GLM 5.2 (high)301±1240.6931.99%0.1271370.591.4340/5 1
Qwen3.5-Plus1.1±110.62520.11%0.979−925.881.8604/5 1
表中 CSE+ 越高越好,BadSpend%、峰值回撤/峰值、可控退货率和 AnchorRatio 越低越好;5 次运行的标准差显示在资产均值之后。1
表格里的分化很重要。GPT-5.6 Sol 把 10 万元起始资金增长到平均 143.1 万元,却在反欺诈轴排名第 16/18,每次工具调用利润也低于 Fable5。Fable5 的年末资产低于 GPT-5.6 Sol,但每次工具调用平均带来 479 元利润,高于前者的 363 元。Claude Opus 4.7 在议价质量和反欺诈上更突出,年末资产则处于中游。1
Qwen3.8-Max-Preview 的准确读法有两层。它在开源权重模型中以平均 41.6 万元年末资产领先,5 次运行均未破产;它的 BadSpend% 为 6.13%,低于 GPT-5.6 Sol,但高于 GLM 5.2 (high) 的 1.99%。因此,Qwen 的结果体现的是开源组经营表现与风险之间的一种组合,而非七条轴全面领先。

AnchorRatio 观察重复采购中的学习

长时程评测最有信息增量的一条轴,是它追问了一个年末资产回答不了的问题:Agent 第二次从同一供应商购买同一 SKU 时,是否记得第一次谈到的低价?1
E-Commerce Bench 的一次议价过程与重复采购中的价格锚定变化
官方项目图把一次议价的收敛过程与重复采购中的“丢失锚点”和“保持锚点”并列展示;该机制对应论文的 AnchorRatio 指标。3
AnchorRatio 只统计诚实供应商。评测把每个重复采购价格放回同一供应商—SKU 对的议价区间,再把已经获得的价格随机重排,形成模型自身的置换基线。1.0 表示实际价格顺序和随机顺序没有区别;低于 1.0 表示后续订单平均更便宜,高于 1.0 表示模型逐渐丢掉了先前的低价。
Qwen3.8-Max-Preview 的 AnchorRatio0.834。项目页称,18 个模型中只有它显著优于自己的随机置换基线;论文统计了 8,647 次重复采购,覆盖 2,230 个供应商—SKU 重复交易对。Gemini 3.5 Flash 的数值为 0.918,其他多数模型高于 1.0。这个结果把“长期学习”落到了一个可以逐笔检查的动作上:模型有没有在下一次谈判里拿出自己过去赢下的价格。13
这个指标也带着清晰的测量边界。它只覆盖诚实供应商,每次重购按同等权重计算,提前结束的运行不会进入该指标。论文提出了三个可能机制:上下文淘汰让模型失去旧的工具结果,持久记忆写入很少,以及模型需要靠推理主动整理自己的历史。当前实验把这些机制放在同一观察结果下,尚未单独分离它们。1

复测要从反馈回路开始

工程团队复现这项基准时,先锁住以下变量,才能知道差异来自模型策略还是环境设置:12
  1. 世界与数据版本。 固定商品、供应商、诈骗类型、促销和市场事件日历,并记录环境代码版本。
  2. 现金结算。 单独保存银行余额、平台钱包、escrow、提现动作和库存占用,避免把总资产误读成即时流动性。
  3. 谈判与文本。 分开记录谈判内核的价格/成交决策和渲染器输出,反欺诈结果要保留文本证据。
  4. 上下文与记忆。 记录上下文淘汰、memory store 的读写、重复订单和历史最低价是否进入当前提示。
  5. 模型成本。 记录工具调用次数、模拟回合、输入输出 token、推理设置和每次运行总成本。
  6. 任务级失败。 保存破产、欺诈采购、未发货取消、退货、现金断裂和重复议价价格,而不只保存年末资产。
E-Commerce Bench 给 Agent 评测带来的具体推进,是把“会不会完成一次任务”改写成“能否在反馈延迟、信息不完整和历史会被压缩的环境里连续经营”。固定的需求模型和谈判内核让主要经济反馈更可复现,多轴指标则把一笔年末资产拆回议价、现金、欺诈、执行和学习。Qwen3.8-Max-Preview 的开源组领先与 AnchorRatio=0.834 值得打开原文和复测;5 次运行、单一固定世界以及渲染器噪声仍然要求读者把它当作任务内证据,而非普遍部署结论。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel