Commerce Gym · 研发中

在真实商业环境中, 训练和评估智能体。

我们正在构建以已授权的商业状态和可观测结果为基础的环境,让团队可以评估智能体是如何做出购买决策的。

状态 State

有什么可用?

商品、价格、库存、政策与权限。

动作 Action

智能体能做什么?

比较选项,并选择被支持的商业动作。

结果 Outcome

实际发生了什么?

完成、失败,以及可观测的商业结果。

为什么真实环境重要

智能体还在做决定时,商业状况已经变了。

01

状态一直在变

价格、可用性和配送条件都会变。智能体需要针对当下相关的状态做推理。

02

业务约束

政策、授权和被支持的动作,决定了智能体实际能做什么。

03

有意义的结果

"回答听起来合理"和"任务真的完成了"是两回事。评测需要一个明确的结果定义。

我们的研发路径

从商家上下文,到有用的评测。

当前基础

商家上下文与结果

Agentic Page 在商家内容、AI 发现与可获得的归因上提供了起点。

研发中

结构化轨迹

把已授权的状态、被支持的动作与可观测的结果连成明确的记录。

研究方向

评测与训练环境

用这些记录来标定任务,并在商业约束下评估智能体的行为。

面向智能体与模型团队

一起定义值得衡量的任务。

我们欢迎关于评测任务、环境需求与授权数据合作的讨论。开放程度与合作范围逐案商定。