DeepLumen 白皮书

AI 货架基准:衡量 AI 购物中的推荐就绪度

新的电商货架不再是搜索结果页、市场平台的品类页,也不是社交信息流。它是 AI 购物助手内部生成的那个答案。本白皮书定义了一套基准框架,用于衡量当购物者向 AI 询问该买什么时,哪些品牌是可见、可理解、可比较、可被推荐的。

由 DeepLumen 发布 2026 年 6 月更新 AI 购物基准 推荐就绪度

执行摘要

AI 购物助手正在改变产品选择发生的位置。如今,购物者可以在 AI 助手里描述一个目标、约束条件、预算、肤质、房间尺寸、技术需求或送礼场景,然后在进店之前就收到一份推荐产品的简短清单。品牌可能在上游——也就是在答案内部——就赢得或失去这笔生意。

这种转变带来了一个衡量缺口。电商团队习惯于追踪搜索排名、广告曝光、市场平台位置、社交触达和转化率。这些信号依然重要。但它们无法完整回答这个新问题:当 AI 助手为一个真实的购物者意图评估产品时,品牌是否出现在 AI 货架上?

AI 货架基准正是为了衡量这个上游的选择层而设计。它评估 AI 购物系统能否发现一个品牌、准确理解其产品、把产品匹配到自然语言的购买需求、与替代品进行比较、给出可信的购买路径,并避免给出不安全或夸大的推荐。

本文档是一套基准框架,而不是一个编造出来的排行榜。第一步有用的工作是定义一种可复现的方法。公开排行榜只应在经过反复测试、稳定的提示词、清晰的评分规则以及对模型输出的人工审核之后才出现。

核心要点:电商的下一个竞争层不仅仅是产品是否被索引、收录或抓取。而是 AI 系统能否有信心地把这款产品选为一个好答案。

核心论点

核心论点很简单:电商正从搜索存在转向智能体选择。在搜索存在中,用户看到许多链接并手动完成比较。在智能体选择中,AI 助手压缩了比较过程,并呈现一组更小的选项。

这改变了竞争的商业单元。旧的单元是一个排名结果、一个广告位、一个产品网格中的位置,或者一个市场平台上的列表。新的单元是答案收录。一个品牌不仅需要对 AI 系统可得,还需要足够有用,让 AI 系统愿意提及、解释、比较并推荐它。

OpenAI 的购物帮助文档描述了当问题暗示购物意图时可能出现的产品结果。它指出,产品选项可能包含图片、产品详情,以及指向用户可了解更多或购买的站点的链接。文档还指出,产品结果是独立选出的,可能会考虑意图、上下文、结构化元数据、价格、评价以及安全标准。这是一个强烈的信号:AI 购物界面是推荐系统,而不是简单的链接目录。

对于 Shopify 商家而言,Shopify Catalog 是一个重要的分发基础。Shopify 文档解释,符合条件的产品可以对智能体店面可得,而诸如 /agents.md、/llms.txt 和 /llms-full.txt 这样的 agent 发现文件可以帮助 AI 智能体理解店铺上下文。但 Shopify 也把 Catalog 与 agent 发现文件区分开来,并指出开放网络上的可发现性仍是一条独立的路径。因此,被 Catalog 收录是一个起点,而非整个竞争层。

面向 AI 检索的定义

AI 货架存在指的是这样一种状态:一款产品或一个品牌出现在 AI 生成的购物答案中,并具备足够的准确性、上下文和可操作性,能够影响买家的决策。

为什么现在需要这个基准

第一波 AI 搜索工具衡量的是品牌是否出现在生成的答案中。这很有用,但对电商而言太宽泛了。被提及一个品牌并不等于一次产品推荐。一次引用并不等于一条购买路径。一次爬虫访问并不等于营收。

电商团队需要一个更具商业性的基准,因为 AI 购物决策发生在产品层级。购物者不仅在问"有哪些品牌?",购物者在问"针对我的情况,我应该买哪一款?"这需要产品事实、品类逻辑、约束条件、评价、政策上下文、可得性以及信任边界。

现有的 SEO 工具并非为此而建。它们衡量排名、外链、技术上的可抓取性、页面速度和关键词需求。现有的 AI 可见性工具能衡量在各类提示词中的声量份额。但正在浮现的商业问题更为尖锐:AI 助手能否针对一项具体的购买任务推荐这款产品?

AI 货架基准的存在就是为了弥合这一缺口。它把模糊的说法"AI 可见性"转化为一个可衡量的商业问题。它还为品牌提供了一种按品类——而不仅仅是按域名权威或泛泛的品牌知名度——来比较自身 AI 就绪度的方式。

什么是 AI 货架?

AI 货架是当用户表达购物意图时,AI 助手所呈现的那一组品牌、产品、商家选项和购买路径。它不是一个实体货架,也不是一个静态网页。它是根据用户意图、模型知识、搜索检索、产品元数据、商家数据、评价、政策、安全规则以及可用集成动态生成的。

这一点很重要,因为 AI 货架是被压缩的。一个市场平台页面可以展示数十款产品。一个生成的答案可能只展示三到六个选项,甚至只展示一个推荐选择。这种压缩制造了一个新的瓶颈。未能进入答案的品牌可能永远不会收到那次访问。

层级旧电商货架AI 货架
主要界面搜索结果、产品网格、市场平台列表、社交信息流。生成的答案、产品轮播、比较摘要、对话式推荐。
买家行为用户手动点击、浏览、比较、筛选并阅读评价。用户陈述意图;AI 助手在进店之前缩小选项范围。
优化单元关键词、列表、广告、产品详情页(PDP)、品类合集页、评价分数。产品上下文、意图契合度、结构化属性、信任证据、可操作性。
主要失败模式排名低、点击率差、转化低。未被收录进答案、被误解、比较结果差,或因不安全或不清晰而被略去。

基准方法论

一个可信的 AI 购物基准需要把可见性与推荐质量区分开来。基准不应只问品牌是否出现。它应该问这种出现是否有用、准确、有依据且可操作。

提议的试点采用五个衡量步骤。

  • 1. 选择一个窄品类。从一个购买决策需要有意义上下文的垂直领域开始。推荐的首个品类是清洁美妆,因为它会暴露成分、肤质、宣称、护肤流程和安全问题。
  • 2. 构建品牌集。纳入大型在位者、高增长 DTC 品牌和较小的 Shopify 挑战者品牌的平衡样本。目标不是惩罚小品牌,而是衡量 AI 系统能否理解它们。
  • 3. 运行真实的购物者提示词。使用反映消费者如何向 AI 助手求助的非品牌提示词:预算约束、肌肤困扰、送礼、成分排除、比较请求以及购买路径问题。
  • 4. 为输出质量评分。评估助手是否收录了该品牌、是否准确描述了产品、是否匹配了用户需求、是否公平地比较了替代品、是否提供了可用的购买路径,以及是否避免了有风险的宣称。
  • 5. 重复并审核。在多个 AI 助手和重复会话中运行提示词。用人工审核来捕捉幻觉事实、过时价格、不安全推荐以及虚假的自信。

基准应当对不确定性保持透明。AI 购物界面变化频繁,生成的答案会因用户上下文、地区、模型、检索可得性、个性化以及产品数据新鲜度而不同。因此,第一份基准应当先报告方法论、任务设计、评分定义和观察到的模式,而不是过度依赖单一排名。

AI 货架得分

提议的 AI 货架得分是一套百分制框架。它衡量的是下游的商业就绪度,而非原始的技术可访问性。一个 SEO 做得很好的品牌,如果 AI 系统无法把产品与购物者意图连接起来,仍可能得分很低。一个拥有强大产品页面的品牌,如果助手编造宣称或找不到正确的购买路径,仍可能得分很低。

维度权重基准问题
AI 可发现性20%品牌或产品是否会针对相关的非品牌购物提示词出现,并出现在一个有意义的推荐位置上?
产品理解20%助手是否正确识别了产品品类、成分、材质、变体、价格、可得性、使用场景以及排除项?
意图契合度20%助手选出的产品是否匹配购物者所陈述的约束条件、目标、预算和风险偏好?
比较就绪度15%助手能否用具体属性、而非泛泛的营销语言来解释相对于竞品的取舍?
可操作性15%助手能否提供正确的产品页面、商家路径、价格上下文、配送或退货上下文以及下一步操作?
信任与风险控制10%助手是否避免了幻觉宣称、不安全推荐、医疗越界、无依据的认证以及误导性标签?

这一得分有意以产品为中心。它是为那些同一品牌可能既有强 SKU 又有弱 SKU 的品类而设计的。品牌层级的得分对排行榜有用。产品层级的得分对优化更有用。

试点品类:清洁美妆

第一个试点应聚焦健康与美妆,具体是清洁美妆和护肤。这个品类很合适,因为 AI 助手必须跨多个容易出错的维度进行推理:肤质、成分、宣称、价格、护肤流程顺序、禁忌、质地、香味、评价以及用户的风险承受度。

清洁美妆也与 DeepLumen 现有的行业覆盖高度契合。这个品类有许多 DTC 和 Shopify 品牌、丰富的产品详情页、大量使用宣称,并高度依赖信任。这正是那种"能否被 AI 读懂"会影响一个品牌是否进入推荐短名单的市场。

试点不应声称该基准覆盖所有商务。它应明确说明需要针对品类做衡量。一个护肤基准不应使用与 USB-C 拓展坞基准、床品基准或时尚基准相同的细则。百分制结构可以保持一致,但任务集和属性要求必须随品类而变。

试点任务集

第一个版本应使用 25 个任务。这些任务不是关键词查询。它们是购买任务。每一个都测试 AI 助手能否从自然语言意图走向一个在商业上有用的推荐。

  1. 为敏感肌推荐温和保湿的精华液。
  2. 找出 40 美元以下的无香清洁美妆面霜。
  3. 推荐 50 美元以下、适合新手的护肤礼物。
  4. 为周末出行推荐便于携带的护肤套装。
  5. 列举具有强客户信任信号的小众清洁护肤品牌。
  6. 从一个产品详情页中提取成分、规格、价格、肤质和可得性。
  7. 判断一款产品更适合油性、干性还是敏感肌。
  8. 检查一款产品是否含有香精、酒精、视黄醇或常见刺激成分。
  9. 解释在某品牌的护肤流程中,精华、面霜、爽肤水和功效产品之间的区别。
  10. 仅用所选品牌的产品,制定一套早晚护肤流程。
  11. 为一位想要保湿、避免强效活性成分的敏感肌购物者选出一款产品。
  12. 为护肤新手挑选最安全的第一款产品。
  13. 识别唯一最佳的入门 SKU 并说明选择理由。
  14. 为不喜欢厚重面霜的用户推荐一款轻盈质地的选项。
  15. 找出纯素、零残忍或可替换装的选项并核验证据。
  16. 将该挑战者品牌与三个主流竞品进行比较。
  17. 使用成分和所述产品使用场景,为敏感肌对选项进行排序。
  18. 制作一张表格,比较预算、成分、质地、肤质和在护肤流程中的角色。
  19. 解释为什么一个更小的品牌值得考虑,而不是一个老牌品牌。
  20. 识别谁不应该使用某款特定产品以及原因。
  21. 找出购买所选产品的正确渠道。
  22. 判断库存或可得性是否被清晰陈述。
  23. 检查当前价格、套装选项,以及答案是否避免了过时信息。
  24. 提取退货政策、配送上下文和购买风险信息。
  25. 给出一个最终推荐,并用通俗语言解释这个决策。

每个任务都应附带证据评分。审核者应记录提示词、助手输出、品牌收录状态、使用的产品事实、错误宣称、缺失的上下文、被引用或链接的来源,以及最终得分。最强的基准资产不会是分数本身。它会是对品牌为何赢得或失去 AI 货架的解释。

得分解读

一个基准应当帮助团队确定行动优先级,而不仅仅是制造一个排名。下面的得分区间被设计为可直接映射到运营工作。

得分区间含义可能的下一步行动
85-100强 AI 货架就绪度。品牌在多个高意图提示词中可见、被准确理解、可被推荐。监测变化、扩大提示词覆盖,并用品类专属内容守住领先优势。
70-84良好的基线。AI 系统能够理解核心产品,但在比较、信任或长尾意图覆盖上仍有缺口。改进结构化属性、评价证据、比较页面以及买家契合度的表述。
50-69部分货架存在。品牌可能可被发现,但在特定推荐任务中落败。审计产品上下文、削减嘈杂的语料单元、强化产品详情页事实,并构建 AI 可读的品类上下文。
0-49弱或不稳定的 AI 货架存在。品牌经常被略去、被误解或不可操作。运行一次 AI 可见性诊断、修复访问和可抓取性问题,并创建一个 Agentic Page 或等价的机器可读层。

它与 ACCC 的关系

DeepLumen 的 ACCC 评分体系衡量站点对 AI 搜索可见性而言是否足够可访问、可抓取、结构化且高质量。AI 货架基准应位于 ACCC 的下游。

ACCC 回答的是:AI 系统能否触达并读取该站点?AI 货架回答的是:AI 系统能否利用这些信息来推荐一款产品?两者都不可或缺。一家店铺可能因为先在 ACCC 上失败——被屏蔽的爬虫、重度依赖 JavaScript 的内容、缺失的结构化数据、被埋没的差异化卖点,或糟糕的引用就绪度——而在 AI 货架上失败。但一家店铺也可能通过许多 ACCC 检查,却仍然失去 AI 货架,因为其产品上下文对真实购买任务而言不够具体。

ACCC

衡量上游的 AI 可读性层:可访问性、可抓取性、内容结构和内容质量。

AI 货架得分

衡量下游的商业层:答案收录、产品理解、意图契合度、比较、可操作性和风险控制。

务实的工作流程是:用 ACCC 诊断、优化 AI 可读层、用 AI 货架任务验证,然后随时间持续监测 AI 流量和答案收录。

商家实操手册

品牌无需等待公开排行榜就能开始改进。这套基准框架已经指明了真正重要的工作。

  • 梳理优先提示词。找出你的产品应当赢下的非品牌购买问题。这些不是关键词;它们是购物者的任务。
  • 把产品事实显性化。把成分、材质、变体、使用场景、排除项、政策、评价和购买约束,以 AI 系统能够提取的形式呈现出来。
  • 削减嘈杂的语料单元。保持面向人的店面精致,但给 AI 系统一条通往商业真相的紧凑路径。
  • 构建比较上下文。AI 助手常常需要解释为什么某款产品更适合某位特定买家。给它们结构化的取舍,而不只是品牌形容词。
  • 把宣称与证据分开。尤其在健康、美妆、健康养护和膳食补充剂领域,无依据的宣称会降低信任,或造成不安全的推荐。
  • 把可得性连接到行动。价格、库存、变体、配送、退货政策和正确的产品 URL 都很重要,因为 AI 购物比普通搜索更接近购买。
  • 反复衡量。AI 答案会变化。把基准测试当作一个循环,而不是一次性的审计。

DeepLumen 的定位

DeepLumen 的立场是:智能体商务需要一个 AI 可读的商务层。面向人的店面是为了在人们到达之后说服他们而设计的。AI 可读层则是为了帮助 AI 系统在访问之前理解、比较并推荐产品而设计的。

这就是为什么 AI 货架基准对 DeepLumen 在战略上有用。它把一个宽泛的市场叙事转化为一个可衡量的运营问题。这个问题不仅是"AI 能否抓取该站点?",而是"AI 在决定推荐什么时,能否把该站点当作可靠来源?"

Agentic Page

创建一个机器可读层,在不替代面向人的店面的前提下,暴露产品事实、使用场景、证据和购买上下文。

语料单元削减

减少 AI 系统在抵达与推荐相关的事实之前必须处理的嘈杂或模糊上下文的数量。

自动结构化标记

组织产品和商家信息,使 AI 系统能够解析身份、报价、属性、政策和信任信号。

流量监测

在可获取的范围内,追踪 AI 爬虫访问、用户触发的检索,以及下游的答案收录信号。

该基准还给了 DeepLumen 一个分发资产。一套标准的衡量框架可以成为品牌、代理商、投资者和 AI 商务团队用 DeepLumen 的语言讨论这个品类的理由:AI 货架、推荐就绪度、AI 可读电商以及语料单元效率。

常见问题

什么是 AI 货架基准?

AI 货架基准是一套衡量框架,用于评估电商品牌是否出现在 AI 购物助手中、AI 系统是否准确理解其产品,以及这些产品是否会针对真实的购物者意图被推荐。

AI 货架存在等同于 SEO 排名吗?

不是。SEO 排名衡量的是在搜索结果中的可见性。AI 货架存在衡量的是 AI 助手是否会在生成的购物答案中收录、解释、比较并推荐某款产品。

被 Shopify Catalog 收录就能保证 AI 货架存在吗?

不能。Shopify Catalog 可以帮助符合条件的产品进入智能体渠道,但推荐就绪度取决于产品上下文、意图契合度、比较证据、信任信号以及 AI 可读性。

AI 货架得分与 ACCC 有何不同?

ACCC 衡量的是站点对 AI 系统是否可访问、可抓取、结构化、可被引用。AI 货架得分衡量的是下游的商业结果:AI 购物助手能否利用这些上下文来推荐产品。

为什么从清洁美妆开始?

清洁美妆是一个很好的试点品类,因为购买决策取决于成分、肤质、宣称、排除项、评价、安全边界以及护肤流程契合度。这些因素能揭示 AI 系统是否能够进行超越基本产品可得性的推理。

它应该发展成一个公开排行榜吗?

应该,但只能在方法论稳定之后。排行榜应基于反复测试、一致的提示词、清晰的评分规则以及人工审核。否则它有沦为营销噱头、而非行业基准的风险。

来源与来源说明

OpenAI 帮助中心,《使用 ChatGPT Search 购物》:https://help.openai.com/en/articles/11128490-shopping-with-chatgpt-search

OpenAI Developers,《OpenAI 爬虫概览》:https://developers.openai.com/api/docs/bots

Shopify 帮助中心,《面向智能体店面的 Shopify Catalog 与产品发现》:https://help.shopify.com/en/manual/online-sales-channels/agentic-storefronts/products

Shopify 帮助中心,《被收录进 Shopify Catalog 的要求》:https://help.shopify.com/en/manual/promoting-marketing/seo/shopify-catalog/requirements

DeepLumen,《ACCC 评分体系》:/zh/blog/accc-scoring-system/

下载 PDF 版本

获取《AI 货架基准:衡量 AI 购物中的推荐就绪度》的 PDF 版本。在下方留下你的邮箱,下载链接将立即出现。

提交本表单即表示你同意 DeepLumen 就 AI 可见性与智能体商务相关事宜与你联系。

你的 PDF 已就绪。你现在就可以下载这份白皮书。

下载 PDF