执行摘要
电商分析是围绕真人会话搭建起来的。购物者点开一条广告、打开一条搜索结果、落到产品页、浏览、加入购物车,然后要么转化、要么离开。渠道标签并不完美,但通常对营销运营来说足够清晰可读。AI 购物打破了这份安稳。一家店铺可能在真人到访之前就被 AI 爬虫触及。一个产品页可能因为用户提了个问题而被 ChatGPT 检索,但用户也许从未点击。一条目录记录可能已对某个智能体渠道可用,而开放网络上的产品页却仍然无法把产品讲清楚。一波爬虫日志的激增看起来像是需求,实际上却只是基础设施活动。
本白皮书聚焦其中一个重要切片:电商团队应当如何解读 ChatGPT-User、OAI-SearchBot 与 GPTBot。这三个 user agent 常被笼统归为"AI 流量",但它们携带的商业含义并不相同。把它们当作一个桶来处理,会制造误报、孱弱的仪表盘和糟糕的决策。更好的做法,是把访问、索引、实时检索、可读性、推荐与商业结果分开来看。
OpenAI 的爬虫文档按用途区分了这些 user agent。OAI-SearchBot 用于搜索相关的呈现。GPTBot 与可能用于改进生成式 AI 基础模型的抓取相关联。ChatGPT-User 用于 ChatGPT 和 Custom GPTs 中的某些用户操作;它不用于自动网络抓取。这一区别并非次要的实现细节。它改变了增长、SEO、GEO、分析、商品运营与工程团队读取日志的方式。
对电商而言,商业层面的解读很简单。OAI-SearchBot 主要是一个 AI 搜索可见性与抓取访问信号。GPTBot 是一个模型抓取与治理信号。ChatGPT-User 则是最接近用户触发的实时检索的信号。它们当中没有任何一个,单凭自身就能证明一次推荐、一次引荐或一笔订单。价值来自于把这些信号与产品覆盖、语料单元效率、AI 可读性、结构化的产品上下文、回答收录以及下游营收连接起来。
DeepLumen 的立场是:爬虫分类是 AI 商务情报的起点,而非终点。日志显示某个 AI 系统到达了站点,却不会显示 AI 理解了什么。要把访问转化为推荐就绪度,电商品牌需要更干净的产品上下文、更少的嘈杂语料单元、自动的结构化标记,以及一个机器可读的层,让 AI 系统能以更低的歧义去检索和比较产品事实。
核心论点
本白皮书的核心论点是:AI 流量应当按商业含义来分类,而不是按新鲜感来分类。一个来自 AI 相关 user agent 的请求,并不自动等于一位新客户、一次推荐事件或一份需求证明。它只是一个证据:某个特定的 AI 系统,带着某个特定的目的,在某个特定的时刻触及了一个页面。电商团队必须追问,这次触及代表了什么。
旧的分析本能是建一个叫"AI 流量"的单一分组。这个分组在情绪上令人满足,因为它让一个新渠道变得可见。但它在分析上很孱弱。它把后台抓取、搜索抓取、用户触发的检索、自动化智能体动作、引荐会话,有时还有无关的爬虫流量混在一起。当这些信号被混合,得出的那个数字就太含糊,无法指导行动。
更好的模型把 AI 流量看作一个分层漏斗。最上面是访问:合适的 AI 系统能否到达重要页面?接着是检索:实时的 AI 工作流是否在查看产品、政策、评论、合集或购买指南?接着是可读性:AI 能否在不把过多上下文花在噪音上的前提下理解它检索到的内容?接着是推荐:针对相关提示词,AI 是否真的把产品纳入了回答?最后是商业:由 AI 中介的旅程是否带来了访问、辅助转化、结账事件或可归因的营收?
ChatGPT-User、OAI-SearchBot 与 GPTBot 处在这个分层漏斗的不同部位。它们不是竞争对手,也不能互相替代。它们是三个各不相同的信号,回答三个不同的问题。实操工作就是:把每个信号映射到它能回答的那个问题,并避免拿它去回答它无法回答的问题。
如果把所有 AI user agent 塞进一个桶里,你就丢失了这部分流量的商业含义。目标不是去数 AI 访问次数,而是去理解发生了哪一种 AI 交互,以及页面是否为这次交互做好了准备。
定义:三个 User Agent,三种含义
在搭建度量模型之前,电商团队需要一套共同的词汇。AI 可见性中的大多数报告问题,都起源于语言漂移。团队说"ChatGPT 流量",其实指的是一次引荐访问。他们说"AI 爬虫",其实指的是 GPTBot。他们说"ChatGPT 搜了我们",实际上看到的是 OAI-SearchBot。他们说"有客户用了 AI",而唯一的证据只是后台抓取。下面这些定义,是更清晰报告的基线。
| User agent | 主要含义 | 电商解读 | 它无法证明什么 |
|---|---|---|---|
| ChatGPT-User | ChatGPT 或 Custom GPTs 中用户触发的操作。 | 一个实时的 AI 工作流可能正在检索产品、政策、品类、评论或来源页面。 | 它不能证明产品被推荐、被点击或被购买。 |
| OAI-SearchBot | OpenAI 的搜索爬虫,用于在 ChatGPT 搜索功能中呈现网站。 | 该页面可能可被访问,用于 AI 搜索可见性与回答呈现。 | 它不能证明实时的买家意图或一次用户提示词。 |
| GPTBot | 与 OpenAI 模型改进及相关用途相关联的爬虫。 | 一个治理与后台抓取信号,应当与购物需求分开看待。 | 它不能证明产品发现、推荐或引荐需求。 |
这些定义之所以有用,是因为每个信号的下一步都不一样。OAI-SearchBot 应当引出关于抓取访问、页面覆盖、重要 URL 与搜索资格的问题。ChatGPT-User 应当引出关于实时检索、提示词上下文、回答收录、产品事实清晰度,以及被检索页面是否 AI 可读的问题。GPTBot 应当引出关于爬虫策略、训练相关治理、robots.txt 设置,以及团队是否把后台抓取量误当作需求来计数的问题。
OpenAI 还做了一个重要的策略区分:针对 OAI-SearchBot 与 GPTBot 的 robots.txt 设置是相互独立的。一个站点可以允许 OAI-SearchBot 以支持出现在搜索结果中,同时禁止 GPTBot 以表明内容不应被用于训练生成式 AI 基础模型。这种独立性让电商团队不必再把"允许 AI"还是"屏蔽 AI"当作单一决策来争论。AI 访问有好几种类型,每一种都值得有自己的策略。
为什么传统电商分析会失灵
传统电商分析假设用户与浏览器是紧密绑定的。一个人搜索、点击、落地、浏览、然后购买。由 AI 中介的购物把这些事件拆开了。一个人可以问 ChatGPT 一个问题,ChatGPT 检索一个产品页,回答把产品总结一遍,然后这个人不必点击就做出了决定。或者这个人稍后用另一台设备才点击。又或者助手从多个商家检索页面、加以比较,最终只把流量导向其中一家。
这改变了服务器日志的角色。在旧世界里,服务器日志主要服务于工程、安全与归因清理。在 AI 购物世界里,服务器日志成了机器中介需求的早期信号。但"早期"并不等于"完整"。一条日志能告诉你某个 user agent 到达了某个 URL,却无法告诉你用户完整的提示词、页面是否被用进了回答、回答是否有利,或者用户是否在别处完成了转化。
结果就是一道度量鸿沟。营销团队想知道 AI 是否在驱动营收。SEO 团队想知道 AI 能否抓取并引用内容。商品团队想知道哪些产品正在被考虑。法务团队想管控训练用途。工程团队想管理爬虫负载与验证。这些团队常常盯着同一份原始的 user-agent 数据,却各问各的问题。没有一个共同的模型,数据会很快变得嘈杂。
LinkedIn 上从业者的讨论正反映了这种混乱。人们通常并不从一套干净的分类法开始。他们问:为什么 AI 爬虫在打我的服务器?该不该屏蔽 GPTBot?日志里的 ChatGPT 访问是不是真人?Cloudflare 的爬虫管控是不是压制了有用流量?AI 引荐会话该怎么报告?在 2026 年 6 月 10 日围绕 GPTBot robots.txt、llms.txt GPTBot、OAI-SearchBot、ChatGPT-User user agent、AI crawler traffic ecommerce 等短语的一次 LinkedIn 扫描中,有用的信号并不是某条爆款帖,而是反复出现的运营者词汇:屏蔽、允许、标注、验证、报告、归因。这些不是随机的问题,而是同一个底层转变的症状:电商团队正眼看着机器智能体出现在买家旅程里,而他们的分析栈还不知道该怎么称呼它们。
正确的应对不是把仪表盘做得更戏剧化,而是把仪表盘做得更精确。AI 流量应当被拆成一组映射到业务问题的信号。抓取访问回答 AI 系统能否到达店铺。检索回答某个实时 AI 工作流是否在查看店铺。可读性回答被检索的页面是否可被理解。推荐回答产品是否被选中。商业回答由 AI 中介的路径是否产生了可度量的业务动作。
六层 AI 流量信号模型
DeepLumen 使用一个六层模型,避免 AI 流量沦为虚荣指标。这些层并不总是顺序发生,也不是每个 AI 系统都会暴露每一层。但这个模型给了电商团队一种清晰的方式,把"已知"与"推断"分开。
AI 系统能否到达重要页面、目录数据、agent discovery 文件、政策页与产品 URL?
AI 搜索系统能否在以回答为导向的搜索功能中抓取并呈现店铺?
用户触发的 AI 工作流是否在一次实时对话中检索了产品页或政策页?
AI 能否以低歧义、低语料单元成本理解被检索到的内容?
针对相关购物提示词,产品是否以恰当的措辞出现在 AI 回答中?
由 AI 中介的路径是否产生了引荐流量、辅助转化、结账事件或订单?
OAI-SearchBot 大多属于访问层与搜索抓取层。ChatGPT-User 大多属于实时检索层。GPTBot 属于治理与后台抓取层,它可能支撑广义的模型改进,但不应被当作实时购物意图。AI 引荐会话与订单则位于更下游。语料单元分析与结构化标记位于检索与推荐之间,因为它们决定了 AI 解读它所到达内容的效率有多高。
这个模型也帮助团队避免漏报。一个产品可能几乎没有可见的引荐流量,却仍被 ChatGPT-User 反复检索。这意味着即便真人点击尚未出现,该产品也可能已经进入了 AI 的决策工作流。反过来,一个站点可能收到大量 GPTBot 流量,却没有任何有意义的实时购物活动。两种模式都很重要,但它们意味着不同的行动。
OAI-SearchBot:搜索可见性,而非实时需求
OAI-SearchBot 是反映 OpenAI 搜索抓取访问最清晰的信号。OpenAI 把它描述为一个爬虫,用于在 ChatGPT 搜索功能的搜索结果中呈现网站。对电商团队而言,这让它与 AI 搜索可见性和开放网络的可发现性相关。如果 OAI-SearchBot 无法访问某个页面,那个页面就更不容易作为来源出现在搜索相关的 ChatGPT 回答里。
但 OAI-SearchBot 不应被读作购物者信号。它更接近索引,而非意图。如果它抓取了一个合集页,正确的解读不是"有客户问了这个品类",更稳妥的解读是"OpenAI 搜索系统也许能够到达这个品类"。这有用,但它只是旅程中的一层。
对电商报告而言,OAI-SearchBot 应当按页面类型和产品优先级来度量。哪些产品页被到达了?哪些合集被到达了?哪些购买指南被到达了?哪些政策页被到达了?是否有重要 SKU 缺失?canonical URL 是否干净?重要页面是否被屏蔽、隐藏、设了密码,或者埋在客户端渲染背后?这些问题把抓取访问与商业覆盖连接了起来。
下一个问题是:被抓取的页面在被访问之后是否有用。一个可被抓取的产品页,如果含有含糊的文案、单薄的属性、重复的 App 小部件、嘈杂的脚本、脱节的评论或缺失的政策上下文,仍然可能在 AI 推荐上很弱。OAI-SearchBot 说明门可以被打开,却不能说明房间是否被收拾整齐。
ChatGPT-User:最接近实时检索的信号
ChatGPT-User 在商业上很有意思,因为它可能在 ChatGPT 或某个 Custom GPT 中的用户操作引发一次页面访问时出现。换句话说,它可能更接近一个人向 AI 助手求助的那一刻。对电商来说,这可能意味着比较产品、确认产品是否满足某个约束、核实配送细节、阅读退货政策,或为一次推荐收集证据。
这个信号值得特殊对待,不应被埋进通用的爬虫流量里。一次 ChatGPT-User 对产品页的访问,不同于一次爬虫的全面扫描。它可能表明某个实时 AI 工作流需要那个页面。页面可能被用上、被忽略、被总结、被引用、被比较或被丢弃。日志无法告诉你是哪一种,但它告诉你这个页面进入了一条实时检索路径,而这很有价值。
ChatGPT-User 活动之后的运营问题,不是简单的"我们拿到了多少次访问?",而是"ChatGPT 很可能从这个页面需要哪些产品事实,这些事实是否容易被提取?"如果被检索的是产品页,相关事实可能包括价格、库存、规格变体、材质、尺寸、兼容性、使用场景、评论、退货政策、配送时效、保修与认证。如果被检索的是政策页,相关事实可能是退货窗口、例外条款、国际配送、保修索赔或支付方式。
ChatGPT-User 也应当与提示词测试连接起来。如果一个产品页反复被 ChatGPT-User 检索,就去测试可能导向它的那些提示词。产品是否出现在回答里?措辞是否准确?助手是否提到了正确的属性?它引用的是店铺、经销商、评论页还是竞品?它是否幻觉出了过时的价格或库存?这正是检索转化为推荐质量工作的地方。
GPTBot:治理信号,而非购物意图
GPTBot 经常出现在 AI 爬虫仪表盘里,因为它在日志中很容易被发现。但过度解读它是危险的。OpenAI 把 GPTBot 描述为一个用于让生成式 AI 基础模型更有用、更安全的爬虫,并称它用于抓取可能被用于训练这些模型的内容。这把 GPTBot 归入了一个与 ChatGPT-User 和 OAI-SearchBot 不同的类别。
就电商需求分析而言,GPTBot 不是一个实时购物意图信号。GPTBot 流量的激增并不意味着购物者在问你的产品,不意味着你的产品被推荐了,也不意味着助手为响应某个买家提示词而查过价格。它意味着一个后台爬虫可能正为另一种用途访问内容。
这并不让 GPTBot 变得无关紧要。它对爬虫治理、数据策略、法务审查、服务器负载与训练用途偏好都很重要。一个品牌可以决定允许 GPTBot、屏蔽 GPTBot,或按页面类型对 GPTBot 做不同的监控。但这个决策属于治理层,而不属于 AI 营收仪表盘。
最常见的错误,是把 GPTBot 的量与 ChatGPT-User 的访问加在一起,把总数叫作"AI 需求"。这会产生一个好看的数字和一个孱弱的洞察。增长团队可能在庆祝一波与真实买家几乎无关的流量激增。工程团队可能在不理解业务含义的情况下屏蔽了某个 user agent。法务团队可能定下一条宽泛的策略,意外压制了有用的搜索可见性。把 GPTBot 分开,能避免这些误读。
Robots.txt、网络管控与治理
Robots.txt 重新变得重要,因为 AI 系统让自动化访问在商业上再次变得可见。但 robots.txt 并不是一套完整的 AI 可见性策略。它是一个建议性的访问层。它帮助行为良好的爬虫理解站点所有者的意愿,却不能保证每个系统都以同样方式行事,也无法解决访问之后的产品可读性。
OpenAI 的爬虫文档尤其相关,因为它把 OAI-SearchBot 与 GPTBot 分开了。商家可以允许 OAI-SearchBot 用于搜索呈现,同时禁止 GPTBot 用于训练相关用途。这种独立性很重要。它让团队既能保住搜索可见性,又不必把所有 AI 访问当作同一个策略问题来处理。
Shopify 又加了一层。Shopify Catalog 可以让合资格的产品被 AI 渠道发现,而 AI 爬虫也可能通过开放网络直接访问店铺。Shopify 文档指出,在 robots.txt 或网络层屏蔽 AI 爬虫,只影响开放网络的可发现性,并不会阻止产品数据通过已激活的 Shopify Catalog 渠道被发送出去。这个区别很重要,因为团队可能会想当然地以为爬虫策略管控了全部 AI 曝光,而它其实只管控了发现系统的一部分。
网络管控同样需要谨慎处理。CDN 规则、爬虫过滤器、WAF 策略、代理配置与速率限制,都可能在 robots.txt 被考虑之前就屏蔽掉有用的 AI 访问。一种黑色幽默式的失败模式是:一家店铺部署了激进的爬虫防护来阻止抓取,结果恰好屏蔽了潜在客户正用来评估购买的那个 AI 助手。解决办法不是把一切都打开,而是基于 user-agent 的用途与页面敏感度去分类、验证、监控并做决策。
Shopify 语境:Catalog、Agent Discovery 与开放网络抓取
Shopify 商家如今需要在多个 AI 发现层上思考。Shopify Catalog 是面向智能体渠道的一条产品数据通道。诸如 agents.md、llms.txt 与 llms-full.txt 这样的 agent discovery 文件,为 AI 系统提供了一种途径,去理解店铺上下文、政策、站点地图与发现端点。开放网络抓取依然重要,因为 AI 系统能像传统搜索引擎那样找到页面。这些层彼此互补,但并不互相替代。
Shopify 表示,通过 Shopify Catalog 同步到 AI 渠道的产品,会带着标题、描述、选项、图片、价格、库存等关键属性一并列出,并以 AI 智能体能够解析和理解的方式加以结构化。这是一个有力的基线。Shopify 还指出,该目录是面向智能体渠道的权威产品数据源,而 agent discovery 文件与 Shopify Catalog 是分开的。
其战略含义是:Shopify 的 AI 可见性并不是一个单一开关。一个产品可以有 Shopify Catalog 资格、能通过开放网络抓取被发现、在 agent discovery 文件中有所体现,但如果产品上下文很弱,仍然可能在 AI 推荐中表现不佳。反过来,一个产品页可能拿到了 OAI-SearchBot 的访问,却缺少为某个具体买家提示词被选中所需的结构化属性与证据。
对 Shopify 团队而言,报告模型至少应包含五个相互独立的层:Catalog 资格、agent discovery 可用性、开放网络爬虫访问、用户触发的检索,以及推荐就绪度。DeepLumen 的角色尤其落在最后两层:削减嘈杂的语料单元、提升 AI 可读性,并用自动结构化标记来组织产品事实,让智能体能更有把握地检索和比较产品。
为什么爬虫可访问不等于 AI 可读
日志文件能确认访问,却不能确认理解。这个区别正是 AI 可读电商的核心。当一个 AI 系统检索一个产品页时,它仍然要解析页面、过滤噪音、识别产品事实、消解歧义、把事实与用户约束加以比较,并判断证据是否足够有力到能写进回答里。
传统产品页往往是为人类说服而设计的,而非为机器解读而设计。它们可能用到标签页、折叠面板、App 小部件、由 JavaScript 渲染的评论、基于图片的对比图表、装饰性文案、隐藏的规格数据、重复的元数据以及不完整的 schema。人类购物者可以靠视觉浏览页面,而一个 AI 智能体可能要处理成千上万个低信号 token,才能找到寥寥几条商业事实。
DeepLumen 把这描述为一个语料单元问题。一个语料单元,是 AI 系统在试图理解一个页面时所处理的一段离散内容——一段文本、元数据、标记、表格数据、评论片段、产品事实、政策声明或被检索的上下文。嘈杂的语料单元过多,会抬高阅读成本和歧义。产品也许在技术上可见,却理解起来代价高昂。
当页面以紧凑、结构化、一致的方式暴露产品身份、属性、证据、政策、使用场景、约束与购买上下文时,AI 可读性就会提升。自动结构化标记之所以有帮助,是因为它给了 AI 系统一份更清晰的产品表示。语料单元削减之所以有帮助,是因为它移除了低信号材料,让重要事实更容易被检索。两者结合,能把爬虫访问变成一个更强的推荐输入。
度量架构
一个有用的 AI 流量仪表盘不应以一个 AI 流量总数开头,而应以一组问题开头。AI 系统能否到达站点?哪些系统到达了哪些页面?哪些访问是搜索抓取、后台抓取、实时检索还是引荐?哪些产品品类被触及得最频繁?哪些重要产品缺失了?哪些被检索到的产品出现在提示词测试里?哪些 AI 回答带来了会话、购物车或订单?围绕 AI 爬虫的社交词汇在这里很有用,因为它展现了运营者已经在问的原始问题;仪表盘应当把这些杂乱的短语翻译成干净的字段,而不是把它们压平成一个虚荣指标。
| 层 | 主要信号 | 回答的问题 | 业务责任方 |
|---|---|---|---|
| 访问 | OAI-SearchBot 覆盖、robots 状态、允许的 IP | AI 搜索系统能否到达优先页面? | SEO / 工程 |
| 实时检索 | 按 URL 与页面类型划分的 ChatGPT-User | 实时 AI 工作流是否在查看店铺? | GEO / 分析 |
| 治理 | GPTBot 与爬虫策略 | 哪些自动化访问被允许或被屏蔽? | 法务 / 工程 |
| 可读性 | 语料单元数量、结构化标记、属性完整度 | 检索之后 AI 能否理解产品? | 商品运营 / SEO |
| 推荐 | 提示词测试、回答收录、引用质量 | 针对相关买家意图产品是否出现? | 增长 / 内容 |
| 商业 | AI 引荐、辅助营收、结账事件 | AI 可见性是否产生了业务动作? | 营收 / 分析 |
仪表盘还应包含按页面类型的细分。ChatGPT-User 访问退货政策,与 ChatGPT-User 访问一款畅销产品,含义并不相同。OAI-SearchBot 抓取首页,不如它对优先产品 URL 的覆盖那么有用。GPTBot 抓取旧博客文章,不应与 OAI-SearchBot 到达新品类页等同解读。
产品优先级同样重要。一个长尾博客页的 AI 可见性是有用的,但电商价值来自把可见性与可售产品连接起来。仪表盘应当显示:哪些优先 SKU 是可被到达、被检索、可读、被推荐且在商业上活跃的。这就在技术性的 AI 访问与营收运营之间架起了一座桥。
AI 流量情报成熟度模型
大多数电商团队不会从零 AI 可见性报告一步跨到完美归因。务实的路径是一个成熟度模型。每一个阶段都增添精度,而不假装由 AI 中介的购买行为已经像传统付费搜索归因那样运作。这个成熟度模型的用途,是帮助团队明白自己已经准备好主张哪一种真相。
第一阶段是原始观察。团队在服务器日志里注意到 GPTBot、OAI-SearchBot、ChatGPT-User、PerplexityBot、ClaudeBot、Google-Extended 或其他 AI 相关的 user agent。在这个阶段,唯一可靠的主张就是:自动化或 AI 中介的访问正在发生。现在去主张需求、推荐或营收还太早。正确的行动是把这些信号分类,并保留足够的日志细节供日后分析。
第二阶段是分类。User agent 按用途、页面类型、状态码、请求方法、canonical URL、国家、设备类别、响应时间,以及请求是否到达了有用内容来区分。在这个阶段,团队不再谈论一团"AI 流量",而开始分别报告 OAI-SearchBot 覆盖、ChatGPT-User 检索、GPTBot 治理与 AI 引荐会话。
第三阶段是覆盖分析。团队把 AI 访问与店铺的商业地图加以对照。哪些产品最重要?哪些品类带来利润?哪些政策页影响转化?哪些购买指南支撑品类权威?哪些畅销品的 AI 访问为零?哪些低优先级页面占走了大部分爬虫量?覆盖分析把日志转化为商品运营问题。
第四阶段是可读性分析。一旦团队知道 AI 系统能到达哪些页面,就要追问这些页面对 AI 来说处理起来是否高效。在这个阶段,语料单元数量、结构化标记、属性完整度、实体清晰度与证据映射都很重要。一个人类设计出色的页面,如果重要事实被埋在截图、标签页、由 JavaScript 渲染的小部件或含糊的营销话语里,在这个阶段仍然可能很弱。
第五阶段是推荐验证。团队测试匹配真实买家意图的提示词,并把 AI 回答与日志加以对照。如果 ChatGPT-User 检索了一个产品,但产品很少出现在回答里,问题可能出在推荐就绪度上。如果 OAI-SearchBot 抓取了一个页面,但回答引擎引用的是竞品页面,问题可能出在权威、结构化上下文或品类证据上。如果产品出现了,但回答对它的描述很糟糕,问题可能出在缺失或含糊的产品事实上。
第六阶段是商业归因。这并不意味着每一个 AI 回答都变得可以完美归因。它意味着团队把 AI 引荐会话、辅助转化、优惠券使用、直接流量的抬升、产品页检索模式与结账事件,连接进一个审慎的营收模型。在这个阶段,公司可以开始把 AI 可见性当作一个可度量的商业渠道来对待,而不必假装每一次机器交互都等于一笔销售。
| 阶段 | 主要问题 | 可接受的主张 | 跳过的风险 |
|---|---|---|---|
| 观察 | AI 系统是否在触及站点? | 存在 AI 相关的访问。 | 忽视早期的机器中介需求信号。 |
| 分类 | 哪个 AI 系统触及了哪个页面? | 信号可以按用途加以区分。 | 用爬虫噪音夸大需求。 |
| 覆盖 | 优先产品与页面是否被到达? | AI 系统能或不能到达商业资产。 | 优化了不影响营收的页面。 |
| 可读性 | AI 能否理解被到达的页面? | 产品含义清晰,或解析起来代价高昂。 | 把抓取访问与可用的产品上下文混为一谈。 |
| 验证 | 产品是否出现在 AI 回答里? | 提示词收录与回答质量可被测试。 | 误以为检索就等于推荐。 |
| 归因 | AI 可见性是否影响商业? | AI 活动可与营收指标连接起来。 | 过度承诺或低报业务影响。 |
页面类型解读:不是每个 URL 含义都相同
AI 流量的解读在很大程度上取决于页面类型。一次 ChatGPT-User 对配送政策页的访问,可能表明某个实时用户或 GPT 工作流需要核实购买条件。一次 ChatGPT-User 对产品页的访问,可能表明正在进行产品评估。一次 OAI-SearchBot 对博客文章的抓取,可能支撑品类教育。一次 GPTBot 对数百篇旧文章的抓取,更多说明的是后台抓取,而非当下需求。
产品页在商业上最直接。当 AI 系统检索产品页时,团队应当检查关键事实是否明确:产品名称、品牌、价格、库存、规格变体、材质、规格参数、兼容性、尺寸、保修、评论、使用场景、局限与购买条件。产品页通常是语料单元削减商业回报最清晰的地方,因为每一处歧义都可能影响推荐置信度。
合集页扮演不同的角色。它们帮助 AI 系统理解品类结构、产品分组、内部相关性以及商家的库存广度。合集页往往是宽泛购物者意图与具体产品选择之间的桥梁。如果 OAI-SearchBot 到达了合集页却没到达单个产品,那么店铺可能拥有品类级可见性,却缺少足够的 SKU 级覆盖。如果 ChatGPT-User 到达了某个合集页,那可能意味着助手在选定产品之前正在探索一个品类。
政策页在智能体商务中的重要性,比许多品牌预期的更高。AI 助手不只需要产品描述,它们还需要知道:产品能否配送给用户、出问题时能否退货、是否在保修范围内、能否安全支付,以及能否在所需时间内送达。一个产品可能因为助手无法核实售后条件而失去一次推荐。ChatGPT-User 对退货、保修、配送、隐私或支付页面的访问,应当被当作购买评估的一部分,而不是随机的支持页流量。
评论页与口碑版块提供证据。如果评论内容由 JavaScript 小部件渲染,或被藏在 App 容器背后,AI 系统可能难以使用它。一个页面可以声称"最适合电子维修",但如果评论证据既不可访问也未被结构化,模型可能会偏好一个证据更清晰的竞品。对 AI 推荐而言,证据不是装饰,而是推理基质的一部分。
博客文章、术语条目与白皮书帮助模型理解品类语言与品牌权威。它们并不总是直接的转化页,但能支撑回答收录。一个定义 OAI-SearchBot 的术语页也许不能一键卖出一个 Shopify App,但当 AI 系统回答关于 AI 流量分类的问题时,它能让 DeepLumen 更有可能成为来源。这正是内容集群对 GEO 重要的原因:它们围绕新兴术语建立起密集、内部互链的语义覆盖。
| 页面类型 | AI 流量含义 | 就绪度问题 |
|---|---|---|
| 产品页 | 潜在的产品评估。 | 事实、规格变体、证据与约束是否明确? |
| 合集页 | 品类探索与库存映射。 | 页面是否解释了品类结构与产品差异? |
| 政策页 | 购买条件核实。 | AI 能否提取配送、退货、保修与支付规则? |
| 评论内容 | 信任与证明评估。 | 评论是否可访问、可溯源,并与产品主张相连? |
| 博客或白皮书 | 主题权威与实体理解。 | 内容是否定义了市场语言并链接到商业页面? |
| 术语页 | 定义归属与 AI 引用支撑。 | 该术语是否干净地映射到相关实体、FAQ 与产品相关性? |
AI 可读电商背后的数据要求
一旦团队把这些 user agent 分开,下一个问题就是:AI 系统到达页面之后需要哪些数据。很多电商站点正是在这里发现,自己内容很多,机器可读的含义却不够。产品数据散落在后台、主题、产品描述、图片库、评论 App、FAQ 折叠面板、配送政策与 schema 标记里,但这些碎片并不总是彼此一致或彼此连接。
AI 可读电商需要稳定的产品身份。模型需要知道这是什么产品、归属哪个品牌、属于哪个品类、有哪些规格变体可选,以及哪个 URL 是权威的。重复的产品页、不一致的标题、含糊的变体命名以及单薄的 canonical 结构都会制造不确定性。人类常常能绕过这些问题,而 AI 系统可能会选一个更干净的竞品,因为不确定性抬高了推荐的成本。
它还需要属性的完整度。一个产品标题也许写着"电磨工具套装",但购物者可能会问电池电压、随附配件、适配材料、重量、噪音水平、安全特性、保修时长,或它是否适合新手。如果这些属性缺失,AI 就无法有把握地把产品匹配到提示词上。如果它们只存在于一张图片里,AI 可能会错过它们。如果它们以散文形式存在却未被结构化,AI 提取出来的结果可能前后不一致。
证据与属性同等重要。AI 系统越来越被期望为推荐给出理由。一个产品不应只声称自己耐用、紧凑、低敏、适合新手或专业级,它还应提供证据:评论、规格参数、认证、第三方提及、保修条款、对比数据与清晰的政策支撑。证据降低了推荐风险。
上下文契合度是另一项要求。一个产品可能客观上很好,却与某个特定买家无关。页面应当帮助 AI 系统理解:这个产品是为谁准备的、不适合谁、支持哪些使用场景、满足哪些约束,以及它相对于替代品处于什么位置。对许多电商品类而言,这就是"被收录进目录"与"在推荐中被选中"之间的区别。
最后,可行动性也很重要。AI 系统需要知道接下来会发生什么。产品有库存吗?能配送到用户所在市场吗?价格是当前的吗?有套装选项吗?能结账吗?退货容易吗?围绕电池、跨境配送、订阅、个性化定制或受监管品类是否有约束?当下一步不明确时,推荐置信度就会下降。
品牌、产品名称、canonical URL、品类、变体结构与权威来源。
材质、尺寸、兼容性、特性、规格参数、选项、价格与库存。
评论、认证、保修、第三方引用、证明要点与政策支撑。
使用场景、买家画像、约束、例外、品类契合与比较逻辑。
库存、配送、退货、结账路径、支付方式、套装与服务覆盖。
低噪音语料单元、结构化标记、语义化 HTML 与简洁的机器可读事实。
品类示例:同一个 User Agent 如何改变含义
ChatGPT-User、OAI-SearchBot 与 GPTBot 的商业含义也取决于品类。由 AI 中介的购物不是单一行为。一位美妆购物者可能会问成分与肤质。一位五金购物者可能会问兼容性与扭矩。一位家具购物者可能会问尺寸与配送。一位保健品购物者可能会问认证与安全。User agent 是同一个,但推荐所需的产品事实各不相同。
在家居生活品类,AI 系统往往需要尺寸、材质、空间适配、组装要求、清洁说明、配送细节与退货约束。一次 ChatGPT-User 对沙发产品页的访问,可能表明助手正在核实产品是否符合用户的空间、预算或风格偏好。如果页面缺少结构化的尺寸、配送时效、面料材质与退货条款,检索就可能无法变成推荐。
在工具与电子品类,兼容性成为核心。一套精密螺丝刀套装需要批头类型、磁性特性、支持的设备类别、收纳盒质量、材质、保修与随附配件。一台电磨工具需要电压、转速范围、附件、是否含电池、安全特性与适用材料。这个品类的 ChatGPT-User 检索之后,应当围绕任务而非仅仅产品名称去做提示词测试。
在美妆与个护品类,关键事实是成分、肤质、认证、过敏原、使用说明、合规声明、评论证据与禁忌。如果页面做出宽泛主张却没有具体的成分或适用性数据,AI 助手可能会回避推荐该产品。OAI-SearchBot 覆盖是有用的,但推荐就绪度取决于敏感事实是否明确且可信。
在时尚与服饰品类,AI 需要尺码、版型、面料、洗护说明、模特尺寸、退货政策、颜色还原度、场合、季节性与库存。一个对人类来说很美的产品页,如果版型指引藏在图片里,或者变体含糊不清,对 AI 来说可能很弱。ChatGPT-User 的检索可能表明助手正试图回答一个关于版型或场合的问题,而不是单纯在浏览。
在 B2B 或技术类产品上,AI 系统需要文档、集成要求、合规声明、定价模型、支持条款与实施约束。用户可能让助手根据技术栈兼容性或采购需求列出候选工具。没有结构化技术上下文的爬虫访问是不够的。
这些示例说明了为什么没有一份通用的"AI 流量优化"清单。共同的一层是分类与可读性。品类的一层,是 AI 系统安全地推荐该产品所需的具体证据与属性。DeepLumen 的语料单元方法之所以有用,是因为它从底层的表示问题入手,再去适配各品类特定的产品含义。
提示词、日志与页面三角校验
最强的 AI 可见性工作流会对三种来源做三角校验:日志、提示词与页面。日志显示 AI 系统到达了什么。提示词显示 AI 系统回答了什么。页面显示 AI 当时能拿到怎样的产品上下文。三者单独都不够,合起来才构成一个务实的运营闭环。
从日志开始。识别哪些 user agent 到达了哪些页面。按 ChatGPT-User、OAI-SearchBot、GPTBot 与其他 AI 系统加以细分。把这些访问映射到产品品类、页面类型与商业优先级。这就构成了一份店铺的机器访问视图,它回答的问题是:AI 系统实际去了哪里?
然后测试提示词。对任何有显著 ChatGPT-User 或 OAI-SearchBot 活动的产品或品类,构造匹配真实买家意图的提示词。使用富含约束的提示词、比较型提示词、政策敏感型提示词与替代型提示词。不要只测品牌名。AI 购物往往在用户还不知道该选哪个品牌之前就开始了。测"适合小型工作间的最佳模块化工具收纳",而不只是"HOTO SNAPBLOQ"。测"200 美元以内的 queen 尺寸有机棉床垫保护垫",而不只是产品名。
接着检查页面。如果产品出现在回答里,核对回答是否准确。如果产品没有出现,检查页面是否提供了缺失的事实。如果回答引用了竞品,去比较竞品的结构化上下文。如果回答提到了一个错误细节,去查找歧义或过时数据。如果助手检索了页面却没有推荐产品,问题可能出在证据、属性完整度、品类契合或信任上。
这种三角校验避免了两个常见错误。第一个是只看日志、不核对回答就过度反应。第二个是做提示词测试,却不了解 AI 系统是否真的能访问页面。日志与提示词必须连接起来,而页面分析解释了二者之间的落差。
随着时间推移,这个工作流会产出一份 AI 可见性待办清单。有些是访问任务,比如修复被屏蔽的 URL 或缺失的产品覆盖。有些是可读性任务,比如削减嘈杂的语料单元或添加结构化标记。有些是内容任务,比如创建品类指南或术语定义。有些是商品运营任务,比如厘清产品使用场景与比较逻辑。这个模型的价值在于:每一项任务都系于一个信号,而不是系于一种"会不会对 AI 不可见"的模糊恐惧。
报告节奏与运营节律
AI 流量情报应当成为一种周期性的运营节律,而非一次性的审计。这些信号对季度评审来说太过动态,对团队逐一响应每一波日志激增来说又太过嘈杂。合适的节奏取决于店铺规模、产品更新速度,以及日志中已经出现的 AI 中介流量有多少。社交监听应当作为一个预警层嵌进这个节律里:当运营者开始在公开场合反复问相同的爬虫、robots、llms.txt 或引荐归因问题时,这些短语往往会变成下一批搜索查询和下一批支持工单。
对大多数处于增长期的电商团队,每周的节律行之有效。每周回顾:优先产品与品类的 OAI-SearchBot 覆盖、按页面类型划分的 ChatGPT-User 检索、用于治理感知的 GPTBot 量、AI 引荐会话,以及最具商业重要性品类的提示词测试结果。目的不是产出一份大报告,而是尽早发现变化,并决定哪些页面值得关注。
每月的节律应当把 AI 可见性信号与内容及商品运营决策连接起来。如果某个品类获得了 AI 爬虫访问却没有提示词收录,团队可能需要更强的品类内容、更好的产品对比或更清晰的结构化标记。如果某个产品反复被 ChatGPT-User 检索,团队就应当审计该页面的语料单元、产品事实、评论、政策上下文与提示词表现。如果 GPTBot 是唯一上升的信号,团队就应把它留在治理报告里,而非放进需求预测中。
每季度的节律应当评估 AI 可见性是否正在成为一个可度量的销售渠道。这并不要求完美归因,而要求对领先与滞后指标有一份有纪律的视图:AI 爬虫覆盖、实时检索、回答收录、AI 引荐会话、辅助营收,以及围绕被 AI 发现的产品所产生的直接或品牌需求变化。目标是搞清楚品牌是否正从"可被访问"走向"可被推荐"。
这套运营节律也给了 SEO、GEO、工程、法务与营收团队一套共同语言。SEO 可以负责可抓取性与内容覆盖。GEO 可以负责提示词测试与回答收录。工程可以负责爬虫验证、网络管控与结构化数据部署。商品运营可以负责产品事实与对比证据。营收团队可以负责转化与归因。没有这个节律,AI 流量只是一个好奇心;有了它,AI 流量就成了一套管理系统。
从检索到推荐就绪度
推荐就绪度始于访问之后。它追问的是:产品能否被选中以满足某个特定的买家意图。这是一个比可抓取性更高的标准。它需要产品身份、属性清晰度、使用场景映射、证据、约束、政策上下文、比较逻辑与可行动性。一个页面可以被抓取、被检索,却仍然在推荐的那一刻败下阵来。
设想一位购物者要找"一套紧凑的精密螺丝刀套装,用于电子维修,80 美元以内,带磁性批头和耐用收纳盒"。AI 系统需要知道:哪个产品是螺丝刀套装、它是否紧凑、是否为电子维修设计、价格是否合适、批头是否磁性、收纳盒是否耐用、评论是否支撑这些主张,以及配送与退货是否可接受。如果这些事实散落在图片、标签页、含糊的文案与 App 小部件里,产品可能会输给一个结构化上下文更干净的竞品。
这正是 DeepLumen 把 AI 流量信号与语料单元削减、自动结构化标记连接起来的原因。重点不只是吸引爬虫,而是让产品在 AI 到达之后更容易被理解。当页面紧凑、结构化且证据充足时,ChatGPT-User 的检索就更具商业意义,因为 AI 能以更低的歧义提取出正确的事实。
推荐就绪度应当用提示词来测试,而不是从日志中臆断。如果 ChatGPT-User 检索了一个产品,就围绕该产品与品类跑买家意图提示词。检查产品是否出现、回答是否准确、产品是否被公平比较、助手是否引用了正确来源,以及回答是否反映了当前的库存与政策上下文。日志显示机会,提示词测试显示选择质量。
按信号模式划分的运营手册
当分类能改变行动时,它才变得有用。下表把常见的信号模式映射到下一层分析。它避免把每一个 AI 爬虫事件都当作危机或胜利。
| 信号模式 | 可能含义 | 建议的下一步分析 |
|---|---|---|
| OAI-SearchBot 抓取了许多品类页,却漏掉了优先产品。 | AI 搜索访问存在,但产品覆盖可能很弱。 | 检查内部链接、canonical URL、产品 URL 可发现性、robots 规则与结构化标记。 |
| ChatGPT-User 反复访问某个特定产品页。 | 实时 AI 工作流可能正在查看那个产品。 | 跑买家意图提示词测试,检查回答收录,并审计产品事实清晰度。 |
| GPTBot 量上升,但 ChatGPT-User 缺席。 | 后台抓取增加,但没有清晰的实时购物检索。 | 分开报告,避免把这波激增当作需求。 |
| OAI-SearchBot 与 ChatGPT-User 都到达了同一品类。 | 该品类可能同时进入了 AI 搜索与实时检索工作流。 | 优先做语料单元削减、属性清理、证据映射与对比内容。 |
| ChatGPT-User 检索之后出现了 AI 引荐会话。 | 旅程可能正从检索走向真人点击进入。 | 分析落地页行为、转化率、产品契合与回答措辞。 |
| AI 爬虫被 CDN 规则屏蔽。 | 网络管控可能在 robots.txt 生效之前就压制了有用的 AI 访问。 | 验证 user agent 与 IP 段,再把搜索、训练与用户触发的访问策略分开。 |
常见误区
- 把所有 AI user agent 当成一个渠道来计数。这抹去了搜索抓取、后台抓取与用户实时触发检索之间的区别。
- 把 OAI-SearchBot 称作需求。OAI-SearchBot 对搜索可见性很有价值,但它不能证明有购物者问起了这个产品。
- 把 GPTBot 称作营收信号。GPTBot 属于爬虫治理与策略报告,而非直接的购物意图归因。
- 忽视页面类型。对政策页、产品页、合集页、博客文章与术语条目的访问,应当有不同的解读。
- 止步于访问。一个可被到达的页面,仍然可能因太嘈杂或太含糊,而让 AI 系统无法有把握地推荐。
- 忘记 Shopify 的多个层。Shopify Catalog、agent discovery 文件、robots.txt、开放网络抓取与产品页可读性,回答的都是不同的问题。
- 跳过提示词验证。服务器日志显示检索机会;提示词测试显示这个机会是否变成了回答收录。
DeepLumen 的观点
DeepLumen 把 AI user-agent 日志当作可见性情报的第一层。它们显示访问、覆盖、检索与治理信号。但更深层的问题,不只是哪个爬虫来过。更深层的问题是:AI 系统到达之后能理解什么。
这正是 DeepLumen 产品论点的要害所在。许多电商站点之所以不可见,并不是因为它们缺少产品,而是因为它们的产品含义对 AI 系统来说处理起来代价高昂。产品身份、属性、使用场景、证据、政策与购买上下文往往都在,却散落在以人为先的版式、App 碎片、脚本与营销文案之中。
DeepLumen 帮助削减嘈杂的语料单元、提升 AI 可读性,并施加自动结构化标记。目标是让产品更容易被 AI 系统检索、比较、信任与推荐。这把 ChatGPT-User 检索从一个好奇心变成一个务实的优化信号;把 OAI-SearchBot 覆盖从一个抓取指标变成 AI 搜索就绪度的一个输入;并把 GPTBot 留在正确的治理车道里,而不是让它去夸大需求报告。
在这种视角下,AI 可见性不是一个仪表盘分数,而是一套面向机器中介商务的操作系统。日志显示谁来过页面。语料分析显示页面有多难读。结构化标记显示产品事实是否明确。提示词测试显示产品是否被选中。营收数据显示由 AI 中介的路径是否创造了业务价值。
术语表
AI 流量情报对电商团队来说仍是一种新兴的运营语言。这些术语界定了本白皮书所处的语义场。
ChatGPT-User
一个 user agent,与 ChatGPT 和 Custom GPTs 中某些用户触发的操作相关联。
对电商团队而言,它通常比后台抓取更接近实时检索,但它本身不能证明推荐。
OAI-SearchBot
OpenAI 的搜索爬虫,用于在 ChatGPT 搜索功能中呈现网站。
它主要是一个 AI 搜索可见性与抓取访问信号,而非直接的购物意图信号。
GPTBot
一个爬虫,与抓取可能用于改进生成式 AI 基础模型的内容相关联。
就电商分析而言,它应当与实时检索、引荐与推荐报告分开。
AI 流量日志
服务器端记录,显示哪些 AI 相关的 user agent 在什么时间到达了哪些 URL。
日志显示访问与检索机会;它们不显示 AI 回答里包含了什么,也不显示购物者是否转化。
语料单元
AI 系统处理的一个离散单元——内容、元数据、标记、表格数据、评论文本、产品事实或被检索的上下文。
削减嘈杂的语料单元能降低阅读成本,帮助 AI 系统以更低的歧义抵达产品含义。
AI 可读电商
经过组织的电商内容,让 AI 系统能可靠地提取产品事实、政策、证据、使用场景与购买约束。
一家店铺可以为人类设计得很美,对 AI 系统来说却仍然解析起来代价高昂或含糊不清。
推荐就绪度
这样一种状态:AI 系统能够检索、理解、比较、信任并选择一个产品,以满足某个相关的购物者意图。
这正是区分"对 AI 可被访问"与"被 AI 选中"的那一层。
Agentic Page
一个 AI 可读的语义层,置于面向人类的店面旁侧,向 AI 智能体暴露结构化的商业上下文。
对 DeepLumen 而言,Agentic Page 把 AI 流量信号与语料单元削减、自动结构化标记连接起来。
常见问题
ChatGPT-User 和 ChatGPT 引荐流量是一回事吗?
不是。ChatGPT-User 是 ChatGPT 检索页面时可能出现的 user agent。引荐流量则是从 AI 界面到达的真人会话。一次检索完全可能发生,却没有任何引荐点击。
电商团队应该屏蔽 GPTBot 吗?
这是一个治理决策,而非增长捷径。GPTBot 应当与 OAI-SearchBot、ChatGPT-User 分开评估,因为它的目的不同,商业含义也不同。
允许 OAI-SearchBot 就能保证获得 AI 推荐吗?
不能。允许 OAI-SearchBot 有助于搜索相关的可见性,但推荐就绪度取决于 AI 可读的产品上下文、证据、结构化标记以及与提示词的契合度。
Shopify 团队应该如何理解这件事?
Shopify 团队应当把 Shopify Catalog 资格、agent discovery 文件、开放网络抓取、ChatGPT-User 检索、AI 可读性、回答收录以及营收归因分开看待。每一层回答的是不同的问题。
DeepLumen 的定位在哪里?
DeepLumen 处在访问与推荐之间。它帮助电商团队削减嘈杂的语料单元、提升 AI 可读性,并通过自动结构化标记把产品上下文暴露出来。
参考来源与延伸阅读
OpenAI Developers,OpenAI 爬虫概览:https://developers.openai.com/api/docs/bots
IETF RFC 9309,机器人排除协议(Robots Exclusion Protocol):https://datatracker.ietf.org/doc/html/rfc9309
Shopify 帮助中心,面向智能体店面的 Shopify Catalog 与产品发现:https://help.shopify.com/en/manual/online-sales-channels/agentic-storefronts/products
Shopify 帮助中心,被收录进 Shopify Catalog 的要求:https://help.shopify.com/en/manual/promoting-marketing/seo/shopify-catalog/requirements
Business Insider,围绕 OAI-SearchBot 的发布方屏蔽模式:https://www.businessinsider.com/several-top-news-sites-shun-openai-searchgpt-search-engine-2024-8
The Verge,AI 爬虫访问与爬虫治理背景:https://www.theverge.com/2024/7/24/24205244/reddit-blocking-search-engine-crawlers-ai-bot-google
LinkedIn 内容扫描,2026 年 6 月 10 日:GPTBot robots.txt、llms.txt GPTBot、OAI-SearchBot、ChatGPT-User user agent、AI crawler traffic ecommerce。
下载 PDF 版本
获取 ChatGPT-User vs OAI-SearchBot vs GPTBot:电商 AI 流量白皮书 的完整 PDF 版本。在下方留下你的邮箱,下载链接会立即出现。
提交此表单即表示你同意 DeepLumen 就 AI 可见性与智能体商务与你联系。
你的 PDF 已就绪。现在即可下载这份白皮书。
下载 PDF