TL;DR
- 到目前为止,AI 可读性的工作大多集中在文本上:JSON-LD、llms.txt、产品描述。 但真正决定购物者在两款产品之间选哪一款的因素——材质、颜色还原、贴合度、尺寸感、实际使用时的样子——有相当一部分存在于图片和视频里,而不在文本里。
- 除非周围的数据告诉 AI 智能体图里有什么,它无法像人类购物者那样可靠地「看见」一张图片。 一张没有 alt 文本、没有结构化
imageschema、也没有描述性图注的照片,对大多数 AI 检索来说几乎是不可见的——即使人类一眼就能看出它信息量很足。 - 视频的情况更加落后。 极少有 Shopify 产品页为产品视频实际展示的内容提供任何机器可读的摘要,因此对于正在形成推荐的 AI 智能体来说,这部分信息实际上是不可用的。
- 这是此前已经讲过的那套 JSON-LD/llms.txt 基础的自然延伸——底层是同一套原则(结构化、显式、机器可读的数据),只是应用到了另一种内容类型上。
为什么一张好的产品照片不会自动变成 AI 可读?
解析产品页的 AI 智能体不会像人那样去「看」一张图片——它依赖周围的标记和文本来知道图里有什么:alt 属性、Product schema 的 image 字段、图注,以及任何显式描述视觉属性(颜色、材质、图案)的结构化 additionalProperty 值。如果这些支撑性文本都不存在,一个页面即使摄影水准极高,对 AI 智能体来说在功能上依然是沉默的——因为图片本身并不携带 AI 检索流程能在缺少这些文本时提取出来的含义。
这与 ACCC 框架里讲过的「内容结构 vs. 内容质量」差距是同一个问题,只是这里专门落在视觉内容上,而不是正文文本。
一张 AI 可读的产品图片实际需要什么?
至少三件事要同时到位:一个描述性的 alt 属性,用平实的语言说明图片展示了什么(而不只是文件名或一个笼统的标签);一个指向实际素材的 Product schema image 字段;以及——在视觉细节会影响购买决策的地方——一句显式的文字说明,讲清这张图证明了什么(例如「图为胡桃木饰面」或「自然光下颜色真实还原」)。缺了第三件,AI 智能体可能知道有一张图存在,却仍然说不出它在支撑哪个具体的说法。
产品视频呢——同样的逻辑适用吗?
大体上适用,但视频还多了一层缺口:即使是标记良好的视频文件,也很少附带任何逐分钟说明它实际展示了什么的文字摘要。一条带 VideoObject schema 条目、配上 description 字段,再加一段简短的文字摘要说明视频演示了什么(组装步骤、尺寸对比、360° 环视、某个具体使用场景),才能给 AI 智能体一些具体可检索的东西——否则这段视频实际上就是未被索引的内容,无论它对观看它的人有多大用处。
「好看的照片」和「AI 可读的照片」之间的差距具体是什么样?
| 要素 | 大多数产品页有吗? | 什么让它变得 AI 可读 |
|---|---|---|
| 描述性 alt 文本 | 经常缺失或过于笼统(「产品图 1」) | 说明具体的视觉信息:材质、颜色、角度、使用场景 |
Product schema 的 image 字段 | 主图通常有 | 应当覆盖所有有意义的图片,而不只是主视觉图 |
| 显式的视觉说明文字 | 很少有 | 一句简短文字说明这张图证明了什么(例如「与标准咖啡杯并排展示实际尺寸」) |
| 视频 schema + 摘要 | 几乎从来没有 | VideoObject schema,加一段纯文本描述说明视频展示了什么 |
Shopify 商家该怎么实际修复?
- 审查现有产品图片的 alt 文本质量,把笼统或缺失的描述换成具体、准确地说明每张图展示了什么的文字。
- 确保
Productschema 覆盖所有有意义的图片,而不只是主视觉图——次要角度、尺寸参照、材质特写都携带真实的购买决策信息。 - 在图片旁加上显式的视觉说明文字,尤其是那些真正承担说服作用的图(贴合度、尺寸、颜色还原),不要假设图片会自己说话。
- 给产品视频打上
VideoObjectschema 和一段纯文本摘要,说明视频演示了什么,这样即使 AI 智能体无法直接处理视频内容,也有东西可以检索。
商家真正跑一次扫描之后会看到什么?
目录扫描的作用,是把「图片和视频大概有些缺口」变成一份具体、可修的清单。在一个典型的 Shopify 目录上,对图片与视频标记做结构化扫描,通常会浮现出同样的几种模式:主图的 alt 文本笼统或缺失(写成「产品图 1」,而不是说明图里展示了什么);次要角度和材质细节图从未被加进 Product schema 的 image 字段;以及产品视频就摆在页面上,却没有 VideoObject 条目或文字摘要——这意味着无论这些视频对观看的人有多有用,AI 智能体都无从知道它们演示了什么。
一旦这些缺口被补上——加上描述性 alt 文本、把每一张有意义的图都登记进 schema、给视频打上 VideoObject 描述——实际的变化是:解析这个页面的 AI 智能体,现在对它此前只靠一张照片或一段视频无法解决的问题有了显式、机器可读的答案:产品实际是什么材质或颜色、相对于一个熟悉的物件是什么尺寸、一段视频到底一步步展示了什么。这就是「在人看来视觉丰富的页面」和「对代表购物者做评估的 AI 智能体同样可读的页面」之间的区别。
即使商家认为自己的摄影已经很强,这件事仍然值得检查,原因在于:AI 智能体能不能用上一张图,和照片拍得多好几乎无关,而几乎完全取决于周围的标记是否存在。商家自己看自己的站点是看不出来的——这个差距只体现在底层数据说了什么,而不体现在店面看起来什么样。
DeepLumen 的位置
DeepLumen 把 Agentic Page 定位为把 AI 可读结构化数据延伸到文本之外的那一层——为 Shopify 目录的图片和视频生成与产品事实同样显式、机器可读的标记,让店铺的视觉内容不被排除在 AI 智能体真正能检索、能推理的范围之外。这与 DeepLumen 在其 700+ 家已安装 Shopify 商家上取得更广泛 AI 可见性成果的底层机制是同一套(结构化数据修复 → AI 引用与转化提升)——只是在这里专门应用到大多数目录尚未触及的图片/视频层。
检查一下你的产品图片和视频是否真的在为你的 AI 可见性做贡献,还是只是静静躺在仅覆盖文本的标记旁边。了解 Agentic Page,或 预约演示 获取一次完整的目录扫描。