让产品图片与视频变得 AI 可读

仅有文本标记还不够——一份实用指南,讲清如何描述产品图片与视频,让 AI 购物智能体真正用得上它们。

AI 可读电商2026年7月30日

仅有文本标记还不够——一份实用指南,讲清如何描述产品图片与视频,让 AI 购物智能体真正用得上它们。

DeepLumen

本页目录

TL;DR

  • 到目前为止,AI 可读性的工作大多集中在文本上:JSON-LD、llms.txt、产品描述。 但真正决定购物者在两款产品之间选哪一款的因素——材质、颜色还原、贴合度、尺寸感、实际使用时的样子——有相当一部分存在于图片和视频里,而不在文本里。
  • 除非周围的数据告诉 AI 智能体图里有什么,它无法像人类购物者那样可靠地「看见」一张图片。 一张没有 alt 文本、没有结构化 image schema、也没有描述性图注的照片,对大多数 AI 检索来说几乎是不可见的——即使人类一眼就能看出它信息量很足。
  • 视频的情况更加落后。 极少有 Shopify 产品页为产品视频实际展示的内容提供任何机器可读的摘要,因此对于正在形成推荐的 AI 智能体来说,这部分信息实际上是不可用的。
  • 这是此前已经讲过的那套 JSON-LD/llms.txt 基础的自然延伸——底层是同一套原则(结构化、显式、机器可读的数据),只是应用到了另一种内容类型上。

为什么一张好的产品照片不会自动变成 AI 可读?

解析产品页的 AI 智能体不会像人那样去「看」一张图片——它依赖周围的标记和文本来知道图里有什么:alt 属性、Product schema 的 image 字段、图注,以及任何显式描述视觉属性(颜色、材质、图案)的结构化 additionalProperty 值。如果这些支撑性文本都不存在,一个页面即使摄影水准极高,对 AI 智能体来说在功能上依然是沉默的——因为图片本身并不携带 AI 检索流程能在缺少这些文本时提取出来的含义。

这与 ACCC 框架里讲过的「内容结构 vs. 内容质量」差距是同一个问题,只是这里专门落在视觉内容上,而不是正文文本。

一张 AI 可读的产品图片实际需要什么?

至少三件事要同时到位:一个描述性的 alt 属性,用平实的语言说明图片展示了什么(而不只是文件名或一个笼统的标签);一个指向实际素材的 Product schema image 字段;以及——在视觉细节会影响购买决策的地方——一句显式的文字说明,讲清这张图证明了什么(例如「图为胡桃木饰面」或「自然光下颜色真实还原」)。缺了第三件,AI 智能体可能知道有一张图存在,却仍然说不出它在支撑哪个具体的说法。

产品视频呢——同样的逻辑适用吗?

大体上适用,但视频还多了一层缺口:即使是标记良好的视频文件,也很少附带任何逐分钟说明它实际展示了什么的文字摘要。一条带 VideoObject schema 条目、配上 description 字段,再加一段简短的文字摘要说明视频演示了什么(组装步骤、尺寸对比、360° 环视、某个具体使用场景),才能给 AI 智能体一些具体可检索的东西——否则这段视频实际上就是未被索引的内容,无论它对观看它的人有多大用处。

「好看的照片」和「AI 可读的照片」之间的差距具体是什么样?

Shopify 商家该怎么实际修复?

  • 审查现有产品图片的 alt 文本质量,把笼统或缺失的描述换成具体、准确地说明每张图展示了什么的文字。
  • 确保Productschema 覆盖所有有意义的图片,而不只是主视觉图——次要角度、尺寸参照、材质特写都携带真实的购买决策信息。
  • 在图片旁加上显式的视觉说明文字,尤其是那些真正承担说服作用的图(贴合度、尺寸、颜色还原),不要假设图片会自己说话。
  • 给产品视频打上VideoObjectschema 和一段纯文本摘要,说明视频演示了什么,这样即使 AI 智能体无法直接处理视频内容,也有东西可以检索。

商家真正跑一次扫描之后会看到什么?

目录扫描的作用,是把「图片和视频大概有些缺口」变成一份具体、可修的清单。在一个典型的 Shopify 目录上,对图片与视频标记做结构化扫描,通常会浮现出同样的几种模式:主图的 alt 文本笼统或缺失(写成「产品图 1」,而不是说明图里展示了什么);次要角度和材质细节图从未被加进 Product schema 的 image 字段;以及产品视频就摆在页面上,却没有 VideoObject 条目或文字摘要——这意味着无论这些视频对观看的人有多有用,AI 智能体都无从知道它们演示了什么。

一旦这些缺口被补上——加上描述性 alt 文本、把每一张有意义的图都登记进 schema、给视频打上 VideoObject 描述——实际的变化是:解析这个页面的 AI 智能体,现在对它此前只靠一张照片或一段视频无法解决的问题有了显式、机器可读的答案:产品实际是什么材质或颜色、相对于一个熟悉的物件是什么尺寸、一段视频到底一步步展示了什么。这就是「在人看来视觉丰富的页面」和「对代表购物者做评估的 AI 智能体同样可读的页面」之间的区别。

即使商家认为自己的摄影已经很强,这件事仍然值得检查,原因在于:AI 智能体能不能用上一张图,和照片拍得多好几乎无关,而几乎完全取决于周围的标记是否存在。商家自己看自己的站点是看不出来的——这个差距只体现在底层数据说了什么,而不体现在店面看起来什么样。

DeepLumen 的位置

DeepLumen 把 Agentic Page 定位为把 AI 可读结构化数据延伸到文本之外的那一层——为 Shopify 目录的图片和视频生成与产品事实同样显式、机器可读的标记,让店铺的视觉内容不被排除在 AI 智能体真正能检索、能推理的范围之外。这与 DeepLumen 在其 700+ 家已安装 Shopify 商家上取得更广泛 AI 可见性成果的底层机制是同一套(结构化数据修复 → AI 引用与转化提升)——只是在这里专门应用到大多数目录尚未触及的图片/视频层。

检查一下你的产品图片和视频是否真的在为你的 AI 可见性做贡献,还是只是静静躺在仅覆盖文本的标记旁边。了解 Agentic Page,或 预约演示 获取一次完整的目录扫描。

相关阅读

JSON-LD

{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@context": "https://schema.org",
      "@type": "Organization",
      "@id": "https://staging2.deeplumen.io/#organization",
      "name": "DeepLumen",
      "url": "https://staging2.deeplumen.io/",
      "inLanguage": "zh-CN",
      "logo": {
        "@type": "ImageObject",
        "url": "https://staging2.deeplumen.io/logo.png",
        "width": 200,
        "height": 200
      },
      "image": "https://staging2.deeplumen.io/og-image.png",
      "slogan": "面向商家侧的智能体商务层",
      "description": "DeepLumen 是一个智能体商务(agentic commerce)平台,帮助品牌和产品被 AI 智能体发现、推荐,并进入交易流程。",
      "sameAs": [
        "https://www.linkedin.com/company/deeplumen/",
        "https://x.com/Deeplumen0922"
      ],
      "knowsAbout": [
        "智能体商务",
        "AI 购物智能体",
        "生成式引擎优化",
        "AI 搜索优化",
        "产品结构化数据",
        "结构化数据",
        "llms.txt",
        "AI 推荐流量",
        "M2AI"
      ]
    },
    {
      "@context": "https://schema.org",
      "@type": "WebSite",
      "@id": "https://staging2.deeplumen.io/#website",
      "name": "DeepLumen",
      "url": "https://staging2.deeplumen.io/",
      "inLanguage": "zh-CN"
    },
    {
      "@context": "https://schema.org",
      "@type": "BreadcrumbList",
      "itemListElement": [
        {
          "@type": "ListItem",
          "position": 1,
          "name": "首页",
          "item": "https://staging2.deeplumen.io/zh/"
        },
        {
          "@type": "ListItem",
          "position": 2,
          "name": "博客",
          "item": "https://staging2.deeplumen.io/zh/blog/"
        },
        {
          "@type": "ListItem",
          "position": 3,
          "name": "让产品图片与视频变得 AI 可读",
          "item": "https://staging2.deeplumen.io/zh/blog/ai-readable-product-images-video-shopify/"
        }
      ]
    }
  ]
}

{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@type": "BlogPosting",
      "headline": "让产品图片与视频变得 AI 可读",
      "description": "仅有文本标记还不够——一份实用指南,讲清如何描述产品图片与视频,让 AI 购物智能体真正用得上它们。",
      "inLanguage": "zh-CN",
      "datePublished": "2026-07-30",
      "dateModified": "2026-07-30T00:00:00.000Z",
      "author": {
        "@type": "Person",
        "name": "DeepLumen"
      },
      "mainEntityOfPage": "https://staging2.deeplumen.io/zh/blog/ai-readable-product-images-video-shopify/",
      "image": "https://staging2.deeplumen.io/blog-assets/ai-readable-product-images-video-shopify-cover.webp"
    }
  ]
}
Human