你当前正在访问 Microsoft Azure Global Edition 技术文档网站。 如果需要访问由世纪互联运营的 Microsoft Azure 中国技术文档网站,请访问 https://docs.azure.cn。

Azure AI 搜索中的多模式搜索

注释

Azure AI 搜索可通过Azure门户、REST API 和Azure SDK获取。 它也是 Foundry IQ 的基础;Foundry IQ 是一个托管式知识层,可将企业内容转化为供 Microsoft Foundry 门户中的智能体使用的、可复用且具备权限感知能力的知识库。

多模式搜索是指跨多个内容类型(包括文本、图像、视频和音频)引入、理解和检索信息的功能。 在Azure AI 搜索中,多模式搜索原生支持引入包含文本和图像的文档及其内容的检索,使你能够执行合并这两种形式的搜索。

构建可靠的多模式管道通常涉及:

  1. 从文档中提取内联图像和页面文本。

  2. 用自然语言描述图像。

  3. 将文本和图像嵌入共享矢量空间。

  4. 存储图像以供以后用作批注。

多模式搜索还需要保留信息的顺序,因为它出现在文档中,并执行 混合查询 ,将 全文搜索 与 矢量搜索 和 语义排名相结合。

实际上,使用多模式搜索的应用程序可以回答“批准 HR 表单的过程是什么?”等问题,即使进程的唯一权威说明位于 PDF 文件中的嵌入关系图中时也是如此。

传统上,多模式搜索需要单独的文本和图像处理系统,这通常需要开发人员的自定义代码和低级别配置。 维护这些系统会产生更高的成本、复杂性和工作量。

Azure AI 搜索通过将图像集成到与文本相同的检索管道中来解决这些难题。 使用单个多模态管道,您可以简化设置,并解锁位于图表、屏幕截图、信息图、扫描表单和其他复杂视觉中的信息。

多模式搜索非常适用于检索扩充生成(RAG)方案。 通过解释图像的结构逻辑,多模式搜索会使 RAG 应用程序或 AI 代理不太可能忽略重要的视觉细节。 它还为用户提供了详细的答案,这些答案可以追溯到其原始源,而不管源的形式如何。

多模式搜索的工作原理是什么?

为了简化多模式管道的创建,Azure AI 搜索在Azure门户中提供导入数据向导。 该向导可帮助你配置数据源、定义提取和扩充设置,并生成包含文本、嵌入图像引用和矢量嵌入的多模式索引。 有关详细信息,请参阅 Quickstart:Azure 门户中的多模式搜索。

向导遵循以下步骤创建多模式管道:

  1. 提取内容: 可选择 文档提取技能 或 Azure 内容理解技能,以获取页面文本、内联图像和结构元数据。 每个技能为元数据提取、表处理和文件格式支持提供了不同的功能。 有关详细比较,请参阅 多模式内容提取选项。

  2. 区块文本:文本拆分技能将提取的文本分解为可在剩余管道中使用的可管理区块,例如嵌入技能。

  3. 生成映像说明:GenAI 提示技能对图像进行口头处理,使用大型语言模型(LLM)生成文本搜索和嵌入的简洁自然语言说明。

  4. 生成嵌入: 嵌入技能可创建文本和图像的矢量表示形式,从而实现相似性和混合检索。 可以原生调用 Azure OpenAI、Microsoft Foundry 或 Azure Vision(预览版) 的嵌入模型。

    或者,你可以跳过图像描述,通过 AML 技能或 Azure 视觉多模态嵌入技能将提取的文本和图像直接传递给多模态嵌入模型。 有关详细信息,请参阅 多模式内容嵌入的选项。

  5. 存储提取的图像:知识存储包含可直接返回到客户端应用程序的提取映像。 使用向导时,图像的位置直接存储在多模式索引中,以便在查询时方便检索。

提示

若要查看多模式搜索的实际操作,请将向导创建的索引插入 多模式 RAG 示例应用程序。 此示例演示 RAG 应用程序如何使用多模式索引并在响应中呈现文本引文和关联的图像片段。 此示例还展示了基于代码的数据引入和索引过程。

多模式内容提取的选项

多模式管道首先将每个源文档分解为文本块、内嵌图像和相关的元数据。 对于此步骤,Azure AI 搜索提供了两种建议的内置技能:

特点 文档提取技能 Azure内容理解技能
文本位置元数据提取(页面和包围多边形) 不 是的
图像位置元数据提取(页面和边界多边形) 是的 是的
表提取和保存 不 是(包括跨页表)
跨页语义单元 不适用 是(跨页边界)
基于文件类型的位置元数据提取 仅限 PDF。 多种支持的文件类型,包括 PDF、DOCX、XLSX 和 PPTX。
数据提取计费 图像提取按 Azure AI 搜索 定价计费。 服务基于 Azure 内容理解定价而计费。
内置分块 否(使用文本分割技能) 是(语义分块)
AI 生成的图像说明 不 是(当 modelName 和 modelDeployment 已配置时,自 2026-05-01-preview REST API 起可用)
建议的方案 不需要确切位置或详细布局信息的快速原型制作或生产管道。 需要跨页表提取、语义分块和 AI 生成的图像说明的高级文档分析。

现有管道仍支持文档布局技能。 对于新的技能集,请使用Azure内容理解技能,该技能将内容提取和分块合并为单个技能,并支持语义分块、AI 生成的图像说明和跨页表提取。

多模式内容嵌入的选项

在Azure AI 搜索中,从图像中检索知识可以遵循两个互补的路径:图像语言化或直接嵌入。 了解区别有助于将成本、延迟和答案质量与应用程序的需求保持一致。

图像描述生成然后进行文本嵌入

使用此方法,GenAI提示技能在引入过程中调用LLM,以创建每个提取图像的简洁自然语言描述,例如“以经理审批开头的五步HR访问工作流”。说明以文本形式存储,并被嵌入到周围的文档文本中。然后,您可以通过调用Azure OpenAI、Microsoft Foundry或Azure Vision嵌入模型进行向量化。

由于图像现在以语言表示,因此Azure AI 搜索可以:

  • 解释关系图中显示的关系和实体。

  • 提供现成标题,以便 LLM 可以在响应中逐字引用。

  • 为 RAG 应用程序或使用有据数据的 AI 智能体场景返回相关片段。

添加的语义深度需要对每个图像进行 LLM 调用,索引时间略有增加。

直接多模式嵌入

第二个选项是将文档提取的图像和文本传递给多模式嵌入模型,该模型在同一向量空间中生成矢量表示形式。 配置非常简单,索引时不需要 LLM。 直接嵌入非常适合视觉相似性和“帮我找类似这个”情境。

由于表示形式纯粹是数学性的,因此它不会传达为什么两个图像相关,并且它不提供 LLM 准备的引文上下文或详细说明。

组合这两种方法

许多解决方案都需要这两种编码路径。 图表、流程图和其他包含丰富解释的视觉对象被转换为文本,以便语义信息可用于 RAG 和 AI 代理的基础建立。 直接嵌入屏幕截图、产品照片或插图,以便进行高效的相似性搜索。 可以自定义 Azure AI 搜索 的索引和索引器技能管道,以存储两组向量并同时检索它们。

用于查询多模式内容的选项

如果多模式管道由 GenAI 提示技能提供支持,则可以在搜索索引中对纯文本和口头图像运行 混合查询 。 还可以使用筛选器将搜索结果缩小到特定内容类型,例如仅文本或仅图像。

尽管 GenAI 提示技能通过混合搜索支持文本到矢量查询,但它不支持 图像到矢量查询。 只有多模态嵌入模型在查询过程中提供将图像转换为向量的向量化器。

若要将图像用作多模式索引的查询输入,必须使用具有等效矢量化器的 AML 技能或 Azure视觉多模式嵌入技能。 有关详细信息,请参阅 在搜索索引中配置向量器。

教程和示例

为了帮助你开始Azure AI 搜索中的多模式搜索,下面是一组内容,演示如何使用Azure功能创建和优化多模式索引。

内容 描述
Quickstart:Azure 门户中的多模式搜索 使用向导和搜索资源管理器在Azure门户中创建和测试多模式索引。
多模态教程 提取文本和图像、区块数据,并向量化区块,以便进行相似性搜索和其他检索模式。
示例应用程序:多模态 RAG GitHub 存储库 具有多模式功能的端到端代码就绪 RAG 应用程序,可显示文本代码片段和图像注释。 非常适合快速启动企业 Copilot。