你当前正在访问 Microsoft Azure Global Edition 技术文档网站。 如果需要访问由世纪互联运营的 Microsoft Azure 中国技术文档网站,请访问 https://docs.azure.cn。

配置扩充缓存(预览版)

注释

Azure AI 搜索可通过Azure门户、REST API 和Azure SDK获取。 它也是 Foundry IQ 的基础;Foundry IQ 是一个托管式知识层,可将企业内容转化为供 Microsoft Foundry 门户中的智能体使用的、可复用且具备权限感知能力的知识库。

重要

标记为“预览”的特性、功能或属性不受服务级别协议 (SLA) 保障,不建议用于生产工作负载,并且在正式发布之前可能会更改或受到限制。 Azure AI 搜索预览条款适用于所有预览功能,无论是独立功能还是正式版功能的一部分。

本文介绍如何将缓存添加到技能组管道,以便每次都无需完全重新生成即可修改下游扩充步骤。 扩充缓存(预览版)需要 预览版 REST API。 默认情况下,技能组是无状态的,并且更改其组合的任何部分都需要重新运行索引器。 使用 扩充缓存时,索引器会根据技能集或索引器定义更改来确定必须刷新文档树的哪些部分。 索引器尽可能保留并重复使用现有的已处理输出。

使用所提供的连接字符串将缓存的内容放置在Azure 存储中。 索引器在运行时创建这些对象。 将扩充缓存视为由搜索服务管理且不得修改的内部组件。

重要

扩充缓存不是技能集输出、索引器状态或索引文档的备份。 它不会跟踪哪些文档完成处理。 对于大型数据源,请在启用缓存之前查看 “限制” 部分。

  • 名为 ms-az-search-indexercache-<alpha-numeric-string> 的容器
  • 名为 MsAzSearchIndexerCacheIndex<alpha-numeric-string> 的表

先决条件

  • 用于存储缓存扩充的 Azure 存储。 存储帐户必须是 常规用途 v2。

  • 仅用于 Blob 索引时,如果您需要在从数据源中删除 Blob 时同时从缓存和索引中移除文档,请在索引器中启用删除策略。 如果没有此策略,则不支持从缓存中删除文档。

你应该熟悉如何设置索引器和技能集。 从索引器概述着手,然后继续学习技能集来了解扩充管道。

限制

谨慎

如果使用SharePoint索引器(预览版),请避免增量扩充。 在某些情况下,缓存将失效。 若要重新加载它,请执行索引器重置和完全重建。

大型数据源具有额外的缓存限制。

谨慎

对于大型数据源,在技能运行时间较长、反复中断或技能频繁失败时,增强缓存可以提高整体重新处理效率。 索引器将正确性优先于最小化重新处理,因此缓存积压工作会放大重试行为。 这种行为是预期之中的,不是缺陷。

若要从不断增长的缓存积压工作中恢复,请将数据源分区为较小的容器或虚拟文件夹。 然后使用指向同一索引的 并行索引器 。 若要取消关联缓存,请将 cache 索引器的属性设置为 null。 有关分区模式的指导,请参阅 索引大型数据集 。

权限

Azure AI 搜索标识需要对 Azure 存储 具有写入访问权限:

  • 存储 Blob 数据参与者
  • 存储表数据贡献者

连接字符串的语法决定使用的是系统分配的标识还是用户分配的标识。 有关详细信息,请参阅使用托管标识连接到Azure存储。

设置缓存属性

对新的索引器和现有索引器使用此过程。

在索引器定义中,使用以下命令进行设置 cache :

  • (必需)storageConnectionString 设置为 Azure 存储连接字符串。
  • (可选) enableReprocessing (true 默认情况下)。 将其设置为 false 以暂时暂停增量扩充,稍后将其切换回 true。
  1. 在左侧,选择 “索引器”。

  2. 选择 “添加索引器 ”以创建新的索引器,或在 JSON 编辑模式下打开现有索引器。

  3. 启用增量扩充,设置扩充缓存存储帐户,并保存索引器。

    Azure 门户中用于丰富缓存的选项的屏幕截图

  4. 如果索引器已存在,请重置索引器。

  5. 运行索引器。 此一次性操作用于初始化缓存。 加载后,增量重用将应用于后续运行。