你当前正在访问 Microsoft Azure Global Edition 技术文档网站。 如果需要访问由世纪互联运营的 Microsoft Azure 中国技术文档网站,请访问 https://docs.azure.cn。
注释
Azure AI 搜索可通过Azure门户、REST API 和Azure SDK获取。 它也是 Foundry IQ 的基础;Foundry IQ 是一个托管式知识层,可将企业内容转化为供 Microsoft Foundry 门户中的智能体使用的、可复用且具备权限感知能力的知识库。
Important
标记为“预览”的特性、功能或属性不受服务级别协议 (SLA) 保障,不建议用于生产工作负载,并且在正式发布之前可能会更改或受到限制。 Azure AI 搜索预览条款适用于所有预览功能,无论是独立功能还是正式版功能的一部分。
本文介绍Azure AI 搜索用于无服务器和标准 3 高密度(S3 HD)搜索服务的索引器执行模型。 这两个选项都有一个服务级别的每日运行时配额,用于控制每 24 小时 UTC 窗口可以使用的总索引器时间。
本文中所述的功能以预览版提供:
- S3 HD 上的索引器支持需要
2025-11-01-previewREST API 或更高版本。 - 无服务器索引器支持需要
2026-05-01-previewREST API 或更高版本。
适用情况
本文中的执行模型适用于:
-
使用
2026-05-01-previewREST API 或更高版本运行索引器的无服务器搜索服务 - 使用
2025-11-01-previewREST API 或更高版本运行索引器的 S3 HD 搜索服务。
支持的索引器定义、数据源、技能集和索引器支持的知识源无需修改这两个选项即可工作。
执行模型
无服务器和 S3 HD 上的索引器具有以下执行特征:
不预配或管理索引器基础结构。 该服务为你处理容量。
对于 S3 HD,如果需要使索引器连接不经过公共互联网,请在搜索服务中配置 网络安全边界(NSP),以通过显式访问规则控制入站和出站流量。
对于 Serverless,不支持私有连接。
每日累积运行时配额
索引器的执行由每日运行时长配额决定,该配额于 UTC 时间 00:00 重置。 配额为:
- 服务级别: 它适用于整个搜索服务。
- 累积: 服务中的每个索引器的运行时都计入相同的预算。 不会为每个索引器应用配额。
所有正在运行的索引器的运行时间都会计入同一个共享服务预算。 该服务不会为单个索引器保留运行时,也不会自动将配额相等划分。 例如,12 个各运行 2 小时的索引器,其累计运行时长就会耗尽全部 24 小时的总运行时长,无论这些运行是重叠进行还是在不同时间进行。
下表列出了 SKU 的每日配额,以及支持该配额的最低 API 版本:
| SKU | 每个 UTC 24 小时时间窗口的每日配额 | 最低 API 版本 |
|---|---|---|
| S3 HD | 24 小时 | 2025-11-01-preview |
| Serverless | 24 小时 | 2026-05-01-preview |
当每日配额耗尽时:
当前正在运行的索引器将在大约五分钟内停止。
新的索引器运行任务不会处理文档,并会立即返回暂时性失败,表明已超出每日配额。
计数器在 00:00 UTC 重置后,索引器恢复正常运行。
从配额耗尽中恢复
若要在配额耗尽后恢复,并降低再次触及配额上限的可能性:
等待下一个 00:00 UTC 重置,或使用获取服务统计信息 (REST API) 确认
remainingSeconds是否已补充,然后再触发新运行。将索引器安排为错峰计划,以便工作在 24 小时窗口内分散,而不是同时运行。
您无法暂停或停止正在进行的运行。 使用 获取索引器状态 监控索引器的状态,有关运行时控制行为,请参阅 运行或重置索引器。
如果运行时保持不变,但索引器运行失败,请参阅 索引器问题疑难解答。
降低技能集成本。 调用外部服务的技能(如 Azure OpenAI 嵌入技能、GenAI 提示技能和 Azure 内容理解技能)快速使用运行时。 减少技能、批处理文档或 配置扩充缓存 的数量,以重复使用以前的结果,而不是重新处理。
在服务和索引器级别主动监视
remainingSeconds,以便在工作负荷失败之前对其进行限制。
监视累积运行时
本部分介绍如何使用搜索服务 REST API 跟踪运行时使用情况和剩余预算。 在预览期间,门户中不提供累计运行时间相关功能。
服务级别运行时
使用 “获取服务统计信息 ”(REST API)检索当前 24 小时时段服务中所有索引器的累积索引器运行时:
GET {endpoint}/servicestats?api-version=2026-08-01-preview
响应包括一个 indexersRuntime 部分。 以下 JSON 显示了不使用其 24 小时每日配额的服务:
"indexersRuntime": {
"usedSeconds": 0,
"remainingSeconds": 86400,
"beginningTime": "2026-05-16T00:00:00.000Z",
"endingTime": "2026-05-17T00:00:00.000Z"
}
要点:
-
usedSeconds:服务中的所有索引器在当前窗口中运行的总秒数。 -
remainingSeconds:在达到每日配额前,仍有可用秒数。 当适用特定层级限制时显示。 -
beginningTime和endingTime:当前 24 小时 UTC 计数窗口的开始和结束。
索引器级运行时
使用 “获取索引器状态 ”(REST API)检索单个索引器的累积运行时:
GET {endpoint}/indexers('{indexerName}')/search.status?api-version=2026-08-01-preview
响应包括一个 runtime 部分。 下面的 JSON 显示了某个服务上的索引器,该服务的 24 小时每日配额尚未用完:
"runtime": {
"usedSeconds": 0,
"remainingSeconds": 86400,
"beginningTime": "2026-05-16T00:00:00.000Z",
"endingTime": "2026-05-17T00:00:00.000Z"
}
要点:
-
usedSeconds:索引器在当前窗口中运行的总秒数。 -
remainingSeconds:秒数仍然可用于服务中的所有索引器,而不仅仅是此索引器。 当适用特定层级限制时显示。 -
beginningTime和endingTime:当前 24 小时 UTC 计数窗口的开始和结束。
最佳做法
S3 HD 和无服务器上的索引器支持处于预览状态。 按照本指南适当调整工作负荷大小,并计划在以后引入无服务器计费。
S3 HD
在预览期间,S3 HD 索引器支持功能专为不使用技能集或仅使用较小技能集的工作负载而设计。 为确保不超出每日配额:
规划大小约为 1 GB 的小型索引。
请谨慎控制技能集的使用规模。 调用外部服务的技能(如 Azure OpenAI 嵌入技能、GenAI 提示技能和 Azure 内容理解技能)显著增加运行时,并且可以快速消耗每日配额,尤其是在多租户方案中。
在预览期间,并行度预计会受到限制。 对大型索引器舰队使用有计划的交错运行,这样工作就可以在 24 小时内分散,而不是争夺相同的预算。
示例性拆分和嵌入工作负载
在一个受控 S3 HD 测试中,拆分技能和一个 Azure OpenAI 嵌入技能生成了区块和嵌入。 该工作负载平均每个源文档生成约 2.5 个区块,并且在一次 24 小时的 S3 HD 测试窗口期间,此测试中观察到约 22,000 个源文档。
以下数值是基于汇总观测结果得出的、经过四舍五入的公平份额的计算结果。 它们不会按索引器结果进行度量。
| 索引器数量 | 每个索引器每天的示例性原始文档 |
|---|---|
| 100 | 约 200 |
| 500 | 约 40 |
| 1,000 | 大约 20 |
该服务不会为这些索引器数量设置预留容量,也不保证均匀分配、执行顺序或吞吐量。
注释
在一个受控测试中观察到此结果。 它不是性能目标、服务保证、容量承诺、容量规划公式,也不能替代对您的工作负载进行测试。
吞吐量可能会因文档复杂性和配置、分块处理、技能和矢量输出的数量与类型、模型延迟、容量和配额、源端和目标端性能、并发度、调度顺序、限流、区域、故障与重试、文档解析或光学字符识别(OCR),以及各租户负载不均衡等因素而出现显著差异。 在规划容量之前,先使用具有代表性的生产输入进行测试。
Serverless
在预览期间,无服务器索引器旨在简化检索扩充生成(RAG)和知识库方案的引入:
索引器执行(不包括技能)目前是免费的。 将文档写入索引会产生费用。
技能集执行的计费方式与专用索引器相同。 调用外部服务(例如,Azure OpenAI 嵌入技能、GenAI 提示技能和 Azure 内容理解技能)的费用通过关联的 Foundry 或 Azure AI 服务资源收取。
限制和配额
有关无服务器和 S3 HD 的索引器限制,请参阅 索引器限制。
服务级别的运行时配额和索引器限制并不会取代技能集中的技能和外部服务的输入、请求或处理限制。 在确定扩充管道的规模时,请分别检查每个技能引用。