Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Note
Pesquisa de IA do Azure está disponível por meio do portal Azure, APIs REST e SDKs do Azure. Ele também sustenta o IQ do Foundry, a camada de conhecimento gerenciado que transforma o conteúdo da empresa em bases de conhecimento reutilizáveis e com reconhecimento de permissão para agentes no portal do Microsoft Foundry.
Importante
Recursos, funcionalidades ou propriedades marcados como (versão prévia) não são cobertos por um contrato de nível de serviço (SLA), não são recomendados para cargas de trabalho de produção e podem mudar ou ser restringidos antes da disponibilidade geral. Os termos de visualização do Pesquisa de IA do Azure se aplicam a toda funcionalidade em visualização, seja autônoma ou parte de um recurso de disponibilidade geral.
Este artigo descreve o modelo de execução do indexador usado pelo Pesquisa de IA do Azure para serviços de busca Serverless e Standard 3 High Density (S3 HD). Ambas as opções têm uma cota diária de tempo de execução no nível de serviço que determina quanto tempo total de indexador você pode usar em cada janela de 24 horas em UTC.
Os recursos descritos neste artigo estão em versão prévia:
- O suporte ao indexador no S3 HD requer a
2025-11-01-previewAPI REST ou posterior. - O suporte ao indexador sem servidor requer a
2026-05-01-previewAPI REST ou posterior.
Aplica-se a
O modelo de execução neste artigo se aplica a:
-
Serviços de pesquisa sem servidor que executam indexadores usando a
2026-05-01-previewAPI REST ou posterior. - Serviços de pesquisa S3 HD que executam indexadores usando a API REST
2025-11-01-previewou versões posteriores.
As definições de indexador, fontes de dados, conjuntos de habilidades e fontes de conhecimento com suporte do indexador funcionam sem modificação em ambas as opções.
Modelo de execução
Os indexadores no HD S3 e sem servidor têm as seguintes características de execução:
Você não provisiona nem gerencia a infraestrutura do indexador. O serviço lida com o gerenciamento para você.
Os indexadores são executados somente no ambiente de execução multilocatário. O ambiente de execução privada, fornecido por meio de recursos de link privado compartilhados, não está disponível para indexadores nessas SKUs.
Para s3 HD, se você precisar de conexões de indexador para ficar fora da Internet pública, configure um NSP ( perímetro de segurança de rede ) em seu serviço de pesquisa para controlar o tráfego de entrada e saída por meio de regras de acesso explícitas.
Para o Serverless, não há suporte para conexões privadas.
Cota diária de tempo de execução acumulado
A execução do indexador é regida por uma cota de runtime diária que é redefinida às 00:00 UTC. A cota é:
- Nível de serviço: Aplica-se ao serviço de pesquisa como um todo.
- Cumulativo: O tempo de execução de cada indexador do serviço é contabilizado no mesmo orçamento. A cota não é aplicada para cada indexador.
Todos os indexadores em execução acumulam tempo em um orçamento de serviço compartilhado. O serviço não reserva runtime para indexadores individuais ou divide automaticamente a cota igualmente entre eles. Por exemplo, as durações cumulativas de 12 indexadores executados durante duas horas cada podem consumir todas as 24 horas agregadas de tempo de execução, independentemente de as execuções se sobreporem ou ocorrerem em momentos diferentes.
A tabela a seguir lista a cota diária por SKU e a versão mínima da API que dá suporte a ela:
| SKU | Cota diária por janela UTC de 24 horas | Versão mínima da API |
|---|---|---|
| S3 HD | 24 horas | 2025-11-01-preview |
| Serverless | 24 horas | 2026-05-01-preview |
Quando a cota diária é esgotada:
Os indexadores que estão em execução no momento param em aproximadamente cinco minutos.
Novas execuções do indexador não processam documentos e retornam imediatamente uma falha transitória indicando que a cota diária foi excedida.
A execução normal do indexador retoma após a reinicialização do contador às 00:00 UTC.
Recuperação após cota esgotada
Para se recuperar do esgotamento da cota e reduzir a probabilidade de atingi-la novamente:
Aguarde até a próxima redefinição à 00:00 UTC ou use Obter Estatísticas de Serviço (API REST) para confirmar que
remainingSecondsfoi reabastecido antes de iniciar novas execuções.Coloque os indexadores em agendas escalonadas para que o trabalho se espalhe pela janela de 24 horas em vez de ser executado simultaneamente.
Não é possível pausar ou interromper execuções ativas. Use Obter o status do indexador para monitorá-los e consulte Executar ou redefinir indexadores para saber como funciona o controle de tempo de execução.
Se o runtime continuar disponível, mas as execuções do indexador falharem, consulte Solucionar problemas do indexador.
Reduza o custo das habilidades. Habilidades que chamam serviços externos, como Azure OpenAI Embedding skill, GenAI Prompt skill e Azure Content Understanding skill, consomem rapidamente o tempo de execução. Reduza o número de habilidades, documentos em lote ou configure um cache de enriquecimento para reutilizar resultados anteriores em vez de reprocessar.
Monitore
remainingSecondsproativamente no nível do serviço e do indexador para que você possa limitar as cargas de trabalho antes que elas falhem.
Monitor de tempo de execução cumulativo
Esta seção explica como acompanhar o uso de runtime e o orçamento restante usando as APIs REST do Serviço de Pesquisa. Não há experiência no portal para o tempo de execução cumulativo durante a versão prévia.
Tempo de execução em nível de serviço
Use a API REST Get Service Statistics para obter o tempo de execução cumulativo de todos os indexadores no serviço na janela atual de 24 horas:
GET {endpoint}/servicestats?api-version=2026-08-01-preview
A resposta inclui uma indexersRuntime seção. O JSON a seguir mostra um serviço cuja cota diária de 24 horas não é usada:
"indexersRuntime": {
"usedSeconds": 0,
"remainingSeconds": 86400,
"beginningTime": "2026-05-16T00:00:00.000Z",
"endingTime": "2026-05-17T00:00:00.000Z"
}
Pontos principais:
-
usedSeconds: total de segundos que todos os indexadores no serviço executaram durante a janela atual. -
remainingSeconds: segundos ainda disponíveis antes que a cota diária seja atingida. Apresente quando um limite específico de camada se aplica. -
beginningTimeeendingTime: início e fim da janela de contagem UTC atual de 24 horas.
Tempo de execução em nível de indexador
Use Obter Status do Indexador (API REST) para recuperar o runtime cumulativo de um indexador individual:
GET {endpoint}/indexers('{indexerName}')/search.status?api-version=2026-08-01-preview
A resposta inclui uma runtime seção. O JSON a seguir mostra um indexador em um serviço cuja cota diária de 24 horas não é usada:
"runtime": {
"usedSeconds": 0,
"remainingSeconds": 86400,
"beginningTime": "2026-05-16T00:00:00.000Z",
"endingTime": "2026-05-17T00:00:00.000Z"
}
Pontos principais:
-
usedSeconds: total de segundos que o indexador executou durante a janela atual. -
remainingSeconds: segundos ainda disponíveis para todos os indexadores no serviço, não apenas para esse indexador. Apresente quando um limite específico de camada se aplica. -
beginningTimeeendingTime: início e fim da janela de contagem UTC atual de 24 horas.
Práticas recomendadas
O suporte ao indexador no HD S3 e no Serverless está em versão prévia. Siga estas diretrizes para dimensionar cargas de trabalho adequadamente e planejar a cobrança para que o Serverless seja introduzido posteriormente.
S3 HD
Na versão prévia, o suporte ao indexador S3 HD foi projetado para cargas de trabalho sem conjuntos de habilidades ou com conjuntos de habilidades pequenos. Para permanecer dentro da cota diária:
Planeje índices pequenos de cerca de 1 GB de tamanho.
Dimensione o uso do conjunto de habilidades com cuidado. Habilidades que chamam serviços externos, como a habilidade Azure OpenAI Embedding, a habilidade GenAI Prompt e a habilidade Compreensão de Conteúdo do Azure, aumentam significativamente o tempo de execução e podem consumir rapidamente a cota diária, especialmente em cenários multilocatário.
Espere paralelismo limitado durante a visualização. Use execuções agendadas e escalonadas para grandes frotas de indexadores para distribuir a carga de trabalho ao longo de um período de 24 horas, em vez de disputar o mesmo orçamento.
Exemplo de carga de trabalho de divisão e incorporação
Em um teste controlado do S3 HD, uma habilidade de divisão e uma habilidade de incorporação do OpenAI do Azure geraram fragmentos e incorporações. A carga de trabalho produziu aproximadamente 2,5 blocos por documento de origem, e aproximadamente 22.000 documentos de origem foram observados neste teste durante uma janela de teste de 24 horas do S3 HD.
Os valores a seguir são arredondados e representam um cálculo ilustrativo de rateio proporcional com base na observação agregada. Esses resultados não são medidos por indexador.
| Contagem de indexador | Documentos de origem ilustrativos por indexador por dia |
|---|---|
| 100 | Cerca de 200 |
| 500 | Cerca de 40 |
| 1,000 | Cerca de 20 |
O serviço não reserva capacidade nem garante distribuição, ordem de execução ou taxa de transferência iguais para essas contagens de indexadores.
Note
Esse resultado foi observado em um teste controlado. Ele não é uma meta de desempenho, uma garantia de serviço, um compromisso de capacidade, uma fórmula de dimensionamento nem um substituto para testar sua carga de trabalho.
A taxa de transferência pode apresentar variações consideráveis dependendo da complexidade e do perfil do documento, do particionamento, da quantidade e do tipo de habilidades e das saídas vetoriais, da latência do modelo, da capacidade e da cota, do desempenho das fontes e dos destinos, da concorrência, da ordem de agendamento, da limitação, da região, das falhas e das novas tentativas, da divisão dos documentos ou do reconhecimento óptico de caracteres (OCR), além dos volumes desiguais entre os locatários. Teste com entradas de produção representativas antes de planejar a capacidade.
Serverless
Na versão prévia, os indexadores sem servidor foram projetados para simplificar a ingestão em cenários de RAG (geração aumentada por recuperação) e base de conhecimento:
A execução do indexador (excluindo habilidades) é atualmente gratuita. Gravar documentos em um índice gera um custo.
A execução do conjunto de habilidades é cobrada da mesma maneira que em indexadores dedicados. As chamadas para serviços externos, como a habilidade de incorporações do OpenAI do Azure, a habilidade de prompt do GenAI e a habilidade de Compreensão de Conteúdo do Azure, são cobradas por meio do recurso do Foundry ou dos serviços de IA do Azure anexado.
Limites e cotas
Para ver os limites do indexador no Serverless e no S3 HD, consulte os limites do indexador.
As cotas de tempo de execução e os limites de indexação definidos no nível do serviço não substituem as restrições relacionadas à entrada, às solicitações ou ao processamento das habilidades e dos serviços externos utilizados em um conjunto de habilidades. Ao dimensionar um pipeline de enriquecimento, analise individualmente cada referência de habilidade.