Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Note
Pesquisa de IA do Azure está disponível por meio do portal Azure, APIs REST e SDKs do Azure. Ele também sustenta o IQ do Foundry, a camada de conhecimento gerenciado que transforma o conteúdo da empresa em bases de conhecimento reutilizáveis e com reconhecimento de permissão para agentes no portal do Microsoft Foundry.
Este artigo explica como medir o desempenho e o volume da consulta usando métricas internas e log de diagnóstico. Ele também explica como obter as cadeias de caracteres de consulta inseridas pelos usuários do aplicativo.
O portal Azure mostra métricas básicas sobre latência de consulta, carga de consultas (QPS - consultas por segundo) e restrição. Dados históricos que se alimentam dessas métricas podem ser acessados no portal do Azure por 30 dias. Para uma retenção mais longa ou para relatar dados operacionais e cadeias de caracteres de consulta, você deve habilitar o registro em log de diagnóstico e escolher uma opção de armazenamento para persistir operações e métricas registradas em log. Recomendamos Log Analytics workspace como destino para operações registradas. As consultas e a exploração de dados do Kusto têm como destino um workspace do Log Analytics.
As condições que maximizam a integridade da medida de dados incluem:
Use um serviço faturável (um serviço criado na camada básica ou standard). O serviço gratuito é compartilhado por vários assinantes, o que introduz uma certa quantidade de volatilidade à medida que as cargas mudam.
Use uma única réplica e partição, se possível, para criar um ambiente contido e isolado. Se você usar várias réplicas, as métricas de consulta serão médias em vários nós, o que pode reduzir a precisão dos resultados. Da mesma forma, várias partições significam que os dados estão divididos, com o potencial de que algumas partições possam ter dados diferentes se a indexação também estiver em andamento. Quando você ajusta o desempenho da consulta, um único nó e uma partição fornecem um ambiente mais estável para testes.
Volume de consulta (QPS)
O volume é medido como QPS ( Consultas de Pesquisa por Segundo ), uma métrica interna que pode ser relatada como um valor médio, de contagem, mínimo ou máximo de consultas que são executadas em uma janela de um minuto. Intervalos de um minuto (TimeGrain = "PT1M") para métricas estão definidos dentro do sistema.
Pesquisa de IA do Azure mantém 30 dias de dados de métricas por padrão. Você pode habilitar o registro em log para fins de retenção mais longa. O QPS está disponível no portal Azure, na guia Monitoring do serviço de pesquisa.
Para saber mais sobre a métrica SearchQueriesPerSecond, consulte Consultas de pesquisa por segundo.
Desempenho da consulta
Em todo o serviço, o desempenho da consulta é medido por meio de latência de consulta e consultas restritas. Essas métricas também estão disponíveis na guia Monitoramento .
Latência de pesquisa
A latência de pesquisa indica quanto tempo uma consulta leva para ser concluída. Para saber mais sobre a métrica SearchLatency, consulte Latência de pesquisa.
Considere o seguinte exemplo de métricas de Latência de Pesquisa : 86 consultas foram amostradas, com uma duração média de 23,26 milissegundos. Um mínimo de 0 indica que algumas consultas foram descartadas. A consulta de execução mais longa levou 1000 milissegundos para ser concluída. O tempo total de execução foi de 2 segundos.
Consultas limitadas
As consultas limitadas referem-se a consultas descartadas em vez de processadas. Na maioria dos casos, a limitação é uma parte normal da execução do serviço. Não é necessariamente uma indicação de que há algo errado. Para saber mais sobre a métrica ThrottledSearchQueriesPercentage, consulte a porcentagem de consultas de pesquisa limitadas.
Na captura de tela a seguir, o primeiro número é a contagem (ou o número de métricas enviadas para o log). Outras agregações, que aparecem na parte superior ou ao passar o mouse sobre a métrica, incluem média, máximo e total. Neste exemplo, nenhuma solicitação foi descartada.
Explorar as métricas no portal do Azure
Para ver rapidamente os números atuais, a guia Monitoramento na página Visão Geral do serviço mostra três métricas (latência de pesquisa, consultas de pesquisa por segundo (por unidade de pesquisa),Porcentagem de Consultas de Pesquisa Limitadas) em intervalos fixos medidos em horas, dias e semanas, com a opção de alterar o tipo de agregação.
Para uma exploração mais profunda, abra o gerenciador de métricas no menu Monitoramento para que você possa colocar, ampliar e visualizar dados para explorar tendências ou anomalias. Saiba mais sobre o Metrics Explorer concluindo este tutorial sobre como criar um gráfico de métricas.
Na seção Monitoramento, selecione Métricas para abrir o gerenciador de métricas com o escopo definido para o serviço de pesquisa.
Em Métrica, escolha uma na lista suspensa e examine a lista de agregações disponíveis para um tipo preferencial. A agregação define como os valores coletados são amostrados ao longo de cada intervalo de tempo.
No canto superior direito, defina o intervalo de tempo.
Escolha uma visualização. O padrão é um gráfico de linhas.
Coloque mais agregações em camadas escolhendo Adicionar métrica e selecionando agregações diferentes.
Amplie uma área de interesse no gráfico de linhas. Coloque o ponteiro do mouse no início da área, selecione e segure o botão esquerdo do mouse, arraste para o outro lado da área e solte o botão. O gráfico amplia esse intervalo de tempo.
Retornar cadeias de caracteres de consulta inseridas pelos usuários
Quando você habilita o log de recursos, o sistema captura solicitações de consulta na tabela AzureDiagnostics . Como pré-requisito, você já deve ter especificado um destino para operações registradas, um workspace do Log Analytics ou outra opção de armazenamento.
Na seção Monitoramento, selecione Logs para abrir uma janela de consulta vazia no Log Analytics.
Execute a expressão a seguir para operações de pesquisa
Query.Search, retornando um conjunto de resultados tabular que consiste no nome da operação, na cadeia de caracteres de consulta, no índice consultado e no número de documentos encontrados. As duas últimas instruções excluem cadeias de caracteres de consulta que consistem em uma pesquisa vazia ou não especificada, em um índice de exemplo, que reduz o ruído nos resultados.AzureDiagnostics | project OperationName, Query_s, IndexName_s, Documents_d | where OperationName == "Query.Search" | where Query_s != "?api-version=2026-04-01&search=*" | where IndexName_s != "hotels-sample"Opcionalmente, defina um filtro column em Query_s para pesquisar uma sintaxe ou cadeia de caracteres específica. Por exemplo, você pode filtrar por é igual a
?api-version=2026-04-01&search=*&%24filter=HotelName.
Embora essa técnica funcione para investigação ad hoc, a criação de um relatório permite consolidar e apresentar as cadeias de caracteres de consulta em um layout mais propício à análise.
Identificar consultas de longa duração
Adicione a coluna de duração para obter os números de todas as consultas, não apenas aquelas que são captadas como uma métrica. Classificar esses dados mostra quais consultas levam mais tempo para serem concluídas.
Na seção Monitoramento, selecione Logs para consultar informações de log.
Execute a consulta básica a seguir para retornar consultas, classificadas por duração em milissegundos. As consultas de execução mais longa estão na parte superior.
AzureDiagnostics | project OperationName, resultSignature_d, DurationMs, Query_s, Documents_d, IndexName_s | where OperationName == "Query.Search" | sort by DurationMs
Criar um alerta de métrica
Um alerta de métrica estabelece um limite para enviar uma notificação ou disparar uma ação corretiva que você define com antecedência. Você pode criar alertas relacionados à execução da consulta, mas também pode criá-los para integridade do recurso, alterações na configuração do serviço de pesquisa, execução de habilidades e processamento de documentos (indexação).
Todos os limites são definidos pelo usuário, portanto, você deve ter uma ideia de qual nível de atividade deve disparar o alerta.
Para o monitoramento de consultas, é comum criar um alerta de métrica para latência de pesquisa e consultas limitadas. Se você souber quando as consultas são descartadas, você poderá procurar soluções que reduzam a carga ou aumentem a capacidade. Por exemplo, se as consultas limitadas aumentarem durante a indexação, você poderá adiar isso até a atividade de consulta diminua.
Se você estiver efetuando push dos limites de uma configuração de partição de réplica específica, a configuração de alertas para limites de volume de consulta (QPS) também será útil.
Em Monitoramento, selecione Alertas e, em seguida, selecione Criar regra de alerta.
Em Condição, selecione Adicionar.
Configurar a lógica do sinal. Para o tipo de sinal, escolha as métricas e selecione o sinal.
Depois de selecionar o sinal, você pode usar um gráfico para visualizar dados históricos para uma decisão informada sobre como proceder com a configuração de condições.
Em seguida, role para baixo até a lógica de alertas. Para prova de conceito, você pode especificar um valor artificialmente baixo para fins de teste.
Em seguida, especifique ou crie um Grupo de Ações. Essa é a resposta a ser invocada quando o limite é atingido. Pode ser uma notificação por push ou uma resposta automatizada.
Por fim, especifique os detalhes do alerta. Nomeie e descreva o alerta, atribua um valor de severidade e especifique se a regra deve ser criada em um estado habilitado ou desabilitado.
Se você especificou uma notificação por email, receberá um email de "Microsoft Azure" com uma linha de assunto "Azure: Severidade Ativada: 3 <your rule name>".
Próximas etapas
Se você ainda não fez isso, examine os conceitos básicos do monitoramento do serviço de pesquisa para saber mais sobre toda a gama de recursos de supervisão.