Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Note
Pesquisa de IA do Azure está disponível por meio do portal Azure, APIs REST e SDKs do Azure. Ele também sustenta o IQ do Foundry, a camada de conhecimento gerenciado que transforma o conteúdo da empresa em bases de conhecimento reutilizáveis e com reconhecimento de permissão para agentes no portal do Microsoft Foundry.
Pesquisa de IA do Azure está disponível em dois modelos de preços:
Dedicado: capacidade provisionada com preço fixo. Você seleciona um nível de serviço, e a cobrança é feita por hora, com base em SUs (Unidades de Pesquisa). Melhor para cargas de trabalho estáveis, previsíveis e de alta utilização.
Serverless (prévia): preços com base no consumo, medidos em Unidades de Computação por hora (CU/hr) e por GB/mês para armazenamento indexado. Melhor para cargas de trabalho pouco frequentes, com intermitência ou altamente variáveis.
Este artigo explica como a cobrança funciona em cada modelo e fornece diretrizes para estimativa de custos, minimização e monitoramento.
Entender o modelo de preços
Pesquisa de IA do Azure tem dois modelos de preços primários: Dedicado e sem servidor. Ambos os modelos têm cobranças separadas por recursos premium, como classificador semântico, recuperação agêntica e enriquecimento por IA.
Pesquisa de IA do Azure encargos são um componente da sua fatura geral de Azure. Você é cobrado por todos os serviços e recursos do Azure usados na sua assinatura, incluindo serviços fora do Pesquisa de IA do Azure .
Para serviços dedicados, use a calculadora de preços do Azure para estimar os custos com base na capacidade planejada e nos recursos. Uma planilha de planejamento de capacidade pode ajudá-lo a modelar o tamanho do índice, a taxa de transferência de indexação e os custos de indexação esperados.
À medida que a carga de trabalho de pesquisa evolui, siga estas dicas para minimizar os custos durante a implantação e a operação. Você também pode usar métricas internas para monitorar solicitações de consulta e Gerenciamento de Custos para criar orçamentos, alertas e exportações de dados.
Modelo de preço dedicado
Ao criar ou usar um serviço Pesquisa dedicado, você paga pela combinação mínima de replicação e partição necessária (R × P) na taxa proporcional por hora da camada de serviço selecionada. Cada combinação de réplica e partição representa uma unidade de capacidade dedicada.
Para obter mais detalhes sobre as camadas de serviço disponíveis, consulte Escolher um modelo de preços e uma camada de serviço.
À medida que você aumenta ou diminui o número de réplicas ou partições, o total de unidades de pesquisa é alterado e os custos são dimensionados adequadamente. Para obter mais informações e exemplos, consulte as taxas de cobrança.
Modelo de preço sem servidor (versão prévia)
Importante
A camada desenvolvedor sem servidor está atualmente em versão prévia. Essa versão prévia é fornecida sem um contrato de nível de serviço e não é recomendada para cargas de trabalho de produção. Alguns recursos podem não ter suporte ou podem ter restrição de recursos. Para obter mais informações, consulte Termos de Uso Complementares para Versões Prévias do Microsoft Azure.
A cobrança da camada Serverless Developer teve início em 13 de setembro de 2026. Os encargos de uso em ou após essa data aparecem em sua fatura Azure. Você não é cobrado pelo uso antes de 13 de setembro de 2026.
A camada de Desenvolvedor sem Servidor não dá suporte à migração para ou de outros tipos de preço e alguns recursos disponíveis em outras camadas não têm suporte durante a Visualização Pública. Limites de serviço, recursos com suporte e detalhes de preços podem ser alterados antes da disponibilidade geral.
Durante a visualização, o modelo de preços sem servidor tem suporte apenas em regiões específicas.
O modelo de preços sem servidor cobra com base no uso, sem capacidade pré-provisionada ou ociosa. Você paga apenas pelos recursos de computação consumidos pelas operações e pelo armazenamento usado pelos índices.
Ao contrário do modelo Dedicado, você não configura réplicas ou partições. O serviço gerencia automaticamente a capacidade com base na demanda de carga de trabalho e nos limites de serviço.
A cobrança sem servidor tem duas dimensões independentes:
Computação (Unidades de Computação,):
O uso de computação é medido em CUs /hr (Unidades de Computação por hora). O custo de computação é impulsionado por fatores como complexidade de consulta, tamanho do índice, volume de dados e tipo de operação (consulta, indexação ou enriquecimento).Armazenamento indexado:
O armazenamento é cobrado por GB por mês com base no tamanho em disco dos índices. Esse tamanho inclui conteúdo indexado e estruturas de dados de suporte usadas para recuperação.
Como você é cobrado pelas funcionalidades premium
Os recursos Premium incorrem em encargos além dos encargos de computação e armazenamento do serviço de pesquisa, independentemente de você usar o modelo de preço dedicado ou sem servidor.
A tabela a seguir lista os recursos premium e suas unidades de cobrança. Todos esses recursos são opcionais, portanto, se você não usá-los, não incorre em encargos.
| Feature | Unidade de cobrança |
|---|---|
| Extração de imagem (enriquecimento de IA) 1 | Por 1.000 imagens. Consulte a página de preços. |
| Habilidade de pesquisa de entidade personalizada (enriquecimento de IA) | Por 1.000 registros de texto. Confira a página de preços |
| Habilidades internas ou personalizadas (enriquecimento de IA) 2 | Número de transações. Cobrado de acordo com a tarifa do provedor do modelo: Microsoft Foundry ou modelos ou recursos hospedados no Azure. |
| Vectorizers2 | Número de operações de vetorização. Cobrado de acordo com a taxa do provedor de modelos: Serviço Cognitivo do Azure para Visão no Foundry Tools, OpenAI do Azure ou Foundry. |
| Classificador semântico | Número de consultas de queryType=semantic. Cobrado em uma taxa progressiva. Consulte a página de preços. |
| Recuperação com agentes | Número de tokens de raciocínio agêntico, além do número de tokens usados no planejamento de consultas e na formulação de respostas. Consulte a página de preços. |
| Link privado compartilhado | Cobrado pela largura de banda desde que o link privado compartilhado exista e seja usado. |
1 Refere-se às imagens extraídas de um arquivo dentro do pipeline do indexador. A extração de texto é gratuita. A extração de imagem é cobrada quando você habilita o indexAction parâmetro ou quando chama a habilidade de Extração de Documentos.
2 Encargos para Modelos do OpenAI do Azure e Modelos da Fábrica aparecem em sua fatura para esses serviços.
Como você é cobrado de outra forma
Dependendo da configuração e do uso, os seguintes encargos podem ser aplicados:
O tráfego de dados pode incorrer em custos de rede. Consulte o preço da largura de banda.
Vários recursos premium, como repositórios de conhecimento, sessões de depuração1 e caches de enriquecimento (versão prévia), dependem de Armazenamento do Azure e incorrem em custos de armazenamento. Os encargos pelos recursos aparecem na fatura do armazenamento do Azure.
As chaves gerenciadas pelo cliente, que fornecem criptografia dupla de conteúdo confidencial, exigem um Azure Key Vault faturável.
Um conjunto de habilidades pode incluir habilidades internas faturáveis, habilidades internas utilitárias não faturáveis e habilidades personalizadas. As habilidades do utilitário sem cobrança incluem Condicional, Formador, Mesclagem deTexto e Divisão de Texto. Eles não têm um requisito de chave de API ou um limite de 20 documentos.
A habilidade personalizada é a funcionalidade que você fornece. As habilidades personalizadas só poderão ser cobrada se chamarem outros serviços faturáveis. Eles não têm um requisito de chave de API ou um limite de 20 documentos.
1 As sessões de depuração estão disponíveis apenas nos serviços do modelo de preços dedicado.
Note
Em serviços dedicados, você não é cobrado por consulta. No entanto, os limites de serviço se aplicam a cada tipo de preço. No modo Serverless, as consultas consomem CU/hr com base na complexidade e no tamanho do índice.
Estimar e planejar custos para o modelo de preços dedicado
Para estimar os custos do modelo de preço dedicado, use a calculadora de preços Azure para estimar os custos de linha de base para Pesquisa de IA do Azure . Você também pode encontrar os custos estimados e comparações de camada na página Selecionar Tipo de Preço durante a criação do serviço.
Para testes iniciais do modelo de preço dedicado, crie uma planilha de planejamento de capacidade. A planilha ajuda a entender a proporção índice-origem e o efeito das características de enriquecimento ou de vetor tanto na capacidade quanto no custo.
Para criar uma planilha de planejamento de capacidade:
Indexe uma amostra pequena (1 a 5%) de seus dados. Inclua qualquer OCR, enriquecimento ou habilidades de inserção que você planeja usar.
Meça o tamanho do índice, o desempenho de indexação e os custos de indexação.
Extrapole os resultados para estimar os requisitos de escala total para seus dados.
Estimar e planejar custos para o modelo de preços sem servidor
Para estimar e gerenciar custos no Serverless, monitore o consumo de computação e o tamanho do índice e otimize as consultas e o design do esquema para reduzir o uso de recursos.
Primeiro, indexe uma amostra representativa e, depois, execute consultas típicas e meça o consumo de CU por meio de x-ms-request-charge. Depois de ter uma média de consumo, extrapole os custos com base nessa média. Para obter diretrizes sobre como monitorar o uso da computação, consulte Otimizar custos com o modelo de preços sem servidor.
Minimizar os custos para o modelo de preços dedicado
Para minimizar os custos para o modelo de preços dedicado, use as seguintes estratégias:
Implantação e configuração
Crie um serviço de pesquisa em uma região com mais armazenamento por partição.
Crie todos os recursos relacionados do Azure na mesma região (ou o menor número possível de regiões) para minimizar ou eliminar encargos de largura de banda.
Escolha a camada de serviço mais leve que atenda às suas necessidades. Basic e S1 oferecem acesso total à API moderna à menor taxa por hora por unidade de serviço (SU). * Para cargas de trabalho com tráfego variável ou intermitido, o modelo de preços sem servidor pode ser mais econômico do que um serviço Básico ou S1 provisionado continuamente.
Use os Aplicativos Web do Azure para seu aplicativo front-end para manter solicitações e respostas dentro do limite do data center.
Scaling
Adicione partições somente quando o tamanho do índice ou a taxa de transferência de ingestão exigir.
Adicione réplicas somente quando suas consultas por segundo aumentarem, quando consultas complexas estiverem limitando seu serviço ou quando a alta disponibilidade for necessária.
Aumente a capacidade para operações com uso intensivo de recursos, como indexação, e, em seguida, reduza a capacidade para cargas de trabalho de consulta regulares.
Escreva código para automatizar o dimensionamento para padrões previsíveis de carga de trabalho.
Lembre-se de que a capacidade e os preços não são lineares. Dobrar a capacidade mais do que dobra os custos na mesma camada. Para obter um melhor desempenho a um preço semelhante, considere mudar para um nível mais alto.
Indexação e enriquecimento
Use a indexação incremental para processar apenas dados novos ou alterados.
Use o cache de enriquecimento e um repositório de conhecimento para reutilizar conteúdo enriquecido anteriormente. Embora o cache incorre em um custo de armazenamento, ele reduz o custo cumulativo do enriquecimento de IA.
Mantenha as cargas de vetor compactas. Para pesquisa de vetor, consulte as práticas recomendadas de compactação de vetor.
Minimizar os custos para o modelo de preços sem servidor
Para minimizar os custos para o modelo de preços dedicado, use as seguintes estratégias:
- Monitore a telemetria de CU/hr para identificar consultas dispendiosas.
- Use o tipo de consulta mais simples que atenda às necessidades de relevância.
- Remova índices não utilizados para reduzir os custos de armazenamento.
Saiba mais: otimize os custos com o modelo de preços sem servidor.
Monitorar custos
No nível do serviço, você pode monitorar métricas internas para consultas por segundo (QPS), latência de pesquisa, consultas limitadas e tamanho do índice.
A maneira como você usa essas métricas depende do seu modelo de preços:
Modelo de preço dedicado:
Use métricas de QPS, latência e limitação de taxa para determinar quando adicionar ou remover réplicas ou partições. O dimensionamento da capacidade afeta diretamente o desempenho e o custo, portanto, o monitoramento desses sinais ajuda você a otimizar suas unidades de pesquisa.Modelo de preços sem servidor:
Use essas métricas para entender os padrões de carga de trabalho e identificar drivers de custo. Como a capacidade sem servidor é gerenciada automaticamente, você não dimensiona adicionando réplicas ou partições. Em vez disso, concentre-se no monitoramento do consumo de computação e na otimização do uso.
Para o Serverless, você pode monitorar o uso de computação por solicitação usando o cabeçalho de resposta x-ms-request-charge e analisar padrões de consulta usando Azure Monitor logs. Acompanhar o consumo de CU por tipo de consulta ou por carga de trabalho ajuda a identificar oportunidades para reduzir custos por meio da otimização de consultas, da modelagem do esquema ou da distribuição da carga de trabalho.
No nível da assinatura ou do grupo de recursos, o Gerenciamento de Custos fornece ferramentas para acompanhar, analisar e controlar os custos. Use o Gerenciamento de Custos para:
Crie orçamentos que definem e acompanhem o progresso em relação aos limites de gastos. Para monitoramento mais granular, personalize seus orçamentos usando filters para recursos ou serviços Azure específicos. Os filtros ajudam a garantir que o controle de custos esteja alinhado a cargas de trabalho ou implantações específicas.
Crie alertas que notifiquem automaticamente os stakeholders sobre anomalias de gastos ou riscos de gastos excessivos. Os alertas são baseados em gastos em comparação com os limites de orçamento e custo e se aplicam no nível da assinatura ou do grupo de recursos.
Exportar dados de custo para uma conta de armazenamento para uma análise mais profunda. Por exemplo, as equipes de finanças podem analisar dados exportados usando Excel ou Power BI. Exportar dados de custo em um agendamento é o método recomendado para recuperar conjuntos de dados de custo.
perguntas frequentes
Posso desligar um serviço de pesquisa temporariamente para economizar nos custos?
A pesquisa é executada como um serviço contínuo. Os recursos dedicados estão sempre operacionais e alocados para seu uso exclusivo durante o tempo de vida do serviço.
No modelo de preço dedicado, para interromper totalmente a cobrança, você deve excluir o serviço. Excluir um serviço será permanente e também exclui seus dados associados.
No modelo de preços sem servidor, não há cobrança de computação no modo ocioso. Você paga apenas pelo armazenamento indexado enquanto o serviço não está processando solicitações.
Posso alterar o modelo de preços ou o nível de cobrança (nível) de um serviço de busca existente?
Depois de escolher o modelo de preço dedicado ou sem servidor, você não poderá converter seus serviços de Pesquisa de IA entre os dois.
Se você escolher o modelo de preço dedicado, seus serviços existentes poderão alternar entre as camadas Básica e Standard (S1, S2 e S3). Sua configuração de serviço atual não pode exceder os limites da camada de destino e sua região não pode ter restrições de capacidade na camada de destino. Para obter mais informações, consulte Alterar seu tipo de preço.