Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Note
Recherche Azure AI est disponible via le portail Azure, les API REST et les SDK Azure. Il sous-tend également Foundry IQ, la couche de connaissances managée qui transforme le contenu d’entreprise en bases de connaissances réutilisables et prenant en charge les autorisations pour les agents dans le portail Microsoft Foundry.
Recherche Azure AI est disponible dans deux modèles tarifaires :
Dédié : capacité approvisionnée avec tarification fixe. Vous sélectionnez un niveau de service et vous êtes facturé par heure en fonction des unités de recherche (SU). Idéal pour les charges de travail stables, prévisibles et à forte utilisation.
Serverless (préversion) : tarification basée sur la consommation mesurée par unités de calcul par heure (CU/hr) et par Go/mois pour le stockage indexé. Idéal pour les charges de travail ponctuelles, par pics ou très variables.
Cet article explique comment la facturation fonctionne sous chaque modèle et fournit des conseils pour l’estimation des coûts, la minimisation et la surveillance.
Comprendre le modèle de tarification
Recherche Azure AI a deux modèles de tarification principaux : dédié et serverless. Les deux modèles entraînent des frais distincts pour les fonctionnalités Premium telles que le classement sémantique, la récupération agentique et l’enrichissement par IA.
Recherche Azure AI frais sont un composant de votre facture globale Azure. Vous êtes facturé pour tous les services et ressources Azure utilisés dans votre abonnement, y compris les services en dehors de Recherche Azure AI.
Pour les services dédiés, utilisez la calculatrice de prix Azure pour estimer les coûts en fonction de votre capacité planifiée et des fonctionnalités. Une feuille de calcul de planification de capacité peut vous aider à modéliser la taille d’index attendue, l’indexation du débit et les coûts d’indexation.
À mesure que votre charge de travail de recherche évolue, suivez ces conseils pour réduire les coûts pendant le déploiement et l’opération. Vous pouvez également utiliser des métriques intégrées pour surveiller les requêtes et Cost Management pour créer des budgets, des alertes et des exportations de données.
Modèle de tarification dédié
Lorsque vous créez ou utilisez un service de recherche dédié, vous payez pour la combinaison minimale requise de réplica et de partition (R × P) au taux horaire calculé au prorata du niveau de service que vous sélectionnez. Chaque combinaison de réplicas et de partitions représente une unité de capacité dédiée.
Pour plus d’informations sur les niveaux de service disponibles, consultez Choisir un modèle tarifaire et un niveau de service.
Lorsque vous augmentez ou diminuez le nombre de réplicas ou de partitions, le nombre total d’unités de recherche change, et les coûts augmentent ou diminuent en conséquence. Pour plus d’informations et d’exemples, consultez Tarifs de facturation.
Modèle de tarification serverless (préversion)
Important
Le niveau Développeur serverlessr est actuellement en préversion. Cette version préliminaire est fournie sans contrat de niveau de service et n’est pas recommandée pour les environnements de production. Certaines fonctionnalités peuvent ne pas être prises en charge ou avoir des fonctionnalités contraintes. Pour plus d’informations, consultez Conditions d'utilisation supplémentaires pour les versions préliminaires de Microsoft Azure.
La facturation de l’offre Développeur sans serveur a débuté le 13 septembre 2026. Les frais d’utilisation sur ou après cette date apparaissent sur votre facture Azure. Vous n’êtes pas facturé pour l’utilisation avant le 13 septembre 2026.
Le niveau Développeur serverless ne prend pas en charge la migration vers ou depuis d’autres niveaux tarifaires et certaines fonctionnalités disponibles sur d’autres niveaux ne sont pas prises en charge pendant la préversion publique. Les limites de service, les fonctionnalités prises en charge et les détails des tarifs peuvent changer avant la disponibilité générale.
Pendant la préversion, le modèle de tarification Serverless est pris en charge uniquement dans des régions spécifiques.
Le modèle de tarification Serverless est facturé en fonction de l’utilisation, sans capacité préprovisionnée ou inactive. Vous payez uniquement pour les ressources de calcul consommées par les opérations et le stockage utilisé par vos index.
Contrairement au modèle dédié, vous ne configurez pas de réplicas ou de partitions. Le service gère automatiquement la capacité en fonction de la demande de charge de travail et des limites de service.
La facturation serverless a deux dimensions indépendantes :
Calcul (unités de calcul, CU) :
L’utilisation du calcul est mesurée en unités de calcul par heure (unités de calcul/heure). Le coût de calcul est piloté par des facteurs tels que la complexité des requêtes, la taille d’index, le volume de données et le type d’opération (interrogation, indexation ou enrichissement).Stockage indexé :
Le stockage est facturé par Go par mois en fonction de la taille sur disque de vos index. Cette taille inclut le contenu indexé et les structures de données associées utilisées pour la recherche.
Comment vous êtes facturé pour les fonctionnalités Premium
Les fonctionnalités Premium entraînent des frais en plus des frais de calcul et de stockage pour votre service de recherche, que vous utilisiez le modèle tarifaire Dédié ou Serverless.
Le tableau suivant répertorie les fonctionnalités Premium et leurs unités de facturation. Toutes ces fonctionnalités sont facultatives. Par conséquent, si vous ne les utilisez pas, vous n’êtes pas facturé.
| Feature | Unité de facturation |
|---|---|
| Extraction d’images (enrichissement par IA) 1 | Par unité de 1 000 images. Consultez la page de tarification. |
| Compétence de recherche d’entité personnalisée (enrichissement par IA) | Par unité de 1 000 enregistrements texte. Consultez la page de tarification |
| Compétences intégrées ou personnalisées (enrichissement par IA) 2 | Nombre de transactions. Facturé au tarif du fournisseur de modèle : Microsoft Foundry ou modèles ou ressources hébergés sur Azure. |
| Vectorizers2 | Nombre d’opérations de vectorisation. Facturé au taux du fournisseur de modèles : Azure Vision dans Foundry Tools, Azure OpenAI ou Foundry. |
| Classeur sémantique | Nombre de requêtes de queryType=semantic. Facturé à un taux progressif. Consultez la page de tarification. |
| Récupération agentique | Nombre de jetons de raisonnement agentiques, ainsi que le nombre de jetons utilisés dans la planification des requêtes et la formulation de réponses. Consultez la page de tarification. |
| Liaison privée partagée | Facturé pour la bande passante tant que la liaison privée partagée existe et est utilisée. |
1 Fait référence aux images extraites d’un fichier dans le pipeline d’indexeur. L’extraction de texte est gratuite. L’extraction d’images est facturée lorsque vous activez le indexAction paramètre ou lorsque vous appelez la compétence Extraction de documents.
2 Frais pour les modèles Azure OpenAI et les modèles Foundry apparaissent sur votre facture pour ces services.
Les autres façons dont vous êtes facturé
Selon votre configuration et votre utilisation, les frais suivants peuvent s’appliquer :
Le trafic de données peut entraîner des coûts réseau. Consultez la tarification de la bande passante.
Plusieurs fonctionnalités Premium, telles que les magasins de connaissances, les sessions de débogage1 et les caches d’enrichissement (préversion) dépendent de stockage Azure et entraînent des coûts de stockage. Les frais liés à ces fonctionnalités s’affichent sur votre facture stockage Azure.
Les clés gérées par le client, qui fournissent un double chiffrement de contenu sensible, nécessitent un coffre de clés Azure facturable.
Un ensemble de compétences peut inclure des compétences intégrées facturables, des compétences utilitaires intégrées non facturables et des compétences personnalisées. Les compétences utilitaires non facturables sont les suivantes : Conditionnel, Shaper, Fusion de texte et Fractionnement de texte. Ils ne disposent pas d’une exigence de clé API ou d’une limite de 20 documents.
Une compétence personnalisée est une fonctionnalité que vous fournissez. Les compétences personnalisées sont facturables uniquement si elles appellent d’autres services facturables. Ils ne disposent pas d’une exigence de clé API ou d’une limite de 20 documents.
1 Les sessions de débogage sont disponibles uniquement dans les services utilisant le modèle tarifaire dédié.
Note
Sur les services dédiés, vous n’êtes pas facturé par requête. Toutefois, les limites de service s’appliquent à chaque niveau tarifaire. Sur Serverless, les requêtes consomment des cu/hr en fonction de la complexité et de la taille de l’index.
Estimer et planifier les coûts pour le modèle de tarification dédié
Pour estimer les coûts du modèle de tarification Dédié, utilisez la calculatrice de prix Azure pour estimer vos coûts de base pour Recherche Azure AI. Vous pouvez également trouver les coûts estimés et les comparaisons de niveaux dans la page Sélectionner le niveau tarifaire lors de la création du service.
Pour les tests initiaux du modèle tarifaire dédié, créez une feuille de calcul de planification de capacité. La feuille de calcul vous aide à comprendre le ratio index-source et l’effet des fonctionnalités d’enrichissement ou de vecteur sur la capacité et le coût.
Pour créer une feuille de calcul de planification de capacité :
Indexez un petit échantillon (1 à 5%) de vos données. Incluez toutes les compétences OCR, enrichissement ou incorporation que vous envisagez d’utiliser.
Mesurez la taille de l’index, le débit d’indexation et les coûts d’indexation.
Extrapolez les résultats pour estimer les exigences de mise à l’échelle complète pour vos données.
Estimer et planifier les coûts pour le modèle de tarification Serverless
Pour estimer et gérer les coûts dans Serverless, surveillez à la fois la consommation de calcul et la taille de l’index, et optimisez la conception des requêtes et du schéma pour réduire l’utilisation des ressources.
Indexez d’abord un échantillon représentatif, puis exécutez des requêtes typiques et mesurez la consommation de CU via x-ms-request-charge. Une fois que vous avez une moyenne de consommation, extrapolez les coûts en fonction de cette moyenne. Pour obtenir des conseils sur la supervision de l’utilisation du calcul, consultez Optimiser les coûts avec le modèle de tarification Serverless.
Réduire les coûts pour le modèle de tarification dédié
Pour réduire les coûts du modèle de tarification dédié, utilisez les stratégies suivantes :
Déploiement et configuration
Créez un service de recherche dans une région avec plus de stockage par partition.
Créez toutes les ressources Azure associées dans la même région (ou autant de régions que possible) pour réduire ou éliminer les frais de bande passante.
Choisissez le niveau de service le plus léger qui répond à vos besoins. Essentiel et S1 offrent un accès complet à l’API moderne au taux horaire le plus bas par unité de stockage. * Pour les charges de travail avec un trafic variable ou en rafale, le modèle de tarification Serverless peut être plus économique qu’un service de base ou S1 approvisionné en continu.
Utilisez Azure Web Apps pour votre application frontale pour conserver les demandes et les réponses au sein de la limite du centre de données.
Scaling
Ajoutez des partitions uniquement lorsque la taille d’index ou le débit d’ingestion l’exige.
Ajoutez des réplicas uniquement lorsque le nombre de vos requêtes par seconde augmente, lorsque des requêtes complexes ralentissent votre service, ou lorsque la haute disponibilité est requise.
Effectuez un scale-up pour les opérations nécessitant beaucoup de ressources, telles que l’indexation, puis réajustez à la baisse les charges de travail de requête régulières.
Écrivez du code pour automatiser la mise à l’échelle pour les modèles de charge de travail prévisibles.
N’oubliez pas que la capacité et la tarification ne sont pas linéaires. Le doublement de la capacité fait que les coûts augmentent de plus du double sur le même palier. Pour de meilleures performances à un prix similaire, envisagez de passer à un niveau supérieur.
Indexation et enrichissement
Utilisez l’indexation incrémentielle pour traiter uniquement les données nouvelles ou modifiées.
Utilisez la mise en cache d’enrichissement et une base de connaissances pour réutiliser le contenu précédemment enrichi. Bien que la mise en cache entraîne des frais de stockage, elle réduit le coût cumulé de l’enrichissement par IA.
Compactez les charges utiles vectorielles. Pour la recherche vectorielle, consultez les meilleures pratiques de compression vectorielle.
Réduire les coûts pour le modèle de tarification Serverless
Pour réduire les coûts du modèle de tarification dédié, utilisez les stratégies suivantes :
- Surveillez les données de télémétrie CU/hr pour identifier les requêtes coûteuses.
- Utilisez le type de requête le plus simple qui répond aux besoins de pertinence.
- Supprimez les index inutilisés pour réduire les coûts de stockage.
En savoir plus : Optimiser les coûts avec le modèle de tarification Serverless.
Superviser les coûts
Au niveau du service, vous pouvez surveiller les métriques intégrées pour les requêtes par seconde (QPS), la latence de recherche, les requêtes limitées et la taille d’index.
L’utilisation de ces métriques dépend de votre modèle de tarification :
Modèle tarifaire dédié :
Utilisez les métriques de QPS, de latence et de limitation du débit pour déterminer quand ajouter ou supprimer des réplicas ou des partitions. La capacité de mise à l’échelle affecte directement les performances et les coûts. Par conséquent, la surveillance de ces signaux vous permet d’optimiser vos unités de recherche.Modèle de tarification serverless :
Utilisez ces métriques pour comprendre les modèles de charge de travail et identifier les pilotes de coûts. Étant donné que la capacité serverless est gérée automatiquement, vous n’effectuez pas de mise à l’échelle en ajoutant des réplicas ou des partitions. Au lieu de cela, concentrez-vous sur la surveillance de la consommation de calcul et l’optimisation de l’utilisation.
Pour le mode Serverless, vous pouvez surveiller l’utilisation des ressources de calcul par requête à l’aide de l’en-tête de réponse x-ms-request-charge et analyser les modèles de requêtes à l’aide des journaux Azure Monitor. Le suivi de la consommation cu par type de requête ou charge de travail permet d’identifier les opportunités de réduction des coûts par le biais de l’optimisation des requêtes, de la conception de schéma ou de la distribution de charge de travail.
Au niveau de l’abonnement ou du groupe de ressources, Cost Management fournit des outils pour suivre, analyser et contrôler les coûts. Utilisez Cost Management pour :
Créez des budgets qui définissent et suivent les progrès par rapport aux limites de dépense. Pour une surveillance plus précise, personnalisez vos budgets à l’aide de filters pour des ressources ou services Azure spécifiques. Les filtres permettent de s’assurer que le suivi des coûts s’aligne sur des charges de travail ou des déploiements spécifiques.
Créez des alertes qui informent automatiquement les parties prenantes des anomalies de dépense ou des risques trop importants. Les alertes sont basées sur les dépenses par rapport aux seuils de budget et de coût, et s’appliquent au niveau de l’abonnement ou du groupe de ressources.
Exportez les données de coût vers un compte de stockage pour une analyse plus approfondie. Par exemple, les équipes financières peuvent analyser les données exportées à l’aide de Excel ou de Power BI. L’exportation des données de coût selon une planification est la méthode recommandée pour récupérer les jeux de données de coût.
FAQ
Puis-je arrêter temporairement un service de recherche pour réduire les coûts ?
La recherche s’exécute en tant que service continu. Les ressources dédiées sont toujours opérationnelles et allouées pour votre utilisation exclusive pendant la durée de vie de votre service.
Dans le modèle tarifaire dédié, pour arrêter entièrement la facturation, vous devez supprimer le service. La suppression d'un service est définitive, et elle entraîne également la suppression des données associées à celui-ci.
Dans le modèle de tarification Serverless, il n’y a pas de frais de calcul en cas d’inactivité. Vous payez uniquement pour le stockage indexé alors que le service ne traite pas les demandes.
Puis-je modifier le modèle tarifaire ou le taux de facturation (niveau) d’un service de recherche existant ?
Une fois que vous avez choisi le modèle tarifaire Dédié ou Serverless, vous ne pouvez pas convertir vos services de recherche IA entre les deux.
Si vous choisissez le modèle tarifaire dédié, vos services existants peuvent basculer entre les niveaux De base et Standard (S1, S2 et S3). Votre configuration de service actuelle ne peut pas dépasser les limites du niveau cible et votre région ne peut pas avoir de contraintes de capacité sur le niveau cible. Pour plus d’informations, consultez Modifier votre niveau tarifaire.