Planen und Verwalten der Kosten eines Azure KI Search-Diensts

Note

Azure KI-Suche ist über das Azure Portal, REST-APIs und Azure SDKs verfügbar. Es unterstützt auch Foundry IQ, die verwaltete Wissensschicht, die Unternehmensinhalte in wiederverwendbare, berechtigungsfähige Wissensbasen für Agenten im Microsoft Foundry-Portal transformiert.

Azure KI-Suche ist in zwei Preismodellen verfügbar:

  • Dedizierte: Bereitgestellte Kapazität mit festen Preisen. Sie wählen eine Dienstebene aus, und Sie werden pro Stunde abgerechnet, basierend auf Sucheinheiten (SUs). Am besten geeignet für stabile, vorhersagbare, auslastungsintensive Workloads.

  • Serverless (Vorschau): Verbrauchsbasierte Preisgestaltung basierend auf Compute-Einheiten pro Stunde (CU/hr) und pro GB/Monat für indizierten Speicher. Am besten geeignet für sporadische, sprunghafte oder stark schwankende Arbeitslasten.

In diesem Artikel wird erläutert, wie die Abrechnung unter jedem Modell funktioniert und Anleitungen für die Kostenschätzung, Minimierung und Überwachung bietet.

Grundlegendes zum Preismodell

Azure KI-Suche verfügt über zwei primäre Preismodelle: Dedizierte und Serverless. Für beide Modelle fallen separate Gebühren für Premiumfunktionen wie semantisches Ranking, agentische Informationsabrufung und KI-gestützte Anreicherung an.

Azure KI-Suche Gebühren sind eine Komponente Ihrer gesamt Azure Rechnung. Sie werden für alle in Ihrem Abonnement verwendeten Azure Dienste und Ressourcen in Rechnung gestellt, einschließlich Der Dienste außerhalb von Azure KI-Suche.

Verwenden Sie für dedizierte Dienste den Azure Preisrechner, um Kosten basierend auf Ihren geplanten capacity und Features zu schätzen. Ein Kapazitätsplanungsarbeitsblatt kann Ihnen dabei helfen, die erwartete Indexgröße, den Indizierungsdurchsatz und die Indizierungskosten zu modellieren.

Wenn sich Ihr Suchworkload weiterentwickelt, befolgen Sie diese Tipps, um die Kosten während der Bereitstellung und des Betriebs zu minimieren. Sie können auch integrierte Metriken verwenden, um Abfrageanforderungen und Kostenverwaltung zu überwachen, um Budgets, Warnungen und Datenexporte zu erstellen.

Dediziertes Preismodell

Wenn Sie einen dedizierten Suchdienst erstellen oder verwenden, zahlen Sie für die mindestens erforderliche Replikat- und Partitionskombination (R × P) zum anteiligen Stundensatz des von Ihnen ausgewählten Diensttarifs. Jede Replikat- und Partitionskombination stellt eine Einheit der dedizierten Kapazität dar.

Weitere Informationen zu den verfügbaren Dienstebenen finden Sie unter Auswählen eines Preismodells und einer Serviceebene.

Wenn Sie die Anzahl der Replikate oder Partitionen erhöhen oder verkleinern, ändern sich die Gesamtsucheinheiten, und die Kosten werden entsprechend skaliert. Weitere Informationen und Beispiele finden Sie unter Abrechnungsraten.

Serverloses Preismodell (Vorschau)

Von Bedeutung

Der serverlose Entwicklertarif ist derzeit als Vorschau verfügbar. Diese Vorschau wird ohne Vereinbarung auf Serviceebene bereitgestellt und wird für Produktionsworkloads nicht empfohlen. Manche Features werden möglicherweise nicht unterstützt oder sind nur eingeschränkt verwendbar. Weitere Informationen finden Sie unter Supplementale Nutzungsbedingungen für Microsoft Azure Previews.

Die Abrechnung für die Stufe "Serverless Developer" begann am 13. September 2026. Gebühren für die Nutzung am oder nach diesem Datum werden auf Ihrer Azure Rechnung angezeigt. Sie werden nicht vor dem 13. September 2026 für die Nutzung belastet. Die Serverless Developer-Stufe unterstützt keine Migration zu oder von anderen Preisstufen, und einige Features, die auf anderen Ebenen verfügbar sind, werden während der öffentlichen Vorschau nicht unterstützt. Servicelimits, unterstützte Features und Preisdetails können sich vor der allgemeinen Verfügbarkeit ändern.

Während der Vorschau wird das Serverless-Preismodell nur in bestimmten Regionen unterstützt.

Das Serverless-Preismodell rechnet nutzungsbasiert ab, ohne vorab bereitgestellte oder ungenutzte Kapazitäten. Sie zahlen nur für die von Vorgängen verbrauchten Computeressourcen und den von Ihren Indizes verwendeten Speicher.

Im Gegensatz zum dedizierten Modell konfigurieren Sie keine Replikate oder Partitionen. Der Dienst verwaltet die Kapazität automatisch basierend auf Workloadbedarf und Dienstgrenzwerten.

Die serverlose Abrechnung hat zwei unabhängige Dimensionen:

  • Rechenleistung (Recheneinheiten, CU):
    Die Berechnungsnutzung wird in Computeeinheiten pro Stunde (CUs/hr) gemessen. Berechnungskosten werden durch Faktoren wie Abfragekomplexität, Indexgröße, Datenvolumen und Vorgangstyp (Abfragen, Indizierung oder Anreicherung) gesteuert.

  • Indizierter Speicher:
    Der Speicher wird pro GB pro Monat berechnet, basierend auf der Datenträgergröße Ihrer Indizes. Diese Größe umfasst indizierte Inhalte und unterstützende Datenstrukturen, die zum Abrufen verwendet werden.

Wie Ihnen Premium-Funktionen berechnet werden

Premium-Features entstehen zusätzlich zu den Berechnungs- und Speichergebühren für Ihren Suchdienst, unabhängig davon, ob Sie das Preismodell "Dedicated" oder "Serverless" verwenden.

In der folgenden Tabelle sind Premium-Features und ihre Abrechnungseinheiten aufgeführt. Alle diese Features sind optional. Wenn Sie sie also nicht verwenden, entstehen keine Gebühren.

Feature Abrechnungseinheit
Bildextraktion (KI-Anreicherung) 1 Pro 1.000 Bildern. Siehe Seite zu Preisen.
Benutzerdefinierte Entitäts-Nachschlagefähigkeit (KI-Anreicherung) Pro 1.000 Texteinträgen. Informieren Sie sich auf der Preisseite
Integrierte oder benutzerdefinierte Fähigkeiten (KI-Anreicherung ) 2 Anzahl der Transaktionen. Abgerechnet zum Tarif des Modellanbieters: Microsoft Foundry oder in Azure gehostete Modelle oder Ressourcen.
Vectorizers2 Anzahl der Vektorisierungsvorgänge. Abgerechnet mit der Rate des Modellanbieters: Azure Vision in Foundry Tools, Azure OpenAI oder Foundry.
Semantischer Sortierer Anzahl der Abfragen von queryType=semantic. Berechnet mit einem progressiven Zinssatz. Siehe Seite zu Preisen.
Agent-Abruf Anzahl der agentischen Begründungstoken sowie anzahl der Token, die in der Abfrageplanung und Antwortformulierung verwendet werden. Siehe Seite zu Preisen.
Freigegebener privater Link Die Bandbreite wird abgerechnet, solange der freigegebene private Link vorhanden ist und verwendet wird.

1 Bezieht sich auf Bilder, die aus einer Datei in der Indexerpipeline extrahiert wurden. Die Textextraktion ist frei. Die Bildextraktion wird abgerechnet, wenn Sie den indexAction Parameter aktivieren oder die Dokumentextraktionsfähigkeitaufrufen.

2 Gebühren für Azure OpenAI-Modelle und Gießereimodelle werden auf Ihrer Rechnung für diese Dienste angezeigt.

Wie Sie andernfalls belastet werden

Je nach Konfiguration und Nutzung können die folgenden Gebühren anfallen:

  • Der Datenverkehr kann zu Netzwerkkosten führen. Sehen Sie sich die Bandbreitenpreise an.

  • Mehrere Premium-Features wie Wissensspeicher, Debugsitzungen1 und Anreicherungscaches (Vorschau) hängen von Azure Storage ab und verursachen Speicherkosten. Gebühren für diese Features werden in Ihrer Azure Storage-Rechnung angezeigt.

  • Vom Kunden verwaltete Schlüssel, die eine doppelte Verschlüsselung vertraulicher Inhalte bereitstellen, erfordern einen abrechnenden Azure Key Vault.

  • Ein Skillset kann integrierte Fähigkeiten, nicht zu berechenbare integrierte Hilfsfertigkeiten und benutzerdefinierte Fähigkeiten umfassen. Nicht abgerechnete Hilfsfertigkeiten umfassen bedingten, Shaper-, Textzusammenführungund Textteilung. Sie besitzen keine API-Schlüsselanforderung oder 20-Dokument-Grenze.

  • Bei einer benutzerdefinierten Qualifikation handelt es sich um die von Ihnen bereitgestellte Funktionalität. Benutzerdefinierte Fähigkeiten können nur abgerechnet werden, wenn sie andere abrechnende Dienste aufrufen. Sie besitzen keine API-Schlüsselanforderung oder 20-Dokument-Grenze.

1 Debugsitzungen sind nur in den dedizierten Preismodelldiensten verfügbar.

Note

Bei dedizierten Diensten werden Sie nicht pro Abfrage in Rechnung gestellt. Servicelimits gelten jedoch für jede Preisstufe. Bei Serverless verbrauchen Abfragen CU/hr, abhängig von Komplexität und Indexgröße.

Kosten für das dedizierte Preismodell schätzen und planen

Um die Kosten für das Modell mit dedizierter Preisgestaltung zu schätzen, verwenden Sie den Azure-Preisrechner, um Ihre Basiskosten für Azure KI-Suche zu ermitteln. Während der Diensterstellung finden Sie auch geschätzte Kosten und Tiervergleiche auf der Seite "Preisstufe auswählen ".

Erstellen Sie zum ersten Testen des dedizierten Preismodells ein Arbeitsblatt für die Kapazitätsplanung. Das Arbeitsblatt hilft Ihnen, das Index-zu-Quell-Verhältnis und die Auswirkungen von Anreicherungs- oder Vektorfeatures auf Kapazität und Kosten zu verstehen.

So erstellen Sie ein Kapazitätsplanungsarbeitsblatt:

  1. Indizieren Sie eine kleine Stichprobe (1 bis 5 %) Ihrer Daten. Schließen Sie OCR-, Anreicherungs- oder Einbettungsfähigkeiten ein, die Sie verwenden möchten.

  2. Messen Sie die Indexgröße, den Indizierungsdurchsatz und die Indizierungskosten.

  3. Extrapolieren Sie die Ergebnisse, um die vollständigen Anforderungen für Ihre Daten zu schätzen.

Kosten für serverloses Preismodell schätzen und planen

Um Die Kosten in Serverless zu schätzen und zu verwalten, überwachen Sie sowohl die Berechnungsnutzung als auch die Indexgröße, und optimieren Sie Abfragen und schemadesign, um die Ressourcenauslastung zu reduzieren.

Indizieren Sie zunächst eine repräsentative Stichprobe, führen Sie dann typische Abfragen aus und messen Sie den CU-Verbrauch über x-ms-request-charge. Nachdem Sie einen Verbrauchsdurchschnitt haben, werden die Kosten basierend auf diesem Durchschnitt extrapoliert. Informationen zur Überwachung der Compute-Nutzung finden Sie in Kosten mit dem Serverless-Preismodell optimieren.

Minimieren der Kosten für das dedizierte Preismodell

Verwenden Sie die folgenden Strategien, um die Kosten für das dedizierte Preismodell zu minimieren:

Bereitstellung und Konfiguration

  • Erstellen Sie einen Suchdienst in einer Region mit mehr Speicher pro Partition.

  • Erstellen Sie alle zugehörigen Azure-Ressourcen in derselben Region (oder so wenige Regionen wie möglich), um Bandbreitengebühren zu minimieren oder zu beseitigen.

  • Wählen Sie die leichteste Dienstebene aus, die Ihren Anforderungen entspricht. Basic und S1 bieten vollzugriff auf die moderne API mit dem niedrigsten Stundensatz pro SU. * Bei Workloads mit variablem oder platzigem Datenverkehr ist das Serverless-Preismodell möglicherweise kostengünstiger als ein kontinuierlich bereitgestellter Basic- oder S1-Dienst.

  • Verwenden Sie Azure Web-Apps für Ihre Front-End-Anwendung, um Anforderungen und Antworten innerhalb der Rechenzentrumsgrenze beizubehalten.

Scaling

  • Fügen Sie Partitionen nur hinzu, wenn die Indexgröße oder der Aufnahmedurchsatz dies erfordert.

  • Fügen Sie Replikate nur hinzu, wenn Ihre Abfragen pro Sekunde erhöht werden, wenn komplexe Abfragen Ihren Dienst drosseln oder wenn hohe Verfügbarkeit erforderlich ist.

  • Skalieren Sie für ressourcenintensive Vorgänge wie die Indizierung und verringern Sie die Kapazität dann wieder für normale Abfragelasten.

  • Schreiben Sie Code, um die Skalierung für vorhersagbare Workloadmuster zu automatisieren.

  • Denken Sie daran, dass Kapazität und Preise nicht linear sind. Das Verdoppeln der Kapazität verursacht mehr als doppelt so hohe Kosten in derselben Ebene. Um eine bessere Leistung zu einem ähnlichen Preis zu erzielen, sollten Sie auf eine höhere Stufe umsteigen.

Indizierung und Anreicherung

Minimieren der Kosten für das Serverless-Preismodell

Verwenden Sie die folgenden Strategien, um die Kosten für das dedizierte Preismodell zu minimieren:

  • Überwachen Sie die CU/Hr-Telemetrie, um teure Abfragen zu identifizieren.
  • Verwenden Sie den einfachsten Abfragetyp, der den Relevanzanforderungen entspricht.
  • Entfernen Sie nicht verwendete Indizes, um die Speicherkosten zu reduzieren.

Weitere Informationen: Optimieren Sie die Kosten mit dem Serverless-Preismodell.

Kosten überwachen

Auf Dienstebene können Sie integrierte Metriken für Abfragen pro Sekunde (QPS), Suchlatenz, gedrosselte Abfragen und Indexgröße überwachen.

Die Verwendung dieser Metriken hängt von Ihrem Preismodell ab:

  • Dediziertes Preismodell:
    Verwenden Sie QPS-, Latenz- und Drosselungsmetriken, um zu bestimmen, wann Replikate oder Partitionen hinzugefügt oder entfernt werden sollen. Die Skalierungskapazität wirkt sich direkt auf Leistung und Kosten aus, sodass Sie diese Signale überwachen können, um Ihre Sucheinheiten zu optimieren.

  • Serverloses Preismodell:
    Verwenden Sie diese Metriken, um Arbeitsauslastungsmuster zu verstehen und Kostentreiber zu identifizieren. Da serverlose Kapazität automatisch verwaltet wird, skalieren Sie nicht, indem Sie Replikate oder Partitionen hinzufügen. Konzentrieren Sie sich stattdessen auf die Überwachung des Berechnungsverbrauchs und die Optimierung der Nutzung.

Für Serverless können Sie die Berechnungsauslastung pro Anforderung mithilfe des x-ms-request-charge Antwortheaders überwachen und Abfragemuster mithilfe von Azure Monitor Protokollen analysieren. Die Nachverfolgung des CU-Verbrauchs nach Abfragetyp oder Workload hilft dabei, Möglichkeiten zur Kostensenkung durch Abfrageoptimierung, Schemadesign oder Workloadverteilung zu identifizieren.

Auf Abonnement- oder Ressourcengruppenebene bietet die Kostenverwaltung Tools zum Nachverfolgen, Analysieren und Steuern von Kosten. Kostenverwaltung verwenden, um:

  • Erstellen Sie Budgets , die den Fortschritt für Ausgabenlimits definieren und nachverfolgen. Um die Überwachung genauer zu überwachen, passen Sie Ihre Budgets mithilfe von Filtern für bestimmte Azure Ressourcen oder Dienste an. Mithilfe von Filtern wird sichergestellt, dass die Kostennachverfolgung an bestimmte Workloads oder Bereitstellungen ausgerichtet ist.

  • Erstellen Sie Warnungen , die Projektbeteiligte automatisch über Ausgabenanomalien oder überstehende Risiken informieren. Warnungen basieren auf Ausgaben im Vergleich zu Budget- und Kostenschwellenwerten und gelten auf Abonnement- oder Ressourcengruppenebene.

  • Exportieren Von Kostendaten in ein Speicherkonto zur tieferen Analyse. Beispielsweise können Finanzteams exportierte Daten mithilfe von Excel oder Power BI analysieren. Das Exportieren von Kostendaten in einem Zeitplan ist die empfohlene Methode zum Abrufen von Kostendatensätzen.

FAQ

Kann ich einen Suchdienst vorübergehend herunterfahren, um Kosten zu sparen?

Die Suche wird als kontinuierlicher Dienst ausgeführt. Dedizierte Ressourcen sind ständig betriebsbereit und exklusiv für Ihre Nutzung während der gesamten Laufzeit Ihres Dienstes zugeordnet.

Im Modell für dedizierte Preise müssen Sie den Dienst löschen, um die Abrechnung vollständig zu beenden. Das Löschen eines Diensts ist endgültig und löscht auch die zugehörigen Daten.

Im Serverless-Preismodell fallen im Leerlauf keine Gebühren für Rechenleistung an. Sie zahlen nur für den indizierten Speicher, während der Dienst keine Anforderungen verarbeitet.

Kann ich das Preismodell oder den Abrechnungssatz (Stufe) eines vorhandenen Suchdiensts ändern?

Nachdem Sie das Preismodell "Dedicated" oder "Serverless" ausgewählt haben, können Sie Ihre KI-Suchdienste nicht zwischen den beiden konvertieren.

Wenn Sie das Dedizierte Preismodell auswählen, können Ihre vorhandenen Dienste zwischen den Stufen "Basic" und "Standard" (S1, S2 und S3) wechseln. Ihre aktuelle Dienstkonfiguration darf die Grenzwerte der Zielebene nicht überschreiten, und Ihre Region kann keine Kapazitätsbeschränkungen auf der Zielebene aufweisen. Weitere Informationen finden Sie unter Ändern Ihres Preisniveaus.