Indexerausführung auf Serverless und Standard 3 High Density (S3 HD) (Vorschau)

Note

Azure KI-Suche ist über das Azure Portal, REST-APIs und Azure SDKs verfügbar. Es unterstützt auch Foundry IQ, die verwaltete Wissensschicht, die Unternehmensinhalte in wiederverwendbare, berechtigungsfähige Wissensbasen für Agenten im Microsoft Foundry-Portal transformiert.

Important

Features, Funktionen oder Eigenschaften, die als (Vorschau) gekennzeichnet sind, werden von keiner Dienstebenenvereinbarung (SLA) abgedeckt, werden für Produktionsworkloads nicht empfohlen und können geändert oder eingeschränkt werden, bevor sie allgemein verfügbar sind. Die Azure KI-Suche Vorschaubedingungen gelten für alle Vorschaufunktionen, unabhängig davon, ob sie eigenständig oder Teil eines allgemein verfügbaren Features ist.

In diesem Artikel wird das Indexerausführungsmodell beschrieben, das Azure KI-Suche für Serverless- und Standard 3 High Density (S3 HD)-Suchdienste verwendet. Beide Optionen verfügen über ein tägliches Laufzeitkontingent auf Dienstebene, das bestimmt, wie viel Gesamtindexerzeit Sie pro 24-Stunden-UTC-Fenster verwenden können.

Die in diesem Artikel beschriebenen Funktionen finden Sie in der Vorschau:

Wofür es angewendet wird

Das Ausführungsmodell in diesem Artikel gilt für:

  • Serverlose Suchdienste , die Indexer mithilfe der 2026-05-01-preview REST-API oder höher ausführen.
  • S3 HD-Suchdienste, die Indexer mithilfe der 2025-11-01-preview REST-API oder höher ausführen.

Unterstützte Indexerdefinitionen, Datenquellen, Fähigkeiten und indizierte Wissensquellen funktionieren ohne Änderungen an beiden Optionen.

Ausführungsmodell

Indexer auf Serverless und S3 HD weisen die folgenden Ausführungsmerkmale auf:

  • Sie stellen keine Indexerinfrastruktur bereit oder verwalten sie nicht. Der Dienst übernimmt die Kapazitätsverwaltung für Sie.

  • Indexer werden nur in der Mehrinstanzenausführungsumgebung ausgeführt. Die private Ausführungsumgebung, die über freigegebene private Linkressourcen bereitgestellt wird, ist für Indexer für diese SKUs nicht verfügbar.

  • Wenn Sie für S3 HD Indizierungsverbindungen benötigen, um das öffentliche Internet zu verlassen, konfigurieren Sie einen Netzwerksicherheitsperimeter (Network Security Perimeter , NSP) in Ihrem Suchdienst, um eingehenden und ausgehenden Datenverkehr über explizite Zugriffsregeln zu steuern.

  • Für Serverless gibt es keine Unterstützung für private Verbindungen.

Tägliches Kontingent für kumulierte Laufzeit

Die Indexerausführung wird durch ein tägliches Laufzeitkontingent gesteuert, das bei 00:00 UTC zurückgesetzt wird. Das Kontingent lautet:

  • Servicelevel: Sie gilt für den Suchdienst als Ganzes.
  • Kumulativ: Die Laufzeit von jedem Indexer im Dienst zählt zu demselben Budget. Das Kontingent wird nicht pro Indexer angewendet.

Die Laufzeit aller laufenden Indexer wird auf ein gemeinsames Servicebudget angerechnet. Der Dienst reserviert keine Laufzeit für einzelne Indexer oder teilt das Kontingent automatisch unter ihnen auf. Beispielsweise können die kumulierten Laufzeiten von 12 Indexern, die jeweils zwei Stunden lang ausgeführt werden, alle 24 aggregierten Laufzeitstunden verbrauchen, unabhängig davon, ob sich die Ausführungen überschneiden oder zu unterschiedlichen Zeiten stattfinden.

In der folgenden Tabelle sind das tägliche Kontingent nach SKU und die mindeste API-Version aufgeführt, die es unterstützt:

Artikelnummer (SKU) Tägliches Kontingent pro 24-Stunden-UTC-Fenster Mindest-API-Version
S3 HD 24 Stunden 2025-11-01-preview
Serverlos 24 Stunden 2026-05-01-preview

Wenn das tageskontingent erschöpft ist:

  • Indexer, die derzeit ausgeführt werden, werden innerhalb von etwa fünf Minuten beendet.

  • Neue Indexerausführungen verarbeiten keine Dokumente und geben sofort einen vorübergehenden Fehler zurück, der angibt, dass das tägliche Kontingent überschritten wurde.

  • Die normale Indexerausführung wird fortgesetzt, nachdem der Zähler um 00:00 UTC zurückgesetzt wurde.

Wiederherstellen nach Kontingentausschöpfung

Um sich von der Erschöpfung des Kontingents zu erholen und die Wahrscheinlichkeit zu verringern, das Kontingent erneut auszuschöpfen:

  • Warten Sie, bis die nächste 00:00 UTC-Zurücksetzung erfolgt, oder verwenden Sie die REST-API ( Get Service Statistics ), um zu bestätigen, dass remainingSeconds vor dem Auslösen neuer Ausführungen aufgefüllt wird.

  • Setzen Sie Indexer auf gestaffelte Zeitpläne , sodass sich die Arbeit über das 24-Stunden-Fenster verteilt, anstatt gleichzeitig ausgeführt zu werden.

  • Aktive Ausführungen können nicht angehalten oder beendet werden. Verwenden Sie Indexerstatus abrufen, um sie zu überwachen, und weitere Informationen zum Verhalten der Laufzeitsteuerung finden Sie unter Indexer ausführen oder zurücksetzen.

  • Wenn die Laufzeit bestehen bleibt, aber die Indexerläufe fehlschlagen, siehe Probleme mit dem Indexer beheben.

  • Verringern Sie die Kosten für das Skillset. Fähigkeiten, die externe Dienste aufrufen, z. B. die Azure OpenAI Embedding Skills, GenAI Prompt skill und Azure Content Understanding Skills, nutzen die Laufzeit schnell. Verringern Sie die Anzahl der Fähigkeiten, Batchdokumente oder konfigurieren Sie einen Anreicherungscache , um frühere Ergebnisse wiederzuverwenden, anstatt sie erneut zu verarbeiten.

  • Überwachen Sie remainingSeconds proaktiv sowohl auf Dienst- als auch auf Indexerebene, damit Sie Workloads drosseln können, bevor sie fehlschlagen.

Kumulative Laufzeit überwachen

In diesem Abschnitt wird erläutert, wie Sie die Laufzeitnutzung und das verbleibende Budget mithilfe der REST-APIs des Suchdiensts nachverfolgen. Während der Vorschau steht keine Portaloberfläche für die kumulierte Laufzeit zur Verfügung.

Laufzeit auf Dienstebene

Verwenden Sie die REST-API ( Get Service Statistics ), um die kumulative Indexerlaufzeit für alle Indexer im Dienst für das aktuelle 24-Stunden-Fenster abzurufen:

GET {endpoint}/servicestats?api-version=2026-08-01-preview

Die Antwort enthält einen indexersRuntime Abschnitt. Der folgende JSON-Code zeigt einen Dienst an, dessen tägliches Kontingent von 24 Stunden nicht verwendet wird:

"indexersRuntime": {
    "usedSeconds": 0,
    "remainingSeconds": 86400,
    "beginningTime": "2026-05-16T00:00:00.000Z",
    "endingTime": "2026-05-17T00:00:00.000Z"
}

Wichtige Punkte:

  • usedSeconds: Gesamtzahl der Sekunden, die alle Indexer im Dienst im aktuellen Zeitfenster ausgeführt wurden.
  • remainingSeconds: Sekunden, die noch verfügbar sind, bevor das tägliche Kontingent erreicht ist. Vorhanden, wenn ein stufiger Grenzwert gilt.
  • beginningTime und endingTime: Start und Ende des aktuellen 24-Stunden-UTC-Zählfensters.

Laufzeit auf Indexerebene

Verwenden Sie get Indexer Status (REST API), um die kumulative Laufzeit für einen einzelnen Indexer abzurufen:

GET {endpoint}/indexers('{indexerName}')/search.status?api-version=2026-08-01-preview

Die Antwort enthält einen runtime Abschnitt. Der folgende JSON-Code zeigt einen Indexer für einen Dienst an, dessen 24-Stunden-Tageskontingent nicht verwendet wird:

"runtime": {
    "usedSeconds": 0,
    "remainingSeconds": 86400,
    "beginningTime": "2026-05-16T00:00:00.000Z",
    "endingTime": "2026-05-17T00:00:00.000Z"
}

Wichtige Punkte:

  • usedSeconds: Gesamtzahl der Sekunden, die der Indexer während des aktuellen Zeitfensters gelaufen ist.
  • remainingSeconds: Sekunden, die allen Indexern im Dienst noch zur Verfügung stehen, nicht nur diesem Indexer. Vorhanden, wenn ein stufiger Grenzwert gilt.
  • beginningTime und endingTime: Start und Ende des aktuellen 24-Stunden-UTC-Zählfensters.

Bewährte Methoden

Die Indexerunterstützung für S3 HD und Serverless befindet sich in der Vorschau. Befolgen Sie diese Anleitung, um Workloads entsprechend zu formatieren und die Abrechnung für Serverless zu einem späteren Zeitpunkt zu planen.

S3 HD

In der Vorschau ist die S3 HD-Indexerunterstützung für Workloads ohne Skillsets oder mit kleinen Skillsets ausgelegt. So bleiben Sie innerhalb des Tageskontingents:

  • Rechnen Sie mit kleinen Indizes mit einer Größe von etwa 1 GB.

  • Planen Sie die Verwendung von Skillsets sorgfältig. Fähigkeiten, die externe Dienste aufrufen, z. B. die Azure OpenAI Embedding Skill, GenAI Prompt skill und Azure Content Understanding Skill, die Laufzeit erheblich erhöhen und das tägliche Kontingent schnell nutzen können, insbesondere in Multitenant-Szenarien.

  • Erwarten Sie während der Vorschau eine begrenzte Parallelität. Verwenden Sie für große Indexerflotten geplante, gestaffelte Ausführungen, sodass sich die Arbeit über das 24-Stunden-Zeitfenster verteilt, anstatt mit demselben Budget zu konkurrieren.

Beispielhafter Split-and-Embed-Workload

In einem kontrollierten S3 HD-Test generierten ein Split-Skill und ein Azure OpenAI Embedding-Skill Textsegmente und Einbettungen. Die Arbeitsauslastung produzierte ungefähr 2,5 Blöcke pro Quelldokument, und in diesem Test wurden in einem 24-Stunden-S3 HD-Testfenster ca. 22.000 Quelldokumente beobachtet.

Die folgenden Werte sind gerundete, beispielhafte Fair-Share-Berechnungen auf Grundlage der aggregierten Beobachtung. Sie werden nicht anhand der Ergebnisse pro Indexer gemessen.

Anzahl der Indexer Illustrative Quelldokumente pro Indexer pro Tag
100 Über 200
500 Ca. 40
1.000 Ca. 20

Der Dienst reserviert weder Kapazität noch gewährleistet er für diese Anzahl von Indexern eine gleichmäßige Verteilung, Ausführungsreihenfolge oder einen bestimmten Durchsatz.

Note

Dieses Ergebnis wurde in einem kontrollierten Test beobachtet. Es handelt sich nicht um ein Leistungsziel, eine Dienstgarantie, eine Kapazitätsverpflichtung, eine Formel zur Größenanpassung oder einen Ersatz zum Testen Ihrer Workload.

Der Durchsatz kann erheblich variieren, abhängig von der Komplexität und dem Profil des Dokuments, der Chunking-Methode, der Anzahl und Art der Skills und Vektorausgaben, der Modelllatenz, der Kapazität und dem Kontingent, der Leistung von Quelle und Ziel, der Parallelität, der Reihenfolge der Planung, der Drosselung, der Region, Fehlern und Wiederholungsversuchen, dem Knacken von Dokumenten oder der optischen Zeichenerkennung (OCR) sowie ungleichmäßigen Mandantenvolumina. Testen Sie mit repräsentativen Produktionseingängen, bevor Sie die Kapazität planen.

Serverlos

In der Vorschauphase sind serverlose Indexer darauf ausgelegt, die Datenaufnahme für Szenarien der Retrieval-Augmented Generation (RAG) und für Wissensdatenbanken zu vereinfachen:

  • Die Indexerausführung (ohne Fähigkeiten) ist derzeit kostenlos. Das Schreiben von Dokumenten in einen Index verursacht einen Kostenaufwand.

  • Die Ausführung von Skillset wird auf die gleiche Weise abgerechnet wie bei dedizierten Indexern. Aufrufe externer Dienste, z. B. des Skills Azure OpenAI Embedding, des Skills GenAI Prompt und des Skills Azure Content Understanding, werden über die zugeordnete Foundry- oder Azure KI Services-Ressource abgerechnet.

Grenzen und Kontingente

Informationen zu Indexergrenzwerten für Serverless und S3 HD finden Sie unter Indexer-Grenzwerte.

Das Laufzeitkontingent und die Indizierungsgrenzwerte auf Dienstebene ersetzen nicht die Eingabe-, Anforderungs- oder Verarbeitungsgrenzwerte von Fähigkeiten und externen Diensten in einem Skillset. Prüfen Sie jeden Skillverweis separat, wenn Sie eine Anreicherungspipeline dimensionieren.