Tipps für die KI-Anreicherung in Azure KI Search

Hinweis

Azure KI-Suche ist über das Azure Portal, REST-APIs und Azure SDKs verfügbar. Es unterstützt auch Foundry IQ, die verwaltete Wissensschicht, die Unternehmensinhalte in wiederverwendbare, berechtigungsfähige Wissensbasen für Agenten im Microsoft Foundry-Portal transformiert.

Dieser Artikel enthält Tipps, die Ihnen den Einstieg in die KI-Anreicherung und in die während der Indizierung verwendeten Skillsets erleichtern.

Tipp 1: Beginnen Sie einfach, und beginnen Sie klein.

Der Assistent zum Importieren von Daten im Azure-Portal unterstützt die KI-Anreicherung. Ohne Code schreiben zu müssen, können Sie alle in einer Anreicherungspipeline verwendeten Objekte erstellen und untersuchen: Index, Indexer, Datenquelle und Skillset.

Eine weitere Möglichkeit, einfach zu beginnen, besteht darin, eine Datenquelle mit nur wenigen Dokumenten oder Zeilen in einer Tabelle zu erstellen, die repräsentativ für die Dokumente sind, die Sie indizieren möchten. Ein kleiner Datensatz ist die beste Möglichkeit, um die Geschwindigkeit des Auffindens und Behebens von Problemen zu erhöhen. Führen Sie Ihr Beispiel über die End-to-End-Pipeline aus, und überprüfen Sie, ob die Ergebnisse Ihren Anforderungen entsprechen. Wenn Sie mit den Ergebnissen zufrieden sind, können Sie Ihrer Datenquelle weitere Dateien hinzufügen.

Tipp 2: Ermitteln Sie, was funktioniert, auch wenn Fehler auftreten.

Manchmal wird ein Indexer durch einen kleinen Fehler aufgehalten. Diese Bedingung ist in Ordnung, wenn Sie probleme einzeln beheben möchten. Möglicherweise möchten Sie jedoch einen bestimmten Fehlertyp ignorieren, damit der Indexer fortfahren kann, und Sie können sehen, welche Flüsse tatsächlich funktionieren.

Um Fehler während der Entwicklung zu ignorieren, setzen Sie maxFailedItems und maxFailedItemsPerBatch in der Indexerdefinition auf -1.

{
  "parameters": {
    "maxFailedItems": -1,
    "maxFailedItemsPerBatch": -1
  }
}

Hinweis

Setzen Sie als bewährte Vorgehensweise maxFailedItems und maxFailedItemsPerBatch für Produktionsworkloads auf 0.

Tipp 3: Verwenden der Debugsitzung zum Beheben von Problemen

Debugsitzung ist ein visueller Editor, der das Abhängigkeitsdiagramm, Eingaben und Ausgaben sowie Definitionen eines Skillsets anzeigt. Es lädt ein einzelnes Quelldokument aus der Indexerdatenquelle mit der aktuellen Indexer- und Skillset-Konfiguration. Anschließend können Sie das gesamte Skillset ausführen, das auf dieses Dokument beschränkt ist. In einer Debugging-Sitzung können Sie Fehler identifizieren und beheben sowie Änderungen überprüfen und Änderungen in ein übergeordnetes Skillset übernehmen. Eine exemplarische Vorgehensweise finden Sie unter Tutorial: Debugsitzungen.

Tipp 4: Erwarteter Inhalt wird nicht angezeigt

Wenn Inhalt fehlt, suchen Sie im Azure-Portal nach abgelegten Dokumenten. Öffnen Sie auf der Suchdienstseite Indexer, wählen Sie den Indexer aus, und wählen Sie dann den Statuswert eines Ausführens aus, um Ausführungsdetails und Fehler anzuzeigen.

Wenn das Problem mit der Dateigröße zusammenhängt, wird möglicherweise ein Fehler wie folgt angezeigt: "Der Blob-Dateiname<>" hat die Größe von <Bytes der Dateigröße>, die die maximale Größe für die Dokumentextraktion für die aktuelle Dienstebene überschreitet." Weitere Informationen zu Indexergrenzwerten finden Sie unter Dienstgrenzwerte.

Ein zweiter Grund dafür, dass Inhalte nicht angezeigt werden, kann mit Fehlern bei der Eingabe-/Ausgabezuordnung zusammenhängen. Ein Beispiel hierfür wäre, wenn ein Ausgabezielname „Personen“ lautet, aber der Indexfeldname kleingeschrieben ist („personen“). Das System gibt 201 Erfolgsmeldungen für die gesamte Pipeline zurück, sodass Sie denken, dass die Indizierung erfolgreich war, wenn tatsächlich ein Feld leer ist.

Tipp 5: Erweitern Sie die Verarbeitung über die maximale Laufzeit hinaus.

Die Bildanalyse ist selbst für einfache Fälle rechenintensiv, sodass die Verarbeitungsdauer bei besonders großen oder komplexen Bildern die maximal zulässige Zeit überschreiten kann.

Bei Indexern, die über Skillsets verfügen, ist die Ausführung der Skillsets für die meisten Stufen auf 2 Stunden begrenzt. Wenn die Verarbeitung des Skillsets innerhalb dieses Zeitraums nicht abgeschlossen wird, konfigurieren Sie den Indexer so, dass er alle fünf Minuten ausgeführt wird, damit er die Verarbeitung beim zuletzt als fehlerfrei bekannten Dokument fortsetzen kann.

Die geplante Indizierung wird beim zuletzt bekannten fehlerfreien Dokument fortgesetzt. Durch die Verwendung eines wiederkehrenden Zeitplans kann der Indexer über mehrere Stunden oder Tage hinweg schrittweise die unbearbeiteten Bilder abarbeiten, bis schließlich alle Bilder verarbeitet sind. Weitere Informationen zur Zeitplansyntax finden Sie unter Planen eines Indexers.

Hinweis

Wenn ein geplanter Indexer in demselben Dokument wiederholt fehlschlägt, reduziert der Dienst seine Ausführungshäufigkeit (bis zu einmal alle 24 Stunden), bis er Fortschritte macht. Führen Sie nach dem Beheben des zugrunde liegenden Problems den Indexer bei Bedarf aus. Wenn der Indexer Fortschritte macht, kehrt er zu dem konfigurierten Intervall zurück. Wenn der Indexer nach einer erfolgreichen Ausführung nicht zu seinem konfigurierten Zeitplan zurückkehrt, lesen Sie häufig gestellte Fragen zum Terminplanungsverhalten.

Tipp 6: Erhöhen Sie den Durchsatz der Indexierung.

Für eine parallele Indizierung verteilen Sie Ihre Daten auf mehrere Container oder mehrere virtuelle Ordner innerhalb desselben Containers. Erstellen Sie dann mehrere Datenquellen- und Indexerpaare. Alle Indexer können das gleiche Skillset verwenden und in den gleichen Zielsuchindex schreiben, sodass Ihre Such-App über diese Partitionierung nicht informiert sein muss.

Siehe auch