Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Hinweis
Azure KI-Suche ist über das Azure Portal, REST-APIs und Azure SDKs verfügbar. Es unterstützt auch Foundry IQ, die verwaltete Wissensschicht, die Unternehmensinhalte in wiederverwendbare, berechtigungsfähige Wissensbasen für Agenten im Microsoft Foundry-Portal transformiert.
In dieser Schnellstartanleitung verwenden Sie den Assistenten Import data im Azure-Portal, um mit integrierten Vektorisierung zu beginnen. Der Assistent zerlegt Ihre Inhalte und ruft ein Einbettungsmodell auf, um die Blöcke während der Indizierung und Abfrage zu vektorisieren.
In dieser Schnellstartanleitung werden textbasierte PDF-Dateien und einfache Bilder aus dem Repository azure-search-sample-data verwendet. Sie können jedoch verschiedene Dateien verwenden und diese Schnellstartanleitung trotzdem abschließen.
Tipp
Haben Sie bildreiche Dokumente? Siehe Quickstart: Multimodale Suche im Azure Portal zum Extrahieren, Speichern und Durchsuchen von Bildern zusammen mit Text.
Voraussetzungen
Ein Azure Konto mit einem aktiven Abonnement. Erstellen Sie kostenlos ein Konto.
Ein Azure KI-Suche-Dienst. Diese Schnellstartanleitung erfordert die Stufe "Einfach" oder höher für die Unterstützung verwalteter Identitäten.
Eine unterstützte Datenquelle.
Vertrautheit mit dem Assistenten. Siehe Import-Daten-Assistent im Azure Portal.
Unterstützte Datenquellen
Der Assistent unterstützt mehrere Azure Datenquellen. In dieser Schnellstartanleitung werden jedoch nur die Datenquellen behandelt, die mit ganzen Dateien arbeiten, die in der folgenden Tabelle beschrieben werden.
| Datenquelle | Beschreibung |
|---|---|
| Azure Blob Storage | Diese Datenquelle funktioniert mit Blobs und Tabellen. Sie müssen ein Standardleistungskonto (general-purpose v2) verwenden. Zugriffsebenen können heiß, kühl oder kalt sein. |
| Azure Data Lake Storage (ADLS) Gen2 | Dies ist ein Azure Storage Konto mit aktiviertem hierarchischen Namespace. Um zu bestätigen, dass Sie Data Lake Storage haben, überprüfen Sie die Registerkarte Properties auf der Seite Overview. |
| Microsoft OneLake | Diese Datenquelle stellt eine Verbindung mit OneLake-Dateien und -Verknüpfungen her. |
Unterstützte Einbettungsmodelle
Das Portal unterstützt die folgenden Einbettungsmodelle für die integrierte Vektorisierung. Bereitstellungsanweisungen werden in einem späteren Abschnitt bereitgestellt.
| Anbieter | Unterstützte Modelle |
|---|---|
| Azure AI Multi-Service-Konto1 | Für Text und Bilder: Azure Vision multimodal |
| Microsoft Foundry Hub-basiertes Projekt | Für Text:
|
| Microsoft Foundry-Projekt | Für Text:
|
| Azure OpenAI-Ressource3, 4 | Für Text:
|
1 Für Abrechnungszwecke müssen Sie Ihr Multi-Service-Konto mit Ihrem Azure KI-Suche Skillset verknüpfen. Der Assistent setzt voraus, dass sich Ihr Suchdienst und Ihr Multi-Service-Konto in derselben unterstützten Region für die Funktion für multimodale Azure Vision-Einbettungen (Vorschau) befinden.
2 Der Assistent unterstützt nur serverlose API-Bereitstellungen für dieses Modell. Sie können die Azure CLI verwenden, um die serverlose Bereitstellung (Vorschau) bereitzustellen.
3 Der Endpunkt Ihrer Azure OpenAI-Ressource muss über eine custom subdomain verfügen, z. B. https://my-unique-name.openai.azure.com. Wenn Sie Ihre Ressource im Azure-Portal erstellt haben, wurde diese Unterdomäne während der Ressourceneinrichtung automatisch generiert.
4 Azure OpenAI-Ressourcen (mit Zugriff auf einbettende Modelle), die im Microsoft Foundry-Portal erstellt wurden werden nicht unterstützt. Sie müssen eine Azure OpenAI-Ressource im Azure Portal erstellen.
Die neuesten Informationen zum Modelllebenszyklus, einschließlich zu Abschaffungen, finden Sie unter Modellauslauf und -abschaffung.
Anforderungen an öffentliche Endpunkte
Alle oben genannten Ressourcen müssen öffentlich zugänglich sein, damit der Assistent auf sie zugreifen kann. Andernfalls tritt im Assistenten ein Fehler auf. Nachdem der Assistent ausgeführt wurde, können Sie aus Sicherheitsgründen Firewalls und private Endpunkte auf den Integrationskomponenten aktivieren. Weitere Informationen finden Sie unter Sichere Verbindungen im Import-Assistenten.
Wenn private Endpunkte bereits vorhanden sind und Sie sie nicht deaktivieren können, besteht die alternative Option darin, den entsprechenden End-to-End-Fluss von einem Skript oder Programm auf einem virtuellen Computer auszuführen. Der virtuelle Computer muss sich im selben virtuellen Netzwerk wie der private Endpunkt befinden. Hier ist ein Python Codebeispiel für die integrierte Vektorisierung. Das gleiche GitHub-Repository enthält Beispiele in anderen Programmiersprachen.
Konfigurieren des Zugriffs
Bevor Sie beginnen, stellen Sie sicher, dass Sie über Berechtigungen für den Zugriff auf Inhalte und Vorgänge verfügen. In dieser Schnellstartanleitung werden Microsoft Entra ID für die Authentifizierung und den rollenbasierten Zugriff für die Autorisierung verwendet. Sie müssen ein Besitzer oder Benutzerzugriffsadministrator sein, um Rollen zuzuweisen. Wenn Rollen nicht machbar sind, verwenden Sie stattdessen die schlüsselbasierte Authentifizierung .
Konfigurieren Sie die erforderlichen Rollen und bedingten Rollen , die in diesem Abschnitt identifiziert wurden.
Erforderliche Rollen
Azure KI-Suche stellt die Vektorsuchpipeline bereit. Konfigurieren Sie den Zugriff für sich und Ihren Suchdienst, um Daten zu lesen, die Pipeline auszuführen und mit anderen Azure Ressourcen zu interagieren.
Auf Ihrem Azure KI-Suche-Dienst:
Konfigurieren sie eine vom System zugewiesene verwaltete Identität.
Weisen Sie sich selbst die folgenden Rollen zu.
Suchdienstmitwirkender
Suchindexdaten-Beitragender
Suchindexdatenleser
Bedingte Rollen
Auf den folgenden Registerkarten werden alle Assistent-kompatiblen Ressourcen für die Vektorsuche behandelt. Wählen Sie nur die Registerkarten aus, die für die ausgewählte Datenquelle und das Einbettungsmodell gelten.
Azure Blob Storage und Azure Data Lake Storage Gen2 erfordern, dass Ihr Suchdienst Lesezugriff auf Speichercontainer hat.
Auf Ihrem Azure Storage Konto:
- Weisen Sie Storage Blob Data Reader der verwalteten Identität Ihres Suchdienstes zu.
Vorbereiten von Beispieldaten
In diesem Abschnitt bereiten Sie Beispieldaten für die ausgewählte Datenquelle vor.
Wechseln Sie zum Azure Storage Konto im Azure Portal.
Wählen Sie im linken Bereich "Datenspeichercontainer>" aus.
Erstellen Sie einen Container, und laden Sie dann die PDF-Dokumente Health-Plan hoch, die für diese Schnellstartanleitung verwendet werden.
(Optional) Synchronisieren Sie Löschungen in Ihrem Container mit Löschungen im Suchindex. So konfigurieren Sie den Indexer für die Löscherkennung:
Aktivieren Sie das vorläufige Löschen für Ihr Speicherkonto. Wenn Sie native soft delete verwenden, ist der nächste Schritt nicht erforderlich.
Fügen Sie benutzerdefinierte Metadaten hinzu , die ein Indexer überprüfen kann, um zu bestimmen, welche Blobs zum Löschen markiert sind. Weisen Sie Ihrer benutzerdefinierten Eigenschaft einen beschreibenden Namen zu. Nennen Sie beispielsweise die Eigenschaft "IsDeleted", und legen Sie sie auf "false" fest. Wiederholen Sie diesen Schritt für jeden Blob im Container. Wenn Sie das Blob löschen möchten, ändern Sie die Eigenschaft in "true". Weitere Informationen finden Sie unter Erkennung von Änderungen und Löschungen beim Indexieren aus Azure Storage.
Vorbereiten des Einbettungsmodells
Hinweis
Wenn Sie Azure Vision verwenden, überspringen Sie diesen Schritt. Die multimodalen Einbettungen sind in Ihr Multi-Service-Konto integriert und erfordern keine Modellbereitstellung.
Der Assistent unterstützt mehrere Einbettungsmodelle aus Azure OpenAI und dem Microsoft Foundry-Modellkatalog. Informationen zum Bereitstellen der modelle, die für Ihr ausgewähltes embedding-Modell erforderlich sind, finden Sie unter Deploy Microsoft Foundry Models im Foundry-Portal.
Starten des Assistenten
Wechseln Sie zum Suchdienst im Azure-Portal.
Wählen Sie auf der Seite "Übersicht" die Option "Daten importieren" aus.
Wählen Sie Ihre Datenquelle aus: Azure Blob Storage, ADLS Gen2 oder OneLake.
Wählen Sie RAG aus.
Ausführen des Assistenten
Der Assistent führt Sie durch mehrere Konfigurationsschritte. In diesem Abschnitt werden die einzelnen Schritte in Sequenz behandelt.
Herstellen einer Verbindung mit Ihren Daten
In diesem Schritt verbinden Sie Azure KI-Suche mit ihrer ausgewählten Datenquelle für die Erfassung und Indizierung von Inhalten.
Wählen Sie auf der Seite Verbinden mit Ihren Daten Ihr Azure-Abonnement aus.
Wählen Sie das Speicherkonto und den Container aus, das die Beispieldaten bereitstellt.
Wenn Sie das vorläufige Löschen aktiviert und benutzerdefinierte Metadaten in " Beispieldaten vorbereiten" hinzugefügt haben, aktivieren Sie das Kontrollkästchen " Löschverfolgung aktivieren ".
Bei nachfolgenden Indizierungsläufen wird der Suchindex aktualisiert, um alle Suchdokumente basierend auf vorläufig gelöschten Blobs auf Azure Storage zu entfernen.
Blobs unterstützen entweder Natives vorläufiges Löschen von Blobs oder Vorläufiges Löschen mithilfe benutzerdefinierter Metadaten.
Wenn Sie Ihre Blobs für das vorläufige Löschen konfiguriert haben, stellen Sie das Namen-/Wertepaar der Metadateneigenschaft bereit. Wir empfehlen IsDeleted. Wenn IsDeleted für ein Blob auf true gesetzt ist, entfernt der Indexer das entsprechende Suchdokument beim nächsten Indexlauf.
Der Assistent überprüft nicht Azure Storage auf gültige Einstellungen oder löst einen Fehler aus, wenn die Anforderungen nicht erfüllt sind. Stattdessen funktioniert die Löscherkennung nicht, und Ihr Suchindex sammelt wahrscheinlich verwaiste Dokumente im Laufe der Zeit.
Aktivieren Sie das Kontrollkästchen "Authentifizieren mit verwalteter Identität ". Lassen Sie den Identitätstyp als vom System zugewiesen.
Wählen Sie "Weiter" aus.
Vektorisieren des Texts
Während dieses Schritts verwendet der Assistent das ausgewählte Einbettungsmodell zum Vektorisieren von Datenblöcken. Chunking ist integriert und nicht konfigurierbar. Die effektiven Einstellungen sind:
"textSplitMode": "pages",
"maximumPageLength": 2000,
"pageOverlapLength": 500,
"maximumPagesToTake": 0, #unlimited
"unit": "characters"
Wählen Sie auf der Seite Vectorize your text, Azure OpenAI für den Typ aus.
Wählen Sie Ihr Azure-Abonnement aus.
Wählen Sie Ihre Azure OpenAI-Ressource und dann das Modell aus, das Sie in Prepare embedding model bereitgestellt haben.
Wählen Sie für den Authentifizierungstyp die vom System zugewiesene Identität aus.
Aktivieren Sie das Kontrollkästchen, das die Abrechnungseffekte der Verwendung dieser Ressourcen bestätigt.
Wählen Sie "Weiter" aus.
Vektorisieren und Anreichern Ihrer Bilder
Die PDFs für den Gesundheitsplan enthalten ein Unternehmenslogo, ansonsten gibt es keine Bilder. Sie können diesen Schritt überspringen, wenn Sie die Beispieldokumente verwenden.
Wenn Ihre Inhalte jedoch nützliche Bilder enthalten, können Sie KI auf eine oder beide der folgenden Arten anwenden:
Verwenden Sie ein unterstütztes Bildeinbettungsmodell aus dem Microsoft Foundry-Modellkatalog oder die Azure Vision multimodale Einbettungs-API (über ein Multi-Service-Konto), um Bilder zu vektorisieren.
Verwenden Sie die optische Zeichenerkennung (OCR), um Text aus Bildern zu extrahieren. Diese Option ruft die OCR-Fähigkeit auf.
Aktivieren Sie auf der Seite " Vektorisieren und Erweitern Ihrer Bilder " das Kontrollkästchen "Bilder Vektorisieren ".
Wählen Sie für die Art Ihren Modellanbieter aus: Microsoft Foundry oder Azure Vision in Foundry Tools.
Wählen Sie Ihr Azure Abonnement, Ihre Ressource und die Bereitstellung des Einbettungsmodells (falls zutreffend) aus.
Wählen Sie für den Authentifizierungstyp die vom System zugewiesene Identität aus, wenn Sie kein hubbasiertes Projekt verwenden. Lassen Sie dies andernfalls als API-Schlüssel.
Aktivieren Sie das Kontrollkästchen, das die Abrechnungseffekte der Verwendung dieser Ressourcen bestätigt.
Wählen Sie "Weiter" aus.
Hinzufügen der semantischen Rangfolge
Auf der Seite "Erweiterte Einstellungen " können Sie optional eine semantische Rangfolge hinzufügen, um die Ergebnisse am Ende der Abfrageausführung zu reranken. Reranking bringt die semantisch relevantesten Übereinstimmungen nach oben.
Zuordnen neuer Felder
Auf der Seite "Erweiterte Einstellungen " können Sie optional neue Felder hinzufügen, vorausgesetzt, die Datenquelle stellt Metadaten oder Felder bereit, die beim ersten Durchlauf nicht aufgenommen werden. Standardmäßig generiert der Assistent die in der folgenden Tabelle beschriebenen Felder.
| Feld | Gilt für | Beschreibung |
|---|---|---|
| chunk_id | Text- und Bildvektoren | Generiertes Zeichenfolgenfeld. Durchsuchbar, abrufbar und sortierbar. Dies ist der Dokumentschlüssel für den Index. |
| parent_id | Textvektoren | Generiertes Zeichenfolgenfeld. Abrufbar und filterbar. Gibt das übergeordnete Dokument an, aus dem der Block stammt. |
| Block | Text- und Bildvektoren | Zeichenfolgenfeld. Menschlich lesbare Version des Datenabschnitts. Durchsuchbar und abrufbar, aber nicht filterbar, in Facetten unterteilbar oder sortierbar. |
| Titel | Text- und Bildvektoren | Zeichenfolgenfeld. Lesbarer Dokumenttitel oder Seitentitel oder Seitenzahl. Durchsuchbar und abrufbar, aber nicht filterbar, in Facetten unterteilbar oder sortierbar. |
| text_vector | Textvektoren | Collection(Edm.single). Vektordarstellung des Abschnitts. Durchsuchbar und abrufbar, aber nicht filterbar, in Facetten unterteilbar oder sortierbar. |
Sie können die generierten Felder oder deren Attribute nicht ändern, aber Sie können neue Felder hinzufügen, wenn ihre Datenquelle sie bereitstellt. Beispielsweise stellt Azure Blob Storage eine Sammlung von Metadatenfeldern bereit.
So fügen Sie dem Indexschema Felder hinzu:
Wählen Sie auf der Seite "Erweiterte Einstellungen" unter "Indexfelder" die Option "Vorschau" und "Bearbeiten" aus.
Wählen Sie "Feld hinzufügen" aus.
Wählen Sie ein Quellfeld aus den verfügbaren Feldern aus, geben Sie einen Feldnamen für den Index ein, und akzeptieren (oder überschreiben) Sie den Standarddatentyp.
Wenn Sie das Schema in seiner ursprünglichen Version wiederherstellen möchten, wählen Sie "Zurücksetzen" aus.
Wichtige Punkte zu diesem Schritt:
Das Indexschema stellt Vektor- und Nichtvektorfelder für datenblöcke bereit.
Der Dokumentanalysemodus erstellt Blöcke (ein Suchdokument pro Block).
Indexierung planen
Für Datenquellen, in denen die zugrunde liegenden Daten veränderlich sind, können Sie die Indizierung planen , um Änderungen in bestimmten Intervallen oder bestimmten Datums- und Uhrzeitangaben zu erfassen.
So planen Sie die Indizierung:
Geben Sie auf der Seite "Erweiterte Einstellungen " unter " Indizierung planen" einen Ausführungszeitplan für den Indexer an. Wir empfehlen Once für diesen Quickstart.
Wählen Sie "Weiter" aus.
Fertigstellen des Assistenten
Der letzte Schritt besteht darin, Ihre Konfiguration zu überprüfen und die erforderlichen Objekte für die Vektorsuche zu erstellen. Kehren Sie bei Bedarf zu den vorherigen Seiten des Assistenten zurück, um Ihre Konfiguration anzupassen.
So beenden Sie den Assistenten:
Geben Sie auf der Seite " Überprüfen und Erstellen " ein Präfix für die Vom Assistenten erstellten Objekte an. Ein gängiges Präfix hilft Ihnen, organisiert zu bleiben.
Wählen Sie "Erstellen" aus.
Vom Assistenten erstellte Objekte
Wenn der Assistent die Konfiguration abschließt, erstellt er die folgenden Objekte:
| Objekt | Beschreibung |
|---|---|
| Datenquelle | Stellt eine Verbindung mit der ausgewählten Datenquelle dar. |
| Index | Enthält Vektorfelder, Vektorizer, Vektorprofile und Vektoralgorithmen. Sie können den Standardindex während des Assistentenworkflows nicht ändern. Indizes entsprechen der neuesten Vorschau-REST-API , sodass Sie Vorschaufeatures verwenden können. |
| Kompetenzen | Enthält die folgenden Fähigkeiten und Konfigurationen:
|
| Indizierer | Steuert die Indizierungspipeline mit Feldzuordnungen und Ausgabefeldzuordnungen (falls zutreffend). |
Tipp
Vom Assistenten erstellte Objekte verfügen über konfigurierbare JSON-Definitionen. Um diese Definitionen anzuzeigen oder zu ändern, wählen Sie die Suchverwaltung im linken Bereich aus, in dem Sie Ihre Indizes, Indexer, Datenquellen und Skillsets anzeigen können.
Ergebnisse überprüfen
Der Such-Explorer akzeptiert Textzeichenfolgen als Eingabe und vektorisiert dann den Text für die Ausführung von Vektorabfragen.
So fragen Sie ihren Vektorindex ab:
Wechseln Sie im Azure-Portal zu Search Management>Indexes, und wählen Sie dann Ihren Index aus.
Wählen Sie "Abfrageoptionen" und dann " Vektorwerte in Suchergebnissen ausblenden" aus. Dieser Schritt macht die Ergebnisse besser lesbar.
Wählen Sie im Menü "Ansicht " die JSON-Ansicht aus, damit Sie Text für Ihre Vektorabfrage im
textVektorabfrageparameter eingeben können.Die Standardabfrage ist eine leere Suche (
"*"), enthält jedoch Parameter für die Rückgabe der Anzahl übereinstimmungen. Es ist eine Hybridabfrage, die Text- und Vektorabfragen parallel ausführt. Außerdem enthält sie semantische Rangfolge und gibt an, welche Felder in den Ergebnissen über dieselectAnweisung zurückgegeben werden sollen.{ "search": "*", "count": true, "vectorQueries": [ { "kind": "text", "text": "*", "fields": "text_vector,image_vector" } ], "queryType": "semantic", "semanticConfiguration": "my-demo-semantic-configuration", "captions": "extractive", "answers": "extractive|count-3", "queryLanguage": "en-us", "select": "chunk_id,text_parent_id,chunk,title,image_parent_id" }Ersetzen Sie beide Platzhalter für Sternchen (
*) durch eine Frage im Zusammenhang mit Gesundheitsplänen, z. B.Which plan has the lowest deductible?.{ "search": "Which plan has the lowest deductible?", "count": true, "vectorQueries": [ { "kind": "text", "text": "Which plan has the lowest deductible?", "fields": "text_vector,image_vector" } ], "queryType": "semantic", "semanticConfiguration": "my-demo-semantic-configuration", "captions": "extractive", "answers": "extractive|count-3", "queryLanguage": "en-us", "select": "chunk_id,text_parent_id,chunk,title" }Um die Abfrage auszuführen, wählen Sie "Suchen" aus.
Jedes Dokument ist ein Teil der ursprünglichen PDF-Datei. Das
titleFeld zeigt an, aus welcher PDF-Datei der Block stammt. Jederchunkist lang. Sie können einen kopieren und in einen Text-Editor einfügen, um den gesamten Wert zu lesen.Um alle Blöcke aus einem bestimmten Dokument anzuzeigen, fügen Sie einen Filter für das
title_parent_idFeld für eine bestimmte PDF-Datei hinzu. Sie können die Registerkarte "Felder " ihres Indexes überprüfen, um zu bestätigen, dass das Feld gefiltert werden kann.{ "select": "chunk_id,text_parent_id,chunk,title", "filter": "text_parent_id eq 'aHR0cHM6Ly9oZWlkaXN0c3RvcmFnZWRlbW9lYXN0dXMuYmxvYi5jb3JlLndpbmRvd3MubmV0L2hlYWx0aC1wbGFuLXBkZnMvTm9ydGh3aW5kX1N0YW5kYXJkX0JlbmVmaXRzX0RldGFpbHMucGRm0'", "count": true, "vectorQueries": [ { "kind": "text", "text": "*", "k": 5, "fields": "text_vector" } ] }
Bereinigen von Ressourcen
Wenn Sie in Ihrem eigenen Abonnement arbeiten, ist es ratsam, ein Projekt abzuschließen, indem Sie die nicht mehr benötigten Ressourcen entfernen. Ressourcen, die Sie weiterhin ausführen, können Sie Geld kosten.
Wählen Sie im Azure Portal All resources or Resource groups aus dem linken Bereich aus, um Ressourcen zu suchen und zu verwalten. Sie können Ressourcen einzeln löschen oder die Ressourcengruppe löschen, um alle Ressourcen gleichzeitig zu entfernen.
Nächster Schritt
In dieser Schnellstartanleitung haben Sie den Assistenten zum Importieren von Daten eingeführt, der alle erforderlichen Objekte für die integrierte Vektorisierung erstellt. Informationen zu den einzelnen Schritten finden Sie unter Set up integrated vectorization in Azure KI-Suche.