Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Uwaga
Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.
W tym szybkim rozpoczęciu użyjesz kreatora Importuj dane w portalu Azure, aby rozpocząć pracę z integracją wektorów. Kreator dzieli zawartość na fragmenty i wykorzystuje model osadzania, aby wektoryzować te fragmenty podczas indeksowania i wyszukiwania.
Instrukcja szybkiego startu wykorzystuje pliki PDF oparte na tekście i proste obrazy z repozytorium azure-search-sample-data. Możesz jednak użyć różnych plików i nadal ukończyć ten szybki przewodnik.
Wskazówka
Masz dokumenty zawierające wiele obrazów? Zobacz Quickstart: wyszukiwanie wielomodalne w portalu Azure w celu wyodrębniania, przechowywania i wyszukiwania obrazów obok tekstu.
Wymagania wstępne
Konto Azure z aktywną subskrypcją. Utwórz bezpłatne konto.
Usługa Wyszukiwanie AI platformy Azure. Ten Szybki Start wymaga warstwy Podstawowej lub wyższej w celu obsługi tożsamości zarządzanych.
Znajomość kreatora. Zobacz kreatora Import danych w portalu Azure.
Obsługiwane źródła danych
Kreator obsługuje wiele źródeł danych Azure. Jednak ten przewodnik, Szybkie wprowadzenie, obejmuje tylko źródła danych współpracujące z całymi plikami, opisane w poniższej tabeli.
| Źródło danych | Opis |
|---|---|
| Azure Blob Storage | Źródło danych współpracuje z obiektami typu blob i tabelami. Musisz użyć konta standardowej wydajności (ogólnego przeznaczenia w wersji 2). Warstwy dostępu mogą być gorące, chłodne lub zimne. |
| Azure Data Lake Storage (ADLS) Gen2 | Jest to konto Azure Storage z włączoną hierarchiczną przestrzenią nazw. Aby potwierdzić, że masz Data Lake Storage, sprawdź stronę Properties na karcie Overview. |
| Microsoft OneLake | To źródło danych łączy się z plikami OneLake i skrótami. |
Obsługiwane modele osadzania
Portal obsługuje następujące modele osadzania na potrzeby zintegrowanej wektoryzacji. Instrukcje dotyczące wdrażania znajdują się w późniejszej sekcji.
| Dostawca | Obsługiwane modele |
|---|---|
| Konto Azure AI wielousługowe1 | W przypadku tekstu i obrazów: Azure Vision multimodal |
| projekt oparty na centrum Microsoft Foundry | Dla tekstu:
|
| projekt Microsoft Foundry | Dla tekstu:
|
| Zasób Azure OpenAI3, 4 | Dla tekstu:
|
1 W celach rozliczeniowych musisz przyłączyć konto wielousług do zestawu umiejętności Wyszukiwanie AI platformy Azure. Kreator wymaga, aby usługa wyszukiwania i konto wielousługowe znajdowały się w tym samym obsługiwanym regionie na potrzeby umiejętności osadzeń multimodalnych usługi Azure Vision (wersja zapoznawcza).
2 Kreator obsługuje tylko wdrożenia bezserwerowego interfejsu API dla tego modelu. Za pomocą Azure CLI można aprowizować wdrożenie bezserwerowe (wersja zapoznawcza).
3 Punkt końcowy zasobu Azure OpenAI musi mieć poddomenę custom, taką jak https://my-unique-name.openai.azure.com. Jeśli zasób został utworzony w portalu Azure, ta poddomena została automatycznie wygenerowana podczas konfigurowania zasobów.
4 zasoby Azure OpenAI (z dostępem do modeli osadzania), które zostały utworzone w portalu Microsoft Foundry, nie są obsługiwane. Musisz utworzyć zasób Azure OpenAI w portalu Azure.
Aby uzyskać najnowsze wskazówki dotyczące cyklu życia modelu, w tym wycofania z użycia, zobacz Wycofanie modelu i wycofanie z użycia.
Wymagania dotyczące publicznego punktu końcowego
Wszystkie powyższe zasoby muszą mieć włączony dostęp publiczny, aby kreator mógł uzyskać do nich dostęp. W przeciwnym razie kreator zakończy się niepowodzeniem. Po uruchomieniu kreatora, można włączyć zapory i prywatne punkty końcowe w składnikach integracji w celu zapewnienia bezpieczeństwa. Aby uzyskać więcej informacji, zobacz Bezpieczne połączenia w kreatorze importu.
Jeśli prywatne punkty końcowe są już obecne i nie można ich wyłączyć, alternatywną opcją jest uruchomienie przepływu end-to-end ze skryptu lub programu na maszynie wirtualnej. Maszyna wirtualna musi znajdować się w tej samej sieci wirtualnej co prywatny punkt końcowy. Oto przykład kodu Python do zintegrowanej wektoryzacji. To samo repozytorium GitHub zawiera przykłady w innych językach programowania.
Konfigurowanie dostępu
Przed rozpoczęciem upewnij się, że masz uprawnienia dostępu do zawartości i operacji. W tym szybkim starcie używany jest Microsoft Entra ID do uwierzytelniania i dostępu opartego na rolach dla autoryzacji. Aby przypisać role, musisz być właścicielem lub administratorem dostępu użytkowników . Jeśli role nie są możliwe, zamiast tego użyj uwierzytelniania opartego na kluczach .
Skonfiguruj wymagane role i role warunkowe zidentyfikowane w tej sekcji.
Wymagane role
Wyszukiwanie AI platformy Azure udostępnia potok wyszukiwania wektorów. Skonfiguruj dostęp dla siebie i swojej usługi wyszukiwania, aby odczytywać dane, uruchamiać pipeline oraz wchodzić w interakcje z innymi zasobami Azure.
W usłudze Wyszukiwanie AI platformy Azure:
Przypisz sobie następujące role.
Współautor usługi wyszukiwania
Współautor danych indeksu wyszukiwania
Czytnik danych indeksu wyszukiwania
Role warunkowe
Poniższe karty obejmują wszystkie zasoby kompatybilne z kreatorem dla wyszukiwania wektorowego. Wybierz tylko karty, które mają zastosowanie do wybranego źródła danych i modelu osadzania.
Azure Blob Storage i Azure Data Lake Storage Gen2 wymagają, aby Twoja usługa wyszukiwania miała dostęp do odczytu do kontenerów danych.
Na koncie Azure Storage:
- Przypisz czytelnik danych Storage Blob do tożsamości zarządzanej usługi wyszukiwania.
Przygotowywanie przykładowych danych
W tej sekcji przygotujesz przykładowe dane dla wybranego źródła danych.
Przejdź do konta Azure Storage w portalu Azure.
W okienku po lewej wybierz opcję Magazyn danych>Kontenery.
Utwórz kontener, a następnie przekaż dokumenty PDF planu zdrowotnego używane na potrzeby tego szybkiego startu.
(Opcjonalnie) Synchronizuj usunięcia w kontenerze z usunięciami w indeksie wyszukiwania. Aby skonfigurować indeksator do wykrywania usuwania:
Włącz usuwanie miękkie na koncie storage. Jeśli używasz natywnego usuwania nietrwałego, następny krok nie jest wymagany.
Dodaj niestandardowe metadane , które indeksator może skanować, aby określić, które obiekty blob są oznaczone do usunięcia. Nadaj właściwości niestandardowej nazwę opisową. Na przykład nadaj właściwości nazwę "IsDeleted" i ustaw ją na false. Powtórz ten krok dla każdego obiektu blob w kontenerze. Jeśli chcesz usunąć obiekt blob, zmień właściwość na true. Aby uzyskać więcej informacji, zobacz wykrywanie zmian i usuwanie podczas indeksowania z Azure Storage.
Przygotowywanie modelu osadzania
Uwaga
Jeśli używasz usługi Azure Vision, pomiń ten krok. Funkcje osadzania wielomodalnego są wbudowane na koncie z wieloma usługami i nie wymagają wdrożenia modelu.
Kreator obsługuje kilka modeli osadzania z Azure OpenAI i katalogu modeli Microsoft Foundry. Aby wdrożyć modele wymagane dla wybranego modelu embedding zobacz Deploy Microsoft Foundry Models w portalu Foundry.
Uruchamianie kreatora
Przejdź do usługi wyszukiwania w portalu Azure.
Na stronie Przegląd wybierz pozycję Importuj dane.
Wybierz źródło danych: Azure Blob StorageADLS Gen2 lub OneLake.
Wybierz RAG.
Uruchamianie kreatora
Kreator przeprowadza Cię przez kilka etapów konfiguracji. W tej sekcji opisano poszczególne kroki w sekwencji.
Połącz się z danymi
W tym kroku nawiąż połączenie Wyszukiwanie AI platformy Azure z wybranym źródłem data na potrzeby pozyskiwania i indeksowania zawartości.
Na stronie Połączenie z danymi wybierz subskrypcję Azure.
Wybierz konto magazynu i kontener, które udostępniają przykładowe dane.
Jeśli włączono usuwanie nietrwałe i dodano niestandardowe metadane w obszarze Przygotowywanie przykładowych danych, zaznacz pole wyboru Włącz śledzenie usuwania .
Podczas kolejnych przebiegów indeksowania indeks wyszukiwania jest aktualizowany w celu usunięcia wszelkich dokumentów wyszukiwania powiązanych z miękko usuniętymi obiektami blob w usłudze Azure Storage.
Obiekty blob obsługują natywne usuwanie nietrwałe obiektów blob lub usuwanie nietrwałe przy użyciu niestandardowych metadanych.
Jeśli skonfigurowałeś obiekty blob do miękkiego usuwania, podaj parę nazwa-wartość dla właściwości metadanych. Zalecamy użycie funkcji IsDeleted. Jeśli parametr IsDeleted ma wartość true w obiekcie blob, indeksator pominie odpowiedni dokument wyszukiwania w następnym uruchomieniu indeksatora.
Kreator nie sprawdza prawidłowych ustawień Azure Storage lub nie zgłasza błędu, jeśli wymagania nie zostały spełnione. Zamiast tego detekcja usuwania nie działa, a indeks wyszukiwania prawdopodobnie z czasem będzie zbierać osierocone dokumenty.
Zaznacz pole wyboru Uwierzytelnij przy użyciu tożsamości zarządzanej . Pozostaw typ tożsamości przypisany przez system.
Wybierz pozycję Dalej.
Wektoryzacja tekstu
W tym kroku kreator używa wybranego modelu osadzania w celu wektoryzacji danych fragmentowanych. Fragmentowanie jest wbudowane i niekonfigurowalne. Obowiązujące ustawienia to:
"textSplitMode": "pages",
"maximumPageLength": 2000,
"pageOverlapLength": 500,
"maximumPagesToTake": 0, #unlimited
"unit": "characters"
Na stronie Vectorize your text wybierz Azure OpenAI jako rodzaj.
Wybierz subskrypcję Azure.
Wybierz zasób Azure OpenAI, a następnie wybierz model, który wdrożyłeś w Przygotowanie modelu osadzania.
W polu Typ uwierzytelniania wybierz pozycję Tożsamość przypisana przez system.
Zaznacz pole wyboru, które potwierdza skutki rozliczeń korzystania z tych zasobów.
Wybierz pozycję Dalej.
Wektoryzacja i wzbogacanie obrazów
Pliki PDF planu kondycji zawierają logo firmowe, ale w przeciwnym razie nie ma obrazów. Jeśli używasz przykładowych dokumentów, możesz pominąć ten krok.
Jeśli jednak zawartość zawiera przydatne obrazy, możesz zastosować sztuczną inteligencję w jeden lub oba następujące sposoby:
Użyj obsługiwanego modelu osadzania obrazów z katalogu modeli Microsoft Foundry lub wielomodalnego interfejsu API osadzania usługi Azure Vision (za pośrednictwem konta z wieloma usługami), aby wektoryzować obrazy.
Wyodrębnianie tekstu z obrazów przy użyciu optycznego rozpoznawania znaków (OCR). Ta opcja wywołuje umiejętności OCR.
Na stronie Wektoryzacja i wzbogacanie obrazów zaznacz pole wyboru Wektoryzacja obrazów .
Aby wybrać rodzaj, wybierz dostawcę modelu: Microsoft Foundry lub Azure Vision w narzędziach Foundry Tools.
Wybierz subskrypcję Azure, zasób i wdrożenie modelu osadzenia (jeśli ma to zastosowanie).
W polu Typ uwierzytelniania wybierz pozycję Tożsamość przypisana przez system , jeśli nie używasz projektu opartego na centrum. W przeciwnym razie pozostaw go jako klucz API.
Zaznacz pole wyboru, które potwierdza skutki rozliczeń korzystania z tych zasobów.
Wybierz pozycję Dalej.
Dodawanie klasyfikacji semantycznej
Na stronie Ustawienia zaawansowane możesz opcjonalnie dodać semantyczną klasyfikację , aby ponownie korbować wyniki na końcu wykonywania zapytania. Reranking promuje najbardziej semantycznie istotne mecze do góry.
Mapowanie nowych pól
Na stronie Ustawienia zaawansowane możesz opcjonalnie dodać nowe pola, zakładając, że źródło danych udostępnia metadane lub pola, które nie są pobierane podczas pierwszego przekazywania. Domyślnie kreator generuje pola opisane w poniższej tabeli.
| Pole | Dotyczy | Opis |
|---|---|---|
| chunk_id | Wektory tekstowe i obrazowe | Wygenerowane pole ciągu. Możliwe do wyszukiwania, odzyskiwania i sortowania. Jest to klucz dokumentu dla indeksu. |
| id_rodzica | Wektory tekstowe | Wygenerowane pole ciągu. Możliwe do pobrania i filtrowania. Identyfikuje dokument nadrzędny, z którego pochodzi fragment. |
| Fragment | Wektory tekstowe i obrazowe | Pole tekstowe. Czytelna dla człowieka wersja fragmentu danych. Można wyszukiwać i pobierać, ale nie można filtrować, tworzyć faset lub sortować. |
| Tytuł | Wektory tekstowe i obrazowe | Pole tekstowe. Czytelny dla człowieka tytuł dokumentu lub tytuł strony lub numer strony. Można wyszukiwać i pobierać, ale nie można filtrować, tworzyć faset lub sortować. |
| wektor_tekstowy | Wektory tekstowe | Kolekcja(Edm.pojedynczy). Wektorowa reprezentacja fragmentu. Można wyszukiwać i pobierać, ale nie można filtrować, tworzyć faset lub sortować. |
Nie można modyfikować wygenerowanych pól ani ich atrybutów, ale możesz dodać nowe pola, jeśli źródło danych je udostępni. Na przykład Azure Blob Storage udostępnia kolekcję pól metadanych.
Aby dodać pola do schematu indeksu:
Na stronie Ustawienia zaawansowane w obszarze Pola indeksu wybierz pozycję Podgląd i edytuj.
Wybierz pozycję Dodaj pole.
Wybierz pole źródłowe z dostępnych pól, wprowadź nazwę pola dla indeksu i zaakceptuj domyślny typ danych (lub przesłoń).
Jeśli chcesz przywrócić schemat do oryginalnej wersji, wybierz pozycję Resetuj.
Kluczowe kwestie dotyczące tego kroku:
Schemat indeksu zawiera pola wektorowe i niewektorowe dla danych fragmentowanych.
Tryb analizowania dokumentów tworzy fragmenty (jeden dokument wyszukiwania na fragment).
Indeksowanie harmonogramu
W przypadku źródeł danych, w których dane bazowe są niestabilne, można zaplanować indeksowanie w celu przechwycenia zmian w określonych interwałach lub określonych datach i godzinach.
Aby zaplanować indeksowanie:
Na stronie Ustawienia zaawansowane w obszarze Planowanie indeksowania określ harmonogram uruchamiania indeksatora. Zalecamy Once do tego szybkiego startu.
Wybierz pozycję Dalej.
Zakończ kreatora
Ostatnim krokiem jest przejrzenie konfiguracji i utworzenie niezbędnych obiektów do wyszukiwania wektorów. W razie potrzeby wróć do poprzednich stron w kreatorze, aby dostosować konfigurację.
Aby zakończyć działanie kreatora:
Na stronie Przeglądanie i tworzenie określ prefiks dla obiektów tworzonych przez kreatora. Wspólny prefiks pomaga zachować organizację.
Wybierz pozycję Utwórz.
Obiekty utworzone przez kreatora
Po zakończeniu konfiguracji kreator tworzy następujące obiekty:
| Obiektu | Opis |
|---|---|
| Źródło danych | Reprezentuje połączenie z wybranym źródłem danych. |
| Indeks | Zawiera pola wektorowe, wektoryzatory, profile wektorów i algorytmy wektorów. Nie można zmodyfikować indeksu domyślnego podczas przepływu pracy kreatora. Indeksy są zgodne z najnowszym interfejsem API REST w wersji zapoznawczej , dzięki czemu można używać funkcji w wersji zapoznawczej. |
| Zestaw umiejętności | Zawiera następujące umiejętności i konfigurację:
|
| Indeksatora | Zarządza potokiem indeksowania, z mapowaniami pól i mapowaniami pól wyjściowych (jeśli mają zastosowanie). |
Wskazówka
Obiekty utworzone przez kreatora mają konfigurowalne definicje JSON. Aby wyświetlić lub zmodyfikować te definicje, wybierz pozycję Zarządzanie wyszukiwaniem w okienku po lewej stronie, gdzie można wyświetlić indeksy, indeksatory, źródła danych i zestawy umiejętności.
Sprawdzanie wyników
Eksplorator wyszukiwania akceptuje ciągi tekstowe jako dane wejściowe, a następnie wektoryzuje tekst na potrzeby wykonywania zapytania wektorowego.
Aby wysłać zapytanie do indeksu wektora:
W portalu Azure przejdź do Search Management>Indexes a następnie wybierz indeks.
Wybierz pozycję Opcje zapytania, a następnie wybierz pozycję Ukryj wartości wektorów w wynikach wyszukiwania. Ten krok sprawia, że wyniki są bardziej czytelne.
W menu Widok wybierz widok JSON , aby wprowadzić tekst zapytania wektorowego w parametrze zapytania wektorowego
text.Zapytanie domyślne jest pustym wyszukiwaniem (
"*"), ale dopuszcza parametry do zwracania liczby dopasowań. Jest to zapytanie hybrydowe, które uruchamia zapytania tekstowe i wektorowe równolegle. Zawiera również semantyczną klasyfikację i określa, które pola mają być zwracane w wynikach za pomocą instrukcjiselect.{ "search": "*", "count": true, "vectorQueries": [ { "kind": "text", "text": "*", "fields": "text_vector,image_vector" } ], "queryType": "semantic", "semanticConfiguration": "my-demo-semantic-configuration", "captions": "extractive", "answers": "extractive|count-3", "queryLanguage": "en-us", "select": "chunk_id,text_parent_id,chunk,title,image_parent_id" }Zastąp oba symbole zastępcze gwiazdek (
*) pytaniem związanym z planami zdrowotnymi, takim jakWhich plan has the lowest deductible?.{ "search": "Which plan has the lowest deductible?", "count": true, "vectorQueries": [ { "kind": "text", "text": "Which plan has the lowest deductible?", "fields": "text_vector,image_vector" } ], "queryType": "semantic", "semanticConfiguration": "my-demo-semantic-configuration", "captions": "extractive", "answers": "extractive|count-3", "queryLanguage": "en-us", "select": "chunk_id,text_parent_id,chunk,title" }Aby uruchomić zapytanie, wybierz pozycję Wyszukaj.
Każdy dokument jest fragmentem oryginalnego pliku PDF. Pole
titlepokazuje, z którego pliku PDF pochodzi fragment. Każdychunkjest długi. Możesz skopiować i wkleić jeden z nich do edytora tekstów, aby odczytać całą wartość.Aby wyświetlić wszystkie fragmenty z określonego dokumentu, dodaj filtr dla
title_parent_idpola dla określonego pliku PDF. Możesz sprawdzić kartę Pola indeksu, aby potwierdzić, że pole jest filtrowalne.{ "select": "chunk_id,text_parent_id,chunk,title", "filter": "text_parent_id eq 'aHR0cHM6Ly9oZWlkaXN0c3RvcmFnZWRlbW9lYXN0dXMuYmxvYi5jb3JlLndpbmRvd3MubmV0L2hlYWx0aC1wbGFuLXBkZnMvTm9ydGh3aW5kX1N0YW5kYXJkX0JlbmVmaXRzX0RldGFpbHMucGRm0'", "count": true, "vectorQueries": [ { "kind": "text", "text": "*", "k": 5, "fields": "text_vector" } ] }
Czyszczenie zasobów
Jeśli pracujesz we własnej subskrypcji, dobrym pomysłem jest zakończenie projektu przez usunięcie zasobów, których już nie potrzebujesz. Zasoby, które pozostają uruchomione, mogą kosztować pieniądze.
W portalu Azure wybierz pozycję Wszystkie zasoby lub Grupy zasobów w okienku po lewej stronie, aby znaleźć zasoby i zarządzać nimi. Zasoby można usunąć pojedynczo lub usunąć grupę zasobów, aby jednocześnie usunąć wszystkie zasoby.
Następny krok
W tym przewodniku szybkiego startu przedstawiono kreatora Importuj dane, który tworzy wszystkie niezbędne obiekty do zintegrowanej wektoryzacji. Aby zapoznać się ze szczegółowymi informacjami na temat poszczególnych kroków, zobacz