Wyszukiwanie wielomodalne w Wyszukiwanie AI platformy Azure

Note

Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.

Wyszukiwanie wielomodalne odnosi się do możliwości pozyskiwania, interpretowania i pobierania informacji w wielu typach zawartości, w tym tekstu, obrazów, wideo i audio. W Wyszukiwanie AI platformy Azure wyszukiwanie wielomodalne natywnie obsługuje pozyskiwanie dokumentów zawierających tekst i obrazy oraz pobieranie ich zawartości, umożliwiając wyszukiwanie, które łączy obie formy.

Tworzenie niezawodnego przepływu wielomodalnego zwykle obejmuje:

  1. Wyodrębnianie obrazów wbudowanych i tekstu strony z dokumentów.

  2. Opisywanie obrazów w języku naturalnym.

  3. Osadzanie tekstu i obrazów w udostępnionej przestrzeni wektorowej.

  4. Przechowywanie obrazów do późniejszego użycia jako adnotacje.

Wyszukiwanie wielomodalne wymaga również zachowania kolejności informacji wyświetlanych w dokumentach i wykonywania zapytań hybrydowych łączących wyszukiwanie pełnotekstowe z wyszukiwaniem wektorowym i klasyfikacją semantyczną.

W praktyce aplikacja korzystająca z wyszukiwania wielomodalnego może odpowiedzieć na pytania, takie jak "Jaki jest proces zatwierdzenia formularza KADR?" nawet wtedy, gdy jedyny autorytatywny opis procesu znajduje się wewnątrz osadzonego diagramu w pliku PDF.

Tradycyjnie wyszukiwanie wielomodalne wymaga oddzielnych systemów przetwarzania tekstu i obrazu, często wymagających niestandardowego kodu i konfiguracji niskiego poziomu od deweloperów. Utrzymanie tych systemów wiąże się z wyższymi kosztami, złożonością i nakładem pracy.

Wyszukiwanie AI platformy Azure sprosta tym wyzwaniom, integrując obrazy w ten sam potok wyszukiwania co tekst. Jednym potokiem wielomodalnym można uprościć konfigurowanie i odblokowywanie informacji znajdujących się na wykresach, zrzutach ekranu, infografikach, zeskanowanych formularzach i innych złożonych wizualizacjach.

Wyszukiwanie wielomodalne jest idealne dla scenariuszy generowania wspomaganego przez pobieranie (RAG). Interpretując logikę strukturalną obrazów, wyszukiwanie wielomodalne sprawia, że aplikacja RAG lub agent sztucznej inteligencji rzadziej pomija ważne szczegóły wizualne. Udostępnia również użytkownikom szczegółowe odpowiedzi, które można prześledzić z powrotem do swoich oryginalnych źródeł, niezależnie od modalności źródła.

Jak działa wyszukiwanie wielomodalne?

Aby uprościć tworzenie potoku wielomodalnego, Wyszukiwanie AI platformy Azure oferuje kreatora Importuj dane w portalu Azure. Kreator pomaga skonfigurować źródło danych, zdefiniować ustawienia wyodrębniania i wzbogacania oraz wygenerować wielomodalny indeks zawierający tekst, osadzone odwołania do obrazów i osadzanie wektorów. Aby uzyskać więcej informacji, zobacz Quickstart: Wyszukiwanie wielomodalne w portalu Azure.

Asystent wykonuje następujące kroki, aby utworzyć wielomodalny potok:

  1. Wyodrębnij zawartość: Wybierz umiejętność wyodrębniania dokumentów lub umiejętność Azure Content Understanding, aby uzyskać tekst strony, obrazy osadzone i metadane strukturalne. Każda umiejętność oferuje różne możliwości wyodrębniania metadanych, obsługi tabel i obsługi formatu plików. Aby uzyskać szczegółowe porównania, zobacz Opcje wyodrębniania zawartości wielomodalnej.

  2. Fragment Tekstu: Umiejętność Rozdzielania Tekstu dzieli wyodrębniony tekst na łatwe do zarządzania części do użycia w pozostałych etapach potoku, na przykład umiejętności osadzania.

  3. Generowanie opisów obrazów:Umiejętność GenAI Prompt słowizuje obrazy, tworząc zwięzłe opisy języka naturalnego na potrzeby wyszukiwania tekstu i osadzania przy użyciu dużego modelu językowego (LLM).

  4. Generowanie osadzania: Umiejętność osadzania tworzy wektorowe reprezentacje tekstu i obrazów, umożliwiając podobieństwo i pobieranie hybrydowe. Można bezpośrednio wywoływać modele osadzania Azure OpenAI, Microsoft Foundry lub Azure Vision (wersja zapoznawcza).

    Alternatywnie można pominąć werbalizację obrazów i przekazać wyodrębniony tekst i obrazy bezpośrednio do modelu wielomodalnego osadzania za pośrednictwem umiejętności AML lub umiejętności Azure Vision wielomodalnego osadzania. Aby uzyskać więcej informacji, zobacz Opcje osadzania zawartości wielomodalnej.

  5. Przechowywanie wyodrębnionych obrazów:Magazyn wiedzy zawiera wyodrębnione obrazy, które mogą być zwracane bezpośrednio do aplikacji klienckich. W przypadku korzystania z kreatora lokalizacja obrazu jest przechowywana bezpośrednio w indeksie wielomodalnym, co umożliwia wygodne pobieranie w czasie wykonywania zapytań.

Wskazówka

Aby wyświetlić wielomodalne wyszukiwanie w działaniu, podłącz utworzony przez kreatora indeks do wielomodalnej aplikacji przykładowej RAG. W przykładzie pokazano, jak aplikacja RAG korzysta z wielomodalnego indeksu i renderuje zarówno cytaty tekstowe, jak i skojarzone fragmenty kodu obrazu w odpowiedzi. W przykładzie pokazano również oparty na kodzie proces pozyskiwania i indeksowania danych.

Opcje wyodrębniania zawartości wielomodalnej

Potok wielomodalny rozpoczyna się od segmentacji każdego dokumentu źródłowego na fragmenty tekstu, obrazy osadzone oraz skojarzone metadane. W tym kroku Wyszukiwanie AI platformy Azure oferuje dwa zalecane wbudowane umiejętności:

Charakterystyka Umiejętność ekstrakcji dokumentów funkcja Azure Content Understanding
Wyodrębnianie metadanych lokalizacji tekstu (strony i powiązane wielokąty) Nie Tak
Wyodrębnianie metadanych lokalizacji obrazu (strony i powiązane wielokąty) Tak Tak
Wyodrębnianie i zachowywanie tabel Nie Tak (w tym tabele między stronami)
Jednostki semantyczne przekraczające strony Nie dotyczy Tak (obejmuje granice stron)
Wyodrębnianie metadanych lokalizacji na podstawie typu pliku Tylko pliki PDF. Wiele obsługiwanych typów plików, w tym PDF, DOCX, XLSX i PPTX.
Rozliczenia dotyczące wyodrębniania danych Wyodrębnianie obrazów jest rozliczane zgodnie z cennikiem Wyszukiwanie AI platformy Azure. Rozliczane zgodnie z cennikiem Azure Content Understanding.
Wbudowane fragmentowanie Nie (użyj umiejętności dzielenia tekstu) Tak (fragmentowanie semantyczne)
Opisy obrazów generowanych przez sztuczną inteligencję Nie Tak (gdy modelName i modelDeployment są skonfigurowane, dostępne od interfejsu API REST 2026-05-01-preview)
Zalecane scenariusze Szybkie prototypowanie lub procesy produkcyjne niewymagające dokładnych informacji o pozycji ani szczegółowym układzie. Zaawansowana analiza dokumentów wymagająca wyodrębniania tabel między stronami, fragmentowania semantycznego i opisów obrazów generowanych przez sztuczną inteligencję.

Funkcja Układ dokumentu jest nadal obsługiwana dla istniejących potoków. W przypadku nowych umiejętności użyj umiejętności Azure Content Understanding, która łączy wyodrębnianie i dzielenie zawartości w jedną umiejętność i obsługuje semantyczne fragmentowanie, opisy obrazów generowane przez sztuczną inteligencję i wyodrębnianie tabel między stronami.

Opcje osadzania zawartości wielomodalnej

W Wyszukiwanie AI platformy Azure pobieranie wiedzy z obrazów może przebiegać dwiema uzupełniającymi się ścieżkami: werbalizacją obrazów lub bezpośrednim embeddowaniem. Zrozumienie różnic pomaga w dopasowaniu kosztów, opóźnień i jakości odpowiedzi z potrzebami aplikacji.

Werbalizacja obrazów, po której następuje osadzanie tekstu

Przy użyciu tej metody GenAI Prompt skill wywołuje LLM podczas pozyskiwania, aby utworzyć zwięzły opis w języku naturalnym dla każdego wyodrębnionego obrazu, na przykład "Pięcioetapowy proces uzyskiwania dostępu w zakresie HR, który rozpoczyna się od zatwierdzenia przez menedżera." Opis jest przechowywany jako tekst i osadzany obok otaczającego tekstu dokumentu, który następnie można wektoryzować, wywołując modele osadzenia Azure OpenAI, Microsoft Foundry lub Azure Vision.

Ponieważ obraz jest teraz wyrażony w języku, Wyszukiwanie AI platformy Azure może:

  • Interpretowanie relacji i jednostek pokazanych na diagramie.

  • Podaj gotowe podpisy, które LLM może cytować dosłownie w swojej odpowiedzi.

  • Zwracanie odpowiednich fragmentów dla aplikacji RAG lub scenariuszy agenta AI z podstawowymi danymi.

Dodatkowa głębokość semantyczna wiąże się z wywołaniem LLM dla każdego obrazu oraz niewielkim wzrostem czasu indeksowania.

Bezpośrednia wielomodalna integracja

Drugą opcją jest przekazanie wyodrębnionych przez dokument obrazów i tekstu do modelu osadzania wielomodalnego, który tworzy reprezentacje wektorów w tej samej przestrzeni wektorowej. Konfiguracja jest prosta, a podczas indeksowania nie jest wymagany LLM. Osadzenia bezpośrednie doskonale nadają się do wizualnego podobieństwa i scenariuszy "znajdź-mi-coś-co-wygląda-tak-jak-to".

Ponieważ reprezentacja jest czysto matematyczna, nie przekazuje, dlaczego dwa obrazy są powiązane i nie oferuje gotowego kontekstu LLM do cytatów ani szczegółowych wyjaśnień.

Łączenie obu podejść

Wiele rozwiązań wymaga obu ścieżek kodowania. Diagramy, wykresy blokowe i inne wizualizacje bogate w wyjaśnienia są zwerbalizowane, dzięki czemu informacje semantyczne są dostępne na potrzeby uziemienia agenta RAG i sztucznej inteligencji. Zrzuty ekranu, zdjęcia produktów lub grafika są osadzone bezpośrednio w celu wydajnego wyszukiwania podobieństwa. Możesz dostosować indeks Wyszukiwanie AI platformy Azure oraz potok zestawu umiejętności indeksatora, aby przechowywać dwa zestawy wektorów i pobierać je razem.

Opcje wykonywania zapytań dotyczących zawartości wielomodalnej

Jeśli potok wielomodalny jest obsługiwany przez umiejętność GenAI Prompt, możesz uruchamiać zapytania hybrydowe zarówno na zwykłym tekście, jak i na zwerbalizowanych obrazach w indeksie wyszukiwania. Możesz również użyć filtrów, aby zawęzić wyniki wyszukiwania do określonych typów zawartości, takich jak tylko tekst lub tylko obrazy.

Mimo że umiejętność GenAI Prompt obsługuje zapytania tekstowe do wektora za pośrednictwem wyszukiwania hybrydowego, nie obsługuje zapytań obraz-wektor. Tylko modele osadzania wielomodalnego zapewniają wektoryzatory, które konwertują obrazy na wektory w czasie wykonywania zapytania.

Aby używać obrazów jako danych wejściowych zapytań dla indeksu wielomodalnego, należy użyć umiejętności AML lub umiejętności osadzania wielomodalnego Azure Vision z równoważnym wektoryzatorem. Aby uzyskać więcej informacji, zobacz Konfigurowanie wektoryzatora w indeksie wyszukiwania.

Samouczki i przykłady

Aby ułatwić rozpoczęcie wyszukiwania wielomodalnego w Wyszukiwanie AI platformy Azure, oto kolekcja zawartości, która pokazuje, jak tworzyć i optymalizować indeksy wielomodalne przy użyciu funkcji Azure.

Zawartości Opis
Quickstart: wyszukiwanie wielomodalne w portalu Azure Utwórz i przetestuj indeks wielomodalny w portalu Azure przy użyciu kreatora i Eksploratora wyszukiwania.
Samouczek wielomodalny Wyodrębnianie tekstu i obrazów, fragmentów danych i wektoryzowanie fragmentów na potrzeby wyszukiwania podobieństwa i innych wzorców pobierania.
Przykładowa aplikacja: Wielomodalne repozytorium GitHub RAG Zintegrowana, gotowa do użycia aplikacja RAG typu code-ready z funkcjami wielomodalnymi, które wyświetlają zarówno fragmenty tekstu, jak i adnotacje graficzne. Idealny do szybkiego uruchamiania pomocników korporacyjnych.