Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Ważne
Tłumaczenia nieanglojęzyczne są dostępne tylko dla wygody. Zapoznaj się zEN-US wersją tego dokumentu, aby uzyskać ostateczną wersję.
Co to jest notatka dotycząca przezroczystości?
System sztucznej inteligencji obejmuje nie tylko technologię, ale także osoby, które będą jej używać, osoby, których to dotyczy, oraz środowisko, w którym jest wdrażana. Utworzenie systemu dopasowanego do zamierzonego celu wymaga zrozumienia, jak działa technologia, jakie są jego możliwości i ograniczenia oraz jak osiągnąć najlepszą wydajność. Notatki dotyczące przejrzystości Microsoftu mają na celu pomóc w zrozumieniu, jak działa nasza technologia sztucznej inteligencji, jakie wybory mogą podejmować właściciele systemu, które wpływają na wydajność i zachowanie systemu, oraz podkreślić znaczenie uwzględniania całego systemu, w tym technologii, ludzi i środowiska. Możesz użyć notatek przezroczystości podczas tworzenia lub wdrażania własnego systemu lub udostępniania ich osobom, które będą korzystać z systemu lub mają na nie wpływ.
Uwagi dotyczące przejrzystości Microsoft są częścią szerszego wysiłku firmy, aby w praktyce wprowadzić nasze zasady sztucznej inteligencji. Aby dowiedzieć się więcej, zobacz Microsoft zasady sztucznej inteligencji.
Podstawy Wyszukiwanie AI platformy Azure
Wprowadzenie
Wyszukiwanie AI platformy Azure udostępnia deweloperom narzędzia, interfejsy API i zestawy SDK do tworzenia rozbudowanego środowiska wyszukiwania w prywatnej, heterogenicznej zawartości w aplikacjach internetowych, mobilnych i dla przedsiębiorstw. Wyszukiwanie jest podstawowe dla każdej aplikacji, która wyświetla dane użytkownikom. Typowe scenariusze obejmują wyszukiwanie katalogów lub dokumentów, sklepy detaliczne online lub eksplorację danych w przypadku zastrzeżonej zawartości.
Dane z możliwością wyszukiwania mogą być w postaci tekstu lub wektorów i pozyskiwane as-is ze źródła danych lub wzbogacone za pomocą sztucznej inteligencji w celu ulepszenia ogólnego środowiska wyszukiwania. Deweloperzy mogą konwertować dane int na reprezentacje liczbowe (nazywane wektorami), wybierając opcję wywoływania zewnętrznych modeli uczenia maszynowego (nazywanych modelami osadzania). Indeksatory mogą opcjonalnie zawierać zestawy umiejętności, które obsługują zaawansowany zestaw wzbogacania danych za pośrednictwem kilku Azure Language in Foundry Tools możliwości, takich jak Named Entity Recognition (NER) i wykrywanie informacji umożliwiających identyfikację osoby (PII), oraz Azure Vision in Foundry Tools możliwości, w tym optyczne rozpoznawanie znaków (OCR) i analizę obrazów.
Zapoznaj się z poniższymi kartami, aby uzyskać więcej informacji o tym, jak Wyszukiwanie AI platformy Azure usprawnia wyszukiwanie przy użyciu narzędzi Foundry Tools lub innych systemów sztucznej inteligencji, aby lepiej zrozumieć intencję, semantyka i dorozumianą strukturę zawartości klienta.
- Wzbogacanie sztucznej inteligencji
- Wyszukiwanie wektorowe
- Ranga semantyczna
- Ponowne zapisywanie zapytań
- Umiejętność tworzenia promptów GenAI
- Pobieranie agentowe
Wzbogacanie sztucznej inteligencji to zastosowanie modeli uczenia maszynowego z narzędzi Foundry Tools za pośrednictwem zawartości, która nie jest łatwo wyszukiwana w postaci pierwotnej. Poprzez wzbogacenie, analiza i wnioskowanie są używane do tworzenia przeszukiwalnej zawartości i struktury, której wcześniej nie było.
Wzbogacanie sztucznej inteligencji to opcjonalne rozszerzenie pipeline'u indeksowania Wyszukiwanie AI platformy Azure, które łączy się z Foundry Tools w tym samym regionie co usługa wyszukiwania klienta. Potok wzbogacania ma te same podstawowe składniki co typowy indeksator (indeksator, źródło danych, indeks), a także zestaw umiejętności określający atomowe kroki wzbogacania. Zestaw umiejętności można zebrać, korzystając z wbudowanych umiejętności opartych na interfejsach API narzędzi Foundry, takich jak Widzenie i Język, lub niestandardowe umiejętności, które uruchamiają dostarczony przez użytkownika kod zewnętrzny.
Wyszukiwanie wektorowe to metoda pobierania informacji, w której dokumenty i zapytania są reprezentowane w indeksie jako wektory zamiast zwykłego tekstu. W wyszukiwaniu wektorowym modele uczenia maszynowego hostowane zewnętrznie z Wyszukiwanie AI platformy Azure generują wektorowe reprezentacje danych wejściowych źródłowych, które mogą być tekstem, obrazami, audio lub zawartością wideo. Ta matematyczna i znormalizowana reprezentacja zawartości, nazywana osadzaniem wektorów, stanowi wspólną podstawę dla scenariuszy wyszukiwania.
Gdy wszystko jest wektorem, zapytanie może znaleźć dopasowanie w przestrzeni wektorowej, nawet jeśli skojarzona oryginalna zawartość znajduje się w innym typie nośnika, takim jak obrazy i tekst, lub język niż zapytanie. Aparat wyszukiwania skanuje indeks w poszukiwaniu zawartości wektorowej, która jest najbardziej podobna, czyli najbliżej wektora w zapytaniu. Dopasowywanie na podstawie matematycznego wektora reprezentacji zamiast słów kluczowych sprawia, że znacznie bardziej prawdopodobne jest znalezienie dopasowań, które dzielą znaczenie semantyczne, lecz różnią się tekstowo, takich jak "samochód" i "auto", na przykład. Zapewnia to bardziej szczegółowe wprowadzenie do osadzania wektorów i sposobu działania algorytmu podobieństwa.
Kluczowe terminy
| Termin | Definicji |
|---|---|
| Osadzanie wektorów | Wysoce zoptymalizowany sposób reprezentowania danych, które odzwierciedlają znaczenie i zrozumienie wyodrębnione przez model uczenia maszynowego z obrazów, audio, wideo lub tekstu. Zawartość jest konwertowana na osadzenia wektorowe zarówno podczas indeksowania, jak i generowania zapytania. Wyszukiwanie wektorowe to pobieranie osadzonych elementów podanych w zapytaniu i wyszukiwanie najbardziej podobnych osadzania w indeksie. Wyniki są następnie zwykle sortowane według stopnia podobieństwa. |
| Przestrzeń osadzania | Wszystkie wektory w korpusie pojedynczego pola zajmują to samo miejsce osadzania, w którym podobne elementy znajdują się blisko siebie, a różne elementy są bardziej oddalone. Wyższa wymiarowość miejsca osadzania może zawierać więcej informacji w jednym wektorze i znacznie poprawić środowisko wyszukiwania, ale przy znaczącym koszcie rozmiaru magazynu indeksu i większym opóźnieniu zapytań. |
Semantyczny ranker wykorzystuje kontekst lub semantyczne znaczenie zapytania, aby obliczyć nowy wynik relewancji, który promuje wyniki semantycznie najbliższe intencji oryginalnego zapytania na wyższe pozycje. Początkowy zestaw wyników może pochodzić z wyszukiwania słów kluczowych z klasyfikacją BM25 , wyszukiwaniem wektorów lub wyszukiwaniem hybrydowym obejmującym oba te elementy. Tworzy ona również i zwraca "napisy", wyodrębniając dosłowną zawartość z wyniku, oraz "wyróżnia", aby zwrócić uwagę na ważną zawartość w wyniku. Może również zwrócić "odpowiedź", jeśli zapytanie ma cechy pytania ("jaki jest mroźny punkt wody"), a wynik zawiera tekst o cechach odpowiedzi ("woda zamarza w temperaturze 0°C lub 32°F").
Kluczowe terminy
| Termin | Definicji |
|---|---|
| Ranga semantyczna | Używa kontekstu i semantycznego znaczenia zapytania, aby poprawić istotność wyszukiwania przy użyciu interpretacji języka w celu ponownego pozycjonowania wyników wyszukiwania. |
| Semantyczne podpisy i wyróżnienia | Wyodrębnia zdania i frazy z dokumentu, które najlepiej podsumowują zawartość, z wyróżnionymi fragmentami kluczowymi w celu łatwego skanowania. Podpisy, które podsumowują wynik, są przydatne, gdy poszczególne pola zawartości są zbyt gęste dla strony wyników. Wyróżniony tekst podnosi poziom najbardziej odpowiednich terminów i fraz, dzięki czemu użytkownicy mogą szybko określić, dlaczego dopasowanie zostało uznane za istotne. |
| Odpowiedzi semantyczne | Udostępnia opcjonalną i dodatkową strukturę zwracaną z zapytania semantycznego. Zapewnia bezpośrednią odpowiedź na zapytanie, które wygląda jak pytanie. Wymaga to, aby dokument miał tekst z cechami odpowiedzi. |
Ponowne zapisywanie zapytań tworzy zapytania syntetyczne, które są zapytaniami tworzonymi sztucznie lub generowanymi na podstawie danych pochodzących od klientów, aby poprawić pokrycie (ułamek odpowiednich dokumentów pobranych z łącznej liczby dostępnych dokumentów) rankingu BM25, wyszukiwania wektorowego lub wyszukiwania hybrydowego. Oryginalne zapytanie jest łączone z zapytaniami syntetycznymi w celu zapewnienia optymalnego przywołania przez wyszukiwarkę.
Umiejętność GenAI Prompt jest częścią katalogu umiejętności Wyszukiwanie AI platformy Azure, umożliwiając klientom ulepszanie indeksów wyszukiwania przy użyciu zawartości wygenerowanej przez sztuczną inteligencję na podstawie ich danych. Korzystając z własnych danych i preferencji organizacji klienta, ta umiejętność ułatwia tworzenie dostosowanych podsumowań, odpowiedzi lub szczegółowych informacji, które są zgodne z ich potrzebami.
Oznacza to, że gdy użytkownik końcowy przeszukuje zawartość klientów za pośrednictwem wyszukiwania sztucznej inteligencji, wygenerowana przez sztuczną inteligencję zawartość może zapewnić bardziej informacyjne i kontekstowe wyniki, co ułatwia użytkownikom znajdowanie szukanych informacji.
Kluczowe terminy
| Termin | Definicji |
|---|---|
| Umiejętności | Umiejętność Wyszukiwanie AI platformy Azure to modułowy składnik przetwarzania w ramach potoku wzbogacania Wyszukiwanie AI platformy Azure. Te umiejętności stosują przekształcenia oparte na sztucznej inteligencji do nieprzetworzonej zawartości, takiej jak tekst, obrazy lub dokumenty, podczas indeksowania, umożliwiając wyodrębnianie ustrukturyzowanych, przeszukiwalnych informacji z danych bez struktury. |
| Monit | Tekst wysyłany do usługi w wywołaniu interfejsu API. Ten tekst jest następnie wprowadzany do modelu. Można na przykład wprowadzić następujące zapytanie: Przekonwertuj pytania na polecenie: Pyt.: Zapytaj Constance, czy potrzebujemy chleba A: send-msg Czy potrzebujemy chleba find constance? Pyt.: Wyślij wiadomość do Grega, aby dowiedzieć się, czy wszystko jest gotowe do środy. 1: Wyślij wiadomość find greg wszystko gotowe na środę? |
| Indeksy wyszukiwania | W Wyszukiwanie AI platformy Azure indeks jest strukturą danych, która przechowuje zawartość z możliwością wyszukiwania, definiuje sposób jego przechowywania i kontroluje, jak usługa zinterpretuje ją podczas uruchamiania zapytania. |
Agentowe pobieranie to równoległa architektura przetwarzania zapytań, która używa konwersacyjnego modelu dużego języka (LLM) jako "planisty zapytań." Model LLM zmienia historię konwersacji użytkownika w jedną lub kilka skoncentrowanych podzapytań w miarę potrzeby. Te podzapytania są uruchamiane jednocześnie w indeksie Wyszukiwanie AI platformy Azure, a usługa scala pierwsze wyniki, zwracając:
- Pojedynczy ciąg zawartości zawierający najbardziej odpowiednie fragmenty (dane uziemieniowe).
- Tablica odwołań (opcjonalnie), która uwidacznia pełne dokumenty źródłowe lub fragmenty.
- Tablica działań, która zawiera listę każdej operacji, liczby tokenów i opóźnień, aby wspierać śledzenie kosztów i debugowanie.
Kluczowe terminy
| Termin | Definicji |
|---|---|
| Agentowa ekstrakcja | Dotyczy to agenta sztucznej inteligencji planującego i realizującego sekwencję kroków w celu pobrania informacji z podstawowych źródeł. Obejmuje to działania, takie jak wykonywanie zapytań i udoskonalanie wyszukiwań w celu uzyskania najbardziej odpowiednich informacji dotyczących zapytania. |
| Dane dotyczące uziemienia | Zestaw dokumentów/informacji zwracanych przez Agentic Retrieval. Służy jako podstawa rzeczowa, którą zewnętrzny LLM może przytaczać lub przekształcić w odpowiedź języka naturalnego, zapewniając możliwość śledzenia i zmniejszając ryzyko halucynacji. |
| Planer zapytań | Podział historii konwersacji na podzapytania w celu znalezienia najbardziej odpowiednich danych uziemienia dla bazowego zapytania wyszukiwania. |
| Podzapytanie | Pojedyncze zapytanie wygenerowane przez usługę LLM. Podzapytania są oparte na pytaniach użytkownika, historii czatu i parametrach w żądaniu. Podzapytania są przeznaczone dla indeksowanych dokumentów (zwykły tekst i wektory) w Wyszukiwanie AI platformy Azure. |
Możliwości
- Wzbogacanie sztucznej inteligencji
- Wyszukiwanie wektorowe
- Ranga semantyczna
- Ponowne zapisywanie zapytań
- Umiejętność tworzenia promptów GenAI
- Pobieranie agentowe
Zachowanie systemu
Kilka wbudowanych funkcji do wzbogacania sztucznej inteligencji w Wyszukiwanie AI platformy Azure korzysta z narzędzi Foundry Tools. Zobacz notatki o przejrzystości dla każdej wbudowanej umiejętności powiązanej poniżej w celu rozważenia, czy warto używać tej umiejętności.
- Umiejętność wyodrębniania kluczowych fraz: język — wyodrębnianie kluczowych fraz
- Umiejętność wykrywania języka: język — wykrywanie języka
- Umiejętność łączenia jednostek: język — łączenie jednostek
- Umiejętność rozpoznawania jednostek: język — rozpoznawanie jednostek nazwanych (NER)
- Umiejętność wykrywania PII: Język — wykrywanie PII
- Umiejętność sentymentu: język — analiza sentymentu
- Umiejętność analizy obrazów: Wizja — analiza obrazów
- Umiejętność OCR: Rozpoznawanie obrazu - OCR
- Umiejętność układu dokumentu: analiza dokumentów
Zapoznaj się z dokumentacją każdej umiejętności, aby dowiedzieć się więcej o odpowiednich możliwościach, ograniczeniach, wydajności, ocenach i metodach integracji i odpowiedzialnego użycia. Należy pamiętać, że użycie tych funkcji w połączeniu może prowadzić do efektów kumulacji (na przykład błędy wprowadzone podczas korzystania z OCR będą utrzymywać się podczas wyodrębniania kluczowych fraz).
Przypadki użycia
Przykładowe przypadki użycia
Ponieważ Wyszukiwanie AI platformy Azure jest rozwiązaniem do wyszukiwania pełnotekstowego, celem wzbogacania sztucznej inteligencji jest ulepszenie narzędzia wyszukiwania zawartości bez struktury. Oto kilka przykładów scenariuszy wzbogacania zawartości obsługiwanych przez wbudowane umiejętności:
- Funkcja translacji i wykrywania języka umożliwia wyszukiwanie wielojęzyczne.
- Rozpoznawanie jednostek wyodrębnia osoby , miejsca i inne jednostki z dużych fragmentów tekstu.
- Wyodrębnianie kluczowych fraz identyfikuje, a następnie generuje ważne terminy.
- Funkcja OCR rozpoznaje tekst drukowany i odręczny w plikach binarnych.
- Analiza obrazów opisuje zawartość obrazu i wyprowadza opisy jako pola tekstowe z możliwością wyszukiwania.
- Integrated vectorization to funkcja w wersji zapoznawczej, która wywołuje model osadzeń Azure OpenAI w celu wektoryzacji danych i przechowywania osadzeń w Wyszukiwanie AI platformy Azure w celu wyszukiwania podobieństwa.
Zachowanie systemu
W wyszukiwaniu wektorowym wyszukiwarka wyszukuje wektory w obszarze osadzania w indeksie, aby znaleźć te blisko wektora zapytania. Ta technika jest nazywana wyszukiwaniem najbliższego sąsiada. Pomaga to również określić stopień podobieństwa lub odległości między elementami. Wysoki stopień podobieństwa wektorów wskazuje, że oryginalne dane również były podobne. Dwa algorytmy wyszukiwania wektorowego obsługiwane przez Wyszukiwanie AI platformy Azure mają różne podejścia do tego problemu, balansując różne cechy, takie jak opóźnienie, przepustowość, czułość i pamięć.
Znalezienie rzeczywistego zestawu najbliższych sąsiadów "k" wymaga wyczerpującego porównania wektora wejściowego ze wszystkimi wektorami w zestawie danych. Chociaż każde obliczenie podobieństwa wektorów jest stosunkowo szybkie, wykonywanie tych wyczerpujących porównań w dużych zestawach danych jest kosztowne obliczenia i powolne ze względu na wymaganą liczbę porównań. Ponadto im większa jest wymiarowość każdego wektora, tym bardziej złożone i wolniejsze będą obliczenia w każdym wektorze.
Aby rozwiązać to wyzwanie, metody przybliżonego wyszukiwania najbliższego sąsiada (ANN) są używane do kompromisu między dokładnością a szybkością. Metody te mogą skutecznie znaleźć niewielki zestaw wektorów kandydatów, które najprawdopodobniej będą podobne do wektora zapytania, zmniejszając całkowitą liczbę porównań wektorów. Wyszukiwanie AI platformy Azure używa algorytmu Hierarchical Navigable Small World (HNSW) do organizowania wielowymiarowych punktów danych w probabilistycznej strukturze grafów hierarchicznych, która umożliwia szybkie wyszukiwanie podobieństwa przy jednoczesnym umożliwieniu dostosowania kompromisu między dokładnością wyszukiwania a kosztami obliczeniowymi.
Wyszukiwanie AI platformy Azure obsługuje również wiele metryk podobieństwa w celu określenia najbliższego sąsiada i wyniku każdego wektora. Obejmują one cosinus, "Euclidean" (znany również jako "l2 norm") i "produkt kropkowy". Cosine oblicza kąt między dwoma wektorami. Euklidesowa oblicza odległość euklidesową między dwoma wektorami, która jest l2-normą różnicy tych dwóch wektorów. Produkt kropkowy ma wpływ zarówno na wielkości wektorów, jak i kąt między nimi. W przypadku znormalizowanych miejsc osadzania produkt kropkowy jest odpowiednikiem podobieństwa cosinusu, ale jest bardziej wydajny.
Przypadki użycia
Przykładowe przypadki użycia
Istnieje wiele scenariuszy, w których wyszukiwanie wektorów jest przydatne i ogranicza je tylko do możliwości modelu używanego do generowania osadzania wektorów. Poniżej przedstawiono niektóre ogólne przypadki użycia, w których można użyć wyszukiwania wektorów:
- Semantyczne wyszukiwanie: Wyodrębnij semantyczne zrozumienie z tekstu przy użyciu modelu, na przykład modeli osadzania Azure OpenAI Service.
- Wyszukiwanie w różnych typach danych (wielomodalnych): kodowanie zawartości pochodzącej z obrazów, tekstu, dźwięku i wideo lub kombinacji oraz wykonywanie pojedynczego wyszukiwania we wszystkich z nich.
- Wyszukiwanie wielojęzyczne: użyj wielojęzycznego modelu osadzania, aby przedstawić dokument w wielu językach, aby znaleźć wyniki w obsługiwanych językach.
- Wyszukiwanie hybrydowe: wyszukiwanie wektorowe jest implementowane na poziomie pola, co oznacza, że można tworzyć zapytania obejmujące pola wektorowe i pola tekstowe z możliwością wyszukiwania. Zapytania są uruchamiane równolegle, a wyniki są scalane w jedną odpowiedź. Wykazano, że wyniki wyszukiwania hybrydowego z semantycznym rankingiem zapewniają najlepszą jakość rezultatów.
- Wyszukiwanie wektorów filtrowanych: zapytanie może zawierać zapytanie wektorowe i wyrażenie filtru. Filtry stosowane do innych typów danych są przydatne do dołączania lub wykluczania dokumentów na podstawie innych kryteriów.
- Baza danych wektorów: ten czysty magazyn wektorów jest przeznaczony dla pamięci długoterminowej lub zewnętrznej bazy wiedzy dla dużych modeli językowych (LLMs). Na przykład użyj funkcji wyszukiwania Wyszukiwanie AI platformy Azure jako indeksu wektorowego w przepływie monitu Azure Machine Learning dla aplikacji korzystających z technologii Retrieval Augmented Generation (RAG).
Zagadnienia dotyczące wybierania przypadku użycia
Mogą istnieć zagadnienia i obawy związane z określonym modelem, który wybierzesz do generowania osadzania wektorów. Każdy model może mieć własne problemy z stronniczością i uczciwością i należy je ocenić przed użyciem w aplikacji. Wyszukiwanie AI platformy Azure nie udostępnia żadnych modeli wektoryzacji zawartości w ramach usługi. Zobacz Azure OpenAI Service Transparency Note aby zapoznać się z przykładami tych zagadnień. Inne modele innych firm lub systemów operacyjnych mają kwestie do przejrzenia.
Zachowanie systemu
Klasyfikowanie wyników pierwszego kroku pobierania warstwy jest procesem intensywnie korzystającym z zasobów. Aby ukończyć przetwarzanie rankera w przewidywanym czasie opóźnienia operacji zapytania, tylko 50 najlepszych wyników z silnika wyszukiwania jest wysyłanych do semantycznego modelu rankingowego jako dane wejściowe. Jeśli liczba wyników jest za duża, 50 wyników jest najpierw wysyłanych do kroku podsumowania, który wyodrębnia najbardziej odpowiednią treść z każdego wyniku przed uruchomieniem semantycznego rankera.
W kroku podsumowania pobrany dokument jest najpierw umieszczany w procesie przygotowywania, który łączy różne dane wejściowe dokumentu w jeden długi ciąg. Jeśli ciąg jest za długi, wykonywane jest ćwiczenie przycinania, z szczególnym naciskiem na zachowanie zawartości zawartej w polach dodanych do konfiguracji semantycznej. Po przygotowaniu ciągów są one przekazywane za pośrednictwem zrozumienia maszynowego i modeli reprezentacji języka w celu określenia, które zdania i frazy zapewniają najlepsze podsumowanie względem zapytania. Ta faza wyodrębnia zawartość z ciągu, który zostanie przekazany do semantycznego etapu klasyfikacji i opcjonalnie wyprowadza semantyczny podpis lub semantyczną odpowiedź.
Ostatni krok, semantyczny ranking, określa istotność zawartości wyodrębnionej w poprzednim kroku do zapytania użytkownika i generuje semantyczny wynik klasyfikacji od 4 (wysoce istotne) do 0 (bez znaczenia). Ten krok jest oparty na tekście zapytania i na podsumowaniu tekstu i obejmuje bardziej złożone obliczenia niż te z warstwy pobierania.
Przypadki użycia
Przykładowe przypadki użycia
Klasyfikator semantyczny może być używany w wielu scenariuszach. Zamierzone przypadki użycia systemu obejmują:
- Generacja wspomagana wyszukiwaniem (RAG): Semantic ranker umożliwia udzielanie odpowiedzi przez aplikacje wykorzystujące generatywną sztuczną inteligencję na podstawie wyników wyszukiwania, które spełniają zdefiniowany przez Ciebie próg oceny istotności. Na przykład usługa Azure OpenAI wykorzystuje Wyszukiwanie AI platformy Azure do wzbogacania modeli Azure OpenAI za pomocą Twoich danych. W ramach tej usługi można użyć semantycznego klasyfikatora, aby poprawić trafność informacji podawanych do modelu Azure OpenAI.
- Wyszukiwanie zawartości: semantyczny rangator umożliwia wyszukiwanie odpowiedniej zawartości w danych przez analizowanie tekstu i metadanych. Na przykład, wyszukiwanie na witrynie learn.microsoft.com używa semantycznego rankera, aby poprawić trafność wyników dla deweloperów oprogramowania, którzy szukają dokumentacji technicznej Microsoft.
- Wyszukiwanie e-commerce: Semantyczny ranker umożliwia firmom e-commerce poprawę doświadczenia wyszukiwania, zapewniając odpowiednie wyniki produktów w oparciu o semantyczną trafność. Na przykład sprzedawcy detaliczni online używają semantycznego rankera, aby zoptymalizować swoje środowisko handlu elektronicznego, zapewniając odpowiednie wyniki wyszukiwania dla swoich kupujących online.
- QnA: Wyszukiwanie AI platformy Azure umożliwia organizacjom udostępnianie użytkownikom konwersacji, odpowiadając na pytania na podstawie informacji dostępnych w bazach danych. Na przykład producent może używać semantycznego rangatora do rozszerzania informacji dostępnych dla czatbota. Inżynierowie mogą używać tego czatbota do zadawania pytań i pobierania wysoce odpowiednich dokumentów wewnętrznych związanych z zapytaniami i błyskawicznymi odpowiedziami w pobranych dokumentach.
Zagadnienia dotyczące wybierania przypadku użycia
Zachęcamy klientów do używania klasyfikatora semantycznego w swoich innowacyjnych rozwiązaniach lub aplikacjach. Poniżej przedstawiono jednak niektóre zagadnienia dotyczące wybierania przypadku użycia:
- Informacje poufne : modele uczenia maszynowego, które umożliwiają semantyczny ranker przetwarzają dane pobierane w zapytaniu wyszukiwania, w tym informacje poufne, takie jak dane osobowe i informacje finansowe. Przed wdrożeniem semantycznego klasyfikatora semantycznego w takich przypadkach użycia należy wziąć pod uwagę wszelkie implikacje dotyczące prywatności i zabezpieczeń.
- Stronniczość i sprawiedliwość : semantyczny ranking jest obsługiwany przez modele głębokiego uczenia. Te modele uczenia głębokiego zostały wytrenowane przy użyciu publicznej zawartości. Dane klientów są oceniane przez modele klasyfikatora semantycznego. Oceń dane wyjściowe rankera semantycznego podczas wybierania przypadków użycia, szczególnie w przypadku przypadków użycia, które mają wpływ na sprawiedliwość i równość, na przykład zatrudnianie i rekrutację.
- Zgodność z przepisami: Niektóre branże, takie jak opieka zdrowotna i finanse, są wysoce regulowane i mogą mieć ograniczenia dotyczące korzystania ze sztucznej inteligencji i uczenia maszynowego. Przed użyciem semantycznego klasyfikatora w takich branżach upewnij się, że rozwiązanie jest zgodne z odpowiednimi przepisami i wytycznymi.
Zachowanie systemu
Oryginalne zapytanie jest wysyłane do dopasowanego Small Language Model (SLM) hostowanego przez Wyszukiwanie AI platformy Azure. Ten model został wytrenowany przy użyciu treści publicznych. SlM przekształca oryginalne zapytanie w zestaw zapytań syntetycznych. Te syntetyczne zapytania są semantycznie zbliżone do intencji oryginalnego zapytania, ale zawierają inny zestaw terminów, aby poprawić skuteczność wyszukiwania.
Zapytania syntetyczne są następnie łączone z oryginalnym zapytaniem i wysyłane do wyszukiwarki. Gdy wykonuje klasyfikację BM25, kluczowe terminy z zapytań syntetycznych są łączone z oryginalnym zapytaniem. Podczas wykonywania wyszukiwania wektorowego oryginalne zapytanie jest łączone z syntetycznymi zapytaniami przed krokiem osadzania wektora .
Przypadki użycia
Przykładowe przypadki użycia
Ponowne zapisywanie zapytań może być używane w wielu scenariuszach. Ponowne zapisywanie zapytań wymaga użycia klasyfikatora semantycznego.
- Interakcja czatu z danymi: ponowne zapisywanie zapytań umożliwia uziemienie odpowiedzi z wygenerowanych aplikacji sztucznej inteligencji w odpowiednich wynikach wyszukiwania, które spełniają zdefiniowany próg oceny istotności. Na przykład Azure OpenAI Service w Twoich Danych używa Wyszukiwanie AI platformy Azure, aby rozszerzyć modele Azure OpenAI z użyciem twoich danych. Możesz użyć ponownego zapisywania zapytań w tej usłudze, aby poprawić trafność wyników informacji podanych w modelu Azure OpenAI.
- Konwersacyjne pytania i odpowiedzi (QnA): Wyszukiwanie AI platformy Azure umożliwia organizacjom dostarczanie użytkownikom doświadczenia konwersacyjnego poprzez odpowiadanie na pytania w oparciu o informacje dostępne w ich bazach danych. Na przykład producent może używać semantycznego rangatora do rozszerzania informacji dostępnych dla czatbota. Inżynierowie mogą używać tego czatbota do zadawania pytań i pobierania wysoce odpowiednich dokumentów wewnętrznych związanych z zapytaniami i błyskawicznymi odpowiedziami w pobranych dokumentach.
Zagadnienia dotyczące wybierania przypadku użycia
Zachęcamy klientów do ponownego pisania zapytań w swoich innowacyjnych rozwiązaniach lub aplikacjach. Poniżej przedstawiono jednak niektóre zagadnienia dotyczące wybierania przypadku użycia:
- Poufne informacje i dane osobowe: dostrojony program SLM umożliwiający ponowne zapisywanie zapytań przetwarza zapytanie wyszukiwania, które może zawierać poufne informacje. Przed zaimplementowaniem ponownego zapisywania zapytań w takich przypadkach użycia należy wziąć pod uwagę wszelkie implikacje dotyczące prywatności i zabezpieczeń.
- Zredaguj dane osobowe, aby zmniejszyć nieświadomą stronniczość. Na przykład podczas procesu przeglądu CV firmy mogą chcieć zablokować imię i nazwisko, adres lub numer telefonu kandydata, aby zmniejszyć nieświadome uprzedzenia związane z płcią lub inne uprzedzenia podczas wyszukiwania.
- Zagadnienia prawne i regulacyjne. Organizacje muszą ocenić potencjalne konkretne zobowiązania prawne i regulacyjne podczas korzystania z dowolnego wyszukiwania opartego na sztucznej inteligencji, które może nie być odpowiednie do użycia w każdej branży lub scenariuszu. Ograniczenia mogą się różnić w zależności od regionalnych lub lokalnych wymagań prawnych. Ponadto wyszukiwanie sztucznej inteligencji nie jest przeznaczone i nie może być używane w sposób zabroniony w odpowiednich warunkach świadczenia usług i odpowiednich kodeksach postępowania.
Umiejętność GenAI Prompt umożliwia klientom przekazywanie zawartości dokumentów, które znajdują się w ich źródłach danych, oraz monitów niestandardowych do modelu językowego, którego są właścicielami, hostowanego w usłudze Microsoft Foundry. Model językowy przetwarza dane wejściowe i zwraca wzbogaconą zawartość, która jest następnie pozyskiwana do indeksu wyszukiwania wraz z oryginalną zawartością dokumentu. Ten proces umożliwia rozszerzanie indeksów wyszukiwania za pomocą podsumowań generowanych przez sztuczną inteligencję, podpisów obrazów i wyodrębniania jednostek, między innymi na podstawie kryteriów zdefiniowanych przez klienta.
W poniższych przykładach pokazano, jak działa umiejętność GenAI Prompt.
Podsumowanie zgłoszeń zero-shot
Cel: Zapewnij agentom możliwość przeglądania wielostronicowych wątków poczty e-mail w ciągu kilku sekund.
Jak to działa:
- Podczas indeksowania każda długa rozmowa dotycząca zgłoszenia jest dzielona na logiczne segmenty (początkowe żądanie, pytania dodatkowe, dzienniki diagnostyczne itp.).
- Dla każdego segmentu model językowy jest instruowany, aby "podsumować tę sekcję w trzech zwięzłych zdaniach".
- Wynikowe abstrakcje zastępują nieprzetworzony tekst podczas pobierania, tak aby agenci (i podrzędne potoki RAG) widzieli tylko wydestylowaną esencję.
Dlaczego pomaga: zwięzłe podsumowania na poziomie segmentu zmniejszają rozmiar monitów, przyspieszają generowanie odpowiedzi i pomagają agentom skupić się na podstawowym problemie klienta.
Wyodrębnianie jednostek na podstawie małej liczby przykładów
Cel: Zapytania pomocy technicznej, takie jak "Pokaż mi wszystkie bilety, w których produkt X uległ awarii z powodu błędu 500".
Jak to działa
- Pełny tekst biletu jest wysyłany do umiejętności wraz z jednym przykładowym projektem, który pokazuje żądany format danych wyjściowych (lista kluczowych jednostek, takich jak nazwa produktu, kod błędu, system operacyjny i stopień ważności).
- Model wyodrębnia każde wystąpienie produktu, error_code, platformy, ważności.
- Ta lista ustrukturyzowana jest przechowywana w dokumencie, umożliwiając szybkie filtrowanie, na przykład wszystkich awarii o wysokiej powadze w systemie iOS.
Dlaczego pomaga: wstępnie obliczone jednostki przekształcają swobodne wiadomości klientów w filtrowalne dane, pozwalając liderom wsparcia dostrzegać wzorce i ustalać priorytety napraw bez ręcznego analizowania.
Klasyfikacja routingu biletów jednorazowych
Zadanie: Automatycznie przekieruj każdy bilet do właściwej kolejki.
Jak to działa:
- Każdy bilet jest analizowany z podpowiedzią zawierającą pięć kategorii pomocy technicznej — rozliczenia, problemy techniczne, dostęp do konta, wniosek o funkcję i opinie ogólne — oraz jeden przykład odniesienia ("Przykładowy bilet → Rozliczenia").
- Model przypisuje dokładnie jedną etykietę na podstawie pięciu powyższych kategorii pomocy technicznej do każdego biletu, który trafia do systemu wyszukiwania AI jako dane wejściowe.
- System obsługi zgłoszeń używa etykiety do wysyłania zapytań rozliczeniowych do specjalistów finansowych, awarii technicznych do inżynierów itd.
Dlaczego pomaga: Szybkie, spójne etykietowanie zmniejsza liczbę błędnie kierowanych zgłoszeń, skróca czas ich rozwiązywania i poprawia zadowolenie klientów.
Sugestia rozwiązania łańcucha myśli
Cel: zapewnij agentom pomocy technicznej jeden najlepszy następny krok, aby rozwiązać ten problem.
Jak to działa
- Cały bilet ( lub jego najnowszy komunikat klienta) jest przekazywany do modelu językowego.
- Komunikat użytkownika instruuje model po wyświetleniu monitu systemowego: "Pomyśl krok po kroku wewnętrznie, ale wyprowadzaj tylko zalecaną następną czynność".
- Zwrócone wskazówki mogą być następujące: "Poproś klienta o wyczyszczenie pamięci podręcznej i ponowne zainstalowanie wersji 3.2.1".
- Agenci mogą skopiować sugestię bezpośrednio lub uściślić ją przed odpowiedzią.
Dlaczego pomaga: Agenci otrzymują rekomendację z możliwością działania bez prywatnego łańcucha rozumowania modelu, oszczędzając czas, zachowując zwięzłość i istotne kroki rozwiązywania problemów. W niektórych przypadkach konsultant nie jest zalewany niepotrzebnymi informacjami.
Przypadki użycia
Przykładowe przypadki użycia
Umiejętność GenAI Prompt zwiększa wzbogacanie danych w Wyszukiwanie AI platformy Azure, pomagając w zapewnieniu większej trafności odpowiedzi, tak, aby była zgodna z intencjami i oczekiwaniami użytkownika. Dzięki zintegrowaniu zawartości wygenerowanej przez sztuczną inteligencję z indeksami wyszukiwania ta umiejętność umożliwia dokładniejsze i kontekstowe wyniki wyszukiwania. Kluczowe aplikacje obejmują:
- Generowanie zwięzłych podsumowań długich dokumentów w celu ułatwienia szybszego pobierania informacji: firma prawna przetwarza obszerne kontrakty i wykorzystuje umiejętności GenAI Prompt do tworzenia krótkich podsumowań wyróżniających kluczowe klauzule, co ułatwia prawnikom przeglądanie podstawowych informacji bez odczytywania całych dokumentów.
- Tworzenie opisów tekstowych obrazów w celu zwiększenia możliwości wyszukiwania i ułatwień dostępu: firma mediacka zarządza ogromną biblioteką obrazów. Stosując umiejętności GenAI Prompt, generują opisowe podpisy dla każdego obrazu, umożliwiając wydajne wyszukiwanie i organizację w systemie zarządzania zasobami cyfrowymi.
- Identyfikowanie i wyodrębnianie określonych jednostek lub faktów z dokumentów na podstawie kryteriów niestandardowych: Instytucja badawcza analizuje dokumenty naukowe, aby wyodrębnić wzmianki o związkach chemicznych i ich właściwościach. Umiejętności GenAI Prompt automatyzują to wyodrębnianie, wypełniając ustrukturyzowaną bazę danych, aby naukowcy szybko uzyskiwali dostęp do odpowiednich danych.
- Klasyfikowanie dokumentów do zdefiniowanych kategorii w celu uzyskania lepszej organizacji i pobierania: firma ubezpieczeniowa otrzymuje codziennie wiele typów dokumentów. Korzystając z umiejętności monitu genAI, automatycznie klasyfikują te dokumenty do kategorii, takich jak oświadczenia, aktualizacje zasad i opinie klientów. Usprawnia to proces zarządzania dokumentami i ułatwia znajdowanie określonych dokumentów w razie potrzeby.
Chociaż są to typowe aplikacje, umiejętność jest elastyczna, umożliwiając klientom definiowanie monitów dostosowanych do ich unikatowych wymagań.
Zagadnienia dotyczące wybierania przypadku użycia
Należy pamiętać, że zawartość, polecenia i wdrożenia modelu językowego są całkowicie zasobami zarządzanymi przez klienta. Rozwiązanie Foundry obsługuje filtry bezpieczeństwa zawartości dla wdrożeń modeli, a klienci są odpowiedzialni za konfigurowanie tych filtrów zgodnie z potrzebami. Poza konfiguracjami dostępnymi w narzędziu Foundry, Wyszukiwanie AI platformy Azure nie stosuje dodatkowych filtrów bezpieczeństwa zawartości w funkcji Generowanie monitów.
Podczas implementowania umiejętności promptu GenAI należy wziąć pod uwagę następujące kwestie:
Implementowanie procesów przeglądu zawartości generowanej przez sztuczną inteligencję przez ludzi, zwłaszcza w przypadku stosowania transformacji monitów, które mogą wpływać na niezawodność informacji. Użyj narzędzia Wyszukiwanie AI platformy Azure debug sessions tool, aby przetestować zapytania na przykładowych dokumentach przed wdrożeniem na pełną skalę. - Unikaj scenariuszy, w których użycie lub niewłaściwe użycie systemu może spowodować znaczne uszkodzenie fizyczne lub psychiczne osoby. Na przykład scenariusze, które diagnozują pacjentów lub przepisują leki, mogą spowodować znaczne szkody. Włączenie znaczącego przeglądu ludzkiego i nadzoru do scenariusza może pomóc zmniejszyć ryzyko szkodliwych wyników.
- Uważnie rozważ wszystkie przypadki użycia generatywnego. Scenariusze generowania zawartości mogą częściej tworzyć niezamierzone dane wyjściowe, a scenariusze te wymagają starannego rozważenia i ograniczenia ryzyka.
- Aspekty prawne i regulacyjne. Organizacje muszą ocenić potencjalne konkretne zobowiązania prawne i regulacyjne podczas korzystania z dowolnego wyszukiwania opartego na sztucznej inteligencji, które może nie być odpowiednie do użycia w każdej branży lub scenariuszu. Ograniczenia mogą się różnić w zależności od regionalnych lub lokalnych wymagań prawnych. Ponadto wyszukiwanie sztucznej inteligencji nie jest przeznaczone i nie może być używane w sposób zabroniony w odpowiednich warunkach świadczenia usług i odpowiednich kodeksach postępowania.
Zachowanie systemu
Oryginalne zapytanie konwersacji lub wyszukiwania jest wysyłane do należącego do klienta modelu Azure OpenAI w celu wykonania kroków planowania zapytań. Planowanie zapytań dzieli konwersację na serię zoptymalizowanych podzapytań, które odzwierciedlają intencje użytkownika z poprawioną pisownią i rozszerzonymi synonimami. Wyszukiwanie AI platformy Azure następnie przetwarza wszystkie podzapytania jednocześnie w całym systemie wyszukiwania i pobierania danych. Podzapytania są najpierw przetwarzane przez hybrydową kombinację wyszukiwania słów kluczowych i wyszukiwania wektorów. Wyszukiwanie słów kluczowych znajduje dokumenty w indeksie wyszukiwania z podobnymi słowami kluczowymi do podzapytania. Wyszukiwanie wektorowe znajduje dokumenty w indeksie wyszukiwania, które mogą mieć różne słowa kluczowe, ale podobne znaczenie bazowe do podzapytania. Wyniki tego wyszukiwania hybrydowego są następnie ponownie uporządkowywane przez podręcznik semantyczny, aby znaleźć dokumenty z najlepszym dopasowaniem do intencji podzapytania. Następnie usługa scala i usuwa duplikaty z sklasyfikowanych wyników, stosując limity odpowiedzi, takie jak maksymalna długość danych wyjściowych przed wysłaniem z powrotem ostatecznej odpowiedzi.
Przypadki użycia
Przykładowe przypadki użycia
- Bazowanie danych dla niestandardowych czatbotów. Połącz czatbota z oficjalną polityką kadrową firmy i podręcznikiem pracownika, aby kiedy ktoś pyta: "Ile dni urlopu dostaję?" czatbot wyciąga odpowiedź prosto z tych dokumentów, a nie zgadywania.
- Wyposażenie asystentów wiedzy przedsiębiorstwa w celu poszanowania kontekstu użytkownika, filtrów i historii czatów. Na przykład, gdy pracownik pyta o cele określonego okresu, asystent używa swojej funkcji, bieżących filtrów (na przykład regionu: USA) i trwającej konwersacji (na przykład ostatnim tematem był "pipeline Q2"), aby wygenerować spersonalizowaną odpowiedź.
- Rozwiązywanie złożonych zadań wyszukiwania informacji, w których pojedyncze zapytanie kluczowe ma niską trafność. Takie zadania mogą obejmować przewodniki rozwiązywania problemów, badania medyczne lub porównania produktów. Na przykład jeśli technik po prostu wyszukuje "błąd urządzenia" i otrzymuje ogólne wyniki, agent pobierania może uwzględniać całą historię konwersacji, która może obejmować model urządzenia, wersję oprogramowania, historię konserwacji i stan sieci, aby wyświetlić dokładne, odpowiednie artykuły.
- Zapewnij pełną przejrzystość tego, co zostało pobrane, dlaczego i po jakim koszcie. Na przykład podczas podsumowania dokumentów regulacyjnych i wcześniejszych ustaleń dotyczących inspekcji ważne jest, aby znać dokładne źródła (na przykład "zgłoszenie SEC z kwartału 2023 r."), uzasadnienie wyboru (na przykład "dopasowane słowa kluczowe: ujawnienie ryzyka, pochodne") i powiązane koszty (na przykład użycie tokenu).
Zagadnienia dotyczące wybierania przypadku użycia
- Opóźnienie: dodanie drugiego wywołania LLM do planowania zapytań nieuchronnie wydłuża czas trwania żądania. Nawet przy szybkich modelach należy zmierzyć dodatkowe opóźnienie w szczytowym natężeniu ruchu i sprawdzić, czy ogólne doświadczenie pozostaje akceptowalne dla użytkowników. Jeśli opóźnienie jest krytyczne, rozważ buforowanie częstych zapytań lub używanie mniejszych, szybszych modeli planowania.
- Koszt: opłaty są naliczane w dwóch wymiarach — tokeny modelu OpenAI i tokeny klasyfikacji wyszukiwania. Wywołanie planisty zapytań jest rozliczane przez Azure openAI zarówno dla tokenów wejściowych, jak i wyjściowych, podczas gdy każde podzapytywanie jest rozliczane przez Wyszukiwanie AI platformy Azure dla tokenów, które muszą zostać sklasyfikowane. Tokeny rankingowe są bezpłatne w początkowej fazie publicznej wersji zapoznawczej. Z wyprzedzeniem oszacuj liczbę tokenów dla modelu i rankingu w odniesieniu do swojego obciążenia.
- Wrażliwe dane wejściowe: cała historia konwersacji przekazywana jest do modelu planera, co oznacza, że wszelkie dane osobowe lub poufne dla firmy opuszczają bezpośrednią granicę zaufania. Usuń, zamaskuj lub zredaguj takie dane przed wywołaniem funkcji LLM i udokumentuj te środki zaradcze w zakresie ochrony danych.
- Limity regionów i podglądów: Agentowe pobieranie jest dostępne tylko w regionach, w których dostępny jest semantyczny ranker. Pojedynczy agent może wskazywać tylko jeden indeks wyszukiwania. Upewnij się, że region hostujący twoje dane i model obsługuje agentowe pobieranie, i zaplanuj oddzielne agenty, jeśli musisz obejmować wiele indeksów lub lokalizacje geograficzne.
- Zgodność: Upewnij się, że korzystanie z planisty zapytań opartego na usłudze LLM jest zgodne z wymaganiami specyficznymi dla sektora lub regionalnymi (na przykład miejscem przechowywania danych, prywatnością lub zautomatyzowanymi regułami podejmowania decyzji w opiece zdrowotnej lub finansach). Zapewnienie odpowiedniego nadzoru i kontroli człowieka. Rozważ uwzględnienie kontrolek ułatwiających deweloperom weryfikowanie, przeglądanie i/lub zatwierdzanie akcji w odpowiednim czasie, które mogą obejmować przeglądanie planowanych zadań lub wywołań do zewnętrznych źródeł danych.
- Zagadnienia prawne i prawne: Użytkownicy muszą ocenić potencjalne konkretne zobowiązania prawne i prawne w przypadku korzystania z narzędzi i rozwiązań usługi Foundry, które mogą nie być odpowiednie do użycia w każdej branży lub scenariuszu. Ponadto, Foundry Tools lub rozwiązania nie są przeznaczone do używania i mogą nie być używane w sposób zabroniony w odpowiednich warunkach świadczenia usług i obowiązujących kodeksach postępowania.
Ograniczenia
- Wzbogacanie sztucznej inteligencji
- Wyszukiwanie wektorowe
- Ranga semantyczna
- Ponowne zapisywanie zapytań
- Umiejętność tworzenia promptów GenAI
- Pobieranie agentowe
Wzbogacanie sztucznej inteligencji w Wyszukiwanie AI platformy Azure korzysta z funkcji indeksatora i źródła danych usługi w celu wywołania narzędzi Foundry Tools w celu przeprowadzenia wzbogacania zawartości. Zostaną zastosowane ograniczenia indeksatorów i źródeł danych używanych w tym procesie. Zapoznaj się z dokumentacją indeksatora i źródła danych , aby uzyskać więcej informacji na temat tych powiązanych ograniczeń. Obowiązują również ograniczenia każdego narzędzia foundry używanego przez potok wzbogacania sztucznej inteligencji w Wyszukiwanie AI platformy Azure. Aby uzyskać więcej informacji na temat tych ograniczeń, zobacz uwagi dotyczące przezroczystości dla każdej usługi .
Ograniczenia techniczne, czynniki operacyjne i zakresy
Wszystkie wektory przekazane do Wyszukiwanie AI platformy Azure muszą być generowane zewnętrznie z poziomu usługi przy użyciu wybranego modelu. Twoim zadaniem jest rozważenie ograniczeń technicznych i czynników operacyjnych każdego modelu oraz tego, czy utworzone przez niego osadzanie są zoptymalizowane, czy nawet odpowiednie dla danego przypadku użycia. Obejmuje to zarówno wnioskowanie znaczenia wyodrębnione z zawartości, jak i wymiarowość przestrzeni osadzania wektorów.
Model wektoryzacji tworzy przestrzeń osadzania, która definiuje wynikowe środowisko wyszukiwania użytkownika końcowego aplikacji. Mogą istnieć wady modelu, który negatywnie wpływa zarówno na funkcjonalność, jak i wydajność, jeśli model nie jest dobrze dopasowany do żądanego przypadku użycia lub wygenerowane osadzanie jest źle zoptymalizowane.
Chociaż wiele ograniczeń wyszukiwania wektorowego wynika z modelu używanego do generowania osadzonych, istnieją pewne dodatkowe opcje, które należy wziąć pod uwagę w czasie zapytania. Można wybrać jeden z dwóch algorytmów do określania istotności wyników wyszukiwania wektorowego: wyczerpujące k-najbliższych sąsiadów (KNN) lub hierarchiczna nawigowalna mała sieć świata. Wyczerpujące k najbliższych sąsiadów (KNN) wykonuje brutalne wyszukiwanie całego obszaru wektorowego dla dopasowań, które są najbardziej podobne do zapytania, obliczając odległości między wszystkimi parami punktów danych i wyszukując dokładnych k najbliższych sąsiadów punktu zapytania. Chociaż bardziej precyzyjne, ten algorytm może być powolny. Jeśli małe opóźnienie jest głównym celem, rozważ użycie algorytmu hierarchicznego nawigowalnego małego świata (HNSW). HNSW wykonuje efektywne przybliżone wyszukiwanie najbliższego sąsiada (ANN) w przestrzeniach osadzania o wysokim wymiarach. Aby uzyskać więcej informacji na temat tych opcji, zobacz dokumentację wyszukiwania wektorów .
Najlepsze rozwiązania dotyczące poprawy wydajności systemu
- Prześwięć czas na testowanie aplikacji przy użyciu różnych typów zawartości i zapytań, których oczekujesz, że aplikacja będzie obsługiwać. Dowiedz się, które środowisko zapytań jest najlepsze dla Twoich potrzeb.
- Należy poświęcić czas na testowanie modeli z pełną gamą zawartości wejściowej, aby zrozumieć, jak działa w wielu sytuacjach. Ta zawartość może zawierać potencjalnie poufne dane wejściowe, aby zrozumieć, czy istnieje stronniczość w modelu. Omówienie Azure OpenAI Responsible AI zawiera wskazówki dotyczące odpowiedzialnego używania sztucznej inteligencji.
- Rozważ dodanie Bezpieczeństwo zawartości platformy Azure AI do architektury aplikacji. Zawiera API do wykrywania szkodliwych treści generowanych przez użytkownika oraz sztuczną inteligencję, zarówno w postaci tekstów, jak i obrazów, w aplikacjach i usługach.
Ocenianie i integrowanie wyszukiwania wektora dla własnych potrzeb
Aby zapewnić optymalną wydajność, przeprowadź własne oceny rozwiązań, które planujesz wdrożyć przy użyciu wyszukiwania wektorowego. Postępuj zgodnie z procesem oceny, który: (1) wykorzystuje niektórych interesariuszy wewnętrznych do oceny wyników, (2) korzysta z eksperymentów A/B w celu wdrożenia wyszukiwania wektorów dla użytkowników, (3) uwzględnia kluczowe wskaźniki wydajności (KPI) i monitorowanie metryk podczas wdrażania usługi w środowiskach po raz pierwszy, a (4) testuje i dostosowuje konfigurację semantycznego rangatora i/lub definicję indeksu, w tym otaczające aspekty, takie jak umieszczanie interfejsu użytkownika lub procesy biznesowe.
Microsoft przeprowadziło rygorystyczną ocenę wyszukiwania wektorowego zarówno pod względem opóźnienia, jak i kompletności wyników oraz istotności, używając różnorodnych zestawów danych do mierzenia szybkości, skalowalności i dokładności zwracanych wyników. Głównym celem działań ewaluacyjnych powinno być wybranie odpowiedniego modelu dla konkretnego przypadku użycia, zrozumienie ograniczeń i uprzedzeń modelu oraz rygorystyczne testowanie kompleksowego środowiska wyszukiwania wektorowego.
Ograniczenia techniczne, czynniki operacyjne i zakresy
Zdarzają się przypadki, w których wyniki semantyczne, podpisy i odpowiedzi mogą być niepoprawne. Modele używane przez ranker semantyczny są trenowane na różnych źródłach danych, w tym z otwartych źródeł i wybranych danych z korpusu Microsoft Bing. Ranga semantyczna obsługuje szeroką gamę języków i próbuje dopasować zapytania użytkowników do zawartości z wyników wyszukiwania. Ranga semantyczna jest również funkcją premium, która wiąże się z dodatkowymi kosztami i którą należy wziąć pod uwagę podczas oszacowania ogólnego kosztu rozwiązania end-to-end.
Semantyczny ranker najprawdopodobniej poprawi trafność zawartości semantycznie bogatej, takie jak artykuły i opisy. Szuka kontekstu oraz powiązań między terminami, zwiększając znaczenie dopasowań, które mają większy sens w kontekście zapytania. Rozumienie języka "odnajduje" podsumowania, opisy lub odpowiedzi w obrębie Twojej zawartości, ale w przeciwieństwie do generatywnych modeli, takich jak modele Azure OpenAI Service GPT-3.5 lub GPT-4, nie tworzy ich. W odpowiedzi znajduje się tylko tekst dosłowny z dokumentów źródłowych, który można następnie renderować na stronie wyników wyszukiwania w celu uzyskania bardziej wydajnego środowiska wyszukiwania.
Najnowocześniejsze, wstępnie wytrenowane modele są używane do podsumowywania i klasyfikowania. Aby zachować szybką wydajność, którą użytkownicy oczekują od wyszukiwania, semantyczne podsumowania i klasyfikacja są stosowane tylko do pierwszych 50 wyników, zgodnie z domyślnym algorytmem oceniania. Dane wejściowe pochodzą z zawartości w wynikach wyszukiwania. Nie może wrócić do indeksu wyszukiwania, aby uzyskać dostęp do innych pól w dokumencie wyszukiwania, które nie zostały zwrócone w odpowiedzi zapytania. Dane wejściowe podlegają długości tokenu 8960. Te limity są niezbędne do utrzymania czasu odpowiedzi w milisekundach.
Domyślny algorytm oceniania pochodzi od Bing i Microsoft Research i jest zintegrowany z infrastrukturą Wyszukiwanie AI platformy Azure jako funkcja dodatkowa. Modele są używane wewnętrznie, nie są widoczne dla dewelopera i nie można ich konfigurować. Aby uzyskać więcej informacji na temat badań i inwestycji w sztuczną inteligencję na potrzeby semantycznego rankera, zobacz Jak sztuczna inteligencja z usługi Bing wspiera Wyszukiwanie AI platformy Azure (blog Microsoft Research).
Semantyczny silnik rankingowy oferuje również odpowiedzi, podpisy i wyróżnianie w ramach odpowiedzi. Na przykład, jeśli model klasyfikuje zapytanie jako pytanie i jest pewny odpowiedzi w 70%, model zwraca odpowiedź semantyczną. Ponadto semantyczne podpisy zawierają najbardziej odpowiednią zawartość w wynikach i zawierają krótki fragment kodu wyróżniający najbardziej odpowiednie słowa lub frazy w tym fragmencie kodu.
Wyniki klasyfikacji semantycznej są oparte na danych w bazowym indeksie wyszukiwania, a modele zapewniają klasyfikację istotności, odpowiedzi i podpisy na podstawie informacji pobranych z indeksu. Przed użyciem klasyfikatora semantycznego w środowisku produkcyjnym ważne jest przeprowadzenie dalszych testów i upewnienie się, że zestaw danych jest dokładny i odpowiedni dla zamierzonego przypadku użycia. Aby uzyskać więcej informacji i przykładów oceny semantic rankera, zobacz tutaj zawartość i dodatek.
Wydajność systemu
W wielu systemach sztucznej inteligencji wydajność jest często definiowana w odniesieniu do dokładności — czyli jak często system sztucznej inteligencji oferuje poprawne przewidywanie lub dane wyjściowe. W przypadku modeli języka naturalnego na dużą skalę dwóch różnych użytkowników może przyjrzeć się tym samym danym wyjściowym i mieć różne opinie na temat tego, jak przydatne lub istotne jest, co oznacza, że wydajność tych systemów musi być zdefiniowana bardziej elastycznie. W tym miejscu ogólnie uważamy, że wydajność aplikacji oznacza, że aplikacja działa tak, jak Ty i Twoi użytkownicy tego oczekujecie, oraz że nie generuje szkodliwych danych wyjściowych.
Ranker semantyczny został przetrenowany na podstawie treści publicznych. W związku z tym znaczenie semantyczne różni się w zależności od dokumentów w indeksie i zapytań wystawionych względem niego. Ważne jest, aby użyć własnego osądu i badań, gdy używasz tej zawartości do podejmowania decyzji.
Najlepsze rozwiązania dotyczące poprawy wydajności systemu
- Poświęć czas na testowanie A/B swojej aplikacji z użyciem różnych typów zapytań, takich jak słowo kluczowe w porównaniu z hybrydowym i semantycznym rangerem. Dowiedz się, które środowisko zapytań jest najlepsze dla Twoich potrzeb.
- Wykonaj rozsądny wysiłek, aby skonfigurować konfigurację semantyczną zgodnie z dokumentacją funkcji.
- Nie ufaj semantycznym odpowiedziom, jeśli nie masz pewności co do dokładności informacji w indeksie wyszukiwania.
- Nie zawsze ufaj podpisom semantycznym, ponieważ są wyodrębniane z zawartości klienta za pośrednictwem serii modeli, które przewidują najbardziej odpowiednie odpowiedzi w krótkim fragmencie kodu.
Ocena klasyfikatora semantycznego
Metody oceny
Ranking semantyczny został oceniony za pomocą testów wewnętrznych, w tym ocen zautomatyzowanych i przeprowadzanych przez ludzi dla wielu zestawów danych, a także informacji zwrotnych od klientów wewnętrznych. Testowanie obejmuje ocenę dokumentów, oceniając je jako istotne lub nieistotne, wraz z ustaleniem ich kolejności według priorytetu istotności. Podobnie funkcje podpisów i odpowiedzi zostały również sklasyfikowane za pośrednictwem testów wewnętrznych.
Wyniki oceny
Staramy się dostarczać wszystkie aktualizacje modelu bez regresji (czyli zaktualizowany model powinien poprawić tylko bieżący model produkcyjny). Każdy kandydat jest porównywany bezpośrednio z bieżącym modelem produkcyjnym przy użyciu metryk odpowiednich dla ocenianej funkcji (na przykład znormalizowany zdyskontowany skumulowany zysk na potrzeby klasyfikacji oraz precyzji/pełności w celu uzyskania odpowiedzi). Modele klasyfikatora semantycznego są trenowane, dostrojone i oceniane przy użyciu szerokiego zakresu danych treningowych, które są reprezentatywne dla dokumentów o różnych właściwościach (język, długość, formatowanie, style i odcienie), aby obsługiwać najszerszą gamę scenariuszy wyszukiwania. Nasze dane szkoleniowe i testowe pochodzą z:
Źródła dokumentów:
- Benchmarki dla środowisk akademickich i branżowych
- Dane klienta (tylko testy wykonywane z uprawnieniami klienta)
- Dane syntetyczne
Źródła zapytań:
- Zestawy zapytań porównawczych
- Zestawy zapytań dostarczone przez klienta (tylko testy wykonywane z uprawnieniami klienta)
- Syntetyczne zestawy zapytań
- Zestawy zapytań generowanych przez człowieka
Źródła etykiet na potrzeby oceniania par zapytań i dokumentów:
- Etykiety testów porównawczych akademickich i branżowych
- Etykiety klientów (testy tylko przeprowadzane za zgodą klienta)
- Syntetyczne etykiety danych
- Etykiety oceniane przez człowieka
Ocenianie i integrowanie semantycznego rankera dla Twoich potrzeb
Wydajność semantycznego rankera różni się w zależności od rzeczywistych zastosowań i warunków, w których ludzie go używają. Jakość trafności dostarczana przez modele uczenia głębokiego, które umożliwiają funkcje wyznacznika semantycznego, jest bezpośrednio skorelowana z jakością danych w indeksie wyszukiwania. Na przykład modele mają obecnie ograniczenia tokenu, które uwzględniają tylko 8960 pierwszych tokenów na potrzeby odpowiedzi semantycznych. W związku z tym, jeśli semantyczna odpowiedź na zapytanie wyszukiwania zostanie znaleziona na końcu długiego dokumentu (poza limitem tokenu 8960), odpowiedź nie zostanie podana. Ta sama reguła dotyczy podpisów. Ponadto semantyczna konfiguracja wyświetla odpowiednie pola wyszukiwania w kolejności priorytetu. Możesz zmienić kolejność pól na tej liście, aby ułatwić dostosowanie istotności do Twoich potrzeb.
Aby zapewnić optymalną wydajność w swoich scenariuszach, klienci powinni przeprowadzać własne oceny rozwiązań, które wdrażają przy użyciu semantycznego rankera. Klienci powinni zazwyczaj postępować zgodnie z procesem oceny, który: (1) wykorzystuje niektórych wewnętrznych interesariuszy do oceny wyników, (2) używa eksperymentacji A/B do wprowadzania semantycznego rankera dla użytkowników, (3) uwzględnia kluczowe wskaźniki wydajności i monitorowanie metryk, gdy usługa jest wdrażana w doświadczeniach po raz pierwszy, oraz (4) testuje i dostosowuje konfigurację semantycznego rankera i/lub definicji indeksu, w tym elementy takie jak umiejscowienie interfejsu użytkownika lub procesy biznesowe.
Jeśli tworzysz aplikację w domenie lub branży o wysokich stawkach, takich jak opieka zdrowotna, zasoby ludzkie, edukacja lub dziedzina prawna, oceń, jak dobrze działa aplikacja w twoim scenariuszu, zaimplementuj silny nadzór człowieka, oceń, jak dobrze użytkownicy rozumieją ograniczenia aplikacji i przestrzegają wszystkich odpowiednich przepisów. Rozważ inne środki zaradcze w zależności od scenariusza.
Ograniczenia techniczne, czynniki operacyjne i zakresy
Mogą wystąpić przypadki, w których zapytania syntetyczne są nieprawidłowe, pochodzą z zbyt wielu ograniczeń lub są zbyt drogie. Ponowne zapisywanie kwerend obsługuje szeroką gamę języków i próbuje przepisać kwerendy użytkownika w celu zmaksymalizowania dokładności wyszukiwania. Wymagane jest określenie języka kwerend jako dane wejściowe. Ponowne zapisywanie zapytań jest częścią funkcji Semantic Ranker (Wyszukiwanie AI platformy Azure w celu poprawy istotności wyszukiwania), która jest funkcją Premium z dodatkowymi kosztami. Należy to wziąć pod uwagę podczas projekcji ogólnych wydatków na kompleksowe rozwiązanie. Ponowne zapisywanie zapytań może być używane tylko wtedy, gdy włączono semantyczny ranker.
Przed użyciem ponownego zapisywania zapytań w środowisku produkcyjnym (wersja na żywo aplikacji) ważne jest przeprowadzenie dalszych testów i upewnienie się, że zapytania syntetyczne są odpowiednie dla zamierzonego przypadku użycia. Aby uzyskać więcej informacji i przykładów oceny ponownego zapisywania zapytań, zobacz zawartość i dodatek tutaj.
Wydajność systemu
W przypadku modeli języka naturalnego na dużą skalę dwóch różnych użytkowników może przyjrzeć się tym samym danym wyjściowym i mieć różne opinie na temat tego, jak przydatne lub istotne jest, co oznacza, że wydajność tych systemów musi być zdefiniowana bardziej elastycznie. W tym miejscu ogólnie uważamy, że wydajność aplikacji oznacza, że aplikacja działa tak, jak Ty i Twoi użytkownicy tego oczekujecie, oraz że nie generuje szkodliwych danych wyjściowych.
Wydajność ponownego zapisywania zapytań różni się w zależności od rzeczywistych zastosowań i warunków, w których użytkownicy go używają. Jakość syntetycznych zapytań udostępnianych przez model ponownego zapisywania zapytań jest bezpośrednio skorelowana z oryginalnym zapytaniem wyszukiwania.
Aby zapewnić optymalną wydajność w swoich scenariuszach, klienci powinni przeprowadzać własne oceny rozwiązań, które implementują przy użyciu ponownego zapisywania zapytań. Klienci powinni zazwyczaj postępować zgodnie z procesem oceny, który:
- używa niektórych wewnętrznych uczestników projektu do oceny wyników,
- używa eksperymentów A/B, aby wdrożyć ponowne zapisywanie zapytań dla użytkowników i
- uwzględnia kluczowe wskaźniki wydajności i monitorowanie metryk podczas pierwszego wdrożenia usługi w scenariuszach użytkowych
Najlepsze rozwiązania dotyczące poprawy wydajności systemu
- Ukończ testowanie A/B dla aplikacji z różnymi typami zapytań (pełny tekst, wektor, hybryda lub inne typy zapytań). Dowiedz się, które środowisko zapytań jest najlepsze dla Twoich potrzeb.
- Nie zawsze zakładaj, że każde syntetyczne zapytanie wygenerowane przez ponowne zapisywanie zapytań będzie odzwierciedlać dokładną intencję oryginalnego zapytania. Zapytania syntetyczne są generowane przez dostrojony slm, który generuje zapytania semantycznie podobne do intencji oryginalnego zapytania, ale może nie odpowiadać dokładnej intencji.
Ocena ponownego zapisywania zapytań
Metody oceny
Ponowne zapisywanie zapytań zostało ocenione za pomocą testów wewnętrznych, w tym zautomatyzowanego i ludzkiego osądu w wielu zestawach danych, a także opinii klientów wewnętrznych. Testy obejmowały ocenę istotności wyników klasyfikacji semantycznej w połączeniu z ponownym zapisywaniem zapytań w porównaniu z istotnością wyników tylko z semantycznym rankingiem.
Wyniki oceny
Każdy model kandydata jest porównywany bezpośrednio z aktualnie wdrożonym modelem przy użyciu metryk odpowiednich dla ocenianej funkcji. Modele ponownego zapisywania zapytań są dostrojone i oceniane przy użyciu szerokiego zakresu danych publicznych reprezentatywnych dla zapytań, które mają różne właściwości (język, długość, formatowanie, style i odcienie), aby obsługiwać najszerszą gamę scenariuszy wyszukiwania. Nasze dane szkoleniowe i testowe pochodzą z:
Źródła dokumentów:
- Benchmarki dla środowisk akademickich i branżowych
- Dane klienta (tylko testy wykonywane z uprawnieniami klienta)
Źródła zapytań:
- Zestawy zapytań porównawczych
- Zestawy zapytań dostarczone przez klienta (tylko testy wykonywane z uprawnieniami klienta)
- Syntetyczne zestawy zapytań
- Zestawy zapytań generowanych przez człowieka
Źródła etykiet na potrzeby oceniania par zapytań i dokumentów:
- Etykiety testów porównawczych akademickich i branżowych
- Etykiety klientów (testy tylko przeprowadzane za zgodą klienta)
- Syntetyczne etykiety danych
- Etykiety oceniane przez człowieka
Ocenianie i integrowanie ponownego zapisywania zapytań do użycia
Ponieważ zmiana treści zapytań była trenowana na publicznie dostępnym materiale, zapytania syntetyczne mogą się różnić w zależności od zapytań, które zostały do niego wystawione. Dlatego ważne jest, aby użyć własnego osądu i badań, gdy używasz tej zawartości do podejmowania decyzji.
Ograniczenia techniczne, czynniki operacyjne i zakresy
Chociaż umiejętności GenAI Prompt oferują zaawansowane możliwości, ważne jest, aby rozpoznać pewne ograniczenia:
- Umiejętność opiera się na filtrach zawartości skonfigurowanych przez klienta w programie Foundry. Wyszukiwanie AI platformy Azure nie zapewnia dodatkowych mechanizmów bezpieczeństwa zawartości dla tej umiejętności.
- Jakość zawartości wygenerowanej przez sztuczną inteligencję zależy od skuteczności monitów i bazowego modelu językowego. Dokładne testowanie jest niezbędne, aby zapewnić, że dane wyjściowe spełniają wymagane standardy.
- Przetwarzanie dużych ilości danych ze złożonymi monitami może wymagać znaczących zasobów obliczeniowych i może spowodować opóźnienie. Zaplanuj i przydziel zasoby odpowiednio, aby nie tylko utrzymać wydajność i efektywność kosztową, ale także zapobiegać ewentualnym opóźnieniom przetwarzania danych.
Wydajność systemu
Najlepsze rozwiązania dotyczące poprawy wydajności systemu
Aby zoptymalizować wydajność umiejętności podpowiedzi GenAI:
- Użyj narzędzia Wyszukiwanie AI platformy Azure debug sessions tool aby przetestować monity dotyczące przykładowych dokumentów, zapewniając, że zawartość wygenerowana przez sztuczną inteligencję jest zgodna z oczekiwaniami przed pełnym wdrożeniem.
- Twórz jasne i szczegółowe polecenia, aby skutecznie kierować modelem językowym, zmniejszając prawdopodobieństwo nieistotnych lub niedokładnych danych wyjściowych.
- Monitorowanie wydajności systemu i skalowanie zasobów zgodnie z potrzebami w celu obsługi obliczeń związanych z przetwarzaniem sztucznej inteligencji.
- Zachęcaj do nadzoru nad danymi wyjściowymi przed publikacją lub rozpowszechnianiem. W przypadku generowania sztucznej inteligencji istnieje możliwość wygenerowania zawartości, która może być obraźliwa lub nieistotna dla zadania.
Ocena umiejętności polecenia w GenAI
Ocenianie i integrowanie umiejętności tworzenia treści przez GenAI dla własnych potrzeb
Aby zmaksymalizować korzyści wynikające z umiejętności GenAI Prompt w określonym kontekście, należy wziąć pod uwagę następujące kroki:
- Określ konkretne cele wzbogacania, takie jak generowanie zwięzłych podsumowań, wyodrębnianie kluczowych jednostek lub tworzenie metadanych opisowych, aby dopasować aplikację umiejętności do potrzeb biznesowych.
- Zacznij od podzbioru danych, aby ocenić wydajność umiejętności i wprowadzić niezbędne korekty. Takie podejście umożliwia kontrolowane eksperymentowanie i uściślenie przed wdrożeniem na pełną skalę.
- Ustanów mechanizmy monitorowania jakości i wpływu zawartości wygenerowanej przez sztuczną inteligencję. Żądaj opinii od użytkowników końcowych, aby zidentyfikować obszary poprawy i zapewnić, że wzbogacone dane spełniają oczekiwania użytkowników.
Ograniczenia techniczne, czynniki operacyjne i zakresy
Mogą wystąpić przypadki, w których podzapytania generowane przez LLM są nieistotne, zbyt restrykcyjne lub zwiększają koszty tokenów. Agentowe pobieranie wspiera wszystkie języki obsługiwane przez rodzinę GPT-4o, ale jakość wygenerowanego planu zapytania nadal zależy od jasności danych wejściowych użytkownika. Ze względu na to, że agentic retrieval opiera się na semantycznym rankerze dla każdego podzapytania, musisz mieć włączony semantyczny ranker w indeksie. Ranga semantyczna to funkcja premium oparta na tokenach; Mimo że opłaty za klasyfikację zostaną wycofane w początkowej fazie publicznej wersji zapoznawczej, będą one stosowane później i powinny być uwzględniane w łącznym koszcie własności.
Przed przeniesieniem agentowego pobierania do środowiska produkcyjnego przeprowadź dodatkowe testy, aby potwierdzić, że podzapytania i zwrócone fragmenty są odpowiednie dla zamierzonego przypadku użycia, czy opóźnienie i koszty spełniają cele poziomu usług oraz że dane podstawowe nie ujawniają poufnej lub niezgodnej zawartości.
Wydajność systemu
Podobnie jak w przypadku dowolnego systemu modelu językowego na dużą skalę, różni użytkownicy mogą uzyskać różne oceny dotyczące przydatności lub istotności zwracanych fragmentów, dlatego wydajność musi być zdefiniowana elastycznie. W przypadku agentowego odzyskiwania uważamy, że dobrą wydajność oznacza, że aplikacja end-to-end dostarcza zawartość, której oczekują użytkownicy — bez niedopuszczalnych opóźnień, kosztów lub szkodliwych wyników.
Skuteczność odzyskiwania agentowego zależy od wielu rzeczywistych czynników.
- Długość monitu/historii czatu
- Liczba podzapytania generowanych przez moduł LLM
- Rozmiar i schemat indeksu (słowo kluczowe, wektor, hybryda)
- Wybór modelu planowania (GPT-4o a GPT-4o-mini)
- Konfiguracja i progi wyników wyszukiwania semantycznego
Najlepsze rozwiązania dotyczące poprawy wydajności systemu
- Podsumowywanie lub przycinanie starszych wymian czatu pomaga utrzymać niskie użycie tokenów.
- Dostrój próg rankera tak, aby zwracane były tylko wysoce istotne fragmenty
- Używaj filtrów tam, gdzie to możliwe
Ocena agentowego pobierania
Ocena agenticznego pobierania została przeprowadzona przez wewnętrzne testy, w tym automatyczną i manualną ocenę na wielu zestawach danych. Testy obejmowały ocenę istotności wyników pozyskiwania agentowego w porównaniu z wynikami uzyskanymi wyłącznie z rankingu semantycznego.
Metody oceny
Każda konfiguracja kandydującego agenta-pobierania, zdefiniowana przez monit planisty, wariant modelu, liczbę podzapytania i progi klasyfikacji wyników, jest oceniana bezpośrednio z podstawową konfiguracją produkcyjną. Stosujemy zestaw metryk istotności, bezpieczeństwa, opóźnień i kosztów wybranych specjalnie dla scenariuszy pobierania wielu zapytań. Aby zapewnić niezawodność w rzeczywistych przypadkach użycia, dostrajanie i testowanie są wykonywane na szerokiej gamie publicznych i zatwierdzonych przez klienta zestawów danych, które różnią się w zależności od języka, długości zapytań, formatowania, stylu i tonu konwersacji. Materiał testowy pochodzi z:
Źródła dokumentów:
- Benchmarki dla środowisk akademickich i branżowych
- Dane klienta (tylko testy wykonywane z uprawnieniami klienta)
- Źródła zapytań:
- Zestawy zapytań porównawczych
- Zestawy zapytań dostarczone przez klienta (tylko testy wykonywane z uprawnieniami klienta)
- Syntetyczne zestawy zapytań
- Zestawy zapytań generowanych przez człowieka
Źródła etykiet na potrzeby oceniania par zapytań i dokumentów:
- Etykiety testów porównawczych akademickich i branżowych
- Etykiety klientów (testy tylko przeprowadzane za zgodą klienta)
- Syntetyczne etykiety danych
- Etykiety oceniane przez człowieka
Ocena i integracja agentowej metody wyszukiwania dla Twojego użytku
Ponieważ planista odzyskiwania agentowego jest trenowany w dużej mierze na danych publicznych, jakość i istotność wygenerowanych podzapytań będą się różnić w zależności od domeny i konkretnych instrukcji użytkownika. Aby zmaksymalizować korzyści wynikające z wykorzystania procesów agentowych w Twoim konkretnym kontekście, warto rozważyć następujące kroki:
- Zweryfikuj dane wyjściowe przed użyciem ich, aby podejmować decyzje krytyczne dla działania firmy: ręcznie sprawdź próbkę wygenerowanych podzapytania i zwróconych dokumentów, aby potwierdzić, że są one zgodne z terminologią domeny, dokładnością i wymaganiami dotyczącymi zgodności.
- Podaj informacje specyficzne dla domeny planującemu. Podaj mapy synonimów i całą historię rozmów, aby LLM mógł parafrazować i rozkładać zapytania w języku odpowiadającym twoim treściom, zwiększając trafność wyszukiwania i precyzję.
- Zaimplementuj logikę rezerwową lub zabezpieczenia: jeśli planer generuje podzapytania o niskim poziomie zaufania lub poza zakresem, skieruj żądanie do prostszego wyszukiwania słów kluczowych lub wyszukiwania wektorowego albo wyświetl monit o wyjaśnienie dla użytkownika, aby zapobiec rozprzestrzenianiu się nierzetelnych odpowiedzi.
Dowiedz się więcej o odpowiedzialnej sztucznej inteligencji
- Microsoft zasady sztucznej inteligencji
- Microsoft zasoby dotyczące odpowiedzialnej sztucznej inteligencji
- Microsoft Azure Kursy szkoleniowe dotyczące odpowiedzialnej sztucznej inteligencji
Dowiedz się więcej o Wyszukiwanie AI platformy Azure
Opinia
Czy ta strona była pomocna?
Nie
Potrzebujesz pomocy dotyczącej tego tematu?
Chcesz spróbować użyć asystenta Ask Learn, aby wyjaśnić ten temat lub uzyskać instrukcje, które go dotyczą?
Dodatkowe zasoby
-
Ostatnia aktualizacja o
2026-04-30