Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Poznámka
Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.
V tomto rychlém startu použijete průvodce Import dat na portálu Azure k zahájení práce s integrovanou vektorizací. Průvodce rozdělí váš obsah na části a zavolá embeddingový model, který vektorizuje tyto části při indexování a dotazování.
V tomto rychlém startu se používají textové soubory PDF a jednoduché obrázky z úložiště azure-search-sample-data. Můžete ale použít různé soubory a přesto tento rychlý start dokončit.
Tip
Máte dokumenty obsahující mnoho obrázků? Viz Quickstart: Multimodální vyhledávání na portálu Azure pro extrakci, ukládání a vyhledávání obrázků vedle textu.
Požadavky
Účet Azure s aktivním předplatným. Vytvořte si bezplatný účet.
Služba Azure AI Vyhledávač. Tento rychlý start vyžaduje úroveň Basic nebo vyšší pro podporu spravované identity.
Znalost průvodce Viz průvodce Import dat na portálu Azure.
Podporované zdroje dat
Průvodce podporuje několik zdrojů dat Azure. Tento rychlý start ale pokrývá pouze zdroje dat, které pracují s celými soubory, které jsou popsány v následující tabulce.
| Zdroj dat | Popis |
|---|---|
| Azure Blob Storage | Tento zdroj dat funguje s objekty blob a tabulkami. Musíte použít účet standardního výkonu (pro obecné účely verze 2). Úrovně přístupu můžou být horké, studené nebo mrazivé. |
| Azure Data Lake Storage (ADLS) Gen2 | Jedná se o účet Azure Storage s povoleným hierarchickým oborem názvů. Pokud chcete potvrdit, že máte Data Lake Storage, zkontrolujte kartu Properties na stránce Přehled. |
| Microsoft OneLake | Tento zdroj dat se připojuje k souborům a zkratkám OneLake. |
Podporované modely vkládání
Portál podporuje následující modely vkládání pro integrovanou vektorizaci. Pokyny k nasazení najdete v další části.
| Zprostředkovatel | Podporované modely |
|---|---|
| Účet Azure AI s podporou více služeb1 | Pro text a obrázky: Azure Vision multimodal |
| Projekt Microsoft Foundry založený na centru | Text:
|
| projekt Microsoft Foundry | Text:
|
| Azure OpenAI prostředek3, 4 | Text:
|
1 Pro účely fakturace musíte připojit váš účet pro více služeb k sadě dovedností Azure AI Vyhledávač. Průvodce vyžaduje, aby vaše vyhledávací služba a účet s více službami byly ve stejné podporované oblasti pro dovednosti s vícemodálními vkládáními ve službě Azure Vision (Preview).
2 Průvodce podporuje pouze nasazení bezserverového rozhraní API pro tento model. K zřízení bezserverového nasazení (Preview) můžete použít Azure CLI.
3 Koncový bod prostředku Azure OpenAI musí mít subdoménu custom subdomain, například https://my-unique-name.openai.azure.com. Pokud jste prostředek vytvořili na portálu Azure, tato subdoména se během instalace prostředku automaticky vygenerovala.
4 Azure prostředky OpenAI (s přístupem k modelům vkládání), které byly vytvořeny na portálu Microsoft Foundry portal nejsou podporované. Na portálu Azure musíte vytvořit prostředek Azure OpenAI.
Nejnovější pokyny k životnímu cyklu modelů, včetně informací o vyřazení a zastarávání, najdete v tématu Vyřazení a zastarávání modelů.
Požadavky na veřejný koncový bod
Všechny předchozí prostředky musí mít povolený veřejný přístup, aby k nim mohl získat přístup průvodce. Jinak průvodce selže. Po spuštění průvodce můžete pro zabezpečení povolit brány firewall a privátní koncové body na integračních komponentách. Další informace naleznete v tématu Zabezpečené připojení v průvodci importem.
Pokud už existují privátní koncové body a nemůžete je zakázat, je alternativní možností spuštění příslušného kompletního toku ze skriptu nebo programu na virtuálním počítači. Virtuální počítač musí být ve stejné virtuální síti jako privátní koncový bod. Tady je ukázka kódu Python pro integrovanou vektorizaci. Stejné úložiště GitHub obsahuje ukázky v jiných programovacích jazycích.
Konfigurace přístupu
Než začnete, ujistěte se, že máte oprávnění pro přístup k obsahu a operacím. Tento rychlý start používá Microsoft Entra ID pro ověřování a přístup na základě role k autorizaci. Abyste mohli přiřadit role, musíte být vlastníkem nebo správcem uživatelských přístupů . Pokud role nejsou proveditelné, použijte místo toho ověřování založené na klíči .
Nakonfigurujte požadované role a podmíněné role identifikované v této části.
Požadované role
Azure AI Vyhledávač poskytuje kanál vektorového vyhledávání. Nakonfigurujte přístup pro sebe a svou vyhledávací službu ke čtení dat, spuštění potrubí a interakci s dalšími zdroji Azure.
Ve službě Azure AI Vyhledávač:
Přiřaďte sobě následující role .
Přispěvatel vyhledávací služby
Přispěvatel dat indexu vyhledávání
Čtečka dat indexu vyhledávání
Podmíněné role
Následující karty pokrývají všechny prostředky kompatibilní s průvodcem pro vektorové vyhledávání. Vyberte pouze karty, které platí pro vybraný zdroj dat a model vkládání.
Azure Blob Storage a Azure Data Lake Storage Gen2 vyžadují, aby vaše vyhledávací služba měla ke kontejnerům úložiště přístup pro čtení.
Na účtu Azure Storage:
- Přiřaďte „Storage Blob Data Reader“ ke spravované identitě vaší vyhledávací služby.
Příprava ukázkových dat
V této části připravíte ukázková data pro vybraný zdroj dat.
Na portálu Azure přejděte na svůj účet Azure Storage.
V levém podokně vyberteKontejnery> dat.
Vytvořte kontejner a nahrajte dokumenty PDF health-plan použité pro tento rychlý start.
(Volitelné) Synchronizujte odstranění v kontejneru s odstraněními v indexu vyhledávání. Konfigurace indexeru pro detekci odstranění:
U účtu úložiště povolte soft delete. Pokud používáte nativní měkké odstranění, další krok se nevyžaduje.
Přidejte vlastní metadata , která indexer může zkontrolovat a zjistit, které objekty blob jsou označené k odstranění. Dejte své uživatelské vlastnosti popisný název. Například pojmenujte vlastnost IsDeleted a nastavte ji na false. Tento krok opakujte pro každý objekt blob v kontejneru. Pokud chcete objekt blob odstranit, změňte vlastnost na true. Další informace najdete v tématu Změna a detekce odstranění při indexování z Azure Storage.
Příprava modelu vkládání
Poznámka
Pokud používáte Azure Vision, přeskočte tento krok. Multimodální vkládání jsou integrované do vašeho účtu s více službami a nevyžadují nasazení modelu.
Průvodce podporuje několik modelů vkládání z Azure OpenAI a katalogu modelů Microsoft Foundry. Pokud chcete nasadit modely potřebné pro zvolený model embedding, podívejte se na nasazení modelů Microsoft Foundry ve Foundry portálu.
Spusťte průvodce
Přejděte do vyhledávací služby na portálu Azure.
Na stránce Přehled vyberte Importovat data.
Vyberte zdroj dat: Azure Blob Storage, ADLS Gen2 nebo OneLake.
Vyberte RAG.
Spustit průvodce
Průvodce vás provede několika kroky konfigurace. Tato část popisuje jednotlivé kroky v posloupnosti.
Připojení k datům
V tomto kroku připojíte Azure AI Vyhledávač ke zvolenému zdroji dat pro příjem a indexování obsahu.
Na stránce Připojte se k datům vyberte své předplatné Azure.
Vyberte účet úložiště a kontejner, který poskytuje ukázková data.
Pokud jste povolili softwarové odstranění a přidali vlastní metadata v Příprava ukázkových dat, zaškrtněte políčko Povolit sledování odstranění.
Při následných spuštěních indexování se index vyhledávání aktualizuje, aby odstranil všechny vyhledávací dokumenty spojené s měkce odstraněnými blobovými objekty v úložišti Azure.
Objekty blob podporují buď nativní měkké odstranění objektu blob, nebo měkké odstranění pomocí vlastních metadat.
Pokud jste nakonfigurovali objekty blob pro obnovitelné odstranění, zadejte dvojici název-hodnota vlastnosti metadat. Doporučujeme IsDeleted. Pokud je vlastnost IsDeleted nastavena na hodnotu true pro objekt blob, indexer zahodí odpovídající vyhledávací dokument při dalším spuštění indexeru.
Průvodce nekontroluje Azure Storage kvůli platným nastavením ani nevyvolá chybu, pokud nejsou splněné požadavky. Namísto toho detekce odstranění nefunguje a váš index vyhledávání pravděpodobně akumuluje osiřelé dokumenty v průběhu času.
Zaškrtněte políčko Ověřit pomocí spravované identity . Typ identity ponechte přiřazený systémem.
Vyberte Další.
Vektorizace textu
Během tohoto kroku průvodce použije vybraný model pro vložení k vektorizaci blokovaných dat. Funkce chunkování je vestavěná a nekonfigurovatelná. Platná nastavení jsou:
"textSplitMode": "pages",
"maximumPageLength": 2000,
"pageOverlapLength": 500,
"maximumPagesToTake": 0, #unlimited
"unit": "characters"
Na stránce Zvektorizujte svůj text vyberte Azure OpenAI pro typ.
Vyberte své Azure předplatné.
Vyberte prostředek Azure OpenAI a pak vyberte model, který jste nasadili v Připravení modelu vkládání.
Jako typ ověřování vyberte identitu přiřazenou systémem.
Zaškrtněte políčko, které potvrzuje účinky fakturace používání těchto prostředků.
Vyberte Další.
Vektorizace a rozšiřování obrázků
Soubory PDF s plánem stavu obsahují firemní logo, ale jinak neexistují žádné obrázky. Pokud používáte ukázkové dokumenty, můžete tento krok přeskočit.
Pokud ale váš obsah obsahuje užitečné obrázky, můžete AI použít jedním nebo oběma způsoby:
K vektorizaci obrázků použijte podporovaný model vkládání obrázků z katalogu modelů Microsoft Foundry nebo Azure rozhraní API pro multimodální vkládání obrazu (prostřednictvím účtu s více službami).
K extrakci textu z obrázků použijte optické rozpoznávání znaků (OCR). Tato možnost vyvolá dovednost OCR.
Na stránce Vektorizace a obohacení obrázků zaškrtněte políčko Vektorizovat obrázky .
Jako druh vyberte poskytovatele modelu: Microsoft Foundry nebo Azure Vision in Foundry Tools.
Vyberte své Azure předplatné, prostředek a nasazení vkládacího modelu (pokud je to možné).
Jako typ ověřování vyberte identitu přiřazenou systémem , pokud nepoužíváte projekt založený na centru. Jinak ho ponechte jako klíč rozhraní API.
Zaškrtněte políčko, které potvrzuje účinky fakturace používání těchto prostředků.
Vyberte Další.
Přidání sémantického řazení
Na stránce Upřesnit nastavení můžete volitelně přidat sémantické řazení , aby se výsledky na konci provádění dotazu přeřadily. Přerovnání umísťuje nejvíce sémanticky relevantní shody na začátek.
Mapování nových polí
Na stránce Upřesnit nastavení můžete volitelně přidat nová pole za předpokladu, že zdroj dat poskytuje metadata nebo pole, která se při prvním průchodu nenabírají. Ve výchozím nastavení průvodce generuje pole popsaná v následující tabulce.
| Pole | Platí pro | Popis |
|---|---|---|
| chunk_id | Vektory textu a obrázku | Vygenerované pole řetězců Prohledávatelné, dohledatelné a řaditelné. Toto je klíč dokumentu indexu. |
| parent_id | Textové vektory | Vygenerované pole řetězců Lze načíst a filtrovat. Identifikuje nadřazený dokument, ze kterého pochází blok dat. |
| Kus | Vektory textu a obrázku | Řetězcové pole Lidsky čitelná verze datového bloku Prohledávatelné a dostupné, ale nefiltrovatelné, nefasetovatelné nebo neřaditelné. |
| Název | Vektory textu a obrázku | Řetězcové pole Název dokumentu čitelný pro člověka nebo název stránky nebo číslo stránky Prohledávatelné a dostupné, ale nefiltrovatelné, nefasetovatelné nebo neřaditelné. |
| text_vector | Textové vektory | Collection(Edm.single). Vektorové znázornění bloku dat Prohledávatelné a dostupné, ale nefiltrovatelné, nefasetovatelné nebo neřaditelné. |
Vygenerovaná pole ani jejich atributy nemůžete upravovat, ale pokud je zdroj dat poskytuje, můžete přidat nová pole. Například Azure Blob Storage poskytuje kolekci polí metadat.
Přidání polí do schématu indexu:
Na stránce Pokročilá nastavení v části Pole rejstříku vyberte Náhled a upravit.
Vyberte Přidat pole.
Vyberte zdrojové pole z dostupných polí, zadejte název pole pro index a přijměte (nebo přepsat) výchozí datový typ.
Pokud chcete obnovit schéma do původní verze, vyberte Obnovit.
Klíčové body týkající se tohoto kroku:
Schéma indexu poskytuje vektorová a nevektorová pole pro datové úseky.
Režim analýzy dokumentů vytváří bloky dat (jeden vyhledávací dokument na jeden blok dat).
Plánování indexování
U zdrojů dat, kde jsou podkladová data nestálá, můžete naplánovat indexování , aby zaznamenávaly změny v konkrétních intervalech nebo v konkrétních datech a časech.
Naplánování indexování:
Na stránce Upřesnit nastavení v části Naplánovat indexování zadejte plán spuštění indexeru. Pro tento rychlý start doporučujeme Once.
Vyberte Další.
Dokončete průvodce
Posledním krokem je zkontrolovat konfiguraci a vytvořit potřebné objekty pro vektorové vyhledávání. V případě potřeby se vraťte na předchozí stránky průvodce a upravte konfiguraci.
Pro dokončení průvodce:
Na stránce Zkontrolovat a vytvořit zadejte předponu pro objekty, které průvodce vytvoří. Běžná předpona vám pomůže udržet si přehled.
Vyberte Vytvořit.
Objekty vytvořené průvodcem
Po dokončení konfigurace průvodce vytvoří následující objekty:
| Objekt | Popis |
|---|---|
| Zdroj dat | Představuje připojení ke zvolenému zdroji dat. |
| Index | Obsahuje vektorová pole, vektorizátory, vektorové profily a vektorové algoritmy. Během pracovního postupu průvodce nelze změnit výchozí index. Indexy odpovídají nejnovějšímu rozhraní REST API verze Preview , abyste mohli používat funkce preview. |
| Dovednostní sada | Obsahuje následující dovednosti a konfiguraci:
|
| Indexátor | Řídí kanál indexování s mapováním polí a mapováním výstupních polí (pokud je to možné). |
Tip
Objekty vytvořené průvodcem mají konfigurovatelné definice JSON. Pokud chcete tyto definice zobrazit nebo upravit, vyberte v levém podokně správu vyhledávání , kde můžete zobrazit indexy, indexery, zdroje dat a sady dovedností.
Kontrola výsledků
Průzkumník služby Search přijímá textové řetězce jako vstup a pak vektorizuje text pro provádění vektorového dotazu.
Dotazování vektorových indexů:
Na portálu Azure přejděte na Search Management>Indexes a pak vyberte index.
Vyberte Možnosti dotazu a pak ve výsledcích hledání vyberte Skrýt vektorové hodnoty. Díky tomuto kroku budou výsledky čitelnější.
V nabídce Zobrazení vyberte zobrazení JSON , abyste mohli do parametru vektorového
textdotazu zadat text pro vektorový dotaz.Výchozí dotaz je prázdné hledání (
"*"), ale obsahuje parametry pro vrácení odpovídajících čísel. Jedná se o hybridní dotaz, který paralelně spouští textové a vektorové dotazy. Obsahuje také sémantické řazení a určuje, která pole se mají vrátit do výsledků prostřednictvímselectpříkazu.{ "search": "*", "count": true, "vectorQueries": [ { "kind": "text", "text": "*", "fields": "text_vector,image_vector" } ], "queryType": "semantic", "semanticConfiguration": "my-demo-semantic-configuration", "captions": "extractive", "answers": "extractive|count-3", "queryLanguage": "en-us", "select": "chunk_id,text_parent_id,chunk,title,image_parent_id" }Zástupce hvězdičky (
*) nahraďte otázkou související se zdravotními plány, napříkladWhich plan has the lowest deductible?.{ "search": "Which plan has the lowest deductible?", "count": true, "vectorQueries": [ { "kind": "text", "text": "Which plan has the lowest deductible?", "fields": "text_vector,image_vector" } ], "queryType": "semantic", "semanticConfiguration": "my-demo-semantic-configuration", "captions": "extractive", "answers": "extractive|count-3", "queryLanguage": "en-us", "select": "chunk_id,text_parent_id,chunk,title" }Pokud chcete dotaz spustit, vyberte Hledat.
Každý dokument je blokem původního souboru PDF. Pole
titleukazuje, ze kterého souboru PDF blok pochází. Každýchunkje dlouhý. Pokud chcete přečíst celou hodnotu, můžete ho zkopírovat a vložit do textového editoru.Pokud chcete zobrazit všechny bloky dat z konkrétního dokumentu, přidejte filtr pro
title_parent_idpole pro konkrétní PDF. Zkontrolujte kartu Pole v indexu a ověřte, že je pole filtrovatelné.{ "select": "chunk_id,text_parent_id,chunk,title", "filter": "text_parent_id eq 'aHR0cHM6Ly9oZWlkaXN0c3RvcmFnZWRlbW9lYXN0dXMuYmxvYi5jb3JlLndpbmRvd3MubmV0L2hlYWx0aC1wbGFuLXBkZnMvTm9ydGh3aW5kX1N0YW5kYXJkX0JlbmVmaXRzX0RldGFpbHMucGRm0'", "count": true, "vectorQueries": [ { "kind": "text", "text": "*", "k": 5, "fields": "text_vector" } ] }
Vyčištění prostředků
Když pracujete ve vlastním předplatném, je vhodné dokončit projekt odebráním prostředků, které už nepotřebujete. Prostředky, které zůstaly spuštěné, vám můžou stát peníze.
Na portálu Azure vyberte Všechny prostředky nebo Zdrojové skupiny v levém podokně a vyhledejte a spravujte prostředky. Prostředky můžete odstranit jednotlivě nebo odstranit skupinu prostředků a odebrat tak všechny prostředky najednou.
Další krok
V tomto rychlém startu jste se seznámili s průvodcem importem dat , který vytvoří všechny potřebné objekty pro integrovanou vektorizaci. Podrobné prozkoumání jednotlivých kroků najdete v tématu Nastavování integrované vektorizace v Azure AI Vyhledávač.