Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Note
Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.
V tomto rychlém startu použijete průvodce importem dat na webu Azure Portal, abyste mohli začít s multimodálním vyhledáváním. Průvodce zjednodušuje proces extrakce, vytváření bloků dat, vektorizace a načítání textu i obrázků do prohledávatelného indexu.
V tomto rychlém startu se používá multimodální PDF z úložiště azure-search-sample-data. Můžete ale použít různé soubory a přesto tento rychlý start dokončit.
Tip
Máte dokumenty náročné na text? Viz Quickstart: Vektorové vyhledávání na portálu Azure pro vytváření bloků a vektorizaci obsahu s volitelnou podporou obrázků.
Prerequisites
Účet Azure s aktivním předplatným. Vytvořte si bezplatný účet.
Služba Azure AI Vyhledávač. Tento rychlý start vyžaduje úroveň Basic nebo vyšší pro podporu spravované identity.
Účet Azure Storage. Pro účet standardního výkonu (pro obecné účely v2) použijte Azure Blob Storage nebo Azure Data Lake Storage Gen2 (účet úložiště s hierarchickým oborem názvů). Úrovně přístupu můžou být aktivní, mírné nebo studené.
Znalost průvodce Viz Průvodce importem dat na webu Azure Portal.
Podporované metody extrakce
Pro extrakci obsahu zvolte výchozí extrakci prostřednictvím Azure AI Vyhledávač nebo rozšířené extrakce prostřednictvím Azure funkce Document Intelligence in Foundry Tools.
| Method | Description |
|---|---|
| Výchozí extrakce | Extrahuje metadata umístění pouze z obrázků PDF. Nevyžaduje další Azure prostředek. |
| Vylepšená extrakce | Extrahuje metadata umístění z textu a obrázků pro více typů dokumentů. Vyžaduje Azure účet AI pro více služeb1 pro integraci. |
1 Pro účely fakturace musíte připojit svůj účet s více službami ke své sadě schopností Azure AI Vyhledávač. Průvodce vyžaduje, aby vyhledávací služba a účet s více službami byly ve stejné podporované oblasti pro dovednost rozložení dokumentu.
Podporované metody vkládání
Pro vkládání obsahu zvolte jednu z následujících metod:
Verbalizace obrazu: Používá LLM ke generování popisů obrázků v přirozeném jazyce a poté použije embedding model k vektorizaci prostého textu a verbalizovaných obrázků.
Vícemodální vestavění: Používá model vestavění k přímé vektorizaci textu i obrázků.
Portál podporuje pro každou metodu následující modely. Pokyny k nasazení najdete v další části.
| Provider | Modely pro obrazovou slovesnost | Modely pro vícemodální vkládání |
|---|---|---|
| Účet Azure AI pro víceslužbové použití1 | Model vkládání: Azure Vision multimodal | Azure Vision Multimodální |
| Projekt založený na centru Microsoft Foundry | LLMs:
|
|
| Projekt Microsoft Foundry | LLMs:
|
|
| Prostředek Azure OpenAI3, 4 | LLMs:
|
1 Pro účely fakturace musíte připojit svůj účet s více službami ke své sadě schopností Azure AI Vyhledávač. Průvodce vyžaduje, aby vaše vyhledávací služba a účet s více službami byly ve stejné podporované oblasti pro dovednosti s vícemodálními vkládáními ve službě Azure Vision (Preview).
2 Průvodce podporuje pouze nasazení bezserverového rozhraní API pro tento model. K zřízení bezserverového nasazení (Preview) můžete použít Azure CLI.
3 Koncový bod prostředku Azure OpenAI musí mít subdoménu custom subdomain, například https://my-unique-name.openai.azure.com. Pokud jste prostředek vytvořili na portálu Azure, tato subdoména se během instalace prostředku automaticky vygenerovala.
4 Azure prostředky OpenAI (s přístupem k modelům vkládání), které byly vytvořeny na portálu Microsoft Foundry nejsou podporované. Na portálu Azure musíte vytvořit prostředek Azure OpenAI.
Nejnovější pokyny k životnímu cyklu modelů, včetně informací o vyřazení a zastarávání, najdete v tématu Vyřazení a zastarávání modelů.
Požadavky na veřejný koncový bod
Všechny předchozí prostředky musí mít povolený veřejný přístup, aby k nim mohl získat přístup průvodce. Jinak asistent selže. Po spuštění průvodce můžete pro zabezpečení povolit brány firewall a privátní koncové body na integračních komponentách. Další informace naleznete v tématu Zabezpečené připojení v průvodci importem.
Pokud už existují privátní koncové body a nemůžete je zakázat, je alternativou spuštění příslušného kompletního toku ze skriptu nebo programu na virtuálním počítači. Virtuální počítač musí být ve stejné virtuální síti jako privátní koncový bod. Vzorek kódu Python pro integrovanou vektorizaci. Stejné úložiště GitHub obsahuje ukázky v jiných programovacích jazycích.
Konfigurace přístupu
Než začnete, ujistěte se, že máte oprávnění pro přístup k obsahu a operacím. Tento rychlý start používá Microsoft Entra ID pro ověřování a přístup na základě role k autorizaci. Abyste mohli přiřadit role, musíte být vlastníkem nebo správcem uživatelských přístupů . Pokud role nejsou proveditelné, použijte místo toho ověřování založené na klíči .
Nakonfigurujte požadované role a podmíněné role identifikované v této části.
Požadované role
Azure AI Vyhledávač a Azure Storage jsou vyžadovány pro všechny scénáře multimodálního vyhledávání.
Azure AI Vyhledávač poskytuje multimodální pipeline. Nakonfigurujte přístup pro sebe a vaši vyhledávací službu, abyste mohli číst data, spustit datový kanál a interagovat s dalšími prostředky Azure.
Ve službě Azure AI Vyhledávač:
Přiřaďte sobě následující role .
Přispěvatel vyhledávací služby
Přispěvatel dat indexu vyhledávání
Čtečka dat vyhledávacího indexu
Podmíněné role
Následující karty pokrývají prostředky kompatibilní s průvodcem pro vícemodální vyhledávání. Vyberte pouze karty, které platí pro zvolenou metodu extrakce a metodu vkládání.
Účet s více službami poskytuje přístup k více službám Azure, včetně Azure Document Intelligence pro extrakci obsahu a Azure Zpracování obrazu pro vkládání obsahu. Vaše vyhledávací služba vyžaduje přístup k volání dovednosti rozložení dokumentu a vícemodální vkládací dovednost Azure Vision.
Na vašem účtu s více službami:
- Přiřaďte uživatele služeb Cognitive Services ke spravované identitě vyhledávací služby.
Příprava ukázkových dat
V tomto rychlém startu se používá ukázkový multimodální SOUBOR PDF, ale můžete také použít vlastní soubory. Pokud používáte bezplatnou vyhledávací službu, použijte méně než 20 souborů, abyste zůstali v rámci bezplatné kvóty pro zpracování obohacení.
Příprava ukázkových dat pro účely tohoto rychlého startu:
Na webu Azure Portal přejděte ke svému účtu Azure Storage.
V levém podokně vyberte úložiště dat>Kontejnery.
Vytvořte kontejner a nahrajte do kontejneru sample PDF.
Vytvořte další kontejner pro ukládání obrázků extrahovaných z PDF.
Příprava modelů
Note
Pokud používáte Azure Vision, přeskočte tento krok. Multimodální vkládání jsou integrované do vašeho účtu s více službami a nevyžadují nasazení modelu.
Průvodce nabízí několik možností pro vkládání obsahu. Vektorizace obrazů vyžaduje, aby velký jazykový model (VJM) popsal obrázky a aby vektorizující model zpracoval textový a obrazový obsah, zatímco přímá multimodální vektorizace vyžaduje pouze vektorizující model. Tyto modely jsou dostupné prostřednictvím Azure OpenAI a Foundry.
Pokud chcete nasadit modely požadované pro zvolenou metodu vkládání, přečtěte si téma Nasazení modelů Microsoft Foundry na portálu Foundry.
Spustit průvodce
Na webu Azure Portal přejděte do vyhledávací služby.
Na stránce Přehled vyberte Importovat data.
Vyberte zdroj dat: Azure Blob Storage nebo Azure Data Lake Storage Gen2.
Vyberte Multimodal RAG.
Spuštění průvodce
Průvodce vás provede několika konfiguračními kroky. Tato část popisuje jednotlivé kroky v posloupnosti.
Připojení k datům
Azure AI Vyhledávač vyžaduje připojení ke zdroji dat pro příjem a indexování obsahu. V tomto případě je zdrojem dat váš účet Azure Storage.
Připojení k datům:
Na stránce Připojte se k datům vyberte své předplatné Azure.
Vyberte účet úložiště a kontejner, do kterého jste nahráli ukázková data.
Zaškrtněte políčko Ověřit pomocí spravované identity . Typ identity ponechte přiřazený systémem.
Vyberte Další.
Extrahování obsahu
V závislosti na zvolené metodě extrakce průvodce poskytuje možnosti konfigurace pro prolomení a vytváření bloků dokumentů.
Výchozí metoda volá dovednost extrakce dokumentů k extrakci textového obsahu a generování normalizovaných obrázků z dokumentů. Dovednost Rozdělení textu se pak volá k rozdělení extrahovaného textového obsahu na stránky.
Použití dovednosti extrakce dokumentů:
Vložení obsahu
Během tohoto kroku průvodce použije zvolenou metodu vkládání k vygenerování vektorových reprezentací textu i obrázků.
Průvodce volá jednu dovednost k vytvoření popisného textu pro obrázky (verbalizace obrázků) a další dovednost k vytváření vektorových reprezentací textu i obrázků.
Dovednost GenAI Prompt používá váš nasazený LLM k analýze každého extrahovaného obrázku a vytvoření popisu v přirozeném jazyce.
Pro vkládání dovedností, jako je dovednost vkládání Azure OpenAI, dovednost AML nebo dovednost pro multimodální vkládání Azure Vision, se používá váš nasazený model vkládání k převodu bloků textu a slovních popisů na vysoce dimenzionální vektory. Tyto vektory umožňují podobnost a hybridní načítání.
Použít dovednosti pro verbalizaci obrazu
Na stránce Vkládání obsahu vyberte Verbalizace obrázku.
Na záložce Verbální vyjádření obrázku:
Pro typ vyberte svého poskytovatele LLM: Azure OpenAI nebo Microsoft Foundry.
Vyberte předplatné služby Azure, zdroj a nasazení LLM.
Jako typ ověřování vyberte identitu přiřazenou systémem , pokud nepoužíváte projekt založený na centru. Jinak ho ponechte jako klíč rozhraní API.
Zaškrtněte políčko, které potvrzuje účinky fakturace používání těchto prostředků.
Na kartě Vektorizace textu :
Jako druh vyberte poskytovatele modelu: Azure OpenAI, Microsoft Foundry nebo Azure Vision v nástrojích Foundry.
Vyberte své předplatné Azure, prostředek a nasazení vkládacího modelu (pokud je to relevantní).
Jako typ ověřování vyberte identitu přiřazenou systémem , pokud nepoužíváte projekt založený na centru. Jinak ho ponechte jako klíč rozhraní API.
Zaškrtněte políčko, které potvrzuje účinky fakturace používání těchto prostředků.
Vyberte Další.
Uložení extrahovaných obrázků
Dalším krokem je odeslání obrázků extrahovaných z dokumentů do Azure Storage. V Azure AI Vyhledávač se toto sekundární úložiště označuje jako úložiště knowledge store.
Uložení extrahovaných obrázků:
Na stránce Výstup obrázku vyberte své předplatné Azure.
Vyberte účet úložiště a kontejner objektů blob pro obrázky, který jste vytvořili k jejich uložení.
Zaškrtněte políčko Ověřit pomocí spravované identity . Typ identity ponechte přiřazený systémem.
Vyberte Další.
Přidání sémantického řazení
Na stránce Upřesnit nastavení můžete volitelně přidat sémantické řazení, aby se výsledky na konci provádění dotazu přeřadily. Přeřazení podporuje nejvíce sémanticky relevantní shody na přední místa.
Mapování nových polí
Na stránce Upřesnit nastavení můžete volitelně přidat pole do schématu indexu. Ve výchozím nastavení průvodce generuje pole popsaná v následující tabulce.
| Field | Vztahuje se na | Description | Attributes |
|---|---|---|---|
| content_id | Vektory textu a obrázku | Pole řetězců. Klíč dokumentu pro index. | Lze načíst, řadit a prohledávat. |
| document_title | Vektory textu a obrázku | Pole řetězců. Název dokumentu čitelný pro člověka. | Dostupné a prohledávatelné. |
| text_document_id | Textové vektory | Pole řetězců. Identifikuje nadřazený dokument, ze kterého pochází textový blok. | Možné načíst a filtrovat. |
| image_document_id | Vektory obrázků | Pole řetězců. Identifikuje nadřazený dokument, ze kterého obrázek pochází. | Možné načíst a filtrovat. |
| content_text | Textové vektory | Pole řetězců. Verze textového bloku čitelná pro člověka | Dostupné a prohledávatelné. |
| content_embedding | Vektory textu a obrázku | Collection(Edm.Single). Vektorové znázornění textu a obrázků | Dostupné a prohledávatelné. |
| content_path | Vektory textu a obrázku | Pole řetězců. Cesta k obsahu v úložném kontejneru | Dostupné a prohledávatelné. |
| locationMetadata | Vektory obrázků | Edm.ComplexType. Obsahuje metadata o umístění obrázku v dokumentech. | Liší se podle oblasti. |
Vygenerovaná pole ani jejich atributy nemůžete upravovat, ale pokud je zdroj dat poskytuje, můžete přidat pole. Například Azure Blob Storage poskytuje kolekci polí metadat.
Přidání polí do schématu indexu:
V části Indexová pole vyberte Náhled a úprava.
Vyberte Přidat pole.
Vyberte zdrojové pole z dostupných polí, zadejte název pole pro index a přijměte (nebo přepsat) výchozí datový typ.
Pokud chcete obnovit schéma do původní verze, vyberte Obnovit.
Klíčové body týkající se tohoto kroku:
Schéma indexu poskytuje vektorová a nevektorová pole pro členěná data.
Režim analýzy dokumentů vytváří bloky dat (jeden vyhledávací dokument na jeden blok dat).
Plánování indexování
U zdrojů dat, kde jsou podkladová data nestálá, můžete naplánovat indexování , aby zaznamenávaly změny v konkrétních intervalech nebo v konkrétních datech a časech.
Naplánování indexování:
Na stránce Upřesnit nastavení v části Naplánovat indexování zadejte plán spuštění indexeru. Pro účely tohoto rychlého startu doporučujeme Once.
Vyberte Další.
Dokončete průvodce
Posledním krokem je zkontrolovat konfiguraci a vytvořit potřebné objekty pro vícemodální vyhledávání. V případě potřeby se vraťte na předchozí stránky průvodce a upravte konfiguraci.
Pro dokončení průvodce:
Na stránce Zkontrolovat a vytvořit zadejte předponu pro objekty, které průvodce vytvoří. Běžná předpona vám pomůže udržet si přehled.
Vyberte Vytvořit.
Objekty vytvořené průvodcem
Po dokončení konfigurace průvodce vytvoří následující objekty:
| Object | Description |
|---|---|
| Zdroj dat | Představuje připojení k Azure Blob Storage. |
| Index | Obsahuje textová pole, vektorová pole, vektorové metody, vektorové profily a vektorové algoritmy. Během pracovního postupu průvodce nelze změnit výchozí index. Indexy odpovídají nejnovějšímu rozhraní REST API verze Preview , abyste mohli používat funkce preview. |
| Soubor dovedností | Obsahuje následující dovednosti:
|
| Indexer | Řídí kanál indexování s mapováním polí a mapováním výstupních polí (pokud je to možné). |
| Úložiště znalostí | Ukládá extrahované obrázky jako objekty blob ve službě Azure Storage pro podřízené zpracování nebo multimodální scénáře. |
Tip
Objekty vytvořené průvodcem mají konfigurovatelné definice JSON. Pokud chcete tyto definice zobrazit nebo upravit, vyberte v levém podokně správu vyhledávání , kde můžete zobrazit indexy, indexery, zdroje dat a sady dovedností.
Pokud chcete zobrazit úložiště znalostí, přejděte do svého účtu Azure Storage a vyberte kontejner, který jste určili pro výstup image.
Kontrola výsledků
Tento rychlý start vytvoří multimodální index, který podporuje hybridní vyhledávání textu i obrázků. Pokud nepoužíváte přímé multimodální vkládání, index nepřijímá obrázky jako vstupy dotazů, což vyžaduje dovednost AML nebo dovednost multimodálních vkládání systému Azure Vision s ekvivalentním vektorizátorem. Další informace naleznete v tématu Konfigurace vektorizátoru v indexu vyhledávání.
Hybridní vyhledávání kombinuje fulltextové dotazy a vektorové dotazy. Když vydáte hybridní dotaz, vyhledávací modul vypočítá sémantickou podobnost mezi dotazem a indexovanými vektory a odpovídajícím způsobem řadí výsledky. V případě indexu vytvořeného v tomto rychlém startu se zobrazí obsah výsledků z content_text pole, které je úzce v souladu s vaším dotazem.
Chcete-li dotázat svůj vícemodální index:
Na webu Azure Portal přejděte do vyhledávací služby.
V levém podokně vyberte správu vyhledávání>Indexy.
Vyberte index.
Vyberte Možnosti dotazu a pak ve výsledcích hledání vyberte Skrýt vektorové hodnoty. Díky tomuto kroku budou výsledky čitelnější.
Zadejte text, pro který chcete hledat. Náš příklad používá
energy.Pokud chcete dotaz spustit, vyberte Hledat.
Výsledky JSON by měly obsahovat text a obrázky související s vaším indexem
energy. Pokud jste povolili sémantický ranker, pole@search.answersposkytuje stručné a vysoce spolehlivé sémantické odpovědi, které vám pomůžou rychle identifikovat relevantní shody."@search.answers": [ { "key": "a71518188062_aHR0cHM6Ly9oYWlsZXlzdG9yYWdlLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsLXNlYXJjaC9BY2NlbGVyYXRpbmctU3VzdGFpbmFiaWxpdHktd2l0aC1BSS0yMDI1LnBkZg2_normalized_images_7", "text": "A vertical infographic consisting of three sections describing the roles of AI in sustainability: 1. **Measure, predict, and optimize complex systems**: AI facilitates analysis, modeling, and optimization in areas like energy distribution, resource allocation, and environmental monitoring. **Accelerate the development of sustainability solution...", "highlights": "A vertical infographic consisting of three sections describing the roles of AI in sustainability: 1. **Measure, predict, and optimize complex systems**: AI facilitates analysis, modeling, and optimization in areas like<em> energy distribution, </em>resource<em> allocation, </em>and environmental monitoring. **Accelerate the development of sustainability solution...", "score": 0.9950000047683716 }, { "key": "1cb0754930b6_aHR0cHM6Ly9oYWlsZXlzdG9yYWdlLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsLXNlYXJjaC9BY2NlbGVyYXRpbmctU3VzdGFpbmFiaWxpdHktd2l0aC1BSS0yMDI1LnBkZg2_text_sections_5", "text": "...cross-laminated timber.8 Through an agreement with Brookfield, we aim 10.5 gigawatts (GW) of renewable energy to the grid.910.5 GWof new renewable energy capacity to be developed across the United States and Europe.Play 4 Advance AI policy principles and governance for sustainabilityWe advocated for policies that accelerate grid decarbonization", "highlights": "...cross-laminated timber.8 Through an agreement with Brookfield, we aim <em> 10.5 gigawatts (GW) of renewable energy </em>to the<em> grid.910.5 </em>GWof new<em> renewable energy </em>capacity to be developed across the United States and Europe.Play 4 Advance AI policy principles and governance for sustainabilityWe advocated for policies that accelerate grid decarbonization", "score": 0.9890000224113464 }, { "key": "1cb0754930b6_aHR0cHM6Ly9oYWlsZXlzdG9yYWdlLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsLXNlYXJjaC9BY2NlbGVyYXRpbmctU3VzdGFpbmFiaWxpdHktd2l0aC1BSS0yMDI1LnBkZg2_text_sections_50", "text": "ForewordAct... Similarly, we have restored degraded stream ecosystems near our datacenters from Racine, Wisconsin120 to Jakarta, Indonesia.117INNOVATION SPOTLIGHTAI-powered Community Solar MicrogridsDeveloping energy transition programsWe are co-innovating with communities to develop energy transition programs that align their goals with broader s.", "highlights": "ForewordAct... Similarly, we have restored degraded stream ecosystems near our datacenters from Racine, Wisconsin120 to Jakarta, Indonesia.117INNOVATION SPOTLIGHTAI-powered Community<em> Solar MicrogridsDeveloping energy transition programsWe </em>are co-innovating with communities to develop<em> energy transition programs </em>that align their goals with broader s.", "score": 0.9869999885559082 } ]
Vyčistěte zdroje
Když pracujete ve vlastním předplatném, je vhodné dokončit projekt odebráním prostředků, které už nepotřebujete. Prostředky, které zůstaly spuštěné, vám můžou stát peníze.
Na portálu Azure vyberte Všechny prostředky nebo Zdrojové skupiny v levém podokně a vyhledejte a spravujte prostředky. Prostředky můžete odstranit jednotlivě nebo odstranit skupinu prostředků a odebrat tak všechny prostředky najednou.
Další krok
V tomto rychlém startu jste se seznámili s průvodcem importem dat , který vytvoří všechny potřebné objekty pro vícemodální vyhledávání. Podrobné prozkoumání jednotlivých kroků najdete v kurzu Multimodal.