Průvodce importem dat na portálu Azure

Note

Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.

Průvodce Importovat data na portálu Azure poskytuje cestu bez kódu k indexu vyhledávání s možností dotazu. Připojuje se k podporovanému zdroji dat, konfiguruje volitelné rozšiřování a vektorizaci umělé inteligence, odvodí schéma indexu a načte obsah do indexu. Průvodce můžete použít pro vyhledávání klíčových slov, RAG a multimodální RAG.

Průvodce podporuje:

  • Vytvoření kanálu indexeru, včetně indexu, indexeru, zdroje dat a sady dovedností
  • Integrované indexery a konektory Azure Logic Apps
  • Rozšiřování umělé inteligence založené na dovednostech.
  • Vytváření bloků dat a integrovaná vektorizace, včetně vícemodálních vkládání
  • Sémantická konfigurace řazení.
  • Vytvoření úložiště znalostí

Co průvodce podporuje

Tato část popisuje možnosti dostupné v průvodci.

Integrovaná ukázková data

Předdefinovaná ukázková data pro index ukázek hotelů už nejsou k dispozici. Stejný index ale můžete vytvořit pomocí Quickstart: Fulltextové vyhledávání na portálu Azure.

Zdroje dat

Průvodce se připojí k následujícím zdrojům dat prostřednictvím integrovaných indexerů nebo konektorů Logic Apps.

Zdroj dat Podporováno Připojení
ADLS Gen2 Integrovaný indexer
Azure Blob Storage Integrovaný indexer
Úložiště souborů Azure Konektor Logic Apps
Azure Fronty Konektor Logic Apps
Azure Table Storage Integrovaný indexer
Azure SQL Database a Spravovaný Instance Integrovaný indexer
Cosmos DB pro NoSQL Integrovaný indexer
Cosmos DB pro MongoDB (Preview) Integrovaný indexer
Cosmos DB pro Apache Gremlin (Preview) Integrovaný indexer
MySQL (Preview) Není relevantní
OneDrive Konektor Logic Apps
OneDrive pro firmy Konektor Logic Apps
OneLake Integrovaný indexer
Service Bus Konektor Logic Apps
SharePoint Konektor Logic Apps
SQL Server na virtuálních počítačích Integrovaný indexer

Návod

Místo použití konektoru Logic Apps pro Azure File Storage nebo SharePoint můžete pomocí rozhraní REST API vyhledávací služby programově indexovat data z těchto zdrojů. Další informace viz Indexování dat ze služby Azure Files (verze Preview) a Indexování dat z knihoven dokumentů SharePointu (verze Preview).

Kvalifikace

V sadě dovedností vygenerovaných průvodcem se můžou objevit následující dovednosti. Po vytvoření sady dovedností můžete upravit její definici JSON a přidat nebo odebrat dovednosti.

Dovednost Podporováno Popis
AML K dispozici pouze pro RAG a multimodální RAG.
Azure Vision – multimodální vektorizace (Preview) K dispozici pouze pro RAG a multimodální RAG.
Vektorové reprezentace Azure OpenAI K dispozici pouze pro RAG a multimodální RAG.
Rozložení dokumentu K dispozici pouze pro RAG a multimodální RAG.
Rozpoznávání entit K dispozici pouze pro vyhledávání klíčových slov.
Analýza obrázků K dispozici pro objekty blobů Azure Storage a soubory Microsoft OneLake, za předpokladu výchozího režimu analýzy. Použijte typ obsahu obrázku, například PNG nebo JPG, nebo vložený obrázek v souboru aplikace, například PDF.
Extrakce klíčových frází K dispozici pouze pro vyhledávání klíčových slov.
Rozpoznávání jazyka K dispozici pouze pro vyhledávání klíčových slov. Automaticky se přidá, když sada dovedností zahrnuje rozpoznávání entit, extrakci klíčových frází nebo rozdělení textu. Nelze konfigurovat uživatelem.
Překlad textu Nelze použít.
OCR K dispozici pro objekty blobů Azure Storage a soubory Microsoft OneLake, za předpokladu výchozího režimu analýzy. Použijte typ obsahu obrázku, například PNG nebo JPG, nebo vložený obrázek v souboru aplikace, například PDF.
Detekce PII Nelze použít.
Cítění Nelze použít.
Tvarující stroj Nelze použít.
Rozdělení textu Přidáno pro dělení dat při volbě modelu vkládání. U dovedností, které nejsou embedding, se přidává při nastavování členění zdrojového pole na stránky nebo věty.
Sloučení textu Přidáno pro dělení dat při volbě modelu vkládání. U dovedností, které nejsou embedding, se přidává při nastavování členění zdrojového pole na stránky nebo věty.

Sémantické řazení

Sémantické řazení je k dispozici pro všechny scénáře průvodce: vyhledávání klíčových slov, RAG a multimodální RAG. Pokud ho povolíte, průvodce přidá do indexu sémantickou konfiguraci .

Úložiště znalostí

Vytvoření úložiště znalostí je k dispozici pouze pro scénář multimodálního RAG. Průvodce extrahuje obrázky z dokumentů a uloží je jako blobové objekty v zadaném kontejneru Azure Storage.

Co asistent vytvoří

Po dokončení průvodce se ve vyhledávací službě vytvoří několik objektů. Přesné objekty závisí na vybraných možnostech. Pokud například použijete rozšiřování založené na dovednostech, vytvoří se sada dovedností.

Objekt Popis
zdroje dat Ukládá informace o připojení pro podporovaný Microsoft nebo Azure zdroj dat.
Index Fyzická datová struktura pro fulltextové vyhledávání, vektorové vyhledávání a další dotazy. Pokud povolíte sémantické řazení, může obsahovat sémantickou konfiguraci.
indexer Import dat se řídí načtením ze zdroje dat do cílového indexu podle volitelného plánu. Může také odkazovat na sadu dovedností.
Sada dovedností (Volitelné) Sada instrukcí pro rozšiřování AI, vytváření bloků dat a integrované vektorizace během indexování
Úložiště znalostí (Volitelné) Sekundární úložiště v Azure Storage pro výstup sady dovedností, jako jsou extrahované obrázky.

Chcete-li zobrazit tyto objekty po spuštění průvodce:

  1. Přejděte do vyhledávací služby na portálu Azure.
  2. V levém podokně vyberte Správa hledání a vyhledejte stránky pro indexy, indexery, zdroje dat a sady dovedností.

Výhody a omezení

Tato část rozebírá výhody a nevýhody zážitků s průvodcem. Pomocí těchto informací se můžete rozhodnout, kdy použít průvodce a kdy zvážit alternativy, jako jsou programové přístupy pomocí rozhraní REST API nebo Sady Azure SDK.

Zaměstnanecké výhody

Než napíšete jakýkoli kód, můžete použít průvodce pro testování prototypů a testování konceptu. Průvodce se připojí k externím zdrojům dat, vzorkuje data, aby vytvořil počáteční index, a pak importuje a volitelně vektorizuje data jako dokumenty JSON do indexu v Azure AI Vyhledávač.

Pokud vyhodnocujete sady schopností, průvodce zpracuje mapování výstupních polí a přidá pomocné funkce k vytvoření použitelných objektů. Rozdělení textu se přidá při zadání režimu analýzy. Sloučení textu se přidá, když zvolíte analýzu obrázků, aby průvodce mohl znovu sloučit textové popisy s obsahem obrázku. Všechny tyto úkoly mají křivku učení. Pokud s rozšiřováním začínáte, můžete díky těmto krokům měřit hodnotu dovednosti, aniž byste museli investovat mnoho času a úsilí.

Vzorkování je proces, kterým je odvozeno schéma indexu, což má určitá omezení. Po vytvoření zdroje dat průvodce vybere náhodný vzorek dokumentů a rozhodne, které sloupce jsou součástí zdroje dat. Ne všechny soubory se čtou, protože to může trvat hodiny u velkých zdrojů dat. Při výběru dokumentů se k vytvoření kolekce polí ve schématu indexu používají zdrojová metadata (například název pole nebo typ). Na základě složitosti zdrojových dat možná budete muset upravit počáteční schéma pro přesnost nebo rozšířit jeho úplnost. Změny můžete provést přímo na stránce definice indexu.

Obecně platí, že výhody průvodce jsou jasné: pokud jsou splněny požadavky, můžete během několika minut vytvořit dotazovatelný index. Průvodce zpracovává některé složitosti indexování, jako je serializace dat jako dokumentů JSON.

Omezení

  • Průvodce nepodporuje iteraci ani opakované použití. Každý průchod průvodcem vytvoří index, sadu dovedností a konfiguraci indexeru. Po dokončení průvodce můžete vytvořené objekty upravit pomocí jiných nástrojů portálu, rozhraní REST API nebo Sady Azure SDK.

  • Zdrojový obsah se musí nacházet v podporovaném zdroji dat.

  • Vzorkování, které se používá k odvození předběžného schématu indexu, probíhá nad podmnožinou zdrojových dat. U velkých datových zdrojů může průvodce vynechat pole. Pokud vzorkování není dostatečné, budete možná muset do indexu přidat pole ručně nebo opravit odvozené datové typy.

  • Rozšiřování AI a integrovaná vektorizace, jak je vystaveno v průvodci, je omezené na podmnožinu předdefinovaných dovedností.

Zabezpečená připojení

Ochrana sítě ovlivňuje připojení portálu ke koncovému bodu a také připojení koncového bodu k externím prostředkům během operací portálu.

Připojení portálu k vyhledávací službě

Připojení portálu ke koncovému bodu chráněnému sítí se provádějí pomocí IP adresy klienta.

Návod

Portál zjistí IP adresu vašeho klienta a vyzve vás, abyste ji přidali do brány firewall vyhledávací služby.

Připojení portálu k externím prostředkům

Průvodce se připojí k externím prostředkům za účelem:

V průvodci se téměř každý odchozí dotaz na data chráněná sítí a zpracování dat pomocí umělé inteligence provádí pomocí IP adresy vašeho klienta.

Tato část vysvětluje požadavky na připojení pro odchozí požadavky.

Konfigurace přístupu k externím prostředkům na portálu

  • Zdroje chráněné pomocí IP adresy: Přidejte IP adresu klienta do externího allowListzdroje. Pokud je to podporováno, uveďte Microsoft.Search/searchServices jako důvěryhodnou službu. Například v Azure Storage můžete vypsat Microsoft.Search/searchServices jako důvěryhodnou službu.

  • Privátní připojení: Průvodce používá sdílené privátní propojení. Ověřte, že vaše search service splňuje požadavky na vrstvu a oblast. Ověřte, že je váš externí zdroj dat podporovaný pro sdílené privátní propojení.

Pokud se průvodce nemůže připojit, zobrazí se "Access denied due to Virtual Network/Firewall rules". Jako alternativu zvažte skriptované nebo programové přístupy.

Workflow

Průvodce dodržuje obecný pracovní postup:

  1. Připojte se k podporovanému zdroji dat Azure.

  2. (Volitelné) Přidejte dovednosti pro extrakci nebo generování obsahu a struktury.

  3. Vytvořte schéma indexu odvozené vzorkováním zdrojových dat.

  4. Spuštěním průvodce vytvoříte objekty, volitelně vektorizujete data, načtete data do indexu, nastavíte plán a nakonfigurujete další možnosti.

Workflow je jednosměrné potrubí. Průvodce nemůžete použít k úpravě objektů, které byly vytvořeny, ale k provádění povolených aktualizací můžete použít jiné nástroje portálu, jako je návrhář indexu nebo editor JSON.

Spusťte průvodce

  1. Přejděte do vyhledávací služby na portálu Azure.

  2. Na stránce Přehled vyberte Importovat data.

    Snímek obrazovky s možnostmi průvodce importem

    Průvodce se v okně prohlížeče otevře v plné velikosti, což vám poskytne více prostoru pro práci.

  3. Vyberte scénář: Vyhledávání klíčových slov, RAG nebo Multimodal RAG.

    Vybraný scénář určuje dostupné zdroje dat a dovednosti a také konfiguraci schématu indexu a indexeru, které průvodce vytvořil.

  4. Pomocí zbývajících kroků vytvořte index, indexer a další příslušné objekty.

Konfigurace zdroje dat

Průvodce se připojí k externímu podporovanému zdroji dat pomocí interní logiky poskytovanou indexery, které jsou vybaveny pro vzorkování zdroje, čtení metadat, rozklad dokumentů pro čtení obsahu a struktury a serializaci obsahu jako JSON pro následný import do Azure AI Vyhledávač.

Ne všechny zdroje dat ve verzi Preview jsou zaručené, že budou v průvodci dostupné. Vzhledem k tomu, že každý zdroj dat má potenciál zavést změny do dalších fází, přidá se zdroj dat jako preview pouze v případě, že plně podporuje všechny funkce průvodce, jako je definice sady dovedností a odvození schématu indexu.

Importovat můžete jenom z jedné tabulky, zobrazení databáze nebo ekvivalentní datové struktury. Struktura však může zahrnovat hierarchické nebo vnořené podstruktury. Další informace naleznete v tématu Modelování složitých typů.

Konfigurace sady dovedností

Konfigurace sady dovedností se vyskytuje po definici zdroje dat, protože typ zdroje dat informuje o dostupnosti určitých předdefinovaných dovedností. Pokud například indexujete soubory z Azure Blob Storage, režim analýzy, který pro tyto soubory zvolíte, určuje, jestli je analýza mínění dostupná.

Průvodce přidá nejen dovednosti, které zvolíte, ale také dovednosti, které jsou nezbytné pro úspěšný výsledek.

Sady dovedností jsou volitelné a v dolní části stránky je možné přeskočit, pokud nechcete AI obohacení.

Konfigurace schématu indexu

Průvodce odebírá vzorek ze zdroje dat, aby zjistil pole a typy polí. V závislosti na zdroji dat může také nabízet pole pro indexování metadat.

Jelikož je vzorkování nepřesný proces, zkontrolujte index s ohledem na následující aspekty:

  1. Je seznam polí přesný? Pokud zdroj dat obsahuje pole, která nebyla vybrána v vzorkování, můžete ručně přidat zmeškaná pole. Můžete také odebrat pole, která nepřidají hodnotu do vyhledávacího prostředí nebo nebudou použita ve výrazu filtru nebo v bodovacím profilu.

  2. Je datový typ vhodný pro příchozí data? Azure AI Vyhledávač podporuje datové typy datového modelu entity (EDM). Pro Azure SQL data existuje mapingový graf, který obsahuje ekvivalentní hodnoty. Další informace naleznete v tématu Mapování a transformace polí.

  3. Máte jedno pole, které může sloužit jako klíč? Toto pole musí být Edm.String, který jednoznačně identifikuje dokument. U relačních dat je možné je namapovat na primární klíč. U objektů blob to může být metadata-storage-path. Pokud hodnoty polí obsahují mezery nebo pomlčky, je nutné nastavit možnost Klíč kódování Base-64 v kroku Vytvoření indexeru v části Upřesnit možnosti pro potlačení kontroly ověření těchto znaků.

  4. Nastavte atributy, abyste zjistili, jak se toto pole používá v indexu.

    S tímto krokem si dejte čas, protože atributy určují fyzický výraz polí v indexu. Pokud chcete později změnit atributy, dokonce i programově, téměř vždy potřebujete odstranit a znovu sestavit index. Základní atributy, jako jsou Searchable a Retrievable, mají zanedbatelný vliv na úložiště. Povolení filtrů a používání návrhofčů zvyšuje požadavky na úložiště.

    • Umožňuje fulltextové vyhledávání. Každé pole použité ve volných dotazech nebo ve výrazech dotazu musí mít tento atribut. Invertované indexy se vytvoří pro každé pole, které označíte jako prohledávatelné.

    • Dostupnost vrátí pole ve výsledcích hledání. Každé pole, které poskytuje obsah výsledkům hledání, musí mít tento atribut. Nastavení tohoto pole nemá vliv na velikost indexu.

    • Filtrovatelné umožňuje odkaz na pole ve výrazech filtru. Každé pole použité ve výrazu $filter musí mít tento atribut. Výrazy filtru slouží k přesné shodě. Vzhledem k tomu, že textové řetězce zůstávají beze změny, je potřeba více storage pro doslovný obsah.

    • Facetable umožňuje pole pro fasetovou navigaci. Jako facetable lze označit pouze pole označená jako filtrovatelná.

    • Seřaditelné umožňuje pole použít k řazení. Každé pole použité ve výrazu $Orderby musí mít tento atribut.

  5. Potřebujete lexikální analýzu? Pro pole Edm.String, která jsou prohledávatelná, můžete nastavit Analyzátor , pokud chcete indexování a dotazování rozšířeného jazyka.

    Výchozí hodnota je Standard Lucene, ale můžete zvolit Microsoft angličtinu, pokud chcete použít analyzátor Microsoft pro pokročilé lexikální zpracování, například překlad nepravidelných jmen a slovesných formulářů. Na portálu Azure je možné zadat pouze analyzátory jazyka. Pokud chcete použít vlastní analyzátor nebo analyzátor bez jazyka, například klíčové slovo nebo vzor, musíte ho vytvořit programově. Další informace naleznete v tématu Přidání analyzátorů jazyka.

  6. Potřebujete funkci pro psaní textu ve formě automatického dokončování nebo navrhovaných výsledků? Chcete-li u vybraných polí povolit návrhy při psaní a automatické dokončování dotazů, zaškrtněte políčko Navrhovací modul. Návrhy přidávají k počtu tokenizovaných termínů ve vašem indexu a tím spotřebují více úložiště.

Nakonfigurujte indexer

Poslední stránka průvodce shromažďuje uživatelské vstupy pro konfiguraci indexeru. Můžete zadat plán a nastavit další možnosti, které se liší podle typu zdroje dat.

Průvodce interně nastaví následující definice, které nejsou v indexeru viditelné, dokud není plně vytvořen.

Vyzkoušejte průvodce.

Nejlepší způsob, jak porozumět výhodám a omezením průvodce importem dat, je projít si ho krok za krokem. Následující rychlé starty jsou založené na průvodci.