Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Poznámka:
Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.
Important
Tyto funkce podporují připojení k jiným služby Microsoft a službám třetích stran. Použití těchto služeb podléhá vlastním podmínkám jednotlivých služeb a může vést ke zpracování nebo ukládání dat mimo hranici souladu Azure, stejně jako k toku dat do hranice souladu Azure.
Je vaší zodpovědností spravovat, jestli budou vaše data přetékat mimo dodržování předpisů a geografické hranice vaší organizace a případné související důsledky a že se zřídí příslušná oprávnění, hranice a schválení.
Zodpovídáte za pečlivou kontrolu a testování aplikací, které vytváříte v kontextu konkrétních případů použití, a za veškerá vhodná rozhodnutí a přizpůsobení. To zahrnuje implementaci vlastního zodpovědného zmírnění rizik umělé inteligence, jako jsou metaprompty, filtry obsahu nebo jiné bezpečnostní systémy, a zajištění toho, aby vaše aplikace splňovaly příslušné standardy kvality, spolehlivosti, zabezpečení a důvěryhodnosti. Další informace najdete v informacích o transparentnosti Azure AI Vyhledávač.
Hledání v různých typech obsahu uložených ve službě Azure Blob Storage může být obtížné vyřešit, ale Azure AI Vyhledávač poskytuje hlubokou integraci ve vrstvě obsahu, extrahování a odvozování textových informací, které se pak dají dotazovat v indexu vyhledávání.
V tomto článku si projděte základní pracovní postup pro extrakci obsahu a metadata z objektů blob a jeho odeslání do indexu vyhledávání ve službě Azure AI Vyhledávač. Výsledný index se dá dotazovat pomocí fulltextového vyhledávání nebo vektorového vyhledávání. Volitelně můžete zpracovaný obsah blob odeslat do úložiště znalostí pro scénáře, které nejsou určené pro vyhledávání.
Poznámka:
Už znáte pracovní postup a složení? Dalším krokem je konfigurace indexeru blobů.
Přidání vyhledávání pro blobová data: Co to znamená
Azure AI Vyhledávač je samostatná vyhledávací služba, která podporuje indexování a dotazování úloh nad uživatelsky definovanými indexy, které obsahují váš privátní prohledávatelný obsah hostovaný v cloudu. Umístění prohledávatelného obsahu společně s vyhledávačem v cloudu je nezbytné pro výkon a poskytování výsledků rychlostí, kterou uživatelé očekávají od dotazů.
Azure AI Vyhledávač se integruje se službou Azure Blob Storage ve vrstvě indexování a importuje obsah objektů blob jako vyhledávací dokumenty, které jsou indexované do invertovaných indexů a dalších struktur dotazů, které podporují textové dotazy, vektorové dotazy a výrazy filtru. Vzhledem k tomu, že se obsah objektu blob indexuje do indexu vyhledávání, můžete k vyhledání informací v obsahu objektu blob použít celou řadu funkcí dotazů ve službě Azure AI Vyhledávač.
Vaše vstupy jsou objekty blob v jednom kontejneru ve službě Azure Blob Storage. Blobové objekty mohou být téměř jakýmkoli druhem textových dat. Pokud objekty blob obsahují obrázky, můžete přidat obohacení AI, abyste z obrázků vytvořili a extrahovali text a funkce.
Výstup je vždy index azure AI Search, který se používá k rychlému vyhledávání, načítání a zkoumání textu v klientských aplikacích. Mezi nimi se nachází samotná architektura indexovacího kanálu. Potrubí je založeno na funkci indexeru, která je podrobněji popsána v tomto článku.
Po vytvoření a naplnění indexu existuje nezávisle na kontejneru objektů blob, ale můžete znovu spustit operace indexování a aktualizovat index na základě změněných dokumentů. Informace o časovém razítku jednotlivých objektů blob se používají k detekci změn. Jako mechanismus aktualizace můžete zvolit plánované spuštění nebo indexování na vyžádání.
Prostředky používané v řešení vyhledávání blobů
Potřebujete Azure AI Vyhledávač, Azure Blob Storage a klienta. Azure AI Vyhledávač je obvykle jednou z několika komponent řešení, kde váš kód aplikace vydává dotazy na požadavky rozhraní API a zpracovává odpověď. Můžete také napsat kód aplikace pro zpracování indexování, i když pro testování konceptu a improvizované úlohy je běžné používat Azure Portal jako vyhledávacího klienta.
Ve službě Blob Storage budete potřebovat kontejner, který poskytuje zdrojový obsah. Můžete nastavit kritéria zahrnutí a vyloučení souborů a určit, které části objektu blob se indexují ve službě Azure AI Vyhledávač.
Můžete začít přímo na stránce portálu účtu úložiště.
Na levé navigační stránce v části Správa dat vyberte Azure AI Vyhledávač a vyberte nebo vytvořte vyhledávací službu.
Pomocí průvodce importem můžete extrahovat a volitelně vytvořit prohledávatelný obsah z objektů blob. Pracovní postup vytvoří indexer, zdroj dat, index a volitelnou sadu dovedností ve službě Azure AI Vyhledávač.
Pomocí Průzkumníka služby Search na stránce vyhledávacího portálu můžete dotazovat obsah.
Průvodce je nejlepším místem, kde začít, ale při vlastní konfiguraci indexeru objektů blob zjistíte flexibilnější možnosti. Můžete použít klienta REST. Kurz: Indexování a vyhledávání částečně strukturovaných dat (objektů blob JSON) vás provede postupem volání rozhraní REST API.
Jak se objekty blob indexují
Ve výchozím nastavení se většina objektů blob indexuje jako jeden vyhledávací dokument v indexu, včetně objektů blob se strukturovaným obsahem, jako je JSON nebo CSV, které se indexují jako jeden blok textu. U dokumentů JSON nebo CSV s interní strukturou (oddělovači) ale můžete přiřadit režimy analýzy, které generují jednotlivé dokumenty hledání pro každý řádek nebo prvek:
- Indexování objektů blob JSON
- Indexování objektů blob CSV
- Indexování objektů blob Markdownu
- Indexování objektů blob ve formátu prostého textu
Složený nebo vložený dokument (například archiv ZIP, wordový dokument s vloženým outlookovým e-mailem obsahujícím přílohy nebo přílohy. Soubor MSG s přílohami) je také indexován jako jeden dokument. Například všechny obrázky extrahované z přílohy souboru .MSG budou vráceny v poli normalized_images. Pokud máte obrázky, zvažte přidání obohacení AI, abyste z tohoto obsahu získali další vyhledávací nástroj.
Textový obsah dokumentu se extrahuje do textového pole s názvem "content". Můžete také extrahovat standardní a uživatelsky definovaná metadata.
Poznámka:
Azure AI Vyhledávač uplatňuje omezení indexátoru na to, kolik textu extrahuje, v závislosti na cenové úrovni. Pokud jsou dokumenty zkráceny, zobrazí se v odpovědi na stav indexeru upozornění.
Použití indexeru objektů blob k extrakci obsahu
Indexer je podslužba podporující zdroj dat ve službě Azure AI Vyhledávač, která je vybavena interní logikou pro vzorkování dat, čtení a načítání dat a metadat a serializaci dat z nativních formátů do dokumentů JSON pro následný import.
Objekty blob ve službě Azure Storage se indexují pomocí indexeru objektů blob. Tento indexer můžete vyvolat pomocí příkazu Azure AI Vyhledávač ve službě Azure Storage, průvodce importem dat na webu Azure Portal, rozhraní REST API nebo .NET SDK. V kódu použijete tento indexer nastavením typu a poskytnutím informací o připojení, které zahrnují účet služby Azure Storage spolu s kontejnerem objektů blob. Můžete si podmnožit objekty blob vytvořením virtuálního adresáře, který pak lze předat jako parametr, nebo filtrováním podle přípony typu souboru.
Indexer "analyzuje dokument", otevře blob k prozkoumání obsahu. Po připojení ke zdroji dat je to první krok v pracovním postupu. Pro data typu blob se zde zjišťují PDF, dokumenty Office a další typy obsahu. Narušení dokumentu s extrakcí textu je zdarma. Pokud objekty blob obsahují obsah obrázku, obrázky se ignorují, ledaže přidáte obohacení AI. Standardní indexování se vztahuje pouze na textový obsah.
Indexer objektů blob Azure obsahuje konfigurační parametry a podporuje sledování změn, pokud podkladová data poskytují dostatečné informace. Další informace o základních funkcích najdete v části Indexování dat z Azure Blob Storage.
Podporované úrovně přístupu
Mezi úrovně přístupu k úložišti objektů blob patří horká, chladná, studená a archivní úroveň. Indexery můžou načítat objekty blob na horké, chladné a studené úrovni přístupu.
Podporované typy obsahu
Spuštěním indexeru objektů blob v kontejneru můžete extrahovat text a metadata z následujících typů obsahu pomocí jednoho dotazu:
- CSV (viz indexování CSV blobů)
- EML
- EPUB
- GZ
- jazyk HTML
- JSON (viz indexování JSON blobů)
- KML (XML pro geografické reprezentace)
- Markdown
- formáty systém systém Microsoft Office: DOCX/DOC/DOCM, XLSX/XLS/XLSM, PPTX/PPTM, MSG (e-maily Outlooku), XML (2003 i 2006 WORD XML)
- Formáty otevřených dokumentů: ODT, ODS, ODP
- soubor PDF
- Soubory ve formátu prostého textu (viz také indexování prostého textu)
- RTF
- jazyk XML
- ZIP
Řízení toho, které objekty blob jsou indexovány
Můžete určit, které objekty blob se indexují a které se přeskočí, podle typu souboru objektu blob nebo nastavením vlastností samotného objektu blob, což způsobí, že indexer je přeskočí.
Zahrňte konkrétní přípony souborů nastavením "indexedFileNameExtensions" na čárkami oddělený seznam přípon souborů (s úvodní tečkou). Vynechejte určité přípony souborů nastavením "excludedFileNameExtensions" na přípony, které by se měly přeskočit. Pokud je stejné rozšíření v obou seznamech, je vyloučené z indexování.
PUT /indexers/[indexer name]?api-version=2026-04-01
{
"parameters" : {
"configuration" : {
"indexedFileNameExtensions" : ".pdf, .docx",
"excludedFileNameExtensions" : ".png, .jpeg"
}
}
}
Přidejte metadata "skip" k blobu
Parametry konfigurace indexeru se vztahují na všechny objekty blob v kontejneru nebo složce. Někdy chcete řídit, jak jsou jednotlivé "bloby" indexovány.
Do objektů blob ve službě Blob Storage přidejte následující vlastnosti a hodnoty metadat. Když indexer na tuto vlastnost narazí, přeskočí objekt blob nebo jeho obsah při spuštění indexování.
Indexování metadat objektů blob
Běžným scénářem, který usnadňuje řazení objektů blob libovolného typu obsahu, je indexování vlastních metadat i systémových vlastností pro každý objekt blob. Tímto způsobem se informace pro všechny objekty blob indexují bez ohledu na typ dokumentu uloženého v indexu ve vyhledávací službě. Pomocí nového indexu pak můžete pokračovat v řazení, filtrování a fazetě napříč veškerým obsahem úložiště objektů blob.
Poznámka:
Značky indexu objektů blob jsou nativně indexovány službou Blob Storage a vystavené pro dotazování. Pokud atributy klíče a hodnoty objektů blob vyžadují funkce indexování a filtrování, měly by se místo metadat používat značky indexu objektů blob.
Další informace o indexu objektů blob najdete v tématu Správa a vyhledání dat ve službě Azure Blob Storage pomocí indexu objektů blob.
Vyhledávání obsahu objektu blob v indexu vyhledávání
Výstupem indexeru je vyhledávací index, který se používá k interaktivnímu zkoumání pomocí volného textu a filtrovaných dotazů v klientské aplikaci. Pro počáteční zkoumání a ověření obsahu doporučujeme začít s Průzkumníkem služby Search na webu Azure Portal, abyste prozkoumali strukturu dokumentů. V Průzkumníku služby Search můžete použít:
Trvalejším řešením je shromáždit vstupy dotazů a prezentovat odpověď jako výsledky hledání v klientské aplikaci.