Co je zdroj znalostí?

Poznámka

Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.

Important

Na funkce, možnosti nebo vlastnosti označené jako (Preview) se nevztahuje smlouva o úrovni služeb, nejsou doporučené pro produkční úlohy a mohou se změnit nebo být omezeny dříve, než budou obecně k dispozici. Podmínky Azure AI Vyhledávač Preview platí pro všechny funkce ve verzi Preview, ať už jsou samostatné nebo součástí obecně dostupné funkce.

Zdroj znalostí je prostředek na nejvyšší úrovni ve službě Azure AI Vyhledávač, který definuje obsah používaný v kanálu pro agentní načítání. Každý zdroj znalostí je buď indexovaný, nebo vzdálený, což určuje, jak se obsah ingestuje, zpracovává a dotazuje. Zdroje znalostí jsou povinné součásti znalostní báze.

V jedné znalostní bázi můžete odkazovat na více zdrojů znalostí. Agentní vyhledávací engine se všech dotazuje v rámci jediného požadavku. Poddotazy se generují pro každý zdroj znalostí a nejrelevantnější výsledky jsou vráceny v odpovědi vyhledání.

Podporované zdroje znalostí

Azure AI Vyhledávač podporuje následující zdroje znalostí pro úlohy agentního vyhledávání.

Druh Description Indexované nebo vzdálené
Index vyhledávání Zabalí existující index. Indexované
Azure Blob Vygeneruje kanál zpracování indexeru z kontejneru blobů. Indexované
Azure SQL (Preview) Vygeneruje kanál indexeru z tabulky nebo zobrazení Azure SQL. Indexované
Soubor (náhled) Nahraje soubory přímo do Azure AI Vyhledávač. Indexované
OneLake Vygeneruje kanál zpracování indexeru z lakehouse. Indexované
Indexovaný SharePoint (verze Preview) Vygeneruje kanál pro indexer z webu SharePointu. Indexované
Vzdálený SharePoint (preview) Načte obsah z SharePoint. Vzdálený
Fabric Data Agent (Preview) Načte odpovědi a vložené zdroje z datového agenta Microsoft Fabric. Vzdálený
Fabric Ontologie (Preview) Načte odpovědi založené na entitách a relacích z Microsoft Fabric ontologie. Vzdálený
Server MCP (Preview) Načítá výsledky v reálném čase podporované nástroji z externího serveru MCP. Vzdálený
Work IQ (Preview) Získá poznatky o organizaci z Work IQ. Vzdálený
Web Načítá podkladová data v reálném čase ze služby Microsoft Bing. Vzdálený

Indexované zdroje znalostí

Indexovaný zdroj znalostí odkazuje na index vyhledávání, který splňuje kritéria pro agentní vyhledávání. Obsah se ingestuje do indexu před časem dotazu prostřednictvím jedné ze tří cest:

  • Přineste si vlastní index: Ke zabalení existujícího indexu ve vyhledávací službě použijte zdroj znalostí indexu vyhledávání.

  • Přímé nahrávání souborů: K nahrání souborů přímo do Azure AI Vyhledávač použijte zdroj znalostí souboru. Služba zpracovává soubory a ukládá extrahovaný obsah do generovaného indexu vyhledávání bez nutnosti externího úložiště nebo kanálu indexeru.

  • Automaticky generovaný kanál indexeru: Pro všechny ostatní indexované zdroje znalostí Azure AI Vyhledávač automaticky vytvoří úplný kanál indexeru z externího zdroje dat. To zahrnuje zdroj dat, sadu dovedností, indexer a index, který je naplněný a rozdělený na části.

Dotazy se spouštějí lokálně ve vaší vyhledávací službě pomocí fulltextových (klíčových), vektorových nebo hybridních dotazů.

Vzhledem k tomu, že indexovaný zdroj znalostí má podkladový vyhledávací index, mohou odkazy v odpovědi zahrnovat adresy URL citací generované službou (preview), které odkazují na příslušné dokumenty v indexu. Vzdálené zdroje znalostí nemají žádný záložní index, takže nevrací adresy URL citací.

Vzdálené zdroje znalostí

Vzdálený zdroj znalostí se připojuje přímo k externí platformě. Obsah se nikdy neingestuje do Azure AI Vyhledávač. Místo toho se načte v době dotazu prostřednictvím nativních rozhraní API jednotlivých platforem. Agentový vyhledávací engine provede volání rozhraní API a ve stejné odpovědi vrátí výsledky spolu s případnými indexovanými zdroji znalostí.

V závislosti na platformě se vzdálená připojení dostanou k obsahu přes veřejný internet (například Bing) nebo v rámci vašeho Microsoft tenanta (například SharePoint a Fabric).

Sjednocené hodnocení

U indexovaných i vzdálených zdrojů znalostí prochází veškerý načtený obsah přes stejný kanál řazení. Výsledky jsou ohodnoceny podle relevance, sloučeny napříč dotazy a před vrácením v odpovědi na vyhledání znovu seřazeny.

Práce se zdroji znalostí

Zdroje znalostí jsou nezávislé objekty, které vytváříte a spravujete odděleně od znalostních bází. Mějte na paměti následující skutečnosti:

  • Před vytvořením znalostní báze vytvořte zdroj znalostí. Znalostní báze odkazují na zdroje znalostí podle ID, takže zdroj znalostí musí existovat jako první.

  • Pokud chcete odstranit zdroj znalostí, nejprve aktualizujte nebo odstraňte všechny znalostní báze, které na něj odkazují. Pak můžete zdroj znalostí odstranit.

  • Zdroj znalostí a jeho znalostní báze musí existovat ve stejné vyhledávací službě.

Vytváření zdrojů znalostí

Podpora vytváření na portálu Azure, portálu Microsoft Foundry, rozhraní REST API a Sady Azure SDK se liší podle druhu zdroje znalostí. Pokyny pro jednotlivé druhy najdete v odkazech v podporovaných zdrojích znalostí.

Ingestování popisků citlivosti (Preview)

U objektů blob a indexovaných zdrojů znalostí OneLake a SharePoint můžete načítat popisky citlivosti Microsoft Purview nastavením ingestionPermissionOptions tak, aby zahrnovalo sensitivityLabel. Před nastavením této hodnoty postupujte podle všech požadavků. Po synchronizaci s indexem se štítky zobrazují v odpovědích operace načtení a používají se k vynucení přístupu na úrovni dokumentu při zpracování dotazu. Další informace najdete v tématu Vynucení oprávnění v době dotazu (Preview).

Pokud váš indexovaný zdroj znalostí používá index rozdělený na bloky, například s integrovanou vektorizací nebo vlastní dovedností Text Split, musíte také namapovat popisek citlivosti na řádek každého bloku prostřednictvím projekcí indexu v sadě dovedností. Jinak se reference na úrovni chunků v odpovědích operace retrieve nevrátí, pokud mají ve zdrojovém dokumentu popisky.

Zobrazit obrázky vložené v dokumentu (preview)

U zdrojů znalostí typu blob, indexovaného OneLake a indexovaného SharePointu můžete v assetStore zdroje znalostí nakonfigurovat ingestionParameters, aby se zachovaly obrázky vložené ve vašich zdrojových dokumentech. Když povolíte také obsluhu obrázků ve znalostní bázi, akce načtení vloží tyto obrázky do výzvy k syntéze odpovědí, aby LLM mohl zdůvodnět diagramy, grafy a extrahovaný obsah obrázku. Další informace najdete v tématu Zobrazení obrázků vložených do dokumentu v agentním vyhledávání (verze Preview).

Nekonfigurujte assetStore a ingestionPermissionOptions na stejném zdroji znalostí. Poskytování obrázků není podporováno, když je nakonfigurováno ingestionPermissionOptions.

Omezit příjem dat na privátní síť (Preview)

Blob, indexovaný SharePoint a indexovaný Azure SQL zdroje znalostí podporují spuštění privátního indexeru. U objektů blob a Azure SQL můžou schválené sdílené privátní odkazy chránit zdrojové připojení a Azure závislosti. SharePoint Online není cílem sdíleného privátního propojení, takže privátní režim se vztahuje pouze na chráněné závislosti Azure.

V současné době se privátní synchronizace nepodporuje pro indexované zdroje znalostí OneLake.

Použití automatických analyzátorů pro jednotlivé jazyky (Preview)

Blob, indexované zdroje znalostí OneLake a indexované zdroje znalostí SharePointu podporují automatické analyzátory pro konkrétní jazyky pro vícejazyčný obsah. Pokud je tato možnost povolená, Azure AI Vyhledávač rozpozná jazyk jednotlivých zdrojových dokumentů a automaticky použije odpovídající analyzátor jazyka Microsoft. V definici zdroje znalostí ani v dotazu nezadáte analyzátor.

Použití zdrojů znalostí

Po vytvoření zdroje znalostí na něj ve znalostní bázi odkazujte. Znalostní báze určuje, na které zdroje znalostí se má dotazovat. Následující části popisují možnosti řízení, které zdroje jsou zahrnuty a jak modul mezi nimi vybírá.

Vždy se dotazujte na znalostní zdroj

Nastavte v definici zdroje znalostí alwaysQuery na true, aby byl zahrnut do každého dotazu bez ohledu na míru úsilí věnovaného uvažování při načítání.

Použít úsilí uvažování při vyhledávání pro řízení využití LLM (ve verzi Preview)

Míra uvažování při vyhledávání určuje, kolik výpočetních prostředků LLM se použije pro každý dotaz. Ne všechna řešení využívají plánování dotazů LLM. Pokud jsou prioritou jednoduchost a rychlost, použijte minimal úsilí k obejití zpracování pomocí LLM. Při úrovni úsilí low a medium LLM plánuje a vybírá, které zdroje znalostí bude dotazovat, přičemž medium přidává iterativní průchod pro dosažení hlubších výsledků. Další informace o jednotlivých úrovních najdete v článku Nastavení míry úsilí při uvažování pro načítání (Preview).

Následující faktory ovlivňují výběr při úsilí low a medium:

  • Zdroj znalostí name.

  • Index description (pro indexované zdroje znalostí)

  • retrievalInstructions, které je zadáno v definici znalostní báze nebo v akci načtení. Pokyny pro vyhledávání určují, které zdroje znalostí LLM vybere nebo vynechá. Fungují jako výzva: můžete zadat stručnost, tón a formátování.