Tipy pro rozšiřování AI ve službě Azure AI Vyhledávač

Poznámka:

Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.

Tento článek obsahuje tipy, které vám pomůžou začít s rozšiřováním AI a sadami dovedností používaných při indexování.

Tip 1: Začněte jednoduše a začněte malé

Průvodce importem dat na webu Azure Portal podporuje rozšiřování AI. Bez psaní kódu můžete vytvořit a prozkoumat všechny objekty používané v kanálu rozšiřování: index, indexer, zdroj dat a sadu dovedností.

Dalším způsobem, jak začít jednoduše, je vytvoření zdroje dat s pouhými několika dokumenty nebo řádky v tabulce, které představují dokumenty, které chcete indexovat. Malá datová sada je nejlepší způsob, jak zvýšit rychlost hledání a řešení problémů. Spusťte ukázkový soubor celým zpracovatelským řetězcem end-to-end a zkontrolujte, zda výsledky odpovídají vašim potřebám. Až budete s výsledky spokojeni, můžete do zdroje dat přidat další soubory.

Tip 2: Podívejte se, co funguje, i když dojde k nějakým chybám

Někdy malé selhání zastaví indexovací stroj v průběhu. Tato podmínka je v pořádku, pokud plánujete vyřešit problémy jeden po druhém. Můžete ale chtít ignorovat konkrétní typ chyby, aby indexer mohl pokračovat a zjistit, jaké toky skutečně fungují.

Pokud chcete ignorovat chyby během vývoje, nastavte maxFailedItems a maxFailedItemsPerBatch -1 jako součást definice indexeru.

{
  "parameters": {
    "maxFailedItems": -1,
    "maxFailedItemsPerBatch": -1
  }
}

Poznámka:

Osvědčeným postupem je nastavit maxFailedItems hodnotu a maxFailedItemsPerBatch hodnotu 0 pro produkční úlohy.

Tip 3: Řešení problémů pomocí ladicí relace

Ladicí sezení je vizuální editor, který zobrazuje graf závislostí souboru dovedností, vstupy a výstupy a definice. Načte jeden zdrojový dokument ze zdroje dat indexeru s aktuální konfigurací indexeru a sady dovedností. Poté můžete spustit celou sadu dovedností omezenou na daný dokument. V rámci ladicí relace můžete identifikovat a vyřešit chyby, ověřit změny a potvrdit změny v nadřazené sadě dovedností. Návod najdete v tématu Kurz: Ladicí relace.

Tip 4: Očekávaný obsah se nezobrazuje

Pokud chybí obsah, na portálu Azure zkontrolujte vynechané dokumenty. Na stránce vyhledávací služby otevřete Indexery, vyberte indexer a pak vyberte hodnotu Stav spuštění, abyste zobrazili podrobnosti o spuštění a chyby.

Pokud problém souvisí s velikostí souboru, může se zobrazit chyba typu "Název souboru objektu blob<" má velikost >bajtů velikosti< souboru, což překračuje maximální velikost pro extrakci dokumentů pro aktuální úroveň služby.> Další informace o limitech indexeru najdete v tématu Omezení služby.

Druhý důvod, proč se obsah nezobrazuje, může souviset s chybami mapování vstupu a výstupu. Například název cílového výstupu je "Lidé", ale název pole indexu je malé písmeno "people". Systém vrátí 201 zpráv o úspěchu pro celý kanál, takže si myslíte, že indexování bylo úspěšné, když je ve skutečnosti pole prázdné.

Tip 5: Rozšíření zpracování nad rámec maximální doby běhu

Analýza obrázků je pro i jednoduché případy výpočetně náročná, takže pokud jsou obrázky obzvláště velké nebo složité, doba zpracování může překročit maximální povolenou dobu.

U indexerů, které mají sady dovedností, je provádění sady dovedností u většiny vrstev omezené na 2 hodiny. Pokud se zpracování sady dovedností v daném období nedokončí, naplánujte spuštění indexeru každých pět minut, aby mohl pokračovat ve zpracování z posledního známého dobrého dokumentu.

Naplánované indexování bude pokračovat od posledního úspěšně indexovaného dokumentu. Při opakovaném rozvrhu může indexer zpracovávat backlog obrázků během několika hodin nebo dnů, dokud nebudou zpracovány všechny nezpracované obrazy. Další informace o syntaxi plánu najdete v tématu Plánování indexeru.

Poznámka:

Pokud naplánovaný indexer opakovaně selhává při zpracování téhož dokumentu, služba omezí četnost jeho spouštění, maximálně na jedno spuštění za 24 hodin, dokud nedojde k pokroku. Po opravě základního problému spusťte indexer na vyžádání. Pokud postupuje, indexer se vrátí do nakonfigurovaného intervalu. Pokud se indexer po úspěšném spuštění nevrátí do nakonfigurovaného plánu, přečtěte si nejčastější dotazy k chování plánování.

Tip 6: Zvýšení propustnosti indexování

Pro paralelní indexování distribuujte data do více kontejnerů nebo více virtuálních složek uvnitř stejného kontejneru. Pak vytvořte několik dvojic zdrojů dat a indexeru. Všechny indexery můžou používat stejnou sadu dovedností a zapisovat do stejného cílového vyhledávacího indexu, takže vaše vyhledávací aplikace nemusí o tomto dělení vědět.

Viz také