Indexování dat ze služby Azure Blob Storage

Poznámka:

Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.

Important

Tyto funkce podporují připojení k jiným služby Microsoft a službám třetích stran. Použití těchto služeb podléhá vlastním podmínkám jednotlivých služeb a může vést ke zpracování nebo ukládání dat mimo hranici souladu Azure, stejně jako k toku dat do hranice souladu Azure.

Je vaší zodpovědností spravovat, jestli budou vaše data přetékat mimo dodržování předpisů a geografické hranice vaší organizace a případné související důsledky a že se zřídí příslušná oprávnění, hranice a schválení.

Zodpovídáte za pečlivou kontrolu a testování aplikací, které vytváříte v kontextu konkrétních případů použití, a za veškerá vhodná rozhodnutí a přizpůsobení. To zahrnuje implementaci vlastního zodpovědného zmírnění rizik umělé inteligence, jako jsou metaprompty, filtry obsahu nebo jiné bezpečnostní systémy, a zajištění toho, aby vaše aplikace splňovaly příslušné standardy kvality, spolehlivosti, zabezpečení a důvěryhodnosti. Další informace najdete v informacích o transparentnosti Azure AI Vyhledávač.

Indexer objektů blob importuje obsah z Azure Blob Storage a umožňuje prohledávat v Azure AI Vyhledávač. Indexer přijímá objekty blob v jednom kontejneru jako vstup. Výstupem je vyhledávací index, který ukládá prohledávatelný obsah a metadata do jednotlivých polí.

Tento článek používá rozhraní REST API vyhledávací služby k předvedení konfigurace a spuštění indexeru. Můžete ale také použít:

Poznámka:

Azure AI Vyhledávač může během indexování ingestovat obor řízení přístupu na základě role (RBAC) a přenést tato oprávnění do indexovaného obsahu ve vyhledávacím indexu. Další informace najdete v článku Použití indexeru objektů blob nebo zdroje znalostí k načítání metadat rozsahů RBAC (preview).

Požadavky

  • Azure Blob Storage, standardní výkon (pro obecné účely v2).

  • Úrovně přístupu zahrnují horkou, studenou, studenou a archivní úroveň. Indexery můžou načítat objekty blob na horké, chladné a studené úrovni přístupu.

  • Bloby poskytují textový obsah a metadata. Pokud objekty blob obsahují binární obsah nebo nestrukturovaný text, zvažte přidání rozšíření AI pro zpracování obrázků a přirozeného jazyka. Obsah objektu blob nemůže překročit limity indexeru pro vaši cenovou úroveň.

    Omezení indexeru objektů blob pokrývají maximální velikost objektu blob a počet znaků, které Azure AI Vyhledávač extrahují z objektu blob. Pokud používáte sadu dovedností, platí limit jednotlivých dovedností nebo služeb samostatně po prolomení dokumentu.

  • Podporovaná konfigurace sítě a přístup k datům. Minimálně potřebujete oprávnění ke čtení ve službě Azure Storage. Připojovací řetězec úložiště, které obsahuje přístupový klíč, poskytuje přístup pro čtení k obsahu úložiště. Pokud místo toho používáte přihlášení a role Microsoft Entra, ujistěte se, že spravovaná identita vyhledávací služby má oprávnění Čtenář dat objektů blob služby Storage.

    Ve výchozím nastavení přijímá vyhledávání i úložiště požadavky z veřejných IP adres. Pokud zabezpečení sítě není bezprostředním problémem, stačí vám pro indexaci dat objektů blob pouze připojovací řetězec a oprávnění ke čtení. Až budete připraveni přidat ochranu sítě, přečtěte si téma Přístup indexeru k obsahu chráněnému funkcemi zabezpečení sítě Azure, kde najdete pokyny k přístupu k datům.

  • Pomocí klienta REST formulujte volání REST podobně jako volání, která jsou uvedená v tomto článku.

Podporované úlohy

Tento indexer můžete použít pro následující úlohy:

Podporované formáty dokumentů

Indexer objektů blob dokáže extrahovat text z následujících formátů dokumentu:

  • CSV (viz indexování CSV blobů)
  • EML
  • EPUB
  • GZ
  • jazyk HTML
  • JSON (viz indexování blobů JSON)
  • KML (XML pro geografické reprezentace)
  • Markdown
  • formáty systém systém Microsoft Office: DOCX/DOC/DOCM, XLSX/XLS/XLSM, PPTX/PPTM, MSG (e-maily Outlooku), XML (2003 i 2006 WORD XML)
  • Formáty otevřených dokumentů: ODT, ODS, ODP
  • soubor PDF
  • Soubory ve formátu prostého textu (viz také indexování prostého textu)
  • RTF
  • jazyk XML
  • ZIP

Určení objektů blob, které se mají indexovat

Před nastavením indexování zkontrolujte zdrojová data a zjistěte, jestli potřebujete provést nějaké změny. Indexer může indexovat obsah z jednoho kontejneru najednou. Indexer ve výchozím nastavení zpracovává všechny objekty blob v kontejneru. Pro selektivní zpracování máte několik možností:

  • Umístěte objekty blob do virtuální složky. Definice zdroje dat indexeru query obsahuje parametr, který může převzít virtuální složku. Pokud zadáte virtuální složku, indexer indexuje pouze objekty blob v této složce.

  • Zahrnout nebo vyloučit objekty blob podle typu souboru Seznam podporovaných formátů dokumentů vám může pomoct určit, které objekty blob se mají vyloučit. Můžete například chtít vyloučit obrázky nebo zvukové soubory, které neposkytují prohledávatelný text. Tuto funkci můžete řídit prostřednictvím nastavení konfigurace v indexeru.

  • Zahrnout nebo vyloučit libovolné objekty blob. Pokud chcete přeskočit konkrétní objekt blob, přidejte do objektů blob v Azure Blob Storage následující vlastnosti a hodnoty metadat. Když indexer na tuto vlastnost narazí, přeskočí objekt blob nebo jeho obsah při spuštění indexování.

    Název vlastnosti Hodnota vlastnosti Explanation
    AzureSearch_Skip true Dává indexeru objektů blob pokyn, aby objekt blob úplně přeskočil. Indexer se nepokouší extrahovat metadata ani obsah. Tato vlastnost je užitečná, když opakovaně selže konkrétní blob a přeruší proces indexování.
    AzureSearch_SkipContent true Indexer přeskočí obsah a extrahuje pouze metadata. Tato vlastnost je ekvivalentní "dataToExtract": "allMetadata" nastavení popsanému v nastavení konfigurace, ale je vymezená na konkrétní objekt blob.

Pokud nenastavíte kritéria zahrnutí nebo vyloučení, indexer hlásí neoprávněný blob jako chybu a pokračuje dál. Pokud dojde k dostatečným chybám, zpracování se může zastavit. V nastavení konfigurace indexeru můžete zadat odolnost proti chybám.

Indexer obvykle vytvoří jeden prohledávací dokument na objekt blob, kde se textový obsah a metadata zachytí jako prohledávatelná pole v indexu. Pokud jsou objekty blob celé soubory, můžete je potenciálně analyzovat do více vyhledávacích dokumentů. Můžete například analyzovat řádky v souboru CSV a vytvořit jeden hledaný dokument na řádek.

Složený nebo vložený dokument (například archiv ZIP, wordový dokument s vloženým outlookovým e-mailem obsahujícím přílohy nebo přílohy. Soubor MSG s přílohami) je také indexován jako jeden dokument. Například všechny obrázky extrahované z příloh souboru .MSG jsou vráceny v poli normalized_images. Pokud máte obrázky, zvažte přidání obohacení AI, abyste z tohoto obsahu získali další vyhledávací nástroj.

Indexer extrahuje textový obsah dokumentu do pole řetězce s názvem content. Můžete také extrahovat standardní a uživatelsky definovaná metadata.

Indexování metadat objektů blob

Metadata objektů blob můžete indexovat společně s obsahem. Indexer extrahuje vlastnosti metadat a ukládá je do polí indexu, což je užitečné při vytváření filtrů a dotazů.

Definujte pole v indexu vyhledávání pro vlastnosti metadat, které chcete zachytit. Nemusíte definovat každou dostupnou standardní nebo vlastní vlastnost metadat. Stačí zachytit vlastnosti, které potřebujete pro vaši aplikaci.

V současné době tento indexer nepodporuje indexování značek indexu blobů.

Important

Indexer naplní pouze pole metadat, která jsou již definována v indexu vyhledávání. Tento požadavek platí pro standardní metadata blobů i vlastní metadata. Pokud pole není definované, hodnota metadat se během indexování extrahuje, ale bezobslužně se zahodí, takže se ve výsledcích hledání nezobrazí. Toto je nejběžnější zdroj polí metadat null ve výsledcích hledání. Další informace naleznete v tématu Pole metadat jsou ve výsledcích hledání null.

Standardní vlastnosti metadat objektů blob

Pro standardní metadata objektu blob definujte v indexu pole pomocí stejných názvů s podtržítky. Podrobné příklady definic polí najdete v tématu Přidání vyhledávacích polí do indexu.

Informace o konfiguraci indexeru dataToExtract včetně nastavení, které řídí, která metadata se mají extrahovat, najdete v tématu Konfigurace a spuštění indexeru objektů blob.

Indexer rozpozná a může mapovat tyto standardní vlastnosti metadat, pokud definujete odpovídající pole v indexu:

  • metadata_storage_name (Edm.String) je název souboru objektu blob. Pokud máte například objekt blob /my-container/my-folder/subfolder/resume.pdf, hodnota tohoto pole je resume.pdf.

  • metadata_storage_path (Edm.String) je úplný identifikátor URI blobu včetně účtu úložiště. Například: https://myaccount.blob.core.windows.net/my-container/my-folder/subfolder/resume.pdf. Tuto vlastnost použijte k zahrnutí adres URL blobů do výsledků hledání pro účely navigace nebo atribuce zdroje.

  • metadata_storage_content_type (Edm.String) je typ obsahu určený kódem, který jste použili k nahrání objektu blob. Například: application/octet-stream.

  • metadata_storage_last_modified (Edm.DateTimeOffset) je časové razítko poslední změny objektu blob. Azure AI Vyhledávač toto časové razítko používá k identifikaci změněných objektů blob a zabránění přeindexování všeho po počátečním indexování.

  • metadata_storage_size (Edm.Int64) je velikost objektu blob v bajtech.

  • metadata_storage_content_md5 (Edm.String) je hodnota hash MD5 obsahu objektu blob, pokud je k dispozici.

  • metadata_storage_sas_token (Edm.String) je dočasný token SAS, který vlastní dovednosti můžou použít k získání přístupu k objektu blob. Neukládejte tento token pro pozdější použití, protože jeho platnost může vypršet.

Vlastní metadata a metadata specifická pro obsah

Pro vlastní nebo uživatelem definovaná metadata objektu blob definujte pole se stejným názvem jako klíč metadat objektu blobu. Pokud například objekty blob mají klíč Sensitivity metadat s hodnotou High, definujte pole s názvem Sensitivity typu Edm.String v indexu.

Můžete také reprezentovat vlastnosti metadat specifické pro formát dokumentu objektů blob, které indexujete. Další informace naleznete v tématu Vlastnosti metadat obsahu.

Definování zdroje dat

Definice zdroje dat určuje data, která se mají indexovat, přihlašovací údaje a zásady pro identifikaci změn v datech. Zdroj dat je definován jako nezávislý prostředek, aby ho mohl používat více indexerů.

  1. Vytvořte nebo aktualizujte zdroj dat a nastavte jeho definici:

    {
        "name" : "my-blob-datasource",
        "type" : "azureblob",
        "credentials" : { "connectionString" : "DefaultEndpointsProtocol=https;AccountName=<account name>;AccountKey=<account key>;" },
        "container" : { "name" : "my-container", "query" : "<optional-virtual-directory-name>" }
    }
    
  2. Nastaveno type na azureblob (povinné).

  3. Nastavte credentials na připojovací řetězec služby Azure Storage. Následující část popisuje podporované formáty.

  4. Nastavte blobový kontejner container a použijte query k určení všech podsložek.

Zásady měkkého odstranění můžete zahrnout také do definice zdroje dat, pokud chcete, aby indexer odstranil vyhledávací dokument, když je zdrojový dokument označen příznakem pro odstranění.

Podporované přihlašovací údaje a připojovací řetězec

Indexery se mohou připojit k blob kontejneru pomocí těchto připojení.

Připojovací řetězec účtu úložiště s úplným přístupem
{ "connectionString" : "DefaultEndpointsProtocol=https;AccountName=<your storage account>;AccountKey=<your account key>;" }
Připojovací řetězec můžete získat ze stránky účtu úložiště na webu Azure Portal výběrem přístupových klíčů v levém podokně. Nezapomeňte vybrat úplný připojovací řetězec a ne jenom klíč.
Připojovací řetězec spravované identity
{ "connectionString" : "ResourceId=/subscriptions/<your subscription ID>/resourceGroups/<your resource group name>/providers/Microsoft.Storage/storageAccounts/<your storage account name>/;" }
Připojovací řetězec nevyžaduje klíč účtu, ale musíte mít již dříve nakonfigurovanou vyhledávací službu pro připojení pomocí spravované identity.
Připojovací řetězec sdíleného přístupového podpisu (SAS) účtu úložiště
{ "connectionString" : "BlobEndpoint=https://<your account>.blob.core.windows.net/;SharedAccessSignature=?sv=2016-05-31&sig=<the signature>&spr=https&se=<the validity end time>&srt=co&ss=b&sp=rl;" }
SAS by měl mít oprávnění k seznamu a čtení pro kontejnery a blobové objekty (v tomto případě bloby).
Sdílený přístupový podpis kontejneru
{ "connectionString" : "ContainerSharedAccessUri=https://<your storage account>.blob.core.windows.net/<container name>?sv=2016-05-31&sr=c&sig=<the signature>&se=<the validity end time>&sp=rl;" }
Sdílený přístupový podpis by měl mít v kontejneru oprávnění k zobrazení seznamu a čtení. Další informace najdete v tématu Udělení omezeného přístupu k prostředkům Azure Storage pomocí sdílených přístupových podpisů (SAS).

Poznámka:

Pokud používáte přihlašovací údaje SAS, musíte přihlašovací údaje ke zdroji dat pravidelně aktualizovat obnovenými podpisy, aby se zabránilo jejich vypršení platnosti. Pokud vyprší platnost přihlašovacích údajů SAS, indexer selže s chybovou zprávou typu "Přihlašovací údaje zadané v připojovacím řetězci jsou neplatné nebo vypršela jejich platnost".

Přidání vyhledávacích polí do indexu

Do indexu vyhledávání přidejte pole pro příjem obsahu a metadat objektů blob Azure.

  1. Vytvořte nebo aktualizujte index a definujte vyhledávací pole, která ukládají obsah a metadata objektů blob:

    POST https://[service name].search.windows.net/indexes?api-version=2026-04-01
    {
        "name" : "my-search-index",
        "fields": [
            { "name": "ID", "type": "Edm.String", "key": true, "searchable": false },
            { "name": "content", "type": "Edm.String", "searchable": true, "filterable": false },
            { "name": "metadata_storage_name", "type": "Edm.String", "searchable": false, "filterable": true, "sortable": true  },
            { "name": "metadata_storage_size", "type": "Edm.Int64", "searchable": false, "filterable": true, "sortable": true  },
            { "name": "metadata_storage_content_type", "type": "Edm.String", "searchable": false, "filterable": true, "sortable": true },        
        ]
    }
    
  2. Vytvoření pole klíče dokumentu ("key": true). Nejlepšími kandidáty pro obsah objektů blob jsou vlastnosti metadat.

    • metadata_storage_path (výchozí) je úplná cesta k objektu nebo souboru. Pole klíče (ID v tomto příkladu) se naplní hodnotami z metadata_storage_path, protože se jedná o výchozí hodnotu.

    • metadata_storage_name je použitelný pouze v případě, že jsou názvy jedinečné. Pokud chcete toto pole použít jako klíč, přejděte "key": true na tuto definici pole.

    • Vlastní vlastnost metadat, kterou přidáte do objektů blob. Tato možnost vyžaduje, aby proces nahrání objektu blob přidal tuto vlastnost metadat do všech objektů blob. Vzhledem k tomu, že klíč je požadovaná vlastnost, všechny objekty blob, kterým chybí hodnota, se nedaří indexovat. Pokud jako klíč použijete vlastní vlastnost metadat, vyhněte se změnám této vlastnosti. Indexery při změně klíčové vlastnosti přidají duplicitní dokumenty pro stejný objekt blob.

    Vlastnosti metadat často obsahují znaky, například / a -, které jsou neplatné pro klíče dokumentu. Indexer však automaticky zakóduje vlastnost klíčových metadat bez nutnosti konfigurace nebo mapování polí.

  3. Přidejte pole pro uložení extrahovaného content textu z každého souboru prostřednictvím vlastnosti content objektu blob. Tento název nemusíte používat, ale jeho použitím můžete využít implicitní mapování polí.

  4. Přidejte pole pro standardní vlastnosti metadat. Indexer může číst vlastní vlastnosti metadat, standardní vlastnosti metadat a vlastnosti metadat specifických pro obsah.

Nakonfigurujte a spusťte indexer objektů blob

Po vytvoření indexu a zdroje dat vytvořte indexer. Konfigurace indexeru určuje vstupy, parametry a vlastnosti, které řídí chování modulu runtime. Můžete také určit, které části objektu blob se mají indexovat.

  1. Vytvořte nebo aktualizujte indexer tak, že ho pojmenujte a odkazujete na zdroj dat a cílový index:

    POST https://[service name].search.windows.net/indexers?api-version=2026-04-01
    {
      "name" : "my-blob-indexer",
      "dataSourceName" : "my-blob-datasource",
      "targetIndexName" : "my-search-index",
      "parameters": {
          "batchSize": null,
          "maxFailedItems": null,
          "maxFailedItemsPerBatch": null,
          "configuration": {
              "indexedFileNameExtensions" : ".pdf,.docx",
              "excludedFileNameExtensions" : ".png,.jpeg",
              "dataToExtract": "contentAndMetadata",
              "parsingMode": "default"
          }
      },
      "schedule" : { },
      "fieldMappings" : [ ]
    }
    
  2. Nastavte batchSize v případě, že výchozí nastavení (10 dokumentů) buď nedostatečně využívá, nebo přetěžuje dostupné prostředky. Výchozí velikosti dávek jsou specifické pro zdroj dat. Indexování blobů nastavuje dávkovou velikost na 10 dokumentů kvůli větší průměrné velikosti dokumentu.

  3. Pod configuration určete, které objekty blob se indexují na základě typu souboru, nebo je nechte nespecifikované, aby se získaly všechny objekty blob.

    Zadejte indexedFileNameExtensionsčárkami oddělený seznam přípon souborů (s úvodní tečkou). excludedFileNameExtensions Stejným způsobem označte, která rozšíření má indexer přeskočit. Pokud je stejné rozšíření v obou seznamech, indexer ho vyloučí z indexování.

  4. Nastavte configuration pod dataToExtract pro ovládání, které části objektů blob se indexují:

  5. V části configuration nastavte parsingMode. Výchozí režim analýzy je jeden vyhledávací dokument pro každý objekt blob. Pokud jsou objekty blob prostým textem, můžete dosáhnout lepšího výkonu přepnutím na analýzu prostého textu . Pokud potřebujete podrobnější analýzu, která mapuje objekty blob na více vyhledávacích dokumentů, zadejte jiný režim. Analýza typu 1:N je podporovaná pro objekty blob, které se skládají z:

  6. Určete mapování polí, pokud existují rozdíly v názvu nebo typu pole nebo pokud potřebujete v indexu vyhledávání více verzí zdrojového pole.

    Při indexování objektů blob můžete často vynechat mapování polí, protože indexer má integrovanou podporu mapování content vlastností metadat a podobně pojmenovaných a zadaných polí v indexu. U vlastností metadat indexer automaticky nahradí pomlčky - podtržítky v indexu vyhledávání.

  7. Další informace o dalších vlastnostech najdete v tématu Vytvoření indexeru . Úplný seznam popisů parametrů najdete v rozhraní REST API.

Indexer se spustí automaticky při jeho vytvoření. Tuto akci můžete zabránit nastavením disabled na hodnotu true. Pokud chcete řídit provádění indexeru, spusťte indexer na vyžádání nebo ho umístěte do plánu.

Indexování dat z několika kontejnerů objektů blob Azure do jednoho indexu

Nezapomeňte, že indexer může indexovat pouze data z jednoho kontejneru. Pokud potřebujete indexovat data z více kontejnerů a konsolidovat je do jednoho indexu vyhledávání AI, nakonfigurujte několik indexerů, které odkazují na stejný index. Mějte na paměti maximální počet indexerů dostupných na skladovou položku.

Můžete například použít dva indexery k načtení dat ze dvou různých zdrojů dat s názvem my-blob-datasource1 a my-blob-datasource2. Každý zdroj dat odkazuje na samostatný kontejner objektů blob Azure, ale oba směrují na stejný index s názvem my-search-index.

První příklad definice indexeru:

POST https://[service name].search.windows.net/indexers?api-version=2026-04-01
{
  "name" : "my-blob-indexer1",
  "dataSourceName" : "my-blob-datasource1",
  "targetIndexName" : "my-search-index",
  "parameters": {
      "batchSize": null,
      "maxFailedItems": null,
      "maxFailedItemsPerBatch": null,
      "configuration": {
          "indexedFileNameExtensions" : ".pdf,.docx",
          "excludedFileNameExtensions" : ".png,.jpeg",
          "dataToExtract": "contentAndMetadata",
          "parsingMode": "default"
      }
  },
  "schedule" : { },
  "fieldMappings" : [ ]
}

Druhá definice indexeru, která se spouští v paralelním příkladu:

POST https://[service name].search.windows.net/indexers?api-version=2026-04-01
{
  "name" : "my-blob-indexer2",
  "dataSourceName" : "my-blob-datasource2",
  "targetIndexName" : "my-search-index",
  "parameters": {
      "batchSize": null,
      "maxFailedItems": null,
      "maxFailedItemsPerBatch": null,
      "configuration": {
          "indexedFileNameExtensions" : ".pdf,.docx",
          "excludedFileNameExtensions" : ".png,.jpeg",
          "dataToExtract": "contentAndMetadata",
          "parsingMode": "default"
      }
  },
  "schedule" : { },
  "fieldMappings" : [ ]
}

Kontrola stavu indexeru

Pokud chcete monitorovat stav indexeru a historii spuštění, odešlete žádost o získání stavu indexeru:

GET https://myservice.search.windows.net/indexers/myindexer/status?api-version=2026-04-01
  Content-Type: application/json  
  api-key: [admin key]

Odpověď zahrnuje stav a počet zpracovaných položek. Měl by vypadat podobně jako v následujícím příkladu:

    {
        "status":"running",
        "lastResult": {
            "status":"success",
            "errorMessage":null,
            "startTime":"2022-02-21T00:23:24.957Z",
            "endTime":"2022-02-21T00:36:47.752Z",
            "errors":[],
            "itemsProcessed":1599501,
            "itemsFailed":0,
            "initialTrackingState":null,
            "finalTrackingState":null
        },
        "executionHistory":
        [
            {
                "status":"success",
                "errorMessage":null,
                "startTime":"2022-02-21T00:23:24.957Z",
                "endTime":"2022-02-21T00:36:47.752Z",
                "errors":[],
                "itemsProcessed":1599501,
                "itemsFailed":0,
                "initialTrackingState":null,
                "finalTrackingState":null
            },
            ... earlier history items
        ]
    }

Historie provedení obsahuje až 50 z nejnověji dokončených provedení. Položky jsou seřazené v obráceném chronologickém pořadí, takže poslední provedení přichází jako první.

Troubleshooting

V této části můžete diagnostikovat chybějící hodnoty metadat a běžné chyby indexování objektů blob.

Pole metadat mají ve výsledcích hledání hodnotu null.

Pokud se ve výsledcích hledání zobrazují hodnoty null nebo prázdné hodnoty pro pole metadat, použijte tento kontrolní seznam:

  1. Ověřte, že pole ve schématu indexu existuje: Zkontrolujte, že jste definovali pole pro každou vlastnost metadat, kterou chcete zachytit. Spusťte na indexu požadavek GET, abyste potvrdili, že je pole k dispozici.

  2. Použijte správný název pole: Pro standardní vlastnosti objektu blob použijte podtržítko, například metadata_storage_path místo metadata-storage-path. U vlastních metadat musí název pole přesně odpovídat klíči metadat objektu blob.

  3. Ověřte, že indexer správně nastavil dataToExtract :

    • contentAndMetadata (výchozí) extrahuje jak obsah, tak standardní i vlastní metadata.
    • storageMetadata extrahuje pouze standardní vlastnosti objektu blob a vlastní metadata.
    • allMetadata extrahuje standardní vlastnosti a metadata specifická pro obsah.

    Zkontrolujte konfiguraci indexeru a ujistěte se, že nastavení odpovídá vašemu záměru.

  4. Po aktualizacích schématu znovu spusťte indexer: Pokud jste do indexu přidali nové pole, spusťte indexer znovu, aby se dokumenty zpracovávaly s aktualizovaným schématem. Před naplněním nového pole může být nutné znovu zpracovat existující dokumenty.

  5. Zkontrolujte historii provádění indexeru: Přejděte do indexeru na portálu Azure nebo pomocí rozhraní REST API (Get Indexer Status) zobrazte podrobnosti o spuštění a všechny chybové zprávy.

Selhání indexeru a nepodporované typy obsahu

Indexer objektů blob se ve výchozím nastavení zastaví, jakmile narazí na objekt blob s nepodporovaným typem obsahu, jako je zvukový soubor. Pomocí parametru excludedFileNameExtensions můžete přeskočit určité typy obsahu.

Pokud chcete, aby indexování pokračovalo, když některé dokumenty selžou, upravte následující parametry a pak prozkoumejte jednotlivé dokumenty později. Další informace najdete v tématu Průvodce odstraňováním potíží s indexerem a chybami a upozorněními indexeru.

Pokud dojde k chybám, pět parametrů indexeru řídí odpověď indexeru:

PUT /indexers/[indexer name]?api-version=2026-04-01
{
  "parameters" : { 
    "maxFailedItems" : 10, 
    "maxFailedItemsPerBatch" : 10,
    "configuration" : { 
        "failOnUnsupportedContentType" : false, 
        "failOnUnprocessableDocument" : false,
        "indexStorageMetadataOnlyForOversizedDocuments": false
      }
    }
}
Parameter Platné hodnoty Description
maxFailedItems -1, null nebo 0, kladné celé číslo Pokračujte v indexování, pokud k chybám dochází v jakémkoli okamžiku zpracování, a to buď při analýze objektů blob, nebo při přidávání dokumentů do indexu. Nastavte tuto vlastnost na počet přijatelných selhání. Hodnota -1 umožňuje zpracování bez ohledu na počet výskytů chyb. V opačném případě je hodnota kladné celé číslo.
maxFailedItemsPerBatch -1, null nebo 0, kladné celé číslo Stejné jako výše, ale používá se k dávkovému indexování.
failOnUnsupportedContentType pravda nebo lež Pokud indexer nemůže určit typ obsahu, zvolte, zda v úloze pokračovat nebo ji ukončit.
failOnUnprocessableDocument pravda nebo lež Pokud indexer nemůže zpracovat dokument podporovaného typu obsahu, určete, jestli chcete pokračovat nebo selhat.
indexStorageMetadataOnlyForOversizedDocuments pravda nebo lež Příliš velké soubory blob se ve výchozím nastavení považují za chyby. Pokud tento parametr nastavíte na hodnotu true, indexer se pokusí indexovat jeho metadata, i když obsah nelze indexovat. Omezení velikosti objektu blob najdete v tématu Omezení služby.