Indexování dat ze služby Azure Files (ve verzi Preview)

Note

Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.

Důležité

Na funkce, možnosti nebo vlastnosti označené jako (Preview) se nevztahuje smlouva o úrovni služeb, nejsou doporučené pro produkční úlohy a mohou se změnit nebo být omezeny dříve, než budou obecně k dispozici. Podmínky Azure AI Vyhledávač Preview platí pro všechny funkce ve verzi Preview, ať už jsou samostatné nebo součástí obecně dostupné funkce.

Důležité

Tyto funkce podporují připojení k jiným služby Microsoft a službám třetích stran. Použití těchto služeb podléhá vlastním podmínkám jednotlivých služeb a může vést ke zpracování nebo ukládání dat mimo hranici souladu Azure, stejně jako k toku dat do hranice souladu Azure.

Je vaší zodpovědností spravovat, jestli budou vaše data přetékat mimo dodržování předpisů a geografické hranice vaší organizace a případné související důsledky a že se zřídí příslušná oprávnění, hranice a schválení.

Zodpovídáte za pečlivou kontrolu a testování aplikací, které vytváříte v kontextu konkrétních případů použití, a za veškerá vhodná rozhodnutí a přizpůsobení. To zahrnuje implementaci vlastního zodpovědného zmírnění rizik umělé inteligence, jako jsou metaprompty, filtry obsahu nebo jiné bezpečnostní systémy, a zajištění toho, aby vaše aplikace splňovaly příslušné standardy kvality, spolehlivosti, zabezpečení a důvěryhodnosti. Další informace najdete v informacích o transparentnosti Azure AI Vyhledávač.

Indexer Azure Files (Preview) importuje obsah ze sdílené složky do indexu Azure AI Vyhledávač. Vstupy indexeru jsou vaše soubory v jedné sdílené složce. Výstup je index vyhledávání s prohledávatelným obsahem a metadaty uloženými v jednotlivých polích.

Ke konfiguraci a spuštění indexeru můžete použít:

Požadavky

Podporované úlohy

Tento indexer můžete použít pro následující úlohy:

Podporované formáty dokumentů

Indexer Azure Files může extrahovat text z následujících formátů dokumentu:

Jak se indexují Azure Files

Ve výchozím nastavení se většina souborů indexuje jako jeden vyhledávací dokument v indexu, včetně souborů se strukturovaným obsahem, jako je JSON nebo CSV, které se indexují jako jeden blok textu.

Složený nebo vložený dokument (například archiv ZIP, Word dokument s vloženým Outlook e-mailem obsahujícím přílohy nebo . Soubor MSG s přílohami) je také indexován jako jeden dokument. Například všechny obrázky extrahované z příloh souboru .MSG budou vráceny v poli normalized_images. Pokud máte obrázky, zvažte přidání obohacení AI, aby se zvýšila využitelnost vyhledávání v tomto obsahu.

Textový obsah dokumentu se extrahuje do textového pole s názvem "content". Můžete také extrahovat standardní a uživatelsky definovaná metadata.

Definování zdroje dat

Definice zdroje dat určuje data, která se mají indexovat, přihlašovací údaje a zásady pro identifikaci změn v datech. Zdroj dat je definován jako nezávislý prostředek, aby ho mohl používat více indexerů.

Pro typ můžete použít verzi 2020-06-30-preview nebo novější: "azurefile". Doporučujeme nejnovější rozhraní API ve verzi Preview.

  1. Vytvořte zdroj dat pro nastavení jeho definice pomocí rozhraní API ve verzi Preview pro "typ": "azurefile".

    POST /datasources?api-version=2026-08-01-preview
    {
        "name" : "my-file-datasource",
        "type" : "azurefile",
        "credentials" : { "connectionString" : "DefaultEndpointsProtocol=https;AccountName=<account name>;AccountKey=<account key>;" },
        "container" : { "name" : "my-file-share", "query" : "<optional-directory-name>" }
    }
    
  2. Nastavte "typ" na "azurefile" (povinné).

  3. Nastavte přihlašovací údaje na Azure Storage připojovací řetězec. Následující část popisuje podporované formáty.

  4. Nastavte "kontejner" na kořenovou sdílenou složku a pomocí příkazu "query" zadejte všechny podsložky.

Definice zdroje dat může také zahrnovat zásady měkkého smazání, pokud chcete, aby indexer odstranil vyhledávací dokument, když je zdrojový dokument označen příznakem pro odstranění.

Podporované přihlašovací údaje a připojovací řetězce

Indexery se můžou připojit ke sdílené složce pomocí následujících připojení.

Úplný přístupový řetězec připojení k účtu úložiště
{ "connectionString" : "DefaultEndpointsProtocol=https;AccountName=<your storage account>;AccountKey=<your account key>;" }
Connection string můžete získat ze stránky účtu úložiště na portálu Azure tak, že v levém podokně vyberete Access keys. Nezapomeňte vybrat úplný „připojovací řetězec“ a nejenom klíč.

Přidání vyhledávacích polí do indexu

Do indexu search přidejte pole pro příjem obsahu a metadat souborů Azure.

  1. Vytvořte nebo aktualizujte index a definujte vyhledávací pole, která budou ukládat obsah souboru a metadata.

    POST /indexes?api-version=2026-04-01
    {
      "name" : "my-search-index",
      "fields": [
          { "name": "ID", "type": "Edm.String", "key": true, "searchable": false },
          { "name": "content", "type": "Edm.String", "searchable": true, "filterable": false },
          { "name": "metadata_storage_name", "type": "Edm.String", "searchable": false, "filterable": true, "sortable": true  },
          { "name": "metadata_storage_path", "type": "Edm.String", "searchable": false, "filterable": true, "sortable": true },
          { "name": "metadata_storage_size", "type": "Edm.Int64", "searchable": false, "filterable": true, "sortable": true  },
          { "name": "metadata_storage_content_type", "type": "Edm.String", "searchable": true, "filterable": true, "sortable": true }        
      ]
    }
    
  2. Vytvoření pole klíče dokumentu ("key": true) Nejlepšími kandidáty pro obsah objektů blob jsou vlastnosti metadat. Vlastnosti metadat často obsahují znaky, například / a -, které jsou neplatné pro klíče dokumentu. Indexer automaticky zakóduje vlastnost klíčových metadat, aniž by bylo nutné mapovat konfiguraci nebo pole.

    • metadata_storage_path (výchozí) úplná cesta k objektu nebo souboru

    • metadata_storage_name použitelné pouze v případě, že jsou názvy jedinečné

    • Vlastní vlastnost metadat, kterou přidáte do objektů blob. Tato možnost vyžaduje, aby proces nahrání objektu blob přidal tuto vlastnost metadat do všech objektů blob. Vzhledem k tomu, že klíč je povinná vlastnost, žádné objekty blob, u kterých chybí hodnota, nebudou indexovány. Pokud jako klíč použijete vlastní vlastnost metadat, vyhněte se změnám této vlastnosti. Indexery při změně klíčové vlastnosti přidají duplicitní dokumenty pro stejný objekt blob.

  3. Přidejte pole "content" pro uložení extrahovaného textu z každého souboru prostřednictvím vlastnosti "content" objektu blob. Tento název nemusíte používat, ale můžete tak využít implicitní mapování polí.

  4. Přidejte pole pro standardní vlastnosti metadat. Při indexování souborů jsou standardní vlastnosti metadat stejné jako vlastnosti metadat objektů blob. Indexer Azure Files automaticky vytvoří interní mapování polí pro tyto vlastnosti, které převádí názvy vlastností s pomlčkami na názvy s podtržítky. Stále musíte přidat pole, která chcete použít definici indexu, ale můžete vynechat vytváření mapování polí ve zdroji dat.

    • metadata_storage_name (Edm.String) – název souboru. Pokud máte například soubor /my-share/my-folder/podsložka/resume.pdf, hodnota tohoto pole je resume.pdf.
    • metadata_storage_path (Edm.String) – úplný identifikátor URI souboru, včetně účtu úložiště. Příklad: https://myaccount.file.core.windows.net/my-share/my-folder/subfolder/resume.pdf
    • metadata_storage_content_type (Edm.String) – typ obsahu určený kódem, který jste použili k nahrání souboru. Například application/octet-stream.
    • metadata_storage_last_modified (Edm.DateTimeOffset) – časové razítko poslední změny souboru. Azure AI Vyhledávač pomocí tohoto časového razítka identifikuje změněné soubory, aby se zabránilo přeindexování všeho po počátečním indexování.
    • metadata_storage_size (Edm.Int64) – velikost souboru v bajtech.
    • metadata_storage_content_md5 (Edm.String) – hodnota hash MD5 obsahu souboru, pokud je k dispozici.
    • metadata_storage_sas_token (Edm.String) – dočasný token SAS, který lze použít vlastními dovednostmi k získání přístupu k souboru. Tento token by neměl být uložen pro pozdější použití, protože může vypršet jeho platnost.

Konfigurace a spuštění indexeru Azure Files

Po vytvoření indexu a zdroje dat můžete indexer vytvořit. Konfigurace indexeru určuje vstupy, parametry a vlastnosti, které řídí chování doby běhu.

  1. Vytvořte nebo aktualizujte indexer tak, že ho pojmenujte a odkazujete na zdroj dat a cílový index:

    POST /indexers?api-version=2026-04-01
    {
      "name" : "my-file-indexer",
      "dataSourceName" : "my-file-datasource",
      "targetIndexName" : "my-search-index",
      "parameters": {
         "batchSize": null,
         "maxFailedItems": null,
         "maxFailedItemsPerBatch": null,
         "configuration": {
            "indexedFileNameExtensions" : ".pdf,.docx",
            "excludedFileNameExtensions" : ".png,.jpeg" 
        }
      },
      "schedule" : { },
      "fieldMappings" : [ ]
    }
    
  2. V volitelné části Konfigurace zadejte všechna kritéria zahrnutí nebo vyloučení. Pokud není specifikováno, všechny soubory ve sdílené složce se načtou.

    Pokud jsou k dispozici parametry indexedFileNameExtensions i excludedFileNameExtensions, Azure AI Vyhledávač se nejprve podívá na indexedFileNameExtensions a pak na excludedFileNameExtensions. Pokud v obou seznamech existuje stejná přípona souboru, bude vyloučena z indexování.

  3. Určete mapování polí , pokud existují rozdíly v názvu nebo typu pole nebo pokud potřebujete v indexu vyhledávání více verzí zdrojového pole.

    Při indexování souborů můžete často vynechat mapování polí, protože indexer má integrovanou podporu mapování vlastností "obsahu" a metadat na podobně pojmenovaná a zapisovaná pole v indexu. U vlastností metadat indexer automaticky nahradí pomlčky - podtržítky v indexu vyhledávání.

  4. Další informace o dalších vlastnostech najdete v tématu Vytvoření indexeru .

Indexer se spustí automaticky při jeho vytvoření. Můžete tomu zabránit nastavením "zakázáno" na hodnotu true. Pokud chcete řídit provádění indexeru, spusťte indexer na vyžádání nebo ho umístěte do plánu.

Kontrola stavu indexeru

Pokud chcete monitorovat stav indexeru a historii spuštění, odešlete žádost o získání stavu indexeru :

GET https://myservice.search.windows.net/indexers/myindexer/status?api-version=2026-04-01
  Content-Type: application/json  
  api-key: [admin key]

Odpověď zahrnuje stav a počet zpracovaných položek. Měl by vypadat podobně jako v následujícím příkladu:

    {
        "status":"running",
        "lastResult": {
            "status":"success",
            "errorMessage":null,
            "startTime":"2022-02-21T00:23:24.957Z",
            "endTime":"2022-02-21T00:36:47.752Z",
            "errors":[],
            "itemsProcessed":1599501,
            "itemsFailed":0,
            "initialTrackingState":null,
            "finalTrackingState":null
        },
        "executionHistory":
        [
            {
                "status":"success",
                "errorMessage":null,
                "startTime":"2022-02-21T00:23:24.957Z",
                "endTime":"2022-02-21T00:36:47.752Z",
                "errors":[],
                "itemsProcessed":1599501,
                "itemsFailed":0,
                "initialTrackingState":null,
                "finalTrackingState":null
            },
            ... earlier history items
        ]
    }

Historie provádění obsahuje až 50 naposledy dokončených spuštění, které jsou seřazeny v obráceném chronologickém pořadí tak, aby poslední spuštění bylo první.

Další kroky

Teď můžete spustit indexer, monitorovat stav nebo naplánovat spuštění indexeru. Následující články platí pro indexery, které načítá obsah z Azure Storage: