Kognitivní dovednost extrakce dokumentů

Note

Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.

Dovednost extrakce dokumentů extrahuje obsah ze souboru v kanálu rozšiřování. Ve výchozím nastavení je extrakce nebo načítání obsahu integrovaná do kanálu rozšiřování. Pomocí dovednosti extrakce dokumentů ale můžete řídit, jak jsou parametry nastaveny a jak se extrahovaný obsah jmenuje ve stromu rozšiřování.

Pro vektorové a multimodální vyhledávání zkombinujte extrakci dokumentů s dovedností Rozdělení textu a implementujte konfigurovatelný přístup k blokům dat. Tento scénář ukazuje multimodální kurz .

Note

Tato dovednost není vázána na Nástroje Foundry a nemá žádný klíčový požadavek na nástroje Foundry Tools.

Tato dovednost extrahuje text a obrázky. Extrakce textu je volná. Extrakce obrázků je fakturovatelná službou Azure AI Vyhledávač. V bezplatné vyhledávací službě se náklady na 20 transakcí za den absorbují, abyste mohli provádět rychlé starty, kurzy a malé projekty bez poplatků. Pro základní a vyšší úrovně je extrakce obrázků fakturovatelná.

@odata.type

Microsoft.Skills.Util.DocumentExtractionSkill

Podporované formáty dokumentů

DocumentExtractionSkill může extrahovat text z následujících formátů dokumentu:

  • CSV (viz indexování objektů blob CSV)
  • EML
  • EPUB
  • GZ
  • jazyk HTML
  • JSON (viz indexování objektů blob JSON)
  • KML (XML pro geografické reprezentace)
  • Markdown
  • formáty systém systém Microsoft Office: DOCX/DOC/DOCM, XLSX/XLS/XLSM, PPTX/PPTM, MSG (e-maily Outlooku), XML (2003 i 2006 WORD XML)
  • Formáty otevřených dokumentů: ODT, ODS, ODP
  • soubor PDF
  • Soubory ve formátu prostého textu (viz také indexování prostého textu)
  • RTF
  • jazyk XML
  • ZIP

Parametry dovedností

Parametry rozlišují malá a velká písmena.

Inputs Povolené hodnoty Description
parsingMode default
text
json
Nastavte na default extrakci dokumentů ze souborů, které nejsou čistým textem nebo JSON. U zdrojových souborů, které obsahují značky, jako jsou SOUBORY PDF, HTML, RTF a systém Microsoft Office, použijte výchozí možnost k extrakci textu bez jazyka nebo značek. Pokud parsingMode není definován explicitně, hodnota je default.

Nastavte, text jestli jsou zdrojové soubory TXT. Tento režim analýzy zlepšuje výkon u souborů ve formátu prostého textu. Pokud soubory obsahují značky, zachová tento režim značky v konečném výstupu.

Nastavte na json extrahování strukturovaného obsahu ze souborů JSON.
dataToExtract contentAndMetadata
allMetadata
Nastavte na contentAndMetadata extrahování všech metadat a textového obsahu z každého souboru. Pokud dataToExtract není definován explicitně, hodnota je contentAndMetadata.

Nastavte na allMetadata extrahování pouze vlastností metadat pro typ obsahu, jako jsou metadata jedinečná pro soubory PNG.
configuration Viz níže. Slovník volitelných parametrů, které upravují způsob provedení extrakce dokumentů. Popis podporovaných vlastností konfigurace najdete v následující tabulce.
Parametr konfigurace Povolené hodnoty Description
imageAction none
generateNormalizedImages
generateNormalizedImagePerPage
Pokud chcete none ignorovat vložené obrázky nebo soubory obrázků v sadě dat nebo pokud zdrojová data neobsahují soubory obrázků. Tato hodnota je výchozí.

V případě analýzy OCR a obrázků nastavte, aby generateNormalizedImages dovednost vytvářela pole normalizovaných obrázků jako součást prolomení dokumentu. Tato akce vyžaduje parsingMode nastavení default a dataToExtract nastavení na contentAndMetadatahodnotu . Normalizovaný obrázek má jednotný výstup, který je velký a otočený tak, aby podporoval konzistentní vykreslování ve výsledcích vizuálního hledání. Tato dovednost generuje tyto informace pro každý obrázek.

Pokud nastavíte imageActiongenerateNormalizedImagePerPagemožnost , každá stránka PDF se vykreslí jako obrázek a normalizuje se místo extrahování vložených obrázků. Typy souborů, které nejsou pdf, se považují za stejné, jako kdyby generateNormalizedImages byly nastaveny.
normalizedImageMaxWidth Jakékoli celé číslo mezi 50–10000 Maximální šířka (v pixelech) pro normalizované obrázky generované. Výchozí hodnota je 2000.
normalizedImageMaxHeight Jakékoli celé číslo mezi 50–10000 Maximální výška (v pixelech) pro vygenerované normalizované obrázky. Výchozí hodnota je 2000.

Note

Výchozí hodnota 2000 pixelů pro normalizované obrázky maximální šířky a výšky je založená na maximální velikosti podporované dovedností OCR a dovedností analýzy obrázků. Dovednost OCR podporuje maximální šířku a výšku 4200 pro neanglické jazyky a 1 0000 pro angličtinu. Pokud zvýšíte maximální limity, zpracování může selhat na větších obrázcích v závislosti na definici sady dovedností a jazyce dokumentů.

Vstupy dovedností

Název vstupu Description
file_data Soubor, ze kterého se má obsah extrahovat.

Vstup "file_data" musí být objekt definovaný takto:

{
  "$type": "file",
  "data": "BASE64 encoded string of the file"
}

Alternativně se dá definovat takto:

{
  "$type": "file",
  "url": "URL to download file",
  "sasToken": "OPTIONAL: SAS token for authentication if the URL provided is for a file in blob storage"
}

Objekt odkazu na soubor lze vygenerovat jedním ze tří způsobů:

  • Nastavení parametru v definici indexeru allowSkillsetToReadFileData na hodnotu true Tím se vytvoří cesta /document/file_data , která představuje původní data souboru stažená z vašeho zdroje dat objektů blob. Tento parametr platí jenom pro soubory v úložišti objektů blob.

    allowSkillsetToReadFileData zpřístupní stažená data souboru dovednosti. Nezvětší velikost souboru indexeru objektů blob ani extrahované limity obsahu.

  • Nastavení parametru v definici indexeru imageAction na jinou hodnotu než none. Tím se vytvoří pole obrázků, které se řídí požadovanou konvencí pro vstup do této dovednosti, pokud jsou předány jednotlivě (to znamená /document/normalized_images/*).

  • Vlastní dovednost vrátí objekt JSON definovaný PŘESNĚ jako výše. Parametr $type musí být nastaven přesně file a data parametr musí být základní 64 kódovaná bajtová data obsahu souboru nebo url parametr musí být správně naformátovaná adresa URL s přístupem ke stažení souboru v daném umístění.

Výstupy schopností

Název výstupu Description
content Textový obsah dokumentu.
normalized_images Pokud imageAction je nastavena na jinou hodnotu než none, nové pole normalized_images obsahuje pole obrázků. Další informace o výstupním formátu naleznete v tématu Extrakce textu a informací z obrázků.

Ukázková definice

 {
    "@odata.type": "#Microsoft.Skills.Util.DocumentExtractionSkill",
    "parsingMode": "default",
    "dataToExtract": "contentAndMetadata",
    "configuration": {
        "imageAction": "generateNormalizedImages",
        "normalizedImageMaxWidth": 2000,
        "normalizedImageMaxHeight": 2000
    },
    "context": "/document",
    "inputs": [
      {
        "name": "file_data",
        "source": "/document/file_data"
      }
    ],
    "outputs": [
      {
        "name": "content",
        "targetName": "extracted_content"
      },
      {
        "name": "normalized_images",
        "targetName": "extracted_normalized_images"
      }
    ]
  }

Ukázkový vstup

{
  "values": [
    {
      "recordId": "1",
      "data":
      {
        "file_data": {
          "$type": "file",
          "data": "aGVsbG8="
        }
      }
    }
  ]
}

Ukázkový výstup

{
  "values": [
    {
      "recordId": "1",
      "data": {
        "content": "hello",
        "normalized_images": []
      }
    }
  ]
}

Viz také