Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Note
Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.
Dovednost extrakce dokumentů extrahuje obsah ze souboru v kanálu rozšiřování. Ve výchozím nastavení je extrakce nebo načítání obsahu integrovaná do kanálu rozšiřování. Pomocí dovednosti extrakce dokumentů ale můžete řídit, jak jsou parametry nastaveny a jak se extrahovaný obsah jmenuje ve stromu rozšiřování.
Pro vektorové a multimodální vyhledávání zkombinujte extrakci dokumentů s dovedností Rozdělení textu a implementujte konfigurovatelný přístup k blokům dat. Tento scénář ukazuje multimodální kurz .
Note
Tato dovednost není vázána na Nástroje Foundry a nemá žádný klíčový požadavek na nástroje Foundry Tools.
Tato dovednost extrahuje text a obrázky. Extrakce textu je volná. Extrakce obrázků je fakturovatelná službou Azure AI Vyhledávač. V bezplatné vyhledávací službě se náklady na 20 transakcí za den absorbují, abyste mohli provádět rychlé starty, kurzy a malé projekty bez poplatků. Pro základní a vyšší úrovně je extrakce obrázků fakturovatelná.
@odata.type
Microsoft.Skills.Util.DocumentExtractionSkill
Podporované formáty dokumentů
DocumentExtractionSkill může extrahovat text z následujících formátů dokumentu:
- CSV (viz indexování objektů blob CSV)
- EML
- EPUB
- GZ
- jazyk HTML
- JSON (viz indexování objektů blob JSON)
- KML (XML pro geografické reprezentace)
- Markdown
- formáty systém systém Microsoft Office: DOCX/DOC/DOCM, XLSX/XLS/XLSM, PPTX/PPTM, MSG (e-maily Outlooku), XML (2003 i 2006 WORD XML)
- Formáty otevřených dokumentů: ODT, ODS, ODP
- soubor PDF
- Soubory ve formátu prostého textu (viz také indexování prostého textu)
- RTF
- jazyk XML
- ZIP
Parametry dovedností
Parametry rozlišují malá a velká písmena.
| Inputs | Povolené hodnoty | Description |
|---|---|---|
parsingMode |
defaulttextjson |
Nastavte na default extrakci dokumentů ze souborů, které nejsou čistým textem nebo JSON. U zdrojových souborů, které obsahují značky, jako jsou SOUBORY PDF, HTML, RTF a systém Microsoft Office, použijte výchozí možnost k extrakci textu bez jazyka nebo značek. Pokud parsingMode není definován explicitně, hodnota je default.Nastavte, text jestli jsou zdrojové soubory TXT. Tento režim analýzy zlepšuje výkon u souborů ve formátu prostého textu. Pokud soubory obsahují značky, zachová tento režim značky v konečném výstupu.Nastavte na json extrahování strukturovaného obsahu ze souborů JSON. |
dataToExtract |
contentAndMetadataallMetadata |
Nastavte na contentAndMetadata extrahování všech metadat a textového obsahu z každého souboru. Pokud dataToExtract není definován explicitně, hodnota je contentAndMetadata.Nastavte na allMetadata extrahování pouze vlastností metadat pro typ obsahu, jako jsou metadata jedinečná pro soubory PNG. |
configuration |
Viz níže. | Slovník volitelných parametrů, které upravují způsob provedení extrakce dokumentů. Popis podporovaných vlastností konfigurace najdete v následující tabulce. |
| Parametr konfigurace | Povolené hodnoty | Description |
|---|---|---|
imageAction |
nonegenerateNormalizedImagesgenerateNormalizedImagePerPage |
Pokud chcete none ignorovat vložené obrázky nebo soubory obrázků v sadě dat nebo pokud zdrojová data neobsahují soubory obrázků. Tato hodnota je výchozí.V případě analýzy OCR a obrázků nastavte, aby generateNormalizedImages dovednost vytvářela pole normalizovaných obrázků jako součást prolomení dokumentu. Tato akce vyžaduje parsingMode nastavení default a dataToExtract nastavení na contentAndMetadatahodnotu . Normalizovaný obrázek má jednotný výstup, který je velký a otočený tak, aby podporoval konzistentní vykreslování ve výsledcích vizuálního hledání. Tato dovednost generuje tyto informace pro každý obrázek.Pokud nastavíte imageActiongenerateNormalizedImagePerPagemožnost , každá stránka PDF se vykreslí jako obrázek a normalizuje se místo extrahování vložených obrázků. Typy souborů, které nejsou pdf, se považují za stejné, jako kdyby generateNormalizedImages byly nastaveny. |
normalizedImageMaxWidth |
Jakékoli celé číslo mezi 50–10000 | Maximální šířka (v pixelech) pro normalizované obrázky generované. Výchozí hodnota je 2000. |
normalizedImageMaxHeight |
Jakékoli celé číslo mezi 50–10000 | Maximální výška (v pixelech) pro vygenerované normalizované obrázky. Výchozí hodnota je 2000. |
Note
Výchozí hodnota 2000 pixelů pro normalizované obrázky maximální šířky a výšky je založená na maximální velikosti podporované dovedností OCR a dovedností analýzy obrázků. Dovednost OCR podporuje maximální šířku a výšku 4200 pro neanglické jazyky a 1 0000 pro angličtinu. Pokud zvýšíte maximální limity, zpracování může selhat na větších obrázcích v závislosti na definici sady dovedností a jazyce dokumentů.
Vstupy dovedností
| Název vstupu | Description |
|---|---|
file_data |
Soubor, ze kterého se má obsah extrahovat. |
Vstup "file_data" musí být objekt definovaný takto:
{
"$type": "file",
"data": "BASE64 encoded string of the file"
}
Alternativně se dá definovat takto:
{
"$type": "file",
"url": "URL to download file",
"sasToken": "OPTIONAL: SAS token for authentication if the URL provided is for a file in blob storage"
}
Objekt odkazu na soubor lze vygenerovat jedním ze tří způsobů:
Nastavení parametru v definici indexeru
allowSkillsetToReadFileDatana hodnotu true Tím se vytvoří cesta/document/file_data, která představuje původní data souboru stažená z vašeho zdroje dat objektů blob. Tento parametr platí jenom pro soubory v úložišti objektů blob.allowSkillsetToReadFileDatazpřístupní stažená data souboru dovednosti. Nezvětší velikost souboru indexeru objektů blob ani extrahované limity obsahu.Nastavení parametru v definici indexeru
imageActionna jinou hodnotu nežnone. Tím se vytvoří pole obrázků, které se řídí požadovanou konvencí pro vstup do této dovednosti, pokud jsou předány jednotlivě (to znamená/document/normalized_images/*).Vlastní dovednost vrátí objekt JSON definovaný PŘESNĚ jako výše. Parametr
$typemusí být nastaven přesněfileadataparametr musí být základní 64 kódovaná bajtová data obsahu souboru nebourlparametr musí být správně naformátovaná adresa URL s přístupem ke stažení souboru v daném umístění.
Výstupy schopností
| Název výstupu | Description |
|---|---|
content |
Textový obsah dokumentu. |
normalized_images |
Pokud imageAction je nastavena na jinou hodnotu než none, nové pole normalized_images obsahuje pole obrázků. Další informace o výstupním formátu naleznete v tématu Extrakce textu a informací z obrázků. |
Ukázková definice
{
"@odata.type": "#Microsoft.Skills.Util.DocumentExtractionSkill",
"parsingMode": "default",
"dataToExtract": "contentAndMetadata",
"configuration": {
"imageAction": "generateNormalizedImages",
"normalizedImageMaxWidth": 2000,
"normalizedImageMaxHeight": 2000
},
"context": "/document",
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "content",
"targetName": "extracted_content"
},
{
"name": "normalized_images",
"targetName": "extracted_normalized_images"
}
]
}
Ukázkový vstup
{
"values": [
{
"recordId": "1",
"data":
{
"file_data": {
"$type": "file",
"data": "aGVsbG8="
}
}
}
]
}
Ukázkový výstup
{
"values": [
{
"recordId": "1",
"data": {
"content": "hello",
"normalized_images": []
}
}
]
}