Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Note
Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.
Important
Funkce, možnosti nebo vlastnosti označené (Preview) se nevztahují na smlouvu o úrovni služeb, nedoporučuje se pro produkční úlohy a můžou se změnit nebo omezit dříve, než budou obecně dostupné. Podmínky Azure AI Vyhledávač Preview platí pro všechny funkce ve verzi Preview, ať už jsou samostatné nebo součástí obecně dostupné funkce.
Dovednost Azure Content Understanding využívá document analyzatory z Azure Content Understanding in Foundry Tools k analýze nestrukturovaných dokumentů a dalších typů obsahu, generujících organizované, vyhledávatelné výstupy, které lze integrovat do automatizace pracovních zátěží. Tato dovednost extrahuje jak text, tak obrázky, včetně metadat o lokalitě, která zachovávají pozici každého obrázku v dokumentu. Blízkost obrázku k souvisejícímu obsahu je zvláště užitečná pro multimodální vyhledávání, agentické vyhledávání a generování s doplňkem vyhledávání (RAG).
Dovednost Azure Content Understanding je vázána na fakturovatelný Microsoft Foundry zdroj. Na rozdíl od jiných dovedností Azure AI zdrojů, jako je dovednost Document Layout, dovednost Azure Content Understanding neposkytuje 20 bezplatných dokumentů na jednoho indexátora denně. Provádění této dovednosti je účtováno za cenu Azure Content Understanding.
Dovednost Azure Content Understanding můžete využít jak pro extrakci obsahu, tak pro rozdělení částí. Není potřeba používat dovednost Text Split ve svém souboru dovedností. Tato dovednost implementuje stejné rozhraní jako dovednost Document Layout, která využívá >
Tabulky a obrázky jsou vypisovány ve formátu Markdown, což usnadňuje jejich pochopení pro velké jazykové modely (LLM). Naopak dovednost Document Layout vypisuje tabulky a obrázky jako prostý text, což může vést ke ztrátě informací.
U tabulek, které pokrývají více stránek, může dovednost Azure Content Understanding rozpoznat a extrahovat tabulky napříč stránkami jako jednu jednotku.
Dovednost Azure Content Understanding umožňuje blokům dat přesahovat více stránek prostřednictvím sémantických jednotek.
Dovednost Azure Content Understanding je nákladově efektivnější než dovednost Document Layout, protože Content Understanding API je levnější.
Azure Content Understanding může generovat popisy založené na umělé inteligenci pro obrázky, grafy, diagramy a vložené obrázky. Vložené popisy obrázku jsou začleněny přímo do obsahu markdownu generovaného pro načtení. Tyto popisy jsou prohledávatelné a mohou zlepšit uzemnění RAG a kvalitu multimodálního načítání.
Dovednost Azure Content Understanding je obecně dostupná v rozhraní 2026-04-01 REST API. Od této 2026-05-01-previewdovednosti volitelně vygeneruje popisy obrázků založené na umělé inteligenci pro obrázky, grafy a diagramy s vloženými dokumenty (Preview). Pokud chcete povolit popisy, musíte nasadit Azure model dokončování chatu OpenAI v prostředku Foundry připojeném k sadě dovedností. Tato verze rozhraní API také přidává sémantické bloky dat (Preview), což je možnost podporující rozložení, která respektuje hranice odstavců a měří délku bloku v tokenech. Obě možnosti vyžadují výslovný souhlas. Když nové parametry vynecháte, dovednost se chová stejně jako ve stabilní 2026-04-01 verzi rozhraní API.
Omezení
Dovednost Azure Content Understanding má následující omezení:
Tato dovednost není vhodná pro rozsáhlé dokumenty, které vyžadují více než pět minut zpracování v Content Understanding document analyzer. Čas vyprší na dovednost, ale nabití se stále vztahuje na Foundry zdroj, který je k této sadě přiřazen. Ujistěte se, že dokumenty jsou optimalizovány tak, aby zůstaly v rámci limitů zpracování a vyhnuli se zbytečným nákladům.
Tato dovednost volá Azure Content Understanding document analyzer, takže všechny zdokumentované chování služby pro různé typy dokumentů platí pro jeho výstup. Například soubory Word (DOCX) a PDF mohou přinést odlišné výsledky kvůli rozdílům v tom, jak jsou obrázky zpracovávány. Pokud je vyžadováno konzistentní chování obrázků napříč DOCX a PDF, zvažte převod dokumentů do PDF nebo prohlédnutí multimodálního vyhledávání pro alternativní přístupy.
Podporované oblasti
Dovednost Azure Content Understanding nazývá Content Understanding 2025-11-01 REST API. Váš zdroj Foundry musí být v podporovaném regionu, který je popsán v Azure oblasti a jazykové podpory.
Vaše vyhledávací služba může být v jakémkoli podporovaném Azure AI Vyhledávač regionu. Když váš Foundry zdroj a služba Azure AI Vyhledávač nejsou ve stejné oblasti, latence sítě napříč regiony ovlivňuje výkon indexeru.
Podporované formáty souborů
Dovednost Azure Content Understanding rozpoznává následující formáty souborů:
- . JPEG
- .JPG
- .PNG
- .BMP
- . HEIF
- . TIFF
- .DOCX
- . XLSX
- .PPTX
- .HTML
- .TXT
- . MD
- . RTF
- . EML
Podporované jazyky
Pro tištěný text viz Azure Podpora regionu a jazyka pro porozumění obsahu.
@odata.type
Microsoft.Skills.Util.ContentUnderstandingSkill
Omezení dat
I když je velikost souboru pro analýzu dokumentů v rámci limitu 200 MB, jak je popsáno v kvótách a limitech služeb Azure Content Understanding, indexování stále podléhá limitům indexer vaší vyhledávací služby.
Rozměry obrazu musí být mezi 50 pixely x 50 pixely nebo 10 000 pixely x 10 000 pixelů.
Pokud jsou vaše PDF uzamčené heslem, odstraňte zámek před spuštěním indexeru.
Parametry dovedností
Parametry rozlišují malá a velká písmena.
| Název parametru | Povolené hodnoty | Description |
|---|---|---|
extractionOptions |
["images"], , ["images", "locationMetadata"]["locationMetadata"] |
Identifikujte jakýkoli dodatečný obsah vyextrahovaný z dokumentu. Definujte pole enumů, které odpovídají obsahu, který má být zahrnut ve výstupu. Například pokud extractionOptions je , ["images", "locationMetadata"]výstup obsahuje obrázky a metadata polohy, která poskytují polohu stránky a vizuální informace související s místem extrakce obsahu. |
modelName (náhled) |
Řetězec, například "gpt-4.1". |
Optional. K dispozici od 2026-05-01-preview rozhraní REST API. Název modelu dokončování chatu OpenAI Azure, který slouží ke generování popisů vložených obrázků, grafů a diagramů. Popis obrázku je nezávislý na obrázku a je možné ho extractionOptions povolit bez extrakce obrázků. Musí být zadána společně s parametrem modelDeployment. Seznam podporovaných modelů najdete v tématu Podporované modely generování. |
modelDeployment (náhled) |
Řetězec. | Optional. K dispozici od 2026-05-01-preview rozhraní REST API. Název nasazení modelu Azure OpenAI v prostředku Foundry, který je připojený k sadě dovedností. Musí být zadána společně s parametrem modelName. |
chunkingProperties |
Viz následující tabulka. | Možnosti, které zahrnují, jak rozdělit textový obsah. |
chunkingProperties Parametry |
Povolené hodnoty | Description |
|---|---|---|
method |
fixedSize (výchozí) nebo semantic (Preview). K dispozici od 2026-05-01-preview rozhraní REST API. |
Strategie vytváření bloků dat.
fixedSize používá bloky oken založené na znakech.
semantic používá bloky dat pracující s rozložením, které respektuje hranice odstavců a inteligentně zpracovává velké tabulky, které pokrývají hranice bloků dat. |
unit |
characters(s fixedSize) nebo tokens (preview s dostupným rozhraním semantic2026-05-01-preview REST API) |
Ovládá kardinálnost jednotky chunk. Podporují se pouze kombinace fixedSize + characters a semantic + tokens kombinace. Pokud unit je vynechán, je odvozen z method. |
maximumLength |
Když unit je characters, celé číslo mezi 300 a 50 000. Když unit je tokens, celé číslo mezi 100 a 8 000. Výchozí hodnota je 500. |
Maximální délka bloku dat měřená v konfigurovaném unitsouboru . |
overlapLength |
Celé číslo. Hodnota musí být menší než polovina .maximumLength |
Délka překrytí mezi dvěma textovými bloky. Platí pouze v případech, kdy method je fixedSize. Musí být vynechán nebo nastaven na 0 hodnotu , pokud method je semantic. |
Vstupy dovedností
| Název vstupu | Description |
|---|---|
file_data |
Soubor, ze kterého by měl být obsah extrahován. |
Vstup file_data musí být objektem definovaným jako:
{
"$type": "file",
"data": "BASE64 encoded string of the file"
}
Alternativně jej lze definovat jako:
{
"$type": "file",
"url": "URL to download the file",
"sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}
Objekt reference souboru lze generovat jedním z následujících způsobů:
Nastavení parametru
allowSkillsetToReadFileDatav definici indexeru natrue. Toto nastavení vytváří cestu/document/file_data, která je objektem reprezentujícím původní data souboru stažená z vašeho blob datového zdroje. Tento parametr platí pouze pro soubory v Azure Blob Storage.allowSkillsetToReadFileDatazpřístupní stažená data souboru dovednosti. Nezvyšuje limity indexeru objektů blob ani limity služby Content Understanding popsané v omezeních dat.Mít vlastní dovednost vrací definici objektu JSON, která poskytuje
$type,data, nebourla .sastokenParametr$typemusí být nastaven nafile, adatamusí být základním 64-bajtovým polem obsahu souboru. Parametrurlmusí být platná URL s přístupem ke stažení souboru na daném místě.
Výstupy schopností
| Název výstupu | Description |
|---|---|
text_sections |
Sbírka textových bloků. Každý chunk může pokrývat více stránek (s ohledem na další chunking). Objekt bloku textu obsahuje locationMetadata , pokud je k dispozici, a imagePath seznam, když se blok dat překrývá s rozsahy obrázku v dokumentu. |
normalized_images |
Platí pouze tehdy, pokud extractionOptions zahrnuje images. Sbírka obrázků extrahovaných z dokumentu, včetně locationMetadata případných informací. |
Každý prvek obsahuje text_sections následující pole:
| Pole | Typ | Description |
|---|---|---|
id |
String | Jedinečný identifikátor bloku dat. |
content |
String | Obsah Markdownu pro blok dat Pokud method ano semantic, obsah obsahuje popisy obrázků a tabulek vygenerované pomocí umělé inteligence, které jsou vložené jako Markdown. |
locationMetadata |
Objekt | Rozsah stránek a poziční data (pageNumberFrom, pageNumberTo, ordinalPosition, source). Prezentovat, pokud extractionOptions obsahuje locationMetadata. |
imagePath |
String | Středník oddělený seznam cest k obrázkům obsaženým v bloku dat. Je k dispozici, když se blok dat překrývá s rozsahy obrázku v dokumentu. |
Každý prvek obsahuje normalized_images následující pole:
| Pole | Typ | Description |
|---|---|---|
id |
String | Jedinečný identifikátor obrázku. |
data |
String | Data obrázků s kódováním Base64 |
imagePath |
String | Odkaz na cestu k obrázku v dokumentu, například "figures/0". |
locationMetadata |
Objekt | Rozsah stránek a poziční data Prezentovat, pokud extractionOptions obsahuje locationMetadata. |
Examples
První příklad používá bloky s pevnou velikostí a ukazuje, jak výstupní textový obsah v blocích s pevnou velikostí a extrahovat obrázky spolu s metadaty umístění z dokumentu. Druhý příklad, který je k dispozici od 2026-05-01-preview rozhraní REST API, používá sémantické bloky dat s popisy obrázků vygenerovanými AI.
Příklad 1: Bloky s pevnou velikostí s extrakcí obrázků a metadat
{
"skills": [
{
"description": "Analyze a document",
"@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
"context": "/document",
"extractionOptions": ["images", "locationMetadata"],
"chunkingProperties": {
"unit": "characters",
"maximumLength": 1325,
"overlapLength": 0
},
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "text_sections",
"targetName": "text_sections"
},
{
"name": "normalized_images",
"targetName": "normalized_images"
}
]
}
]
}
Ukázkový výstup
{
"text_sections": [
{
"id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
"content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
}
},
...
{
"id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
"content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
"locationMetadata": {
"pageNumberFrom": 2,
"pageNumberTo": 3,
"ordinalPosition": 3,
"source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
}
...
}
],
"normalized_images": [
{
"id": "1_335140f1-9d31-4507-8916-2cde758639cb",
"data": "aW1hZ2UgMSBkYXRh",
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
}
},
{
"id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4",
"data": "aW1hZ2UgMiBkYXRh",
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",
"locationMetadata": {
"pageNumberFrom": 3,
"pageNumberTo": 3,
"ordinalPosition": 1,
"source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
}
}
]
}
locationMetadata je založeno na vlastnosti source poskytované Azure Content Understanding. Pro informace o tom, jak je vizuální pozice prvku v souboru kódována, viz Analýza dokumentu: Extrahování strukturovaného obsahu.
imagePath představuje relativní cestu uloženého obrazu. Pokud je projekce souboru úložiště znalostí nakonfigurována v sadě dovedností, tato cesta odpovídá relativní cestě obrazu uloženého v úložišti.
Příklad 2: Sémantické vytváření bloků s popisem obrázku (Preview)
Tento příklad, který je k dispozici od 2026-05-01-preview rozhraní REST API, používá sémantické vytváření bloků a vytváří popisy vložených obrázků, grafů a diagramů vygenerovaných umělou inteligencí. Prostředek Foundry připojený k sadě dovedností musí mít model dokončení chatu identifikovaný modelName a nasazený modelDeployment.
{
"skills": [
{
"description": "Extract and chunk document content with image descriptions",
"@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
"context": "/document",
"modelName": "gpt-4.1",
"modelDeployment": "myGpt41Deployment",
"extractionOptions": ["images", "locationMetadata"],
"chunkingProperties": {
"method": "semantic",
"unit": "tokens",
"maximumLength": 500
},
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "text_sections",
"targetName": "text_sections"
},
{
"name": "normalized_images",
"targetName": "normalized_images"
}
]
}
]
}
V případě sémantických bloků dat každý blok text_sections dat obsahuje obsah Markdownu, který obsahuje popisy všech obrázků a tabulek generovaných pomocí AI. Pokud se blok dat překrývá s jedním nebo více rozsahy obrázku, obsahuje objekt bloku také imagePath pole, které obsahuje odpovídající cesty k obrázkům:
{
"id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
"content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
},
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}