Azure dovednost pro porozumění obsahu

Note

Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.

Important

Funkce, možnosti nebo vlastnosti označené (Preview) se nevztahují na smlouvu o úrovni služeb, nedoporučuje se pro produkční úlohy a můžou se změnit nebo omezit dříve, než budou obecně dostupné. Podmínky Azure AI Vyhledávač Preview platí pro všechny funkce ve verzi Preview, ať už jsou samostatné nebo součástí obecně dostupné funkce.

Dovednost Azure Content Understanding využívá document analyzatory z Azure Content Understanding in Foundry Tools k analýze nestrukturovaných dokumentů a dalších typů obsahu, generujících organizované, vyhledávatelné výstupy, které lze integrovat do automatizace pracovních zátěží. Tato dovednost extrahuje jak text, tak obrázky, včetně metadat o lokalitě, která zachovávají pozici každého obrázku v dokumentu. Blízkost obrázku k souvisejícímu obsahu je zvláště užitečná pro multimodální vyhledávání, agentické vyhledávání a generování s doplňkem vyhledávání (RAG).

Dovednost Azure Content Understanding je vázána na fakturovatelný Microsoft Foundry zdroj. Na rozdíl od jiných dovedností Azure AI zdrojů, jako je dovednost Document Layout, dovednost Azure Content Understanding neposkytuje 20 bezplatných dokumentů na jednoho indexátora denně. Provádění této dovednosti je účtováno za cenu Azure Content Understanding.

Dovednost Azure Content Understanding můžete využít jak pro extrakci obsahu, tak pro rozdělení částí. Není potřeba používat dovednost Text Split ve svém souboru dovedností. Tato dovednost implementuje stejné rozhraní jako dovednost Document Layout, která využívá >Azure v Foundry Tools při nastavení nastaveno na . Nicméně dovednost Azure Content Understanding nabízí několik výhod oproti dovednosti Document Layout:

  • Tabulky a obrázky jsou vypisovány ve formátu Markdown, což usnadňuje jejich pochopení pro velké jazykové modely (LLM). Naopak dovednost Document Layout vypisuje tabulky a obrázky jako prostý text, což může vést ke ztrátě informací.

  • U tabulek, které pokrývají více stránek, může dovednost Azure Content Understanding rozpoznat a extrahovat tabulky napříč stránkami jako jednu jednotku.

  • Dovednost Azure Content Understanding umožňuje blokům dat přesahovat více stránek prostřednictvím sémantických jednotek.

  • Dovednost Azure Content Understanding je nákladově efektivnější než dovednost Document Layout, protože Content Understanding API je levnější.

  • Azure Content Understanding může generovat popisy založené na umělé inteligenci pro obrázky, grafy, diagramy a vložené obrázky. Vložené popisy obrázku jsou začleněny přímo do obsahu markdownu generovaného pro načtení. Tyto popisy jsou prohledávatelné a mohou zlepšit uzemnění RAG a kvalitu multimodálního načítání.

Dovednost Azure Content Understanding je obecně dostupná v rozhraní 2026-04-01 REST API. Od této 2026-05-01-previewdovednosti volitelně vygeneruje popisy obrázků založené na umělé inteligenci pro obrázky, grafy a diagramy s vloženými dokumenty (Preview). Pokud chcete povolit popisy, musíte nasadit Azure model dokončování chatu OpenAI v prostředku Foundry připojeném k sadě dovedností. Tato verze rozhraní API také přidává sémantické bloky dat (Preview), což je možnost podporující rozložení, která respektuje hranice odstavců a měří délku bloku v tokenech. Obě možnosti vyžadují výslovný souhlas. Když nové parametry vynecháte, dovednost se chová stejně jako ve stabilní 2026-04-01 verzi rozhraní API.

Omezení

Dovednost Azure Content Understanding má následující omezení:

  • Tato dovednost není vhodná pro rozsáhlé dokumenty, které vyžadují více než pět minut zpracování v Content Understanding document analyzer. Čas vyprší na dovednost, ale nabití se stále vztahuje na Foundry zdroj, který je k této sadě přiřazen. Ujistěte se, že dokumenty jsou optimalizovány tak, aby zůstaly v rámci limitů zpracování a vyhnuli se zbytečným nákladům.

  • Tato dovednost volá Azure Content Understanding document analyzer, takže všechny zdokumentované chování služby pro různé typy dokumentů platí pro jeho výstup. Například soubory Word (DOCX) a PDF mohou přinést odlišné výsledky kvůli rozdílům v tom, jak jsou obrázky zpracovávány. Pokud je vyžadováno konzistentní chování obrázků napříč DOCX a PDF, zvažte převod dokumentů do PDF nebo prohlédnutí multimodálního vyhledávání pro alternativní přístupy.

Podporované oblasti

Dovednost Azure Content Understanding nazývá Content Understanding 2025-11-01 REST API. Váš zdroj Foundry musí být v podporovaném regionu, který je popsán v Azure oblasti a jazykové podpory.

Vaše vyhledávací služba může být v jakémkoli podporovaném Azure AI Vyhledávač regionu. Když váš Foundry zdroj a služba Azure AI Vyhledávač nejsou ve stejné oblasti, latence sítě napříč regiony ovlivňuje výkon indexeru.

Podporované formáty souborů

Dovednost Azure Content Understanding rozpoznává následující formáty souborů:

  • .PDF
  • . JPEG
  • .JPG
  • .PNG
  • .BMP
  • . HEIF
  • . TIFF
  • .DOCX
  • . XLSX
  • .PPTX
  • .HTML
  • .TXT
  • . MD
  • . RTF
  • . EML

Podporované jazyky

Pro tištěný text viz Azure Podpora regionu a jazyka pro porozumění obsahu.

@odata.type

Microsoft.Skills.Util.ContentUnderstandingSkill

Omezení dat

  • I když je velikost souboru pro analýzu dokumentů v rámci limitu 200 MB, jak je popsáno v kvótách a limitech služeb Azure Content Understanding, indexování stále podléhá limitům indexer vaší vyhledávací služby.

  • Rozměry obrazu musí být mezi 50 pixely x 50 pixely nebo 10 000 pixely x 10 000 pixelů.

  • Pokud jsou vaše PDF uzamčené heslem, odstraňte zámek před spuštěním indexeru.

Parametry dovedností

Parametry rozlišují malá a velká písmena.

Název parametru Povolené hodnoty Description
extractionOptions ["images"], , ["images", "locationMetadata"]["locationMetadata"] Identifikujte jakýkoli dodatečný obsah vyextrahovaný z dokumentu. Definujte pole enumů, které odpovídají obsahu, který má být zahrnut ve výstupu. Například pokud extractionOptions je , ["images", "locationMetadata"]výstup obsahuje obrázky a metadata polohy, která poskytují polohu stránky a vizuální informace související s místem extrakce obsahu.
modelName (náhled) Řetězec, například "gpt-4.1". Optional. K dispozici od 2026-05-01-preview rozhraní REST API. Název modelu dokončování chatu OpenAI Azure, který slouží ke generování popisů vložených obrázků, grafů a diagramů. Popis obrázku je nezávislý na obrázku a je možné ho extractionOptions povolit bez extrakce obrázků. Musí být zadána společně s parametrem modelDeployment. Seznam podporovaných modelů najdete v tématu Podporované modely generování.
modelDeployment (náhled) Řetězec. Optional. K dispozici od 2026-05-01-preview rozhraní REST API. Název nasazení modelu Azure OpenAI v prostředku Foundry, který je připojený k sadě dovedností. Musí být zadána společně s parametrem modelName.
chunkingProperties Viz následující tabulka. Možnosti, které zahrnují, jak rozdělit textový obsah.
chunkingProperties Parametry Povolené hodnoty Description
method fixedSize (výchozí) nebo semantic (Preview). K dispozici od 2026-05-01-preview rozhraní REST API. Strategie vytváření bloků dat. fixedSize používá bloky oken založené na znakech. semantic používá bloky dat pracující s rozložením, které respektuje hranice odstavců a inteligentně zpracovává velké tabulky, které pokrývají hranice bloků dat.
unit characters(s fixedSize) nebo tokens (preview s dostupným rozhraním semantic2026-05-01-preview REST API) Ovládá kardinálnost jednotky chunk. Podporují se pouze kombinace fixedSize + characters a semantic + tokens kombinace. Pokud unit je vynechán, je odvozen z method.
maximumLength Když unit je characters, celé číslo mezi 300 a 50 000. Když unit je tokens, celé číslo mezi 100 a 8 000. Výchozí hodnota je 500. Maximální délka bloku dat měřená v konfigurovaném unitsouboru .
overlapLength Celé číslo. Hodnota musí být menší než polovina .maximumLength Délka překrytí mezi dvěma textovými bloky. Platí pouze v případech, kdy method je fixedSize. Musí být vynechán nebo nastaven na 0 hodnotu , pokud method je semantic.

Vstupy dovedností

Název vstupu Description
file_data Soubor, ze kterého by měl být obsah extrahován.

Vstup file_data musí být objektem definovaným jako:

{
  "$type": "file",
  "data": "BASE64 encoded string of the file"
}

Alternativně jej lze definovat jako:

{
  "$type": "file",
  "url": "URL to download the file",
  "sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}

Objekt reference souboru lze generovat jedním z následujících způsobů:

  • Nastavení parametru allowSkillsetToReadFileData v definici indexeru na true. Toto nastavení vytváří cestu /document/file_data , která je objektem reprezentujícím původní data souboru stažená z vašeho blob datového zdroje. Tento parametr platí pouze pro soubory v Azure Blob Storage.

    allowSkillsetToReadFileData zpřístupní stažená data souboru dovednosti. Nezvyšuje limity indexeru objektů blob ani limity služby Content Understanding popsané v omezeních dat.

  • Mít vlastní dovednost vrací definici objektu JSON, která poskytuje $type, data, nebo url a .sastoken Parametr $type musí být nastaven na file, a data musí být základním 64-bajtovým polem obsahu souboru. Parametr url musí být platná URL s přístupem ke stažení souboru na daném místě.

Výstupy schopností

Název výstupu Description
text_sections Sbírka textových bloků. Každý chunk může pokrývat více stránek (s ohledem na další chunking). Objekt bloku textu obsahuje locationMetadata , pokud je k dispozici, a imagePath seznam, když se blok dat překrývá s rozsahy obrázku v dokumentu.
normalized_images Platí pouze tehdy, pokud extractionOptions zahrnuje images. Sbírka obrázků extrahovaných z dokumentu, včetně locationMetadata případných informací.

Každý prvek obsahuje text_sections následující pole:

Pole Typ Description
id String Jedinečný identifikátor bloku dat.
content String Obsah Markdownu pro blok dat Pokud method ano semantic, obsah obsahuje popisy obrázků a tabulek vygenerované pomocí umělé inteligence, které jsou vložené jako Markdown.
locationMetadata Objekt Rozsah stránek a poziční data (pageNumberFrom, pageNumberTo, ordinalPosition, source). Prezentovat, pokud extractionOptions obsahuje locationMetadata.
imagePath String Středník oddělený seznam cest k obrázkům obsaženým v bloku dat. Je k dispozici, když se blok dat překrývá s rozsahy obrázku v dokumentu.

Každý prvek obsahuje normalized_images následující pole:

Pole Typ Description
id String Jedinečný identifikátor obrázku.
data String Data obrázků s kódováním Base64
imagePath String Odkaz na cestu k obrázku v dokumentu, například "figures/0".
locationMetadata Objekt Rozsah stránek a poziční data Prezentovat, pokud extractionOptions obsahuje locationMetadata.

Examples

První příklad používá bloky s pevnou velikostí a ukazuje, jak výstupní textový obsah v blocích s pevnou velikostí a extrahovat obrázky spolu s metadaty umístění z dokumentu. Druhý příklad, který je k dispozici od 2026-05-01-preview rozhraní REST API, používá sémantické bloky dat s popisy obrázků vygenerovanými AI.

Příklad 1: Bloky s pevnou velikostí s extrakcí obrázků a metadat

{
  "skills": [
    {
      "description": "Analyze a document",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {     
          "unit": "characters",
          "maximumLength": 1325, 
          "overlapLength": 0
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        { 
          "name": "text_sections", 
          "targetName": "text_sections" 
        }, 
        { 
          "name": "normalized_images", 
          "targetName": "normalized_images" 
        } 
      ]
    }
  ]
}

Ukázkový výstup

{
  "text_sections": [
      {
        "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
        "content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
        "locationMetadata": {
          "pageNumberFrom": 1,
          "pageNumberTo": 1,
          "ordinalPosition": 0,
          "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
        }
      },
      ...
      {
        "id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
        "content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
        "locationMetadata": {
          "pageNumberFrom": 2,
          "pageNumberTo": 3,
          "ordinalPosition": 3,
          "source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
        }
        ...
      }
    ],
    "normalized_images": [
        { 
            "id": "1_335140f1-9d31-4507-8916-2cde758639cb", 
            "data": "aW1hZ2UgMSBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 1,
              "pageNumberTo": 1,
              "ordinalPosition": 0,
              "source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
            }
        },
        { 
            "id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4", 
            "data": "aW1hZ2UgMiBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 3,
              "pageNumberTo": 3,
              "ordinalPosition": 1,
              "source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
            } 
        }
    ] 
}

locationMetadata je založeno na vlastnosti source poskytované Azure Content Understanding. Pro informace o tom, jak je vizuální pozice prvku v souboru kódována, viz Analýza dokumentu: Extrahování strukturovaného obsahu.

imagePath představuje relativní cestu uloženého obrazu. Pokud je projekce souboru úložiště znalostí nakonfigurována v sadě dovedností, tato cesta odpovídá relativní cestě obrazu uloženého v úložišti.

Příklad 2: Sémantické vytváření bloků s popisem obrázku (Preview)

Tento příklad, který je k dispozici od 2026-05-01-preview rozhraní REST API, používá sémantické vytváření bloků a vytváří popisy vložených obrázků, grafů a diagramů vygenerovaných umělou inteligencí. Prostředek Foundry připojený k sadě dovedností musí mít model dokončení chatu identifikovaný modelName a nasazený modelDeployment.

{
  "skills": [
    {
      "description": "Extract and chunk document content with image descriptions",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "modelName": "gpt-4.1",
      "modelDeployment": "myGpt41Deployment",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {
        "method": "semantic",
        "unit": "tokens",
        "maximumLength": 500
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        {
          "name": "text_sections",
          "targetName": "text_sections"
        },
        {
          "name": "normalized_images",
          "targetName": "normalized_images"
        }
      ]
    }
  ]
}

V případě sémantických bloků dat každý blok text_sections dat obsahuje obsah Markdownu, který obsahuje popisy všech obrázků a tabulek generovaných pomocí AI. Pokud se blok dat překrývá s jedním nebo více rozsahy obrázku, obsahuje objekt bloku také imagePath pole, které obsahuje odpovídající cesty k obrázkům:

{
  "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
  "content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
  "locationMetadata": {
    "pageNumberFrom": 1,
    "pageNumberTo": 1,
    "ordinalPosition": 0,
    "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
  },
  "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}