Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Note
Azure AI Search è disponibile tramite il portale di Azure, le API REST e Azure SDK. È inoltre alla base di Foundry IQ, il livello di conoscenza gestito che trasforma il contenuto aziendale in knowledge base riutilizzabili e con riconoscimento delle autorizzazioni per gli agenti nel portale di Microsoft Foundry.
Importante
Le funzionalità, le funzionalità o le proprietà contrassegnate (anteprima) non sono coperte da un contratto di servizio, non sono consigliate per i carichi di lavoro di produzione e potrebbero cambiare o essere vincolate prima che diventino disponibili a livello generale. Le condizioni di anteprima Azure AI Search si applicano a tutte le funzionalità di anteprima, indipendente o parte di una funzionalità disponibile a livello generale.
La competenza
La competenza Azure Content Understanding è legata a una risorsa fatturabile Microsoft Foundry. A differenza di altre competenze Azure risorse IA, come la competenza Layout dei Documenti, la competenza Azure Content Understanding non fornisce 20 documenti gratuiti per indicizzatore al giorno. L'esecuzione di questa abilità è addebitata al prezzo Azure Content Understanding.
Puoi usare la competenza Azure Content Understanding sia per l'estrazione dei contenuti che per il chunking. Non c'è bisogno di usare l'abilità Text Split nel tuo set di competenze. Questa abilità implementa la stessa interfaccia della competenza Layout Document, che utilizza il modello di layout Azure Document Intelligence in Foundry Tools quando outputFormat è impostato su text. Tuttavia, la competenza Azure Content Understanding offre diversi vantaggi rispetto a quella Document Layout:
Tabelle e figure vengono prodotte in formato Markdown, rendendole più facili da comprendere per i grandi modelli linguistici (LLM). Al contrario, l'abilità Layout Documento genera tabelle e figure come testo semplice, il che può causare perdita di informazioni.
Per le tabelle che si estendono su più pagine, la competenza Azure Content Understanding può riconoscere ed estrarre tabelle tra pagine come singola unità.
La competenza Azure Content Understanding consente ai blocchi di estendersi su più pagine tramite unità semantiche.
La competenza Azure Content Understanding è più conveniente rispetto a quella Document Layout perché l'API Content Understanding è meno costosa.
Azure Content Understanding può generare descrizioni basate sull'intelligenza artificiale per immagini, grafici, diagrammi e figure incorporate. Le descrizioni delle figure incorporate vengono incorporate direttamente nel contenuto markdown generato per il recupero. Queste descrizioni sono disponibili per la ricerca e possono migliorare la qualità del recupero di rag e di recupero categorico.
La competenza Azure Content Understanding è disponibile a livello generale nell'API REST 2026-04-01.
2026-05-01-previewA partire da , la competenza genera facoltativamente descrizioni di immagini basate su intelligenza artificiale per immagini, grafici e diagrammi incorporati in documenti (anteprima). Per abilitare le descrizioni, è necessario distribuire un modello di completamento della chat OpenAI Azure nella risorsa Foundry collegata al set di competenze. Questa versione dell'API aggiunge anche la suddivisione in blocchi semantici (anteprima), un'opzione compatibile con il layout che rispetta i limiti di paragrafo e misura la lunghezza dei blocchi nei token. Entrambe le funzionalità richiedono il consenso esplicito. Quando i nuovi parametri vengono omessi, la competenza si comporta come nella versione stabile 2026-04-01 dell'API.
Limitazioni
La competenza Azure Content Understanding presenta le seguenti limitazioni:
Questa competenza non è adatta a documenti di grandi dimensioni che richiedono più di cinque minuti di elaborazione nell'analizzatore di documenti Content Understanding. L'abilità scade il tempo, ma le cariche continuano a valere sulla risorsa della Fonderia che è legata all'abilità tecnica. Assicurati che i documenti siano ottimizzati per rimanere entro i limiti di elaborazione e evitare costi inutili.
Questa abilità chiama l'analizzatore di documenti Azure Content Understanding, quindi tutti i comportamenti documentati service per diversi tipi di documento si applicano al suo output. Ad esempio, Word (DOCX) e file PDF potrebbero produrre risultati diversi a causa delle differenze nel modo in cui vengono gestite le immagini. Se è necessario un comportamento coerente delle immagini tra DOCX e PDF, si consideri la conversione dei documenti in PDF o la revisione della documentazione di ricerca multimodale per approcci alternativi.
Regioni supportate
La competenza Azure Content Understanding chiama l'API REST 01-01 2025-11-01 REST API. La tua risorsa Foundry deve trovarsi in una regione supportata, descritta in Azure Content Understanding region and language support.
Il tuo servizio di ricerca può essere in qualsiasi Azure AI Search regione. Quando la tua risorsa Foundry e il servizio Azure AI Search non sono nella stessa regione, la latenza di rete tra le regioni influisce sulle prestazioni del tuo indexer.
Formati file supportati
La competenza Azure Content Understanding riconosce i seguenti formati file:
- . JPEG
- .JPG
- .PNG
- .BMP
- .HEIF
- . TIFF
- .DOCX
- . XLSX
- .PPTX
- .HTML
- .TXT
- .MD
- .RTF
- .EML
Lingue disponibili
Per il testo stampato, vedi Azure Content Understanding region and language support.
@odata.type
Microsoft.Skills.Util.ContentUnderstandingSkill
Limiti dei dati
Anche quando la dimensione del file per l'analisi dei documenti rientra nel limite di 200 MB, come descritto nelle quote e limiti Azure Content Understanding Service Comprehension, l'indicizzazione è comunque soggetta ai limiti indexer del tuo livello di servizio di ricerca.
Le dimensioni dell'immagine devono essere comprese tra 50 pixel x 50 pixel oppure 10.000 pixel x 10.000 pixel.
Se i tuoi PDF sono bloccati con password, rimuovi il blocco prima di eseguire l'indicizzatore.
Parametri della competenza
I parametri sono distinti dalla mazzela e minuscola.
| Nome del parametro | Valori consentiti | Description |
|---|---|---|
extractionOptions |
["images"], ["images", "locationMetadata"], ["locationMetadata"] |
Identifica eventuali contenuti aggiuntivi estratti dal documento. Definire un array di enum che corrispondono al contenuto da includere nell'output. Ad esempio, se extractionOptions è ["images", "locationMetadata"], l'output include immagini e metadati di posizione che forniscono la posizione della pagina e informazioni visive relative al luogo in cui il contenuto è stato estratto. |
modelName (anteprima) |
Stringa, ad esempio "gpt-4.1". |
Optional. Disponibile a partire dall'API 2026-05-01-preview REST. Nome del modello di completamento della chat OpenAI Azure usato per generare descrizioni di immagini, grafici e diagrammi incorporati. La descrizione dell'immagine è indipendente da extractionOptions e può essere abilitata senza estrarre immagini. Deve essere specificato insieme a modelDeployment. Per un elenco dei modelli supportati, vedere Modelli generativi supportati. |
modelDeployment (anteprima) |
Stringa | Optional. Disponibile a partire dall'API 2026-05-01-preview REST. Nome della distribuzione del Azure modello OpenAI nella risorsa Foundry collegata al set di competenze. Deve essere specificato insieme a modelName. |
chunkingProperties |
Vedi la tabella seguente. | Opzioni che racchiudono come sbloccare i contenuti testuali. |
chunkingProperties Parametri |
Valori consentiti | Description |
|---|---|---|
method |
fixedSize (impostazione predefinita) o semantic (anteprima). Disponibile a partire dall'API 2026-05-01-preview REST. |
Strategia di suddivisione in blocchi.
fixedSize usa la suddivisione in blocchi finestra basata su caratteri.
semantic usa la suddivisione in blocchi compatibile con il layout che rispetta i limiti dei paragrafi e gestisce in modo intelligente tabelle di grandi dimensioni che si estendono sui limiti dei blocchi. |
unit |
characters (con fixedSize) oppure tokens (anteprima, con semantic, disponibile a partire dall'API 2026-05-01-preview REST). |
Controlla la cardinalità dell'unità chunk. Sono supportate solo le fixedSize + characters combinazioni e .semantic + tokens Se unit viene omesso, viene dedotto da method. |
maximumLength |
Quando unit è characters, un numero intero compreso tra 300 e 50.000. Quando unit è tokens, un numero intero compreso tra 100 e 8.000. Il valore predefinito è 500. |
Lunghezza massima del blocco, misurata nell'oggetto configurato unit. |
overlapLength |
Integer. Il valore deve essere minore della metà di maximumLength. |
Lunghezza della sovrapposizione tra due blocchi di testo. Si applica solo quando method è fixedSize. Deve essere omesso o impostato su 0 quando method è semantic. |
Input delle competenze
| Nome del campo di input | Description |
|---|---|
file_data |
Il file da cui il contenuto dovrebbe essere estratto. |
L'ingresso file_data deve essere un oggetto definito come:
{
"$type": "file",
"data": "BASE64 encoded string of the file"
}
In alternativa, può essere definito come:
{
"$type": "file",
"url": "URL to download the file",
"sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}
L'oggetto di riferimento file può essere generato in uno dei seguenti modi:
Impostare il
allowSkillsetToReadFileDataparametro sulla definizione dell'indicizzatore atrue. Questa impostazione crea un/document/file_datapercorso che rappresenta i dati originali del file scaricati dalla tua sorgente di dati blob. Questo parametro si applica solo ai file in Archiviazione BLOB di Azure.allowSkillsetToReadFileDatarende i dati dei file scaricati disponibili per la competenza. Non aumenta i limiti dell'indicizzatore BLOB o i limiti del servizio Content Understanding descritti in Limiti dei dati.Avere una skill personalizzata che restituisce una definizione di oggetto JSON che fornisce
$type,data, oppureurlesastoken. Il parametro$typedeve essere impostato sufile, edatadeve essere l'array di byte codificato in base a 64 del contenuto del file. Ilurlparametro deve essere un URL valido con accesso per scaricare il file in quella posizione.
Output delle competenze
| Nome dell'output | Description |
|---|---|
text_sections |
Una raccolta di oggetti a pezzi di testo. Ogni blocco può occuparsi di più pagine (considerando eventuali ulteriori blocchi configurati). L'oggetto blocco di testo include locationMetadata , se applicabile, e un imagePath elenco quando il blocco si sovrappone a intervalli di figure nel documento. |
normalized_images |
Si applica solo se extractionOptions include images. Una raccolta di immagini estratte dal documento, incluso locationMetadata , se applicabile. |
Ogni elemento in text_sections ha i campi seguenti:
| Campo | Type | Description |
|---|---|---|
id |
String | Identificatore univoco per il blocco. |
content |
String | Contenuto markdown per il blocco. Quando method è semantic, il contenuto include descrizioni generate dall'intelligenza artificiale delle figure e delle tabelle inlined come Markdown. |
locationMetadata |
oggetto | Intervallo di pagine e dati posizionaali (pageNumberFrom, pageNumberTo, ordinalPosition, source). Presente quando extractionOptions include locationMetadata. |
imagePath |
String | Elenco delimitato da punto e virgola dei percorsi delle immagini contenute nel blocco. Presente quando il blocco si sovrappone a quello della figura nel documento. |
Ogni elemento in normalized_images ha i campi seguenti:
| Campo | Type | Description |
|---|---|---|
id |
String | Identificatore univoco per l'immagine. |
data |
String | Dati dell'immagine con codifica Base64. |
imagePath |
String | Riferimento di percorso all'immagine all'interno del documento, ad esempio "figures/0". |
locationMetadata |
oggetto | Intervallo di pagine e dati posizionale. Presente quando extractionOptions include locationMetadata. |
Examples
Il primo esempio usa la suddivisione in blocchi a dimensione fissa e illustra come restituire contenuto di testo in blocchi a dimensione fissa ed estrarre immagini insieme ai metadati della posizione dal documento. Il secondo esempio, disponibile a partire dall'API REST, usa la 2026-05-01-preview suddivisione in blocchi semantici con le descrizioni delle immagini generate dall'intelligenza artificiale.
Esempio 1: suddivisione in blocchi a dimensione fissa con l'estrazione di immagini e metadati
{
"skills": [
{
"description": "Analyze a document",
"@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
"context": "/document",
"extractionOptions": ["images", "locationMetadata"],
"chunkingProperties": {
"unit": "characters",
"maximumLength": 1325,
"overlapLength": 0
},
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "text_sections",
"targetName": "text_sections"
},
{
"name": "normalized_images",
"targetName": "normalized_images"
}
]
}
]
}
Output di esempio
{
"text_sections": [
{
"id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
"content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
}
},
...
{
"id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
"content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
"locationMetadata": {
"pageNumberFrom": 2,
"pageNumberTo": 3,
"ordinalPosition": 3,
"source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
}
...
}
],
"normalized_images": [
{
"id": "1_335140f1-9d31-4507-8916-2cde758639cb",
"data": "aW1hZ2UgMSBkYXRh",
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
}
},
{
"id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4",
"data": "aW1hZ2UgMiBkYXRh",
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",
"locationMetadata": {
"pageNumberFrom": 3,
"pageNumberTo": 3,
"ordinalPosition": 1,
"source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
}
}
]
}
locationMetadata si basa sulla proprietà source fornita da Azure Content Understanding. Per informazioni su come la posizione visiva dell'elemento nel file viene codificata, vedi Analisi documentale: Estrazione del contenuto strutturato.
imagePath rappresenta il percorso relativo di un'immagine memorizzata. Se la proiezione del file dello store della conoscenza è configurata nell'skill set, questo percorso corrisponde al percorso relativo dell'immagine memorizzata nello store della conoscenza.
Esempio 2: Suddivisione semantica in blocchi con descrizione dell'immagine (anteprima)
Questo esempio, disponibile a partire dall'API REST, usa la 2026-05-01-preview suddivisione in blocchi semantici e produce descrizioni generate dall'intelligenza artificiale di immagini, grafici e diagrammi incorporati. La risorsa Foundry collegata al set di competenze deve avere il modello di completamento della chat identificato da modelName e l'oggetto distribuito modelDeployment.
{
"skills": [
{
"description": "Extract and chunk document content with image descriptions",
"@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
"context": "/document",
"modelName": "gpt-4.1",
"modelDeployment": "myGpt41Deployment",
"extractionOptions": ["images", "locationMetadata"],
"chunkingProperties": {
"method": "semantic",
"unit": "tokens",
"maximumLength": 500
},
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "text_sections",
"targetName": "text_sections"
},
{
"name": "normalized_images",
"targetName": "normalized_images"
}
]
}
]
}
Con la suddivisione in blocchi semantici, ogni blocco in text_sections contiene contenuto Markdown che include descrizioni generate dall'intelligenza artificiale di qualsiasi figura e tabella che copre. Quando un blocco si sovrappone a uno o più intervalli di figure, l'oggetto blocchi include anche un imagePath campo che elenca i percorsi di immagine corrispondenti:
{
"id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
"content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
},
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}