Azure Content Understanding compétence

Remarque

Recherche Azure AI est disponible via le portail Azure, les API REST et les SDK Azure. Il sous-tend également Foundry IQ, la couche de connaissances managée qui transforme le contenu d’entreprise en bases de connaissances réutilisables et prenant en charge les autorisations pour les agents dans le portail Microsoft Foundry.

Important

Les fonctionnalités, fonctionnalités ou propriétés marquées (préversion) ne sont pas couvertes par un contrat de niveau de service, ne sont pas recommandées pour les charges de travail de production et peuvent changer ou être limitées avant qu’elles ne soient généralement disponibles. Les Recherche Azure AI termes de la préversion s'appliquent à toutes les fonctionnalités d'aperçu, qu'il s'agisse d'une fonctionnalité autonome ou d'une partie d'une fonctionnalité généralement disponible.

La compétence Azure Content Understanding utilise documents issus de Azure Content Understanding in Foundry Tools pour analyser des documents non structurés et d’autres types de contenu, générant des sorties organisées et consultables pouvant être intégrées dans des charges de travail d’automatisation. Cette compétence extrait à la fois du texte et des images, y compris les métadonnées de localisation qui préservent la position de chaque image dans le document. La proximité des images avec des contenus connexes est particulièrement utile pour la recherche multimodale, la récupération agente et la génération augmentée par la récupération (RAG).

La compétence Azure Compréhension du contenu est liée à une ressource facturable Microsoft Foundry. Contrairement à d'autres compétences Azure ressources IA, comme la compétence Mise en page de documents, la compétence Azure Compréhension du contenu ne fournit pas 20 documents gratuits par indexeur et par jour. L’exécution de cette compétence est facturée au prix Azure Content Understanding.

Vous pouvez utiliser la compétence Azure Content Understanding pour l’extraction et le chunking. Il n’est pas nécessaire d’utiliser la compétence Répartition du texte dans votre ensemble de compétences. Cette compétence implémente la même interface que la compétence Mise en page de documents, qui utilise le modèle de mise en page Azure Document Intelligence dans Foundry Tools lorsque outputFormat est réglé sur text. Cependant, la compétence Azure Content Understanding offre plusieurs avantages par rapport à la compétence Composition de documents :

  • Les tableaux et les figures sont générés au format Markdown, ce qui les rend plus faciles à comprendre pour les grands modèles de langage (LLM). En revanche, la compétence Mise en page de document produit des tableaux et des figures sous forme de texte brut, ce qui peut entraîner une perte d’information.

  • Pour les tables qui s’étendent sur plusieurs pages, la compétence Azure Content Understanding peut reconnaître et extraire des tables de pages croisées sous la forme d’une unité unique.

  • La compétence Azure Content Understanding permet aux segments d’étendre plusieurs pages via des unités sémantiques.

  • La compétence Azure Content Understanding est plus économique que la compétence Document Layout car l’API Content Understanding est moins chère.

  • Azure Content Understanding peut générer des descriptions basées sur l’IA pour les images, les graphiques, les diagrammes et les figures incorporées. Les descriptions de figure incorporées sont incorporées directement dans le contenu Markdown généré pour la récupération. Ces descriptions sont pouvant faire l’objet d’une recherche et améliorer la qualité de récupération modale et de base de RAG.

La compétence Azure Content Understanding est généralement disponible dans l’API REST 2026-04-01. À compter du 2026-05-01-preview, la compétence génère éventuellement des descriptions d’images basées sur l’IA pour les images, graphiques et diagrammes incorporés dans des documents (préversion). Pour activer les descriptions, vous devez déployer un modèle d’achèvement de conversation OpenAI Azure dans la ressource Foundry attachée à l’ensemble de compétences. Cette version de l’API ajoute également la segmentation sémantique (préversion), une option prenant en charge la disposition qui respecte les limites des paragraphes et mesure la longueur du bloc dans les jetons. Les deux fonctionnalités nécessitent l’adhésion. Lorsque les nouveaux paramètres sont omis, la compétence se comporte comme dans la version stable 2026-04-01 de l’API.

Limitations

La compétence Azure Content Understanding présente les limitations suivantes :

  • Cette compétence n’est pas adaptée aux documents volumineux nécessitant plus de cinq minutes de traitement dans l’analyseur de documents Content Understanding. La compétence expire, mais les charges s’appliquent toujours à la ressource Fonderie qui est associée à l’ensemble des compétences. Assurez-vous que les documents sont optimisés pour respecter les limites de traitement afin d’éviter des coûts inutiles.

  • Cette compétence appelle l’analyseur de documents Azure Content Understanding, donc tous les comportements service documentés pour différents types de documents s’appliquent à sa sortie. Par exemple, Word (DOCX) et les fichiers PDF peuvent produire des résultats différents en raison de la manière dont les images sont traitées. Si un comportement cohérent des images entre DOCX et PDF est nécessaire, envisagez de convertir des documents en PDF ou de consulter la documentation de recherche multimodale pour trouver d’autres approches.

Régions prises en charge

La compétence Azure Content Understanding appelle l’API REST 1-11-01 REST API. Votre ressource Foundry doit se trouver dans une région prise en charge, ce qui est décrit dans Azure Compréhension du contenu région et support linguistique.

Votre service de recherche peut se trouver dans n’importe quelle région Recherche Azure AI supportée. Lorsque votre ressource Foundry et le service Recherche Azure AI ne sont pas dans la même région, la latence réseau interrégionale impacte les performances de votre indexeur.

Formats de fichiers pris en charge

La compétence Azure Content Understanding reconnaît les formats de fichiers suivants :

  • .PDF
  • . JPEG
  • .JPG
  • .PNG
  • .BMP
  • .HEIF
  • . TIFF
  • .DOCX
  • . XLSX
  • .PPTX
  • .HTML
  • .TXT
  • .MD
  • .RTF
  • .EML

Langues prises en charge

Pour le texte imprimé, voir Azure Content Understanding region and language support .

@odata.type

Microsoft.Skills.Util.ContentUnderstandingSkill

Limites des données

  • Même lorsque la taille du fichier pour analyser les documents est dans la limite de 200 Mo, comme décrit dans les quotas et limites de service Azure Content Understanding , l’indexation reste soumise aux limites indexeur de votre niveau de service de recherche.

  • Les dimensions de l’image doivent être comprises entre 50 pixels x 50 pixels ou 10 000 pixels x 10 000 pixels.

  • Si vos PDF sont verrouillés par mot de passe, retirez le verrou avant d’exécuter l’indexeur.

Paramètres de compétence

Les paramètres sont sensibles à la casse.

Nom du paramètre Valeurs autorisées Description
extractionOptions ["images"], , ["images", "locationMetadata"]["locationMetadata"] Identifiez tout contenu supplémentaire extrait du document. Définissez un tableau d’enums correspondant au contenu à inclure dans la sortie. Par exemple, si extractionOptions est ["images", "locationMetadata"], la sortie inclut des images et des métadonnées de localisation qui fournissent l’emplacement de la page et des informations visuelles liées à l’endroit où le contenu a été extrait.
modelName (préversion) Chaîne, telle que "gpt-4.1". Optionnel. Disponible à partir de l’API 2026-05-01-preview REST. Nom du modèle d’achèvement de conversation OpenAI Azure utilisé pour générer des descriptions d’images incorporées, de graphiques et de diagrammes. La description de extractionOptions l’image est indépendante et peut être activée sans extraire d’images. Doit être spécifié avec modelDeployment. Pour obtenir la liste des modèles pris en charge, consultez modèles générateurs pris en charge.
modelDeployment (préversion) Chaîne. Optionnel. Disponible à partir de l’API 2026-05-01-preview REST. Nom de déploiement du modèle OpenAI Azure dans la ressource Foundry attachée à l'ensemble de compétences. Doit être spécifié avec modelName.
chunkingProperties Voir le tableau suivant. Des options qui résument comment fragmenter le contenu textuel.
chunkingProperties Paramètres Valeurs autorisées Description
method fixedSize (par défaut) ou semantic (préversion). Disponible à partir de l’API 2026-05-01-preview REST. Stratégie de segmentation. fixedSize utilise la segmentation fenêtré basée sur des caractères. semantic utilise la segmentation prenant en charge la disposition qui respecte les limites des paragraphes et gère intelligemment les grandes tables qui s’étendent sur les limites de segment.
unit characters (avec fixedSize) ou tokens (préversion, avec semantic, disponible à partir de l’API 2026-05-01-preview REST). Contrôle la cardinalité de l’unité chunk. Seules les combinaisons etfixedSize + charactersles semantic + tokens combinaisons sont prises en charge. Si unit elle est omise, elle est déduite de method.
maximumLength Quand unit est characters, entier compris entre 300 et 50 000. Quand unit est tokens, entier compris entre 100 et 8 000. La valeur par défaut est 500. Longueur maximale du bloc, mesurée dans le fichier configuré unit.
overlapLength Entier. La valeur doit être inférieure à la moitié de maximumLength. Longueur du chevauchement entre deux blocs de texte. S’applique uniquement quand method est fixedSize. Doit être omis ou défini sur 0 le moment method où est semantic.

Données de compétences

Nom de saisie Description
file_data Le fichier dont le contenu doit être extrait.

L’entrée file_data doit être un objet défini comme :

{
  "$type": "file",
  "data": "BASE64 encoded string of the file"
}

Alternativement, elle peut être définie comme suit :

{
  "$type": "file",
  "url": "URL to download the file",
  "sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}

L’objet de référence de fichier peut être généré de l’une des manières suivantes :

  • Définir le allowSkillsetToReadFileData paramètre de votre définition d’indexeur à true. Ce paramètre crée un /document/file_data chemin représentant les données originales du fichier téléchargées depuis votre source de données blob. Ce paramètre ne s’applique qu’aux fichiers dans Stockage Blob Azure.

    allowSkillsetToReadFileData rend les données de fichier téléchargées disponibles pour la compétence. Elle n’augmente pas les limites de l’indexeur d’objets blob ou les limites de service Content Understanding décrites dans les limites de données.

  • Avoir une compétence personnalisée retournant une définition d’objet JSON qui fournit $type, data, ou url et sastoken. Le $type paramètre doit être fixé à file, et data doit être le tableau d’octets encodé de base de 64 du contenu du fichier. Le url paramètre doit être une URL valide avec accès pour télécharger le fichier à cet endroit.

Résultats des compétences

Nom de sortie Description
text_sections Une collection d’objets de blocs de texte. Chaque morceau peut s’étendre sur plusieurs pages (en tenant compte de tout autre blocage configuré). L’objet bloc de texte inclut locationMetadata , le cas échéant, et une imagePath liste lorsque le bloc se chevauche avec les étendues de figure dans le document.
normalized_images Ne s’applique que si extractionOptions inclut images. Une collection d’images extraites du document, y compris locationMetadata le cas échéant.

Chaque élément dans lequel se text_sections présente les champs suivants :

Champ Type Description
id String Identificateur unique pour le bloc.
content String Contenu Markdown pour le bloc. Quand method c’est semanticle cas, le contenu inclut des descriptions générées par l’IA des figures et des tables insérées en tant que Markdown.
locationMetadata Object Plage de pages et données positionnelles (pageNumberFrom, pageNumberTo, ordinalPositionsource). Présente quand extractionOptions inclut locationMetadata.
imagePath String Liste séparée par des points-virgules des chemins d’accès aux images contenues dans le bloc. Présente lorsque le bloc se chevauche avec des étendues de figure dans le document.

Chaque élément dans lequel se normalized_images présente les champs suivants :

Champ Type Description
id String Identificateur unique de l’image.
data String Données d’image encodées en base64.
imagePath String Référence de chemin d’accès à l’image dans le document, par "figures/0"exemple .
locationMetadata Object Plage de pages et données positionnelles. Présente quand extractionOptions inclut locationMetadata.

Exemples

Le premier exemple utilise la segmentation de taille fixe et montre comment générer du contenu de texte dans des blocs de taille fixe et extraire des images ainsi que des métadonnées d’emplacement du document. Le deuxième exemple, disponible à partir de l’API 2026-05-01-preview REST, utilise la segmentation sémantique avec des descriptions d’images générées par l’IA.

Exemple 1 : segmentation de taille fixe avec extraction d’images et de métadonnées

{
  "skills": [
    {
      "description": "Analyze a document",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {     
          "unit": "characters",
          "maximumLength": 1325, 
          "overlapLength": 0
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        { 
          "name": "text_sections", 
          "targetName": "text_sections" 
        }, 
        { 
          "name": "normalized_images", 
          "targetName": "normalized_images" 
        } 
      ]
    }
  ]
}

Exemple de résultat

{
  "text_sections": [
      {
        "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
        "content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
        "locationMetadata": {
          "pageNumberFrom": 1,
          "pageNumberTo": 1,
          "ordinalPosition": 0,
          "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
        }
      },
      ...
      {
        "id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
        "content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
        "locationMetadata": {
          "pageNumberFrom": 2,
          "pageNumberTo": 3,
          "ordinalPosition": 3,
          "source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
        }
        ...
      }
    ],
    "normalized_images": [
        { 
            "id": "1_335140f1-9d31-4507-8916-2cde758639cb", 
            "data": "aW1hZ2UgMSBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 1,
              "pageNumberTo": 1,
              "ordinalPosition": 0,
              "source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
            }
        },
        { 
            "id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4", 
            "data": "aW1hZ2UgMiBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 3,
              "pageNumberTo": 3,
              "ordinalPosition": 1,
              "source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
            } 
        }
    ] 
}

locationMetadata est basé sur la propriété source fournie par Azure Content Understanding. Pour des informations sur la manière dont la position visuelle de l’élément dans le fichier est encodée, voir Analyse du document : Extraire le contenu structuré.

imagePath représente le chemin relatif d’une image stockée. Si la projection du fichier du magasin de connaissances est configurée dans le jeu de compétences, ce chemin correspond au chemin relatif de l’image stockée dans le magasin de connaissances.

Exemple 2 : segmentation sémantique avec description de l’image (préversion)

Cet exemple, disponible à partir de l’API REST, utilise la 2026-05-01-preview segmentation sémantique et produit des descriptions générées par l’IA des images incorporées, des graphiques et des diagrammes. La ressource Foundry attachée à l’ensemble de compétences doit avoir le modèle d’achèvement de conversation identifié par modelName et le déploiement modelDeployment.

{
  "skills": [
    {
      "description": "Extract and chunk document content with image descriptions",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "modelName": "gpt-4.1",
      "modelDeployment": "myGpt41Deployment",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {
        "method": "semantic",
        "unit": "tokens",
        "maximumLength": 500
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        {
          "name": "text_sections",
          "targetName": "text_sections"
        },
        {
          "name": "normalized_images",
          "targetName": "normalized_images"
        }
      ]
    }
  ]
}

Avec la segmentation sémantique, chaque bloc contient text_sections du contenu Markdown qui inclut des descriptions générées par l’IA de toutes les figures et tables qu’il couvre. Lorsqu’un bloc chevauche une ou plusieurs étendues de figure, l’objet segment inclut également un imagePath champ qui répertorie les chemins d’accès d’image correspondants :

{
  "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
  "content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
  "locationMetadata": {
    "pageNumberFrom": 1,
    "pageNumberTo": 1,
    "ordinalPosition": 0,
    "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
  },
  "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}