Azure Content Understanding habilidad

Note

Búsqueda de Azure AI está disponible a través del portal de Azure, las API REST y los SDK de Azure. También respalda Foundry IQ, la capa de conocimiento administrada que transforma el contenido empresarial en bases de conocimiento reutilizables y compatibles con permisos para agentes en el portal de Microsoft Foundry.

Importante

Las características, funcionalidades o propiedades marcadas (versión preliminar) no están cubiertas por un contrato de nivel de servicio, no se recomiendan para cargas de trabajo de producción y pueden cambiar o restringirse antes de que estén disponibles con carácter general. Los términos de la versión preliminar Búsqueda de Azure AI se aplican a todas las funciones de vista previa, ya sea independiente o parte de una característica disponible con carácter general.

La habilidad Azure Content Understanding utiliza documentos de Azure Content Understanding in Foundry Tools para analizar documentos no estructurados y otros tipos de contenido, generando resultados organizados y buscables que pueden integrarse en cargas de trabajo de automatización. Esta habilidad extrae tanto texto como imágenes, incluyendo metadatos de ubicación que preservan la posición de cada imagen dentro del documento. La proximidad de imágenes a contenido relacionado es especialmente útil para la búsqueda multimodal, la recuperación agente y la generación aumentada por recuperación (RAG).

La habilidad de Comprensión de Contenidos Azure está vinculada a un recurso facturable Microsoft Foundry. A diferencia de otras habilidades Azure recursos de IA, como la habilidad Layout de Documentos, la habilidad de Comprensión de Contenidos Azure no proporciona 20 documentos gratuitos por indexador al día. La ejecución de esta habilidad se cobra al precio Azure Comprensión de Contenido.

Puedes usar la habilidad de Comprensión de Contenidos de Azure tanto para extraer contenido como para fragmentar. No necesitas usar la habilidad División de Texto en tu conjunto de habilidades. Esta habilidad implementa la misma interfaz que la habilidad de Diseño de Documentos, que utiliza el modelo de diseño Azure Inteligencia de Documentos en Foundry Tools cuando outputFormat está configurado en text. Sin embargo, la habilidad de Comprensión de Contenido de Azure ofrece varias ventajas sobre la habilidad de Diseño de Documentos:

  • Las tablas y figuras se generan en formato Markdown, lo que facilita su comprensión para los grandes modelos de lenguaje (LLM). En cambio, la habilidad Layout de Documentos genera tablas y figuras como texto plano, lo que puede provocar pérdida de información.

  • En el caso de las tablas que abarcan varias páginas, la aptitud Azure Content Understanding puede reconocer y extraer tablas entre páginas como una sola unidad.

  • La aptitud Azure Content Understanding permite que los fragmentos abarquen varias páginas a través de unidades semánticas.

  • La habilidad de Comprensión de Contenidos de Azure es más rentable que la de Diseño de Documentos porque la API de Comprensión de Contenidos es más barata.

  • Azure Content Understanding puede generar descripciones basadas en IA para imágenes, gráficos, diagramas e ilustraciones incrustadas. Las descripciones de ilustración incrustadas se incorporan directamente en el contenido de Markdown generado para su recuperación. Estas descripciones son buscables y pueden mejorar la calidad de recuperación de rag y base de RAG.

La aptitud Azure Content Understanding está disponible con carácter general en 2026-04-01 API REST. A partir de 2026-05-01-preview, la aptitud genera opcionalmente descripciones de imágenes basadas en IA para imágenes, gráficos y diagramas incrustados en documentos (versión preliminar). Para habilitar las descripciones, debe implementar un Azure modelo de finalización de chat de OpenAI en el recurso Foundry asociado al conjunto de aptitudes. Esta versión de API también agrega fragmentación semántica (versión preliminar), una opción compatible con el diseño que respeta los límites de párrafo y mide la longitud del fragmento en los tokens. Ambas funcionalidades requieren participación. Cuando se omiten los nuevos parámetros, la aptitud se comporta igual que en la versión estable 2026-04-01 de la API.

Limitaciones

La habilidad de Comprensión de Contenidos de Azure tiene las siguientes limitaciones:

  • Esta habilidad no es adecuada para documentos grandes que requieren más de cinco minutos de procesamiento en el analizador de documentos de Comprensión de Contenido. La habilidad se agota, pero los cargos siguen aplicándose al recurso de la Fundición que está asociado a esa habilidad. Asegúrate de que los documentos estén optimizados para mantenerse dentro de los límites de procesamiento y evitar costes innecesarios.

  • Esta habilidad llama al analizador de documentos de Comprensión de Contenido Azure, por lo que todos los comportamientos documentados servicio para diferentes tipos de documentos se aplican a su resultado. Por ejemplo, los archivos de Word (DOCX) y PDF pueden producir resultados diferentes debido a diferencias en la forma en que se gestionan las imágenes. Si se requiere un comportamiento consistente de las imágenes entre DOCX y PDF, considera convertir documentos a PDF o revisar la documentación de búsqueda multimodal para encontrar enfoques alternativos.

Regiones soportadas

La habilidad de Comprensión Azure de Contenidos llama a Understanding 2025-11-01/c0>. Tu recurso de Foundry debe estar en una región soportada, que se describe en Azure Content Understanding region and language support .

Tu servicio de búsqueda puede estar en cualquier región Búsqueda de Azure AI soportada. Cuando tu recurso de Foundry y el servicio Búsqueda de Azure AI no están en la misma región, la latencia de la red entre regiones afecta al rendimiento de tu indexador.

Formatos de archivo compatibles

La habilidad Azure Content Understanding reconoce los siguientes formatos de archivo:

  • .PDF
  • . JPEG
  • .JPG
  • .PNG
  • .BMP
  • .HEIF
  • . TIFF
  • .DOCX
  • . XLSX
  • .PPTX
  • .HTML
  • .TXT
  • .MD
  • .RTF
  • .EML

Idiomas compatibles

Para texto impreso, véase Azure Content Understanding region and language support .

@odata.type

Microsoft.Skills.Util.ContentUnderstandingSkill

Límites de datos

  • Incluso cuando el tamaño del archivo para analizar documentos está dentro del límite de 200 MB, como se describe en las cuotas y límites de servicio Azure Content Understanding , la indexación sigue estando sujeta a los límites indexer de tu nivel de servicio de búsqueda.

  • Las dimensiones de la imagen deben estar entre 50 píxeles x 50 píxeles o 10.000 píxeles x 10.000 píxeles.

  • Si tus PDFs están bloqueados con contraseña, elimina el bloqueo antes de ejecutar el indexador.

Parámetros de aptitud

Los parámetros son sensibles a mayúsculas y mayúsculas.

Nombre del parámetro Valores permitidos Descripción
extractionOptions ["images"], , ["images", "locationMetadata"], ["locationMetadata"] Identifica cualquier contenido extra extraído del documento. Define un array de enums que corresponden al contenido que se va a incluir en la salida. Por ejemplo, si extractionOptions es ["images", "locationMetadata"], la salida incluye imágenes y metadatos de ubicación que proporcionan la ubicación de la página e información visual relacionada con el lugar donde se extrajo el contenido.
modelName (versión preliminar) Cadena, como "gpt-4.1". Opcional. Disponible a partir de la 2026-05-01-preview API REST. Nombre del modelo de finalización de chat de OpenAI Azure usado para generar descripciones de imágenes, gráficos y diagramas incrustados. La descripción de la imagen es independiente de extractionOptions y se puede habilitar sin extraer imágenes. Debe especificarse junto con modelDeployment. Para obtener una lista de los modelos admitidos, consulte Modelos generativos admitidos.
modelDeployment (versión preliminar) Cuerda. Opcional. Disponible a partir de la 2026-05-01-preview API REST. Nombre de implementación del Azure modelo de OpenAI en el recurso Foundry que está asociado al conjunto de aptitudes. Debe especificarse junto con modelName.
chunkingProperties Véase la siguiente tabla. Opciones que encapsulan cómo fragmentar contenido de texto.
chunkingProperties Parámetros Valores permitidos Descripción
method fixedSize (valor predeterminado) o semantic (versión preliminar). Disponible a partir de la 2026-05-01-preview API REST. Estrategia de fragmentación. fixedSize usa la fragmentación de ventanas basada en caracteres. semantic usa la fragmentación compatible con el diseño que respeta los límites de párrafo y controla inteligentemente las tablas grandes que abarcan límites de fragmentos.
unit characters (con fixedSize) o tokens (versión preliminar, con semantic, disponible a partir de la 2026-05-01-preview API REST). Controla la cardinalidad de la unidad chunk. Solo se admiten las fixedSize + characters combinaciones y .semantic + tokens Si unit se omite, se deduce de method.
maximumLength Cuando unit es characters, un entero entre 300 y 50 000. Cuando unit es tokens, un entero entre 100 y 8000. El valor predeterminado es 500. Longitud máxima del fragmento, medida en el configurado unit.
overlapLength Entero. El valor debe ser menor que la mitad de maximumLength. Longitud de superposición entre dos fragmentos de texto. Solo se aplica cuando method es fixedSize. Debe omitirse o establecerse en 0 cuando method es semantic.

Entradas de habilidades

Nombre de entrada Descripción
file_data El archivo del que se debe extraer el contenido.

La file_data entrada debe ser un objeto definido como:

{
  "$type": "file",
  "data": "BASE64 encoded string of the file"
}

Alternativamente, puede definirse como:

{
  "$type": "file",
  "url": "URL to download the file",
  "sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}

El objeto de referencia de archivo puede generarse de una de las siguientes maneras:

  • Establecer el allowSkillsetToReadFileData parámetro en la definición de tu indexador en true. Esta configuración crea una /document/file_data ruta que representa los datos originales del archivo descargados de tu fuente de datos blob. Este parámetro solo se aplica a archivos en Azure Blob Storage.

    allowSkillsetToReadFileData hace que los datos de archivo descargados estén disponibles para la aptitud. No aumenta los límites del indexador de blobs ni los límites del servicio Content Understanding descritos en Límites de datos.

  • Tener una habilidad personalizada que devuelva una definición de objeto JSON que proporcione $type, data, o url y sastoken. El $type parámetro debe establecerse en file, y data debe ser el array de bytes codificado en base de 64 del contenido del archivo. El url parámetro debe ser una URL válida con acceso para descargar el archivo en esa ubicación.

Resultados de habilidades

Nombre de salida Descripción
text_sections Una colección de objetos de fragmentos de texto. Cada fragmento puede abarcar varias páginas (teniendo en cuenta cualquier fragmento adicional configurado). El objeto de fragmento de texto incluye locationMetadata , si procede, y una imagePath lista cuando el fragmento se superpone con intervalos de figura en el documento.
normalized_images Solo se aplica si extractionOptions incluye images. Una colección de imágenes extraídas del documento, incluyendo locationMetadata si correspondía.

Cada elemento de text_sections tiene los siguientes campos:

Campo Tipo Descripción
id String Identificador único del fragmento.
content String Contenido de Markdown para el fragmento. Cuando method es semantic, el contenido incluye descripciones generadas por IA de ilustraciones y tablas insertadas como Markdown.
locationMetadata Objeto Intervalo de páginas y datos posicionales (pageNumberFrom, pageNumberTo, ordinalPosition, source). Presente cuando extractionOptions incluye locationMetadata.
imagePath String Lista separada por punto y coma de rutas de acceso a imágenes contenidas en el fragmento. Presente cuando el fragmento se superpone con intervalos de figura en el documento.

Cada elemento de normalized_images tiene los siguientes campos:

Campo Tipo Descripción
id String Identificador único de la imagen.
data String Datos de imagen codificados en Base64.
imagePath String Referencia de ruta de acceso a la imagen dentro del documento, como "figures/0".
locationMetadata Objeto Intervalo de páginas y datos posicionales. Presente cuando extractionOptions incluye locationMetadata.

Ejemplos

En el primer ejemplo se usa la fragmentación de tamaño fijo y se muestra cómo generar contenido de texto en fragmentos de tamaño fijo y extraer imágenes junto con metadatos de ubicación del documento. En el segundo ejemplo, disponible a partir de la 2026-05-01-preview API REST, se usa la fragmentación semántica con descripciones de imágenes generadas por IA.

Ejemplo 1: fragmentación de tamaño fijo con extracción de imágenes y metadatos

{
  "skills": [
    {
      "description": "Analyze a document",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {     
          "unit": "characters",
          "maximumLength": 1325, 
          "overlapLength": 0
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        { 
          "name": "text_sections", 
          "targetName": "text_sections" 
        }, 
        { 
          "name": "normalized_images", 
          "targetName": "normalized_images" 
        } 
      ]
    }
  ]
}

Salida de ejemplo

{
  "text_sections": [
      {
        "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
        "content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
        "locationMetadata": {
          "pageNumberFrom": 1,
          "pageNumberTo": 1,
          "ordinalPosition": 0,
          "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
        }
      },
      ...
      {
        "id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
        "content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
        "locationMetadata": {
          "pageNumberFrom": 2,
          "pageNumberTo": 3,
          "ordinalPosition": 3,
          "source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
        }
        ...
      }
    ],
    "normalized_images": [
        { 
            "id": "1_335140f1-9d31-4507-8916-2cde758639cb", 
            "data": "aW1hZ2UgMSBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 1,
              "pageNumberTo": 1,
              "ordinalPosition": 0,
              "source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
            }
        },
        { 
            "id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4", 
            "data": "aW1hZ2UgMiBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 3,
              "pageNumberTo": 3,
              "ordinalPosition": 1,
              "source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
            } 
        }
    ] 
}

locationMetadata se basa en la propiedad source proporcionada por Azure Content Understanding. Para información sobre cómo se codifica la posición visual del elemento en el archivo, véase Análisis de documentos: Extraer contenido estructurado.

imagePath representa el camino relativo de una imagen almacenada. Si la proyección del archivo del almacén de conocimiento está configurada en el conjunto de habilidades, esta ruta coincide con la ruta relativa de la imagen almacenada en el almacén de conocimientos.

Ejemplo 2: fragmentación semántica con la descripción de la imagen (versión preliminar)

En este ejemplo, disponible a partir de la 2026-05-01-preview API REST, se usa la fragmentación semántica y se generan descripciones generadas por IA de imágenes incrustadas, gráficos y diagramas. El recurso Foundry asociado al conjunto de aptitudes debe tener el modelo de finalización de chat identificado por modelName y el implementado modelDeployment.

{
  "skills": [
    {
      "description": "Extract and chunk document content with image descriptions",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "modelName": "gpt-4.1",
      "modelDeployment": "myGpt41Deployment",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {
        "method": "semantic",
        "unit": "tokens",
        "maximumLength": 500
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        {
          "name": "text_sections",
          "targetName": "text_sections"
        },
        {
          "name": "normalized_images",
          "targetName": "normalized_images"
        }
      ]
    }
  ]
}

Con la fragmentación semántica, cada fragmento de text_sections contiene contenido de Markdown que incluye descripciones generadas por IA de las ilustraciones y tablas que cubre. Cuando un fragmento se superpone con uno o varios intervalos de figura, el objeto de fragmento también incluye un imagePath campo que enumera las rutas de acceso de imagen correspondientes:

{
  "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
  "content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
  "locationMetadata": {
    "pageNumberFrom": 1,
    "pageNumberTo": 1,
    "ordinalPosition": 0,
    "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
  },
  "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}