Azure Content Understanding habilidade

Observação

Pesquisa de IA do Azure  está disponível por meio do portal Azure, APIs REST e SDKs do Azure. Ele também sustenta o IQ do Foundry, a camada de conhecimento gerenciado que transforma o conteúdo da empresa em bases de conhecimento reutilizáveis e com reconhecimento de permissão para agentes no portal do Microsoft Foundry.

Importante

Recursos, recursos ou propriedades marcadas (versão prévia) não são cobertos por um contrato de nível de serviço, não são recomendados para cargas de trabalho de produção e podem ser alterados ou restringidos antes de ficarem disponíveis em geral. Os Pesquisa de IA do Azure  termos de visualização se aplicam a todas as funcionalidades de visualização, seja ela autônoma ou parte de um recurso disponível em geral.

A habilidade Azure Compreensão de Conteúdo utiliza documentos de Azure Content Understanding in Foundry Tools para analisar documentos não estruturados e outros tipos de conteúdo, gerando saídas organizadas e pesquisáveis que podem ser integradas a cargas de trabalho de automação. Essa habilidade extrai tanto texto quanto imagens, incluindo metadados de localização que preservam a posição de cada imagem dentro do documento. A proximidade da imagem com conteúdo relacionado é especialmente útil para busca multimodal, recuperação agential e geração aumentada por recuperação (RAG).

A habilidade Azure Compreensão de Conteúdo está vinculada a um recurso faturável Microsoft Foundry. Diferente de outras habilidades Azure recursos de IA, como a habilidade Layout de Documentos, a habilidade de Compreensão de Conteúdo Azure não oferece 20 documentos gratuitos por indexador por dia. A execução dessa habilidade é cobrada no preço Azure Compreensão de Conteúdo.

Você pode usar a habilidade de Compreensão de Conteúdo do Azure tanto para extração quanto para fragmentação. Não há necessidade de usar a habilidade Text Split no seu conjunto de habilidades. Essa habilidade implementa a mesma interface da habilidade Layout de Documentos, que utiliza o modelo de layout Azure Document Intelligence no Foundry Tools quando outputFormat está definido como text. No entanto, a habilidade Azure Content Understanding oferece várias vantagens em relação à habilidade Document Layout:

  • Tabelas e figuras são geradas no formato Markdown, facilitando a compreensão para grandes modelos de linguagem (LLMs). Em contraste, a habilidade Layout de Documentos gera tabelas e figuras como texto simples, o que pode resultar em perda de informação.

  • Para tabelas que abrangem várias páginas, a habilidade Azure Content Understanding pode reconhecer e extrair tabelas entre páginas como uma única unidade.

  • A habilidade Azure Content Understanding permite que partes se esteram por meio de unidades semânticas.

  • A habilidade de Compreensão de Conteúdo do Azure é mais econômica do que a habilidade de Layout de Documentos porque a API de Compreensão de Conteúdo é mais barata.

  • Azure Compreensão de Conteúdo pode gerar descrições baseadas em IA para imagens, gráficos, diagramas e figuras inseridas. Descrições de figura inseridas são incorporadas diretamente ao conteúdo de markdown gerado para recuperação. Essas descrições são pesquisáveis e podem melhorar o aterramento rag e a qualidade de recuperação multimodal.

A habilidade de Compreensão de Conteúdo Azure geralmente está disponível na 2026-04-01 API REST. A partir da 2026-05-01-previewhabilidade, a habilidade gera opcionalmente descrições de imagem baseadas em IA para imagens, gráficos e diagramas inseridos em documentos (versão prévia). Para habilitar descrições, você deve implantar um modelo de conclusão de chat do Azure OpenAI no recurso Foundry anexado ao conjunto de habilidades. Essa versão da API também adiciona agrupamento semântico (versão prévia), uma opção com reconhecimento de layout que respeita os limites de parágrafo e mede o comprimento da parte em tokens. Ambos os recursos exigem aceitação. Quando os novos parâmetros são omitidos, a habilidade se comporta da mesma forma que na versão estável 2026-04-01 da API.

Limitações

A habilidade de Compreensão de Conteúdo do Azure possui as seguintes limitações:

  • Essa habilidade não é adequada para documentos grandes que exigem mais de cinco minutos de processamento no analisador de documentos Content Understanding. A habilidade expira, mas as cobranças ainda valem para o recurso da Fundição que está ligado ao conjunto de habilidades. Garanta que os documentos estejam otimizados para permanecer dentro dos limites de processamento e evitar custos desnecessários.

  • Essa habilidade chama o analisador de documentos Azure Content Understanding, então todos os comportamentos documentados service para diferentes tipos de documentos se aplicam à sua saída. Por exemplo, arquivos Word (DOCX) e PDF podem produzir resultados diferentes devido a diferenças na forma como as imagens são tratadas. Se for necessário comportamento consistente de imagem entre DOCX e PDF, considere converter documentos para PDF ou revisar a documentação de busca multimodal para abordagens alternativas.

Regiões com suporte

A habilidade Azure Compreensão de Conteúdo chama a API REST 01-11-2025. Seu recurso Foundry deve estar em uma região suportada, o que é descrito em Azure Content Understanding Regional and language support .

Seu serviço de busca pode estar em qualquer região Pesquisa de IA do Azure  suportada por . Quando seu recurso Foundry e o serviço Pesquisa de IA do Azure  não estão na mesma região, a latência de rede entre regiões impacta o desempenho do seu indexador.

Formatos de arquivo suportados

A habilidade Azure Content Understanding reconhece os seguintes formatos de arquivo:

  • .PDF
  • . JPEG
  • .JPG
  • .PNG
  • .BMP
  • .HEIF
  • . TIFF
  • .DOCX
  • . XLSX
  • .PPTX
  • .HTML
  • .TXT
  • .MD
  • .RTF
  • .EML

Idiomas com suporte

Para texto impresso, veja Azure Content Understanding region and language support.

@odata.type

Microsoft.Skills.Util.ContentUnderstandingSkill

Limites de dados

  • Mesmo quando o tamanho do arquivo para análise de documentos está dentro do limite de 200 MB, conforme descrito nas cotas e limites de serviço Azure Content Understanding, a indexação ainda está sujeita aos limites indexer do seu nível de serviço de busca.

  • As dimensões da imagem devem estar entre 50 pixels x 50 pixels ou 10.000 pixels x 10.000 pixels.

  • Se seus PDFs estiverem bloqueados por senha, remova o bloqueio antes de executar o indexador.

Parâmetros de habilidade

Os parâmetros são sensíveis a maiúsculas minúsculas.

Nome do parâmetro Valores permitidos Descrição
extractionOptions ["images"], , ["images", "locationMetadata"]["locationMetadata"] Identifique qualquer conteúdo extra extraído do documento. Defina um array de enums que correspondam ao conteúdo a ser incluído na saída. Por exemplo, se extractionOptions for ["images", "locationMetadata"], a saída inclui imagens e metadados de localização que fornecem localização da página e informações visuais relacionadas ao local onde o conteúdo foi extraído.
modelName (versão prévia) Cadeia de caracteres, como "gpt-4.1". Opcional. Disponível a partir da 2026-05-01-preview API REST. O nome do modelo de conclusão de chat do Azure OpenAI usado para gerar descrições de imagens, gráficos e diagramas inseridos. A descrição da imagem é independente e extractionOptions pode ser habilitada sem extrair imagens. Deve ser especificado junto com modelDeployment. Para obter uma lista de modelos com suporte, consulte modelos generativos com suporte.
modelDeployment (versão prévia) Cadeia de caracteres. Opcional. Disponível a partir da 2026-05-01-preview API REST. O nome da implantação do modelo Azure OpenAI no recurso Foundry anexado ao conjunto de habilidades. Deve ser especificado junto com modelName.
chunkingProperties Veja a tabela a seguir. Opções que encapsulam como fazer um segmento de conteúdo de texto.
chunkingProperties Parâmetros Valores permitidos Descrição
method fixedSize (padrão) ou semantic (versão prévia). Disponível a partir da 2026-05-01-preview API REST. A estratégia de agrupamento. fixedSize usa o agrupamento em janelas baseado em caracteres. semantic usa o agrupamento com reconhecimento de layout que respeita os limites de parágrafo e manipula de forma inteligente tabelas grandes que abrangem limites de partes.
unit characters (com fixedSize) ou tokens (versão prévia, com semantic, disponível a partir da 2026-05-01-preview API REST). Controle a cardinalidade da unidade chunk. Há suporte apenas para as combinações e as fixedSize + characters combinações.semantic + tokens Se unit for omitido, será inferido de method.
maximumLength Quando unit é characters, um inteiro entre 300 e 50.000. Quando unit é tokens, um inteiro entre 100 e 8.000. O padrão é 500. O comprimento máximo da parte, medido na configuração unit.
overlapLength Inteiro. O valor deve ser menor que a metade de maximumLength. O comprimento da sobreposição entre duas partes de texto. Aplica-se somente quando method for fixedSize. Deve ser omitido ou definido como 0 quando method é semantic.

Entradas de competências

Nome do campo de entrada Descrição
file_data O arquivo de onde o conteúdo deve ser extraído.

A file_data entrada deve ser um objeto definido como:

{
  "$type": "file",
  "data": "BASE64 encoded string of the file"
}

Alternativamente, pode ser definido como:

{
  "$type": "file",
  "url": "URL to download the file",
  "sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}

O objeto de referência de arquivo pode ser gerado de uma das seguintes maneiras:

  • Definindo o allowSkillsetToReadFileData parâmetro na definição do seu indexador para true. Essa configuração cria um /document/file_data caminho que representa os dados originais do arquivo baixados da sua fonte de dados do blob. Esse parâmetro se aplica apenas a arquivos no Armazenamento de Blobs do Azure.

    allowSkillsetToReadFileData disponibiliza os dados de arquivo baixados para a habilidade. Ele não aumenta os limites do indexador de blob ou os limites de serviço de Compreensão de Conteúdo descritos nos limites de dados.

  • Ter uma habilidade personalizada que retorna uma definição de objeto JSON que fornece $type, data, ou url e sastoken. O $type parâmetro deve ser definido como file, e data deve ser o array base codificado de 64 bytes do conteúdo do arquivo. O url parâmetro deve ser uma URL válida com acesso para baixar o arquivo naquele local.

Resultados de competências

Nome do resultado Descrição
text_sections Uma coleção de objetos de blocos de texto. Cada bloco pode abranger várias páginas (considerando qualquer outro bloco configurado). O objeto de parte de texto inclui locationMetadata , se aplicável, e uma imagePath lista quando a parte se sobrepõe com intervalos de figura no documento.
normalized_images Só se aplica se extractionOptions inclui images. Uma coleção de imagens extraídas do documento, incluindo locationMetadata , se aplicável.

Cada elemento tem text_sections os seguintes campos:

Campo Tipo Descrição
id String Identificador exclusivo para a parte.
content String Conteúdo de markdown para a parte. Quando method é semantic, o conteúdo inclui descrições geradas por IA de figuras e tabelas embutidas como Markdown.
locationMetadata Objeto Intervalo de páginas e dados posicionais (pageNumberFrom, , pageNumberTo, ordinalPosition). source Apresentar quando extractionOptions incluir locationMetadata.
imagePath String Lista separada por ponto-e-vírgula de caminhos para imagens contidas na parte. Presente quando a parte se sobrepõe com intervalos de figura no documento.

Cada elemento tem normalized_images os seguintes campos:

Campo Tipo Descrição
id String Identificador exclusivo para a imagem.
data String Dados de imagem codificados em Base64.
imagePath String Referência de caminho para a imagem dentro do documento, como "figures/0".
locationMetadata Objeto Intervalo de páginas e dados posicionais. Apresentar quando extractionOptions incluir locationMetadata.

Exemplos

O primeiro exemplo usa agrupamento de tamanho fixo e demonstra como gerar conteúdo de texto em partes de tamanho fixo e extrair imagens junto com metadados de localização do documento. O segundo exemplo, disponível a partir da 2026-05-01-preview API REST, usa agrupamento semântico com descrições de imagem geradas por IA.

Exemplo 1: agrupamento de tamanho fixo com extração de imagem e metadados

{
  "skills": [
    {
      "description": "Analyze a document",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {     
          "unit": "characters",
          "maximumLength": 1325, 
          "overlapLength": 0
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        { 
          "name": "text_sections", 
          "targetName": "text_sections" 
        }, 
        { 
          "name": "normalized_images", 
          "targetName": "normalized_images" 
        } 
      ]
    }
  ]
}

Saída de exemplo

{
  "text_sections": [
      {
        "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
        "content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
        "locationMetadata": {
          "pageNumberFrom": 1,
          "pageNumberTo": 1,
          "ordinalPosition": 0,
          "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
        }
      },
      ...
      {
        "id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
        "content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
        "locationMetadata": {
          "pageNumberFrom": 2,
          "pageNumberTo": 3,
          "ordinalPosition": 3,
          "source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
        }
        ...
      }
    ],
    "normalized_images": [
        { 
            "id": "1_335140f1-9d31-4507-8916-2cde758639cb", 
            "data": "aW1hZ2UgMSBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 1,
              "pageNumberTo": 1,
              "ordinalPosition": 0,
              "source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
            }
        },
        { 
            "id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4", 
            "data": "aW1hZ2UgMiBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 3,
              "pageNumberTo": 3,
              "ordinalPosition": 1,
              "source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
            } 
        }
    ] 
}

locationMetadata é baseado na propriedade source fornecida pela Azure Content Understanding. Para informações sobre como a posição visual do elemento no arquivo é codificada, veja Análise de documentos: Extrair conteúdo estruturado.

imagePath representa o caminho relativo de uma imagem armazenada. Se a projeção do arquivo do armazenamento de conhecimento estiver configurada no conjunto de habilidades, esse caminho corresponde ao caminho relativo da imagem armazenada no armazenamento de conhecimento.

Exemplo 2: agrupamento semântico com descrição da imagem (versão prévia)

Este exemplo, disponível a partir da 2026-05-01-preview API REST, usa agrupamento semântico e produz descrições geradas por IA de imagens, gráficos e diagramas inseridos. O recurso Foundry anexado ao conjunto de habilidades deve ter o modelo de conclusão de chat identificado e modelName o implantado modelDeployment.

{
  "skills": [
    {
      "description": "Extract and chunk document content with image descriptions",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "modelName": "gpt-4.1",
      "modelDeployment": "myGpt41Deployment",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {
        "method": "semantic",
        "unit": "tokens",
        "maximumLength": 500
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        {
          "name": "text_sections",
          "targetName": "text_sections"
        },
        {
          "name": "normalized_images",
          "targetName": "normalized_images"
        }
      ]
    }
  ]
}

Com o agrupamento semântico, cada parte text_sections contém o conteúdo de Markdown que inclui descrições geradas por IA de quaisquer figuras e tabelas que ela abrange. Quando uma parte se sobrepõe com um ou mais intervalos de figura, o objeto de parte também inclui um imagePath campo que lista os caminhos de imagem correspondentes:

{
  "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
  "content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
  "locationMetadata": {
    "pageNumberFrom": 1,
    "pageNumberTo": 1,
    "ordinalPosition": 0,
    "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
  },
  "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}