Azure 콘텐츠 이해 기술

Note

Azure AI 검색 Azure 포털, REST API 및 Azure SDK 통해 사용할 수 있습니다. 또한 엔터프라이즈 콘텐츠를 Microsoft Foundry 포털의 에이전트에 대해 재사용 가능한 사용 권한 인식 기술 자료로 변환하는 관리되는 기술 계층인 Foundry IQ를 뒷받침합니다.

Important

기능, 기능 또는 표시된 속성(미리 보기)은 서비스 수준 계약에 포함되지 않으며 프로덕션 워크로드에는 권장되지 않으며 일반적으로 사용 가능해지기 전에 변경되거나 제한될 수 있습니다. Azure AI 검색 미리 보기 용어는 독립 실행형 기능이든 일반 공급 기능의 일부이든 관계없이 모든 미리 보기 기능에 적용됩니다.

Azure 콘텐츠 이해 기술은 Azure Foundry Tools의 문서 분석기을 사용하여 비정형 문서 및 기타 콘텐츠 유형을 분석하고, 자동화 워크로드에 통합할 수 있는 조직적이고 검색 가능한 출력물을 생성합니다. 이 기술은 텍스트와 이미지 모두를 추출하며, 각 이미지의 위치를 문서에서 보존하는 위치 메타데이터도 포함합니다. 관련 콘텐츠와의 이미지 근접성은 특히 다중 모달 검색, 에이전트 검색 및 검색 증강 생성 (RAG)에 유용합니다.

Azure 콘텐츠 이해 스킬은 청구 가능한 Microsoft Foundry 리소스에 묶여 있습니다. 문서 레이아웃 기술과 같은 다른 Azure AI 자원 기술과 달리, Azure 콘텐츠 이해 기술은 인덱서당 하루에 20개의 무료 문서를 제공하지 않습니다. 이 스킬의 실행은 Azure 콘텐츠 이해 가격에서 요금이 부과됩니다.

Azure 콘텐츠 이해 스킬을 콘텐츠 추출과 청킹 모두에 사용할 수 있습니다. 당신의 스킬셋에서 텍스트 스플릿 스킬을 사용할 필요는 없습니다. 이 기술은 문서 레이아웃 기술과 동일한 인터페이스를 구현하며, 문서 배치 스킬은 가 outputFormat로 설정되었을 때 text을 사용합니다. 하지만 Azure 콘텐츠 이해 스킬은 문서 레이아웃 스킬에 비해 여러 가지 장점을 제공합니다:

  • 표와 그림은 Markdown 형식으로 출력되어 대형 언어 모델(LLM)이 이해하기 쉽게 만듭니다. 반면, 문서 레이아웃 스킬은 표와 그림을 일반 텍스트로 출력하여 정보 손실을 초래할 수 있습니다.

  • 여러 페이지에 걸쳐 있는 테이블의 경우 Azure Content Understanding 기술은 페이지 간 테이블을 단일 단위로 인식하고 추출할 수 있습니다.

  • Azure Content Understanding 기술을 사용하면 청크가 의미 체계 단위를 통해 여러 페이지에 걸쳐 있습니다.

  • Azure 콘텐츠 이해 스킬은 문서 레이아웃 스킬보다 비용 효율적입니다. 왜냐하면 콘텐츠 이해 API가 더 저렴하기 때문입니다.

  • Azure Content Understanding은 이미지, 차트, 다이어그램 및 포함된 그림에 대한 AI 기반 설명을 생성할 수 있습니다. 포함된 그림 설명은 검색을 위해 생성된 markdown 콘텐츠에 직접 통합됩니다. 이러한 설명은 검색 가능하며 RAG 접지 및 다중 모드 검색 품질을 향상시킬 수 있습니다.

Azure Content Understanding 기술은 일반적으로 2026-04-01 REST API 사용할 수 있습니다. 이 2026-05-01-preview기술은 문서 포함 이미지, 차트 및 다이어그램(미리 보기)에 대한 AI 기반 이미지 설명을 선택적으로 생성합니다. 설명을 사용하려면 기술 세트에 연결된 Foundry 리소스에 Azure OpenAI 채팅 완성 모델을 배포해야 합니다. 또한 이 API 버전은 단락 경계를 존중하고 토큰의 청크 길이를 측정하는 레이아웃 인식 옵션인 의미 체계 청크(미리 보기)를 추가합니다. 두 기능 모두 옵트인(opt-in)이 필요합니다. 새 매개 변수를 생략하면 기술은 안정적인 2026-04-01 API 버전과 동일하게 작동합니다.

제한점

Azure 콘텐츠 이해 스킬에는 다음과 같은 제한이 있습니다:

  • 이 기술은 콘텐츠 이해 문서 분석기에서 5분 이상 처리가 필요한 대규모 문서에는 적합하지 않습니다. 스킬은 시간이 지나지만, 스킬셋에 연결된 파운드리 자원에는 여전히 충전이 적용됩니다. 문서 처리가 한도 내에서 최적화되어 불필요한 비용을 피하도록 하세요.

  • 이 기술은 Azure Content Understanding 문서 분석기라고 불리며, 서로 다른 문서 유형<0>서비스 동작이 모두 해당 출력에 적용됩니다. 예를 들어, Word(DOCX)와 PDF 파일은 이미지 처리 방식의 차이로 인해 서로 다른 결과를 낼 수 있습니다. DOCX와 PDF 전반에 걸쳐 일관된 이미지 동작이 필요하다면, 문서를 PDF로 변환하거나 멀티모달 검색 문서를 검토하여 대체 방법을 찾아보는 것을 고려하세요.

지원되는 지역

Azure 콘텐츠 이해 스킬은 Content Understanding 2025-11-01 REST API를 호출합니다. Foundry 자원은 지원 영역에 있어야 하며, 이는 Azure 콘텐츠 이해 지역 및 언어 지원에 설명되어 있습니다.

검색 서비스는 지원되는 Azure AI 검색 지역 어디에서든 가능합니다. Foundry 리소스와 Azure AI 검색 서비스가 같은 지역에 있지 않을 때, 지역 간 네트워크 지연이 인덱서의 성능에 영향을 미칩니다.

지원되는 파일 형식

Azure 콘텐츠 이해 스킬은 다음 파일 형식을 인식합니다:

  • .Pdf
  • . Jpeg
  • .Jpg
  • .Png
  • .Bmp
  • . HEIF
  • . Tiff
  • .Docx
  • . Xlsx
  • .Pptx
  • .Html
  • .TXT
  • . 메릴랜드
  • . RTF
  • . EML

지원되는 언어

인쇄된 텍스트는 Azure 지역 및 언어 이해 지원를 참조하세요.

@odata.type

Microsoft.Skills.Util.ContentUnderstandingSkill

데이터 제한

  • 문서 분석 파일 크기가 Azure 콘텐츠 이해 서비스 할당량 및 제한에 설명된 200MB 제한 내에 있더라도, 색인은 여전히 검색 서비스 계층의 indexer 제한의 적용을 받습니다.

  • 이미지 크기는 50 픽셀 x 50 픽셀 또는 10,000 픽셀 x 10,000 픽셀 사이여야 합니다.

  • PDF가 비밀번호로 잠겨 있다면, 인덱서를 실행하기 전에 잠금장치를 해제하세요.

기술 매개 변수

매개변수는 대소문자에 구분됩니다.

매개 변수 이름 허용되는 값 Description
extractionOptions ["images"], , ["images", "locationMetadata"]["locationMetadata"] 문서에서 추출한 추가 내용을 식별하세요. 출력에 포함될 내용에 대응하는 열거 배열을 정의하세요. 예를 들어, 가 이라extractionOptions면["images", "locationMetadata"], 출력은 이미지와 위치 메타데이터를 포함하며, 이는 콘텐츠가 추출된 위치와 관련된 페이지 위치 및 시각적 정보를 제공합니다.
modelName (미리 보기) 문자열(예: "gpt-4.1". 선택 사항입니다. REST API부터 2026-05-01-preview 사용할 수 있습니다. 포함된 이미지, 차트 및 다이어그램에 대한 설명을 생성하는 데 사용되는 Azure OpenAI 채팅 완성 모델의 이름입니다. 이미지 설명은 독립적 extractionOptions 이며 이미지를 추출하지 않고도 사용할 수 있습니다. 와 함께 modelDeployment지정해야 합니다. 지원되는 모델 목록은 지원되는 생성 모델을 참조하세요.
modelDeployment (미리 보기) 문자열입니다. 선택 사항입니다. REST API부터 2026-05-01-preview 사용할 수 있습니다. 기술 세트에 연결된 Foundry 리소스의 Azure OpenAI 모델의 배포 이름입니다. 와 함께 modelName지정해야 합니다.
chunkingProperties 다음 표를 참고하세요. 텍스트 콘텐츠를 청크로 나누는 방법을 캡슐화하는 옵션들.
chunkingProperties 매개변수 허용되는 값 Description
method fixedSize (기본값) 또는 semantic (미리 보기). REST API부터 2026-05-01-preview 사용할 수 있습니다. 청크 분할 전략입니다. fixedSize 는 문자 기반 창 청크를 사용합니다. semantic 는 단락 경계를 존중하고 청크 경계에 걸쳐 있는 큰 테이블을 지능적으로 처리하는 레이아웃 인식 청크를 사용합니다.
unit characters (with fixedSize) 또는 tokens (미리 보기, REST semanticAPI부터 2026-05-01-preview 사용 가능) 청크 단위의 기수를 제어합니다. 및 fixedSize + characterssemantic + tokens조합만 지원됩니다. 생략하면 unit .에서 method유추됩니다.
maximumLength 이 경우 unitcharacters300에서 50,000 사이의 정수입니다. 이 unit경우 tokens 100에서 8,000 사이의 정수입니다. 기본값은 500입니다. 구성된 unit청크 길이로 측정되는 최대 청크 길이입니다.
overlapLength Integer. 값은 .의 maximumLength절반 미만이어야 합니다. 두 텍스트 청크 간에 겹치는 길이입니다. 있는 경우에만 method 적용됩니다 fixedSize. 생략하거나 다음과 같은 경우 0method로 semantic 설정해야 합니다.

기술 입력

입력 이름 Description
file_data 콘텐츠를 추출해야 할 파일.

입력은 file_data 다음과 같이 정의된 객체여야 합니다:

{
  "$type": "file",
  "data": "BASE64 encoded string of the file"
}

또는 다음과 같이 정의할 수 있습니다:

{
  "$type": "file",
  "url": "URL to download the file",
  "sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}

파일 참조 객체는 다음과 같은 방법 중 하나로 생성할 수 있습니다:

  • 인덱서 정의allowSkillsetToReadFileData에서 매개변수를 true 로 설정하는 것입니다. 이 설정은 블롭 데이터 소스에서 다운로드한 원본 파일 데이터를 나타내는 객체 경로가 /document/file_data 생성됩니다. 이 매개변수는 Azure Blob Storage 내 파일에만 적용됩니다.

    allowSkillsetToReadFileData 는 다운로드한 파일 데이터를 기술에 사용할 수 있도록 합니다. 데이터 제한에 설명된 Blob 인덱서 제한 또는 Content Understanding 서비스 제한은 증가하지 않습니다.

  • 커스텀 스킬이 JSON 객체 정의를 반환하여 , $typedata 를 url제공합니다sastoken. 매개변수는 $type 로 설정 file되어야 하며, data 파일 내용의 기본 64바이트 배열이어야 합니다. 매개변수는 url 해당 위치에서 파일을 다운로드할 수 있는 유효한 URL이어야 합니다.

기술 성과

출력 이름 Description
text_sections 텍스트 청크 객체들의 모음입니다. 각 청크는 여러 페이지를 넘을 수 있습니다(추가로 청킹을 구성할 수도 있습니다). 텍스트 청크 개체에는 해당하는 경우, 청크가 문서의 그림 범위와 locationMetadata 겹치는 목록이 포함 imagePath 됩니다.
normalized_images 가 포함될 extractionOptions때 images 만 적용됩니다. 문서에서 추출한 이미지 모음으로, locationMetadata 해당되는 경우 포함된다.

각 요소에는 text_sections 다음 필드가 있습니다.

Field 유형 Description
id 문자열 청크의 고유 식별자입니다.
content 문자열 청크의 Markdown 콘텐츠입니다. 이 methodsemantic경우 콘텐츠에는 Markdown으로 인라인된 그림 및 테이블에 대한 AI 생성 설명이 포함됩니다.
locationMetadata 객체 페이지 범위 및 위치 데이터(pageNumberFrom, pageNumberTo, ordinalPosition) source 포함되는 경우 extractionOptions 표시합니다 locationMetadata.
imagePath 문자열 청크에 포함된 이미지에 대한 세미콜론으로 구분된 경로 목록입니다. 청크가 문서의 그림 범위와 겹칠 때 표시됩니다.

각 요소에는 normalized_images 다음 필드가 있습니다.

Field 유형 Description
id 문자열 이미지의 고유 식별자입니다.
data 문자열 Base64로 인코딩된 이미지 데이터입니다.
imagePath 문자열 문서 내 이미지에 대한 경로 참조(예: "figures/0".)
locationMetadata 객체 페이지 범위 및 위치 데이터입니다. 포함되는 경우 extractionOptions 표시합니다 locationMetadata.

Examples

첫 번째 예제에서는 고정 크기 청크를 사용하고 텍스트 콘텐츠를 고정 크기 청크로 출력하고 문서에서 위치 메타데이터와 함께 이미지를 추출하는 방법을 보여 줍니다. REST API부터 2026-05-01-preview 사용할 수 있는 두 번째 예제에서는 AI에서 생성된 이미지 설명과 함께 의미 체계 청크를 사용합니다.

예제 1: 이미지 및 메타데이터 추출을 사용한 고정 크기 청크

{
  "skills": [
    {
      "description": "Analyze a document",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {     
          "unit": "characters",
          "maximumLength": 1325, 
          "overlapLength": 0
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        { 
          "name": "text_sections", 
          "targetName": "text_sections" 
        }, 
        { 
          "name": "normalized_images", 
          "targetName": "normalized_images" 
        } 
      ]
    }
  ]
}

샘플 출력

{
  "text_sections": [
      {
        "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
        "content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
        "locationMetadata": {
          "pageNumberFrom": 1,
          "pageNumberTo": 1,
          "ordinalPosition": 0,
          "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
        }
      },
      ...
      {
        "id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
        "content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
        "locationMetadata": {
          "pageNumberFrom": 2,
          "pageNumberTo": 3,
          "ordinalPosition": 3,
          "source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
        }
        ...
      }
    ],
    "normalized_images": [
        { 
            "id": "1_335140f1-9d31-4507-8916-2cde758639cb", 
            "data": "aW1hZ2UgMSBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 1,
              "pageNumberTo": 1,
              "ordinalPosition": 0,
              "source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
            }
        },
        { 
            "id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4", 
            "data": "aW1hZ2UgMiBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 3,
              "pageNumberTo": 3,
              "ordinalPosition": 1,
              "source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
            } 
        }
    ] 
}

locationMetadata는 Azure Content Understanding이 제공하는 source 속성에 기반합니다. 파일 내 요소의 시각적 위치가 어떻게 인코딩되는지에 대한 정보는 문서 분석: 구조화된 콘텐츠 추출을 참조하세요.

imagePath 저장된 이미지의 상대적 경로를 나타냅니다. 지식 저장소 파일 투영이 스킬셋에 설정되어 있다면, 이 경로는 지식 저장소에 저장된 이미지의 상대적 경로와 일치합니다.

예제 2: 이미지 설명이 포함된 의미 체계 청크(미리 보기)

REST API부터 2026-05-01-preview 사용할 수 있는 이 예제에서는 의미 체계 청크를 사용하고 포함된 이미지, 차트 및 다이어그램에 대한 AI 생성 설명을 생성합니다. 기술 세트에 연결된 Foundry 리소스에는 채팅 완료 모델을 식별하여 modelName 배포해야 modelDeployment합니다.

{
  "skills": [
    {
      "description": "Extract and chunk document content with image descriptions",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "modelName": "gpt-4.1",
      "modelDeployment": "myGpt41Deployment",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {
        "method": "semantic",
        "unit": "tokens",
        "maximumLength": 500
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        {
          "name": "text_sections",
          "targetName": "text_sections"
        },
        {
          "name": "normalized_images",
          "targetName": "normalized_images"
        }
      ]
    }
  ]
}

의미 체계 청크를 사용하면 각 청크에 text_sections 포함된 Markdown 콘텐츠가 포함되며, 여기에는 AI에서 생성한 모든 피규어 및 표에 대한 설명이 포함되어 있습니다. 청크가 하나 이상의 그림 범위와 겹치는 경우 청크 개체에는 해당 이미지 경로를 나열하는 필드도 포함 imagePath 됩니다.

{
  "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
  "content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
  "locationMetadata": {
    "pageNumberFrom": 1,
    "pageNumberTo": 1,
    "ordinalPosition": 0,
    "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
  },
  "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}