Azure Content Understanding スキル

Note

Azure AI 検索は、Azure ポータル、REST API、およびAzure SDKから使用できます。 また、Foundry IQ は、エンタープライズ コンテンツを、Microsoft Foundry ポータルのエージェントの再利用可能なアクセス許可に対応したナレッジ ベースに変換するマネージド ナレッジ レイヤーです。

Important

機能、またはマークされたプロパティ (プレビュー) は、サービス レベル アグリーメントの対象ではなく、運用環境のワークロードには推奨されず、一般公開される前に変更または制約される可能性があります。 Azure AI 検索 プレビューの用語は、スタンドアロンでも一般公開されている機能の一部でも、すべてのプレビュー機能に適用されます。

Azure Content Understandingスキルは、Azure Foundry Toolsの document analyzers を用いて、非構造化文書やその他のコンテンツタイプを分析し、整理された検索可能な出力を生成し、自動化ワークロードに統合できます。 このスキルはテキストと画像の両方を抽出し、各画像の位置を文書内で保持する位置メタデータも含まれます。 関連コンテンツへの画像の近接性は、 マルチモーダル検索、 エージェント検索、検索拡張 生成 (RAG)に特に有用です。

Azureコンテンツ理解スキルは、請求可能なMicrosoft Foundryリソースに紐付けられています。 Document Layoutスキルのような他のAzure AIリソーススキルとは異なり、Azureコンテンツ理解スキルは1日あたり1人あたり20件の無料ドキュメントを提供しません。 このスキルの実行は、コンテンツ理解価格<>でAzureで課金されます。

Azure Content Understandingスキルは、コンテンツ抽出とチャンク作成の両方に使えます。 スキルセットでテキストスプリットスキルを使う必要はありません。 このスキルは、Document Layoutスキルと同じインターフェースを実装しており、Foundry Toolsのレイアウトモデル<Azureドキュメントインテリジェンスを>がに設定した場合に使われます。 しかし、Azureコンテンツ理解スキルはドキュメントレイアウトスキルに比べていくつかの利点があります。

  • 表や図はMarkdown形式で出力されるため、大規模言語モデル(LLM)が理解しやすくなっています。 一方、ドキュメントレイアウトスキルは表や図をプレーンテキストとして出力するため、情報損失を引き起こすことがあります。

  • 複数のページにまたがるテーブルの場合、Azure Content Understanding スキルはクロスページ テーブルを 1 つの単位として認識および抽出できます。

  • Azure Content Understanding スキルを使用すると、チャンクをセマンティック 単位を介して複数のページにまたがることができます。

  • Azureコンテンツ理解スキルは、コンテンツ理解APIの方が安価であるため、ドキュメントレイアウトスキルよりもコスト効率が良いです。

  • Azure Content Understanding では、画像、グラフ、図、埋め込み図の AI ベースの説明を生成できます。 埋め込まれた図の説明は、取得のために生成されたマークダウン コンテンツに直接組み込まれます。 これらの説明は検索可能であり、RAG の接地とマルチモーダル取得の品質を向上させることができます。

Azure Content Understanding スキルは、2026-04-01 REST API で一般提供されています。 2026-05-01-preview以降、スキルは必要に応じて、ドキュメント埋め込み画像、グラフ、および図 (プレビュー) の AI ベースの画像の説明を生成します。 説明を有効にするには、スキルセットにアタッチされた Foundry リソースに Azure OpenAI チャット完了モデルをデプロイする必要があります。 この API バージョンでは、セマンティック チャンク (プレビュー) も追加されます。これは、段落の境界を考慮し、トークンのチャンクの長さを測定するレイアウト対応のオプションです。 どちらの機能にもオプトインが必要です。 新しいパラメーターを省略すると、スキルは安定した 2026-04-01 API バージョンと同じように動作します。

制限事項

Azureコンテンツ理解スキルには以下の制限があります:

  • このスキルは、内容理解ドキュメントアナライザーで5分以上の処理が必要な大規模な文書には適していません。 スキルはタイムアウトしますが、スキルセットに紐づくファウンドリーリソースにはチャージが適用されます。 書類が処理制限内に収まるよう最適化し、不要なコストを避けましょう。

  • このスキルはAzure Content Understanding document analyzerと呼ばれ、異なる文書タイプ<サービス振る舞い>がすべて出力に適用されます。 例えば、Word(DOCX)ファイルとPDFファイルは、画像の扱い方の違いにより異なる結果を生むことがあります。 DOCXとPDFで一貫した画像動作が必要な場合は、ドキュメントをPDFに変換するか、 マルチモーダル検索ドキュメント をレビューして代替方法を検討してください。

サポートされているリージョン

Azureコンテンツ理解スキルはContent Understanding 2025-11-01 REST APIを呼び出します。 Foundryのリソースはサポートされている領域にある必要があり、その内容はAzure Content Understanding Region and language supportで説明されています。

検索サービスはどの地域サポートされているAzure AI 検索リージョンでも構いません。 FoundryリソースとAzure AI 検索サービスが同じリージョンにない場合、地域間のネットワーク遅延がインデクサーのパフォーマンスに影響を与えます。

対応ファイル形式

Azure Content Understanding スキルは以下のファイル形式を認識します:

  • 。Pdf
  • .Jpeg
  • 。Jpg
  • 。Png
  • 。Bmp
  • .HEIF
  • .Tiff
  • 。Docx
  • .Xlsx
  • 。Pptx
  • 。Html
  • .TXT
  • .MD
  • .RTF
  • .EML

サポートされている言語

印刷されたテキストについては、Azure Content Understanding Region and Language supportをご覧ください。

@odata.type

Microsoft.Skills.Util.ContentUnderstandingSkill

データ制限

  • 文書分析用のファイルサイズがAzureコンテンツ理解サービスクォータおよびリミットに記載されている200MB制限内であっても、インデックス作成は検索サービス層のindexer制限の対象となります。

  • 画像の寸法は50ピクセル×50ピクセルまたは10,000ピクセル×10,000ピクセルの間でなければなりません。

  • PDFがパスワードロックされている場合は、インデックス作成前にロックを解除してください。

スキル パラメーター

パラメータは大文字・小文字を区別します。

パラメーター名 使用できる値 Description
extractionOptions ["images"]、 ["images", "locationMetadata"]、 ["locationMetadata"] 文書から抽出された余分な内容を特定してください。 出力に含まれる内容に対応する列挙式を定義します。 例えば、 extractionOptions が ["images", "locationMetadata"]されている場合、出力には画像や位置メタデータが含まれ、コンテンツが抽出された場所に関連するページの位置情報や視覚情報を提供します。
modelName (プレビュー) "gpt-4.1"などの文字列。 オプション。 2026-05-01-preview REST API 以降で使用できます。 埋め込み画像、グラフ、および図の説明を生成するために使用される Azure OpenAI チャット完了モデルの名前。 画像の説明は extractionOptions に依存せず、画像を抽出せずに有効にすることができます。 modelDeploymentと共に指定する必要があります。 サポートされているモデルの一覧については、「 サポートされている生成モデル」を参照してください。
modelDeployment (プレビュー) String. オプション。 2026-05-01-preview REST API 以降で使用できます。 スキルセットにアタッチされている Foundry リソース内の Azure OpenAI モデルのデプロイ名。 modelNameと共に指定する必要があります。
chunkingProperties 以下の表を参照してください。 テキスト内容のチャンク分け方法をまとめたオプション。
chunkingProperties パラメータ 使用できる値 Description
method fixedSize (既定) または semantic (プレビュー)。 2026-05-01-preview REST API 以降で使用できます。 チャンク戦略。 fixedSize では、文字ベースのウィンドウ チャンクが使用されます。 semantic では、段落の境界を考慮し、チャンク境界にまたがる大きなテーブルをインテリジェントに処理するレイアウト対応チャンクを使用します。
unit characters ( fixedSizeあり)または tokens (プレビュー、 semantic、 2026-05-01-preview REST API 以降で使用可能)。 チャンク単位の濃度を制御します。 サポートされるのは、 fixedSize + characters と semantic + tokens の組み合わせだけです。 unitを省略すると、methodから推論されます。
maximumLength unitがcharactersの場合、300 ~ 50,000 の整数。 unitがtokensの場合、100 ~ 8,000 の整数。 既定値は 500 です。 構成された unitで測定される最大チャンク長。
overlapLength Integer. 値は、 maximumLengthの半分未満にする必要があります。 2 つのテキスト チャンク間の重複の長さ。 methodがfixedSizeされている場合にのみ適用されます。 0がmethodされている場合は、省略するか、semanticに設定する必要があります。

スキルの入力

入力名 Description
file_data コンテンツを取り出すべきファイル。

file_data入力は次のように定義されるオブジェクトでなければなりません。

{
  "$type": "file",
  "data": "BASE64 encoded string of the file"
}

あるいは、次のように定義することもできます:

{
  "$type": "file",
  "url": "URL to download the file",
  "sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}

ファイル参照オブジェクトは、以下のいずれかの方法で生成できます:

  • インデクサーの定義で allowSkillsetToReadFileData パラメータを trueに設定します。 この設定は、ブロブのデータソースからダウンロードした元のファイルデータを表すオブジェクトの /document/file_data パスを作成します。 このパラメータはAzure Blob Storage内のファイルにのみ適用されます。

    allowSkillsetToReadFileData は、ダウンロードしたファイル データをスキルで使用できるようにします。 BLOB インデクサーの制限や、「データの制限」で説明されている Content Understanding サービスの制限は増加しません。

  • カスタムスキルでJSONオブジェクト定義を返し、 $type、 data、 url 、 sastokenを提供します。 $typeパラメータはfileに設定され、dataファイル内容の64バイト配列のベースでなければなりません。 urlパラメータは有効なURLで、その場所でファイルをダウンロードできるアクセス権が必要です。

スキルの出力

出力名 Description
text_sections テキストチャンクオブジェクトの集合です。 各チャンクは複数のページにまたがることがあります(チャンク構成も考慮してください)。 テキスト チャンク オブジェクトには、該当する場合は locationMetadata と、チャンクがドキュメント内の図形スパンと重なる場合の imagePath リストが含まれます。
normalized_images extractionOptionsを含む場合のみimages適用されます。 文書から抽出された画像のコレクションで、該当する場合は locationMetadata も含まれます。

text_sectionsの各要素には、次のフィールドがあります。

フィールド タイプ Description
id String チャンクの一意識別子。
content String チャンクのマークダウン コンテンツ。 methodがsemanticされると、コンテンツには、マークダウンとしてインライン化された図とテーブルの AI によって生成された説明が含まれます。
locationMetadata オブジェクト ページ範囲と位置指定データ (pageNumberFrom、 pageNumberTo、 ordinalPosition、 source)。 extractionOptionsにlocationMetadataが含まれている場合に表示されます。
imagePath String チャンクに含まれるイメージへのパスのセミコロン区切りの一覧。 チャンクがドキュメント内の図形スパンと重なる場合に表示されます。

normalized_imagesの各要素には、次のフィールドがあります。

フィールド タイプ Description
id String イメージの一意識別子。
data String Base64 でエンコードされた画像データ。
imagePath String "figures/0"など、ドキュメント内のイメージへのパス参照。
locationMetadata オブジェクト ページ範囲と位置データ。 extractionOptionsにlocationMetadataが含まれている場合に表示されます。

Examples

最初の例では、固定サイズのチャンクを使用し、固定サイズのチャンクでテキスト コンテンツを出力し、ドキュメントから場所メタデータと共に画像を抽出する方法を示します。 2 つ目の例は、 2026-05-01-preview REST API 以降で使用でき、AI によって生成された画像の説明とセマンティック チャンクを使用します。

例 1: 画像とメタデータの抽出を使用した固定サイズのチャンク

{
  "skills": [
    {
      "description": "Analyze a document",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {     
          "unit": "characters",
          "maximumLength": 1325, 
          "overlapLength": 0
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        { 
          "name": "text_sections", 
          "targetName": "text_sections" 
        }, 
        { 
          "name": "normalized_images", 
          "targetName": "normalized_images" 
        } 
      ]
    }
  ]
}

サンプル出力

{
  "text_sections": [
      {
        "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
        "content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
        "locationMetadata": {
          "pageNumberFrom": 1,
          "pageNumberTo": 1,
          "ordinalPosition": 0,
          "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
        }
      },
      ...
      {
        "id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
        "content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
        "locationMetadata": {
          "pageNumberFrom": 2,
          "pageNumberTo": 3,
          "ordinalPosition": 3,
          "source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
        }
        ...
      }
    ],
    "normalized_images": [
        { 
            "id": "1_335140f1-9d31-4507-8916-2cde758639cb", 
            "data": "aW1hZ2UgMSBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 1,
              "pageNumberTo": 1,
              "ordinalPosition": 0,
              "source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
            }
        },
        { 
            "id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4", 
            "data": "aW1hZ2UgMiBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 3,
              "pageNumberTo": 3,
              "ordinalPosition": 1,
              "source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
            } 
        }
    ] 
}

locationMetadataは、コンテンツ理解Azureが提供するsourceプロパティに基づいています。 ファイル内の要素の視覚的な位置がどのようにエンコードされるかについては、「 ドキュメント分析:構造化コンテンツを抽出する」をご覧ください。

imagePath は保存画像の相対経路を表します。 スキルセットでナレッジストアファイルの投影が設定されている場合、このパスはナレッジストアに保存された画像の相対パスと一致します。

例 2: イメージの説明を含むセマンティック チャンク (プレビュー)

この例は、 2026-05-01-preview REST API 以降で使用でき、セマンティック チャンクを使用し、埋め込まれた画像、グラフ、および図の AI によって生成された説明を生成します。 スキルセットにアタッチされた Foundry リソースには、 modelName とデプロイされた modelDeploymentによって識別されるチャット完了モデルが必要です。

{
  "skills": [
    {
      "description": "Extract and chunk document content with image descriptions",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "modelName": "gpt-4.1",
      "modelDeployment": "myGpt41Deployment",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {
        "method": "semantic",
        "unit": "tokens",
        "maximumLength": 500
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        {
          "name": "text_sections",
          "targetName": "text_sections"
        },
        {
          "name": "normalized_images",
          "targetName": "normalized_images"
        }
      ]
    }
  ]
}

セマンティック チャンクでは、 text_sections 内の各チャンクに Markdown コンテンツが含まれます。このコンテンツには、AI によって生成された図形とテーブルの説明が含まれます。 チャンクが 1 つ以上の図形スパンと重なる場合、チャンク オブジェクトには、対応するイメージ パスを一覧表示する imagePath フィールドも含まれます。

{
  "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
  "content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
  "locationMetadata": {
    "pageNumberFrom": 1,
    "pageNumberTo": 1,
    "ordinalPosition": 0,
    "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
  },
  "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}