Azure İçerik Anlama yeteneği

Note

Azure Yapay Zeka Arama Azure portalı, REST API'leri ve Azure SDK’ları aracılığıyla kullanılabilir. Ayrıca kuruluş içeriğini Microsoft Foundry portalındaki aracılar için yeniden kullanılabilir, izin kullanan bilgi bankalarına dönüştüren yönetilen bilgi katmanı Foundry IQ'yu temel alır.

Important

(önizleme) olarak işaretlenen özellikler, özellikler veya özellikler hizmet düzeyi sözleşmesi kapsamında değildir, üretim iş yükleri için önerilmez ve genel kullanıma sunulmadan önce değişebilir veya kısıtlanabilir. Azure Yapay Zeka Arama önizleme terimleri, tek başına veya genel kullanıma sunulan bir özelliğin parçası olsun, tüm önizleme işlevleri için geçerlidir.

Azure İçerik Anlama becerisi, yapılandırılmamış belgeleri ve diğer içerik türlerini analiz etmek için Azure Content Understanding in Foundry Tools tarafından belge analizci kullanır; böylece yapılandırılmamış belgeler ve diğer içerik türlerini analiz ederek, otomasyon iş yüklerine entegre edilebilecek organize ve aranabilir çıktılar üretir. Bu beceri, her bir görselin belgedeki konumunu koruyan konum meta verileri dahil olmak üzere hem metin hem de görselleri çıkarır. İlgili içeriğe görüntü yakınlığı özellikle çok modlu arama, ajanik arama ve arama ile artırılmış üretim (RAG) için faydalıdır.

Azure İçerik Anlama becerisi, faturalandırılabilir Microsoft Foundry kaynağı ile bağlıdır. Belge Düzeni becerisi gibi diğer Azure yapay zeka kaynak becerilerinin aksine, Azure İçerik Anlama becerisi her indeksleyici için günde 20 ücretsiz belge sağlamaz. Bu becerinin uygulanması Azure Content Understanding fiyatı üzerinden ücretlendirilir.

Azure Content Understanding becerisini hem içerik çıkarma hem de parçalama için kullanabilirsiniz. Metin Bölme yeteneğini yeteneklerinizde kullanmanıza gerek yok. Bu beceri, Document Layout becerisi ile aynı arayüzü uygular; Document Layout becerisi Azure Document Intelligence in Foundry Tools düzen modeli kullanır; outputFormattext olarak ayarlandığında. Ancak, Azure İçerik Anlama becerisi, Belge Düzeni becerisine göre birkaç avantaj sunar:

  • Tablolar ve şekiller Markdown formatında çıkarılır, bu da büyük dil modellerinin (LLM'ler) anlaşılmasını kolaylaştırır. Buna karşılık, Document Layout becerisi tabloları ve şekilleri düz metin olarak çıkarır ve bu da bilgi kaybına yol açabilir.

  • Birden çok sayfaya yayılan tablolar için Azure Content Understanding becerisi, çapraz sayfa tablolarını tek bir birim olarak tanıyabilir ve ayıklayabilir.

  • Azure Content Understanding becerisi, öbeklerin anlam birimleri aracılığıyla birden çok sayfaya yayılmasına olanak tanır.

  • Azure İçerik Anlama becerisi, İçerik Anlama API'si daha ucuz olduğu için Belge Düzeni becerisinden daha maliyet etkilidir.

  • Azure Content Understanding resimler, grafikler, diyagramlar ve eklenmiş şekiller için yapay zeka tabanlı açıklamalar oluşturabilir. Ekli şekil açıklamaları, alma için oluşturulan markdown içeriğine doğrudan eklenir. Bu açıklamalar aranabilir ve RAG topraklama ve çokmodlu alma kalitesini geliştirebilir.

Azure Content Understanding becerisi genellikle 2026-04-01 REST API kullanılabilir. sürümünden 2026-05-01-previewbaşlayarak, beceri isteğe bağlı olarak belge eklenmiş görüntüler, grafikler ve diyagramlar (önizleme) için yapay zeka tabanlı görüntü açıklamaları oluşturur. Açıklamaları etkinleştirmek için beceri kümesine bağlı Dökümhane kaynağında Azure OpenAI sohbet tamamlama modeli dağıtmanız gerekir. Bu API sürümü ayrıca paragraf sınırlarına saygı gösteren ve belirteçlerdeki öbek uzunluğunu ölçen düzen kullanan bir seçenek olan semantik öbekleme (önizleme) ekler. Her iki özellik de kabul gerektirir. Yeni parametreler atlandığında, beceri kararlı 2026-04-01 API sürümündekiyle aynı şekilde davranır.

Sınırlamalar

Azure İçerik Anlama becerisi aşağıdaki sınırlamalara sahiptir:

  • Bu beceri, İçerik Anlama belge analizöründe beş dakikadan fazla işlem gerektiren büyük belgeler için uygun değildir. Yetenek zaman doluyor, ama yükler yine de yetenek setine bağlı Foundry kaynağına uygulanıyor. Gereksiz maliyetlerden kaçınmak için belgelerin işlem sınırları içinde kalacak şekilde optimize edilmesinden emin olun.

  • Bu beceri, Azure Content Understanding belge analizörü adını verir; böylece farklı belge tipleri için tüm belgelenmiş servis davranışları çıktısına uygulanır. Örneğin, Word (DOCX) ve PDF dosyaları, görsellerin işleniş şeklindeki farklılıklar nedeniyle farklı sonuçlar verebilir. DOCX ve PDF arasında tutarlı görüntü davranışı gerekiyorsa, belgeleri PDF'ye dönüştürmeyi veya alternatif yaklaşımlar için çoklu modal arama dokümantasyonunu incelemeyi düşünün.

Desteklenen bölgeler

Azure İçerik Anlama becerisi İçerik Anlama 2025-11-01 REST API adını verir. Foundry kaynağınız desteklenen bir bölgede olmalıdır; bu Azure İçerik Anlama bölgesi ve dil desteği bölümlerinde tanımlanmıştır.

Arama hizmetiniz herhangi bir desteklenen Azure Yapay Zeka Arama bölgesinde olabilir. Foundry kaynağınız ve Azure Yapay Zeka Arama servisiniz aynı bölgede olmadığında, bölgeler arası ağ gecikmesi indeksleyicinizin performansını etkiler.

Desteklenen dosya formatları

Azure Content Understanding becerisi aşağıdaki dosya formatlarını tanır:

  • .PDF
  • . JPEG
  • .JPG
  • .PNG
  • .BMP
  • . HEIF
  • . TIFF
  • .DOCX
  • . XLSX
  • .PPTX
  • .HTML
  • .TXT
  • . MD
  • . RTF
  • . EML

Desteklenen diller

Basılı metin için bkz. Azure İçerik Anlama bölgesi ve dil desteği.

@odata.type

Microsoft.Skills.Util.ContentUnderstandingSkill

Veri sınırları

  • Belgeleri analiz etmek için dosya boyutu 200 MB sınırı içinde olsa bile, Azure İçerik Anlama hizmet kotaları ve limitleri kapsamında tanımlansa bile, indeksleme yine de arama hizmeti katmanınızın indeksleyici sınırlarına tabidir.

  • Görüntü boyutları 50 piksel x 50 piksel ile 10.000 piksel x 10.000 piksel arasında olmalıdır.

  • PDF'leriniz şifreyle kilitliyse, indeksleyiciyi çalıştırmadan önce kilidi kaldırın.

Beceri parametreleri

Parametreler büyük/küçük harfe duyarlıdır.

Parametre adı İzin verilen değerler Description
extractionOptions ["images"], ["images", "locationMetadata"], ["locationMetadata"] Belgeden çıkarılan ekstra içeriği tespit edin. Çıktıya dahil edilecek içeriğe karşılık gelen bir enum dizisi tanımlayın. Örneğin, eğer extractionOptions ise ["images", "locationMetadata"], çıktı sayfa konumu ve içeriğin çıkarıldığı yerle ilgili görsel bilgi sağlayan görüntüler ve konum meta verileri içerir.
modelName (önizleme) Dize, örneğin "gpt-4.1". Opsiyonel. REST API'den 2026-05-01-preview başlayarak kullanılabilir. Eklenmiş görüntülerin, grafiklerin ve diyagramların açıklamalarını oluşturmak için kullanılan Azure OpenAI sohbet tamamlama modelinin adı. Görüntü açıklaması birbirinden extractionOptions bağımsızdır ve görüntü ayıklanmadan etkinleştirilebilir. ile modelDeploymentbirlikte belirtilmelidir. Desteklenen modellerin listesi için bkz . Desteklenen üretken modeller.
modelDeployment (önizleme) String. Opsiyonel. REST API'den 2026-05-01-preview başlayarak kullanılabilir. Beceri kümesine bağlı Foundry kaynağındaki Azure OpenAI modelinin dağıtım adı. ile modelNamebirlikte belirtilmelidir.
chunkingProperties Aşağıdaki tabloya bakınız. Metin içeriğinin nasıl parçalanacağını kapsayan seçenekler.
chunkingProperties parametreler İzin verilen değerler Description
method fixedSize (varsayılan) veya semantic (önizleme). REST API'den 2026-05-01-preview başlayarak kullanılabilir. Öbekleme stratejisi. fixedSize karakter tabanlı pencereli öbek kullanır. semantic paragraf sınırlarına saygı gösteren ve öbek sınırlarına yayılan büyük tabloları akıllı bir şekilde işleyen düzen duyarlı öbekler kullanır.
unit characters (ile fixedSize) veya tokens (ÖNIZLEME, ile semanticREST API'den 2026-05-01-preview başlayarak kullanılabilir). Parça biriminin kardinalliğini kontrol eder. fixedSize + characters Yalnızca ve semantic + tokens birleşimleri desteklenir. Atlanırsa unit , dosyasından methodçıkarılır.
maximumLength olduğunda unitcharacters, 300 ile 50.000 arasında bir tamsayı. olduğunda unittokens, 100 ile 8.000 arasında bir tamsayı. Varsayılan değer 500'dür. Yapılandırılan unitiçinde ölçülen en fazla öbek uzunluğu.
overlapLength Tamsayı. Değerin yarısından maximumLengthküçük olması gerekir. İki metin öbekleri arasındaki örtüşme uzunluğu. Yalnızca olduğunda methodfixedSizegeçerlidir. atlanması veya olduğunda 0methodolarak ayarlanması semantic gerekir.

Beceri girişleri

Giriş adı Description
file_data İçeriğin çıkarılacağı dosya.

Girdi, file_data şu şekilde tanımlanan bir nesne olmalıdır:

{
  "$type": "file",
  "data": "BASE64 encoded string of the file"
}

Alternatif olarak, şu şekilde tanımlanabilir:

{
  "$type": "file",
  "url": "URL to download the file",
  "sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}

Dosya referans nesnesi aşağıdaki yöntemlerden biriyle oluşturulabilir:

  • İndekser tanımınızda parametreyi allowSkillsetToReadFileData ayarlayarak true. Bu ayar, blob veri kaynağından indirilen orijinal dosya verisini temsil eden bir nesne olan bir /document/file_data yol oluşturur. Bu parametre yalnızca Azure Blob Depolama'daki dosyalar için geçerlidir.

    allowSkillsetToReadFileData indirilen dosya verilerini becerinin kullanımına sağlar. Blob dizin oluşturucu sınırlarını veya Veri sınırları bölümünde açıklanan Content Understanding hizmet sınırlarını artırmaz.

  • Özel bir beceriye sahip olmak, , veya , veya .$typedataurlsastoken Parametre $type olarak fileayarlanmalıdır ve data dosya içeriğinin 64 bayt tabanlı dizisi olmalıdır. Parametre, url dosyayı o konumdan indirmek için erişime sahip geçerli bir URL olmalıdır.

Beceri çıkışları

Çıkış adı Description
text_sections Metin parçası nesnelerinden oluşan bir koleksiyon. Her chunk birden fazla sayfayı kapsayabilir (daha fazla parça yapılandırması da dahil edilir). Metin öbek nesnesi, varsa ve öbek belgedeki şekil yayılmalarıyla çakıştığında bir locationMetadata liste içeririmagePath.
normalized_images Sadece .extractionOptionsimages Belgeden çıkarılan görüntülerin bir koleksiyonu, varsa dahil locationMetadata .

içindeki text_sections her öğe aşağıdaki alanlara sahiptir:

Alan Türü Description
id String Öbek için benzersiz tanımlayıcı.
content String Öbek için Markdown içeriği. olduğunda methodsemantic, içerik Markdown olarak çizili şekildeki şekillerin ve tabloların yapay zeka tarafından oluşturulan açıklamalarını içerir.
locationMetadata Nesne Sayfa aralığı ve konumsal veriler (pageNumberFrom, pageNumberTo, ordinalPosition, source). içerdiğinde extractionOptions sunar locationMetadata.
imagePath String Öbekte yer alan görüntülerin yollarının noktalı virgülle ayrılmış listesi. Öbek, belgedeki şekil yayılma alanlarıyla çakıştığında sunar.

içindeki normalized_images her öğe aşağıdaki alanlara sahiptir:

Alan Türü Description
id String Görüntünün benzersiz tanımlayıcısı.
data String Base64 ile kodlanmış görüntü verileri.
imagePath String Belge içindeki görüntüye yol başvurusu, örneğin "figures/0".
locationMetadata Nesne Sayfa aralığı ve konumsal veriler. içerdiğinde extractionOptions sunar locationMetadata.

Examples

İlk örnekte sabit boyutlu öbekler kullanılır ve metin içeriğinin sabit boyutlu öbekler halinde nasıl çıkarılıp belgedeki konum meta verileriyle birlikte görüntülerin ayıklanması gösterilmektedir. REST API ile 2026-05-01-preview başlayan ikinci örnek, yapay zeka tarafından oluşturulan görüntü açıklamalarıyla anlamsal öbekleme kullanır.

Örnek 1: Görüntü ve meta veri ayıklama ile sabit boyutlu öbekleme

{
  "skills": [
    {
      "description": "Analyze a document",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {     
          "unit": "characters",
          "maximumLength": 1325, 
          "overlapLength": 0
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        { 
          "name": "text_sections", 
          "targetName": "text_sections" 
        }, 
        { 
          "name": "normalized_images", 
          "targetName": "normalized_images" 
        } 
      ]
    }
  ]
}

Örnek çıkış verisi

{
  "text_sections": [
      {
        "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
        "content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
        "locationMetadata": {
          "pageNumberFrom": 1,
          "pageNumberTo": 1,
          "ordinalPosition": 0,
          "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
        }
      },
      ...
      {
        "id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
        "content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
        "locationMetadata": {
          "pageNumberFrom": 2,
          "pageNumberTo": 3,
          "ordinalPosition": 3,
          "source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
        }
        ...
      }
    ],
    "normalized_images": [
        { 
            "id": "1_335140f1-9d31-4507-8916-2cde758639cb", 
            "data": "aW1hZ2UgMSBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 1,
              "pageNumberTo": 1,
              "ordinalPosition": 0,
              "source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
            }
        },
        { 
            "id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4", 
            "data": "aW1hZ2UgMiBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 3,
              "pageNumberTo": 3,
              "ordinalPosition": 1,
              "source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
            } 
        }
    ] 
}

locationMetadata, Azure Content Understanding tarafından sağlanan source özelliğine dayanır. Dosyadaki elemanın görsel konumunun nasıl kodlandığına dair bilgi için bkz. Belge analizi: Yapılandırılmış içeriği çıkar.

imagePath Depolanan bir görüntünün göreli yolunu temsil eder. Bilgi deposu dosyası projeksiyonu beceri setinde yapılandırılmışsa, bu yol bilgi deposunda depolanan görüntünün göreceli yoluyla eşleşir.

Örnek 2: Görüntü açıklamasıyla anlamsal öbekleme (önizleme)

REST API'den 2026-05-01-preview başlayarak kullanılabilen bu örnek, anlamsal öbekleme kullanır ve ekli görüntülerin, grafiklerin ve diyagramların yapay zeka tarafından oluşturulan açıklamalarını oluşturur. Beceri kümesine eklenen Döküm kaynağı tarafından modelName tanımlanan ve dağıtılan modelDeploymentsohbet tamamlama modeline sahip olmalıdır.

{
  "skills": [
    {
      "description": "Extract and chunk document content with image descriptions",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "modelName": "gpt-4.1",
      "modelDeployment": "myGpt41Deployment",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {
        "method": "semantic",
        "unit": "tokens",
        "maximumLength": 500
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        {
          "name": "text_sections",
          "targetName": "text_sections"
        },
        {
          "name": "normalized_images",
          "targetName": "normalized_images"
        }
      ]
    }
  ]
}

Anlamsal öbekleme ile içindeki text_sections her öbek, kapsadığı şekillerin ve tabloların yapay zeka tarafından oluşturulan açıklamalarını içeren Markdown içeriği içerir. Bir öbek bir veya daha fazla şekil yayılmasıyla çakıştığında, öbek nesnesi ilgili görüntü yollarını listeleyen bir imagePath alan da içerir:

{
  "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
  "content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
  "locationMetadata": {
    "pageNumberFrom": 1,
    "pageNumberTo": 1,
    "ordinalPosition": 0,
    "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
  },
  "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}