Umiejętność Azure Content Understanding

Note

Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Stanowi ona również podstawę IQ rozwiązania Foundry, zarządzanej warstwy wiedzy, która przekształca zawartość przedsiębiorstwa w bazy wiedzy wielokrotnego użytku, uwzględniające uprawnienia dla agentów w portalu Microsoft Foundry.

Important

Funkcje, możliwości lub właściwości oznaczone (wersja zapoznawcza) nie są objęte umową dotyczącą poziomu usług, nie są zalecane w przypadku obciążeń produkcyjnych i mogą ulec zmianie lub ograniczeniu, zanim staną się one ogólnie dostępne. Warunki Wyszukiwanie AI platformy Azure wersji zapoznawczej mają zastosowanie do wszystkich funkcji w wersji zapoznawczej, niezależnie od tego, czy jest ona autonomiczna, czy częścią ogólnie dostępnej funkcji.

Umiejętność Azure Content Understanding wykorzystuje analizatory dokumentów z Azure Content Understanding in Foundry Tools do analizy nieustrukturyzowanych dokumentów i innych typów treści, generując zorganizowane, przeszukiwalne wyniki, które można integrować z automatyzacją. Ta umiejętność wyodrębnia zarówno tekst, jak i obrazy, w tym metadane lokalizacji, które zachowują pozycję każdego obrazu w dokumencie. Bliskość obrazów do powiązanych treści jest szczególnie przydatna w wyszukiwaniu multimodalnym, wyszukiwaniu agentowym oraz generowaniu rozszerzonym na wyszukiwanie (RAG).

Umiejętność Azure Content Understanding jest powiązana z billable Microsoft Foundry resource . W przeciwieństwie do innych Azure umiejętności związanych z zasobami AI, takich jak umiejętność Document Layout, umiejętność Azure Content Understanding nie zapewnia 20 darmowych dokumentów na indeksator dziennie. Wykonanie tej umiejętności jest pobierane według Azure Zrozumienia treści.

Możesz używać umiejętności Azure Content Understanding zarówno do ekstrakcji treści, jak i podziału na części (chunmon). Nie musisz używać umiejętności Text Split w swoim zestawie umiejętności. Ta umiejętność implementuje ten sam interfejs co umiejętność układu dokumentów, która wykorzystuje model układu Azure w Foundry Tools gdy outputFormat jest ustawiony na text. Jednak umiejętność Azure Content Understanding oferuje kilka zalet w porównaniu z układem dokumentów:

  • Tabele i rysunki są wyświetlane w formacie Markdown, co ułatwia ich zrozumienie dużym modelom językowym (LLM). Natomiast umiejętność układu dokumentów generuje tabele i rysunki jako zwykły tekst, co może prowadzić do utraty informacji.

  • W przypadku tabel obejmujących wiele stron umiejętności Azure Content Understanding mogą rozpoznawać i wyodrębniać tabele międzystronicowe jako pojedynczą jednostkę.

  • Umiejętność Azure Content Understanding umożliwia fragmentom łączenie wielu stron za pośrednictwem jednostek semantycznych.

  • Umiejętność Azure Content Understanding jest bardziej opłacalna niż umiejętność układu dokumentów, ponieważ API Content Understanding jest tańsze.

  • Azure Content Understanding może generować opisy oparte na sztucznej inteligencji dla obrazów, wykresów, diagramów i osadzonych rysunków. Osadzone opisy rysunków są dołączane bezpośrednio do zawartości markdown wygenerowanej do pobierania. Te opisy można wyszukiwać i mogą poprawić jakość uziemienia RAG i wielokrotnego pobierania.

Umiejętność Azure Content Understanding jest ogólnie dostępna w 2026-04-01 INTERFEJS API REST. 2026-05-01-previewPocząwszy od elementu , ta umiejętność opcjonalnie generuje opisy obrazów opartych na sztucznej inteligencji dla obrazów osadzonych w dokumentach, wykresów i diagramów (wersja zapoznawcza). Aby włączyć opisy, musisz wdrożyć model uzupełniania czatu openAI Azure w zasobie Foundry dołączonym do zestawu umiejętności. Ta wersja interfejsu API dodaje również semantyczne fragmentowanie (wersja zapoznawcza), opcję rozpoznawania układu, która uwzględnia granice akapitu i mierzy długość fragmentu w tokenach. Obie możliwości wymagają zgody. Po pominięciu nowych parametrów umiejętność zachowuje się tak samo jak w stabilnej 2026-04-01 wersji interfejsu API.

Ograniczenia

Umiejętność Azure Content Understanding ma następujące ograniczenia:

  • Ta umiejętność nie nadaje się do dużych dokumentów wymagających więcej niż pięciu minut przetwarzania w analizatorze dokumentów Content Understanding. Czas wygasa na umiejętność, ale ładunki nadal dotyczą zasobu Foundry powiązanego z zestawem umiejętności. Upewnij się, że dokumenty są zoptymalizowane, aby mieszczać się w limitach przetwarzania i uniknąć niepotrzebnych kosztów.

  • Ta umiejętność wywołuje analizator dokumentów Azure Content Understanding, dzięki czemu wszystkie udokumentowane zachowania service dla różnych typów dokumentów mają zastosowanie do jego wyników. Na przykład pliki Word (DOCX) i PDF mogą dawać różne wyniki ze względu na różnice w sposobie obsługi obrazów. Jeśli wymagane jest spójne zachowanie obrazu w DOCX i PDF, rozważ konwersję dokumentów na PDF lub przejrzenie dokumentacji wyszukiwania multimodalnego w poszukiwaniu alternatywnych metod.

Obsługiwane regiony

Umiejętność Azure Content Understanding nazywa Content Understanding 2025-11-01 REST API. Twój zasób Foundry musi znajdować się w wspieranym regionie, który jest opisany w Azure regionie i wsparciu językowym Content Understanding.

Twoja usługa wyszukiwania może działać w dowolnym obsługiwanym Wyszukiwanie AI platformy Azure regionie. Gdy Twój zasób Foundry i usługa Wyszukiwanie AI platformy Azure nie znajdują się w tym samym regionie, opóźnienia sieci międzyregionalnej wpływają na wydajność indeksera.

Obsługiwane formaty plików

Umiejętność Azure Content Understanding rozpoznaje następujące formaty plików:

  • .PDF
  • . JPEG
  • .JPG
  • .PNG
  • .BMP
  • . HEIF
  • . TIFF
  • .DOCX
  • . XLSX
  • .PPTX
  • .HTML
  • .TXT
  • . MD
  • . RTF
  • . EML

Obsługiwane języki

W przypadku tekstu drukowanego zobacz Azure Wsparcie dla regionów i języków Content Understanding.

@odata.type

Microsoft.Skills.Util.ContentUnderstandingSkill

Limity danych

  • Nawet gdy rozmiar pliku do analizy dokumentów mieści się w limicie 200 MB, jak opisano w limitach i limitach usług Azure Content Understanding, indeksowanie nadal podlega ograniczeniom indexer poziomu usługi wyszukiwania.

  • Wymiary obrazu muszą wynosić od 50 pikseli x 50 pikseli do 10 000 pikseli x 10 000 pikseli.

  • Jeśli twoje pliki PDF są zablokowane hasłem, usuń blokadę przed uruchomieniem indeksera.

Parametry umiejętności

W parametrach jest rozróżniana wielkość liter.

Nazwa parametru Dozwolone wartości Opis
extractionOptions ["images"], , ["images", "locationMetadata"]["locationMetadata"] Zidentyfikuj wszelkie dodatkowe treści wyodrębnione z dokumentu. Zdefiniuj tablicę enumów odpowiadających treści, która ma być uwzględniona w wychodzie. Na przykład, jeśli extractionOptions jest , ["images", "locationMetadata"]wynik zawiera obrazy i metadane lokalizacyjne, które dostarczają lokalizacji strony oraz wizualnych informacji związanych z miejscem wyodrębnienia treści.
modelName (wersja zapoznawcza) Ciąg, taki jak "gpt-4.1". Optional. Dostępne od interfejsu 2026-05-01-preview API REST. Nazwa modelu uzupełniania czatu openAI Azure używana do generowania opisów obrazów osadzonych, wykresów i diagramów. Opis obrazu jest niezależny i extractionOptions można go włączyć bez wyodrębniania obrazów. Należy określić razem z parametrem modelDeployment. Aby uzyskać listę obsługiwanych modeli, zobacz Obsługiwane modele generowania.
modelDeployment (wersja zapoznawcza) Struna. Optional. Dostępne od interfejsu 2026-05-01-preview API REST. Nazwa wdrożenia modelu Azure OpenAI w zasobie foundry dołączonym do zestawu umiejętności. Należy określić razem z parametrem modelName.
chunkingProperties Zobacz poniższą tabelę. Opcje obejmujące sposób dzielenia tekstu na fragmenty.
chunkingProperties Parametry Dozwolone wartości Opis
method fixedSize (ustawienie domyślne) lub semantic (wersja zapoznawcza). Dostępne od interfejsu 2026-05-01-preview API REST. Strategia fragmentowania. fixedSize używa fragmentów okien opartych na znakach. semantic używa fragmentów obsługujących układ, które szanują granice akapitu i inteligentnie obsługują duże tabele obejmujące granice fragmentów.
unit characters (z fixedSize) lub tokens (wersja zapoznawcza, z elementem semantic, dostępnym od interfejsu 2026-05-01-preview API REST). Kontroluje krępność jednostki chunk. Obsługiwane są tylko kombinacje ifixedSize + characters.semantic + tokens Jeśli unit zostanie pominięty, zostanie on wywnioskowany z .method
maximumLength Gdy unit wartość to characters, liczba całkowita z zakresu od 300 do 50 000. Gdy unit wartość to tokens, liczba całkowita z zakresu od 100 do 8000. Wartość domyślna to 500. Maksymalna długość fragmentu mierzona w skonfigurowanym unitobiekcie .
overlapLength Liczba całkowita. Wartość musi być mniejsza niż połowa .maximumLength Długość nakładających się między dwoma fragmentami tekstu. Dotyczy tylko wtedy, gdy method ma wartość fixedSize. Należy pominąć lub ustawić wartość , gdy 0method ma wartość semantic.

Dane wejściowe dla umiejętności

Nazwa danych wejściowych Opis
file_data Plik, z którego należy wyodrębnić treść.

Wejście file_data musi być obiektem zdefiniowanym jako:

{
  "$type": "file",
  "data": "BASE64 encoded string of the file"
}

Alternatywnie można ją zdefiniować jako:

{
  "$type": "file",
  "url": "URL to download the file",
  "sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}

Obiekt referencyjny pliku może być generowany na jeden z następujących sposobów:

  • Ustawienie parametru allowSkillsetToReadFileData w definicji indeksera na .true To ustawienie tworzy ścieżkę /document/file_data , która jest obiektem reprezentującym oryginalne dane pliku pobrane ze źródła danych blob. Ten parametr dotyczy tylko plików w Azure Blob Storage.

    allowSkillsetToReadFileData udostępnia pobrane dane pliku umiejętności. Nie zwiększa limitów indeksatora obiektów blob ani limitów usługi Content Understanding opisanych w temacie Limity danych.

  • Posiadanie niestandardowej umiejętności zwracającej definicję obiektu JSON, która dostarcza $type, data, lub url oraz sastoken. Parametr $type musi być ustawiony na file, a data musi być podstawową tablicą bajtów zakodowaną 64 w zawartości pliku. Parametr url musi być poprawnym adresem URL umożliwiającym pobranie pliku w tej lokalizacji.

Dane wyjściowe umiejętności

Nazwa danych wyjściowych Opis
text_sections Zbiór obiektów tekstowych. Każdy chunk może obejmować wiele stron (uwzględniając dodatkowe skonfigurowane chunkingi). Obiekt fragmentu tekstu zawiera locationMetadata , jeśli ma to zastosowanie, oraz imagePath listę, gdy fragment nakłada się na rysunek w dokumencie.
normalized_images Dotyczy tylko wtedy, gdy extractionOptions zawiera images. Zbiór obrazów wyodrębnionych z dokumentu, w tym locationMetadata , jeśli dotyczy.

Każdy element w pliku text_sections ma następujące pola:

Pole Typ Opis
id String Unikatowy identyfikator fragmentu.
content String Zawartość języka Markdown dla fragmentu. Gdy method element to semantic, zawartość zawiera wygenerowane przez sztuczną inteligencję opisy liczb i tabel w postaci w postaci języka Markdown.
locationMetadata Obiekt Zakres stron i dane pozycyjne (pageNumberFrom, pageNumberTo, ordinalPosition, source). Występuje, gdy extractionOptions element zawiera locationMetadataelement .
imagePath String Rozdzielana średnikami lista ścieżek do obrazów zawartych w fragmentach. Prezentuj, gdy fragment nakłada się na rysunek w dokumencie.

Każdy element w pliku normalized_images ma następujące pola:

Pole Typ Opis
id String Unikatowy identyfikator obrazu.
data String Dane obrazu zakodowane w formacie Base64.
imagePath String Odwołanie do ścieżki do obrazu w dokumencie, na przykład "figures/0".
locationMetadata Obiekt Zakres stron i dane pozycyjne. Występuje, gdy extractionOptions element zawiera locationMetadataelement .

Examples

W pierwszym przykładzie użyto fragmentowania o stałym rozmiarze i pokazano, jak wyświetlać zawartość tekstową we fragmentach o stałym rozmiarze i wyodrębniać obrazy wraz z metadanymi lokalizacji z dokumentu. Drugi przykład, dostępny od interfejsu 2026-05-01-preview API REST, używa fragmentów semantycznych z opisami obrazów wygenerowanymi przez sztuczną inteligencję.

Przykład 1. Fragmentowanie o stałym rozmiarze z wyodrębnianiem obrazów i metadanych

{
  "skills": [
    {
      "description": "Analyze a document",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {     
          "unit": "characters",
          "maximumLength": 1325, 
          "overlapLength": 0
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        { 
          "name": "text_sections", 
          "targetName": "text_sections" 
        }, 
        { 
          "name": "normalized_images", 
          "targetName": "normalized_images" 
        } 
      ]
    }
  ]
}

Przykładowe dane wyjściowe

{
  "text_sections": [
      {
        "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
        "content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
        "locationMetadata": {
          "pageNumberFrom": 1,
          "pageNumberTo": 1,
          "ordinalPosition": 0,
          "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
        }
      },
      ...
      {
        "id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
        "content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
        "locationMetadata": {
          "pageNumberFrom": 2,
          "pageNumberTo": 3,
          "ordinalPosition": 3,
          "source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
        }
        ...
      }
    ],
    "normalized_images": [
        { 
            "id": "1_335140f1-9d31-4507-8916-2cde758639cb", 
            "data": "aW1hZ2UgMSBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 1,
              "pageNumberTo": 1,
              "ordinalPosition": 0,
              "source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
            }
        },
        { 
            "id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4", 
            "data": "aW1hZ2UgMiBkYXRh", 
            "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",  
            "locationMetadata": {
              "pageNumberFrom": 3,
              "pageNumberTo": 3,
              "ordinalPosition": 1,
              "source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
            } 
        }
    ] 
}

locationMetadata opiera się na właściwości source udostępnionej przez Azure Content Understanding. Aby uzyskać informacje o tym, jak wizualna pozycja elementu w pliku jest zakodowana, zobacz Analiza dokumentu: Extract structured content.

imagePath reprezentuje względną ścieżkę przechowywanego obrazu. Jeśli projekcja pliku magazynu wiedzy jest skonfigurowana w zestawie umiejętności, ta ścieżka odpowiada względnej ścieżce obrazu przechowywanego w magazynie wiedzy.

Przykład 2. Fragmentowanie semantyczne z opisem obrazu (wersja zapoznawcza)

Ten przykład, dostępny od interfejsu 2026-05-01-preview API REST, używa fragmentów semantycznych i tworzy wygenerowane przez sztuczną inteligencję opisy obrazów osadzonych, wykresów i diagramów. Zasób Foundry dołączony do zestawu umiejętności musi mieć model uzupełniania czatu zidentyfikowany przez modelName program i wdrożony modelDeploymentelement .

{
  "skills": [
    {
      "description": "Extract and chunk document content with image descriptions",
      "@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
      "context": "/document",
      "modelName": "gpt-4.1",
      "modelDeployment": "myGpt41Deployment",
      "extractionOptions": ["images", "locationMetadata"],
      "chunkingProperties": {
        "method": "semantic",
        "unit": "tokens",
        "maximumLength": 500
      },
      "inputs": [
        {
          "name": "file_data",
          "source": "/document/file_data"
        }
      ],
      "outputs": [
        {
          "name": "text_sections",
          "targetName": "text_sections"
        },
        {
          "name": "normalized_images",
          "targetName": "normalized_images"
        }
      ]
    }
  ]
}

W przypadku fragmentowania semantycznego każdy fragment w text_sections pliku zawiera zawartość języka Markdown zawierającą wygenerowane przez sztuczną inteligencję opisy wszystkich liczb i tabel, które obejmują. Gdy fragment nakłada się na co najmniej jeden zakres rysunku, obiekt fragmentu zawiera imagePath również pole, które zawiera odpowiednie ścieżki obrazów:

{
  "id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
  "content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
  "locationMetadata": {
    "pageNumberFrom": 1,
    "pageNumberTo": 1,
    "ordinalPosition": 0,
    "source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
  },
  "imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}