Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Note
Поиск с использованием ИИ Azure доступна через портал Azure, REST API и Azure SDKs. Он также лежит в основе IQ Foundry, управляемого уровня знаний, который преобразует корпоративное содержимое в многократно используемые базы знаний с поддержкой разрешений для агентов на портале Foundry Microsoft.
Important
Функции, возможности или свойства, помеченные (предварительная версия), не охватываются соглашением об уровне обслуживания, не рекомендуются для рабочих нагрузок и могут изменяться или ограничиваться до того, как они становятся общедоступными. Условия предварительной версии Поиск с использованием ИИ Azure применяются ко всем функциям предварительной версии, независимо от того, является ли он автономным или частью общедоступной функции.
Навык Azure Content Understanding использует анализаторы документов из Azure Content Understanding in Foundry Tools для анализа неструктурированных документов и других типов контента, генерируя организованные, поисковые выходы, которые можно интегрировать в автоматизацию. Этот навык извлекает как текст, так и изображения, включая метаданные местоположения, которые сохраняют положение каждого изображения в документе. Близость изображения к связанному контенту особенно полезна для мультимодального поиска, агентного поиска и генерации с дополненным поиском (RAG).
Навык Azure Content Understanding привязан к billable Microsoft Foundry resource. В отличие от других Azure навыков ИИ, таких как навык Document Layout, навык Azure Content Understanding не предоставляет 20 бесплатных документов для каждого индексатора в день. Выполнение этого навыка взимается по цене Azure Content Understanding.
Вы можете использовать навык Azure Content Understanding как для извлечения контента, так и для фрагментирования. Нет необходимости использовать навык Text Split в вашем наборе навыков. Этот навык реализует тот же интерфейс, что и навык Document Layout, который использует модель верстки Azure Document Intelligence in Foundry Tools когда outputFormat установлена на text. Однако навык Azure Content Understanding имеет несколько преимуществ по сравнению с навыком Document Layout:
Таблицы и рисунки выводятся в формате Markdown, что облегчает их понимание для больших языковых моделей (LLM). В отличие от этого, навык верстки документа выводит таблицы и рисунки в виде простого текста, что может привести к потере информации.
Для таблиц, охватывающих несколько страниц, навык распознавания содержимого Azure может распознавать и извлекать межстраничные таблицы в виде одной единицы.
Навык распознавания содержимого Azure позволяет фрагментам охватывать несколько страниц с помощью семантических единиц.
Навык понимания контента Azure более экономичен, чем навык верстки документов, поскольку API понимания контента дешевле.
Azure Content Understanding может создавать описания на основе ИИ для изображений, диаграмм, схем и внедренных фигур. Внедренные описания рисунков включаются непосредственно в содержимое Markdown, созданное для получения. Эти описания доступны для поиска и могут улучшить заземление RAG и многомодальное качество извлечения.
Навык Azure распознавания содержимого общедоступен в интерфейсе REST API 2026-04-01 REST API. Начиная с 2026-05-01-previewнавыка при необходимости создается описание изображений на основе ИИ для внедренных в документ изображений, диаграмм и схем (предварительная версия). Чтобы включить описания, необходимо развернуть модель завершения чата OpenAI Azure в ресурсе Foundry, подключенном к набору навыков. Эта версия API также добавляет семантические блоки (предварительная версия), параметр с поддержкой макета, который учитывает границы абзаца и измеряет длину блока в токенах. Для обоих возможностей требуется согласие. Если новые параметры опущены, навык работает так же, как и в стабильной 2026-04-01 версии API.
Ограничения
Навык понимания контента Azure имеет следующие ограничения:
Этот навык не подходит для крупных документов, требующих обработки более пяти минут в анализаторе документов Content Understanding. Время навыка истекает, но заряды всё равно начисляются на ресурс Foundry, привязанный к набору навыков. Убедитесь, что документы оптимизированы так, чтобы они оставались в пределах объема обработки и избегали ненужных затрат.
Этот навык вызывает анализатор документов Azure Content Understanding, поэтому все задокументированные сервисные поведения для разных типов документов применяются к его выводу. Например, файлы Word (DOCX) и PDF могут давать разные результаты из-за различий в обработке изображений. Если требуется согласованное поведение изображений между DOCX и PDF, рассмотрите возможность конвертации документов в PDF или просмотра мультимодальной поисковой документации на поиск альтернативных подходов.
Поддерживаемые регионы
Навык Azure Content Understanding называет Content Understanding 2025-11-01 REST API. Ваш ресурс Foundry должен находиться в поддерживаемом регионе, описанном в Azure Content Understanding region and language support.
Ваш поисковый сервис может находиться в любом поддерживаемом Поиск с использованием ИИ Azure регионе. Когда ваш ресурс Foundry и сервис Поиск с использованием ИИ Azure не находятся в одном регионе, задержка в межрегиональной сети влияет на производительность индексера.
Поддерживаемые форматы файлов
Навык Azure Content Understanding распознаёт следующие форматы файлов:
- . JPEG
- .JPG
- .PNG
- .BMP
- . HEIF
- . TIFF
- .DOCX
- . XLSX
- .PPTX
- .HTML
- .TXT
- . MD
- . RTF
- . EML
Поддерживаемые языки
Для печатного текста см. Azure Content Understanding region and language support.
@odata.type
Microsoft.Skills.Util.ContentUnderstandingSkill
Ограничения данных
Даже если размер файла для анализа документов находится в пределах 200 МБ, как описано в Azure Content Understanding Service Quotas and Limits, индексация всё равно подчиняется лимитам indexer уровня поискового сервиса.
Размеры изображения должны быть от 50 пикселей x 50 пикселей или 10 000 пикселей x 10 000 пикселей.
Если ваши PDF-файлы заблокированы паролем, снимите блокировку перед запуском индексера.
Параметры навыков
Параметры чувствительны к регистру.
| Имя параметра | Допустимые значения | Описание |
|---|---|---|
extractionOptions |
["images"], , ["images", "locationMetadata"]["locationMetadata"] |
Определите любое дополнительное содержимое из документа. Определите массив enums, соответствующих содержимому, которое должно быть включено в результат. Например, если extractionOptions есть ["images", "locationMetadata"], выход включает изображения и метаданные местоположения, которые предоставляют местоположение страницы и визуальную информацию, связанную с местом извлечения контента. |
modelName (предварительная версия) |
Строка, например "gpt-4.1". |
Optional. Доступно начиная с 2026-05-01-preview REST API. Имя модели завершения чата OpenAI Azure, используемой для создания описания внедренных изображений, диаграмм и схем. Описание изображения не зависит от extractionOptions и может быть включено без извлечения изображений. Необходимо указать вместе с modelDeployment. Список поддерживаемых моделей см. в разделе "Поддерживаемые модели создания". |
modelDeployment (предварительная версия) |
Струна. | Optional. Доступно начиная с 2026-05-01-preview REST API. Имя развертывания модели Azure OpenAI в ресурсе Foundry, подключенном к набору навыков. Необходимо указать вместе с modelName. |
chunkingProperties |
См. следующую таблицу. | Опции, которые охватывают способы фрагментирования текстового контента. |
chunkingProperties параметры |
Допустимые значения | Описание |
|---|---|---|
method |
fixedSize (по умолчанию) или semantic (предварительная версия). Доступно начиная с 2026-05-01-preview REST API. |
Стратегия блокирования.
fixedSize использует блоки на основе символов.
semantic использует фрагмент с поддержкой макета, который учитывает границы абзаца и интеллектуально обрабатывает большие таблицы, охватывающие границы блоков. |
unit |
characters (с fixedSize) или tokens (предварительная версия, semanticдоступная начиная с 2026-05-01-preview REST API). |
Контролирует мощность блока чанка.
fixedSize
+
characters
semantic
+
tokensПоддерживаются только сочетания. Если unit опущен, он выводится из method. |
maximumLength |
Когда unit есть charactersцелое число от 300 до 50 000. В unit противном случае tokensцелое число от 100 до 8000. Значение по умолчанию — 500. |
Максимальная длина блока, измеряемая в настроенном unitобъекте. |
overlapLength |
Integer. Значение должно быть меньше половины maximumLength. |
Длина перекрытия между двумя блоками текста. Применяется только в том methodслучаеfixedSize. Должен быть опущен или задан в том 0methodслучаеsemantic. |
Входные параметры навыков
| Введите имя | Описание |
|---|---|
file_data |
Файл, из которого следует извлекать содержимое. |
Вход должен быть объектом, определённым file_data следующим образом:
{
"$type": "file",
"data": "BASE64 encoded string of the file"
}
Альтернативно, его можно определить как:
{
"$type": "file",
"url": "URL to download the file",
"sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}
Объект ссылки на файл может быть сгенерирован одним из следующих способов:
Установите
allowSkillsetToReadFileDataпараметр в определении индексатора наtrue. Эта настройка создаёт/document/file_dataпуть — объект, представляющий исходные данные файла, загруженные из вашего blob-источника. Этот параметр применяется только к файлам в Хранилище BLOB-объектов Azure.allowSkillsetToReadFileDataделает скачанные данные файла доступными для навыка. Он не увеличивает ограничения индексатора BLOB-объектов или ограничения службы "Распознавание содержимого", описанные в ограничениях данных.Наличие пользовательского навыка, возвращающего определение объекта JSON, которое предоставляет
$type,data, илиurlиsastoken. Параметр$typeдолжен быть установлен вfile, иdataдолжен быть базовым 64-кодовым массив байтов содержимого файла. Параметрurlдолжен быть действительным URL с доступом для скачивания файла в этом месте.
Выходные данные навыка
| Имя результата | Описание |
|---|---|
text_sections |
Коллекция объектов текстовых фрагментов. Каждый чанк может занимать несколько страниц (с учётом дополнительного настройки чанков). Объект фрагмента текста включает в себя locationMetadata , если применимо, и imagePath список, когда блок перекрывается с диапазонами фигур в документе. |
normalized_images |
Применяется только если extractionOptions включает images. Коллекция изображений, извлечённых из документа, включая locationMetadata , если применимо. |
Каждый элемент в text_sections следующих полях:
| Поле | Тип | Описание |
|---|---|---|
id |
String | Уникальный идентификатор блока. |
content |
String | Содержимое Markdown для блока.
methodВ semantic этом случае содержимое включает в себя описания рисунков и таблиц, созданных ИИ, как Markdown. |
locationMetadata |
Объект | Диапазон страниц и позиционные данные (pageNumberFrom,, pageNumberTo, ordinalPositionsource). Присутствует при extractionOptions включении locationMetadata. |
imagePath |
String | Разделенный точкой с запятой список путей к изображениям, содержащимся в блоке. Присутствует, когда блок перекрывается с диапазонами фигур в документе. |
Каждый элемент в normalized_images следующих полях:
| Поле | Тип | Описание |
|---|---|---|
id |
String | Уникальный идентификатор изображения. |
data |
String | Данные изображения в кодировке Base64. |
imagePath |
String | Ссылка на путь к изображению в документе, например "figures/0". |
locationMetadata |
Объект | Диапазон страниц и позиционные данные. Присутствует при extractionOptions включении locationMetadata. |
Examples
В первом примере используется фрагментирование фиксированного размера и показано, как выводить текстовое содержимое в блоках фиксированного размера и извлекать изображения вместе с метаданными расположения из документа. Второй пример, доступный начиная с 2026-05-01-preview REST API, использует семантические блоки с описаниями изображений, созданными ИИ.
Пример 1. Блоки фиксированного размера с извлечением изображений и метаданных
{
"skills": [
{
"description": "Analyze a document",
"@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
"context": "/document",
"extractionOptions": ["images", "locationMetadata"],
"chunkingProperties": {
"unit": "characters",
"maximumLength": 1325,
"overlapLength": 0
},
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "text_sections",
"targetName": "text_sections"
},
{
"name": "normalized_images",
"targetName": "normalized_images"
}
]
}
]
}
Пример полученных результатов
{
"text_sections": [
{
"id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
"content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
}
},
...
{
"id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
"content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
"locationMetadata": {
"pageNumberFrom": 2,
"pageNumberTo": 3,
"ordinalPosition": 3,
"source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
}
...
}
],
"normalized_images": [
{
"id": "1_335140f1-9d31-4507-8916-2cde758639cb",
"data": "aW1hZ2UgMSBkYXRh",
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
}
},
{
"id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4",
"data": "aW1hZ2UgMiBkYXRh",
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",
"locationMetadata": {
"pageNumberFrom": 3,
"pageNumberTo": 3,
"ordinalPosition": 1,
"source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
}
}
]
}
locationMetadata основан на свойстве source, предоставленном Azure Content Understanding. Для получения информации о том, как кодируется визуальное положение элемента в файле, см. раздел Анализ документа: Извлечение структурированного контента.
imagePath представляет относительный путь сохранённого изображения. Если проекция файла хранилища знаний настроена в наборе навыков, этот путь совпадает с относительным путём изображения, хранящегося в хранилище знаний.
Пример 2. Семантическая блокирование с описанием изображения (предварительная версия)
В этом примере, доступном начиная с 2026-05-01-preview REST API, используются семантические блоки и создаются описания внедренных изображений, диаграмм и схем СИ. Ресурс Foundry, подключенный к набору навыков, должен иметь модель завершения чата, определяемую modelName и развернутой modelDeployment.
{
"skills": [
{
"description": "Extract and chunk document content with image descriptions",
"@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
"context": "/document",
"modelName": "gpt-4.1",
"modelDeployment": "myGpt41Deployment",
"extractionOptions": ["images", "locationMetadata"],
"chunkingProperties": {
"method": "semantic",
"unit": "tokens",
"maximumLength": 500
},
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "text_sections",
"targetName": "text_sections"
},
{
"name": "normalized_images",
"targetName": "normalized_images"
}
]
}
]
}
При семантической блокировке каждый блок содержит text_sections содержимое Markdown, включающее описания всех цифр и таблиц, которые он охватывает. Если блок перекрывается с одним или несколькими диапазонами фигур, объект блока также включает imagePath поле, в которое перечислены соответствующие пути изображения:
{
"id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
"content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
},
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}