Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Note
Поиск с использованием ИИ Azure доступна через портал Azure, REST API и Azure SDKs. Он также лежит в основе Foundry IQ — управляемого слоя знаний, который преобразует корпоративный контент в многократно используемые базы знаний с учетом разрешений доступа для агентов на портале Microsoft Foundry.
Область применения: индексаторы BLOB-объектов, индексаторы файлов (предварительная версия)
При использовании индексатора для извлечения текста большого двоичного объекта или содержимого файла для полнотекстового поиска можно назначить режим синтаксического анализа, чтобы получить лучшие результаты индексирования. По умолчанию индексатор анализирует свойство большого двоичного объекта content как один блок текста. Однако, если все блобы и файлы содержат обычный текст в одной кодировке, можно значительно повысить производительность индексирования с помощью режима text парсинга.
Рекомендации по text синтаксическому анализу включают одну или несколько из следующих характеристик:
- Тип файла —
.txt - Файлы имеют любой тип, но сам контент является текстом (например, исходный код программы, HTML, XML и т. д.). Для файлов на языке разметки синтаксические символы передаются как статический текст.
Помните, что все индексаторы сериализуются в JSON. По умолчанию содержимое всего текстового файла индексируется в одном большом поле как "content": "<file-contents>". Новые строки и инструкции возврата внедрены в поле содержимого и выражаются как \r\n\.
Если требуется более подробный или детализированный результат, и если тип файла совместим, рассмотрите следующие решения:
-
delimitedTextРежим синтаксического анализа, если источник — CSV -
jsonArrayилиjsonLines, если источник — JSON
Альтернативный третий вариант для разбиения содержимого в несколько частей требует расширенных функций в виде обогащения ИИ. Он добавляет анализ, который идентифицирует и назначает блоки файла разным полям поиска. Вы можете найти полное или частичное решение с помощью встроенных навыков , таких как распознавание сущностей или извлечение ключевых слов, но более вероятное решение может быть пользовательской моделью обучения, которая понимает содержимое, упаковав его в пользовательский навык.
Настройка индексирования обычного текста
Чтобы индексировать большие двоичные объекты обычного текста, создайте или обновите определение индексатора со parsingMode свойством конфигурации, заданным text в запросе Create Indexer :
PUT https://[service name].search.windows.net/indexers/[indexer name]?api-version=2026-04-01
Content-Type: application/json
api-key: [admin key]
{
... other parts of indexer definition
"parameters" : { "configuration" : { "parsingMode" : "text" } }
}
По умолчанию предполагается кодировка UTF-8 . Чтобы указать другую кодировку encoding , используйте свойство конфигурации. Поддерживаемый список кодировок находится в столбце поддержки .NET 5 и более поздних версий.
{
... other parts of indexer definition
"parameters" : { "configuration" : { "parsingMode" : "text", "encoding" : "iso-8859-1" } }
}
Пример запроса
Режимы синтаксического анализа указываются в определении индексатора.
POST https://[service name].search.windows.net/indexers?api-version=2026-04-01
Content-Type: application/json
api-key: [admin key]
{
"name" : "my-plaintext-indexer",
"dataSourceName" : "my-blob-datasource",
"targetIndexName" : "my-target-index",
"parameters" : { "configuration" : { "parsingMode" : "delimitedText", "delimitedTextHeaders" : "id,datePublished,tags" } }
}