Что такое источник знаний?

Примечание

Поиск с использованием ИИ Azure доступна через портал Azure, REST API и Azure SDKs. Он также лежит в основе Foundry IQ — управляемого слоя знаний, который преобразует корпоративный контент в многократно используемые базы знаний с учетом разрешений доступа для агентов на портале Microsoft Foundry.

Important

Функции, возможности или свойства, помеченные (предварительная версия), не охватываются соглашением об уровне обслуживания, не рекомендуются для рабочих нагрузок и могут изменяться или ограничиваться до того, как они становятся общедоступными. Условия предварительной версии Поиск с использованием ИИ Azure применяются ко всем функциям предварительной версии, независимо от того, является ли он автономным или частью общедоступной функции.

Источник знаний — это ресурс верхнего уровня в службе Поиск с использованием ИИ Azure, который определяет содержимое, используемое в конвейере агентного извлечения. Каждый источник знаний является либо индексируемым, либо удалённым, что определяет способ загрузки, обработки и выполнения запросов к содержимому. Источники знаний являются обязательными компонентами базы знаний.

Вы можете ссылаться на несколько источников знаний в одной базе знаний. Агентный механизм поиска обращается ко всем им в рамках одного запроса. Подзапросы создаются для каждого источника знаний, а лучшие результаты возвращаются в ответе на поиск.

Поддерживаемые источники знаний

Поиск с использованием ИИ Azure поддерживает следующие источники знаний для рабочих нагрузок агентного поиска.

Вид Description Индексированные или удаленные
Индекс поиска Оборачивает существующий индекс. Индексируемые
Azure Blob Создает конвейер индексирования на основе контейнера BLOB-объектов. Индексируемые
Azure SQL (предварительная версия) Создает конвейер индексатора из таблицы или представления Azure SQL. Индексируемые
Файл (предварительная версия) Отправляет файлы непосредственно в Поиск с использованием ИИ Azure. Индексируемые
OneLake Создает конвейер индексатора из lakehouse. Индексируемые
Индекс SharePoint (предварительная версия) Создает конвейер индексатора на сайте SharePoint. Индексируемые
Удаленный SharePoint (предварительная версия) Извлекает содержимое из SharePoint. Удаленный
агент данных Fabric (предварительная версия) Извлекает ответы и внедренные ресурсы из агента данных Microsoft Fabric. Удаленный
Fabric Ontology (предварительная версия) Извлекает ответы на основе сущностей и связей из Microsoft Fabric ontology. Удаленный
Сервер MCP (предварительная версия) Получает результаты в реальном времени с внешнего сервера MCP с использованием инструментов. Удаленный
Рабочий IQ (предварительная версия) Извлекает организационные аналитические данные из Work IQ. Удаленный
Паутина Получает данные для обоснования в режиме реального времени из Microsoft Bing. Удаленный

Индексированные источники знаний

Индексированный источник знаний указывает на поисковый индекс, который соответствует критериям агентного извлечения. Содержимое отправляется в индекс перед временем запроса через один из трех путей:

  • Приведите собственный индекс: Используйте источник знаний индекса поиска, чтобы упаковать существующий индекс в службу поиска.

  • Прямая отправка файла: Используйте источник знаний файлов для отправки файлов непосредственно в Поиск с использованием ИИ Azure. Служба обрабатывает файлы и сохраняет извлеченное содержимое в созданном индексе поиска без внешнего хранилища или конвейера индексатора.

  • Автоматически создаваемый конвейер индексатора: Для всех остальных индексируемых источников знаний Поиск с использованием ИИ Azure автоматически создает полный конвейер индексатора на основе вашего внешнего источника данных. Это включает источник данных, набор навыков, индексатор и индекс, который заполнен и разбит на фрагменты.

Запросы выполняются локально в службе поиска с помощью полнотекстового (ключевого слова), вектора или гибридных запросов.

Поскольку индексированный источник знаний имеет связанный индекс поиска, ссылки в ответе могут включать созданные службой URL-адреса цитат (предварительная версия), которые ведут к соответствующим документам в индексе. Удаленные источники знаний не имеют резервного индекса, поэтому они не возвращают URL-адреса ссылки.

Удаленные источники знаний

Удаленный источник знаний подключается непосредственно к внешней платформе. Содержимое никогда не загружается в Поиск с использованием ИИ Azure. Вместо этого он извлекается во время запроса через собственные API каждой платформы. Агентный механизм поиска выполняет вызов API и возвращает результаты вместе с любыми проиндексированными источниками знаний в том же ответе.

В зависимости от платформы удаленные подключения достигают содержимого через общедоступный Интернет (например, Bing) или в клиенте Microsoft (например, SharePoint и Fabric).

Единый рейтинг

Для индексированных и удаленных источников знаний все извлеченные материалы передаются через один и тот же конвейер ранжирования. Результаты оцениваются по релевантности, объединяются по всем запросам и повторно ранжируются перед возвратом в составе ответа retrieval.

Работа с источниками знаний

Источники знаний — это независимые объекты, которые создаются и управляются отдельно от баз знаний. Помните о перечисленных ниже моментах.

  • Создайте источник знаний перед созданием базы знаний. Базы знаний ссылаются на источники знаний по идентификатору (ID), поэтому источник знаний должен уже существовать.

  • Чтобы удалить источник знаний, сначала обновите или удалите все базы знаний, ссылающиеся на него. Затем можно удалить источник знаний.

  • Источник знаний и его база знаний должны существовать в той же службе поиска.

Создание источников знаний

Возможность создания объектов в портале Azure, портале Microsoft Foundry, REST API и пакетах SDK для Azure зависит от типа источника знаний. Инструкции по каждому типу см. по ссылкам в поддерживаемых источниках знаний.

Прием меток конфиденциальности (предварительная версия)

Для источников знаний BLOB, индексированных OneLake и индексированных SharePoint можно принимать метки конфиденциальности Microsoft Purview, установив ingestionPermissionOptions так, чтобы он включал sensitivityLabel. Перед настройкой этого значения следуйте всем предварительным требованиям. После синхронизации с индексом метки отображаются в ответах и используются для принудительного доступа на уровне документа во время запроса. Дополнительные сведения см. в разделе "Принудительное применение разрешений во время запроса (предварительная версия)".

Если индексируемый источник знаний использует индекс, разбитый на фрагменты, например при использовании встроенной векторизации или пользовательского навыка Text Split, необходимо также сопоставить метку конфиденциальности каждой строке фрагмента с помощью проекций индекса в наборе навыков. В противном случае ссылки на фрагменты в ответах retrieve не будут возвращаться, если они содержат метки в исходном документе.

Отображение изображений, встроенных в документ (предварительная версия)

Для источников знаний Blob, индексированных OneLake и SharePoint, можно настроить assetStore в ingestionParameters источника знаний, чтобы сохранять изображения, встроенные в исходные документы. Если вы также включите выдачу изображений в базе знаний, действие retrieve добавит эти изображения в запрос на синтез ответа, чтобы LLM могла анализировать диаграммы, графики и извлечённое из изображений содержимое. Дополнительные сведения см. в разделе Отображение изображений, внедренных в документ, при агентном поиске (предварительная версия).

Не настраивайте ingestionPermissionOptions и assetStore для одного и того же источника знаний. Показ изображений не поддерживается, если настроен параметр ingestionPermissionOptions.

Ограничение приема в частную сеть (предварительная версия)

Blob, источники знаний SharePoint с индексированием и источники знаний Azure SQL с индексированием поддерживают закрытое выполнение индексатора. Для больших двоичных объектов и Azure SQL утвержденные общие частные ссылки могут защитить исходное подключение и Azure зависимости. SharePoint Online не является общей целью для частной ссылки, поэтому приватный режим применяется только к защищённым зависимостям Azure.

В настоящее время частная синхронизация не поддерживается для индексированных источников знаний OneLake.

Используйте автоматические анализаторы для каждого языка (предварительная версия)

Источники знаний Blob, индексированный OneLake и индексированный SharePoint поддерживают автоматический выбор анализаторов для каждого языка при работе с многоязычным контентом. Если этот параметр включен, Поиск с использованием ИИ Azure обнаруживает язык каждого исходного документа и автоматически применяет соответствующий анализатор языка Microsoft. Вы не указываете анализатор в определении источника знаний или запросе.

Использование источников знаний

После создания источника знаний укажите его в базе знаний. База знаний определяет, какие источники знаний запрашивать. В следующих разделах описываются параметры, определяющие, какие источники включаются и как модуль выбирает между ними.

Всегда запрашивать источник знаний

Установите для alwaysQuery значение true в определении источника знаний, чтобы включать его в каждый запрос независимо от уровня усилий, затрачиваемых на рассуждения при извлечении.

Используйте усилия по извлечению причин для управления использованием LLM (предварительная версия)

Попытка извлечения определяет, сколько обработки LLM применяется к каждому запросу. Не все решения получают преимущества от планирования запросов LLM. Если простота и скорость являются приоритетом, используйте minimal усилия для обхода обработки LLM. При уровне усилий low и medium LLM планирует и выбирает, к каким источникам знаний обращаться, а medium добавляет итеративный проход для получения более глубоких результатов. Дополнительные сведения о каждом уровне см. в статье Настройка усилия рассуждения при извлечении (предварительная версия).

Следующие факторы влияют на выбор на уровне low и medium усилий:

  • Источник name знаний.

  • Индекс description (для индексированных источников знаний).

  • retrievalInstructions, указанный в определении базы знаний или в действии извлечения. Инструкции по извлечению данных определяют, какие источники знаний LLM выбирает или пропускает. Они работают как запрос: можно указать краткость, тон и форматирование.