Recherche multimodale dans Recherche Azure AI

Note

Recherche Azure AI est disponible via le portail Azure, les API REST et les SDK Azure. Il sous-tend également Foundry IQ, la couche de connaissances managée qui transforme le contenu d’entreprise en bases de connaissances réutilisables et prenant en charge les autorisations pour les agents dans le portail Microsoft Foundry.

La recherche modale fait référence à la possibilité d’ingérer, de comprendre et de récupérer des informations sur plusieurs types de contenu, notamment du texte, des images, des vidéos et de l’audio. Dans Recherche Azure AI, la recherche modale prend en charge en mode natif l’ingestion de documents contenant du texte et des images et la récupération de leur contenu, ce qui vous permet d’effectuer des recherches qui combinent les deux modalités.

La création d’un pipeline modal robuste implique généralement les éléments suivants :

  1. Extraction d’images inline et de texte de page à partir de documents.

  2. Description d’images en langage naturel.

  3. Incorporation de texte et d’images dans un espace vectoriel partagé.

  4. Stockage des images pour une utilisation ultérieure en tant qu’annotations.

La recherche modale nécessite également la préservation de l’ordre des informations telles qu’elles apparaissent dans les documents et l’exécution de requêtes hybrides qui combinent la recherche en texte intégral avec la recherche vectorielle et le classement sémantique.

Dans la pratique, une application qui utilise la recherche modale peut répondre à des questions telles que « Quel est le processus d’approbation d’un formulaire RH ? » même si la seule description faisant autorité du processus réside dans un diagramme incorporé dans un fichier PDF.

Traditionnellement, la recherche modale nécessite des systèmes distincts pour le traitement de texte et d’images, nécessitant souvent des configurations personnalisées de code et de bas niveau des développeurs. La maintenance de ces systèmes entraîne des coûts, une complexité et un effort plus élevés.

Recherche Azure AI répond à ces défis en intégrant des images dans le même pipeline de récupération que le texte. Avec un seul pipeline multimodal, vous pouvez simplifier la configuration et déverrouiller les informations qui se trouvent dans des graphiques, des captures d’écran, des infographies, des formulaires numérisés et d’autres visuels complexes.

La recherche modale est idéale pour les scénarios de génération augmentée de récupération (RAG). En interprétant la logique structurelle des images, la recherche modale rend votre application RAG ou agent IA moins susceptible d’ignorer les détails visuels importants. Il fournit également à vos utilisateurs des réponses détaillées qui peuvent être retracées vers leurs sources d’origine, quelle que soit la modalité de la source.

Comment fonctionne la recherche multimodale ?

Pour simplifier la création d’un pipeline modal, Recherche Azure AI propose l’Assistant Importer des données dans le portail Azure. L’Assistant vous aide à configurer une source de données, à définir des paramètres d’extraction et d’enrichissement et à générer un index modal qui contient du texte, des références d’images incorporées et des incorporations vectorielles. Pour plus d’informations, consultez Quickstart : Recherche modale dans le portail Azure.

L’assistant suit ces étapes pour créer un pipeline multimodal :

  1. Extraire le contenu : Choisissez la compétence d’extraction de documents ou la compétence Azure Content Understanding pour obtenir le texte des pages, des images intégrées et des métadonnées structurelles. Chaque compétence offre des fonctionnalités différentes pour l’extraction de métadonnées, la gestion des tables et la prise en charge du format de fichier. Pour obtenir des comparaisons détaillées, consultez Options pour l’extraction de contenu modal.

  2. Texte du bloc : La fonction de fractionnement de texte divise le texte extrait en blocs gérables à utiliser dans le pipeline restant, comme la fonction d’incorporation.

  3. Générer des descriptions d’images : La GenAI Prompt Skill verbalise des images, produisant des descriptions concises en langage naturel pour la recherche de texte et l’incorporation à l’aide d’un grand modèle de langage (LLM).

  4. Génération d’incorporations : La compétence d’incorporation crée des représentations vectorielles de texte et d’images, ce qui permet la similarité et la récupération hybride. Vous pouvez appeler nativement les modèles d’incorporation de Azure OpenAI, de Microsoft Foundry ou de Azure Vision (préversion).

    Vous pouvez également ignorer la verbalisation des images et passer directement le texte et les images extraits à un modèle d’incorporation modale par le biais de la compétence AML ou Azure Compétence d’incorporation modale Vision. Pour plus d’informations, consultez Options d’incorporation de contenu modal.

  5. Stockez les images extraites : La base de connaissances contient des images extraites qui peuvent être retournées directement aux applications clientes. Lorsque vous utilisez l’Assistant, l’emplacement d’une image est stocké directement dans l’index modal, ce qui permet une récupération pratique au moment de la requête.

Conseil

Pour afficher la recherche modale en action, connectez votre index créé par l’Assistant à l’exemple d’application RAG modal. L’exemple montre comment une application RAG consomme un index modal et affiche à la fois des citations textuelles et des extraits d’image associés dans la réponse. L’exemple présente également le processus basé sur le code de l’ingestion et de l’indexation des données.

Options d’extraction de contenu multimodal

Un pipeline multimodal commence par découper chaque document source en blocs de texte, d'images intégrées et de métadonnées associées. Pour cette étape, Recherche Azure AI fournit deux compétences intégrées recommandées :

Caractéristique Compétence Extraction de documents fonctionnalité Azure Compréhension de Contenu
Extraction des métadonnées d’emplacement de texte (pages et polygones délimitants) Non Oui
Extraction des métadonnées d’emplacement de l'image (pages et polygones délimitants) Oui Oui
Extraction et conservation des tables Non Oui (y compris les tableaux traversant les pages)
Unités sémantiques interpage Non applicable Oui (dépasse les limites des pages)
Extraction des métadonnées d’emplacement en fonction du type de fichier Fichiers PDF uniquement. Plusieurs types de fichiers pris en charge, notamment PDF, DOCX, XLSX et PPTX.
Facturation pour l’extraction de données L’extraction d’images est facturée en fonction de la tarification Recherche Azure AI. Facturé en fonction de la tarification Azure Content Understanding.
Segmentation intégrée Non (utiliser la compétence Fractionner du texte) Oui (segmentation sémantique)
Descriptions d’images générées par l’IA Non Oui (quand modelName et modelDeployment sont configurés, disponibles à partir de l’API 2026-05-01-preview REST)
Scénarios recommandés Prototypage rapide ou pipelines de production où des informations de disposition exactes ou détaillées ne sont pas requises. Analyse avancée des documents nécessitant l’extraction de tables multipage, la segmentation sémantique et les descriptions d’images générées par l’IA.

La compétence Mise en page de document est toujours prise en charge pour les pipelines existants. Pour les nouveaux ensembles de compétences, utilisez la compétence Azure Content Understanding, qui combine l’extraction de contenu et la segmentation en une seule compétence et prend en charge la segmentation sémantique, les descriptions d’images générées par l’IA et l’extraction de tables croisées.

Options d’incorporation de contenu multimodal

Dans Recherche Azure AI, la récupération des connaissances à partir d’images peut suivre deux chemins complémentaires : la verbalisation des images ou les incorporations directes. La compréhension des distinctions vous permet d’aligner les coûts, la latence et de répondre à la qualité des besoins de votre application.

Verbalisation d’image suivie d’incorporations de texte

Avec cette méthode, la compétence GenAI Prompt appelle un LLM pendant l’ingestion pour créer une description concise en langage naturel de chaque image extraite, tel que « Workflow d’accès RH en cinq étapes qui commence par l’approbation du responsable ». La description est stockée sous forme de texte et incorporée en même temps que le texte du document environnant, que vous pouvez ensuite vectoriser en appelant le Azure OpenAI, Microsoft Foundry ou Azure Vision modèles incorporés.

Étant donné que l’image est maintenant exprimée dans un langage, Recherche Azure AI peut :

  • Interpréter les relations et les entités affichées dans un diagramme.

  • Fournissez des légendes prêtes que LLM peut citer textuellement dans une réponse.

  • Retournez des extraits de code pertinents pour les applications RAG ou les scénarios d’agent IA avec des données ancrées.

La profondeur sémantique ajoutée implique un appel LLM pour chaque image et une augmentation marginale du temps d’indexation.

Incorporations multimodales directes

Une deuxième option consiste à passer les images extraites du document et le texte à un modèle d’incorporation modale qui produit des représentations vectorielles dans le même espace vectoriel. La configuration est simple et aucun LLM n’est requis au moment de l’indexation. Les incorporations directes conviennent parfaitement aux scénarios de similarité visuelle et aux situations « trouve-moi quelque chose qui ressemble à ça ».

Étant donné que la représentation est purement mathématique, elle ne transmet pas pourquoi deux images sont liées et ne propose pas le contexte prêt LLM pour les citations ou des explications détaillées.

Combinaison des deux approches

De nombreuses solutions ont besoin des deux chemins d’encodage. Les diagrammes, les organigrammes et d'autres visuels explicatifs sont verbalisés afin que les informations sémantiques soient disponibles pour l'ancrage des agents RAG et IA. Des captures d’écran, des photos de produit ou des illustrations sont incorporées directement pour une recherche de similarité efficace. Vous pouvez personnaliser votre pipeline d'index et l'ensemble de compétences de l'indexeur dans Recherche Azure AI pour qu'il stocke les deux ensembles de vecteurs et les récupère côte à côte.

Options d’interrogation de contenu multimodal

Si votre pipeline multimodal est alimenté par la fonctionnalité d'invite GenAI, vous pouvez exécuter des requêtes hybrides sur du texte brut et des images verbalisées dans votre index de recherche. Vous pouvez également utiliser des filtres pour affiner les résultats de recherche à des types de contenu spécifiques, tels que du texte ou uniquement des images.

Bien que la compétence d’invite GenAI prenne en charge les requêtes de texte-en-vecteur via la recherche hybride, elle ne prend pas en charge les requêtes d'image-en-vecteur. Seuls les modèles d’incorporation modale fournissent les vectoriseurs qui convertissent des images en vecteurs au moment de la requête.

Pour utiliser des images comme entrées de requête pour votre index modal, vous devez utiliser la compétence AML ou Azure Vision avec un vectoriseur équivalent. Pour plus d’informations, consultez Configurer un vectoriseur dans un index de recherche.

Tutoriels et exemples

Pour vous aider à vous familiariser avec la recherche modale dans Recherche Azure AI, voici une collection de contenu qui montre comment créer et optimiser des index modals à l'aide de Azure fonctionnalités.

Contenu Description
Quickstart : Recherche modale dans le portail Azure Créez et testez un index modal dans le portail Azure à l’aide de l’Assistant et de l’Explorateur de recherche.
Didacticiel multimodal Extrayez du texte et des images, segmentez des données et vectorisez les blocs pour la recherche de similarité et d’autres modèles de récupération.
Application Exemple : dépôt GitHub de RAG multimodal Application RAG prête à être codée de bout en bout avec des fonctionnalités multimodales qui mettent en avant à la fois les extraits de texte et les annotations d’image. Idéal pour lancer des copilotes d'entreprise.