Assistant d'importation de données dans le portail Azure

Note

Recherche Azure AI est disponible via le portail Azure, les API REST et les SDK Azure. Il sous-tend également Foundry IQ, la couche de connaissances managée qui transforme le contenu d’entreprise en bases de connaissances réutilisables et prenant en charge les autorisations pour les agents dans le portail Microsoft Foundry.

L’Assistant Importer des données dans le portail Azure fournit un chemin d’accès sans code à un index de recherche interrogeable. Il se connecte à une source de données prise en charge, configure l’enrichissement et la vectorisation d’IA facultatifs, déduit un schéma d’index et charge le contenu dans l’index. Vous pouvez utiliser l’Assistant pour la recherche de mots clés, RAG et RAG multimodal.

L’Assistant prend en charge :

  • Création d’un pipeline d’indexation, y compris un index, un indexeur, une source de données et un ensemble de compétences.
  • Indexeurs intégrés et connecteurs Azure Logic Apps.
  • Enrichissement de l’IA basée sur les compétences.
  • Segmentation des données et vectorisation intégrée, y compris les incorporations modales.
  • Configuration du classement sémantique.
  • Création d’une base de connaissances.

Ce que l’Assistant prend en charge

Cette section décrit les fonctionnalités disponibles dans l’assistant.

Données d’exemple intégrées

Les données d'exemple intégrées pour l’index « hotels-sample » ne sont plus disponibles. Toutefois, vous pouvez créer un index identique en suivant Quickstart : recherche en texte intégral dans le portail Azure.

Sources de données

L’assistant se connecte aux sources de données suivantes à l’aide des indexeurs intégrés ou des connecteurs Logic Apps.

Source de données Soutenu Connexion
ADLS Gen2 ✅ Indexeur intégré
Stockage Blob Azure ✅ Indexeur intégré
Azure Stockage de fichiers ✅ Connecteur Logic Apps
Files d'attente Azure ✅ Connecteur Logic Apps
Azure Table Storage ✅ Indexeur intégré
Azure SQL Database et Managed Instance ✅ Indexeur intégré
Cosmos DB pour NoSQL ✅ Indexeur intégré
Cosmos DB pour MongoDB (préversion) ✅ Indexeur intégré
Cosmos DB pour Apache Gremlin (préversion) ✅ Indexeur intégré
MySQL (préversion) ❌ Sans objet
OneDrive ✅ Connecteur Logic Apps
OneDrive Entreprise ✅ Connecteur Logic Apps
OneLake ✅ Indexeur intégré
Service Bus ✅ Connecteur Logic Apps
SharePoint ✅ Connecteur Logic Apps
SQL Server sur les machines virtuelles ✅ Indexeur intégré

Conseil / Astuce

Au lieu d’utiliser un connecteur Logic Apps pour Azure stockage de fichiers ou SharePoint, vous pouvez utiliser les API REST du service de recherche pour indexer par programmation les données de ces sources. Pour plus d’informations, consultez Indexer les données de Azure Files (préversion) et indexer les données de SharePoint bibliothèques de documents (préversion).

Compétences

Les compétences suivantes peuvent apparaître dans un ensemble de compétences généré par un assistant. Une fois l’ensemble de compétences créé, vous pouvez modifier sa définition JSON pour ajouter ou supprimer des compétences.

Compétence Soutenu Descriptif
AML ✅ Disponible uniquement pour RAG et multimodal RAG.
Azure Vision intégration multimodale (préversion) ✅ Disponible uniquement pour RAG et multimodal RAG.
Intégration OpenAI d'Azure ✅ Disponible uniquement pour RAG et multimodal RAG.
Disposition du document ✅ Disponible uniquement pour RAG et multimodal RAG.
Reconnaissance d’entité ✅ Disponible uniquement pour la recherche par mot clé.
Analyse d’image ✅ Disponible pour les blobs stockage Azure et les fichiers Microsoft OneLake, en utilisant le mode d'analyse par défaut. Utilisez un type de contenu d’image, tel que PNG ou JPG, ou une image incorporée dans un fichier d’application, tel que PDF.
Extraction d’expressions clés ✅ Disponible uniquement pour la recherche par mot clé.
Détection de la langue ✅ Disponible uniquement pour la recherche par mot clé. Ajouté automatiquement lorsque l’ensemble de compétences inclut la reconnaissance d’entité, l’extraction d’expressions clés ou le fractionnement de texte. Non configurable par l’utilisateur.
Traduction de texte ❌ Non applicable.
OCR ✅ Disponible pour les blobs stockage Azure et les fichiers Microsoft OneLake, en utilisant le mode d'analyse par défaut. Utilisez un type de contenu d’image, tel que PNG ou JPG, ou une image incorporée dans un fichier d’application, tel que PDF.
Détection d’informations personnelles ❌ Non applicable.
Sentiment ❌ Non applicable.
Shaper ❌ Non applicable.
Fractionnement de texte ✅ Ajouté pour la segmentation des données lorsque vous choisissez un modèle d’incorporation. Pour les compétences non intégrées, il est ajouté lorsque vous définissez la granularité du champ source sur des pages ou des phrases.
Fusion de texte ✅ Ajouté pour la segmentation des données lorsque vous choisissez un modèle d’incorporation. Pour les compétences non intégrées, il est ajouté lorsque vous définissez la granularité du champ source sur des pages ou des phrases.

Classement sémantique

Le classement sémantique est disponible pour tous les scénarios de l'assistant : recherche de mots clés, RAG et RAG multimodal. Si vous l’activez, l’Assistant ajoute une configuration sémantique à l’index.

Bases de connaissances

La création d’une base de connaissances est disponible uniquement pour le scénario RAG modal. L’Assistant extrait des images de vos documents et les stocke en tant qu’objets blob dans un conteneur de stockage Azure que vous spécifiez.

Ce que l’assistant génère

Lorsque vous terminez l’assistant, celui-ci crée plusieurs objets sur votre service Search. Les objets exacts dépendent des options que vous sélectionnez. Par exemple, si vous appliquez l’enrichissement basé sur les compétences, un ensemble de compétences est créé.

Objet Descriptif
Source de données Stocke les informations de connexion pour une source de données Microsoft ou Azure prise en charge.
Index Structure de données physiques pour la recherche en texte intégral, la recherche vectorielle et d’autres requêtes. Peut inclure une configuration sémantique si vous activez le classement sémantique.
Indexeur Conduit l’importation de données en les extrayant à partir d’une source de données vers un index cible avec une planification optionnelle. Peut également référencer un ensemble de compétences.
Ensemble de compétences (Facultatif) Ensemble d’instructions pour l’enrichissement par IA, la segmentation des données et la vectorisation intégrée lors de l’indexation.
Base de connaissances (Facultatif) Stockage secondaire dans stockage Azure pour les résultats de l'ensemble d'aptitudes, comme les images extraites.

Pour afficher ces objets après exécution de l'Assistant :

  1. Accédez à votre service de recherche dans le portail Azure.
  2. Dans le volet gauche, sélectionnez Gestion de la recherche pour rechercher des pages pour les index, les indexeurs, les sources de données et les ensembles de compétences.

Avantages et limitations

Cette section décrit les avantages et les inconvénients de l’expérience de l’Assistant. Utilisez ces informations pour décider quand utiliser l’Assistant et quand envisager des alternatives, telles que des approches programmatiques à l’aide d’API REST ou de SDK Azure.

Avantages

Avant d’écrire du code, vous pouvez utiliser l’Assistant pour le prototypage et les tests de faisabilité. L’Assistant se connecte à des sources de données externes, échantillonne les données pour créer un index initial, puis importe et vectorise éventuellement les données en tant que documents JSON dans un index sur Recherche Azure AI.

Si vous évaluez des compétences, l’assistant gère les mappages de champs de sortie et ajoute des fonctions utilitaires pour créer des objets utilisables. Le fractionnement de texte est ajouté lorsque vous spécifiez un mode d’analyse. Fusion de texte est ajoutée lorsque vous choisissez l’analyse d’image pour que l’outil puisse réunir des descriptions de texte avec du contenu de l’image. Toutes ces tâches sont fournies avec une courbe d’apprentissage. Si vous débutez avec l’enrichissement, la gestion de ces étapes vous permet de mesurer la valeur d’une compétence sans investir beaucoup de temps et d’efforts.

L’échantillonnage est le processus par lequel un schéma d’index est déduit, qui présente certaines limitations. Lorsque la source de données est créée, l’Assistant sélectionne un échantillon aléatoire de documents pour déterminer les colonnes qui font partie de la source de données. Tous les fichiers ne sont pas lus, car cela peut prendre des heures pour les sources de données volumineuses. Étant donné une sélection de documents, les métadonnées sources (telles que le nom ou le type de champ) sont utilisées pour créer une collection de champs dans un schéma d’index. En fonction de la complexité des données sources, vous devrez peut-être modifier le schéma initial pour obtenir une précision ou l’étendre à des fins d’exhaustivité. Vous pouvez faire en sorte que vos modifications soient incorporées dans la page de définition de l’index.

Dans l’ensemble, les avantages de l'assistant sont évidents : dès que les exigences sont satisfaites, vous pouvez créer un index qui peut être interrogé en quelques minutes. L'assistant prend en charge certaines des complexités de l'indexation, notamment la sérialisation des données sous forme de documents JSON.

Limites

  • L’Assistant ne prend pas en charge l’itération ou la réutilisation. Chaque passage dans l’assistant crée une configuration d’index, d’ensemble de compétences et d’indexeur. Une fois l’Assistant terminé, vous pouvez modifier les objets créés à l’aide d’autres outils du portail, des API REST ou du SDK Azure.

  • Le contenu source doit résider dans une source de données prise en charge.

  • L’échantillonnage, utilisé pour déduire un schéma d’index préliminaire, se produit sur un sous-ensemble de données sources. Pour les sources de données volumineuses, l’Assistant peut ne pas déceler des champs. Si l’échantillonnage est insuffisant, vous devrez peut-être ajouter manuellement des champs à l’index ou corriger les types de données déduits.

  • L’enrichissement par IA et la vectorisation intégrée, comme exposé dans l’Assistant, sont limités à un sous-ensemble de compétences intégrées.

Sécuriser les connexions

Les protections réseau affectent la connexion du portail au point de terminaison ainsi que les connexions du point de terminaison aux ressources externes pendant les opérations du portail.

Connexions du portail à un search service

Les connexions du portail à un point de terminaison protégé par le réseau sont effectuées à l’aide de votre adresse IP cliente.

Conseil / Astuce

Le portail détecte votre adresse IP cliente et vous invite à l’ajouter au pare-feu du service de recherche.

Connexions du portail aux ressources externes

L’Assistant se connecte aux ressources externes pour :

  • Récupération des données pendant l’indexation.
  • Traitement de l'intelligence artificielle pour enrichment et vectorisation intégrée effectué par une ressource ou un modèle Microsoft Foundry.

Depuis l’assistant, presque toutes les requêtes sortantes vers des données protégées par le réseau et vers le traitement par l’IA sont effectuées à l’aide de l’adresse IP de votre client.

Cette section décrit les exigences de connexion pour les demandes sortantes.

Configurer l’accès au portail aux ressources externes

  • Ressources protégées par ip : ajoutez votre adresse IP cliente à la ressource allowListexterne. Si c'est le cas, listez Microsoft.Search/searchServices en tant que service de confiance. Par exemple, dans stockage Azure, vous pouvez répertorier Microsoft.Search/searchServices en tant que service approuvé.

  • Connexions privées : l’Assistant utilise des liaisons privées partagées. Vérifiez que votre search service répond aux exigences de niveau et de région. Vérifiez que votre source de données externe est prise en charge pour les liaisons privées partagées.

Si l'Assistant ne peut pas se connecter, vous verrez "Access denied due to Réseau virtuel/Firewall rules". Envisagez d’utiliser des approches de script ou programmatiques comme alternative.

Flux de travail

L’assistant suit un flux de travail de haut niveau :

  1. Connectez-vous à une source de données Azure prise en charge.

  2. (Facultatif) Ajoutez des compétences pour extraire ou générer du contenu et une structure.

  3. Il crée un schéma d’index, déduit par l’échantillonnage des données sources.

  4. Exécutez l’Assistant pour créer des objets, éventuellement vectoriser des données, charger des données dans un index, définir une planification et configurer d’autres options.

Le flux de travail est un pipeline unidirectionnel. Vous ne pouvez pas utiliser l’Assistant pour modifier les objets créés, mais vous pouvez utiliser d’autres outils du portail, tels que le concepteur d’index ou les éditeurs JSON, pour effectuer des mises à jour autorisées.

Démarrer l’Assistant

  1. Accédez à votre service de recherche dans le portail Azure.

  2. Dans la page Vue d’ensemble , sélectionnez Importer des données.

    Capture d’écran des options de l’Assistant Importation.

    L’assistant s’ouvre entièrement développé dans la fenêtre du navigateur, vous offrant ainsi plus d’espace pour travailler.

  3. Sélectionnez un scénario : Recherche de mots clés, RAG ou Modal RAG.

    Le scénario que vous sélectionnez détermine les sources de données et les compétences disponibles, ainsi que le schéma d’index et la configuration de l’indexeur créés par l’Assistant.

  4. Suivez les étapes restantes pour créer l’index, l’indexeur et d’autres objets applicables.

Configurer une source de données

L'Assistant se connecte à une source de données externe prise en charge grâce à la logique interne fournie par les indexeurs, qui leur permettent d'échantillonner la source, de lire les métadonnées, de déchiffrer les documents pour en lire le contenu et la structure, et de sérialiser les contenus au format JSON pour une importation ultérieure dans Recherche Azure AI.

Il n’est pas garanti que toutes les sources de données en préversion soient disponibles dans l’Assistant. Étant donné que chaque source de données a le potentiel d’introduire des modifications en aval, une source de données en préversion est ajoutée uniquement lorsqu’elle prend entièrement en charge toutes les expériences de l’Assistant, telles que la définition d’ensemble de compétences et l’inférence de schéma d’index.

Vous ne pouvez importer qu’à partir d’une table unique, d’une vue de base de données ou d’une structure de données équivalente. Toutefois, la structure peut inclure des sous-structures hiérarchiques ou imbriquées. Pour plus d’informations, consultez How to model complex types (Modélisation des types complexes).

Configurer un ensemble de compétences

La configuration de l’ensemble de compétences se produit après la définition de la source de données, car le type de source de données informe sur la disponibilité de certaines compétences intégrées. Par exemple, si vous indexez des fichiers à partir de Stockage Blob Azure, le mode d'analyse que vous choisissez pour ces fichiers détermine si l'analyse des sentiments est disponible.

L’assistant ajoute non seulement les compétences que vous choisissez, mais aussi celles qui sont nécessaires pour obtenir un résultat satisfaisant.

Les ensembles de compétences sont facultatifs et il existe un bouton en bas de la page pour passer à l’avant si vous ne souhaitez pas d’enrichissement par IA.

Configurer un schéma d’index

L’Assistant échantillonne votre source de données pour détecter les champs et les types de champs. Selon la source de données, il peut également proposer des champs pour l’indexation des métadonnées.

Étant donné que l’échantillonnage est un exercice imprécis, passez l’index en revue pour tenir compte des points suivants :

  1. La liste des champs est-elle exacte ? Si votre source de données contient des champs qui n’ont pas été récupérés dans l’échantillonnage, vous pouvez ajouter manuellement les champs manqués. Vous pouvez également supprimer des champs qui n’ajoutent pas de valeur à l’expérience de recherche ou qui ne seront pas utilisés dans une expression de filtre ou un profil de scoring.

  2. Le type de données convient-il pour les données entrantes ? Recherche Azure AI prend en charge les types de données entity data model (EDM). Pour les données Azure SQL, il existe un tableau de correspondance qui présente des valeurs équivalentes. Pour plus d’informations, consultez Mappages et transformations de champs.

  3. Avez-vous un champ qui peut faire office de clé ? Ce champ doit être un Edm.String qui identifie de façon unique un document. Dans le cas des données relationnelles, elles peuvent être mappées à une clé primaire. Pour les objets blob, il peut s’agir de metadata-storage-path. Si les valeurs de champ incluent des espaces ou des tirets, vous devez définir l’option Clé encodée en base 64 dans l’étape Créer un indexeur , sous Options avancées, pour supprimer la vérification de validation pour ces caractères.

  4. Définissez des attributs pour déterminer comment ce champ est utilisé dans un index.

    Prenez votre temps dans cette étape, car les attributs déterminent l’expression physique des champs dans l’index. Si vous souhaitez modifier les attributs ultérieurement, même par programmation, vous devez presque toujours supprimer et reconstruire l’index. Les attributs principaux tels que Searchable et Retrievable ont un effet agligible sur storage. L’activation des filtres et l’utilisation des suggesteurs augmentent les exigences de stockage.

    • Possibilité de recherche permet une recherche en texte intégral. Chaque champ utilisé dans les requêtes de forme libre ou dans les expressions de requête doit avoir cet attribut. Les index inversés sont créés pour chaque champ que vous marquez comme Possibilité de recherche.

    • Récupérable retourne le champ dans les résultats de la recherche. Chaque champ qui fournit du contenu aux résultats de recherche doit avoir cet attribut. La définition de ce champ n’a pas d’incidence notable sur la taille de l’index.

    • Filtrable permet de référencer le champ dans les expressions de filtre. Chaque champ utilisé dans une expression $filter doit avoir cet attribut. Les expressions de filtre sont des correspondances exactes. Étant donné que les chaînes de texte restent intactes, un stockage supplémentaire est nécessaire pour accueillir le contenu détaillé.

    • À choix multiples active le champ pour la navigation par facettes. Seuls les champs également marqués comme Filtrables peuvent être marqués comme À choix multiples.

    • Triable permet d’utiliser le champ dans un tri. Chaque champ utilisé dans une expression $Orderby doit avoir cet attribut.

  5. Avez-vous besoin d’une analyse lexicale ? Pour les champs Edm.String pouvant faire l’objet d’une recherche, vous pouvez définir un analyseur si vous souhaitez améliorer l’indexation et l’interrogation du langage.

    La valeur par défaut est Standard Lucene, mais vous pouvez choisir Microsoft anglais si vous souhaitez utiliser l'analyseur de Microsoft pour le traitement lexical avancé, comme la résolution de noms irréguliers et de formulaires verbes. Seuls les analyseurs de langage peuvent être spécifiés dans le portail Azure. Si vous souhaitez utiliser un analyseur personnalisé ou un analyseur non linguistique, tel que le mot clé ou le modèle, vous devez le créer par programmation. Pour plus d’informations, consultez Ajouter des analyseurs de langage.

  6. Avez-vous besoin de fonctionnalités TypeAhead matérialisées par la saisie semi-automatique ou les suggestions de résultats ? Cochez la case Suggérateur pour activer les suggestions de requête de saisie semi-automatique et la saisie semi-automatique sur les champs sélectionnés. Les suggesteurs ajoutent au nombre de termes tokenisés dans votre index et consomment donc plus de storage.

Configurer un indexeur

La dernière page de l’Assistant collecte les entrées utilisateur pour la configuration de l’indexeur. Vous pouvez spécifier une planification et définir d’autres options qui varient selon le type de source de données.

En interne, l'assistant configure les définitions suivantes, qui ne sont pas visibles dans l'indexeur avant sa création.

Essayer l’Assistant

La meilleure façon de comprendre les avantages et les limites de l’assistant Import data est de le parcourir étape par étape. Les guides de démarrage rapide suivants sont basés sur l’Assistant.