Démarrage rapide : créer un ensemble de compétences dans le Portail Azure

Remarque

Recherche Azure AI est disponible via le portail Azure, les API REST et les SDK Azure. Il sous-tend également Foundry IQ, la couche de connaissances managée qui transforme le contenu d’entreprise en bases de connaissances réutilisables et prenant en charge les autorisations pour les agents dans le portail Microsoft Foundry.

Dans ce guide de démarrage rapide, vous allez découvrir comment un ensemble de compétences dans Recherche Azure AI ajoute la reconnaissance optique de caractères (OCR), l’analyse des images, la détection de langue, la fusion de texte et la reconnaissance d’entité pour générer du contenu pouvant faire l’objet d’une recherche de texte dans un index.

Vous pouvez exécuter l’assistant Importation de données pour appliquer des compétences qui créent et transforment le contenu textuel lors de son indexation. L’entrée est vos données brutes, généralement des objets blob dans Stockage Azure. La sortie est un index pouvant faire l’objet d’une recherche contenant du texte, des légendes et des entités d’image générés par l’IA. Vous pouvez ensuite interroger du contenu généré dans le portail Azure à l’aide de l’Explorateur de recherche.

Avant d’exécuter l’assistant, vous créez quelques ressources et téléchargez des exemples de fichiers.

Prérequis

Remarque

Ce guide de démarrage rapide utilise Foundry Tools pour l’enrichissement par IA. Étant donné que la charge de travail est petite, Foundry Tools est utilisé dans les coulisses pour un traitement gratuit à hauteur de 20 transactions. Par conséquent, vous n’avez pas besoin de créer une ressource Microsoft Foundry.

Préparer les données d'échantillon

Dans cette section, vous allez créer un conteneur stockage Azure pour stocker des exemples de données composés de différents types de fichiers, y compris les images et les fichiers d’application qui ne sont pas pouvant faire l’objet d’une recherche en texte intégral dans leurs formats natifs.

Pour préparer les exemples de données pour ce guide de démarrage rapide :

  1. Accédez à votre compte Stockage Azure dans le portail Azure.

  2. Dans le volet gauche, sélectionnezstockage de données>Conteneurs.

  3. Créez un conteneur, puis chargez les exemples de données dans le conteneur.

Exécuter l’Assistant

Pour exécuter l’Assistant :

  1. Accédez à votre service Search dans le Portail Microsoft Azure.

  2. Dans la page Vue d’ensemble , sélectionnez Importer des données.

    Capture d’écran montrant comment ouvrir l’Assistant Importation dans le portail Azure.

  3. Sélectionnez Stockage Blob Azure pour la source de données.

    Capture d’écran de l’option de source de données Stockage Blob Azure dans le portail Azure.

  4. Sélectionnez Recherche de mot clé.

    Capture d’écran de la vignette de recherche de mots clés dans le portail Azure.

Étape 1 : Création d’une source de données

Recherche Azure AI nécessite une connexion à une source de données pour l’ingestion et l’indexation de contenu. Dans ce cas, la source de données est votre compte stockage Azure.

Pour créer la source de données :

  1. Dans la page Se connecter à vos données , sélectionnez votre abonnement Azure.

  2. Sélectionnez votre compte de stockage, puis sélectionnez le conteneur que vous avez créé.

    Capture d’écran de la page Se connecter à vos données dans le portail Azure.

  3. Cliquez sur Suivant.

Si vous obtenez Error detecting index schema from data source, l’indexeur qui alimente l’Assistant ne peut pas se connecter à votre source de données. La source de données a probablement des protections de sécurité. Essayez les solutions suivantes, puis réexécutez l’Assistant.

Fonctionnalité de sécurité Solution
La ressource nécessite des rôles Azure ou ses clés d’accès sont désactivées. Connectez-vous en tant que service approuvé ou connectez-vous à l’aide d’une identité managée.
La ressource se trouve derrière un pare-feu IP. Créez une règle de trafic entrant pour Recherche Azure AI et le portail Azure.
La ressource nécessite une connexion de point de terminaison privé. Connectez-vous sur un point de terminaison privé.

Étape 2 : Ajouter des compétences cognitives

L’étape suivante consiste à configurer l’enrichissement par IA pour appeler l’OCR, l’analyse d’images et la reconnaissance d’entité.

L’OCR et l’analyse d’image sont disponibles pour les objets blob dans Stockage Blob Azure et Azure Data Lake Storage (ADLS) Gen2 et pour le contenu d’image dans Microsoft OneLake. Les images peuvent être des fichiers autonomes ou des images intégrées dans un PDF ou d'autres fichiers.

Pour ajouter les compétences :

  1. Sélectionnez Extraire des entités, puis sélectionnez l’icône d’engrenage.

  2. Cochez et enregistrez les cases suivantes :

    • Personnes

    • Emplacements

    • Organisations

    Capture d’écran des options Extraire des entités dans le portail Azure.

  3. Sélectionnez Extraire du texte à partir d’images, puis sélectionnez l’icône d’engrenage.

  4. Cochez et enregistrez les cases suivantes :

    • Générer des balises

    • Classer le contenu

    Capture d’écran des options Extraire du texte à partir d’images dans le portail Azure.

  5. Laissez la case à cocher Utiliser une ressource Foundry Tools gratuite (enrichissements limités).

    Les exemples de données se composent de 14 fichiers, de sorte que l’allocation gratuite de 20 transactions sur Foundry Tools est suffisante.

  6. Cliquez sur Suivant.

Étape 3 : Configurer l’index

Un index contient votre contenu pouvant faire l’objet d’une recherche. L’Assistant peut généralement créer le schéma en échantillonnant la source de données. Dans cette étape, vous passez en revue le schéma généré et éventuellement modifiez les paramètres.

Pour ce démarrage rapide, l’assistant définit des valeurs par défaut raisonnables :

  • Les champs par défaut sont basés sur les propriétés de métadonnées des objets blob existants et de nouveaux champs pour la sortie d’enrichissement, comme persons, locationset organizations. Les types de données sont déduits à partir des métadonnées et des échantillonnages de données.

    Capture d’écran de la page de définition d’index.

  • La clé de document par défaut est metadata_storage_path, qui est sélectionnée car le champ contient des valeurs uniques.

  • Les attributs de champ par défaut sont basés sur les compétences que vous avez sélectionnées. Par exemple, les champs créés par la compétence Reconnaissance d’entité (persons, locationset organizations) sont récupérables, filtrables, visages et pouvant faire l’objet d’une recherche. Pour afficher et modifier ces attributs, sélectionnez un champ, puis sélectionnez Configurer le champ.

    Les champs récupérables peuvent être retournés dans les résultats, tandis que les champs pouvant faire l’objet d’une recherche en texte intégral prennent en charge la recherche en texte intégral. Utilisez Filterable si vous souhaitez utiliser des champs dans une expression de filtre.

    Le marquage d’un champ comme récupérable ne signifie pas que le champ doit apparaître dans les résultats de recherche. Vous pouvez contrôler les champs retournés à l’aide du select paramètre de requête.

Après avoir examiné le schéma d’index, sélectionnez Suivant.

Étape 4 : Ignorer les paramètres avancés

L'assistant propose des paramètres avancés pour le classement sémantique et la planification des index, qui dépassent le cadre de ce démarrage rapide. Ignorez cette étape en sélectionnant Suivant.

Étape 5 : Vérifier et créer des objets

La dernière étape consiste à passer en revue votre configuration et à créer l’index, l’indexeur et la source de données sur votre service de recherche. L’indexeur automatise le processus d’extraction de contenu à partir de votre source de données, le chargement de l’index et le pilotage de l’exécution des compétences.

Pour passer en revue et créer les objets :

  1. Acceptez le préfixe de nom d’objets par défaut.

  2. Passez en revue les configurations d’objet.

    Capture d’écran de la page de configuration d’objet dans le portail Azure.

    L'enrichissement de l'IA, le classement sémantique et la planification de l'indexeur sont soit désactivés, soit définis sur leurs valeurs par défaut, car vous avez ignoré les étapes de l'assistant.

  3. Sélectionnez Créer pour créer simultanément les objets et exécuter l’indexeur.

Superviser l’état

Vous pouvez surveiller la création de l’indexeur dans le portail Azure. L’indexation en fonction des compétences prend plus de temps que l’indexation textuelle, notamment l’OCR et l’analyse d’image.

Pour surveiller la progression de l’indexeur :

  1. Dans le volet gauche, sélectionnez Indexeurs.

  2. Sélectionnez votre indexeur dans la liste.

  3. Sélectionnez Réussite (ou Échec) pour afficher les détails de l’exécution.

    Capture d’écran de la page d’état de l’indexeur.

Dans ce guide de démarrage rapide, il existe quelques avertissements, notamment Could not execute skill because one or more skill input was invalid. cet avertissement vous indique qu’un fichier PNG dans la source de données ne fournit pas d’entrée de texte à La reconnaissance d’entité. Cela se produit parce que la compétence OCR en amont n’a pas reconnu de texte dans l’image et n’a pas pu fournir d’entrée de texte à la compétence Reconnaissance d’entité en aval.

Les avertissements sont courants dans l’exécution de l’ensemble de compétences. Au fur et à mesure que vous vous familiarisez à la manière dont les compétences sont itérées sur vos données, vous allez commencer à remarquer des modèles et à apprendre quels avertissements vous pouvez ignorer.

Requête dans l’Explorateur de recherche

Pour interroger votre index :

  1. Dans le volet gauche, sélectionnez Index.

  2. Sélectionnez votre index dans la liste. Si l’index a zéro document ou stockage, attendez que le portail Azure s’actualise.

  3. Sous l’onglet Explorateur de recherche , entrez une chaîne de recherche, telle que satya nadella.

La barre de recherche accepte les mots clés, les expressions entre guillemets et les opérateurs. Par exemple : "Satya Nadella" +"Bill Gates" +"Steve Ballmer"

Les résultats sont retournés au format JSON détaillé, qui peut être difficile à lire, en particulier dans des documents volumineux. Voici des conseils pour rechercher dans cet outil :

  • Basculez vers la vue JSON pour spécifier les paramètres qui influencent les résultats.
  • Ajoutez select pour limiter les champs dans les résultats.
  • Ajoutez count pour afficher le nombre de résultats.
  • Utilisez Ctrl-F pour rechercher dans le JSON des propriétés ou des termes spécifiques.

Capture d’écran de la page Explorateur de recherche.

Voici un JSON que vous pouvez coller dans la vue :

{
"search": "\"Satya Nadella\" +\"Bill Gates\" +\"Steve Ballmer\"",
"count": true,
"select": "merged_content, persons"
}

Conseil

Les chaînes de requête sont sensibles à la casse. Par conséquent, si vous recevez un message « champ inconnu », vérifiez les Champs ou la définition d'index (JSON) pour vérifier le nom et la casse.

Éléments importants à retenir

Vous avez créé votre premier ensemble de compétences et appris les étapes de base de l’indexation basée sur les compétences.

Parmi les concepts clés que vous avez compris (nous l’espérons), figure la dépendance. Un ensemble de compétences est lié à un indexeur. Les indexeurs sont spécifiques à Azure et à la source. Bien que ce guide de démarrage rapide utilise Stockage Blob Azure, d'autres sources de données Azure sont disponibles. Pour plus d’informations, consultez Indexeurs dans Recherche Azure AI.

Un autre concept important est que les compétences fonctionnent sur les types de contenu, et lorsque vous utilisez du contenu hétérogène, certaines entrées sont ignorées. En outre, les fichiers ou les champs volumineux peuvent dépasser les limites d’indexeur de votre niveau de service. Il est normal de voir des avertissements quand ces événements se produisent.

La sortie est routée vers un index de recherche, et il existe un mappage entre les paires nom-valeur créées lors de l’indexation et des champs individuels de votre index. En interne, l’Assistant configure une arborescence d’enrichissement et définit un ensemble de compétences, en établissant l’ordre des opérations et le flux général. Ces étapes sont masquées dans l’assistant, mais ces concepts deviennent importants lorsque vous démarrez l’écriture de code.

Enfin, vous avez appris que vous pouvez vérifier le contenu en interrogeant l’index. En fin de compte, Recherche Azure AI fournit un index pouvant faire l’objet d’une recherche que vous pouvez interroger à l’aide d’une syntaxe de requête simple ou entièrement étendue. Un index contenant des champs enrichis ressemble à n’importe quel autre index. Vous pouvez incorporer des analyseurs standard ou personnalisés, des profils de scoring, des synonymes, une navigation à facettes, une recherche géographique et d’autres fonctionnalités de Recherche IA Azure.

Nettoyer les ressources

Lorsque vous travaillez dans votre propre abonnement, il est judicieux de terminer un projet en supprimant les ressources dont vous n’avez plus besoin. Les ressources laissées actives peuvent vous coûter de l'argent.

Dans le portail Azure, sélectionnez Toutes les ressources ou groupes de ressources dans le volet gauche pour rechercher et gérer les ressources. Vous pouvez supprimer des ressources individuellement ou supprimer le groupe de ressources pour supprimer toutes les ressources à la fois.

Si vous utilisez un service de recherche gratuit, n’oubliez pas que vous êtes limité à trois index, indexeurs et sources de données. Vous pouvez supprimer des éléments individuels dans le portail pour rester sous la limite.

Étape suivante

Vous pouvez utiliser le portail Azure, les API REST ou un Kit de développement logiciel (SDK) Azure pour créer des ensembles de compétences. Essayez les API REST à l’aide d’un client REST et d’autres exemples de données :