Multimodale zoekopdracht in Azure AI Zoeken

Note

Azure AI Zoeken is beschikbaar via de Azure-portal, REST API's en Azure-SDK's. Het vormt ook een basis voor Foundry IQ, de beheerde kennislaag die bedrijfsinhoud transformeert in herbruikbare, machtigingsbewuste knowledge bases voor agents in de Microsoft Foundry-portal.

Multimodale zoekopdrachten verwijzen naar de mogelijkheid om informatie op te nemen, te begrijpen en op te halen voor meerdere inhoudstypen, waaronder tekst, afbeeldingen, video en audio. In Azure AI Zoeken ondersteunt multimodale zoekopdrachten systeemeigen de opname van documenten met tekst en afbeeldingen en het ophalen van hun inhoud, zodat u zoekopdrachten kunt uitvoeren die beide modaliteiten combineren.

Het bouwen van een robuuste multimodale pijplijn omvat doorgaans:

  1. Inlineafbeeldingen en paginatekst extraheren uit documenten.

  2. Afbeeldingen in natuurlijke taal beschrijven.

  3. Tekst en afbeeldingen insluiten in een gedeelde vectorruimte.

  4. De afbeeldingen opslaan voor later gebruik als aantekeningen.

Multimodale zoekopdrachten vereisen ook het behoud van de volgorde van informatie zoals deze wordt weergegeven in de documenten en het uitvoeren van hybride query's die zoeken in volledige tekst combineren met vectorzoekopdrachten en semantische rangschikking.

In de praktijk kan een toepassing die gebruikmaakt van multimodale zoekopdrachten vragen beantwoorden zoals 'Wat is het proces om een HR-formulier te laten goedkeuren?', zelfs wanneer de enige gezaghebbende beschrijving van het proces zich in een ingesloten diagram in een PDF-bestand bevindt.

Normaal gesproken vereist multimodale zoekopdrachten afzonderlijke systemen voor tekst- en afbeeldingsverwerking, waarbij vaak aangepaste code en configuraties op laag niveau van ontwikkelaars nodig zijn. Het onderhouden van deze systemen kost hogere kosten, complexiteit en inspanning.

Azure AI Zoeken lost deze uitdagingen aan door afbeeldingen in dezelfde ophaalpijplijn als tekst te integreren. Met één multimodale pijplijn kunt u het instellen en ontgrendelen van informatie in grafieken, schermopnamen, infographics, gescande formulieren en andere complexe visuals vereenvoudigen.

Multimodale zoeken is ideaal voor RAG-scenario's (retrieval-augmented generation). Door de structurele logica van afbeeldingen te interpreteren, zorgt multimodale zoekopdracht ervoor dat uw RAG-toepassing of AI-agent minder snel belangrijke visuele details over het hoofd ziet. Het biedt uw gebruikers ook gedetailleerde antwoorden die kunnen worden teruggezet naar hun oorspronkelijke bronnen, ongeacht de modaliteit van de bron.

Hoe werkt multimodale zoekopdracht?

Om het maken van een multimodale pijplijn te vereenvoudigen, biedt Azure AI Zoeken de wizard Importeren van gegevens in de Azure-portal. Met de wizard kunt u een gegevensbron configureren, extractie- en verrijkingsinstellingen definiëren en een multimodale index genereren die tekst, ingesloten afbeeldingsverwijzingen en vector-insluitingen bevat. Zie Quickstart: Multimodal search in the Azure portal voor meer informatie.

De wizard volgt deze stappen om een multimodale pijplijn te maken:

  1. Inhoud extraheren: Kies uit de vaardigheid voor Documentextractie of de vaardigheid voor Azure Content Understanding om tekst op paginaniveau, inline-afbeeldingen en structurele metadata te verkrijgen. Elke vaardigheid biedt verschillende mogelijkheden voor het extraheren van metagegevens, het verwerken van tabellen en bestandsindelingen. Zie Opties voor multimodale inhoudextractie voor gedetailleerde vergelijkingen.

  2. Segmenttekst: De vaardigheid Tekst splitsen breekt de geëxtraheerde tekst op in beheerbare segmenten voor gebruik in de resterende pijplijn, zoals de vaardigheid voor insluiten.

  3. Beschrijvingen van afbeeldingen genereren: De GenAI Prompt vaardigheid verbaalt afbeeldingen, waardoor beknopte beschrijvingen van natuurlijke taal worden geproduceerd voor zoeken in tekst en insluiten met behulp van een groot taalmodel (LLM).

  4. Embeddings genereren: De embedding functionaliteit maakt vectorweergaven van tekst en afbeeldingen mogelijk, wat overeenkomsten en hybride zoekfunctionaliteit mogelijk maakt. U kunt embeddingmodellen van Azure OpenAI, Microsoft Foundry of Azure Vision (preview) rechtstreeks aanroepen.

    U kunt ook de verbalisatie van afbeeldingen overslaan en de geëxtraheerde tekst en afbeeldingen rechtstreeks doorgeven aan een multimodale insluitingsmodel via de vaardigheid AML of Azure Vision multimodal embeddings skill. Zie Opties voor het insluiten van multimodale inhoud voor meer informatie.

  5. Geëxtraheerde afbeeldingen opslaan: De kennisopslag bevat geëxtraheerde afbeeldingen die rechtstreeks naar clienttoepassingen kunnen worden geretourneerd. Wanneer u de wizard gebruikt, wordt de locatie van een afbeelding rechtstreeks in de multimodale index opgeslagen, waardoor deze gemakkelijk kan worden opgehaald op het moment van de query.

Tip

Als u multimodale zoekopdrachten in actie wilt zien, sluit u de door de wizard gemaakte index aan in de multimodale RAG-voorbeeldtoepassing. Het voorbeeld laat zien hoe een RAG-toepassing een multimodale index verbruikt en zowel tekstuele bronvermeldingen als bijbehorende afbeeldingsfragmenten in het antwoord weergeeft. Het voorbeeld toont ook het op code gebaseerde proces van gegevensopname en indexering.

Opties voor multimodale inhoudextractie

Een multimodale pijplijn begint met het kraken van elk brondocument in stukken tekst, inlineafbeeldingen en bijbehorende metagegevens. Voor deze stap biedt Azure AI Zoeken twee aanbevolen ingebouwde vaardigheden:

Karakteristiek Vaardigheid documentextractie Contentbegripvaardigheid van Azure
Extractie van tekstlocatie-metagegevens (pagina's en grenspolygons) Nee Ja
Metagegevensextractie van afbeeldingslocatie (pagina's en begrenzingsveelhoeken) Ja Ja
Tabelextractie en behoud Nee Ja (inclusief tabellen op meerdere pagina's)
Semantische eenheden op meerdere pagina's Niet van toepassing Ja (overschrijdt paginagrenzen)
Extractie van locatiemetagegevens op basis van bestandstype Alleen PDF-bestanden. Meerdere ondersteunde bestandstypen, waaronder PDF, DOCX, XLSX en PPTX.
Facturering voor gegevensextractie Afbeeldingsextractie wordt gefactureerd volgens Azure AI Zoeken prijsstelling. Gefactureerd volgens Azure Content Understanding-prijzen.
Ingebouwde segmentering Nee (gebruik de vaardigheid Tekst splitsen) Ja (semantische segmentering)
Door AI gegenereerde afbeeldingsbeschrijvingen Nee Ja (wanneer modelName en modelDeployment zijn geconfigureerd, beschikbaar vanaf de 2026-05-01-preview REST API)
Aanbevolen scenario's Snelle prototypen of productiepijplijnen waarbij exacte positie- of gedetailleerde indelingsgegevens niet nodig zijn. Geavanceerde documentanalyse waarvoor tabelextractie op meerdere pagina's, semantische segmentering en door AI gegenereerde afbeeldingsbeschrijvingen vereist zijn.

De vaardigheid Documentindeling blijft ondersteund voor bestaande pijplijnen. Voor nieuwe vaardighedensets gebruikt u de vaardigheid Azure Inhoudsbegrip, waarin inhoudsextractie en segmentering in één vaardigheid worden gecombineerd en semantische segmentering, door AI gegenereerde afbeeldingsbeschrijvingen en extractie van tabellen op meerdere pagina's worden ondersteund.

Opties voor het insluiten van multimodale inhoud

In Azure AI Zoeken kan het ophalen van kennis van afbeeldingen twee complementaire paden volgen: verbalisatie van afbeeldingen of directe insluitingen. Als u de verschillen begrijpt, kunt u de kosten, latentie en de kwaliteit van de antwoorden afstemmen op de behoeften van uw toepassing.

Verbalisatie van afbeeldingen gevolgd door insluitingen van tekst

Met deze methode roept de GenAI Prompt skill een LLM aan tijdens de opname om een beknopte beschrijving van natuurlijke taal van elke geëxtraheerde afbeelding te maken, zoals 'Werkstroom voor hr-toegang in vijf stappen die begint met goedkeuring van manager'. De beschrijving wordt opgeslagen als tekst en ingesloten naast de omringende documenttekst, die u vervolgens kunt vectoriseren door de Azure OpenAI aan te roepen, Microsoft Foundry of Azure Vision insluitmodellen.

Omdat de afbeelding nu in taal wordt uitgedrukt, kan Azure AI Zoeken het volgende doen:

  • Interpreteer de relaties en entiteiten die worden weergegeven in een diagram.

  • Geef kant-en-klare bijschriften op die een LLM in een antwoord kan citeren.

  • Relevante codefragmenten retourneren voor RAG-toepassingen of AI-agentscenario's met geaarde gegevens.

De toegevoegde semantische diepte omvat een LLM-aanroep voor elke afbeelding en een marginale toename van de indexeringstijd.

Directe multimodale insluitingen

Een tweede optie is het doorgeven van de door het document geëxtraheerde afbeeldingen en tekst aan een multimodale insluitingsmodel dat vectorweergaven produceert in dezelfde vectorruimte. De configuratie is eenvoudig en er is geen LLM vereist tijdens het indexeren. Directe insluitingen zijn goed geschikt voor visuele overeenkomsten en 'zoek-iets-dat-hierop-lijkt'-scenario's.

Omdat de representatie puur wiskundig is, geeft deze niet aan waarom twee afbeeldingen zijn gerelateerd en biedt het geen kant-en-klare LLM-context voor bronvermeldingen of gedetailleerde uitleg.

Beide benaderingen combineren

Veel oplossingen hebben beide coderingspaden nodig. Diagrammen, stroomdiagrammen en andere visuele elementen met uitgebreide uitleg worden verbaal gemaakt, zodat semantische informatie beschikbaar is voor rag- en AI-agentgronding. Schermopnamen, productfoto's of kunstwerken worden rechtstreeks ingesloten voor een efficiënte zoekopdracht naar overeenkomsten. U kunt uw Azure AI Zoeken-pijplijn voor index- en indexeerfuncties aanpassen, zodat deze de twee sets vectoren kan opslaan en ze naast elkaar kunnen ophalen.

Opties voor het opvragen van multimodale inhoud

Als uw multimodale pijplijn wordt aangedreven door de GenAI Prompt-vaardigheid, kunt u hybride query's uitvoeren op zowel platte tekst als verbaliseerde afbeeldingen in uw zoekindex. U kunt ook filters gebruiken om de zoekresultaten te beperken tot specifieke inhoudstypen, zoals alleen tekst of alleen afbeeldingen.

Hoewel de vaardigheid GenAI-prompt ondersteuning biedt voor tekst-naar-vector-query's via hybride zoekopdrachten, biedt deze geen ondersteuning voor image-to-vector-query's. Alleen de multimodale insluitingsmodellen bieden de vectorizers die afbeeldingen tijdens het uitvoeren van query's converteren naar vectoren.

Als u afbeeldingen wilt gebruiken als queryinvoer voor uw multimodale index, moet u de vaardigheid AML of Azure Vision multimodale insluitingsvaardigheden gebruiken met een equivalente vectorizer. Zie Een vectorizer configureren in een zoekindex voor meer informatie.

Zelfstudies en voorbeelden

Hier volgt een verzameling inhoud die laat zien hoe u multimodale indexen maakt en optimaliseert met behulp van Azure functionaliteit om aan de slag te gaan met multimodale Azure AI Zoeken zoekopdrachten.

Inhoud Beschrijving
Snelle start: Multimodale zoekopdracht in het Azure-portal Maak en test een multimodale index in de Azure-portal met behulp van de wizard en Search Explorer.
Multimodale handleiding Extraheer tekst en afbeeldingen, segmentgegevens en vectoriseer de segmenten voor overeenkomsten zoeken en andere ophaalpatronen.
Voorbeeld-app: Multimodal RAG GitHub-repository Een end-to-end, code-ready RAG-toepassing met multimodale mogelijkheden waarmee zowel tekstfragmenten als afbeeldingsaantekeningen worden weergegeven. Ideaal voor het snel op gang brengen van enterprise copilots.