Azure dovednosti s vícemodálními vkládáními ve zpracování obrazu (Preview)

Note

Azure AI Vyhledávač je k dispozici prostřednictvím portálu Azure, rozhraní REST API a Sady Azure SDK. Podporuje také Foundry IQ, spravovanou znalostní vrstvu, která transformuje podnikový obsah na opakovaně použitelné znalostní báze s podporou oprávnění pro agenty na portálu Microsoft Foundry.

Důležité

Funkce, možnosti nebo vlastnosti označené (Preview) se nevztahují na smlouvu o úrovni služeb, nedoporučuje se pro produkční úlohy a můžou se změnit nebo omezit dříve, než budou obecně dostupné. Podmínky Azure AI Vyhledávač Preview platí pro všechny funkce ve verzi Preview, ať už jsou samostatné nebo součástí obecně dostupné funkce.

Dovednost Azure multimodální vkládání vision (Preview) využívá rozhraní API pro vkládání multimodálních objektů z nástroje Azure Vision in Foundry k vygenerování vkládání textu nebo obrázku.

U transakcí, které přesahují 20 dokumentů na indexera denně, tato dovednost vyžaduje, abyste k vašemu souboru dovedností připojili Microsoft Foundry zdroj fakturovatelný . Realizace vestavěných dovedností je účtována podle stávající standardní ceny Foundry Tools. Extrakce obrázků je také účtovatelná podle Azure AI Vyhledávač.

Zdroj Microsoft Foundry slouží pouze pro fakturaci. Zpracování obsahu probíhá na samostatných zdrojích spravovaných a udržovaných Azure AI Vyhledávač. Vaše data jsou zpracovávána v Geo , kde je váš zdroj nasazen.

Podporované oblasti

Podporované regiony se liší podle modality a způsobu, jakým je dovednost propojena s Azure Vision multimodal embeddings API.

Přístup Požadavek
Průvodce importem dat
  1. Najděte region, který podporuje multimodální embeddingy v Azure Vision.
  2. Ověřte, že region podporuje AI obohacení v Azure AI Vyhledávač.
  3. Vytvořte Azure AI Vyhledávač službu a Azure AI multi-service účet ve stejném regionu.
Programatické, využívající připojení založené na klíčích pro fakturaci
  1. Najděte region, který podporuje multimodální embeddingy v Azure Vision.
  2. Ověřte, že region podporuje AI obohacení v Azure AI Vyhledávač.
  3. Vytvořte službu Azure AI Vyhledávač a zdroj Microsoft Foundry ve stejném regionu.
Programatické, s využitím bezklíčového připojení pro fakturaci Není potřeba mít stejný region. Vytvořte Azure AI Vyhledávač službu a Microsoft Foundry zdroj v jakémkoli regionu, kde je dostupná každá služba.

@odata.type

Microsoft.Skills.Vision.VectorizeSkill

Omezení dat

Vstupní limity pro tuto dovednost lze nalézt v dokumentaci Azure Vision pro obrázky a text. Pokud potřebujete rozdělení dat pro textové vstupy, zvažte použití dovednosti Text Split .

Mezi použitelné vstupy patří:

  • Velikost vstupního souboru obrazu musí být menší než 20 megabajtů (MB). Velikost obrazu musí být větší než 10 x 10 pixelů a menší než 16 000 x 16 000 pixelů.
  • Textový vstupní řetězec musí mít mezi (zahrnovaně) jedno slovo a 70 slovy.

Parametry dovedností

Parametry rozlišují malá a velká písmena.

Vstupy Description
modelVersion (Povinné) Verze modelu (2023-04-15) má být předána do API pro multimodální embeddings Azure Vision pro generování embeddingů. Vektorová vnoření lze porovnávat a párovat pouze tehdy, pokud pocházejí ze stejného typu modelu. Obrázky vektorizované jedním modelem nebudou vyhledávatelné v jiném modelu. Nejnovější API pro analýzu obrázků nabízí dva modely:
  • Verze 2023-04-15 podporuje vyhledávání v mnoha jazycích. Azure AI Vyhledávač používá tuto verzi.
  • Legacy 2022-04-11 model, který podporuje pouze angličtinu.

Vstupy dovedností

Vstupy pro definici dovedností zahrnují jméno, zdroj a vstupy. Následující tabulka uvádí platné hodnoty názvu vstupu. Můžete také specifikovat rekurzivní vstupy. Pro více informací viz odkaz na REST API a Create a skillsset.

Vstup Description
text Vstupní text má být vektorizován. Pokud používáte data chunking, zdroj může být /document/pages/*.
image Komplexní typ. V současnosti funguje pouze s polem "/document/normalized_images", které vytváří Azure blob indexer, když je imageAction nastaveno na jinou hodnotu než none.
url URL pro stažení obrázku bude vektorizován.
queryString Dotazovací řetězec URL pro stažení obrázku pro vektorizaci. Užitečné je, pokud ukládáte URL a SAS token do oddělených cest.

Pouze jeden z text, image nebo url/queryString lze nastavit pro jednu instanci dovednosti. Pokud chcete vektorizovat jak obrázky, tak text v rámci stejné dovednosti, zahrňte do definice dovednosti dvě instance této dovednosti, jednu pro každý typ vstupu, který chcete použít.

Výstupy schopností

Výstup Description
vector Výstupní pole plovoucích prvků pro vstupní text nebo obrázek.

Ukázková definice

Pro zadávání textu uvažujme blob, který obsahuje následující obsah:

{
    "content": "Forests, grasslands, deserts, and mountains are all part of the Patagonian landscape that spans more than a million square  kilometers of South America."
}

U textových vstupů může definice dovednosti vypadat takto:

{ 
    "@odata.type": "#Microsoft.Skills.Vision.VectorizeSkill", 
    "context": "/document", 
    "modelVersion": "2023-04-15", 
    "inputs": [ 
        { 
            "name": "text", 
            "source": "/document/content" 
        } 
    ], 
    "outputs": [ 
        { 
            "name": "vector",
            "targetName": "text_vector"
        } 
    ] 
} 

Pro vstup obrázků by druhá definice dovednosti ve stejné sadě dovedností mohla vypadat takto:

{
    "@odata.type": "#Microsoft.Skills.Vision.VectorizeSkill",
    "context": "/document/normalized_images/*",
    "modelVersion": "2023-04-15", 
    "inputs": [
        {
            "name": "image",
            "source": "/document/normalized_images/*"
        }
    ],
    "outputs": [
        {
            "name": "vector",
            "targetName": "image_vector"
        }
    ]
}

Pokud chcete vektorizovat obrázky přímo ze zdroje dat blob storage místo extrakce obrázků během indexování, definice dovednosti by měla specifikovat URL a případně SAS token v závislosti na bezpečnosti úložiště. V tomto scénáři by definice dovednosti mohla vypadat takto:

{
    "@odata.type": "#Microsoft.Skills.Vision.VectorizeSkill",
    "context": "/document",
    "modelVersion": "2023-04-15", 
    "inputs": [
        {
            "name": "url",
            "source": "/document/metadata_storage_path"
        },
        {
            "name": "queryString",
            "source": "/document/metadata_storage_sas_token"
        }
    ],
    "outputs": [
        {
            "name": "vector",
            "targetName": "image_vector"
        }
    ]
}

Ukázkový výstup

Pro daný vstup je vytvořen vektorizovaný výstup vnoření. Výstup má 1 024 rozměrů, což je počet dimenzí podporovaných multimodálním API Azure Vision.

{
  "text_vector": [
        0.018990106880664825,
        -0.0073809814639389515,
        .... 
        0.021276434883475304,
      ]
}

Výstup zůstává v paměti. Pro odeslání tohoto výstupu do pole v indexu vyhledávání musíte definovat outputFieldMapping , který mapuje vektorizovaný výstup embeddingu (což je pole) na vektorové pole. Za předpokladu, že výstup dovednosti se nachází ve vektorovém uzlu dokumentu a content_vector je pole v indexu, výstupFieldMapping v indexeru by měl vypadat takto:

  "outputFieldMappings": [
    {
      "sourceFieldName": "/document/vector/*",
      "targetFieldName": "content_vector"
    }
  ]

Pro mapování zobrazení obrázků na index používáte indexové projekce. Užitečné zatížení pro indexProjections může vypadat asi jako následující příklad. image_content_vector je pole v indexu a je vyplněno obsahem nalezeným ve vektorunormalized_images pole.

"indexProjections": {
    "selectors": [
        {
            "targetIndexName": "myTargetIndex",
            "parentKeyFieldName": "ParentKey",
            "sourceContext": "/document/normalized_images/*",
            "mappings": [
                {
                    "name": "image_content_vector",
                    "source": "/document/normalized_images/*/vector"
                }
            ]
        }
    ]
}

Viz také