Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Not
Azure Yapay Zeka Arama Azure portalı, REST API'leri ve Azure SDK’ları aracılığıyla kullanılabilir. Ayrıca kuruluş içeriğini Microsoft Foundry portalındaki aracılar için yeniden kullanılabilir, izin kullanan bilgi bankalarına dönüştüren yönetilen bilgi katmanı Foundry IQ'yu temel alır.
Çok modüllü arama, metin, resim, video ve ses gibi birden çok içerik türündeki bilgileri alma, anlama ve alma özelliğini ifade eder. Azure Yapay Zeka Arama'de çok modlu arama, metin ve görüntü içeren belgelerin alımını ve içeriklerinin alınmasını yerel olarak destekleyerek her iki yöntemi de birleştiren aramalar gerçekleştirmenizi sağlar.
Güçlü bir çok modüllü işlem hattı oluşturmak genellikle şunları içerir:
Belgelerden satır içi görüntüleri ve sayfa metnini ayıklama.
Görüntüleri doğal dilde açıklama.
Paylaşılan vektör alanına hem metin hem de görüntü ekleme.
Görüntüleri daha sonra ek açıklama olarak kullanmak üzere depolama.
Çok modüllü arama, belgelerde göründüğü gibi bilgilerin sırasının korunmasını ve tam metin arama ile vektör arama ve anlam sıralamasını birleştiren karma sorguların yürütülmesini de gerektirir.
Uygulamada, çok modlu arama kullanan bir uygulama, işlemin tek yetkili açıklaması PDF dosyasındaki gömülü bir diyagramda yer alsa bile "Bir İK formunun onaylanma süreci nedir?" gibi soruları yanıtlayabilir.
Neden çok modüllü arama kullanmalısınız?
Geleneksel olarak, çok modüllü arama, metin ve görüntü işleme için ayrı sistemler gerektirir ve genellikle geliştiricilerden özel kod ve alt düzey yapılandırmalar gerektirir. Bu sistemlerin korunması daha yüksek maliyetlere, karmaşıklıklara ve çabaya neden olur.
Azure Yapay Zeka Arama, görüntüleri metinle aynı alma işlem hattına tümleştirerek bu zorlukları giderir. Tek bir çok modüllü işlem hattıyla, grafiklerde, ekran görüntülerinde, bilgi grafiklerinde, taranmış formlarda ve diğer karmaşık görsellerde bulunan bilgilerin kurulumunu basitleştirebilir ve kilidini açabilirsiniz.
Çok modüllü arama, alma artırılmış üretim (RAG) senaryoları için idealdir. Çok modüllü arama, görüntülerin yapısal mantığını yorumlayarak RAG uygulamanızın veya yapay zeka aracınızın önemli görsel ayrıntıları gözden kaçırma olasılığını düşürür. Ayrıca, kaynağın modalitesine bakılmaksızın kullanıcılarınıza özgün kaynaklarına kadar izleyebileceğiniz ayrıntılı yanıtlar sağlar.
Çok modüllü arama nasıl çalışır?
çok modüllü işlem hattı oluşturmayı basitleştirmek için Azure Yapay Zeka Arama, Azure portalında Eyi içeri aktarma sihirbazını sunar. Sihirbaz bir veri kaynağını yapılandırmanıza, ayıklama ve zenginleştirme ayarlarını tanımlamanıza ve metin, ekli görüntü başvuruları ve vektör eklemeleri içeren çok modüllü bir dizin oluşturmanıza yardımcı olur. Daha fazla bilgi için bkz. Azure portalında Quickstart: Multimodal search.
Sihirbaz, çok modüllü işlem hattı oluşturmak için şu adımları izler:
İçeriği ayıklayın: Sayfa metni, satır içi görüntüler ve yapısal meta veriler elde etmek için Belge Ayıklama becerisi veya Azure İçerik Anlama becerisi seçin. Her beceri meta veri ayıklama, tablo işleme ve dosya biçimi desteği için farklı özellikler sunar. Ayrıntılı karşılaştırmalar için bkz. Çok modüllü içerik ayıklama seçenekleri.
Öbek metni:Metin Bölme becerisi , ayıklanan metni ekleme becerisi gibi kalan işlem hattında kullanılmak üzere yönetilebilir öbeklere ayırır.
Görüntü açıklamaları oluşturma:GenAI prompt becerisi , büyük bir dil modeli (LLM) kullanarak metin araması ve ekleme için kısa doğal dil açıklamaları oluşturarak görüntüleri sözlüleştirir.
Eklemeler oluşturma: Ekleme becerisi, metin ve görüntülerin vektör gösterimlerini oluşturarak benzerlik ve karma alma olanağı sağlar. Azure OpenAI, Microsoft Foundry veya Azure Görüntü İşleme (önizleme) ekleme modellerini yerel olarak çağırabilirsiniz.
Alternatif olarak, görüntü sözelleştirmeyi atlayabilir ve ayıklanan metin ve görüntüleri doğrudan AML becerisi veya Azure Vision çok modüllü ekleme becerisi aracılığıyla çok modüllü ekleme modeline geçirebilirsiniz. Daha fazla bilgi için bkz. Çok modüllü içerik ekleme seçenekleri.
Ayıklanan görüntüleri depolama:Bilgi deposu , doğrudan istemci uygulamalarına döndürülebilen ayıklanmış görüntüler içerir. Sihirbazı kullandığınızda, görüntünün konumu doğrudan çok modüllü dizinde depolanır ve sorgu zamanında kullanışlı bir şekilde alınabilir.
Ipucu
Çok modüllü aramayı çalışır durumda görmek için sihirbaz tarafından oluşturulan dizininizi çok modüllü RAG örnek uygulamasına takın. Örnek, bir RAG uygulamasının çok modüllü dizini nasıl tükettiğini ve yanıtta hem metin alıntılarını hem de ilişkili görüntü parçacıklarını nasıl işleyip işlemeyişini gösterir. Örnekte ayrıca veri alımı ve dizin oluşturma için kod tabanlı işlem gösterilir.
Çok modüllü içerik ayıklama seçenekleri
Çok modüllü işlem hattı, her kaynak belgeyi metin öbekleri, satır içi görüntüler ve ilişkili meta veriler halinde kırarak başlar. Bu adım için Azure Yapay Zeka Arama önerilen iki yerleşik beceri sağlar:
| Karakteristik | Belge Ayıklama becerisi | Azure İçerik Anlama Becerisi |
|---|---|---|
| Metin konumu meta veri ayıklama (sayfalar ve sınırlayıcı çokgenler) | Hayır | Evet |
| Görüntü yeri meta verileri ayıklama (sayfalar ve sınırlayıcı çokgenler) | Evet | Evet |
| Tablo ayıklama ve koruma | Hayır | Evet (çapraz sayfa tabloları dahil) |
| Çapraz sayfa anlam birimleri | Geçerli değil | Evet (sayfa sınırlarını aşar) |
| Dosya türüne göre konum meta veri ayıklaması | Yalnızca PDF'ler. | PDF, DOCX, XLSX ve PPTX gibi desteklenen birden çok dosya türü. |
| Veri ayıklama için faturalama | Görüntü ayıklama, Azure Yapay Zeka Arama fiyatlandırmasına göre faturalandırılır. | Azure Content Understanding fiyatlandırmasına göre faturalandırılır. |
| Yerleşik öbekleme | Hayır (Metin Bölme becerisini kullan) | Evet (semantik öbekleme) |
| Yapay zeka tarafından oluşturulan görüntü açıklamaları | Hayır | Evet (modelName ve modelDeployment yapılandırıldığında, 2026-05-01-preview REST API'siyle birlikte kullanılabilir) |
| Önerilen senaryolar | Tam konum veya ayrıntılı düzen bilgilerinin gerekli olmadığı hızlı prototip oluşturma veya üretim işlem hatları. | Çapraz sayfa tablo ayıklama, anlamsal öbekleme ve yapay zeka tarafından oluşturulan görüntü açıklamaları gerektiren gelişmiş belge analizi. |
Belge Düzeni becerisi mevcut işlem hatları için desteklenmeye devam eder. Yeni beceri kümeleri için, içerik ayıklama ve öbekleri tek bir beceride birleştiren ve anlamsal öbekleme, yapay zeka tarafından oluşturulan görüntü açıklamaları ve çapraz sayfa tablosu ayıklamayı destekleyen Azure Content Understanding becerisini kullanın.
Çok modüllü içerik ekleme seçenekleri
Azure Yapay Zeka Arama, görüntülerden bilgi almak iki tamamlayıcı yolu izleyebilir: görüntü sözelleştirme veya doğrudan ekleme. Farkları anlamak, maliyeti, gecikme süresini ve yanıt kalitesini uygulamanızın gereksinimleriyle uyumlu hale getirmenize yardımcı olur.
Resim sözelleştirmesi ve ardından metin eklemeler
Bu yöntemle, GenAI Prompt Skill, ayıklanan her görüntünün kısa bir doğal dil açıklamasını oluşturmak için alma sırasında bir LLM çağırır. "Yönetici onayıyla başlayan beş adımlı İK erişim iş akışı" gibi bir açıklama metin olarak depolanır ve çevresindeki belge metninin yanına eklenir. Daha sonra, bu açıklamayı Azure OpenAI, Microsoft Foundry veya Azure Vision ekleme modellerini çağırarak vektörleştirebilirsiniz.
Görüntü artık dilde ifade edildiğinden, Azure Yapay Zeka Arama şunları yapabilir:
Diyagramda gösterilen ilişkileri ve varlıkları yorumlama.
LLM'nin yanıtta ayrıntılı olarak belirtebileceği hazır açıklamalı alt yazılar sağlayın.
Veriye dayalı RAG uygulamaları veya AI aracısı senaryoları için ilgili kesitleri döndürün.
Eklenen anlam derinliği, her görüntü için bir LLM çağrısı ve dizin oluşturma süresinde marjinal bir artış gerektirir.
Doğrudan çok modüllü eklemeler
İkinci seçenek, belge ayıklanan görüntüleri ve metni aynı vektör alanında vektör gösterimleri üreten çok modüllü bir ekleme modeline geçirmektir. Yapılandırma basittir ve dizin oluşturma sırasında LLM gerekmez. Doğrudan gömüler, görsel benzerlik ve "bana-buna-benzeyen-bir-şey-bul" senaryoları için çok uygundur.
Gösterim tamamen matematiksel olduğundan, iki görüntünün neden ilişkili olduğunu iletmez ve alıntılar veya ayrıntılı açıklamalar için LLM'ye hazır bağlamı sunmaz.
Her iki yaklaşımı da birleştirme
Birçok çözümün her iki kodlama yoluna da ihtiyacı vardır. Diyagramlar, akış grafikleri ve diğer açıklama açısından zengin görseller, RAG ve AI aracı topraklama için anlamsal bilgilerin kullanılabilir olması için sözelleştirilir. Etkili benzerlik araması için ekran görüntüleri, ürün fotoğrafları veya resimler doğrudan eklenir. Azure Yapay Zeka Arama dizininizi ve dizin oluşturucu beceri kümesi işlem hattınızı özelleştirerek iki vektör kümesini depolayabilir ve bunları yan yana alabilirsiniz.
Çok modüllü içeriği sorgulama seçenekleri
Çok modüllü işlem hattınız GenAI İstemi becerisiyle destekleniyorsa, arama dizininizdeki hem düz metin hem de sözlü resimler üzerinde karma sorgular çalıştırabilirsiniz. Arama sonuçlarını yalnızca metin veya yalnızca resimler gibi belirli içerik türlerine daraltmak için filtreleri de kullanabilirsiniz.
GenAI İstemi becerisi karma arama aracılığıyla metinden vektöre sorguları desteklese de, görüntüden vektöre sorguları desteklemez. Yalnızca çok modüllü ekleme modelleri, sorgu zamanında görüntüleri vektörlere dönüştüren vektörleştiriciler sağlar.
Görüntüleri çok modüllü dizininizde sorgu girişi olarak kullanmak için AML becerisini veya Azure Vision çok modüllü ekleme becerisini eşdeğer vektörleştirici ile kullanmanız gerekir. Daha fazla bilgi için bkz. Arama dizininde vektörleştirici yapılandırma.
Öğreticiler ve örnekler
Azure Yapay Zeka Arama'da çok modüllü aramayı kullanmaya başlamanıza yardımcı olmak için, Azure işlevselliği kullanarak çok modüllü dizinlerin nasıl oluşturulacağını ve iyileştirildiğini gösteren bir içerik koleksiyonu aşağıdadır.
| Içerik | Açıklama |
|---|---|
| Quickstart: Azure portalında çok modüllü arama | Sihirbazı ve Arama Gezgini'ni kullanarak Azure portalında çok modüllü dizin oluşturun ve test edin. |
| Çok modüllü öğretici | Metin ve görüntüleri ayıklayın, verileri öbekleyin ve benzerlik araması ve diğer alma desenleri için öbekleri vektörleştirin. |
| Örnek uygulama: Multimodal RAG GitHub deposu | Hem metin parçacıklarını hem de görüntü ek açıklamalarını ortaya çıkarabilen çok modüllü özelliklere sahip uçtan uca, koda hazır bir RAG uygulaması. Hızlı başlangıç kurumsal yardımcı pilotlar için idealdir. |