Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Note
Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.
Ważne
Funkcje, możliwości lub właściwości oznaczone (wersja zapoznawcza) nie są objęte umową dotyczącą poziomu usług, nie są zalecane w przypadku obciążeń produkcyjnych i mogą ulec zmianie lub ograniczeniu, zanim staną się one ogólnie dostępne. Warunki Wyszukiwanie AI platformy Azure wersji zapoznawczej mają zastosowanie do wszystkich funkcji w wersji zapoznawczej, niezależnie od tego, czy jest ona autonomiczna, czy częścią ogólnie dostępnej funkcji.
Ważne
Te funkcje i możliwości obsługują połączenia z innymi usługami firmy Microsoft i usługami innych firm. Korzystanie z tych usług podlega odpowiednim warunkom i może spowodować przetwarzanie lub przechowywanie danych poza granicą zgodności Azure, a także dane przepływające do granicy zgodności Azure.
Do Ciebie należy decydowanie o tym, czy dane będą przepływać poza granice zgodności i granice geograficzne organizacji, oraz o wszelkich związanych z tym konsekwencjach, a także zapewnienie odpowiednich uprawnień, ograniczeń i zatwierdzeń.
Odpowiadasz za staranne przeglądanie i testowanie aplikacji, które tworzysz w kontekście konkretnych przypadków użycia, oraz podejmowanie wszelkich odpowiednich decyzji i dostosowań. Obejmuje to implementowanie własnych odpowiedzialnych środków zaradczych dotyczących sztucznej inteligencji, takich jak metaprompty, filtry zawartości lub inne systemy bezpieczeństwa oraz zapewnienie, że aplikacje spełniają odpowiednią jakość, niezawodność, bezpieczeństwo i standardy wiarygodności. Aby uzyskać więcej informacji, zobacz Wyszukiwanie AI platformy Azure Transparency Note.
Indeksator Azure Files (wersja zapoznawcza) importuje zawartość z udziału plikowego do indeksu usługi Wyszukiwanie AI platformy Azure. Dane wejściowe indeksatora to pliki w jednym udziale. Dane wyjściowe to indeks wyszukiwania z wyszukiwalną zawartością i metadanymi przechowywanymi w indywidualnych polach.
Aby skonfigurować i uruchomić indeksator, możesz użyć:
- Interfejsy API REST usługi Search Service w wersji zapoznawczej, dowolna wersja zapoznawcza.
- Pakiet Azure SDK, dowolna wersja.
Kreator importu danych w portalu Azure.
Wymagania wstępne
Azure Files, warstwa zoptymalizowana pod kątem transakcji.
Udział plików SMB dostarczający zawartość źródłową. Udziały NFS nie są obsługiwane.
Pliki zawierające tekst. Jeśli masz dane binarne, możesz uwzględnić wzbogacanie sztucznej inteligencji na potrzeby analizy obrazów.
Pliki źródłowe przetwarzane przez indeksator Azure Files używają udostępnionego rozmiaru pliku źródłowego i limitów wyodrębnionych znaków dla indeksatorów podobnych do obiektów blob.
Uprawnienia do odczytu w usłudze Azure Storage. Connection string z "całkowitym dostępem" zawiera klucz, który udziela dostępu do zawartości.
Użyj klienta REST , aby sformułować wywołania REST podobne do tych przedstawionych w tym artykule.
Obsługiwane zadania
Tego indeksatora można używać do wykonywania następujących zadań:
- Indeksowanie danych i indeksowanie przyrostowe: Indeksator może indeksować pliki i skojarzone metadane z tabel. Wykrywa nowe i zaktualizowane pliki i metadane za pomocą wbudowanego wykrywania zmian. Odświeżanie danych można skonfigurować zgodnie z harmonogramem lub na żądanie.
- Wykrywanie usuwania: Indeksator może wykrywać usunięcia za pomocą metadanych niestandardowych.
- Zastosowana sztuczna inteligencja za pomocą zestawów umiejętności:zestawy umiejętności są w pełni obsługiwane przez indeksator. Obejmuje to kluczowe funkcje, takie jak wektoryzacja zintegrowana , które dodają kroki fragmentowania i osadzania danych.
- Tryby analizowania: Indeksator obsługuje tryby analizowania w formacie JSON , jeśli chcesz przeanalizować tablice JSON lub wiersze do poszczególnych dokumentów wyszukiwania. Obsługuje również tryb analizowania języka Markdown.
- Zgodność z innymi funkcjami: Indeksator jest przeznaczony do bezproblemowej pracy z innymi funkcjami indeksatora, takimi jak sesje debugowania, pamięć podręczna indeksatora na potrzeby wzbogacania przyrostowego i magazyn wiedzy.
Obsługiwane formaty dokumentów
Indeksator Azure Files może wyodrębnić tekst z następujących formatów dokumentów:
- CSV (zobacz Indeksowanie obiektów blob CSV)
- EML
- EPUB
- GZ
- HTML
- JSON (zobacz Indeksowanie obiektów blob JSON)
- KML (XML dla reprezentacji geograficznych)
- Markdown
- formaty Microsoft Office: DOCX/DOC/DOCM, XLSX/XLS/XLSM, PPTX/PPT/PPTM, MSG (Outlook wiadomości e-mail), XML (zarówno 2003, jak i 2006 WORD XML)
- Formaty dokumentów Open Document: ODT, ODS, ODP
- Pliki zwykłego tekstu (zobacz też Indeksowanie zwykłego tekstu)
- RTF
- XML
- ZIP
Jak Azure Files są indeksowane
Domyślnie większość plików jest indeksowana jako pojedynczy dokument wyszukiwania w indeksie, w tym pliki z zawartością ustrukturyzowaną, taką jak JSON lub CSV, które są indeksowane jako pojedynczy fragment tekstu.
Złożony lub osadzony dokument (taki jak archiwum ZIP, dokument Word z osadzonym e-mailem Outlook zawierającym załączniki lub plik MSG z załącznikami) jest również indeksowany jako pojedynczy dokument. Na przykład wszystkie obrazy wyodrębnione z załączników pliku .MSG zostaną zwrócone w polu normalized_images. Jeśli masz obrazy, rozważ dodanie ulepszeń sztucznej inteligencji, aby zwiększyć użyteczność tej zawartości w wyszukiwaniu.
Tekstowa zawartość dokumentu jest wyodrębniona do pola ciągu o nazwie "content". Można również wyodrębnić standardowe i zdefiniowane przez użytkownika metadane.
Definiowanie źródła danych
Definicja źródła danych określa dane do indeksowania, poświadczeń i zasad identyfikowania zmian w danych. Źródło danych jest definiowane jako niezależny zasób, dzięki czemu może być używane przez wiele indeksatorów.
Możesz użyć wersji 2020-06-30-preview lub nowszej dla "type": "azurefile". Zalecamy najnowszą wersję przedpremierową interfejsu API.
Utwórz źródło danych , aby ustawić jego definicję przy użyciu interfejsu API w wersji zapoznawczej dla "type":
"azurefile".POST /datasources?api-version=2026-08-01-preview { "name" : "my-file-datasource", "type" : "azurefile", "credentials" : { "connectionString" : "DefaultEndpointsProtocol=https;AccountName=<account name>;AccountKey=<account key>;" }, "container" : { "name" : "my-file-share", "query" : "<optional-directory-name>" } }Ustaw wartość "type" na
"azurefile"(wymagane).Ustaw wartość "poświadczenia" na łańcuch połączenia Azure Storage. W następnej sekcji opisano obsługiwane formaty.
Ustaw "container" jako główny udział plików, a następnie użyj funkcji "query", aby określić dowolne podfoldery.
Definicja źródła danych może również obejmować zasady miękkiego usuwania, jeśli indeksator ma usunąć dokument wyszukiwania, gdy dokument źródłowy jest oznaczony do usunięcia.
Obsługiwane poświadczenia i parametry połączenia
Indeksatory mogą łączyć się z zasobem udostępnionym plików za pomocą następujących połączeń.
| Ciąg połączenia do konta magazynowego z pełnym dostępem |
|---|
{ "connectionString" : "DefaultEndpointsProtocol=https;AccountName=<your storage account>;AccountKey=<your account key>;" } |
| Możesz pobrać ciąg połączenia ze strony konta magazynu w portalu Azure, wybierając pozycję Klucze dostępu w lewym panelu. Pamiętaj, aby wybrać pełny parametry połączenia, a nie tylko klucz. |
Dodawanie pól wyszukiwania do indeksu
W indeksie search dodaj pola, aby zaakceptować zawartość i metadane plików Azure.
Utwórz lub zaktualizuj indeks, aby zdefiniować pola wyszukiwania, które będą przechowywać zawartość pliku i metadane.
POST /indexes?api-version=2026-04-01 { "name" : "my-search-index", "fields": [ { "name": "ID", "type": "Edm.String", "key": true, "searchable": false }, { "name": "content", "type": "Edm.String", "searchable": true, "filterable": false }, { "name": "metadata_storage_name", "type": "Edm.String", "searchable": false, "filterable": true, "sortable": true }, { "name": "metadata_storage_path", "type": "Edm.String", "searchable": false, "filterable": true, "sortable": true }, { "name": "metadata_storage_size", "type": "Edm.Int64", "searchable": false, "filterable": true, "sortable": true }, { "name": "metadata_storage_content_type", "type": "Edm.String", "searchable": true, "filterable": true, "sortable": true } ] }Utwórz pole klucza dokumentu ("key": true). W przypadku zawartości obiektu blob najlepszymi kandydatami są właściwości metadanych. Właściwości metadanych często zawierają znaki, takie jak
/i-, które są nieprawidłowe dla kluczy dokumentów. Indeksator automatycznie koduje właściwość metadanych klucza bez wymaganej konfiguracji ani mapowania pól.metadata_storage_path(ustawienie domyślne) pełna ścieżka do obiektu lub plikumetadata_storage_namemożna używać tylko wtedy, gdy nazwy są unikatoweNiestandardowa właściwość metadanych, którą dodajesz do obiektów blob. Ta opcja wymaga, aby proces przekazywania obiektów blob dodał tę właściwość metadanych do wszystkich obiektów blob. Ponieważ klucz jest wymaganą właściwością, wszystkie obiekty blob, których brakuje wartości, nie będą indeksowane. Jeśli używasz niestandardowej właściwości metadanych jako klucza, unikaj wprowadzania zmian w tej właściwości. Indeksatory dodają duplikaty dokumentów dla tego samego blobu, jeśli właściwość klucza ulegnie zmianie.
Dodaj pole "content", aby przechowywać wyodrębniony tekst z każdego pliku za pomocą właściwości "content" obiektu blob. Nie musisz używać tej nazwy, ale umożliwia to korzystanie z niejawnych mapowań pól.
Dodaj pola dla standardowych właściwości metadanych. W indeksowaniu plików standardowe właściwości metadanych są takie same jak właściwości metadanych obiektu blob. Indeksator Azure Files automatycznie tworzy wewnętrzne mapowania pól dla tych właściwości, które konwertują nazwy właściwości rozdzielonych łącznikami na nazwy właściwości podkreślonych. Nadal musisz dodać pola, które chcesz użyć do definicji indeksu, ale możesz pominąć tworzenie mapowań pól w źródle danych.
-
metadata_storage_name (
Edm.String) — nazwa pliku. Jeśli na przykład masz plik /my-share/my-folder/subfolder/resume.pdf, wartość tego pola toresume.pdf. -
metadata_storage_path (
Edm.String) — pełny identyfikator URI pliku, w tym konto przechowywania. Na przykład:https://myaccount.file.core.windows.net/my-share/my-folder/subfolder/resume.pdf -
metadata_storage_content_type (
Edm.String) — typ zawartości określony przez kod użyty do przekazania pliku. Na przykładapplication/octet-stream. -
metadata_storage_last_modified (
Edm.DateTimeOffset) — znacznik czasu ostatniej modyfikacji pliku. Wyszukiwanie AI platformy Azure używa tego znacznika czasu do identyfikowania zmienionych plików, aby uniknąć ponownego indeksowania wszystkiego po początkowym indeksowaniu. -
metadata_storage_size (
Edm.Int64) — rozmiar pliku w bajtach. -
metadata_storage_content_md5 (
Edm.String) — skrót MD5 zawartości pliku, jeśli jest dostępny. -
metadata_storage_sas_token (
Edm.String) — tymczasowy token SAS, który może być używany przez umiejętności niestandardowe, aby uzyskać dostęp do pliku. Ten token nie powinien być przechowywany do późniejszego użycia, ponieważ może wygasnąć.
-
metadata_storage_name (
Konfigurowanie i uruchamianie indeksatora Azure Files
Po utworzeniu indeksu i źródła danych możesz utworzyć indeksator. Konfiguracja indeksatora określa dane wejściowe, parametry i właściwości kontrolujące zachowania czasu wykonywania.
Utwórz lub zaktualizuj indeksator , podając mu nazwę i odwołując się do źródła danych i indeksu docelowego:
POST /indexers?api-version=2026-04-01 { "name" : "my-file-indexer", "dataSourceName" : "my-file-datasource", "targetIndexName" : "my-search-index", "parameters": { "batchSize": null, "maxFailedItems": null, "maxFailedItemsPerBatch": null, "configuration": { "indexedFileNameExtensions" : ".pdf,.docx", "excludedFileNameExtensions" : ".png,.jpeg" } }, "schedule" : { }, "fieldMappings" : [ ] }W opcjonalnej sekcji "konfiguracja" podaj wszystkie kryteria dołączania lub wykluczania. Jeśli plik pozostanie nieokreślony, zostaną pobrane wszystkie pliki w udziale plików.
Jeśli oba parametry
indexedFileNameExtensionsiexcludedFileNameExtensionssą obecne, Wyszukiwanie AI platformy Azure najpierw patrzy naindexedFileNameExtensions, a następnie naexcludedFileNameExtensions. Jeśli to samo rozszerzenie pliku znajduje się na obu listach, zostanie wykluczone z indeksowania.Określ mapowania pól , jeśli istnieją różnice w nazwie lub typie pola lub jeśli potrzebujesz wielu wersji pola źródłowego w indeksie wyszukiwania.
W indeksowaniu plików często można pominąć mapowania pól, ponieważ indeksator ma wbudowaną obsługę mapowania właściwości "zawartości" i metadanych na podobnie nazwane i wpisane pola w indeksie. W przypadku właściwości metadanych indeksator automatycznie zastąpi łączniki
-podkreśleniami w indeksie wyszukiwania.Aby uzyskać więcej informacji na temat innych właściwości, zobacz Tworzenie indeksatora .
Indeksator jest uruchamiany automatycznie po jego utworzeniu. Możesz temu zapobiec, ustawiając wartość "disabled" na true. Aby kontrolować wykonywanie indeksatora, uruchom indeksator na żądanie lub umieść go zgodnie z harmonogramem.
Sprawdzanie stanu indeksatora
Aby monitorować stan indeksatora i historię wykonywania, wyślij żądanie pobierz stan indeksatora :
GET https://myservice.search.windows.net/indexers/myindexer/status?api-version=2026-04-01
Content-Type: application/json
api-key: [admin key]
Odpowiedź zawiera stan i liczbę przetworzonych elementów. Powinien on wyglądać podobnie do poniższego przykładu:
{
"status":"running",
"lastResult": {
"status":"success",
"errorMessage":null,
"startTime":"2022-02-21T00:23:24.957Z",
"endTime":"2022-02-21T00:36:47.752Z",
"errors":[],
"itemsProcessed":1599501,
"itemsFailed":0,
"initialTrackingState":null,
"finalTrackingState":null
},
"executionHistory":
[
{
"status":"success",
"errorMessage":null,
"startTime":"2022-02-21T00:23:24.957Z",
"endTime":"2022-02-21T00:36:47.752Z",
"errors":[],
"itemsProcessed":1599501,
"itemsFailed":0,
"initialTrackingState":null,
"finalTrackingState":null
},
... earlier history items
]
}
Historia wykonywania zawiera do 50 ostatnio wykonanych wykonań, które są sortowane w odwrotnej kolejności chronologicznej, tak aby najnowsze wykonanie było wykonywane jako pierwsze.
Następne kroki
Teraz możesz uruchomić indeksator, monitorować stan lub zaplanować wykonywanie indeksatora. Następujące artykuły dotyczą indeksatorów, które ściągają zawartość z Azure Storage: