Indeksowanie danych z Azure Files (wersja zapoznawcza)

Note

Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.

Ważne

Funkcje, możliwości lub właściwości oznaczone (wersja zapoznawcza) nie są objęte umową dotyczącą poziomu usług, nie są zalecane w przypadku obciążeń produkcyjnych i mogą ulec zmianie lub ograniczeniu, zanim staną się one ogólnie dostępne. Warunki Wyszukiwanie AI platformy Azure wersji zapoznawczej mają zastosowanie do wszystkich funkcji w wersji zapoznawczej, niezależnie od tego, czy jest ona autonomiczna, czy częścią ogólnie dostępnej funkcji.

Ważne

Te funkcje i możliwości obsługują połączenia z innymi usługami firmy Microsoft i usługami innych firm. Korzystanie z tych usług podlega odpowiednim warunkom i może spowodować przetwarzanie lub przechowywanie danych poza granicą zgodności Azure, a także dane przepływające do granicy zgodności Azure.

Do Ciebie należy decydowanie o tym, czy dane będą przepływać poza granice zgodności i granice geograficzne organizacji, oraz o wszelkich związanych z tym konsekwencjach, a także zapewnienie odpowiednich uprawnień, ograniczeń i zatwierdzeń.

Odpowiadasz za staranne przeglądanie i testowanie aplikacji, które tworzysz w kontekście konkretnych przypadków użycia, oraz podejmowanie wszelkich odpowiednich decyzji i dostosowań. Obejmuje to implementowanie własnych odpowiedzialnych środków zaradczych dotyczących sztucznej inteligencji, takich jak metaprompty, filtry zawartości lub inne systemy bezpieczeństwa oraz zapewnienie, że aplikacje spełniają odpowiednią jakość, niezawodność, bezpieczeństwo i standardy wiarygodności. Aby uzyskać więcej informacji, zobacz Wyszukiwanie AI platformy Azure Transparency Note.

Indeksator Azure Files (wersja zapoznawcza) importuje zawartość z udziału plikowego do indeksu usługi Wyszukiwanie AI platformy Azure. Dane wejściowe indeksatora to pliki w jednym udziale. Dane wyjściowe to indeks wyszukiwania z wyszukiwalną zawartością i metadanymi przechowywanymi w indywidualnych polach.

Aby skonfigurować i uruchomić indeksator, możesz użyć:

Wymagania wstępne

Obsługiwane zadania

Tego indeksatora można używać do wykonywania następujących zadań:

Obsługiwane formaty dokumentów

Indeksator Azure Files może wyodrębnić tekst z następujących formatów dokumentów:

Jak Azure Files są indeksowane

Domyślnie większość plików jest indeksowana jako pojedynczy dokument wyszukiwania w indeksie, w tym pliki z zawartością ustrukturyzowaną, taką jak JSON lub CSV, które są indeksowane jako pojedynczy fragment tekstu.

Złożony lub osadzony dokument (taki jak archiwum ZIP, dokument Word z osadzonym e-mailem Outlook zawierającym załączniki lub plik MSG z załącznikami) jest również indeksowany jako pojedynczy dokument. Na przykład wszystkie obrazy wyodrębnione z załączników pliku .MSG zostaną zwrócone w polu normalized_images. Jeśli masz obrazy, rozważ dodanie ulepszeń sztucznej inteligencji, aby zwiększyć użyteczność tej zawartości w wyszukiwaniu.

Tekstowa zawartość dokumentu jest wyodrębniona do pola ciągu o nazwie "content". Można również wyodrębnić standardowe i zdefiniowane przez użytkownika metadane.

Definiowanie źródła danych

Definicja źródła danych określa dane do indeksowania, poświadczeń i zasad identyfikowania zmian w danych. Źródło danych jest definiowane jako niezależny zasób, dzięki czemu może być używane przez wiele indeksatorów.

Możesz użyć wersji 2020-06-30-preview lub nowszej dla "type": "azurefile". Zalecamy najnowszą wersję przedpremierową interfejsu API.

  1. Utwórz źródło danych , aby ustawić jego definicję przy użyciu interfejsu API w wersji zapoznawczej dla "type": "azurefile".

    POST /datasources?api-version=2026-08-01-preview
    {
        "name" : "my-file-datasource",
        "type" : "azurefile",
        "credentials" : { "connectionString" : "DefaultEndpointsProtocol=https;AccountName=<account name>;AccountKey=<account key>;" },
        "container" : { "name" : "my-file-share", "query" : "<optional-directory-name>" }
    }
    
  2. Ustaw wartość "type" na "azurefile" (wymagane).

  3. Ustaw wartość "poświadczenia" na łańcuch połączenia Azure Storage. W następnej sekcji opisano obsługiwane formaty.

  4. Ustaw "container" jako główny udział plików, a następnie użyj funkcji "query", aby określić dowolne podfoldery.

Definicja źródła danych może również obejmować zasady miękkiego usuwania, jeśli indeksator ma usunąć dokument wyszukiwania, gdy dokument źródłowy jest oznaczony do usunięcia.

Obsługiwane poświadczenia i parametry połączenia

Indeksatory mogą łączyć się z zasobem udostępnionym plików za pomocą następujących połączeń.

Ciąg połączenia do konta magazynowego z pełnym dostępem
{ "connectionString" : "DefaultEndpointsProtocol=https;AccountName=<your storage account>;AccountKey=<your account key>;" }
Możesz pobrać ciąg połączenia ze strony konta magazynu w portalu Azure, wybierając pozycję Klucze dostępu w lewym panelu. Pamiętaj, aby wybrać pełny parametry połączenia, a nie tylko klucz.

Dodawanie pól wyszukiwania do indeksu

W indeksie search dodaj pola, aby zaakceptować zawartość i metadane plików Azure.

  1. Utwórz lub zaktualizuj indeks, aby zdefiniować pola wyszukiwania, które będą przechowywać zawartość pliku i metadane.

    POST /indexes?api-version=2026-04-01
    {
      "name" : "my-search-index",
      "fields": [
          { "name": "ID", "type": "Edm.String", "key": true, "searchable": false },
          { "name": "content", "type": "Edm.String", "searchable": true, "filterable": false },
          { "name": "metadata_storage_name", "type": "Edm.String", "searchable": false, "filterable": true, "sortable": true  },
          { "name": "metadata_storage_path", "type": "Edm.String", "searchable": false, "filterable": true, "sortable": true },
          { "name": "metadata_storage_size", "type": "Edm.Int64", "searchable": false, "filterable": true, "sortable": true  },
          { "name": "metadata_storage_content_type", "type": "Edm.String", "searchable": true, "filterable": true, "sortable": true }        
      ]
    }
    
  2. Utwórz pole klucza dokumentu ("key": true). W przypadku zawartości obiektu blob najlepszymi kandydatami są właściwości metadanych. Właściwości metadanych często zawierają znaki, takie jak / i -, które są nieprawidłowe dla kluczy dokumentów. Indeksator automatycznie koduje właściwość metadanych klucza bez wymaganej konfiguracji ani mapowania pól.

    • metadata_storage_path (ustawienie domyślne) pełna ścieżka do obiektu lub pliku

    • metadata_storage_name można używać tylko wtedy, gdy nazwy są unikatowe

    • Niestandardowa właściwość metadanych, którą dodajesz do obiektów blob. Ta opcja wymaga, aby proces przekazywania obiektów blob dodał tę właściwość metadanych do wszystkich obiektów blob. Ponieważ klucz jest wymaganą właściwością, wszystkie obiekty blob, których brakuje wartości, nie będą indeksowane. Jeśli używasz niestandardowej właściwości metadanych jako klucza, unikaj wprowadzania zmian w tej właściwości. Indeksatory dodają duplikaty dokumentów dla tego samego blobu, jeśli właściwość klucza ulegnie zmianie.

  3. Dodaj pole "content", aby przechowywać wyodrębniony tekst z każdego pliku za pomocą właściwości "content" obiektu blob. Nie musisz używać tej nazwy, ale umożliwia to korzystanie z niejawnych mapowań pól.

  4. Dodaj pola dla standardowych właściwości metadanych. W indeksowaniu plików standardowe właściwości metadanych są takie same jak właściwości metadanych obiektu blob. Indeksator Azure Files automatycznie tworzy wewnętrzne mapowania pól dla tych właściwości, które konwertują nazwy właściwości rozdzielonych łącznikami na nazwy właściwości podkreślonych. Nadal musisz dodać pola, które chcesz użyć do definicji indeksu, ale możesz pominąć tworzenie mapowań pól w źródle danych.

    • metadata_storage_name (Edm.String) — nazwa pliku. Jeśli na przykład masz plik /my-share/my-folder/subfolder/resume.pdf, wartość tego pola to resume.pdf.
    • metadata_storage_path (Edm.String) — pełny identyfikator URI pliku, w tym konto przechowywania. Na przykład: https://myaccount.file.core.windows.net/my-share/my-folder/subfolder/resume.pdf
    • metadata_storage_content_type (Edm.String) — typ zawartości określony przez kod użyty do przekazania pliku. Na przykład application/octet-stream.
    • metadata_storage_last_modified (Edm.DateTimeOffset) — znacznik czasu ostatniej modyfikacji pliku. Wyszukiwanie AI platformy Azure używa tego znacznika czasu do identyfikowania zmienionych plików, aby uniknąć ponownego indeksowania wszystkiego po początkowym indeksowaniu.
    • metadata_storage_size (Edm.Int64) — rozmiar pliku w bajtach.
    • metadata_storage_content_md5 (Edm.String) — skrót MD5 zawartości pliku, jeśli jest dostępny.
    • metadata_storage_sas_token (Edm.String) — tymczasowy token SAS, który może być używany przez umiejętności niestandardowe, aby uzyskać dostęp do pliku. Ten token nie powinien być przechowywany do późniejszego użycia, ponieważ może wygasnąć.

Konfigurowanie i uruchamianie indeksatora Azure Files

Po utworzeniu indeksu i źródła danych możesz utworzyć indeksator. Konfiguracja indeksatora określa dane wejściowe, parametry i właściwości kontrolujące zachowania czasu wykonywania.

  1. Utwórz lub zaktualizuj indeksator , podając mu nazwę i odwołując się do źródła danych i indeksu docelowego:

    POST /indexers?api-version=2026-04-01
    {
      "name" : "my-file-indexer",
      "dataSourceName" : "my-file-datasource",
      "targetIndexName" : "my-search-index",
      "parameters": {
         "batchSize": null,
         "maxFailedItems": null,
         "maxFailedItemsPerBatch": null,
         "configuration": {
            "indexedFileNameExtensions" : ".pdf,.docx",
            "excludedFileNameExtensions" : ".png,.jpeg" 
        }
      },
      "schedule" : { },
      "fieldMappings" : [ ]
    }
    
  2. W opcjonalnej sekcji "konfiguracja" podaj wszystkie kryteria dołączania lub wykluczania. Jeśli plik pozostanie nieokreślony, zostaną pobrane wszystkie pliki w udziale plików.

    Jeśli oba parametry indexedFileNameExtensions i excludedFileNameExtensions są obecne, Wyszukiwanie AI platformy Azure najpierw patrzy na indexedFileNameExtensions, a następnie na excludedFileNameExtensions. Jeśli to samo rozszerzenie pliku znajduje się na obu listach, zostanie wykluczone z indeksowania.

  3. Określ mapowania pól , jeśli istnieją różnice w nazwie lub typie pola lub jeśli potrzebujesz wielu wersji pola źródłowego w indeksie wyszukiwania.

    W indeksowaniu plików często można pominąć mapowania pól, ponieważ indeksator ma wbudowaną obsługę mapowania właściwości "zawartości" i metadanych na podobnie nazwane i wpisane pola w indeksie. W przypadku właściwości metadanych indeksator automatycznie zastąpi łączniki - podkreśleniami w indeksie wyszukiwania.

  4. Aby uzyskać więcej informacji na temat innych właściwości, zobacz Tworzenie indeksatora .

Indeksator jest uruchamiany automatycznie po jego utworzeniu. Możesz temu zapobiec, ustawiając wartość "disabled" na true. Aby kontrolować wykonywanie indeksatora, uruchom indeksator na żądanie lub umieść go zgodnie z harmonogramem.

Sprawdzanie stanu indeksatora

Aby monitorować stan indeksatora i historię wykonywania, wyślij żądanie pobierz stan indeksatora :

GET https://myservice.search.windows.net/indexers/myindexer/status?api-version=2026-04-01
  Content-Type: application/json  
  api-key: [admin key]

Odpowiedź zawiera stan i liczbę przetworzonych elementów. Powinien on wyglądać podobnie do poniższego przykładu:

    {
        "status":"running",
        "lastResult": {
            "status":"success",
            "errorMessage":null,
            "startTime":"2022-02-21T00:23:24.957Z",
            "endTime":"2022-02-21T00:36:47.752Z",
            "errors":[],
            "itemsProcessed":1599501,
            "itemsFailed":0,
            "initialTrackingState":null,
            "finalTrackingState":null
        },
        "executionHistory":
        [
            {
                "status":"success",
                "errorMessage":null,
                "startTime":"2022-02-21T00:23:24.957Z",
                "endTime":"2022-02-21T00:36:47.752Z",
                "errors":[],
                "itemsProcessed":1599501,
                "itemsFailed":0,
                "initialTrackingState":null,
                "finalTrackingState":null
            },
            ... earlier history items
        ]
    }

Historia wykonywania zawiera do 50 ostatnio wykonanych wykonań, które są sortowane w odwrotnej kolejności chronologicznej, tak aby najnowsze wykonanie było wykonywane jako pierwsze.

Następne kroki

Teraz możesz uruchomić indeksator, monitorować stan lub zaplanować wykonywanie indeksatora. Następujące artykuły dotyczą indeksatorów, które ściągają zawartość z Azure Storage: