Esecuzione dell'indicizzatore in Serverless e Standard 3 High Density (S3 HD) (anteprima)

Note

Azure AI Search è disponibile tramite il portale di Azure, le API REST e Azure SDK. È inoltre alla base di Foundry IQ, il livello di conoscenza gestito che trasforma il contenuto aziendale in knowledge base riutilizzabili e con riconoscimento delle autorizzazioni per gli agenti nel portale di Microsoft Foundry.

Importante

Le funzionalità, le funzionalità o le proprietà contrassegnate (anteprima) non sono coperte da un contratto di servizio, non sono consigliate per i carichi di lavoro di produzione e potrebbero cambiare o essere vincolate prima che diventino disponibili a livello generale. Le condizioni di anteprima Azure AI Search si applicano a tutte le funzionalità di anteprima, indipendente o parte di una funzionalità disponibile a livello generale.

Questo articolo descrive il modello di esecuzione dell'indicizzatore usato Azure AI Search per i servizi di ricerca Serverless e Standard 3 High Density (S3 HD). Entrambe le opzioni hanno una quota di runtime giornaliera a livello di servizio che determina il tempo totale dell'indicizzatore che è possibile usare per una finestra UTC di 24 ore.

Le funzionalità descritte in questo articolo sono disponibili in anteprima:

Dove si applica

Il modello di esecuzione in questo articolo si applica a:

  • Servizi di ricerca senza server che eseguono indicizzatori usando l'API REST 2026-05-01-preview o versioni successive.
  • Servizi di ricerca HD S3 che eseguono indicizzatori usando l'API 2025-11-01-preview REST o versioni successive.

Le definizioni dell'indicizzatore, le origini dati, i set di competenze e le origini conoscenze supportate dall'indicizzatore funzionano senza modifiche in entrambe le opzioni.

Modello di esecuzione

Gli indicizzatori in Serverless e S3 HD hanno le caratteristiche di esecuzione seguenti:

  • Non esegui il provisioning né gestisci l'infrastruttura dell'indicizzatore. Il servizio gestisce la capacità al posto tuo.

  • Gli indicizzatori vengono eseguiti solo nell'ambiente di esecuzione multi-tenant. L'ambiente di esecuzione privato, fornito tramite risorse di collegamento privato condiviso, non è disponibile per gli indicizzatori in questi SKU.

  • Per S3 HD, se sono necessarie connessioni indicizzate per rimanere fuori dalla rete Internet pubblica, configurare un perimetro di sicurezza di rete (NSP) nel servizio di ricerca per controllare il traffico in ingresso e in uscita tramite regole di accesso esplicite.

  • Per Serverless non è disponibile alcun supporto per le connessioni private.

Quota di runtime cumulativa giornaliera

L'esecuzione dell'indicizzatore è governata da una quota di runtime giornaliera che viene reimpostata alle 00:00 UTC. La quota è:

  • Livello di servizio: Si applica al servizio di ricerca nel suo complesso.
  • Totale: Il tempo di esecuzione di ogni indicizzatore del servizio viene conteggiato nell'ambito dello stesso budget. La quota non si applica a ogni indicizzatore.

Tutti gli indicizzatori in esecuzione consumano tempo a carico di un unico budget di servizio condiviso. Il servizio non riserva il tempo di esecuzione per i singoli indicizzatori né divide automaticamente la quota in parti uguali tra di essi. Ad esempio, la durata cumulativa di 12 indicizzatori che vengono eseguiti per due ore ciascuno può consumare tutte le 24 ore aggregate di runtime, indipendentemente dal fatto che le esecuzioni si sovrappongano o avvengano in momenti diversi.

La tabella seguente elenca la quota giornaliera per SKU e la versione minima dell'API che la supporta:

SKU Quota giornaliera per finestra UTC di 24 ore Versione minima dell'API
S3 HD 24 ore 2025-11-01-preview
Serverless 24 ore 2026-05-01-preview

Quando la quota giornaliera è esaurita:

  • Gli indicizzatori attualmente in esecuzione si arrestano entro circa cinque minuti.

  • Le nuove esecuzioni dell'indicizzatore non elaborano i documenti e restituiscono immediatamente un errore temporaneo che indica che la quota giornaliera è stata superata.

  • L'esecuzione normale dell'indicizzatore riprende dopo la reimpostazione del contatore alle 00:00 UTC.

Riprendersi dall'esaurimento della quota

Per recuperare dall'esaurimento della quota e ridurre la probabilità di raggiungerla di nuovo:

Monitora il tempo di esecuzione complessivo

Questa sezione illustra come tenere traccia dell'utilizzo del runtime e del budget rimanente usando le API REST del servizio di ricerca. Durante la fase di anteprima non è disponibile alcuna funzionalità relativa al tempo di esecuzione cumulativo.

Runtime a livello di servizio

Usare Get Service Statistics (API REST) per recuperare il runtime dell'indicizzatore cumulativo in tutti gli indicizzatori nel servizio per la finestra di 24 ore corrente:

GET {endpoint}/servicestats?api-version=2026-08-01-preview

La risposta include una indexersRuntime sezione. Il codice JSON seguente mostra un servizio la cui quota giornaliera di 24 ore non viene usata:

"indexersRuntime": {
    "usedSeconds": 0,
    "remainingSeconds": 86400,
    "beginningTime": "2026-05-16T00:00:00.000Z",
    "endingTime": "2026-05-17T00:00:00.000Z"
}

Punti principali:

  • usedSeconds: numero totale di secondi eseguiti da tutti gli indicizzatori nel servizio durante la finestra corrente.
  • remainingSeconds: secondi ancora disponibili prima che venga raggiunta la quota giornaliera. Presente quando si applica un limite specifico del livello.
  • beginningTime e endingTime: inizio e fine della finestra di conteggio UTC corrente di 24 ore.

Ambiente di runtime a livello dell'indicizzatore

Usare Get Indexer Status (API REST) per recuperare il runtime cumulativo per un singolo indicizzatore:

GET {endpoint}/indexers('{indexerName}')/search.status?api-version=2026-08-01-preview

La risposta include una runtime sezione. Il codice JSON seguente mostra un indicizzatore in un servizio la cui quota giornaliera di 24 ore non viene usata:

"runtime": {
    "usedSeconds": 0,
    "remainingSeconds": 86400,
    "beginningTime": "2026-05-16T00:00:00.000Z",
    "endingTime": "2026-05-17T00:00:00.000Z"
}

Punti principali:

  • usedSeconds: numero totale di secondi eseguiti dall'indicizzatore durante la finestra corrente.
  • remainingSeconds: Secondi ancora a disposizione di tutti gli indicizzatori del servizio, non solo di questo indicizzatore. Presente quando si applica un limite specifico del livello.
  • beginningTime e endingTime: inizio e fine della finestra di conteggio UTC corrente di 24 ore.

Procedure consigliate

Il supporto per l'indicizzatore in S3 HD e Serverless è in anteprima. Seguire queste indicazioni per ridimensionare i carichi di lavoro in modo appropriato e pianificare la fatturazione per Serverless da introdurre in un secondo momento.

S3 HD

Durante la fase di anteprima, il supporto per S3 HD Indexer è pensato per carichi di lavoro che non richiedono competenze specifiche o che ne richiedono poche. Per rimanere entro la quota giornaliera:

  • Prevedere indici piccoli di circa 1 GB.

  • Ridimensionare attentamente l'utilizzo del set di competenze. Le abilità che chiamano servizi esterni, come l'abilità Azure OpenAI Embedding, l'abilità GenAI Prompt e l'abilità Azure Content Understanding, aumentano significativamente il tempo di esecuzione e possono consumare rapidamente la quota giornaliera, soprattutto negli scenari multi-tenant.

  • È possibile che il parallelismo sia limitato durante l’anteprima. Per le grandi flotte di indicizzatori, ricorri a esecuzioni programmate e scaglionate, in modo che il carico di lavoro si distribuisca nell'arco delle 24 ore anziché competere per lo stesso budget.

Carico di lavoro di suddivisione e incorporamento illustrativo

In un test controllato S3 HD, un'abilità Split e un'abilità di incorporamento di Azure OpenAI hanno generato segmenti e incorporamenti. Il carico di lavoro ha prodotto circa 2,5 frammenti per documento sorgente e in questo test sono stati rilevati circa 22.000 documenti sorgente nel corso di una finestra di test S3 HD di 24 ore.

I seguenti valori sono arrotondati e a scopo illustrativo; si basano su un calcolo della quota equa fondato sull’osservazione aggregata. Non sono risultati misurati per indicizzatore.

Numero di indicizzatori Documenti sorgente illustrativi per ogni indicizzatore al giorno
100 Circa 200
500 Circa 40
1,000 Circa 20

Il servizio non riserva capacità o garantisce la stessa distribuzione, ordine di esecuzione o capacità effettiva per questi conteggi dell'indicizzatore.

Note

Questo risultato è stato osservato in un unico test controllato. Non è un obiettivo di prestazioni, una garanzia del servizio, un impegno di capacità, una formula di dimensionamento o un sostituto per il test del carico di lavoro.

La capacità effettiva può variare in modo significativo in base alla complessità e al profilo dei documenti, alla divisione in blocchi, al numero e al tipo di competenze e di output vettoriali, alla latenza del modello, alla capacità e alla quota, alle prestazioni dell'origine e della destinazione, alla concorrenza, all'ordine di pianificazione, alla limitazione, all'area, agli errori e ai nuovi tentativi, al cracking di documenti o al riconoscimento ottico dei caratteri (OCR) e a volumi dei tenant non uniformi. Testare con input di produzione rappresentativi prima di pianificare la capacità.

Serverless

In anteprima, gli indicizzatori serverless sono progettati per semplificare l'acquisizione dei dati per scenari di generazione aumentata dal recupero (RAG) e di knowledge base:

  • Si sostiene un costo per l'esecuzione dell'indicizzatore (skill escluse) e la scrittura di documenti in un indice.

  • L'esecuzione di Skillset viene fatturata allo stesso modo degli indicizzatori dedicati. Le chiamate a servizi esterni, ad esempio la competenza di embedding di Azure OpenAI, la competenza Prompt GenAI e la competenza Azure Content Understanding, vengono fatturate tramite la risorsa Foundry o Azure AI Services associata.

Limiti e quote

Per i limiti dell'indicizzatore in Serverless e S3 HD, vedere Limiti dell'indicizzatore.

La quota di runtime a livello di servizio e i limiti dell'indicizzatore non sostituiscono i limiti di input, richieste o elaborazione delle competenze e dei servizi esterni in un set di competenze. Controlla separatamente ogni riferimento alle competenze quando dimensioni una pipeline di arricchimento.