Suggerimenti per l'arricchimento tramite intelligenza artificiale in Azure AI Search

Nota

Azure AI Search è disponibile tramite il portale di Azure, le API REST e Azure SDK. È inoltre alla base di Foundry IQ, il livello di conoscenza gestito che trasforma il contenuto aziendale in knowledge base riutilizzabili e con riconoscimento delle autorizzazioni per gli agenti nel portale di Microsoft Foundry.

Questo articolo fornisce suggerimenti per iniziare a usare l'arricchimento di intelligenza artificiale e i set di competenze usati durante l'indicizzazione.

Suggerimento 1: Iniziare con la semplicità e con poco

La procedura guidata Importa dati nel portale di Azure supporta l'arricchimento tramite intelligenza artificiale. Senza scrivere codice è possibile creare ed esaminare tutti gli oggetti usati in una pipeline di arricchimento: un indice, un indicizzatore, un'origine dati e un set di competenze.

Un altro modo per iniziare consiste semplicemente nella creazione di un'origine dati con pochi documenti o righe in una tabella rappresentativi dei documenti da indicizzare. Un set di dati di piccole dimensioni è il modo migliore per aumentare la velocità di ricerca e risoluzione dei problemi. Eseguire il campione attraverso la pipeline end-to-end e verificare che- i risultati soddisfino le esigenze. Quando si è soddisfatti dei risultati, è possibile aggiungere altri file all'origine dati.

Suggerimento 2: vedere quali aspetti funzionano anche se sono presenti errori

In alcuni casi, un piccolo errore rende inutilizzabile l'indicizzatore. Questa condizione va bene se si prevede di risolvere i problemi uno alla volta. Tuttavia, è possibile ignorare un particolare tipo di errore, in modo che l'indicizzatore possa continuare e visualizzare i flussi effettivamente funzionanti.

Per ignorare gli errori durante lo sviluppo, impostare maxFailedItems e maxFailedItemsPerBatch su -1 come parte della definizione dell'indicizzatore.

{
  "parameters": {
    "maxFailedItems": -1,
    "maxFailedItemsPerBatch": -1
  }
}

Nota

Come procedura consigliata, impostare maxFailedItems e maxFailedItemsPerBatch su 0 per i carichi di lavoro di produzione.

Suggerimento 3: Usare la sessione di debug per risolvere i problemi

Sessione di debug è un editor visivo che mostra il grafico delle dipendenze di un set di competenze, gli input e gli output, e le definizioni. Carica un singolo documento di origine dall'origine dati dell'indicizzatore usando la configurazione corrente dell'indicizzatore e del set di competenze. È quindi possibile eseguire l'intero set di competenze, limitatamente a quel documento. All'interno di una sessione di debug è possibile identificare e risolvere gli errori, convalidare le modifiche e confermare le modifiche a un insieme di competenze principale. Per una procedura dettagliata, vedere Esercitazione: eseguire il debug di sessioni.

Suggerimento 4: Il contenuto previsto non viene visualizzato

Se il contenuto non è presente, verificare la presenza di documenti eliminati nel portale di Azure. Nella pagina del servizio di ricerca aprire Indicizzatori, selezionare l'indicizzatore e quindi selezionare il valore Stato di un'esecuzione per visualizzare i dettagli e gli errori di esecuzione.

Se il problema è correlato alle dimensioni del file, è possibile che venga visualizzato un errore simile al seguente: "Il nome< del file BLOB>" ha le dimensioni dei byte di dimensioni< del >file, che superano le dimensioni massime per l'estrazione dei documenti per il livello di servizio corrente. Per altre informazioni sui limiti dell'indicizzatore, vedere Limiti del servizio.

Un secondo motivo per cui il contenuto non viene visualizzato potrebbe essere correlato agli errori di mapping di input/output. Ad esempio, il nome di destinazione di output è "Persone" ma il nome del campo indice è in minuscolo, "persone". Il sistema restituisce 201 messaggi di esito positivo per l'intera pipeline, in modo da pensare che l'indicizzazione sia riuscita, quando in realtà un campo è vuoto.

Suggerimento 5: estendere l'elaborazione oltre il tempo di esecuzione massimo

L’analisi delle immagini richiede molte risorse di calcolo anche per i casi semplici, pertanto, quando le immagini sono particolarmente grandi o complesse, i tempi di elaborazione possono superare il tempo massimo consentito.

Per gli indicizzatori con set di competenze, l'esecuzione del set di competenze è limitata a 2 ore per la maggior parte dei livelli. Se l'elaborazione del set di competenze non viene completata entro tale periodo, pianificare l'esecuzione dell'indicizzatore ogni cinque minuti in modo che possa riprendere l'elaborazione dall'ultimo documento valido noto.

L'indicizzazione pianificata riprende dall'ultimo documento valido. Secondo una pianificazione ricorrente, l’indicizzatore può elaborare gradualmente il back-log di immagini nell’arco di diverse ore o giorni, fino a quando tutte le immagini non elaborate vengono processate. Per altre informazioni sulla sintassi della pianificazione, vedere Pianificare un indicizzatore.

Nota

Se un indicizzatore pianificato non riesce ripetutamente sullo stesso documento, il servizio ne riduce la frequenza di esecuzione (fino a una volta ogni 24 ore) finché non compie progressi. Dopo aver risolto il problema sottostante, eseguire l'indicizzatore su richiesta. In caso di avanzamento, l'indicizzatore torna all'intervallo configurato. Se l'indicizzatore non torna alla pianificazione configurata dopo un'esecuzione riuscita, vedere Domande frequenti sul comportamento di pianificazione.

Suggerimento 6: aumentare la velocità effettiva di indicizzazione

Per l'indicizzazione parallela, distribuire i dati in più contenitori o cartelle virtuali all'interno dello stesso contenitore. Creare quindi più coppie di origine dati e indicizzatori. Tutti gli indicizzatori possono utilizzare lo stesso insieme di competenze e scrivere nello stesso indice di ricerca di destinazione, in modo che l'app per la ricerca non debba necessariamente essere a conoscenza di tale partizionamento.

Vedi anche