Sugerencias para el enriquecimiento con IA en Búsqueda de Azure AI

Nota:

Búsqueda de Azure AI está disponible a través del portal de Azure, las API REST y los SDK de Azure. También respalda Foundry IQ, la capa de conocimiento administrada que transforma el contenido empresarial en bases de conocimiento reutilizables y compatibles con permisos para agentes en el portal de Microsoft Foundry.

Este artículo ofrece consejos para ayudarle a empezar a usar el enriquecimiento con IA y los conjuntos de aptitudes que se utilizan durante la indexación.

Consejo 1: Empieza por lo simple y pequeño

El Asistente para importación de datos en Azure Portal admite el enriquecimiento con IA. Sin escribir ningún código, puede crear y examinar todos los objetos usados en una canalización de enriquecimiento: un índice, indexador, origen de datos y conjunto de aptitudes.

Otra manera de empezar simplemente es crear un origen de datos con solo unos pocos documentos o filas en una tabla que sean representativas de los documentos que desea indexar. Un pequeño conjunto de datos es la mejor manera de aumentar la velocidad de búsqueda y solución de problemas. Ejecute su muestra en toda la canalización integral y compruebe que los resultados cumplen sus requisitos. Cuando esté satisfecho con los resultados, estará listo para agregar más archivos al origen de datos.

Recomendación 2: confirme los elementos que funcionan incluso si hay algunos errores

A veces, un pequeño error detiene el proceso del indexador. Esa condición es correcta si tiene previsto corregir problemas uno por uno. Sin embargo, es posible que desee omitir un tipo determinado de error, por lo que el indexador puede continuar y puede ver qué flujos funcionan realmente.

Para pasar por alto los errores durante el desarrollo, establezca maxFailedItems y maxFailedItemsPerBatch en -1 como parte de la definición del indexador.

{
  "parameters": {
    "maxFailedItems": -1,
    "maxFailedItemsPerBatch": -1
  }
}

Nota:

Como práctica recomendada, establezca maxFailedItems y maxFailedItemsPerBatch en 0 para las cargas de trabajo de producción.

Sugerencia 3: Uso de la sesión de depuración para solucionar problemas

La sesión de depuración es un editor visual que muestra el gráfico de dependencias, las entradas y las salidas de un conjunto de aptitudes, así como las definiciones. Carga un único documento fuente de la fuente de datos del indexador con la configuración actual del indexador y del conjunto de aptitudes. A continuación, puede ejecutar todo el conjunto de habilidades, limitado a ese documento. Dentro de una sesión de depuración, puede identificar y resolver errores, validar los cambios y confirmarlos en un conjunto de aptitudes primario. Para ver un tutorial, consulte Tutorial: depuración de sesiones.

Sugerencia 4: El contenido esperado no aparece

Si falta contenido, compruebe si hay documentos descartados en el portal de Azure. En la página del servicio de búsqueda, abra Indexadores, seleccione el indexador y, a continuación, seleccione el valor estado de una ejecución para ver los detalles y los errores de ejecución.

Si el problema está relacionado con el tamaño del archivo, es posible que vea un error como este: "El blob <file-name> tiene un tamaño de <file-size> bytes, lo que supera el tamaño máximo para la extracción de documentos en su nivel de servicio actual". Para obtener más información sobre los límites del indexador, consulte Límites del servicio.

Un segundo motivo para que el contenido no aparezca podría estar relacionado con errores de asignación de entrada y salida. Por ejemplo, el nombre de destino de salida es "Personas", pero el nombre del campo de índice es "personas" en minúsculas. El sistema devuelve 201 mensajes correctos para toda la canalización, por lo que cree que la indexación se realizó correctamente, cuando de hecho un campo está vacío.

Sugerencia 5: ampliar el procesamiento más allá del tiempo de ejecución máximo

El análisis de imágenes es un proceso intensivo a nivel computacional, incluso cuando se trata de casos simples; debido a ello, cuando las imágenes son especialmente grandes o complejas, los tiempos de procesamiento pueden exceder el tiempo máximo permitido.

En el caso de los indexadores que tienen conjuntos de aptitudes, la ejecución del conjunto de aptitudes se limita a 2 horas para la mayoría de los niveles. Si el procesamiento de conjuntos de aptitudes no se completa en ese período, programe el indexador para que se ejecute cada cinco minutos para que pueda reanudar el procesamiento del último documento correcto conocido.

La indexación programada se reanuda en el último documento válido conocido. En una programación recurrente, el indizador puede abrirse camino a través de las imágenes pendientes durante una serie de horas o días, hasta que se procesen todas aquellas imágenes que no estén procesadas. Para obtener más información acerca de la sintaxis de programación, consulte Programación de un indexador.

Nota:

Si se produce un error repetidamente en un indexador programado en el mismo documento, el servicio reduce su frecuencia de ejecución (hasta una vez cada 24 horas) hasta que avanza. Después de corregir el problema subyacente, ejecute el indexador a petición. Si avanza, el indexador vuelve a su intervalo configurado. Si el indexador no vuelve a su programación configurada después de una ejecución correcta, consulte Preguntas más frecuentes sobre el comportamiento de programación.

Sugerencia 6: aumentar del rendimiento de la indexación

Para realizar una indexación paralela, distribuya los datos en varios contenedores o carpetas virtuales múltiples dentro del mismo contenedor. A continuación, cree varios pares de orígenes de datos e indexadores. Todos los indexadores pueden usar el mismo conjunto de aptitudes y escribir en el mismo índice de búsqueda de destino, por lo que la aplicación de búsqueda no necesita conocer esta partición.

Consulte también