Indexes - Analyze
Muestra cómo un analizador divide el texto en tokens.
POST {endpoint}/indexes('{indexName}')/search.analyze?api-version=2024-03-01-Preview
Parámetros de identificador URI
| Nombre | En | Requerido | Tipo | Description |
|---|---|---|---|---|
|
endpoint
|
path | True |
string |
Dirección URL del punto de conexión del servicio de búsqueda. |
|
index
|
path | True |
string |
Nombre del índice para el que se va a probar un analizador. |
|
api-version
|
query | True |
string |
Versión de api de cliente. |
Encabezado de la solicitud
| Nombre | Requerido | Tipo | Description |
|---|---|---|---|
| x-ms-client-request-id |
string (uuid) |
Identificador de seguimiento enviado con la solicitud para ayudar con la depuración. |
Cuerpo de la solicitud
| Nombre | Requerido | Tipo | Description |
|---|---|---|---|
| text | True |
string |
Texto que se va a dividir en tokens. |
| analyzer |
Nombre del analizador que se va a usar para interrumpir el texto especificado. |
||
| charFilters |
Lista opcional de filtros de caracteres que se usarán al interrumpir el texto especificado. |
||
| normalizer |
Nombre del normalizador que se va a usar para normalizar el texto especificado. |
||
| tokenFilters |
Una lista opcional de filtros de token que se usarán al interrumpir el texto especificado. |
||
| tokenizer |
Nombre del tokenizador que se va a usar para interrumpir el texto especificado. |
Respuestas
| Nombre | Tipo | Description |
|---|---|---|
| 200 OK | ||
| Other Status Codes |
Respuesta de error. |
Ejemplos
SearchServiceIndexAnalyze
Solicitud de ejemplo
POST https://myservice.search.windows.net/indexes('hotels')/search.analyze?api-version=2024-03-01-Preview
{
"text": "Text to analyze",
"analyzer": "standard.lucene"
}
Respuesta de muestra
{
"tokens": [
{
"token": "text",
"startOffset": 0,
"endOffset": 4,
"position": 0
},
{
"token": "to",
"startOffset": 5,
"endOffset": 7,
"position": 1
},
{
"token": "analyze",
"startOffset": 8,
"endOffset": 15,
"position": 2
}
]
}
Definiciones
| Nombre | Description |
|---|---|
|
Analyzed |
Información sobre un token devuelto por un analizador. |
|
Analyze |
Especifica algunos componentes de texto y análisis que se usan para dividir ese texto en tokens. |
|
Analyze |
Resultado de probar un analizador en el texto. |
|
Char |
Define los nombres de todos los filtros de caracteres admitidos por el motor de búsqueda. |
|
Error |
Información adicional sobre el error de administración de recursos. |
|
Error |
Detalle del error. |
|
Error |
Respuesta de error |
|
Lexical |
Define los nombres de todos los analizadores de texto admitidos por el motor de búsqueda. |
|
Lexical |
Define los nombres de todos los normalizadores de texto admitidos por el motor de búsqueda. |
|
Lexical |
Define los nombres de todos los tokenizadores admitidos por el motor de búsqueda. |
|
Token |
Define los nombres de todos los filtros de token admitidos por el motor de búsqueda. |
AnalyzedTokenInfo
Información sobre un token devuelto por un analizador.
| Nombre | Tipo | Description |
|---|---|---|
| endOffset |
integer (int32) |
Índice del último carácter del token en el texto de entrada. |
| position |
integer (int32) |
Posición del token en el texto de entrada en relación con otros tokens. El primer token del texto de entrada tiene la posición 0, la siguiente tiene la posición 1, etc. Dependiendo del analizador usado, algunos tokens podrían tener la misma posición, por ejemplo, si son sinónimos entre sí. |
| startOffset |
integer (int32) |
Índice del primer carácter del token en el texto de entrada. |
| token |
string |
Token devuelto por el analizador. |
AnalyzeRequest
Especifica algunos componentes de texto y análisis que se usan para dividir ese texto en tokens.
| Nombre | Tipo | Description |
|---|---|---|
| analyzer |
Nombre del analizador que se va a usar para interrumpir el texto especificado. |
|
| charFilters |
Lista opcional de filtros de caracteres que se usarán al interrumpir el texto especificado. |
|
| normalizer |
Nombre del normalizador que se va a usar para normalizar el texto especificado. |
|
| text |
string |
Texto que se va a dividir en tokens. |
| tokenFilters |
Una lista opcional de filtros de token que se usarán al interrumpir el texto especificado. |
|
| tokenizer |
Nombre del tokenizador que se va a usar para interrumpir el texto especificado. |
AnalyzeResult
Resultado de probar un analizador en el texto.
| Nombre | Tipo | Description |
|---|---|---|
| tokens |
Lista de tokens devueltos por el analizador especificado en la solicitud. |
CharFilterName
Define los nombres de todos los filtros de caracteres admitidos por el motor de búsqueda.
| Valor | Description |
|---|---|
| html_strip |
Filtro de caracteres que intenta quitar construcciones HTML. Vea https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html. |
ErrorAdditionalInfo
Información adicional sobre el error de administración de recursos.
| Nombre | Tipo | Description |
|---|---|---|
| info |
object |
Información adicional. |
| type |
string |
Tipo de información adicional. |
ErrorDetail
Detalle del error.
| Nombre | Tipo | Description |
|---|---|---|
| additionalInfo |
Información adicional del error. |
|
| code |
string |
Código de error. |
| details |
Detalles del error. |
|
| message |
string |
Mensaje de error. |
| target |
string |
Destino del error. |
ErrorResponse
Respuesta de error
| Nombre | Tipo | Description |
|---|---|---|
| error |
Objeto de error. |
LexicalAnalyzerName
Define los nombres de todos los analizadores de texto admitidos por el motor de búsqueda.
| Valor | Description |
|---|---|
| ar.microsoft |
Analizador de Microsoft para árabe. |
| ar.lucene |
Analizador de Lucene para árabe. |
| hy.lucene |
Analizador de Lucene para Armenio. |
| bn.microsoft |
Analizador de Microsoft para Bangla. |
| eu.lucene |
Analizador de Lucene para Euskera. |
| bg.microsoft |
Analizador de Microsoft para búlgaro. |
| bg.lucene |
Analizador de Lucene para Búlgaro. |
| ca.microsoft |
Analizador de Microsoft para catalán. |
| ca.lucene |
Analizador de Lucene para Catalán. |
| zh-Hans.microsoft |
Analizador de Microsoft para chino (simplificado). |
| zh-Hans.lucene |
Analizador de Lucene para chino (simplificado). |
| zh-Hant.microsoft |
Analizador de Microsoft para chino (tradicional). |
| zh-Hant.lucene |
Analizador de Lucene para chino (tradicional). |
| hr.microsoft |
Analizador de Microsoft para croata. |
| cs.microsoft |
Analizador de Microsoft para Checo. |
| cs.lucene |
Analizador de Lucene para Checo. |
| da.microsoft |
Analizador de Microsoft para danés. |
| da.lucene |
Analizador de Lucene para danés. |
| nl.microsoft |
Analizador de Microsoft para neerlandés. |
| nl.lucene |
Analizador de Lucene para neerlandés. |
| en.microsoft |
Analizador de Microsoft para inglés. |
| en.lucene |
Analizador de Lucene para inglés. |
| et.microsoft |
Analizador de Microsoft para Estonia. |
| fi.microsoft |
Analizador de Microsoft para finés. |
| fi.lucene |
Analizador de Lucene para finés. |
| fr.microsoft |
Analizador de Microsoft para francés. |
| fr.lucene |
Analizador de Lucene para francés. |
| gl.lucene |
Analizador de Lucene para Gallega. |
| de.microsoft |
Analizador de Microsoft para alemán. |
| de.lucene |
Analizador de Lucene para alemán. |
| el.microsoft |
Analizador de Microsoft para griego. |
| el.lucene |
Analizador de Lucene para griego. |
| gu.microsoft |
Analizador de Microsoft para Gujarati. |
| he.microsoft |
Analizador de Microsoft para hebreo. |
| hi.microsoft |
Analizador de Microsoft para hindi. |
| hi.lucene |
Analizador de Lucene para hindi. |
| hu.microsoft |
Analizador de Microsoft para húngaro. |
| hu.lucene |
Analizador de Lucene para húngaro. |
| is.microsoft |
Analizador de Microsoft para Islandés. |
| id.microsoft |
Analizador de Microsoft para Indonesia (Bahasa). |
| id.lucene |
Analizador de Lucene para Indonesia. |
| ga.lucene |
Analizador de Lucene para irlandés. |
| it.microsoft |
Analizador de Microsoft para italiano. |
| it.lucene |
Analizador de Lucene para italiano. |
| ja.microsoft |
Analizador de Microsoft para japonés. |
| ja.lucene |
Analizador de Lucene para japonés. |
| kn.microsoft |
Analizador de Microsoft para Kannada. |
| ko.microsoft |
Analizador de Microsoft para coreano. |
| ko.lucene |
Analizador de Lucene para coreano. |
| lv.microsoft |
Analizador de Microsoft para Letonia. |
| lv.lucene |
Analizador de Lucene para Letón. |
| lt.microsoft |
Analizador de Microsoft para Lituano. |
| ml.microsoft |
Analizador de Microsoft para Malayalam. |
| ms.microsoft |
Analizador de Microsoft para malayo (latino). |
| mr.microsoft |
Analizador de Microsoft para Marathi. |
| nb.microsoft |
Analizador de Microsoft para noruego (Bokmål). |
| no.lucene |
Analizador de Lucene para Noruego. |
| fa.lucene |
Analizador de Lucene para persa. |
| pl.microsoft |
Analizador de Microsoft para polaco. |
| pl.lucene |
Analizador de Lucene para polaco. |
| pt-BR.microsoft |
Analizador de Microsoft para portugués (Brasil). |
| pt-BR.lucene |
Analizador de Lucene para portugués (Brasil). |
| pt-PT.microsoft |
Analizador de Microsoft para portugués (Portugal). |
| pt-PT.lucene |
Analizador de Lucene para portugués (Portugal). |
| pa.microsoft |
Analizador de Microsoft para Punjabi. |
| ro.microsoft |
Analizador de Microsoft para rumano. |
| ro.lucene |
Analizador de Lucene para rumano. |
| ru.microsoft |
Analizador de Microsoft para ruso. |
| ru.lucene |
Analizador de Lucene para ruso. |
| sr-cyrillic.microsoft |
Analizador de Microsoft para serbio (cirílico). |
| sr-latin.microsoft |
Analizador de Microsoft para serbio (latino). |
| sk.microsoft |
Analizador de Microsoft para Eslovaco. |
| sl.microsoft |
Analizador de Microsoft para esloveno. |
| es.microsoft |
Analizador de Microsoft para español. |
| es.lucene |
Analizador de Lucene para español. |
| sv.microsoft |
Analizador de Microsoft para sueco. |
| sv.lucene |
Analizador de Lucene para sueco. |
| ta.microsoft |
Analizador de Microsoft para Tamil. |
| te.microsoft |
Analizador de Microsoft para Telugu. |
| th.microsoft |
Analizador de Microsoft para tailandés. |
| th.lucene |
Analizador de Lucene para Tailandés. |
| tr.microsoft |
Analizador de Microsoft para turco. |
| tr.lucene |
Analizador de Lucene para turco. |
| uk.microsoft |
Analizador de Microsoft para Ucrania. |
| ur.microsoft |
Analizador de Microsoft para Urdu. |
| vi.microsoft |
Analizador de Microsoft para vietnamita. |
| standard.lucene |
Analizador estándar de Lucene. |
| standardasciifolding.lucene |
Analizador estándar de Lucene plegado ASCII. Vea https://docs.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers. |
| keyword |
Trata todo el contenido de un campo como un solo token. Esto es útil para datos como códigos postales, identificadores y algunos nombres de producto. Vea http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html. |
| pattern |
Separa de forma flexible el texto en términos a través de un patrón de expresión regular. Vea http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html. |
| simple |
Divide el texto en minúsculas y los convierte en minúsculas. Vea http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html. |
| stop |
Divide el texto en letras no letras; Aplica los filtros de token en minúsculas y palabras irrelevantes. Vea http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html. |
| whitespace |
Analizador que usa el tokenizador de espacio en blanco. Vea http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html. |
LexicalNormalizerName
Define los nombres de todos los normalizadores de texto admitidos por el motor de búsqueda.
LexicalTokenizerName
Define los nombres de todos los tokenizadores admitidos por el motor de búsqueda.
TokenFilterName
Define los nombres de todos los filtros de token admitidos por el motor de búsqueda.