Indexes - Analyze
Zeigt, wie ein Analyzer Text in Token umbricht.
POST {endpoint}/indexes('{indexName}')/search.analyze?api-version=2023-11-01
URI-Parameter
| Name | In | Erforderlich | Typ | Beschreibung |
|---|---|---|---|---|
|
endpoint
|
path | True |
string |
Die Endpunkt-URL des Suchdiensts. |
|
index
|
path | True |
string |
Der Name des Indexes, für den ein Analyzer getestet werden soll. |
|
api-version
|
query | True |
string |
Client-API-Version. |
Anforderungsheader
| Name | Erforderlich | Typ | Beschreibung |
|---|---|---|---|
| x-ms-client-request-id |
string (uuid) |
Die Tracking-ID, die mit der Anforderung gesendet wurde, um beim Debuggen zu helfen. |
Anforderungstext
| Name | Erforderlich | Typ | Beschreibung |
|---|---|---|---|
| text | True |
string |
Der Text, der in Token unterteilt werden soll. |
| analyzer |
Der Name des Analyzers, der verwendet werden soll, um den angegebenen Text zu unterbrechen. Wenn dieser Parameter nicht angegeben ist, müssen Sie stattdessen einen Tokenizer angeben. Die Tokenizer- und Analyseparameter schließen sich gegenseitig aus. |
||
| charFilters |
Eine optionale Liste von Zeichenfiltern, die beim Unterbrechen des angegebenen Texts verwendet werden sollen. Dieser Parameter kann nur bei Verwendung des Tokenizerparameters festgelegt werden. |
||
| tokenFilters |
Eine optionale Liste der Tokenfilter, die beim Unterbrechen des angegebenen Texts verwendet werden sollen. Dieser Parameter kann nur bei Verwendung des Tokenizerparameters festgelegt werden. |
||
| tokenizer |
Der Name des Tokenizers, der zum Unterbrechen des angegebenen Texts verwendet werden soll. Wenn dieser Parameter nicht angegeben ist, müssen Sie stattdessen einen Analyzer angeben. Die Tokenizer- und Analyseparameter schließen sich gegenseitig aus. |
Antworten
| Name | Typ | Beschreibung |
|---|---|---|
| 200 OK | ||
| Other Status Codes |
Fehlerantwort. |
Beispiele
SearchServiceIndexAnalyze
Beispielanforderung
POST https://myservice.search.windows.net/indexes('hotels')/search.analyze?api-version=2023-11-01
{
"text": "Text to analyze",
"analyzer": "standard.lucene"
}
Beispiel für eine Antwort
{
"tokens": [
{
"token": "text",
"startOffset": 0,
"endOffset": 4,
"position": 0
},
{
"token": "to",
"startOffset": 5,
"endOffset": 7,
"position": 1
},
{
"token": "analyze",
"startOffset": 8,
"endOffset": 15,
"position": 2
}
]
}
Definitionen
| Name | Beschreibung |
|---|---|
|
Analyzed |
Informationen zu einem token, das von einem Analyzer zurückgegeben wird. |
|
Analyze |
Gibt einige Text- und Analysekomponenten an, die zum Aufteilen dieses Texts in Token verwendet werden. |
|
Analyze |
Das Ergebnis des Tests eines Analyzers auf Text. |
|
Char |
Definiert die Namen aller Zeichenfilter, die von der Suchmaschine unterstützt werden. |
|
Lexical |
Definiert die Namen aller textanalysatoren, die von der Suchmaschine unterstützt werden. |
|
Lexical |
Definiert die Namen aller Tokenizer, die von der Suchmaschine unterstützt werden. |
|
Search |
Beschreibt eine Fehlerbedingung für die API. |
|
Token |
Definiert die Namen aller Tokenfilter, die von der Suchmaschine unterstützt werden. |
AnalyzedTokenInfo
Informationen zu einem token, das von einem Analyzer zurückgegeben wird.
| Name | Typ | Beschreibung |
|---|---|---|
| endOffset |
integer (int32) |
Der Index des letzten Zeichens des Tokens im Eingabetext. |
| position |
integer (int32) |
Die Position des Tokens im Eingabetext relativ zu anderen Token. Das erste Token im Eingabetext hat Position 0, die nächste hat Position 1 usw. Abhängig von der verwendeten Analyse haben einige Token möglicherweise dieselbe Position, z. B. wenn sie Synonyme voneinander sind. |
| startOffset |
integer (int32) |
Der Index des ersten Zeichens des Tokens im Eingabetext. |
| token |
string |
Das vom Analyzer zurückgegebene Token. |
AnalyzeRequest
Gibt einige Text- und Analysekomponenten an, die zum Aufteilen dieses Texts in Token verwendet werden.
| Name | Typ | Beschreibung |
|---|---|---|
| analyzer |
Der Name des Analyzers, der verwendet werden soll, um den angegebenen Text zu unterbrechen. Wenn dieser Parameter nicht angegeben ist, müssen Sie stattdessen einen Tokenizer angeben. Die Tokenizer- und Analyseparameter schließen sich gegenseitig aus. |
|
| charFilters |
Eine optionale Liste von Zeichenfiltern, die beim Unterbrechen des angegebenen Texts verwendet werden sollen. Dieser Parameter kann nur bei Verwendung des Tokenizerparameters festgelegt werden. |
|
| text |
string |
Der Text, der in Token unterteilt werden soll. |
| tokenFilters |
Eine optionale Liste der Tokenfilter, die beim Unterbrechen des angegebenen Texts verwendet werden sollen. Dieser Parameter kann nur bei Verwendung des Tokenizerparameters festgelegt werden. |
|
| tokenizer |
Der Name des Tokenizers, der zum Unterbrechen des angegebenen Texts verwendet werden soll. Wenn dieser Parameter nicht angegeben ist, müssen Sie stattdessen einen Analyzer angeben. Die Tokenizer- und Analyseparameter schließen sich gegenseitig aus. |
AnalyzeResult
Das Ergebnis des Tests eines Analyzers auf Text.
| Name | Typ | Beschreibung |
|---|---|---|
| tokens |
Die Liste der Token, die von der in der Anforderung angegebenen Analyse zurückgegeben werden. |
CharFilterName
Definiert die Namen aller Zeichenfilter, die von der Suchmaschine unterstützt werden.
| Wert | Beschreibung |
|---|---|
| html_strip |
Ein Zeichenfilter, der versucht, HTML-Konstrukte zu entfernen. Siehe https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html. |
LexicalAnalyzerName
Definiert die Namen aller textanalysatoren, die von der Suchmaschine unterstützt werden.
| Wert | Beschreibung |
|---|---|
| ar.microsoft |
Microsoft Analyzer für Arabisch. |
| ar.lucene |
Lucene Analyzer für Arabisch. |
| hy.lucene |
Lucene Analyzer für Armenier. |
| bn.microsoft |
Microsoft Analyzer für Bangla. |
| eu.lucene |
Lucene Analyzer für Baskisch. |
| bg.microsoft |
Microsoft Analyzer für Bulgarisch. |
| bg.lucene |
Lucene Analyzer für Bulgarisch. |
| ca.microsoft |
Microsoft Analyzer für Katalanisch. |
| ca.lucene |
Lucene Analyzer für Katalanisch. |
| zh-Hans.microsoft |
Microsoft Analyzer für Chinesisch (vereinfacht). |
| zh-Hans.lucene |
Lucene Analyzer für Chinesisch (vereinfacht). |
| zh-Hant.microsoft |
Microsoft Analyzer für Chinesisch (traditionell). |
| zh-Hant.lucene |
Lucene Analyzer für Chinesisch (traditionell). |
| hr.microsoft |
Microsoft Analyzer für Kroatisch. |
| cs.microsoft |
Microsoft Analyzer für Tschechisch. |
| cs.lucene |
Lucene Analyzer für Tschechisch. |
| da.microsoft |
Microsoft Analyzer für Dänisch. |
| da.lucene |
Lucene Analyzer für Dänisch. |
| nl.microsoft |
Microsoft Analyzer für Niederländisch. |
| nl.lucene |
Lucene Analyzer für Niederländisch. |
| en.microsoft |
Microsoft Analyzer für Englisch. |
| en.lucene |
Lucene Analyzer für Englisch. |
| et.microsoft |
Microsoft Analyzer für Estland. |
| fi.microsoft |
Microsoft Analyzer für Finnisch. |
| fi.lucene |
Lucene Analyzer für Finnisch. |
| fr.microsoft |
Microsoft Analyzer für Französisch. |
| fr.lucene |
Lucene Analyzer für Französisch. |
| gl.lucene |
Lucene Analyzer für Galizien. |
| de.microsoft |
Microsoft Analyzer für Deutsch. |
| de.lucene |
Lucene Analyzer für Deutsch. |
| el.microsoft |
Microsoft Analyzer für Griechisch. |
| el.lucene |
Lucene Analyzer für Griechisch. |
| gu.microsoft |
Microsoft Analyzer für Gujarati. |
| he.microsoft |
Microsoft Analyzer für Hebräisch. |
| hi.microsoft |
Microsoft Analyzer für Hindi. |
| hi.lucene |
Lucene Analyzer für Hindi. |
| hu.microsoft |
Microsoft Analyzer für Ungarisch. |
| hu.lucene |
Lucene Analyzer für Ungarisch. |
| is.microsoft |
Microsoft Analyzer für Island. |
| id.microsoft |
Microsoft Analyzer für Indonesien (Bahasa). |
| id.lucene |
Lucene Analyzer für Indonesisch. |
| ga.lucene |
Lucene Analyzer für Irisch. |
| it.microsoft |
Microsoft Analyzer für Italienisch. |
| it.lucene |
Lucene Analyzer für Italienisch. |
| ja.microsoft |
Microsoft Analyzer für Japanisch. |
| ja.lucene |
Lucene Analyzer für Japanisch. |
| kn.microsoft |
Microsoft Analyzer für Kannada. |
| ko.microsoft |
Microsoft Analyzer für Koreanisch. |
| ko.lucene |
Lucene Analyzer für Koreanisch. |
| lv.microsoft |
Microsoft Analyzer für Lettisch. |
| lv.lucene |
Lucene Analyzer für Lettisch. |
| lt.microsoft |
Microsoft Analyzer für Litauisch. |
| ml.microsoft |
Microsoft Analyzer für Malayalam. |
| ms.microsoft |
Microsoft Analyzer für Malaiisch (Lateinisch). |
| mr.microsoft |
Microsoft Analyzer für Marathi. |
| nb.microsoft |
Microsoft Analyzer für Norwegisch (Bokmål). |
| no.lucene |
Lucene Analyzer für Norwegisch. |
| fa.lucene |
Lucene Analyzer für Persisch. |
| pl.microsoft |
Microsoft Analyzer für Polnisch. |
| pl.lucene |
Lucene Analyzer für Polnisch. |
| pt-BR.microsoft |
Microsoft Analyzer für Portugiesisch (Brasilien). |
| pt-BR.lucene |
Lucene Analyzer für Portugiesisch (Brasilien). |
| pt-PT.microsoft |
Microsoft Analyzer für Portugiesisch (Portugal). |
| pt-PT.lucene |
Lucene Analyzer für Portugiesisch (Portugal). |
| pa.microsoft |
Microsoft Analyzer für Punjabi. |
| ro.microsoft |
Microsoft Analyzer für Rumänisch. |
| ro.lucene |
Lucene Analyzer für Rumänisch. |
| ru.microsoft |
Microsoft Analyzer für Russisch. |
| ru.lucene |
Lucene Analyzer für Russisch. |
| sr-cyrillic.microsoft |
Microsoft Analyzer für Serbisch (Kyrillisch). |
| sr-latin.microsoft |
Microsoft Analyzer für Serbisch (Lateinisch). |
| sk.microsoft |
Microsoft Analyzer für Slowakisch. |
| sl.microsoft |
Microsoft Analyzer für Slowenisch. |
| es.microsoft |
Microsoft Analyzer für Spanisch. |
| es.lucene |
Lucene Analyzer für Spanisch. |
| sv.microsoft |
Microsoft Analyzer für Schwedisch. |
| sv.lucene |
Lucene Analyzer für Schwedisch. |
| ta.microsoft |
Microsoft Analyzer für Tamil. |
| te.microsoft |
Microsoft Analyzer für Telugu. |
| th.microsoft |
Microsoft Analyzer für Thailändisch. |
| th.lucene |
Lucene Analyzer für Thai. |
| tr.microsoft |
Microsoft Analyzer für Türkisch. |
| tr.lucene |
Lucene Analyzer für Türkisch. |
| uk.microsoft |
Microsoft Analyzer für Ukrainisch. |
| ur.microsoft |
Microsoft Analyzer für Urdu. |
| vi.microsoft |
Microsoft Analyzer für Vietnamesisch. |
| standard.lucene |
Standard Lucene Analyzer. |
| standardasciifolding.lucene |
Standard ASCII Folding Lucene Analyzer. Siehe https://docs.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers. |
| keyword |
Behandelt den gesamten Inhalt eines Felds als einzelnes Token. Dies ist nützlich für Daten wie Postleitzahlen, IDs und einige Produktnamen. Siehe http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html. |
| pattern |
Trennt Text flexibel in Ausdrücke über ein Muster mit regulären Ausdrücken. Siehe http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html. |
| simple |
Dividiert Text in Nichtbuchstaben und wandelt sie in Kleinbuchstaben um. Siehe http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html. |
| stop |
Dividiert Text in Nichtbuchstaben; Wendet die Tokenfilter in Kleinbuchstaben und Stoppwörtern an. Siehe http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html. |
| whitespace |
Ein Analyzer, der den Leerraumtokenizer verwendet. Siehe http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html. |
LexicalTokenizerName
Definiert die Namen aller Tokenizer, die von der Suchmaschine unterstützt werden.
SearchError
Beschreibt eine Fehlerbedingung für die API.
| Name | Typ | Beschreibung |
|---|---|---|
| code |
string |
Eine serverdefinierte Gruppe von Fehlercodes. |
| details |
Ein Array von Details zu bestimmten Fehlern, die zu diesem gemeldeten Fehler geführt haben. |
|
| message |
string |
Eine lesbare Darstellung des Fehlers. |
TokenFilterName
Definiert die Namen aller Tokenfilter, die von der Suchmaschine unterstützt werden.