Indexes - Analyze
Laat zien hoe een analyse tekst in tokens opbreekt.
POST {endpoint}/indexes('{indexName}')/search.analyze?api-version=2024-03-01-Preview
URI-parameters
| Name | In | Vereist | Type | Description |
|---|---|---|---|---|
|
endpoint
|
path | True |
string |
De eindpunt-URL van de zoekservice. |
|
index
|
path | True |
string |
De naam van de index waarvoor een analyse moet worden getest. |
|
api-version
|
query | True |
string |
Client-API-versie. |
Aanvraagkoptekst
| Name | Vereist | Type | Description |
|---|---|---|---|
| x-ms-client-request-id |
string (uuid) |
De tracerings-id die is verzonden met de aanvraag om hulp te bieden bij foutopsporing. |
Aanvraagbody
| Name | Vereist | Type | Description |
|---|---|---|---|
| text | True |
string |
De tekst die moet worden opgesplitst in tokens. |
| analyzer |
De naam van de analyse die moet worden gebruikt om de opgegeven tekst te verbreken. |
||
| charFilters |
Een optionele lijst met tekenfilters die moeten worden gebruikt bij het verbreken van de opgegeven tekst. |
||
| normalizer |
De naam van de normalisatiefunctie die moet worden gebruikt om de opgegeven tekst te normaliseren. |
||
| tokenFilters |
Een optionele lijst met tokenfilters die moeten worden gebruikt bij het verbreken van de opgegeven tekst. |
||
| tokenizer |
De naam van de tokenizer die moet worden gebruikt om de opgegeven tekst te verbreken. |
Antwoorden
| Name | Type | Description |
|---|---|---|
| 200 OK | ||
| Other Status Codes |
Foutreactie. |
Voorbeelden
SearchServiceIndexAnalyze
Voorbeeldaanvraag
POST https://myservice.search.windows.net/indexes('hotels')/search.analyze?api-version=2024-03-01-Preview
{
"text": "Text to analyze",
"analyzer": "standard.lucene"
}
Voorbeeldrespons
{
"tokens": [
{
"token": "text",
"startOffset": 0,
"endOffset": 4,
"position": 0
},
{
"token": "to",
"startOffset": 5,
"endOffset": 7,
"position": 1
},
{
"token": "analyze",
"startOffset": 8,
"endOffset": 15,
"position": 2
}
]
}
Definities
| Name | Description |
|---|---|
|
Analyzed |
Informatie over een token dat wordt geretourneerd door een analyse. |
|
Analyze |
Hiermee geeft u enkele tekst- en analyseonderdelen op die worden gebruikt om die tekst op te splitsen in tokens. |
|
Analyze |
Het resultaat van het testen van een analyse op tekst. |
|
Char |
Hiermee definieert u de namen van alle tekenfilters die worden ondersteund door de zoekmachine. |
|
Error |
Aanvullende informatie over de resourcebeheerfout. |
|
Error |
De foutdetails. |
|
Error |
Foutreactie |
|
Lexical |
Definieert de namen van alle tekstanalyses die worden ondersteund door de zoekmachine. |
|
Lexical |
Hiermee definieert u de namen van alle tekstnormizers die worden ondersteund door de zoekmachine. |
|
Lexical |
Hiermee definieert u de namen van alle tokenizers die worden ondersteund door de zoekmachine. |
|
Token |
Hiermee definieert u de namen van alle tokenfilters die worden ondersteund door de zoekmachine. |
AnalyzedTokenInfo
Informatie over een token dat wordt geretourneerd door een analyse.
| Name | Type | Description |
|---|---|---|
| endOffset |
integer (int32) |
De index van het laatste teken van het token in de invoertekst. |
| position |
integer (int32) |
De positie van het token in de invoertekst ten opzichte van andere tokens. Het eerste token in de invoertekst heeft positie 0, de volgende heeft positie 1, enzovoort. Afhankelijk van de gebruikte analyse hebben sommige tokens mogelijk dezelfde positie, bijvoorbeeld als ze synoniemen van elkaar zijn. |
| startOffset |
integer (int32) |
De index van het eerste teken van het token in de invoertekst. |
| token |
string |
Het token dat door de analyse wordt geretourneerd. |
AnalyzeRequest
Hiermee geeft u enkele tekst- en analyseonderdelen op die worden gebruikt om die tekst op te splitsen in tokens.
| Name | Type | Description |
|---|---|---|
| analyzer |
De naam van de analyse die moet worden gebruikt om de opgegeven tekst te verbreken. |
|
| charFilters |
Een optionele lijst met tekenfilters die moeten worden gebruikt bij het verbreken van de opgegeven tekst. |
|
| normalizer |
De naam van de normalisatiefunctie die moet worden gebruikt om de opgegeven tekst te normaliseren. |
|
| text |
string |
De tekst die moet worden opgesplitst in tokens. |
| tokenFilters |
Een optionele lijst met tokenfilters die moeten worden gebruikt bij het verbreken van de opgegeven tekst. |
|
| tokenizer |
De naam van de tokenizer die moet worden gebruikt om de opgegeven tekst te verbreken. |
AnalyzeResult
Het resultaat van het testen van een analyse op tekst.
| Name | Type | Description |
|---|---|---|
| tokens |
De lijst met tokens die worden geretourneerd door de analyse die is opgegeven in de aanvraag. |
CharFilterName
Hiermee definieert u de namen van alle tekenfilters die worden ondersteund door de zoekmachine.
| Waarde | Description |
|---|---|
| html_strip |
Een tekenfilter waarmee HTML-constructies worden verwijderd. Zie https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html |
ErrorAdditionalInfo
Aanvullende informatie over de resourcebeheerfout.
| Name | Type | Description |
|---|---|---|
| info |
object |
De aanvullende informatie. |
| type |
string |
Het extra informatietype. |
ErrorDetail
De foutdetails.
| Name | Type | Description |
|---|---|---|
| additionalInfo |
De fout bevat aanvullende informatie. |
|
| code |
string |
De foutcode. |
| details |
De foutdetails. |
|
| message |
string |
Het foutbericht. |
| target |
string |
Het foutdoel. |
ErrorResponse
Foutreactie
| Name | Type | Description |
|---|---|---|
| error |
Het foutobject. |
LexicalAnalyzerName
Definieert de namen van alle tekstanalyses die worden ondersteund door de zoekmachine.
| Waarde | Description |
|---|---|
| ar.microsoft |
Microsoft Analyzer voor Arabisch. |
| ar.lucene |
Lucene analyzer voor Arabisch. |
| hy.lucene |
Lucene analyzer voor Armeens. |
| bn.microsoft |
Microsoft Analyzer voor Bangla. |
| eu.lucene |
Lucene analyzer voor Baskisch. |
| bg.microsoft |
Microsoft Analyzer voor Bulgaars. |
| bg.lucene |
Lucene analyzer voor Bulgaars. |
| ca.microsoft |
Microsoft Analyzer voor Catalaans. |
| ca.lucene |
Lucene analyzer voor Catalaans. |
| zh-Hans.microsoft |
Microsoft Analyzer voor Chinees (vereenvoudigd). |
| zh-Hans.lucene |
Lucene Analyzer voor Chinees (vereenvoudigd). |
| zh-Hant.microsoft |
Microsoft Analyzer voor Chinees (traditioneel). |
| zh-Hant.lucene |
Lucene analyzer voor Chinees (traditioneel). |
| hr.microsoft |
Microsoft Analyzer voor Kroatisch. |
| cs.microsoft |
Microsoft Analyzer voor Tsjechisch. |
| cs.lucene |
Lucene Analyzer voor Tsjechisch. |
| da.microsoft |
Microsoft Analyzer voor Deens. |
| da.lucene |
Lucene analyzer voor Deens. |
| nl.microsoft |
Microsoft Analyzer voor Nederlands. |
| nl.lucene |
Lucene Analyzer voor Nederlands. |
| en.microsoft |
Microsoft Analyzer voor Engels. |
| en.lucene |
Lucene analyzer voor Engels. |
| et.microsoft |
Microsoft Analyzer voor Ests. |
| fi.microsoft |
Microsoft Analyzer voor Fins. |
| fi.lucene |
Lucene analyzer voor Fins. |
| fr.microsoft |
Microsoft Analyzer voor Frans. |
| fr.lucene |
Lucene Analyzer voor Frans. |
| gl.lucene |
Lucene analyzer voor Galicisch. |
| de.microsoft |
Microsoft Analyzer voor Duits. |
| de.lucene |
Lucene analyzer voor Duits. |
| el.microsoft |
Microsoft Analyzer voor Grieks. |
| el.lucene |
Lucene analyzer voor Grieks. |
| gu.microsoft |
Microsoft Analyzer voor Gujarati. |
| he.microsoft |
Microsoft Analyzer voor Hebreeuws. |
| hi.microsoft |
Microsoft Analyzer voor Hindi. |
| hi.lucene |
Lucene Analyzer voor Hindi. |
| hu.microsoft |
Microsoft Analyzer voor Hongaars. |
| hu.lucene |
Lucene analyzer voor Hongaars. |
| is.microsoft |
Microsoft Analyzer voor IJslands. |
| id.microsoft |
Microsoft Analyzer voor Indonesisch (Bahasa). |
| id.lucene |
Lucene analyzer voor Indonesisch. |
| ga.lucene |
Lucene analyzer voor Iers. |
| it.microsoft |
Microsoft Analyzer voor Italiaans. |
| it.lucene |
Lucene analyzer voor Italiaans. |
| ja.microsoft |
Microsoft Analyzer voor Japans. |
| ja.lucene |
Lucene Analyzer voor Japans. |
| kn.microsoft |
Microsoft Analyzer voor Kannada. |
| ko.microsoft |
Microsoft Analyzer voor Koreaans. |
| ko.lucene |
Lucene analyzer voor Koreaans. |
| lv.microsoft |
Microsoft Analyzer voor Lets. |
| lv.lucene |
Lucene analyzer voor Letland. |
| lt.microsoft |
Microsoft Analyzer voor Litouws. |
| ml.microsoft |
Microsoft Analyzer voor Malayalam. |
| ms.microsoft |
Microsoft Analyzer voor Maleis (Latijns). |
| mr.microsoft |
Microsoft Analyzer voor Marathi. |
| nb.microsoft |
Microsoft Analyzer voor Noors (Bokmål). |
| no.lucene |
Lucene analyzer voor Noors. |
| fa.lucene |
Lucene analyzer voor Perzisch. |
| pl.microsoft |
Microsoft Analyzer voor Pools. |
| pl.lucene |
Lucene Analyzer voor Pools. |
| pt-BR.microsoft |
Microsoft Analyzer voor Portugees (Brazilië). |
| pt-BR.lucene |
Lucene analyzer voor Portugees (Brazilië). |
| pt-PT.microsoft |
Microsoft Analyzer voor Portugees (Portugal). |
| pt-PT.lucene |
Lucene analyzer voor Portugees (Portugal). |
| pa.microsoft |
Microsoft Analyzer voor Punjabi. |
| ro.microsoft |
Microsoft Analyzer voor Roemeens. |
| ro.lucene |
Lucene analyzer voor Roemeens. |
| ru.microsoft |
Microsoft Analyzer voor Russisch. |
| ru.lucene |
Lucene analyzer voor Russisch. |
| sr-cyrillic.microsoft |
Microsoft Analyzer voor Servisch (Cyrillisch). |
| sr-latin.microsoft |
Microsoft Analyzer voor Servisch (Latijns). |
| sk.microsoft |
Microsoft Analyzer voor Slowaaks. |
| sl.microsoft |
Microsoft Analyzer voor Slovenië. |
| es.microsoft |
Microsoft Analyzer voor Spaans. |
| es.lucene |
Lucene analyzer voor Spaans. |
| sv.microsoft |
Microsoft Analyzer voor Zweeds. |
| sv.lucene |
Lucene analyzer voor Zweeds. |
| ta.microsoft |
Microsoft Analyzer voor Tamil. |
| te.microsoft |
Microsoft Analyzer voor Telugu. |
| th.microsoft |
Microsoft Analyzer voor Thai. |
| th.lucene |
Lucene analyzer voor Thai. |
| tr.microsoft |
Microsoft Analyzer voor Turks. |
| tr.lucene |
Lucene analyzer voor Turks. |
| uk.microsoft |
Microsoft Analyzer voor Oekraïens. |
| ur.microsoft |
Microsoft Analyzer voor Urdu. |
| vi.microsoft |
Microsoft Analyzer voor Vietnamees. |
| standard.lucene |
Standaard Lucene Analyzer. |
| standardasciifolding.lucene |
Standard ASCII Folding Lucene Analyzer. Zie https://docs.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers |
| keyword |
Behandelt de volledige inhoud van een veld als één token. Dit is handig voor gegevens zoals postcodes, id's en sommige productnamen. Zie http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html |
| pattern |
Scheidt tekst flexibel in termen via een normaal expressiepatroon. Zie http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html |
| simple |
Verdeelt tekst bij niet-letters en converteert deze naar kleine letters. Zie http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html |
| stop |
Verdeelt tekst bij niet-letters; Hiermee past u de tokenfilters voor kleine letters en stopworden toe. Zie http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html |
| whitespace |
Een analyse die gebruikmaakt van de whitespace-tokenizer. Zie http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html |
LexicalNormalizerName
Hiermee definieert u de namen van alle tekstnormizers die worden ondersteund door de zoekmachine.
| Waarde | Description |
|---|---|
| asciifolding |
Converteert alfabetische, numerieke en symbolische Unicode-tekens die zich niet in de eerste 127 ASCII-tekens (het Unicode-blok Basis latijns) bevinden in hun ASCII-equivalenten, als dergelijke equivalenten bestaan. Zie http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html |
| elision |
Verwijdert elisions. "l'avion" (het vliegtuig) wordt bijvoorbeeld geconverteerd naar "avion" (vliegtuig). Zie http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html |
| lowercase |
Hiermee normaliseert u tokentekst in kleine letters. Zie https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html |
| standard |
Standaard normalizer, die bestaat uit kleine letters en asciifolding. Zie http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html |
| uppercase |
Normaliseert tokentekst naar hoofdletters. Zie https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html |
LexicalTokenizerName
Hiermee definieert u de namen van alle tokenizers die worden ondersteund door de zoekmachine.
TokenFilterName
Hiermee definieert u de namen van alle tokenfilters die worden ondersteund door de zoekmachine.