Indexes - Analyze

Ukazuje, jak analyzátor rozdělí text na tokeny.

POST {endpoint}/indexes('{indexName}')/search.analyze?api-version=2023-11-01

Parametry identifikátoru URI

Name V Vyžadováno Typ Description
endpoint
path True

string

Adresa URL koncového bodu vyhledávací služby.

indexName
path True

string

Název indexu, pro který se má testovat analyzátor.

api-version
query True

string

Verze rozhraní API klienta.

Hlavička požadavku

Name Vyžadováno Typ Description
x-ms-client-request-id

string (uuid)

ID sledování odeslané s požadavkem, které vám pomůže s laděním.

Text požadavku

Name Vyžadováno Typ Description
text True

string

Text, který se má rozdělit na tokeny.

analyzer

LexicalAnalyzerName

Název analyzátoru, který se má použít k přerušení daného textu. Pokud tento parametr není zadaný, musíte místo toho zadat tokenizátor. Parametry tokenizátoru a analyzátoru se vzájemně vylučují.

charFilters

CharFilterName[]

Volitelný seznam filtrů znaků, které se mají použít při přerušení daného textu. Tento parametr lze nastavit pouze při použití parametru tokenizátoru.

tokenFilters

TokenFilterName[]

Volitelný seznam filtrů tokenů, které se mají použít při přerušení daného textu. Tento parametr lze nastavit pouze při použití parametru tokenizátoru.

tokenizer

LexicalTokenizerName

Název tokenizátoru, který se má použít k přerušení daného textu. Pokud tento parametr není zadaný, musíte místo toho zadat analyzátor. Parametry tokenizátoru a analyzátoru se vzájemně vylučují.

Odpovědi

Name Typ Description
200 OK

AnalyzeResult

Other Status Codes

SearchError

Chybová odpověď.

Příklady

SearchServiceIndexAnalyze

Ukázkový požadavek

POST https://myservice.search.windows.net/indexes('hotels')/search.analyze?api-version=2023-11-01

{
  "text": "Text to analyze",
  "analyzer": "standard.lucene"
}

Ukázková odpověď

{
  "tokens": [
    {
      "token": "text",
      "startOffset": 0,
      "endOffset": 4,
      "position": 0
    },
    {
      "token": "to",
      "startOffset": 5,
      "endOffset": 7,
      "position": 1
    },
    {
      "token": "analyze",
      "startOffset": 8,
      "endOffset": 15,
      "position": 2
    }
  ]
}

Definice

Name Description
AnalyzedTokenInfo

Informace o tokenu vráceného analyzátorem

AnalyzeRequest

Určuje některé součásti textu a analýzy, které slouží k rozdělení textu na tokeny.

AnalyzeResult

Výsledek testování analyzátoru na textu

CharFilterName

Definuje názvy všech filtrů znaků podporovaných vyhledávacím webem.

LexicalAnalyzerName

Definuje názvy všech textových analyzátorů podporovaných vyhledávacím webem.

LexicalTokenizerName

Definuje názvy všech tokenizátorů podporovaných vyhledávacím webem.

SearchError

Popisuje chybový stav rozhraní API.

TokenFilterName

Definuje názvy všech filtrů tokenů podporovaných vyhledávacím webem.

AnalyzedTokenInfo

Informace o tokenu vráceného analyzátorem

Name Typ Description
endOffset

integer (int32)

Index posledního znaku tokenu ve vstupním textu.

position

integer (int32)

Pozice tokenu ve vstupním textu vzhledem k jiným tokenům. První token vstupního textu má pozici 0, další má pozici 1 atd. V závislosti na použitém analyzátoru můžou mít některé tokeny stejnou pozici, například pokud se jedná o synonyma sebe navzájem.

startOffset

integer (int32)

Index prvního znaku tokenu ve vstupním textu.

token

string

Token vrácený analyzátorem.

AnalyzeRequest

Určuje některé součásti textu a analýzy, které slouží k rozdělení textu na tokeny.

Name Typ Description
analyzer

LexicalAnalyzerName

Název analyzátoru, který se má použít k přerušení daného textu. Pokud tento parametr není zadaný, musíte místo toho zadat tokenizátor. Parametry tokenizátoru a analyzátoru se vzájemně vylučují.

charFilters

CharFilterName[]

Volitelný seznam filtrů znaků, které se mají použít při přerušení daného textu. Tento parametr lze nastavit pouze při použití parametru tokenizátoru.

text

string

Text, který se má rozdělit na tokeny.

tokenFilters

TokenFilterName[]

Volitelný seznam filtrů tokenů, které se mají použít při přerušení daného textu. Tento parametr lze nastavit pouze při použití parametru tokenizátoru.

tokenizer

LexicalTokenizerName

Název tokenizátoru, který se má použít k přerušení daného textu. Pokud tento parametr není zadaný, musíte místo toho zadat analyzátor. Parametry tokenizátoru a analyzátoru se vzájemně vylučují.

AnalyzeResult

Výsledek testování analyzátoru na textu

Name Typ Description
tokens

AnalyzedTokenInfo[]

Seznam tokenů vrácených analyzátorem zadaným v požadavku.

CharFilterName

Definuje názvy všech filtrů znaků podporovaných vyhledávacím webem.

Hodnota Description
html_strip

Filtr znaků, který se pokusí odstranit konstruktory HTML. Podívejte se na https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html

LexicalAnalyzerName

Definuje názvy všech textových analyzátorů podporovaných vyhledávacím webem.

Hodnota Description
ar.microsoft

Microsoft Analyzer pro arabštinu.

ar.lucene

Analyzátor Lucene pro arabštinu.

hy.lucene

Analyzátor Lucene pro Arménii.

bn.microsoft

Analyzátor společnosti Microsoft pro bengálštinu.

eu.lucene

Analyzátor Lucene pro baskičtina.

bg.microsoft

Microsoft Analyzer pro bulharštinu.

bg.lucene

Analyzátor Lucene pro bulharštinu.

ca.microsoft

Microsoft Analyzer pro katalánštinu.

ca.lucene

Analyzátor Lucene pro katalánštinu.

zh-Hans.microsoft

Microsoft Analyzer pro čínštinu (zjednodušená).

zh-Hans.lucene

Analyzátor Lucene pro čínštinu (zjednodušená).

zh-Hant.microsoft

Microsoft Analyzer pro čínštinu (tradiční).

zh-Hant.lucene

Analyzátor Lucene pro čínštinu (tradiční).

hr.microsoft

Microsoft Analyzer pro chorvatštinu.

cs.microsoft

Microsoft Analyzer pro češtinu.

cs.lucene

Lucene analyzer pro češtinu.

da.microsoft

Microsoft Analyzer pro dánštinu.

da.lucene

Analyzátor Lucene pro dánštinu.

nl.microsoft

Microsoft Analyzer pro nizozemštinu.

nl.lucene

Analyzátor Lucene pro nizozemštinu.

en.microsoft

Microsoft Analyzer pro angličtinu.

en.lucene

Lucene Analyzer pro angličtinu.

et.microsoft

Analyzátor společnosti Microsoft pro estonštinu.

fi.microsoft

Microsoft Analyzer pro finštinu.

fi.lucene

Lucene Analyzer pro finštinu.

fr.microsoft

Microsoft Analyzer pro francouzštinu.

fr.lucene

Lucene analyzer pro francouzštinu.

gl.lucene

Analyzátor Lucene pro Galicijštinu.

de.microsoft

Microsoft Analyzer pro němčinu.

de.lucene

Lucene analyzer pro němčinu.

el.microsoft

Microsoft Analyzer pro řečtinu.

el.lucene

Lucene analyzer pro řečtinu.

gu.microsoft

Analyzátor společnosti Microsoft pro gudžarátštinu.

he.microsoft

Microsoft Analyzer for Hebrejština.

hi.microsoft

Microsoft Analyzer pro hindštinu.

hi.lucene

Lucene analyzátor pro hindštinu.

hu.microsoft

Microsoft Analyzer pro maďarštinu.

hu.lucene

Analyzátor Lucene pro maďarštinu.

is.microsoft

Microsoft Analyzer pro Islandštinu.

id.microsoft

Microsoft analyzer for Indonéština (Bahasa).

id.lucene

Analyzátor Lucene pro indonéštinu.

ga.lucene

Lucene analyzer pro irštinu.

it.microsoft

Microsoft Analyzer pro italštinu.

it.lucene

Analyzátor Lucene pro italštinu.

ja.microsoft

Microsoft Analyzer pro japonštinu.

ja.lucene

Lucene Analyzer pro japonštinu.

kn.microsoft

Analyzátor společnosti Microsoft pro kannadštinu.

ko.microsoft

Microsoft Analyzer pro korejštinu.

ko.lucene

Lucene Analyzer pro korejštinu.

lv.microsoft

Microsoft Analyzer pro lotyštinu.

lv.lucene

Analyzátor Lucene pro lotyštinu.

lt.microsoft

Microsoft Analyzer pro litevštinu.

ml.microsoft

Microsoft Analyzer pro Malayalam.

ms.microsoft

Microsoft Analyzer for Malay (latinka).

mr.microsoft

Microsoft analyzer pro maráthštinu.

nb.microsoft

Microsoft Analyzer pro norštinu (Bokmål).

no.lucene

Analyzátor Lucene pro norštinu.

fa.lucene

Lucene analyzátor perský.

pl.microsoft

Microsoft Analyzer pro polštinu.

pl.lucene

Analyzátor Lucene pro polštinu.

pt-BR.microsoft

Microsoft Analyzer pro portugalštinu (Brazílie).

pt-BR.lucene

Analyzátor Lucene pro portugalštinu (Brazílie).

pt-PT.microsoft

Microsoft Analyzer pro portugalštinu (Portugalsko).

pt-PT.lucene

Analyzátor Lucene pro portugalštinu (Portugalsko).

pa.microsoft

Microsoft analyzer pro paňdžábštinu.

ro.microsoft

Microsoft Analyzer pro rumunštinu.

ro.lucene

Lucene analyzer pro rumunštinu.

ru.microsoft

Microsoft Analyzer pro ruštinu.

ru.lucene

Lucene analyzer pro ruštinu.

sr-cyrillic.microsoft

Microsoft Analyzer pro srbštinu (cyrilice).

sr-latin.microsoft

Microsoft Analyzer pro srbštinu (latinka).

sk.microsoft

Microsoft Analyzer pro slovenštinu.

sl.microsoft

Microsoft Analyzer pro slovinštinu.

es.microsoft

Microsoft Analyzer pro španělštinu.

es.lucene

Lucene analyzer pro španělštinu.

sv.microsoft

Microsoft Analyzer pro švédštinu.

sv.lucene

Lucene analyzer pro švédštinu.

ta.microsoft

Microsoft Analyzer pro tamilštinu.

te.microsoft

Microsoft Analyzer pro Telugu.

th.microsoft

Microsoft Analyzer pro thajštinu.

th.lucene

Analyzátor Lucene pro thajštinu.

tr.microsoft

Microsoft Analyzer pro turečtinu.

tr.lucene

Analyzátor Lucene pro turečtinu.

uk.microsoft

Microsoft Analyzer pro ukrajinštinu.

ur.microsoft

Microsoft analyzer pro urdštinu.

vi.microsoft

Microsoft Analyzer pro vietnamštinu.

standard.lucene

Standardní analyzátor Lucene.

standardasciifolding.lucene

Standardní analyzátor ASCII Folding Lucene. Podívejte se na https://docs.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers

keyword

Považuje celý obsah pole za jediný token. To je užitečné pro data, jako jsou PSČ, ID a některé názvy produktů. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html

pattern

Pružně odděluje text do termínů pomocí vzoru regulárního výrazu. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html

simple

Rozdělí text bez písmen a převede je na malá písmena. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html

stop

Rozdělí text bez písmen; Použije filtry tokenů s malými písmeny a stopword. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html

whitespace

Analyzátor, který používá tokenizátor prázdných znaků. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html

LexicalTokenizerName

Definuje názvy všech tokenizátorů podporovaných vyhledávacím webem.

Hodnota Description
classic

Tokenizátor založený na gramatikě, který je vhodný pro zpracování většiny dokumentů evropského jazyka. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicTokenizer.html

edgeNGram

Tokenizuje vstup z okraje na n-gramy dané velikosti. Podívejte se na https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenizer.html

keyword_v2

Vygeneruje celý vstup jako jeden token. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordTokenizer.html

letter

Rozdělí text bez písmen. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LetterTokenizer.html

lowercase

Rozdělí text bez písmen a převede je na malá písmena. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LowerCaseTokenizer.html

microsoft_language_tokenizer

Rozdělí text pomocí pravidel specifických pro jazyk.

microsoft_language_stemming_tokenizer

Rozdělí text pomocí pravidel specifických pro jazyk a zmenšuje slova na jejich základní formuláře.

nGram

Tokenizuje vstup na n-gramy dané velikosti. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenizer.html

path_hierarchy_v2

Tokenizátor pro hierarchie podobné cestě. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/path/PathHierarchyTokenizer.html

pattern

Tokenizátor, který používá porovnávání vzorů regulárních výrazů k vytvoření jedinečných tokenů. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/pattern/PatternTokenizer.html

standard_v2

Standardní analyzátor Lucene; Skládá se ze standardního tokenizátoru, filtru malými písmeny a filtru zastavení. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/StandardTokenizer.html

uax_url_email

Tokenizuje adresy URL a e-maily jako jeden token. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/UAX29URLEmailTokenizer.html

whitespace

Rozdělí text na prázdné znaky. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceTokenizer.html

SearchError

Popisuje chybový stav rozhraní API.

Name Typ Description
code

string

Jedna ze serverově definovaných kódů chyb.

details

SearchError[]

Pole podrobností o konkrétních chybách, které vedly k této nahlášené chybě.

message

string

Čitelné znázornění chyby člověkem.

TokenFilterName

Definuje názvy všech filtrů tokenů podporovaných vyhledávacím webem.

Hodnota Description
arabic_normalization

Filtr tokenů, který použije arabský normalizátor k normalizaci orthografie. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ar/ArabicNormalizationFilter.html

apostrophe

Odstraní všechny znaky za apostrofem (včetně samotného apostrofu). Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/tr/ApostropheFilter.html

asciifolding

Převede abecední, číselné a symbolické znaky Unicode, které nejsou v prvních 127 znaky ASCII (blok "Základní latinka") na jejich ekvivalenty ASCII, pokud takové ekvivalenty existují. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html

cjk_bigram

Tvoří bigramy výrazů CJK, které se generují ze standardního tokenizátoru. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/cjk/CJKBigramFilter.html

cjk_width

Normalizuje rozdíly šířky CJK. Přeloží varianty ASCII na ekvivalentní základní latinku a varianty Katakana s poloviční šířkou do ekvivalentní Kana. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/cjk/CJKWidthFilter.html

classic

Odebere anglické přivlastnické a tečky ze zkratek. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicFilter.html

common_grams

Při indexování vytvořte bigramy pro často se vyskytující termíny. Jednotlivé termíny jsou stále indexované, s překryvnými bigramy. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/commongrams/CommonGramsFilter.html

edgeNGram_v2

Vygeneruje n-gramy dané velikosti počínaje přední nebo zadní částí vstupního tokenu. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenFilter.html

elision

Odebere elisions. Například "l'avion" (letadlo) bude převedeno na "avion" (letadlo). Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html

german_normalization

Normalizuje německé znaky podle heuristiky německého snowball algoritmu. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/de/GermanNormalizationFilter.html

hindi_normalization

Normalizuje text v hindštině a odebere některé rozdíly v pravopisných variantách. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/hi/HindiNormalizationFilter.html

indic_normalization

Normalizuje reprezentaci textu v indickém jazyce unicode. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/in/IndicNormalizationFilter.html

keyword_repeat

Vygeneruje každý příchozí token dvakrát, jednou jako klíčové slovo a jednou jako jiné než klíčové slovo. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/KeywordRepeatFilter.html

kstem

Vysoce výkonný filtr kstem pro angličtinu. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/en/KStemFilter.html

length

Odebere slova, která jsou příliš dlouhá nebo příliš krátká. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/LengthFilter.html

limit

Omezuje počet tokenů při indexování. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/LimitTokenCountFilter.html

lowercase

Normalizuje text tokenu na malá písmena. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.htm

nGram_v2

Vygeneruje n-gramy dané velikosti. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenFilter.html

persian_normalization

Použije normalizaci pro Perštinu. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/fa/PersianNormalizationFilter.html

phonetic

Vytváření tokenů pro fonetické shody Podívejte se na https://lucene.apache.org/core/4_10_3/analyzers-phonetic/org/apache/lucene/analysis/phonetic/package-tree.html

porter_stem

Používá algoritmus vytváření tokenů porteru k transformaci datového proudu tokenu. Podívejte se na http://tartarus.org/~martin/PorterStemmer

reverse

Vrátí řetězec tokenu. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html

scandinavian_normalization

Normalizuje použití zaměnitelných severských znaků. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ScandinavianNormalizationFilter.html

scandinavian_folding

Složené severské znaky åÅäæÄÆ->a a öÖøØ->o. Také diskriminuje použití dvojitých samohlásek aa, ae, ao, oe a oo, ponechání jen první. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ScandinavianFoldingFilter.html

shingle

Vytvoří kombinace tokenů jako jeden token. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/shingle/ShingleFilter.html

snowball

Filtr, který vychází ze slov pomocí vygenerovaného smyšlí snowballu. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/snowball/SnowballFilter.html

sorani_normalization

Normalizuje reprezentaci textu Sorani v kódování Unicode. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ckb/SoraniNormalizationFilter.html

stemmer

Filtr pro konkrétní jazyk. Podívejte se na https://docs.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

stopwords

Odebere slova ze streamu tokenu. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

trim

Oříznou počáteční a koncové prázdné znaky z tokenů. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/TrimFilter.html

truncate

Zkracuje termíny na určitou délku. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/TruncateTokenFilter.html

unique

Vyfiltruje tokeny se stejným textem jako předchozí token. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/RemoveDuplicatesTokenFilter.html

uppercase

Normalizuje text tokenu na velká písmena. Podívejte se na http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html

word_delimiter

Rozdělí slova do dílčích slov a provede volitelné transformace skupin podwordů.