MicrosoftLanguageStemmingTokenizer interface

Разделяет текст с помощью правил, относящихся к языку, и сокращает количество слов к базовым формам.

Extends

Свойства

isSearchTokenizer

Значение, указывающее, как используется токенизатор. Установите значение true, если используется в качестве маркеризатора поиска, установите значение false, если используется в качестве маркеризатора индексирования. Значение по умолчанию — false.

language

Используемый язык. По умолчанию используется английский язык.

maxTokenLength

Максимальная длина маркера. Маркеры длиннее, чем максимальная длина, разделены. Максимальная длина маркера, которую можно использовать, составляет 300 символов. Маркеры длиной более 300 символов сначала разделяются на маркеры длины 300, а затем каждый из этих маркеров разбивается на основе максимального набора длины маркеров. Значение по умолчанию — 255.

odatatype

Фрагмент URI, указывающий тип генератора маркеров.

Унаследованные свойства

name

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

Сведения о свойстве

isSearchTokenizer

Значение, указывающее, как используется токенизатор. Установите значение true, если используется в качестве маркеризатора поиска, установите значение false, если используется в качестве маркеризатора индексирования. Значение по умолчанию — false.

isSearchTokenizer?: boolean

Значение свойства

boolean

language

Используемый язык. По умолчанию используется английский язык.

language?: MicrosoftStemmingTokenizerLanguage

Значение свойства

maxTokenLength

Максимальная длина маркера. Маркеры длиннее, чем максимальная длина, разделены. Максимальная длина маркера, которую можно использовать, составляет 300 символов. Маркеры длиной более 300 символов сначала разделяются на маркеры длины 300, а затем каждый из этих маркеров разбивается на основе максимального набора длины маркеров. Значение по умолчанию — 255.

maxTokenLength?: number

Значение свойства

number

odatatype

Фрагмент URI, указывающий тип генератора маркеров.

odatatype: "#Microsoft.Azure.Search.MicrosoftLanguageStemmingTokenizer"

Значение свойства

"#Microsoft.Azure.Search.MicrosoftLanguageStemmingTokenizer"

Сведения об унаследованном свойстве

name

Имя токенизатора. Он должен содержать только буквы, цифры, пробелы, дефисы или символы подчеркивания, может начинаться и заканчиваться буквенно-цифровыми символами и ограничен 128 символами.

name: string

Значение свойства

string

Унаследованный от LexicalTokenizer.name