适用于:SQL Server
Azure SQL 数据库
Azure SQL 托管实例
CONTAINSTABLE 和 FREETEXTTABLE 函数返回一个名为RANK列的列,包含从 0 到 1,000 的序数值(秩值)。 这些数值根据行与选择标准的匹配程度进行排名。 排名值仅表示结果集中各行相关性的相对顺序,值越小,表示相关性越低。 实际值并不重要,通常每次查询运行时都会有所不同。
注意
CONTAINS 和 FREETEXT 谓词不返回任何排名值。
符合搜索条件的项通常有很多。 为了防止CONTAINSTABLEFREETEXTTABLE查询返回过多匹配,可以使用可选的top_n_by_rank参数。 它只返回行的子集。
top_n_by_rank 是一个整数值 n,表示只有 n 个排名最高的匹配按降序返回。 如果 top_n_by_rank 与其他参数组合使用,则查询返回的行数可能会少于实际与所有谓词都匹配的行数。
SQL Server 数据库引擎 按排名排序匹配,并只返回指定的行数。 例如,一个通常会从包含1000000行的表中返回100000行的查询,如果只请求前100行,其处理速度会更快。
使用RANK限制搜索结果的示例
示例 A:仅查找排名前三的匹配项
下面的示例使用 CONTAINSTABLE 仅返回前三个匹配项。
USE AdventureWorks2025;
GO
SELECT K.RANK,
AddressLine1,
City
FROM Person.Address AS A
INNER JOIN CONTAINSTABLE (Person.Address, AddressLine1, 'ISABOUT ("des*",
Rue WEIGHT(0.5),
Bouchers WEIGHT(0.9))', 3) AS K
ON A.AddressID = K.[KEY];
GO
结果集如下。
RANK Address City
----------- -------------------------------- ------------------------------
172 9005, rue des Bouchers Paris
172 5, rue des Bouchers Orleans
172 5, rue des Bouchers Metz
示例 B:搜索前五个匹配项
下面的示例使用 CONTAINSTABLE 返回前五个产品的描述,其中 Description 列包含“aluminum”一词,且该词出现在 light 或 lightweight 附近。
USE AdventureWorks2025;
GO
SELECT FT_TBL.ProductDescriptionID,
FT_TBL.Description,
KEY_TBL.RANK
FROM Production.ProductDescription AS FT_TBL
INNER JOIN CONTAINSTABLE (Production.ProductDescription,
Description, '(light NEAR aluminum) OR (lightweight NEAR aluminum)', 5) AS KEY_TBL
ON FT_TBL.ProductDescriptionID = KEY_TBL.[KEY];
GO
搜索查询结果的排名方式
全文搜索可以生成一个可选的评分(或排名值),以表示全文查询返回的数据的相关性。 该排名值在每一行计算,可作为排序准则,按相关性排序给定查询的结果集。 此排名值仅指示结果集中各行相关性的相对顺序。 实际的值并不重要,并且每次运行查询时实际值通常都不同。 此排名值在不同的查询之间没有任何意义。
排名统计信息
当你建立索引时,系统会收集统计数据用于排名。 构建全文目录并不会直接创建单一的索引结构。 相反,Full-Text 引擎在索引数据时会生成中间索引。 全文引擎随后会将这些索引根据需要合并为一个较大的索引。 这个过程可以发生很多次。 最后,全文引擎将进行“主合并”,将所有中间索引合并为一个较大的主索引。
在每个中间索引级别都会收集统计信息。 合并索引时,统计信息也将被合并。 某些统计值只有在主合并过程中才能生成。
虽然数据库引擎对查询结果集进行排名,但它使用了来自最大中间索引的统计数据。 这种用法取决于中间索引是否合并。 因此,如果未合并中间索引,则排名统计信息在准确性上会有变化。 这种准确性的差异解释了为何同一查询在添加、修改和删除全文索引数据以及较小索引合并时,可能会返回不同的排名结果。
为了尽量减小索引大小以及尽量降低计算的复杂程度,经常会对统计信息进行舍入。
下表包含了对计算排名非常重要的一些常用术语和统计值。
| 术语/值 | 说明 |
|---|---|
| 属性 | 行的全文索引列。 |
| Document | 在查询中返回的实体。 在 数据库引擎 中,这对应于一行。 正如一行可以具有多个全文索引列一样,一个文档也可以具有多个属性。 |
| Index | 一个或多个文档的单个倒排索引。 此索引可以完全位于内存中或位于磁盘上。 许多查询统计信息都是相对于发生匹配的具体索引而言的。 |
| 全文目录 | 当作一个查询实体来处理的中间索引的集合。 目录是管理员所看到的组织单位。 |
| 词、令牌或项 | 全文检索引擎中的匹配单元。 来自文档的文本流通过特定于语言的分词器被切分为单词或词元。 |
| 出现次数 | 文档属性中的词偏移量取决于断字符。 第一个词出现在位置 1,下一个词出现在位置 2,依此类推。 为避免短语和邻近查询中的误报,句尾和段尾会引入更大的出现间隔。 |
| TermFrequency | 键值连续出现的次数。 |
| IndexedRowCount | 索引行总数。 该值是根据中间索引中维护的计数计算得出的。 此数值在准确性上会有变化。 |
| KeyRowCount | 全文目录中包含给定键的总行数。 |
| MaxOccurrence | 某一行中的给定属性在全文目录中偏移量最大的位置。 |
| MaxQueryRank | 最高等级为 1000,由 Full-Text 引擎返回。 |
排名计算问题
有许多因素影响排名计算过程。 不同语言的断字符对文本进行的词汇切分也不同。 例如,一个词分解器将字符串“dog-house”拆分为“dog”和“house”,但另一个词分解器则将其处理为“dog-house”。 匹配和排名因语言不同而异,不仅词语不同,文档长度也不同。 文档长度的差异可能会影响所有查询的排名。
诸如 IndexRowCount 之类的统计信息可能会大不相同。 例如,如果目录在主索引中有 20 亿行,一个新文档被索引到内存中中间索引中,并且基于内存中索引中文档数量的该文档排名可能与主索引中文档的排名相比出现偏差。 因此,在任何导致大量行被索引或重新索引的填充之后,请使用 ALTER FULLTEXT CATALOG ... REORGANIZE Transact-SQL 语句将索引合并到主索引中。 全文引擎也会根据参数(例如中间索引的数量和大小)自动合并索引。
MaxOccurrence 值被规范化到 32 个范围的其中一个内。 这种规范化意味着,例如,一份50字的文档与一份100字的文档被同等对待。 下表展示了归一化。 由于这两个文档的长度位于相邻表值 32 与 128 之间的范围内,因此将认为它们具有相同的有效长度 128 (32 <docLength<= 128)。
{ 16, 32, 128, 256, 512, 725, 1024, 1450, 2048, 2896, 4096, 5792, 8192, 11585,
16384, 23170, 28000, 32768, 39554, 46340, 55938, 65536, 92681, 131072, 185363,
262144, 370727, 524288, 741455, 1048576, 2097152, 4194304 };
CONTAINSTABLE 的排名
CONTAINSTABLE 排名使用以下算法:
StatisticalWeight = Log2( ( 2 + IndexedRowCount ) / KeyRowCount )
Rank = min( MaxQueryRank, HitCount * 16 * StatisticalWeight / MaxOccurrence )
短语匹配的排名与单个键相同,但 KeyRowCount (包含短语的行数)是一个估计值,可能不准确且高于实际数字。
NEAR 的排名
CONTAINSTABLE 支持通过使用 NEAR 选项来查询彼此接近的两个或更多个搜索词。 每个返回行的排名值基于以下几个参数。 一个主要的排名因素是相对于文档长度而言的匹配总数(或命中次数)。 因此举例来说,如果一个 100 个字长的文档和一个 900 个字长的文档中包含相同的匹配项,那么 100 个字长的文档的排名更靠前。
一行中每个匹配结果的总长度也会影响该行的排名,具体取决于该匹配结果中第一个和最后一个搜索词之间的距离。 距离越小,该命中结果对该行排序值的贡献越大。 如果全文查询没有指定整数作为最大距离,那么仅包含距离大于100个逻辑项的命中点的文档,排名为0。
ISABOUT 排名
CONTAINSTABLE 支持使用 ISABOUT 选项来查询加权词。 按照传统信息检索系统的说法,ISABOUT 表示向量空间查询。 所使用的默认排名算法为广为人知的公式 Jaccard。 排名是根据查询中的每个词计算的,然后按以下算法的说明进行合并。
ContainsRank = same formula used for CONTAINSTABLE ranking of a single term (above).
Weight = the weight specified in the query for each term. Default weight is 1.
WeightedSum = Σ[key=1 to n] ContainsRankKey * WeightKey
Rank = ( MaxQueryRank * WeightedSum ) / ( ( Σ[key=1 to n] ContainsRankKey^2 )
+ ( Σ[key=1 to n] WeightKey^2 ) - ( WeightedSum ) )
FREETEXTTABLE 排名
FREETEXTTABLE 排名基于 OKAPI BM25 排名公式计算。
FREETEXTTABLE 查询通过屈折生成(原始查询词的屈折形式)为查询添加词汇。 这些词被视为独立词语,与其生成词没有特殊关系。 同义词库功能派生出的同义词将被当作单独的、具有同等加权值的词来处理。 查询中的每个词都会对排名产生影响。
Rank = Σ[Terms in Query] w ( ( ( k1 + 1 ) tf ) / ( K + tf ) ) * ( ( k3 + 1 ) qtf / ( k3 + qtf ) ) )
Where:
w is the Robertson-Sparck Jones weight.
In simplified form, w is defined as:
w = log10 ( ( ( r + 0.5 ) * ( N - R + r + 0.5 ) ) / ( ( R - r + 0.5 ) * ( n - r + 0.5 ) )
N is the number of indexed rows for the property being queried.
n is the number of rows containing the word.
K is ( k1 * ( ( 1 - b ) + ( b * dl / avdl ) ) ).
dl is the property length, in word occurrences.
avdl is the average length of the property being queried, in word occurrences.
k1, b, and k3 are the constants 1.2, 0.75, and 8.0, respectively.
tf is the frequency of the word in the queried property in a specific row.
qtf is the frequency of the term in the query.