短语匹配查询

更新时间:
复制 MD 格式

使用 Tablestore Java SDK 的短语匹配查询可按分词后的词条顺序和位置检索 Text 类型字段,并返回满足短语条件的数据及相关性得分。

前提条件

安装Tablestore Java SDK并初始化客户端。

功能说明

短语匹配查询用于检索 Text 类型字段(字段说明请参见字符串类型)中按指定顺序和位置连续出现的词条。字段值和查询文本均使用创建多元索引时配置的分词器进行分词;未配置分词器时,默认使用单字分词。

短语匹配查询不仅要求查询词条全部出现,还要求词条顺序相同且位置相邻。例如,查询文本为 this is 时,this is tablestore 可以命中,this table isis this a table 不能命中。匹配查询只判断词条是否匹配,不要求词条按查询文本中的顺序相邻出现。

如果 Text 字段使用模糊分词器,短语匹配查询可以实现与通配符查询类似的模糊匹配效果,并具有更低的查询延迟。

以下示例查询 description 字段中按顺序连续包含 tablestoredurable 词条的数据,返回最多 10 行数据、匹配总行数和相关性得分。

String tableName = "example_table";
String indexName = "example_index";

MatchPhraseQuery matchPhraseQuery = new MatchPhraseQuery();
matchPhraseQuery.setFieldName("description");
matchPhraseQuery.setText("tablestore durable");

SearchQuery searchQuery = new SearchQuery();
searchQuery.setQuery(matchPhraseQuery);
searchQuery.setSort(new Sort(Collections.singletonList(new ScoreSort())));
searchQuery.setLimit(10);
searchQuery.setTrackTotalCount(SearchQuery.TRACK_TOTAL_COUNT);

SearchRequest request = new SearchRequest(tableName, indexName, searchQuery);
SearchRequest.ColumnsToGet columnsToGet = new SearchRequest.ColumnsToGet();
columnsToGet.setReturnAll(true);
request.setColumnsToGet(columnsToGet);

SearchResponse response = client.search(request);
for (SearchHit hit : response.getSearchHits()) {
    System.out.println(hit.getRow());
    System.out.println(hit.getScore());
}

参数说明

查询请求

request 的类型为 SearchRequest,包含以下参数。

名称

类型

说明

tableName(必选)

String

数据表名称。

indexName(必选)

String

多元索引名称。

searchQuery(必选)

SearchQuery

查询条件和通用查询配置。

columnsToGet(可选)

SearchRequest.ColumnsToGet

返回列配置。未设置时只返回主键列。

timeoutInMillisecond(可选)

int

请求级查询超时时间,单位为毫秒。默认值为 -1,表示不单独设置查询超时时间。

routingValues(可选)

List<PrimaryKey>

自定义路由字段对应的主键值列表。未配置自定义路由时无需设置。

查询配置

request.searchQuery 的类型为 SearchQuery,包含以下参数。

名称

类型

说明

query(必选)

Query

查询条件。短语匹配查询设置为 MatchPhraseQuery

offset(可选)

Integer

本次查询的起始位置。

limit(可选)

Integer

本次查询返回的最大行数。设置为 0 时不返回具体行。

highlight(可选)

Highlight

Text 字段的摘要与高亮配置。有关配置方法和限制,请参见摘要与高亮

collapse(可选)

Collapse

结果折叠配置,用于按指定列对返回结果去重。有关配置方法,请参见折叠(去重)

sort(可选)

Sort

返回结果的排序方式。有关配置方法,请参见排序和翻页

trackTotalCount(可选)

int

期望统计的最大匹配行数。默认值为 TRACK_TOTAL_COUNT_DISABLED,表示不统计;设置为 TRACK_TOTAL_COUNT 时统计全部匹配行。值越小,查询性能越高。

filter(可选)

SearchFilter

query 的查询结果进行过滤。

aggregationList(可选)

List<Aggregation>

统计聚合配置。有关配置方法,请参见统计聚合

groupByList(可选)

List<GroupBy>

分组配置。有关配置方法,请参见统计聚合

token(可选)

byte[]

翻页凭证。将上一次响应的 nextToken 设置为该参数可继续读取后续数据。设置 token 时,SDK 会清除 sort,因为翻页凭证中已包含排序条件。

短语匹配条件

request.searchQuery.query 的类型为 MatchPhraseQuery,包含以下参数。

名称

类型

说明

fieldName(必选)

String

要查询的 Text 类型索引字段名称。

text(必选)

String

查询文本。使用字段的分词器对查询文本分词后,按词条顺序和位置进行匹配。

weight(可选)

float

查询权重。默认值为 1.0,必须为正浮点数。值越大,该查询对相关性得分的贡献越大,不改变匹配范围。

返回列

request.columnsToGet 的类型为 SearchRequest.ColumnsToGet,包含以下参数。

名称

类型

说明

columns(可选)

List<String>

要返回的属性列名称。仅 returnAllreturnAllFromIndex 均为 false 时需要设置;未设置时只返回主键列。

returnAll(可选)

boolean

是否返回数据表中的全部属性列。默认值为 false

returnAllFromIndex(可选)

boolean

是否返回已建立索引的全部属性列。默认值为 false。不能与 returnAll 同时设置为 true

返回值

查询响应

search 方法返回 SearchResponse。核心字段如下。

名称

类型

说明

totalCount

long

匹配行数,通过 getTotalCount() 获取。返回值取决于 trackTotalCount 配置。

rows

List<Row>

本次查询返回的行数据,通过 getRows() 获取。返回数量不超过 limit

searchHits

List<SearchHit>

查询命中结果,通过 getSearchHits() 获取。可从该字段读取相关性得分和摘要与高亮结果。

nextToken

byte[]

下一页凭证,通过 getNextToken() 获取。值不为 null 时,将其设置到下一次请求的 token 中继续读取。

isAllSuccess

boolean

是否已成功查询全部索引分区,通过 isAllSuccess() 获取。值为 false 时,返回的是部分结果,totalCount 可能小于实际匹配行数。

查询命中

response.searchHits[] 的类型为 SearchHit,包含以下核心字段。

名称

类型

说明

row

Row

命中的行数据,通过 getRow() 获取。

score

Double

相关性得分,通过 getScore() 获取。使用 ScoreSort 按相关性得分排序时返回实际得分。匹配词条和 weight 会影响该值。

highlightResultItem

HighlightResultItem

摘要与高亮结果,通过 getHighlightResultItem() 获取。