使用 Tablestore Go SDK 查询与给定向量最相似的 TopK 条数据。
前提条件
开始前,完成以下准备工作:
-
安装Tablestore Go SDK并初始化客户端。
-
已创建包含 Vector 字段的多元索引。具体操作请参见创建多元索引。
功能说明
向量检索使用 KnnVectorQuery 计算查询向量与 Vector 字段中向量的距离,并返回最相似的 TopK 条数据。可以通过 Filter 先过滤候选数据,通过 MinScore 排除相似度不足的数据。
向量字段数量、向量维度和 TopK 等参数存在限制,具体请参见多元索引使用限制。
多元索引服务端包含多个数据分区。每个分区返回自身最邻近的 TopK 条数据,再由协调节点汇总。因此,使用 Token 翻页时可获取的总行数与索引分区数有关。
func (client *tablestore.TableStoreClient) Search(request *tablestore.SearchRequest) (*tablestore.SearchResponse, error)query := &search.KnnVectorQuery{
FieldName: "embedding",
TopK: proto.Int32(10),
NumCandidates: proto.Int32(100),
Float32QueryVector: []float32{1, 0, 0, 0},
MinScore: proto.Float32(0.1),
Filter: &search.TermQuery{
FieldName: "category",
Term: "books",
},
}
searchQuery := search.NewSearchQuery().
SetQuery(query).
SetSort(&search.Sort{Sorters: []search.Sorter{search.NewScoreSort()}})
response, err := client.Search(&tablestore.SearchRequest{
TableName: "example_table",
IndexName: "example_vector_index",
SearchQuery: searchQuery,
ColumnsToGet: &tablestore.ColumnsToGet{
ReturnAllFromIndex: true,
},
})
if err != nil {
log.Fatal(err)
}
fmt.Println(response.SearchHits)
参数说明
查询请求
|
名称 |
类型 |
说明 |
|
TableName(必选) |
string |
数据表名称。 |
|
IndexName(必选) |
string |
多元索引名称。 |
|
SearchQuery(必选) |
search.SearchQuery |
查询条件和通用查询配置。 |
|
ColumnsToGet(可选) |
*tablestore.ColumnsToGet |
返回列配置。未设置时只返回主键列。 |
|
RoutingValues(可选) |
[]*tablestore.PrimaryKey |
自定义路由字段对应的主键值列表。未配置自定义路由时无需设置。 |
|
TimeoutMs(可选) |
*int32 |
请求级超时时间,单位为毫秒。 |
查询配置
|
名称 |
类型 |
说明 |
|
SetQuery(必选) |
search.Query |
设置查询条件。 |
|
SetOffset(可选) |
int32 |
设置本次查询的起始位置,默认值为 0。使用 Offset 翻页时,Offset + Limit 不能超过 100000。 |
|
SetLimit(可选) |
int32 |
设置本次查询返回的最大行数,默认值为 10,最大值为 100。设置为 0 时不返回具体行。 |
|
SetCollapse(可选) |
*search.Collapse |
设置结果折叠。配置方法请参见折叠(去重)。 |
|
SetSort(可选) |
*search.Sort |
设置返回结果的排序方式。配置方法请参见排序和翻页。 |
|
SetGetTotalCount(可选) |
bool |
是否统计匹配总行数,默认值为 false。 |
|
SetToken(可选) |
[]byte |
设置上一次响应返回的 NextToken,以继续读取后续数据。调用该方法会清除 Sort,因为 Token 已包含上一页的排序条件。使用 Token 翻页时不能设置 Offset。 |
|
SetSearchFilter(可选) |
*search.SearchFilter |
对查询结果执行后过滤。配置方法请参见查询后过滤。 |
|
Aggregation(可选) |
...search.Aggregation |
设置统计聚合。配置方法请参见统计聚合。 |
|
GroupBy(可选) |
...search.GroupBy |
设置分组。配置方法请参见统计聚合。 |
向量查询条件
|
名称 |
类型 |
说明 |
|
FieldName(必选) |
string |
Vector 字段名称。 |
|
TopK(必选) |
*int32 |
返回的最邻近数据数量。值越大,召回率通常越高,但查询延迟和费用也越高。 |
|
Float32QueryVector(必选) |
[]float32 |
查询向量,其维度必须与索引字段配置一致。 |
|
Filter(可选) |
search.Query |
候选数据过滤条件,支持除向量检索外的查询类型。 |
|
MinScore(可选) |
*float32 |
最低评分阈值,取值必须大于或等于 0,默认值为 0。仅返回评分高于该值的数据。 |
|
NumCandidates(可选) |
*int32 |
参与精排的候选向量数量,不小于 TopK。值越大,召回率通常越高,但查询延迟也越高。 |
|
Weight(可选) |
*float32 |
查询条件的相关性权重。 |
返回列
|
名称 |
类型 |
说明 |
|
Columns(可选) |
[]string |
要返回的属性列名称。仅 ReturnAll 和 ReturnAllFromIndex 均为 false 时生效。 |
|
ReturnAll(可选) |
bool |
是否返回数据表中的全部属性列,默认值为 false。 |
|
ReturnAllFromIndex(可选) |
bool |
是否返回已建立索引的全部属性列,默认值为 false。不能与 ReturnAll 同时设置为 true。 |
返回值
|
名称 |
类型 |
说明 |
|
TotalCount |
int64 |
匹配总行数。返回值取决于 SetGetTotalCount 配置。 |
|
Rows |
[]*tablestore.Row |
本次查询返回的行数据,数量不超过 SetLimit 指定的值。 |
|
SearchHits |
[]*tablestore.SearchHit |
查询命中结果。配置摘要与高亮、嵌套 InnerHits 或需要相关性评分时,从该字段读取结果。 |
|
NextToken |
[]byte |
下一页凭证。值非空时,将其传入下一次查询继续读取。 |
|
IsAllSuccess |
bool |
是否已成功查询全部索引分区。值为 false 时返回的是部分结果,TotalCount 可能小于实际匹配行数。 |
|
AggregationResults |
search.AggregationResults |
统计聚合结果。 |
|
GroupByResults |
search.GroupByResults |
分组结果。 |