Elasticsearch多索引搜索及PIT索引ID复用相关技术咨询
Elasticsearch 多索引PIT使用常见问题解答
多索引PIT的绑定逻辑与排序规则
- PIT和创建时传入的索引集是强绑定的。你用
/index-1,index-2/_pit?keep_alive=15m接口创建出来的PIT ID,本质是给这两个索引在创建时间点的全量数据打了一个固定快照,后续用这个ID发起的搜索,只能查到这个快照范围内的数据,既不能跨到其他没在创建时指定的索引,也读不到PIT创建完成后这两个索引上的增删改操作。只要是查询index-1,index-2、且需要匹配这个时间点快照的搜索请求,第一次发起查询时都可以用这个PIT ID。 - 多索引场景下PIT隐式的
_shard_doc决胜排序完全可以正常生效。这个机制是PIT配合search_after做稳定深度分页的核心,和PIT绑定了多少个索引没有关系,ES会自动在所有关联索引的分片上维护统一的_shard_doc排序值,不会出现分页时重复返回数据、漏数据的问题。
PIT复用与ID更新规则的矛盾澄清
你看到的两处官方表述其实没有冲突,只是适用场景不一样:
打开point-in-time的请求及后续每一次搜索请求均可能返回不同的id,因此执行下一次搜索请求时必须始终使用最近一次接收到的id。
- 上述文档规则是针对同一个连续分页查询链路的强制要求。同一个深度分页流程里,每次搜索返回的新PIT ID会自动续期PIT的保留时长,如果你不用最新返回的ID,而是一直用最开始创建的旧ID,很容易遇到PIT过期、搜索上下文丢失的报错。
- 官方博客提到的「后台进程统一创建PIT供所有搜索请求复用,不用每次搜索都单独创建PIT」,指的是不同的独立搜索任务,可以共用预创建的PIT拿到统一时间点的数据视图,不是说同一个分页翻页的过程里可以一直用初始ID不更新。举个实际落地的例子:你可以起个后台任务,每5分钟创建一个保留时长10分钟的多索引PIT,所有新发起的搜索请求,第一次查询都用当前最新的公共PIT ID,后续每个搜索任务自己翻页的时候,跟着接口返回的最新PIT ID走就行,不用每个搜索请求一开始都单独调一次开PIT的接口,这就是博客说的复用逻辑,和文档里的ID更新规则完全不冲突。
内容的提问来源于stack exchange,提问作者Matt Bennett
相关产品推荐
相关产品推荐

