Python使用scroll加载Elasticsearch大量数据时搜索上下文丢失报错如何解决
报错根因
你遇到的No search context found for id报错核心是代码逻辑问题,和设置的10分钟scroll有效期没有直接关系:
- 每次调用
es.scroll()接口时没有传递scroll参数续期搜索上下文:你在首次search接口设置的10m仅对初始查询生效,后续每次scroll请求都需要重新传递scroll参数刷新上下文有效期,否则上下文会在首次的10分钟到期后自动销毁,数据量较大时拉取耗时超过10分钟就会触发报错。 - 始终使用首次返回的
scroll_id发起请求:Elasticsearch在每次scroll响应中都会返回最新的scroll_id,部分场景下id会发生更新,一直复用初始id会导致找不到对应搜索上下文。 - 没有设置滚动终止条件:当某次scroll返回的
hits.hits为空时,说明已经拉取完全量数据,需要主动终止循环,否则会一直发起无效请求直到上下文失效。
修复后可用代码
from elasticsearch import Elasticsearch ##########elastic configuration host='localhost' port=9200 user='' pasw='' el_index_name = 'test' scroll_expire = '10m' # 抽为公共参数统一维护 es = Elasticsearch([{'host':host , 'port': port}], http_auth=(user,pasw)) # 首次查询获取初始scroll_id和第一批数据 res = es.search( index=el_index_name, body={"query": {"match_all": {}}, "size": 1000}, # 可调整size控制单次拉取条数,单条数据量小的话可以设到5000,最大不超过默认上限10000 scroll=scroll_expire ) rows = [] # 先存入第一批数据 rows.extend(res['hits']['hits']) scroll_id = res['_scroll_id'] while True: # 每次请求都传递scroll参数续期,且使用上一次返回的最新scroll_id res = es.scroll(scroll_id=scroll_id, scroll=scroll_expire) current_hits = res['hits']['hits'] # 无新数据时终止循环 if not current_hits: break rows.extend(current_hits) # 更新scroll_id为最新返回值 scroll_id = res['_scroll_id'] # 拉取完成后主动清理scroll上下文,释放Elasticsearch服务端资源 es.clear_scroll(scroll_id=scroll_id)
额外优化建议
- 如果你的Elasticsearch版本为7.10及以上,更推荐用
search_after接口替代scroll做海量数据拉取,scroll更适合一次性快照场景,服务端资源占用比search_after更高。 - 如果拉取过程中不需要将全量数据存储到内存,可以在每次拿到
current_hits时直接处理对应数据,避免内存溢出。
内容的提问来源于stack exchange,提问作者Ayaz49
相关产品推荐
相关产品推荐

