如何使用Python借助Elasticsearch为JSON格式文件创建索引?
解决方案(来自Stack Overflow资深用户)
Hey,刚看了你的代码,给你梳理几个关键问题和调整步骤,都是新手常踩的坑:
1. 先搞定ES连接问题
你写的es = Elasticsearch()默认连本地9200,但如果ES不在本地、端口改了或者开了身份验证,直接这么写肯定连不上。先加个连接测试:
# 改成明确的连接地址,有账号密码的话要加上(比如 Elasticsearch("http://user:pass@localhost:9200")) es = Elasticsearch("http://localhost:9200") # 先测能不能连上 if not es.ping(): raise ValueError("麻了,连不上Elasticsearch!检查下地址、端口或者服务有没有启动")
2. 赶紧删掉doc_type参数!
从ES 7.x开始就废弃doc_type了,8.x直接把这个参数移除了,你现在加这个参数运行肯定报错,调用helpers.bulk的时候删掉doc_type='my-type'就行。
3. 修复load函数的文档生成逻辑
你的load现在是把整个JSON文件内容当成一个文档扔给bulk,但大部分时候我们的JSON文件是数组格式(比如[{"id":1, "name":"a"}, {"id":2, "name":"b"}]),这时候得遍历数组里的每个元素,逐个生成文档:
def load(filename): if filename.endswith('.json'): with open(filename, 'r', encoding='utf-8') as open_file: data = json.load(open_file) # 如果是多文档数组,遍历每个元素 if isinstance(data, list): for item in data: # 建议给每个文档加个_id,避免重复插入报错(用你文档里的唯一字段,比如id) if "id" in item: item["_id"] = item["id"] yield item else: # 单个文档的情况直接返回 yield data
要是你的JSON是单个对象,那原来的写法没问题,但多文档必须这么改,不然bulk会把整个数组当成一个超大文档插入,肯定炸。
4. 提前手动创建索引(可选但推荐)
ES虽然能自动创建索引,但自动生成的映射可能不符合你的预期(比如把日期当成字符串),最好提前手动创建:
# 先检查索引是否存在,不存在就创建 if not es.indices.exists(index="my-index"): es.indices.create( index="my-index", body={ "mappings": { "properties": { # 这里根据你的文档字段定义,举个例子: "title": {"type": "text"}, "content": {"type": "text"}, "create_time": {"type": "date", "format": "yyyy-MM-dd HH:mm:ss"} } } } )
5. 加个错误捕获,看具体报错
运行的时候加个try-except,能看到完整的错误信息,方便排查:
try: success_count, failed_items = helpers.bulk(es, load(sys.argv[1]), index='my-index') print(f"搞定!成功插入{success_count}条,失败{len(failed_items)}条") except Exception as e: print(f"报错详情:{str(e)}")
把这些调整完,应该就能正常跑起来了。要是还有具体的报错信息,再贴出来我帮你接着排查~
内容的提问来源于stack exchange,提问作者AaySquare
相关产品推荐
相关产品推荐

