为何itertools.combinations对象启动循环后内容就消失了?
问题根因
itertools.combinations 返回的是一次性迭代器对象,并非列表、元组这类可重复遍历的持久化容器。迭代器的运行逻辑是惰性生成元素,每遍历一个元素就会向后移动指针,全部遍历完成后就没有剩余元素可供读取,也就是被“消耗”完了。
你代码中第一次执行 len(list(image_pairs)) 时,已经把迭代器生成的所有21325546个组合全部取出转成了列表,这时候迭代器指针已经走到末尾,没有任何剩余元素。后续不管是再次转列表统计长度,还是写for循环遍历,都读不到内容,自然会打印0、循环体无输出。
修复方案
根据你的内存情况二选一即可:
- 内存充足的场景:第一次生成组合时直接转成列表存为变量,后续所有操作都基于这个列表执行,列表是支持无限次重复遍历的。
修正后的完整代码:from itertools import combinations import os root = "/root/code/set1/" folders = "images" os.chdir(root+folders) with open(os.path.join(root, root.split("/")[-1]+"_results.txt"), 'w') as f: metrics = ["cosine", "euclidean"] print("starting the loop") jresults = {} images = os.listdir(os.path.join(root, folders)) images = [image for image in images if image.endswith(".jpg")] # 第一次生成就转列表持久化存储 image_pairs = list(combinations(images, 2)) print("number of pairs: {}".format(len(image_pairs))) for metric in metrics: print("metric: {}".format(metric)) print("number of pairs: {}".format(len(image_pairs))) for img1, img2 in image_pairs: print("img1: {}, img2: {}".format(img1, img2)) - 内存不足的场景:两千多万个二元组占用内存较高,如果不想一次性加载全量数据到内存,每次需要遍历组合前重新生成
combinations迭代器即可。注意只要对迭代器做了list()转换、for循环遍历这类消费操作,下次要用就得重新生成。
核心修改逻辑示例:# 首次统计数量时临时生成迭代器 print("number of pairs: {}".format(len(list(combinations(images, 2))))) for metric in metrics: print("metric: {}".format(metric)) # 统计长度前重新生成迭代器 pair_for_count = combinations(images, 2) print("number of pairs: {}".format(len(list(pair_for_count)))) # 遍历时再次重新生成迭代器 image_pairs = combinations(images, 2) for img1, img2 in image_pairs: print("img1: {}, img2: {}".format(img1, img2))
小提示:所有
itertools模块返回的迭代器对象(比如permutations、product、chain等)都有这个一次性消费的特性,使用时要注意不要提前消耗迭代器导致后续逻辑拿不到数据。
内容的提问来源于stack exchange,提问作者shenglih
相关产品推荐
相关产品推荐

