Python 3.6循环重复输出问题排查与优化咨询
问题分析与解决方案
咱们先拆解你遇到的两个核心问题:输出重复7次和函数内DataFrame的优化,再逐一解决:
1. 为什么输出会重复7次?
你的代码里有两个关键逻辑导致了重复:
- 循环遍历了7个有效域名:
city = [0,1,2,3,4,5,6,7],然后for i in city中,i>0的情况刚好有7次(i从1到7)。每次循环里,你都会把整个p列表(24个链接)拼接上当前i后加入p1,相当于p1里会存入7组不同域名前缀的链接。如果你的预期是只生成一组链接(比如只针对某一个域名),那这个循环就是多余的——你误把多域名的遍历写成了重复填充同一结构链接的逻辑。 - 误用
%timeit命令:%timeit是Jupyter用来测试代码执行耗时的魔法命令,它会自动重复执行目标函数多次(默认会跑足够多轮次来得到稳定的耗时数据)。如果你的函数里有写文件操作(pp.to_csv),这会导致文件被多次写入/覆盖,看起来像是重复生成了多次输出。
2. 如何修正代码?
根据你的需求,分两种情况处理:
情况A:需要爬取7个域名的所有对应链接(预期输出是7×24条链接)
如果这是你的真实需求,那当前的链接收集逻辑是对的,但可以优化代码结构,避免误解:
import pandas as pd def firstpage(): # 只保留有效域名索引(去掉0,对应7个域名) valid_cities = [1,2,3,4,5,6,7] p1 = [] # 定义固定的路径后缀 path_suffixes = [f'a{x}' for x in range(24)] for city_idx in valid_cities: for suffix in path_suffixes: page_url = f'https://www.uno.com/{city_idx}/{suffix}' p1.append(page_url) # 生成DataFrame并保存 pp = pd.DataFrame(p1, columns=['Links']) pp.to_csv('Test.csv', index=False) return pp # 注意:不要用%timeit执行有写文件副作用的函数!直接调用即可 AllFirstPages = firstpage()
情况B:只需要生成一组链接(比如针对某一个域名)
那你需要去掉外层的域名循环,或者指定单个域名索引:
import pandas as pd def firstpage(target_city_idx): path_suffixes = [f'a{x}' for x in range(24)] p1 = [f'https://www.uno.com/{target_city_idx}/{suffix}' for suffix in path_suffixes] pp = pd.DataFrame(p1, columns=['Links']) pp.to_csv('Test.csv', index=False) return pp # 传入你需要的单个域名索引(比如1) AllFirstPages = firstpage(1)
3. 如何把DataFrame放在函数外处理?
如果你希望把DataFrame的创建和保存逻辑移到函数外,可以让函数只负责收集链接列表,后续操作在函数外完成:
import pandas as pd def collect_links(): valid_cities = [1,2,3,4,5,6,7] path_suffixes = [f'a{x}' for x in range(24)] all_links = [] for city_idx in valid_cities: all_links.extend([f'https://www.uno.com/{city_idx}/{suffix}' for suffix in path_suffixes]) return all_links # 函数外处理DataFrame raw_links = collect_links() AllFirstPages = pd.DataFrame(raw_links, columns=['Links']) AllFirstPages.to_csv('Test.csv', index=False)
最后提醒:永远不要用%timeit执行带有写文件、数据库写入等副作用的函数,它会重复执行你的代码,导致不必要的重复操作或数据覆盖。
内容的提问来源于stack exchange,提问作者Silviu
相关产品推荐
相关产品推荐

