使用pandas读取BLS的bp.measure文件并提取指定两列的方法求助
问题原因
该数据集的列采用多段空白字符分隔,而非单个制表符,因此你之前设置sep='\t'无法拆分两列,导致出现合并为单列的情况,同时首行的BP measure属于额外的标题行需要跳过。
解决代码
import pandas as pd url = 'https://download.bls.gov/pub/time.series/bp/bp.measure' # sep='\s+' 匹配任意数量的空白字符作为分隔符,skiprows=1 跳过首行标题 df = pd.read_csv(url, sep='\s+', skiprows=1)
运行后直接获取的df就自带measure_code和measure_text两列,无需额外处理。你可以执行print(df.columns)验证输出结果。
内容的提问来源于stack exchange,提问作者gr7
相关产品推荐
相关产品推荐

