如何将以缩进标记观测值的TXT文件导入R语言?
处理人口普查相邻县缩进格式TXT文件的解决方案
针对你这种主县无缩进、相邻县缩进的制表符分隔TXT文件,完全可以用Python脚本批量处理,不用手动操作。以下是具体实现步骤:
核心思路
- 逐行读取文件,识别无缩进的主县行,记录当前主县的名称和FIPS码
- 遇到缩进的相邻县行,就将其与当前主县配对,存入结果列表
- 最后将配对结果导出为规范的CSV文件,方便后续导入分析工具
代码实现
import pandas as pd # 初始化存储相邻县配对的列表 neighbor_pairs = [] current_county = None current_fips = None # 替换为你的实际文件路径 file_path = "county_neighbors.txt" with open(file_path, 'r', encoding='utf-8') as f: for line in f: stripped_line = line.strip() if not stripped_line: continue # 跳过空行 # 按制表符分割行内容,清理空元素 parts = [p for p in stripped_line.split('\t') if p] # 判断是否为主县行(示例中主县行是4列,相邻县行是2列) if len(parts) == 4: # 提取主县名称和FIPS码(去掉引号) current_county = parts[0].strip('"') current_fips = parts[1] elif len(parts) == 2: # 提取相邻县名称和FIPS码 neighbor_county = parts[0].strip('"') neighbor_fips = parts[1] # 存入配对信息 neighbor_pairs.append({ '主县': current_county, '主县FIPS': current_fips, '相邻县': neighbor_county, '相邻县FIPS': neighbor_fips }) # 转换为DataFrame并导出为CSV df = pd.DataFrame(neighbor_pairs) df.to_csv("cleaned_county_neighbors.csv", index=False, encoding='utf-8') print("处理完成,已生成规范的相邻县对应表")
注意事项
- 如果你的文件缩进是多个空格而非制表符,把
stripped_line.split('\t')替换为re.split(r'\s+', stripped_line)(需要先导入import re) - 若实际文件的列数与示例有差异,调整
len(parts)的判断条件即可 - 导出的CSV文件可以直接导入Excel、R、Stata或继续用Python做后续分析
内容的提问来源于stack exchange,提问作者Jonathon Siegle
相关产品推荐
相关产品推荐

