You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python正则提取分包商数据:number_subcontractors数值异常求助

问题分析与解决方案

常见偏差原因

  • 分包商数据未清洗:同一个分包商的名称/地址存在大小写差异、多余空格、换行符或标点(比如"ABC Corp"和"abc corp"、"123 Main St"和"123 Main St."),导致被识别为不同条目。
  • 计数逻辑错误:未按bidder_id分组后对分包商(名称+地址组合)去重,而是直接统计所有出现次数,或者误将非分包商内容纳入计数。
  • TXT解析不规范:读取文件时未正确分割分包商块(比如分包商条目之间的分隔符识别错误),导致拆分出无效或重复的条目。
  • 跨文件重复计数:同一个分包商在多个TXT文件中对应同一个bidder_id,但未在全局聚合时去重,导致重复累加。

分步解决方法

1. 标准化分包商数据

先对分包商的名称和地址做清洗,消除格式差异:

import pandas as pd
import re

def clean_subcontractor(text):
    # 去除多余空格、换行、制表符
    text = re.sub(r'\s+', ' ', text).strip()
    # 统一转为小写
    text = text.lower()
    # 去除末尾的标点(比如句号、逗号)
    text = re.sub(r'[.,;]+$', '', text)
    return text

2. 正确读取并解析TXT文件

假设每个TXT文件对应一个bidder_id,文件中包含分包商列表和投标项目,需按规则提取目标内容(示例规则可根据你的实际文件结构调整):

def parse_txt_file(file_path):
    with open(file_path, 'r', encoding='utf-8') as f:
        content = f.read()
    
    # 从文件名提取bidder_id(示例:文件名格式为"bidder_123.txt")
    bidder_id = file_path.split('_')[-1].split('.')[0]
    
    # 提取分包商区块(假设分包商以"Subcontractors:"开头、"Items:"结尾)
    sub_start = content.find('Subcontractors:') + len('Subcontractors:')
    sub_end = content.find('Items:')
    subcontractors_raw = content[sub_start:sub_end].strip().split('\n\n')  # 假设分包商之间用空行分隔
    
    # 清洗并去重分包商
    unique_subs = set()
    for sub in subcontractors_raw:
        if sub.strip():
            cleaned = clean_subcontractor(sub)
            unique_subs.add(cleaned)
    
    # 提取投标项目
    items_start = content.find('Items:') + len('Items:')
    items = content[items_start:].strip().split('\n')
    items = [item.strip() for item in items if item.strip()]
    
    return {
        'bidder_id': bidder_id,
        'number_subcontractors': len(unique_subs),
        'items': items
    }

3. 批量处理文件并生成DataFrame

import os

# 替换为你的TXT文件目录
txt_dir = './bidder_documents'
data = []
for filename in os.listdir(txt_dir):
    if filename.endswith('.txt'):
        file_path = os.path.join(txt_dir, filename)
        file_data = parse_txt_file(file_path)
        data.append(file_data)

# 生成目标DataFrame
df = pd.DataFrame(data)

4. 验证计数准确性

可以通过以下代码抽查结果是否符合预期:

def get_cleaned_subs(file_path):
    with open(file_path, 'r', encoding='utf-8') as f:
        content = f.read()
    sub_start = content.find('Subcontractors:') + len('Subcontractors:')
    sub_end = content.find('Items:')
    subcontractors_raw = content[sub_start:sub_end].strip().split('\n\n')
    return [clean_subcontractor(sub) for sub in subcontractors_raw if sub.strip()]

# 随机选一个文件验证
sample_file = os.path.join(txt_dir, 'bidder_456.txt')
print("清洗后的分包商列表:", get_cleaned_subs(sample_file))
print("实际计数:", len(get_cleaned_subs(sample_file)))

关键注意事项

  • 务必以名称+地址的组合作为分包商的唯一标识,不能单独用名称或地址去重,避免误判。
  • 必须根据你的实际TXT文件格式调整解析规则(比如分包商的分隔符、bidder_id的提取逻辑),上述示例为通用模板。

内容的提问来源于stack exchange,提问作者Pepa

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 08:12:21