Python实现从表格列文本中提取cmp/与/reviews间的公司名称
从Indeed链接中提取公司名称的实现方案
你要提取的内容有明确的固定前后缀特征,直接用正则匹配捕获即可,不需要预设公司名称库,通用方案如下:
核心正则规则
匹配规则为cmp\/([^\/]+)\/reviews,逻辑说明:
- 先匹配固定前缀
cmp/ - 捕获组
([^\/]+)抓取所有不包含斜杠/的字符,也就是目标公司名称 - 最后匹配固定后缀
/reviews,确保定位精准不会误抓其他内容
不同工具的实现方式
表格工具(Excel/WPS/Google Sheets)
直接使用内置正则提取函数即可,假设链接存放在A列,对应公式为:=REGEXEXTRACT(A1, "cmp\/([^\/]+)\/reviews")
输入后下拉即可批量完成整列提取。
Python 批量处理
如果需要处理大量数据,可以用pandas批量处理表格:
import pandas as pd import re # 读取原始表格 df = pd.read_excel("你的原始表格路径.xlsx") # 定义提取逻辑 def get_company_name(content): res = re.search(r"cmp\/([^\/]+)\/reviews", str(content)) return res.group(1) if res else "" # 生成提取结果列 df["公司名称"] = df["存储链接的列名"].apply(get_company_name) # 导出结果 df.to_excel("提取完成的表格.xlsx", index=False)
其他工具
只要工具支持正则捕获功能,直接套用上面的核心正则规则,取第一个捕获组的返回值即可完成提取。

内容的提问来源于stack exchange,提问作者Mr_12
相关产品推荐
相关产品推荐

