You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python实现从表格列文本中提取cmp/与/reviews间的公司名称

从Indeed链接中提取公司名称的实现方案

你要提取的内容有明确的固定前后缀特征,直接用正则匹配捕获即可,不需要预设公司名称库,通用方案如下:

核心正则规则

匹配规则为cmp\/([^\/]+)\/reviews,逻辑说明:

  • 先匹配固定前缀cmp/
  • 捕获组([^\/]+)抓取所有不包含斜杠/的字符,也就是目标公司名称
  • 最后匹配固定后缀/reviews,确保定位精准不会误抓其他内容

不同工具的实现方式

表格工具(Excel/WPS/Google Sheets)

直接使用内置正则提取函数即可,假设链接存放在A列,对应公式为:
=REGEXEXTRACT(A1, "cmp\/([^\/]+)\/reviews")
输入后下拉即可批量完成整列提取。

Python 批量处理

如果需要处理大量数据,可以用pandas批量处理表格:

import pandas as pd
import re

# 读取原始表格
df = pd.read_excel("你的原始表格路径.xlsx")

# 定义提取逻辑
def get_company_name(content):
    res = re.search(r"cmp\/([^\/]+)\/reviews", str(content))
    return res.group(1) if res else ""

# 生成提取结果列
df["公司名称"] = df["存储链接的列名"].apply(get_company_name)

# 导出结果
df.to_excel("提取完成的表格.xlsx", index=False)

其他工具

只要工具支持正则捕获功能,直接套用上面的核心正则规则,取第一个捕获组的返回值即可完成提取。

示例图片

内容的提问来源于stack exchange,提问作者Mr_12

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.04 09:36:00