You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在R中提取CSV对话文本中的英文与西班牙语文本方案咨询

批量提取CSV中英西双语内容的解决方案

推荐工具:Python + pandas + re

这是最高效的批量处理方案,无需手动逐个单元格操作,直接处理整个CSV文件。

步骤说明

  1. 先安装依赖(如果没装过):
pip install pandas
  1. 运行以下代码(替换成你的文件路径和列名):
import pandas as pd
import re

# 读取CSV文件,把'transcript'改成你实际的对话列名
df = pd.read_csv('你的对话文件.csv')

# 正则匹配方括号内的西班牙语内容
spanish_regex = re.compile(r'\[(.*?)\]')

# 提取所有西班牙语片段,用空格连接
df['spanish_content'] = df['transcript'].apply(lambda text: ' '.join(spanish_regex.findall(text)))

# 提取英文:移除所有方括号及内部内容,清理多余空格
df['english_content'] = df['transcript'].apply(lambda text: re.sub(r'\[.*?\]', '', text).strip())
df['english_content'] = df['english_content'].apply(lambda text: re.sub(r'\s+', ' ', text))

# 导出为独立文件
df['english_content'].to_csv('英文内容.csv', index=False, header=['英文'])
df['spanish_content'].to_csv('西班牙语内容.csv', index=False, header=['西班牙语'])

关键细节解释

  • re.compile(r'\[(.*?)\]'):用非贪婪匹配精准抓取每一个方括号内的西语内容,避免误匹配跨多个方括号的文本
  • apply方法:批量对CSV的每一行执行提取逻辑,全程自动化
  • to_csv参数:index=False避免生成多余的索引列,header可以自定义导出文件的列名

备选:Excel内置公式(适合不想写代码的场景)

如果不想用Python,也可以用Excel公式批量处理,但效率不如代码:

  • 提取西班牙语(需选中整列输入后按Ctrl+Shift+Enter触发数组公式):
    =TEXTJOIN(" ",TRUE,IF(ISNUMBER(SEARCH("]",A:A)),MID(A:A,SEARCH("[",A:A)+1,SEARCH("]",A:A)-SEARCH("[",A:A)-1),""))
    
  • 提取英文:
    =TRIM(CLEAN(SUBSTITUTE(SUBSTITUTE(A1,"[",""),"]","")))
    
    下拉公式覆盖所有行后,复制结果列粘贴到新文件即可。

内容的提问来源于stack exchange,提问作者CogNeuro123

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.01 04:30:59