如何使用MS Excel快速提取JS文件中的日语内容
高效提取JS/JSON文件中的日语文本方案
针对你用Excel文本分列处理慢的问题,推荐以下两种高效实现方式,直接解析JSON结构提取目标内容:
方法一:Python脚本(通用且灵活)
Python对JSON格式的处理非常友好,适合批量处理多个文件,代码逻辑清晰易调整:
import json # 读取目标JS/JSON文件(注意文件实际是JSON格式) with open("your_file.json", "r", encoding="utf-8") as f: data = json.load(f) # 提取所有日语文本 japanese_text = [] for event in data.get("events", []): for seg in event.get("segs", []): utf8_content = seg.get("utf8", "") # 保留日语字符和换行符,可根据需求调整过滤规则 if utf8_content.strip() or utf8_content == "\n": japanese_text.append(utf8_content) # 合并内容并保存到TXT文件 with open("output_japanese.txt", "w", encoding="utf-8") as f: f.write("".join(japanese_text))
使用步骤:
- 将上述代码保存为
extract_japanese.py - 把待处理的文件命名为
your_file.json(或修改代码中的文件名) - 运行脚本:
python extract_japanese.py
方法二:jq命令行工具(快速无代码)
如果你熟悉命令行,jq是专门处理JSON的工具,一行命令就能完成提取:
jq -r '.events[] | .segs[] | .utf8' your_file.json | tr -d '\r' > output_japanese.txt
命令说明:
.events[]:遍历所有events元素.segs[]:遍历每个event下的segs元素.utf8:提取utf8字段的值tr -d '\r':去除多余的回车符(可选,根据文件格式调整)> output_japanese.txt:将结果写入输出文件
优势说明
这两种方法都直接针对JSON结构解析,避免了Excel文本分列的低效字符串切割,处理大文件时速度提升明显,且能精准提取目标内容,不会混入无关数据。
内容的提问来源于stack exchange,提问作者Zhar_ Eng
相关产品推荐
相关产品推荐

