合并多JSON文件并统计文本出现次数:实现语言与云端可行性咨询
编程语言选择推荐
Python
- 优势:语法简洁,处理JSON和文件操作的核心库(
json、os、collections)均为标准库,无需额外安装,上手成本低。 - 实现逻辑:
- 用
os.walk遍历目标文件夹下所有JSON文件; - 用
json.load读取每个文件内容(假设JSON内容为列表格式,若为字典需调整取值逻辑); - 用
collections.Counter累计统计所有文本的出现次数; - 将统计结果写入文本文件,格式为
文本,次数。
- 用
- 示例代码:
import os import json from collections import Counter count_counter = Counter() target_folder = "./your_json_dir" # 遍历文件夹内所有JSON文件 for root, _, files in os.walk(target_folder): for file in files: if file.endswith(".json"): file_path = os.path.join(root, file) with open(file_path, "r", encoding="utf-8") as f: json_data = json.load(f) count_counter.update(json_data) # 导出统计结果 with open("count_result.txt", "w", encoding="utf-8") as f: for item, count in count_counter.items(): f.write(f"{item},{count}\n")
Bash(适用于Linux/macOS环境)
- 优势:无需编写复杂脚本,通过命令行工具组合即可快速完成,适合熟悉终端操作的用户。
- 实现逻辑:用
jq解析JSON内容,结合sort、uniq完成次数统计,最终输出到文件。 - 示例命令:
# 遍历目标文件夹,解析JSON并统计 find ./your_json_dir -name "*.json" -exec jq -r '.[]' {} \; | sort | uniq -c | awk '{print $2","$1}' > count_result.txt
云端实现可行性
完全可以在云端完成,推荐几种方案:
- 云服务器(如EC2、阿里云ECS):将JSON文件夹上传至服务器,运行上述Python脚本或Bash命令,完成后下载统计结果即可。
- 无服务器函数(如Lambda、阿里云函数计算):将统计代码打包为无服务器函数,配置触发规则(例如当JSON文件上传至云存储时自动执行),统计结果直接存入云存储(如S3、OSS)。
- 在线代码平台(如Replit):上传JSON文件至平台,运行Python脚本,直接导出统计结果。
内容的提问来源于stack exchange,提问作者Moeen
相关产品推荐
相关产品推荐

