You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在Pandas DataFrame中为文档内单词添加专属ID

给文档内单词生成专属ID的Pandas解决方案

嘿,我来帮你搞定这个需求!要给每个文档里的每个单词生成专属ID,同时加上COUNT列,用Pandas就能轻松实现,咱们分情况来处理:

先模拟你的原始数据

假设你的原始DataFrame长这样(每个DOCUMENT_ID对应多个单词):

import pandas as pd

data = {
    "DOCUMENT_ID": ["262056708396949504"]*8,
    "WORD": ["DVD", "Girls", "Gone", "Gras", "Hurricane", "Katrina", "Mardi", "Wild"]
}
df = pd.DataFrame(data)

情况1:生成全局唯一的单词ID(所有文档统一排序)

如果想要像你示例里那样,所有单词按顺序拥有全局唯一的ID(从0开始递增),直接用reset_index()就能生成,再加上COUNT列:

# 生成全局专属ID
df["ID"] = df.reset_index().index
# 每个单词的COUNT设为1
df["COUNT"] = 1
# 调整成你要的列顺序
df = df[["ID", "DOCUMENT_ID", "WORD", "COUNT"]]

运行后就能得到每个单词对应唯一全局ID的结果。


情况2:生成文档内的专属ID(每个文档内从0开始计数)

如果希望每个文档内的单词ID独立从0开始排序,就用groupby配合cumcount():

# 按文档分组,生成组内专属ID
df["ID"] = df.groupby("DOCUMENT_ID").cumcount()
# 新增COUNT列
df["COUNT"] = 1
# 调整列顺序
df = df[["ID", "DOCUMENT_ID", "WORD", "COUNT"]]

这样每个DOCUMENT_ID下的单词都会从0开始生成专属ID。


情况3:加上文档单词数汇总行(和你示例格式完全匹配)

如果你需要像示例里那样,先有一行统计该文档的总单词数,再列出每个单词的信息,可以这么搞:

# 第一步:生成文档单词数的汇总行
doc_summary = df.groupby("DOCUMENT_ID").size().reset_index(name="COUNT")
doc_summary["WORD"] = doc_summary["COUNT"].astype(str)  # WORD列显示总数量
doc_summary["ID"] = 0  # 汇总行的ID设为0

# 第二步:给每个单词行生成从1开始的ID
word_details = df.copy()
word_details["ID"] = range(1, len(word_details)+1)
word_details["COUNT"] = 1

# 第三步:合并汇总行和单词行
final_df = pd.concat([doc_summary, word_details], ignore_index=True)
# 调整成目标列顺序
final_df = final_df[["ID", "DOCUMENT_ID", "WORD", "COUNT"]]

运行后就会得到和你示例完全一致的格式啦!

内容的提问来源于stack exchange,提问作者lpt

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.26 08:33:17