如何提取DataFrame每列最高频词拼成句子并添加至DataFrame最后一行
实现代码及说明
- 依赖pandas库实现,核心用
mode()方法直接获取每列最高频值,代码示例如下:
import pandas as pd # 1. 获取每列的最高频值,mode()返回所有频次最高的元素,取第一行默认取最先出现的最高频值 col_most_freq = df.mode(numeric_only=False).iloc[0] # 2. 按列顺序拼接为完整句子,可根据需求调整分隔符(比如不需要分隔符就把' '改成'') full_sentence = ' '.join(col_most_freq.astype(str)) # 3. 添加到DataFrame最后一行,下面提供两种常见场景的写法,按需选择 # 场景A:最后一行每个单元格对应放所属列的最高频值 df.loc[len(df)] = col_most_freq # 场景B:最后一行所有单元格都放拼接好的完整句子 # df.loc[len(df)] = [full_sentence] * df.shape[1]
- 边界处理说明:如果某列存在多个频次相同的最高频元素,默认取最先出现的元素,你可以按需修改排序规则调整取值;如果需要跳过空值统计,保持
mode()默认参数dropna=True即可。
内容的提问来源于stack exchange,提问作者lyo canty
相关产品推荐
相关产品推荐

