如何使用Numpy.vectorize高效遍历Pandas DataFrame并传入整行参数
问题原因及解决方法
问题原因
你之前的代码不符合预期,本质是numpy.vectorize的适用场景和需求不匹配:numpy.vectorize默认会对输入的可迭代对象按逐元素拆分,传入整个DataFrame时它会按列遍历,第一个列tweets_id会被直接当作第一个参数传入自定义函数,自然拿不到整行数据。
解决方法
- 方法1:用Pandas自带的
apply按行遍历(最常用,代码简洁)
设置axis=1即可指定按行遍历,每一行会以Pandas Series对象的形式传入自定义函数,可以直接通过列名取值:
import pandas as pd # 自定义函数,第一个参数接收单行Series def process_row(row, hg): print(hg + str(row['tweets_id']) + row['tokenized_text']) # 构造DataFrame逻辑不变 df = pd.DataFrame.from_records(belongs_node, columns=['tweets_id','tokenized_text']) # 调用apply,axis=1指定按行遍历,额外参数直接加在后面即可 df.apply(process_row, axis=1, hg="#Python")
- 方法2:转字典列表遍历(可读性更高,适合小数据量场景)
如果不习惯Series的取值方式,可以把DataFrame转成字典列表再遍历:
def process_row(row_dict, hg): print(hg + str(row_dict['tweets_id']) + row_dict['tokenized_text']) df = pd.DataFrame.from_records(belongs_node, columns=['tweets_id','tokenized_text']) for row in df.to_dict("records"): process_row(row, "#Python")
- 方法3:矢量化运算(性能最优,适合无特殊逐行逻辑的场景)
如果你只是需要拼接字符串生成新列,完全不需要遍历,直接用Pandas自带的矢量化操作即可,性能比遍历高几十到上百倍:
df = pd.DataFrame.from_records(belongs_node, columns=['tweets_id','tokenized_text']) df['new_col'] = "#Python" + df['tweets_id'].astype(str) + df['tokenized_text'] # 如果需要打印直接输出整列即可 print(df['new_col'])
注意事项
numpy.vectorize本质是对numpy数组做元素级处理的封装,不是为Pandas的行遍历设计的,日常处理Pandas行数据优先用apply或者矢量化操作即可。
内容的提问来源于stack exchange,提问作者Minitorr
相关产品推荐
相关产品推荐

