You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Polars LazyDataFrame时with_columns_seq链式操作遇ComputeError重复列名问题

解决Polars LazyDataFrame列名重复的问题

你的问题出在对review列的多次操作都是独立生成同名列,导致Polars无法区分。正确的做法是将这些操作链式串联,让每个步骤基于前一步的处理结果,最终只生成一个目标列。

修改后的代码:

from bs4 import BeautifulSoup
import polars as pl

df = (
    df
    .with_columns_seq([
        pl.col('sentiment').cast(pl.UInt8),
        pl.col('review')
            .map_elements(lambda x: BeautifulSoup(x).get_text())
            .str.replace(r"[^a-zA-Z0-9]", " ")
            .str.to_lowercase()
            .alias('review')  # 用alias指定最终列名为review,覆盖原列
        # 如果需要保留原始review列,可以把alias改成新名字,比如'cleaned_review'
    ])
)

df.collect().head()

关键说明

  • 链式调用:对pl.col('review')依次调用map_elements、str.replace、str.to_lowercase,每个操作都基于上一步的输出,而非重复读取原始列。
  • .alias('review'):指定最终生成的列名为review,直接覆盖原列;若需保留原始数据,可将别名改为其他名称(如cleaned_review)。

额外优化建议

map_elements是逐行处理,性能较低。如果你的HTML内容结构简单,可以尝试用Polars原生的字符串方法替代BeautifulSoup,比如:

pl.col('review').str.replace_all(r'<.*?>', '')  # 简单移除HTML标签,适合结构简单的内容

这样能充分利用Polars的向量化处理能力,提升运行效率。

内容的提问来源于stack exchange,提问作者Prateek Pravanjan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.28 11:03:21