You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark中基于已有索引列查找数据:查询结果恒为0

在PySpark中查找匹配数据的原有索引

你的问题出在误用了monotonically_increasing_id()——这个函数是用来生成新的递增ID,和你数据集中已有的索引列毫无关系。当filter后只剩一行数据时,生成的新ID自然是0,这就是结果始终为0的原因。

正确的做法是直接提取数据集中已存在的索引列值,步骤如下:

1. 提取单个匹配行的索引

假设你的数据集里已有的索引列名为movie_index(请替换成你实际的列名),代码如下:

matched_row = movies.filter(movies["title"] == close_match).select("movie_index").first()
if matched_row:
    index_movies = matched_row["movie_index"]
    print(index_movies)
else:
    print("未找到匹配的电影标题")

2. 提取所有匹配行的索引

如果存在多个行匹配同一个电影标题,可以用collect()获取所有索引:

matched_indices = [row["movie_index"] for row in movies.filter(movies["title"] == close_match).select("movie_index").collect()]
print(matched_indices)

注意事项

  • 确保close_match与数据集中title列的内容完全匹配(包括大小写、空格、特殊字符等),否则filter会返回空结果。
  • 如果原索引列不是整数类型,根据实际类型处理即可。

内容的提问来源于stack exchange,提问作者Rifqi Hilal

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.07 10:35:18