You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

能否将现有查询转为ALTER TABLE操作删除重复ride_id行?求更优方案

问题解答

原查询能否用于删除重复行?

原查询仅能筛选出ride_id重复的行(即row_num > 1的记录),无法直接执行删除操作。要实现删除,需要将这个筛选逻辑整合到DELETE语句中,通过匹配重复行的字段来删除目标记录。

更简便的实现方式

方式1:结合QUALIFY子句的DELETE语句(BigQuery适用)

利用BigQuery支持的QUALIFY子句,可直接筛选重复行并删除,无需多层嵌套子查询:

DELETE FROM `cyclistic-429604.yearly_csv.nu_null`
WHERE STRUCT(ride_id, rideable_type, started_at, ended_at, start_station_name, start_station_id, end_station_name, start_lat, start_lng, end_lat, end_lng, member_casual) IN (
  SELECT AS STRUCT *
  FROM `cyclistic-429604.yearly_csv.nu_null`
  QUALIFY ROW_NUMBER() OVER (PARTITION BY ride_id ORDER BY ride_id) > 1
);

方式2:直接重建表去重(保留每个ride_id的一行)

如果不需要保留删除过程的中间记录,可通过重建表的方式快速去重:

CREATE OR REPLACE TABLE `cyclistic-429604.yearly_csv.nu_null` AS
SELECT *
FROM (
  SELECT 
    *,
    ROW_NUMBER() OVER (PARTITION BY ride_id ORDER BY ride_id) AS row_num
  FROM `cyclistic-429604.yearly_csv.nu_null`
)
WHERE row_num = 1;

补充说明

  • 原查询中ORDER BY ride_id可替换为其他字段(如started_at),用来指定保留哪一行(最早/最晚的记录);若无需特定顺序,保留ORDER BY ride_id即可。
  • 若你的SQL环境支持DISTINCT ON(如PostgreSQL),还可以用更简洁的写法:
CREATE OR REPLACE TABLE your_table AS
SELECT DISTINCT ON (ride_id) *
FROM your_table
ORDER BY ride_id;

内容的提问来源于stack exchange,提问作者shawn McGuirk

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.20 14:05:08