SQL Server:如何基于sVisitID列去除SELECT结果中的重复项
解决重复sVisitID的问题
看起来你的查询里虽然用了DISTINCT,但它是对整行数据去重,而不是针对sVisitID单独去重——只要其他字段(比如时间戳、经纬度之类的)有细微差异,即使sVisitID重复,整行还是会被保留下来。要只保留每个sVisitID的一条记录,最稳妥的方法是用窗口函数ROW_NUMBER()来分组筛选。
修改后的SQL语句
SELECT [Rep Name], [ID], [Date], [Store Name], [Region], [Map] FROM ( SELECT MyReps.[sName] as 'Rep Name', MyData.[sVisitID] as 'ID', CAST(MyData.[sDate] AS DATE) as 'Date', MyData.[sClientName] as 'Store Name', MyData.[sState] as 'Region', CAST(MyData.[sLatitudeStart] AS VARCHAR(100)) + ',' + CAST(MyData.[sLongitudeStart] as varchar(100)) as 'Map', -- 按sVisitID分组,每组内按开始时间排序,给行编号 ROW_NUMBER() OVER (PARTITION BY MyData.[sVisitID] ORDER BY MyData.[sDateAndTimeStart]) AS rn FROM (SELECT * FROM [tblRepresentatives] WHERE [sActive] = 'True') as MyReps -- 注意:原WHERE里有MyData.[sClientName] IS NOT NULL,所以FULL OUTER JOIN等价于INNER JOIN INNER JOIN (SELECT * FROM [tblVisits] WHERE CAST([sDate] AS DATE) = CAST(GETDATE()-1 AS DATE)) AS MyData ON MyReps.[sName] = MyData.[sRepresentativeName] WHERE MyData.[sClientName] IS NOT NULL AND [sDateAndTimeStart] <> [sDateAndTimeEnd] ) AS RankedVisits -- 只保留每个sVisitID的第一条记录 WHERE rn = 1 ORDER BY [Store Name] DESC
关键说明
ROW_NUMBER() OVER (PARTITION BY MyData.[sVisitID] ORDER BY MyData.[sDateAndTimeStart]):这部分会把相同sVisitID的记录归为一组,每组内按sDateAndTimeStart排序(你可以换成其他字段,比如sDateAndTimeEnd来选最晚的记录),然后给每组的行分配一个从1开始的编号。- 外层查询筛选
rn = 1,就会只保留每个sVisitID组里的第一条记录,完美解决重复问题。 - 另外,原查询的
FULL OUTER JOIN其实可以改成INNER JOIN,因为你的WHERE条件里要求MyData.[sClientName] IS NOT NULL,这会过滤掉所有来自tblRepresentatives的无匹配记录,和INNER JOIN效果一致,这样查询效率会更高一点。
内容的提问来源于stack exchange,提问作者Mark Blackburn
相关产品推荐
相关产品推荐

