多Batch网页爬取数据Timespan字段计算及连续批次去重实现
爬取批次数据清洗需求
原始待处理数据
以下是初始爬取得到的原始数据,每行字段按顺序为:姓名、年龄、性别、有效状态、爬取时间戳、Timespan占位值、批次编号,每个批次对应一次网页爬取的返回结果:
Jacob,19,Male,True,1654949111,0,1 Anna,20,Female,True,1654949111,0,1 Jacob,19,Male,True,1654949222,0,2 Anna,20,Female,True,1654949222,0,2 Brother,20,Male,True,1654949333,0,3 Anna,20,Female,True,1654949333,0,3 Cleitinho,53,Female,True,1654949444,0,4 Jacob,19,Male,True,1654949444,0,4
数据处理规则
- Timespan字段赋值规则:为每条姓名记录填充Timespan字段值,取值为该姓名未出现的第一个后续批次对应的爬取时间戳;若姓名在间隔缺失若干批次后重新出现在后续爬取结果中,需对新出现的连续区间重复执行上述赋值流程;若记录属于最后一个爬取批次,Timespan取值为对应记录爬取时间戳+1秒。
- 连续重复去重规则:若同一姓名连续出现在多个相邻批次中,仅保留该连续出现区间内首次和末次出现的记录,删除区间内的中间冗余条目。
期望处理结果
按上述规则清洗完成后,输出结果如下:
Jacob,19,Male,True,1654949111,1654949333,1 Anna,20,Female,True,1654949111,1654949444,1 Brother,20,Male,True,1654949333,1654949444,3 Cleitinho,53,Female,True,1654949444,1654949445,4 Jacob,19,Male,True,1654949444,1654949445,4
内容的提问来源于stack exchange,提问作者tutte2k
相关产品推荐
相关产品推荐

