You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python处理千万级URL如何更快分割字符串获取末尾元素?

URL尾段提取性能优化方案

以下方案按处理速度从快到慢排序,均基于对应需求场景测试:

  • 固定前缀场景最优方案
    如果所有URL前缀完全一致(即都是https://www.website.com/开头),直接按固定长度切片即可,无需做分割或查找操作,200万条数据耗时可低至0.1秒以内:
    prefix_len = len('https://www.website.com/')
    res = [u[prefix_len:] for u in urls]
    
  • 通用场景最快纯Python方案
    用rfind查找最后一个斜杠的索引后直接切片,避免生成分割后的冗余元组/列表,200万条数据耗时约0.4~0.5秒,比原有rpartition方案提速30%以上:
    res = [u[u.rfind('/') + 1:] for u in urls]
    
  • 千万级超大规模数据方案
    用numpy向量化操作替代纯Python循环,适合单批次处理1000万条以上的场景,比纯Python方案再提速30%~50%:
    import numpy as np
    
    # 转numpy字符串数组
    url_arr = np.array(urls, dtype=np.str_)
    # 批量查找最后一个斜杠的位置
    slash_pos = np.char.rfind(url_arr, '/') + 1
    # 批量切片提取尾段,如需Python列表再调用tolist()
    res_arr = np.char.slice_(url_arr, slash_pos)
    res = res_arr.tolist()
    
    如果后续还要对提取结果做批量计算,建议直接保留numpy数组格式,无需转回Python列表,可进一步降低开销。

内容的提问来源于stack exchange,提问作者mmz

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.03 23:15:04