BigQuery中提取URL指定段的正则表达式求解
解决BigQuery提取URL中part1段的正则问题
你可以使用以下正则表达式来提取目标段:
REGEXP_EXTRACT(page_url, r"//[^/]+/([^/]+)") as Part1
正则说明:
//:匹配URL里的双斜杠部分[^/]+:匹配域名内容(直到碰到第一个斜杠为止)/:匹配域名后的第一个斜杠([^/]+):捕获第一个斜杠后到下一个斜杠之间的内容,也就是你需要的part1
如果你的URL可能没有末尾斜杠(比如https://host.name.com/part1),或者带有查询参数、锚点,可以用更通用的版本:
REGEXP_EXTRACT(page_url, r"//[^/]+/([^/?#]+)") as Part1
这个版本会自动忽略URL里的?xxx或#xxx部分,确保只提取到part1。
内容的提问来源于stack exchange,提问作者Gary
相关产品推荐
相关产品推荐

