You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用正则表达式提取数字加空格后跟随的单位字符串

从带数值的分隔字符串中提取计量单位

问题描述

待处理原始字符串如下:

[1] weight | width | depth | 5.0 kg | 6.0 mm^3 | 10.12 cm^2

提取要求:仅匹配字符串中的计量单位,排除weight/width/depth这类非单位字段,预期输出结果:

unit=kg
unit=mm^3
unit=cm^2

此前尝试的正则存在误匹配问题:

  • 使用(?<unit>[^ -+0-9\\.\|\[\}\]]+)时,会把无前置数值的普通英文字段一并捕获
  • 使用(?<unit>[\D][^|]+)时,匹配结果会携带多余分隔符、无法精准定位单位
    核心匹配逻辑判断:仅匹配紧跟「数值+空格」之后的字段,即可过滤所有非单位内容。

可行正则方案

使用以下带命名捕获组的正则即可精准匹配目标单位:

\d+\.?\d*\s+(?<unit>[^|\s]+)

正则逻辑说明

  • \d+\.?\d*:覆盖所有整数、带小数位的数值格式,比如5/5.0/10.12均可匹配
  • \s+:匹配数值与单位之间的间隔空格,从规则层面直接过滤掉所有没有前置数值的普通字段(比如前面的weight、width、depth)
  • (?<unit>[^|\s]+):命名为unit的捕获组,匹配到竖线分隔符或空格就终止,刚好拿到完整的单位字符串,不会携带多余的分隔符或空格

代码示例(Python)

import re

raw_str = "[1] weight | width | depth | 5.0 kg | 6.0 mm^3 | 10.12 cm^2"
match_iter = re.finditer(r"\d+\.?\d*\s+(?<unit>[^|\s]+)", raw_str)
for item in match_iter:
    print(f"unit={item.group('unit')}")

运行后输出完全符合预期:

unit=kg
unit=mm^3
unit=cm^2

如果使用的编程环境不支持正则命名捕获组,去掉命名部分即可,正则调整为\d+\.?\d*\s+([^|\s]+),取每次匹配结果的第一个捕获组值就是目标单位。


内容的提问来源于stack exchange,提问作者Aneesh Narayanan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.28 19:21:31