如何在Excel中用正则表达式解析支链烷烃IUPAC名称并提取结构信息?
基于Excel自定义函数自动提取支链烷烃IUPAC名称的结构信息
针对数千条支链烷烃IUPAC名称的结构信息提取需求,可通过以下4个步骤实现自动化处理:
步骤1:提取主链碳原子数
主链名称位于IUPAC名称末尾,通过正则匹配主链名后查表获取碳原子数。可自定义UDFMainChainRegex实现,示例:=MainChainRegex("2,2,3-trimethyloctane")返回结果为8。步骤2:提取主链各碳原子连接的侧链碳原子数
生成对应主链每个碳原子的侧链碳数数组,可自定义UDFSideChainRegex实现。示例:输入"3-ethylpentane",返回数组[0,0,2,0,0]。步骤3:处理多侧链重复情况
识别侧链前缀(如di-代表2个相同侧链),对应更新主链碳原子的侧链碳数。示例:输入"2,2-dimethylbutane",返回数组[0,2,0,0]。步骤4:处理多种类侧链汇总
对不同类型的侧链碳数进行汇总,生成最终的主链碳原子侧链碳数数组。示例:输入"5-ethyl-2,2-dimethylheptane",返回数组[0,2,0,0,2,0,0]。相关术语与碳原子数的对应关系参考附表。
内容的提问来源于stack exchange,提问作者Daniel
相关产品推荐
相关产品推荐

