如何从网站Meta标题提取匹配域名的带空格公司名称?
问题解答
一、正则表达式完全可以实现提取需求
核心思路是先从域名中剥离出无空格的核心标识(比如从https://imperiodasmilhas.com/提取imperiodasmilhas),再匹配Meta标题中去掉空格和大小写后与该核心标识完全一致的短语,同时剔除标题后的冗余内容。
具体实现步骤:
- 预处理域名:用字符串操作或正则去掉协议(
https?://)、后缀(.com/.net等)及末尾斜杠,得到纯小写的核心字符串,比如imperiodasmilhas。 - 构建匹配规则:针对示例中标题用
-分隔核心内容和冗余内容的结构,可先用正则捕获-前的文本,再验证该文本去空格转小写后是否与域名核心字符串匹配。
示例正则:
捕获到^([A-Za-zÀ-ÿ\s]+)\s*-Imperio das Milhas后,转小写去空格得到imperiodasmilhas,和域名核心匹配,即可确定这就是目标公司名。
如果标题的分隔符不是-,可以调整正则适配常见的分隔符(比如|、–或冒号),或者直接匹配所有可能的标题前缀,再通过内容匹配筛选。
二、“识别域名首尾3个字符截取前后内容”的方案不可行
这个方案容错率极低,存在多个致命问题:
- 域名长度不确定:如果域名短于6个字符(比如
abcde.com),首尾3字符截取后没有剩余内容,直接失效。 - 匹配逻辑不严谨:域名的首尾3字符和Meta标题中的公司名没有必然对应关系,比如域名
techsolutions.com,首尾3字符是tec和ons,截取中间的hsolut完全无法对应标题里的Tech Solutions。 - 公司名在标题中的位置不固定:Meta标题里的公司名可能在开头、中间或结尾,仅靠截取域名中间内容无法精准匹配。
综上,这种方案完全不可靠,不建议使用。
内容的提问来源于stack exchange,提问作者Rafael Luisari
相关产品推荐
相关产品推荐

