You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PHP如何从带子域名的Google完整URL中提取主域名‘google’

解决方案:准确提取域名主体(移除子域名和所有后缀)

你的问题很典型——用strstr($domain, ".", true)这种简单的字符串截取,只能处理google.com这类单级后缀的主域名,遇到带多级后缀或者子域名的情况就会翻车。要准确提取出google、yahoo这类域名主体,得针对公共后缀和子域名做专门处理,下面给你两种靠谱的方案:


方法一:原生PHP实现(适合常见场景)

这个方法手动维护了常见的公共后缀列表,能覆盖大多数主流域名场景,不需要额外依赖:

function extractDomainMainPart($url) {
    // 第一步:解析出域名部分
    $domain = parse_url($url, PHP_URL_HOST);
    if (!$domain) {
        return false;
    }

    // 处理国际化域名(比如中文域名转ASCII)
    $domain = idn_to_ascii($domain);

    // 拆分域名为数组
    $domainParts = explode('.', $domain);
    $partCount = count($domainParts);

    // 定义常见的两级公共后缀(可根据需求扩展)
    $twoLevelSuffixes = [
        'co.uk', 'co.in', 'co.jp', 'com.cn', 
        'net.cn', 'org.cn', 'gov.cn'
    ];

    if ($partCount >= 3) {
        // 检查是否是两级后缀的情况(比如yahoo.co.uk)
        $currentTwoLevelSuffix = $domainParts[$partCount-2] . '.' . $domainParts[$partCount-1];
        if (in_array($currentTwoLevelSuffix, $twoLevelSuffixes)) {
            // 取倒数第三个部分作为主体
            return $domainParts[$partCount-3];
        } else {
            // 比如in.google.com,取倒数第二个部分(google)
            return $domainParts[$partCount-2];
        }
    } elseif ($partCount == 2) {
        // 比如google.com,取第一个部分(google)
        return $domainParts[0];
    } else {
        // 单段域名(比如localhost)直接返回
        return $domain;
    }
}

// 测试用例
echo extractDomainMainPart('http://google.com');       // 输出:google
echo extractDomainMainPart('http://in.google.com');    // 输出:google
echo extractDomainMainPart('http://mail.yahoo.co.uk'); // 输出:yahoo
echo extractDomainMainPart('http://blog.sina.com.cn'); // 输出:sina

逻辑说明:

  1. 先通过parse_url提取域名,处理国际化域名避免乱码
  2. 根据域名的段数和预定义的两级后缀列表,判断应该取哪一段作为主体
  3. 覆盖了单级后缀、两级后缀、带子域名的各种常见场景

方法二:用专业库处理(最准确,推荐)

如果需要覆盖所有可能的公共后缀(比如各种小众国家域名、新顶级域名),手动维护列表太麻烦,推荐用专门的域名解析库,比如league/uri-components(可通过Composer安装)。这个库内置了完整的公共后缀列表,能精准识别注册域名:

use League\Uri\Components\Host;

// 解析域名
$host = Host::fromString('in.google.com');
// 获取注册域名(比如google.com)
$registrableDomain = $host->getRegistrableDomain();
// 拆分出主体部分
$mainPart = explode('.', $registrableDomain)[0];

echo $mainPart; // 输出:google

这个方法完全不用自己维护后缀列表,不管遇到xxx.co.uk还是xxx.app这种新顶级域名,都能准确提取主体。


为什么原来的代码失效?

你原来的strstr($domain, ".", true)是取第一个点之前的内容,所以in.google.com会返回in——这显然不是你要的。我们需要的是跳过子域名,找到注册域名的主体部分,这就得靠识别公共后缀来实现啦。

内容的提问来源于stack exchange,提问作者nandu kk

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.26 09:55:24