如何设置Google不索引网站页眉页脚 优化google search api搜索效果
Google Search API 排除页眉页脚索引干扰的可行方案
可按落地成本从低到高选择以下方案,多个方案搭配使用效果最优:
- 方案1:使用原生
data-nosnippet属性标记排除区块
直接给页眉、页脚、全站通用导航/广告位这类非核心内容的最外层DOM标签添加data-nosnippet="true"属性,这是Google搜索官方原生支持的索引控制规则,爬虫在抓取渲染页面时,会直接忽略该标签包裹范围内的所有文本内容,不将其纳入页面关键词匹配的索引库。该方案不需要额外在搜索后台做配置,代码上线后等待Google爬虫重新抓取对应页面即可生效,注意不要误将页面核心正文区域套入该标签范围。 - 方案2:使用索引注释标签划定抓取范围
对于不方便修改DOM属性的老旧站点,可以在需要排除的页眉、页脚内容前后分别插入Google识别的索引控制注释:
该标签最早为Google Search Appliance的专用规则,目前公网Google爬虫已兼容识别,标记后对应区块的内容不会参与关键词匹配,优先级略低于<!--googleoff: index--> <!-- 此处为页眉、页脚等不需要纳入索引的通用内容 --> <header>...</header> <footer>...</footer> <!--googleon: index-->data-nosnippet。 - 方案3:配置Programmable Search Engine后台权重规则
如果你使用的是Google自定义搜索对应的JSON API,可以在搜索服务后台做两项配置:一是给页面添加Article类型的Schema结构化数据,articleBody字段仅传入页面剥离了通用模块的纯正文内容,Google会优先匹配该字段内的文本;二是在排名规则配置中,调高页面标题、h1-h6标签、正文段落区域的匹配权重,将通用导航、页脚区域的权重设置为0,配置完成后关键词仅命中低权重通用区域的页面将不会被作为有效结果返回。 - 方案4:API结果二次过滤兜底
以上三种方案都需要等待Google爬虫重新抓取,生效周期从几天到几周不等,可以先做一层可控的兜底逻辑:本地预存所有站点页面剥离页眉页脚后的纯正文内容,拿到Search API返回的结果列表后,用搜索关键词对本地正文库做二次匹配,直接过滤掉正文完全未命中关键词、仅通用模块匹配的无效结果,该方案不需要依赖搜索引擎的抓取节奏,精准度完全可控。
注意:不要通过robots.txt屏蔽页眉、页脚对应的静态资源(如独立加载的header组件、公共js/css文件),如果Google无法爬取到这类资源,会导致页面渲染不完整,反而可能出现核心正文内容索引异常的问题,所有索引排除规则都要在完整渲染的DOM层面标记。
内容的提问来源于stack exchange,提问作者Ka Ho
相关产品推荐
相关产品推荐

