MediaWiki中robots.txt的正确结构及相关规则咨询
关于MediaWiki robots.txt中
Disallow: /wiki/Category:Noindexed_pages的合规性与自定义问题 先直接回应你的两个核心疑问:
1. Disallow: /wiki/Category:Noindexed_pages在MediaWiki环境下是否合规?
完全合规,而且符合标准robots.txt的语法规则。
这里先澄清一个容易混淆的点:标准robots.txt规范里并没有Noindex指令——你提到的Disallow: foo Noindex: bar其实是把两种不同的索引控制手段混在一起了:
Disallow是robots.txt的原生指令,作用是告知爬虫不要抓取指定路径的内容;Noindex通常是通过页面的<meta name="robots" content="noindex">标签或HTTP响应头实现的,目的是让搜索引擎不要索引已经抓取到的页面。
回到MediaWiki的场景:/wiki/Category:Noindexed_pages是MediaWiki中专门存放被标记为「不允许索引」页面的分类路径,在robots.txt中用Disallow屏蔽这个分类页面的抓取,既符合robots.txt的语法要求,也完全契合MediaWiki的索引控制逻辑。维基百科的robots.txt里出现这个条目,就是官方基于这个逻辑配置的。
2. Noindexed_pages是否可自定义?
当然可以自定义,它并非固定值。
MediaWiki有一个核心配置项$wgNoindexCategory,默认值就是"Noindexed pages",这个配置直接决定了用来存放无索引页面的分类名称。如果你是MediaWiki站点的管理员,只需要在LocalSettings.php中修改这个配置值,比如:
$wgNoindexCategory = "不允许索引的页面";
对应的,robots.txt里的Disallow路径就会自动变成/wiki/Category:不允许索引的页面(前提是你的站点路径前缀为/wiki/)。
简单来说,这个分类名称完全由站点管理员决定,维基百科只是沿用了默认值而已。
内容的提问来源于stack exchange,提问作者Filip Torphage
相关产品推荐
相关产品推荐

