Kendra webcrawler数据源sync状态为incomplete无有效页面索引问题咨询
Kendra Web Crawler数据源同步无索引页面问题排查方向
1. 爬虫配置参数错误
- 种子URL配置问题:如果填写的种子URL是重定向地址,且你没有开启跟踪重定向配置,爬虫会直接终止在初始重定向页面,不会进入实际内容页
- 域名白名单/包含规则配置错误:如果配置的包含爬取路径规则和实际网站路径不匹配,爬虫会判定所有页面不符合规则直接跳过
- 爬取深度、页面数量上限设置过小:如果设置的最大爬取深度是0或者最大爬取页面数为0,爬虫不会爬取任何有效内容页
- User-Agent标识配置问题:部分网站虽然没有全局禁止爬虫,但会拦截空User-Agent或者未识别的爬虫请求,你可以在Kendra爬虫配置里自定义User-Agent为可识别的标识,比如包含你公司名或者Kendra的标识
2. 网站访问限制问题
- 虽然没禁止通用爬虫,但可能配置了IP访问限制:AWS Kendra爬虫的请求IP属于AWS公有IP段,如果你的公司官网只允许特定地区或者特定IP段访问,Kendra的请求会被直接拦截
- 网站需要身份认证:如果官网所有内容都需要登录后才能访问,而你没有在Kendra爬虫配置里填写对应的身份认证信息(比如基础认证账号密码、OAuth令牌等),爬虫只能拿到登录页内容,无法爬取实际内容页
- 网站启用了反爬机制:比如单IP请求频率限制、验证码拦截,Kendra默认的爬取频率如果超过你网站的限流阈值,请求会被拦截返回429错误,你可以在爬虫配置里调低爬取请求的间隔时间
3. 页面内容不符合Kendra索引要求
- 网站内容全部是纯动态渲染的JS内容:如果你的官网是纯SPA应用,所有内容都是前端JS动态生成,且你没有开启Kendra的JavaScript渲染配置,爬虫爬取到的是空的HTML骨架,没有可索引的有效内容
- 页面文件类型不在Kendra默认支持范围内:Kendra默认只索引HTML、PDF、Word等常见文本类文件,如果你的网站内容都是图片、音视频等无文本内容的资源,不会被识别为有效可索引页面
- 页面meta标签配置了noindex:即使网站全局robots.txt允许爬取,单个页面如果设置了
<meta name="robots" content="noindex">,Kendra爬虫也会跳过该页面的索引
4. IAM权限配置问题
- Kendra的执行角色缺少对应权限:如果关联的IAM角色没有
kendra:BatchPutDocument等写入索引的权限,即使爬虫爬取到了内容,也无法写入到Kendra索引中,导致无有效页面被记录
内容的提问来源于stack exchange,提问作者Mark Locklear
相关产品推荐
相关产品推荐

