使用Cheerio与Request在Node.js中抓取网页:如何获取Script内容?
解决Cheerio无法获取外部Script标签内容的问题
嘿,我懂你现在的困扰——你用Cheerio解析页面时能正常拿到标题,但那些带src属性的外部script标签,Cheerio只会解析到标签本身的结构,不会自动帮你加载远程的脚本内容,这就是为啥你拿到的是复杂对象而不是实际的脚本代码。下面给你一步步解决的方法:
第一步:提取目标Script的远程地址
先用Cheerio定位到你需要的script标签,把它的src属性提取出来。如果是相对路径,记得补全成绝对URL(用Node.js的url模块就行):const cheerio = require('cheerio'); const request = require('request'); const url = require('url'); const baseUrl = 'https://你要抓取的网站域名'; // 替换成实际域名 request(baseUrl, (err, res, html) => { if (!err && res.statusCode === 200) { const $ = cheerio.load(html); // 比如选中第二个type为text/javascript的script标签,可根据实际情况调整选择器 const targetScriptSrc = $('script[type="text/javascript"]').eq(1).attr('src'); // 把相对路径转成绝对URL const fullScriptUrl = url.resolve(baseUrl, targetScriptSrc); // 下一步请求这个URL } });第二步:单独请求Script的远程地址获取内容
拿到完整的脚本URL后,再发起一次request请求,就能拿到脚本的实际代码了:request({ url: fullScriptUrl, // 有些网站会校验User-Agent,加上模拟浏览器的请求头更稳妥 headers: { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36' } }, (err, res, scriptContent) => { if (!err && res.statusCode === 200) { console.log('成功拿到脚本内容:', scriptContent); // 接下来就可以处理脚本里的数据了 } });第三步:从脚本内容中提取目标数据
大多数情况下,这类脚本里会有类似var data = {...}的结构化数据,你可以用正则匹配出这部分内容,再转成JSON对象:// 假设脚本里有var appData = { ... };这样的结构,可根据实际情况修改正则 const dataMatch = scriptContent.match(/var appData = (.*?);/); if (dataMatch) { try { const targetData = JSON.parse(dataMatch[1]); console.log('提取到的目标数据:', targetData); } catch (parseErr) { console.log('解析JSON出错:', parseErr); } }
额外提示
如果脚本是经过压缩混淆的,不用慌——正则匹配通常也能直接处理压缩后的内容;要是实在难匹配,也可以用js-beautify这类工具先格式化脚本,再进行提取。
内容的提问来源于stack exchange,提问作者lethaljd
相关产品推荐
相关产品推荐

