使用Nest.js Puppeteer模块爬取数据每次需重启服务器问题求助
问题原因
nest-puppeteer通过@InjectBrowser()注入的是全局单例的Browser实例,你在第一次爬取结束后执行了await this.browser.close(),直接销毁了整个浏览器实例,第二次请求调用this.browser.newPage()时,操作的是已经关闭的浏览器实例,所以会一直处于pending状态,无法执行后续代码。
修复方案
你只需要修改资源释放逻辑,不要关闭全局Browser实例,仅关闭每次请求创建的Page实例即可,同时建议增加异常捕获逻辑,避免出错时资源泄漏,修改后代码如下:
@Injectable() export class AppService { constructor(@InjectBrowser() private readonly browser: Browser) {} async getFoodoraRestaurantMenus(url: string): Promise<string> { console.log("Calling method"); let page: Page | null = null; try { page = await this.browser.newPage(); console.log('第二次调用也能正常到这里了'); await page.goto(url, { timeout: 30000 // 建议加超时配置,避免页面无限加载 }); const content = await page.evaluate(() => { // 这里补充你的页面提取逻辑 }); return JSON.stringify(content, null, 4); } catch (err) { // 错误处理逻辑,可按需打日志或者抛出业务错误 console.error('爬取失败:', err); throw err; } finally { // 不管请求成功失败,都关闭当前页面释放资源 if (page) { await page.close(); } } } }
可选优化点
- 可以给Browser实例配置自动重启逻辑,避免浏览器意外崩溃后无法提供服务
- 如果爬取并发量高,可以配置Page池复用页面,减少反复创建销毁页面的性能开销
- 可以给
page.evaluate也加上超时限制,避免页面脚本执行卡住
内容的提问来源于stack exchange,提问作者Martin Nordström
相关产品推荐
相关产品推荐

