You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用immoscrapy爬取柏林公寓房源无结果的问题求助

问题分析与解决方案

从你给出的日志来看,请求返回了204 No Content状态码,这说明目标服务器拒绝了你的爬虫请求,大概率是触发了反爬机制(比如请求头过于机械、触发了验证码验证),导致没有返回任何房源数据。

先尝试修复immoscrapy的问题

  1. 手动验证URL有效性:把日志里生成的URL复制到浏览器打开,看看是否能正常显示房源。如果浏览器里需要完成“我不是机器人”验证,那就是爬虫请求被拦截了。
  2. 添加真实浏览器请求头:immoscrapy默认的请求头可能太像爬虫,你可以尝试修改工具配置,添加真实的User-Agent(比如Chrome浏览器的UA字符串),模拟正常用户访问。
  3. 降低请求频率:短时间内多次请求很容易被封,试试间隔一段时间再执行命令。

适合新手的替代工具/方案

1. Requests + BeautifulSoup(入门级)

这是最适合新手的组合,代码简单易懂,能手动控制请求细节:

import requests
from bs4 import BeautifulSoup

# 模拟Chrome浏览器的请求头
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0 Safari/537.36'
}

target_url = "https://www.immobilienscout24.de/Suche/de/berlin/wohnung-kaufen?sorting=2&price=100000-800000&numberofrooms=5-"
response = requests.get(target_url, headers=headers)

# 解析页面提取房源信息
soup = BeautifulSoup(response.text, 'html.parser')
# 示例:提取房源标题
title_elements = soup.find_all('h2', class_='result-list-entry__brand-title')
for title in title_elements:
    print(title.get_text(strip=True))

如果浏览器访问需要验证码,这种方法可能也会失效,这时可以试试更省心的方案。

2. 使用公开数据集(最省心)

学校机器学习项目不一定非要自己爬取数据,很多公开数据集可以直接用:

  • 搜索德国房产相关的数据集,比如包含柏林公寓价格、房型、面积等信息的CSV文件,下载后直接就能用于模型训练,完全避开反爬问题。

3. Scrapy(进阶但功能强大)

如果想学习更专业的爬虫框架,Scrapy是不错的选择,它自带请求调度、中间件等功能,方便处理反爬逻辑。你可以通过下载中间件添加User-Agent,后续还能配合代理IP使用(新手可以先从基础功能入手)。

内容的提问来源于stack exchange,提问作者David V

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.14 15:05:32