BeautifulSoup爬取职位信息时无对应div元素的描述字段获取方案
解决方法
你可以通过判断BeautifulSoup查询返回的结果是否为空来实现占位值填充,同时注意你原有代码中find_all没有绑定当前循环的job节点,会导致全局搜索结果出错,修正后的实现如下:
写法1(推荐,使用find简化逻辑)
find方法会直接返回第一个匹配的元素,未匹配到则返回None,不需要额外处理列表下标:
import requests import bs4 result = requests.get("https://www.jobs.bg/front_job_search.php?frompage=0&add_sh=1&categories%5B0%5D=29&location_sid=1&keywords%5B0%5D=python&term=#paging").text soup = bs4.BeautifulSoup(result, "lxml") jobs = soup.find_all('td', class_ = "offerslistRow") for job in jobs: # 仅在当前职位节点下查询目标元素 desc_node = job.find('div', class_="card__subtitle mdc-typography mdc-typography--body2") # 元素存在则取文本,否则返回N/A,strip()用于清理首尾空白字符 description = desc_node.get_text(strip=True) if desc_node else "N/A" # 后续其他字段提取逻辑
写法2(兼容你原有find_all取下标[0]的逻辑)
如果需要保留find_all的写法,只需要先判断返回的列表是否非空即可:
for job in jobs: desc_list = job.find_all('div', class_="card__subtitle mdc-typography mdc-typography--body2") description = desc_list[0].get_text(strip=True) if desc_list else "N/A"
内容的提问来源于stack exchange,提问作者Stefan Tončev
相关产品推荐
相关产品推荐

