如何从HTML简历文件中提取不含标签的纯文本内容
提取HTML简历中的纯文本方法
嘿,作为Web开发新手,提取HTML里的纯文本其实有好几种简单易上手的方法,我给你分享几个常用的:
方法一:浏览器控制台(最快最方便)
这是不需要额外工具的首选方法,步骤超简单:
- 把你的HTML简历文件用浏览器打开(比如Chrome、Firefox)
- 按下
F12键打开开发者工具,切换到「Console」标签页 - 在控制台里输入以下命令之一,按下回车就能直接看到提取后的纯文本:
document.body.textContent.trim():会提取页面上所有文本,包括隐藏元素里的内容document.body.innerText.trim():提取的是页面上实际显示的文本,更贴近你肉眼看到的内容
方法二:用Python脚本(适合批量或长内容)
如果你的简历内容比较长,或者以后需要处理类似的HTML文件,可以用Python的BeautifulSoup库来批量处理:
- 先安装依赖库:
pip install beautifulsoup4
- 编写简单的脚本:
from bs4 import BeautifulSoup # 把你的HTML内容替换成实际的简历代码,或者从文件读取 html_resume = """<p>Mobile: 12345678891 E-mail: <a href="abc@gmail.com">abc@gmail.com</a></p> <p><b>Career Objective</b></p> <p>Employment that fully utilizes my experience in Web Site Design & Development and offers the opportunity for career advancement along with the further expansion of IT skills. </p><p><b>Caree...</p>""" # 解析HTML并提取纯文本 soup = BeautifulSoup(html_resume, 'html.parser') clean_text = soup.get_text(strip=True, separator=' ') # 输出结果 print(clean_text)
运行脚本后,就能得到格式规整、没有标签的纯文本内容了。
方法三:手动处理(仅适合短内容)
如果你的简历内容很短,也可以直接把HTML代码复制到记事本里,然后手动删除所有<>包裹的标签。不过这种方法效率低,容易出错,只推荐应急用。
内容的提问来源于stack exchange,提问作者ganesh kaspate
相关产品推荐
相关产品推荐

