本地部署:NER与小参数LLM抽取新闻人物多维度信息咨询
任务相关问题解答
适配任务的小参数LLM
- 存在多款适配这类信息抽取任务的小参数LLM:
- Qwen-7B、Zephyr-7B-beta:经过指令微调,在信息抽取场景下表现优于同参数基础模型,本地运行效率远高于70B级模型。
- Mistral-7B-Instruct:配合针对性的prompt设计,能准确抽取姓名、职位、公司等信息,无需依赖大参数模型。
支持抽取性别等信息的NER工具
- 传统NER工具可通过扩展实体类型实现需求:
- spaCy:自定义添加"性别"实体类型,使用标注数据微调后,可同时抽取姓名、职位、公司和性别信息。
- BERT-base/RoBERTa-base:针对包含性别实体的自定义NER任务微调,资源占用低,适合本地运行,且入门门槛不高。
两步法提升效率的可行性
- 完全可行。先通过轻量NER工具(如spaCy或微调后的小BERT)快速定位所有姓名实体,再截取每个姓名对应的上下文片段,用小参数LLM提取性别、职位和公司信息。这种方式大幅减少LLM处理的文本量,比直接用大模型处理整篇文章效率提升明显,同时能保证结果准确性。
适合入门者的起始训练模型
- 推荐以下模型供机器学习入门者起步:
- BERT-base-chinese:中文适配性强,有丰富的教程和预训练资源,适合自定义NER任务微调。
- DistilBERT:BERT的轻量化版本,训练速度快、资源占用低,便于快速上手实验。
- Qwen-1.8B:小参数中文大模型,支持指令微调,少量标注数据即可完成信息抽取任务的适配。
内容的提问来源于stack exchange,提问作者John
相关产品推荐
相关产品推荐

