KeyBERT是否支持法语文本与西班牙语文本的主题提取?
KeyBERT对法语文本与西班牙语文本的支持及使用方法
支持情况
KeyBERT完全支持法语文本与西班牙语文本的关键词/主题提取,核心原因是它可以灵活接入对应语言的预训练Transformer模型,这些模型能精准捕捉法、西语的语义特征。
法语文本提取示例
使用适配法语的预训练模型(如camembert-base),并设置法语停用词:
from keybert import KeyBERT # 初始化法语模型 kw_model = KeyBERT(model='camembert-base') # 法语文本示例 french_text = """Nous devons protéger la planète Terre pour que les générations futures puissent vivre dans un environnement sûr. Nous pouvons le faire en préservant les arbres, la végétation naturelle, l'eau, les ressources naturelles, l'électricité, etc. Nous devons appliquer strictement toutes les mesures possibles pour contrôler la pollution environnementale et le réchauffement climatique.""" # 提取关键词/主题 keywords = kw_model.extract_keywords(french_text, keyphrase_ngram_range=(3, 3), stop_words='french', # 指定法语停用词 use_mmr=True, diversity=0.7) keywords_list = list(dict(keywords).keys()) print(keywords_list)
西班牙语文本提取示例
使用适配西班牙语的预训练模型(如bert-base-spanish-wwm-uncased),并设置西班牙语停用词:
from keybert import KeyBERT # 初始化西班牙语模型 kw_model = KeyBERT(model='bert-base-spanish-wwm-uncased') # 西班牙语文本示例 spanish_text = """Debemos proteger la Tierra para que las generaciones futuras puedan vivir en un entorno seguro. Podemos hacerlo preservando los árboles, la vegetación natural, el agua, los recursos naturales, la electricidad, etc. Debemos aplicar estrictamente todas las medidas posibles para controlar la contaminación ambiental y el calentamiento global.""" # 提取关键词/主题 keywords = kw_model.extract_keywords(spanish_text, keyphrase_ngram_range=(3, 3), stop_words='spanish', # 指定西班牙语停用词 use_mmr=True, diversity=0.7) keywords_list = list(dict(keywords).keys()) print(keywords_list)
关键注意点
- 模型选择:优先选用针对目标语言优化的预训练模型,比如法语的CamemBERT、西班牙语的BERT-spanish系列,能大幅提升提取效果。
- 停用词:必须设置对应语言的停用词,避免无意义的虚词被纳入结果。
- 参数调整:
keyphrase_ngram_range(控制短语长度)、diversity(控制结果多样性)等参数可根据需求灵活调整,以获得更贴合的主题结果。
内容的提问来源于stack exchange,提问作者Bhagirath Radadiya
相关产品推荐
相关产品推荐

