You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从BibTeX字符串片段中提取指定字段并生成Python字典

问题解答

你完全可以通过匹配大括号的方式实现该需求,针对你给出的结构规整的BibTeX字符串,无需引入第三方依赖就可以快速完成提取。

实现思路

BibTeX的字段固定为字段名={内容}的格式,你可以先通过正则匹配定位所有字段的键和对应大括号包裹的内容,预处理掉内容里的空白字符后,按需提取你需要的字段即可。如果遇到存在嵌套大括号的复杂场景,也可以通过栈逻辑来匹配成对的大括号保证内容完整性。

示例代码

import re

# 示例BibTeX字符串
bibtex_str = '@article{blablabla,\n    key={\n\t1234567\n\t},\n    title={\n\tblablabla\n\t},\n    author={\n\t Name_of_the_authors \n\t},\n    journal={\n\t Name_of_the_journal \n\t},\n    volume={\n\t\n\t},\n    pages={\n\t\n\t},\n    year={\n\t 2020 \n\t},\n    url={\n\t DOI URL \n\t}\n}'

# 匹配所有键值对
match_pattern = re.compile(r'(\w+)\s*=\s*{([^}]*)}', re.DOTALL)
bib_data = {}
for item in match_pattern.finditer(bibtex_str):
    field_key = item.group(1).strip()
    # 清理内容中的换行、制表符和首尾空格
    field_value = item.group(2).strip().replace('\n', '').replace('\t', '')
    bib_data[field_key] = field_value

# 生成目标字典
result_dict = {
    'author': bib_data.get('author', ''),
    'year': int(bib_data['year']) if bib_data.get('year', '').isdigit() else bib_data.get('year', ''),
    'url': bib_data.get('url', '')
}

print(result_dict)

运行上述代码得到的输出为:
{'author': 'Name_of_the_authors', 'year': 2020, 'url': 'DOI URL'}

注意事项

  • 若你处理的BibTeX存在嵌套大括号的场景(比如字段内容中包含{}格式的特殊标注),简单正则匹配可能会出现内容截断,此时可以自己实现栈逻辑:遍历字符串时遇到{入栈、遇到}出栈,栈回到初始空状态时即获取到完整的字段值。
  • 若后续需要处理更复杂的BibTeX格式,也可以使用bibtexparser这类专用解析库,直接完成字符串到字典的转换,无需自行实现匹配逻辑。

内容的提问来源于stack exchange,提问作者James Arten

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.03 06:36:01