Python中对比DataFrame前后行,仅在CUI变更时调用API
优化UMLS API调用方案
核心思路是用缓存字典存储已查询过的CUI对应的名称,重复的CUI直接复用缓存结果,避免重复发起API请求。以下是优化后的完整代码:
import requests import pandas as pd # 替换为你的实际DataFrame df = pd.DataFrame({'CUI': ['C13874', 'C13874', 'C47687']}) # 缓存字典:key为CUI,value为对应的名称 cui_cache = {} API_KEY = "ssssssssssssss" BASE_URL = 'https://uts-ws.nlm.nih.gov/rest/content/current/CUI/' def get_cui_name(cui): # 先检查缓存,存在则直接返回结果 if cui in cui_cache: return cui_cache[cui] # 缓存不存在时调用API headers = {'Content-Type': 'application/json'} params = {'apiKey': API_KEY} url = f"{BASE_URL}{cui}" try: response = requests.get(url, headers=headers, params=params) response.raise_for_status() # 捕获HTTP请求错误 data = response.json() name = data['result']['name'] # 将结果存入缓存 cui_cache[cui] = name return name except Exception as e: # 处理API请求异常(如网络错误、数据解析失败等) print(f"CUI {cui} 查询失败: {str(e)}") return None # 使用上下文管理器自动管理文件生命周期,无需手动关闭 with open('umls_cui_names.txt', 'w') as umls_cui: for cui in df['CUI']: name = get_cui_name(cui) if name is not None: umls_cui.write(f"{cui}\t{name}\n")
关键优化说明
- 缓存机制:通过
cui_cache字典记录已查询的CUI结果,重复CUI直接读取缓存,示例中C13874仅会调用1次API,大幅减少请求次数。 - 文件操作优化:用
with上下文管理器替代手动close(),避免文件资源泄漏和无效的关闭操作(原代码中umls_cui_names.txt.close()属于错误操作,该变量不存在)。 - 异常处理:添加
try-except块捕获API请求中的各类异常,保证程序稳定性。 - 代码结构优化:将常量(API密钥、基础URL)抽离,函数职责单一,更易维护。
内容的提问来源于stack exchange,提问作者rshar
相关产品推荐
相关产品推荐

