加载Yelp餐厅评论JSON时移除ASCII HTML字符的实现方法
解决HTML实体字符处理问题
你可以借助Python标准库中的html模块,先对响应文本做HTML实体解码,再解析JSON,就能同时处理Unicode和HTML实体字符问题。
修改后的代码如下:
import html import json def parse_yelp_restaurant_api(self, response): # 解码所有HTML实体(包括'、"等) cleaned_response_text = html.unescape(response.text) # 解析JSON并保留原有Unicode处理逻辑 jsonresponse = json.loads(cleaned_response_text, strict=False) return jsonresponse
说明:
html.unescape()会自动将'转换为单引号',"转换为双引号",同时也能处理其他常见HTML实体(如&转&等)。- 先处理HTML实体再解析JSON,能确保实体字符在JSON解析前就被转换为正常字符,避免解析后字符串中残留实体编码。
内容的提问来源于stack exchange,提问作者Rodolfo
相关产品推荐
相关产品推荐

