Node.js/TypeScript读取UTF-8 JSON文件时Unicode字符解码错误排查
问题原因与解决方法
问题根源
你的JSON文件存在双重编码问题:原本的UTF-8字符(如è、😅)被错误转换为对应字节的Unicode转义序列(\u00c3\u00a8、\u00f0\u009f\u0098\u0085)。当JSON解析器处理这些转义时,会将\u00c3解析为Ã、\u00a8解析为¨,最终出现乱码。
解决方法
方法1:修正JSON文件(推荐)
直接修改JSON内容,将错误的Unicode转义替换为实际字符或正确的Unicode码点转义:
修正后的JSON:
[ { "media": [ { "title": "La codifica è corretta!😅" } ] } ]
之后使用你原来的代码即可正常解析:
const fInstaPosts = FS.readFileSync("file.json"); const instaPosts = JSON.parse(fInstaPosts.toString()); console.log(instaPosts[0].media[0].title);
方法2:代码中修复双重编码
如果无法修改JSON文件,可通过代码逆向转换修复乱码:
import * as FS from 'fs'; // 读取文件并解析JSON const buffer = FS.readFileSync("file.json"); const instaPosts = JSON.parse(buffer.toString('utf-8')); // 将乱码字符串按Latin1转换为Buffer(还原原本的UTF-8字节),再重新按UTF-8解码 const correctedTitle = Buffer.from(instaPosts[0].media[0].title, 'latin1').toString('utf-8'); console.log(correctedTitle); // 输出:La codifica è corretta!😅
补充说明
正常情况下,UTF-8编码的JSON文件中,è可以直接写入文件,或用其Unicode码点转义\u00e8表示;表情😅的Unicode码点转义为\u{1F605}。你的JSON文件错误地将字符的UTF-8字节当成独立Unicode码点转义,才导致了解析后乱码的问题。
内容的提问来源于stack exchange,提问作者Marco Maroni
相关产品推荐
相关产品推荐

