Java 8读取含重音Unicode字符的文件名出现乱码问题求解
问题原因
- 终端ls乱码但tab补全正常的根因:ls命令会按照当前系统locale设置的字符集对文件名原始字节做解码,遇到无法识别的字节就会替换为
?;而shell的tab补全逻辑不会对文件名字节做编码转换,直接输出原始字节到终端,只要终端本身支持对应的字符集就能正常显示。你碰到的情况说明文件名的原始编码和当前系统locale设置的编码不匹配。 - Java读取文件名乱码的根因:
- 首先你配置的环境变量拼写错误:正确的JVM参数注入环境变量是
JAVA_TOOL_OPTIONS,你写的JAVA_TOOLS_OPTIONS多了一个S,配置的参数根本没有生效。 - 即使拼写正确,仅配置
file.encoding也无法解决文件名编码问题:控制Java读取文件系统名称所用编码的参数是sun.jnu.encoding,该参数默认跟随系统locale的编码设置,和用于文件内容读写的file.encoding是独立的两个配置。 - 你调整配置后出现的
�是UTF-8解码非法字节的替换字符,说明这批文件名的原始编码并非UTF-8,强行用UTF-8解码自然会出现乱码。
- 首先你配置的环境变量拼写错误:正确的JVM参数注入环境变量是
解决思路
- 先确认文件名原始编码:执行命令
ls | grep Li | od -c查看文件名的原始字节,重音字符ò如果对应单字节0xf2,说明原始编码为Latin-1(ISO-8859-1)或者Windows CP1252;如果对应双字节0xc3 0xb2,说明原始编码为UTF-8。 - 修复Java读取编码的问题:
- 修正环境变量配置:执行
export JAVA_TOOL_OPTIONS="-Dfile.encoding=UTF-8 -Dsun.jnu.encoding=文件名原始编码",把「文件名原始编码」替换为上一步确认的编码(比如ISO_8859_1)。 - 代码层面手动转码:如果不想修改环境变量,可以在拿到乱码的文件名字符串后手动转换编码,示例代码:
String correctName = new String(messyName.getBytes(StandardCharsets.ISO_8859_1), "实际原始编码");该逻辑的原理是Java把错误解码得到的字符串转回原始字节序列,再用正确的编码重新解码。
- 修正环境变量配置:执行
- 一劳永逸的方案:使用
convmv工具将目录下所有文件名统一转换为UTF-8编码,避免后续再出现编码问题。先执行预览命令确认转换结果:convmv -f 原始编码 -t utf8 -r 目标目录路径,确认无误后加上--notest参数执行实际转换。 - 比对兼容处理:如果不想修改原始文件名,比对时需要先将两个字符串做Unicode规范化处理,避免因为NFC/NFD规范化形式不同导致匹配失败(比如macOS默认用NFD存储文件名,其他系统多为NFC),可以用
java.text.Normalizer将两边的文件名统一转为同一种规范化形式后再做比对。 - 额外过滤:你输出中出现的
._开头的文件是macOS生成的元数据隐藏文件,不需要参与比对的话可以直接过滤掉。
内容的提问来源于stack exchange,提问作者Tung
相关产品推荐
相关产品推荐

