C# .NET如何编写自定义编码器确保文本读写与序列化字符一致?
解决方案:确保文件读取与JSON序列化全程字符一致
一、文件读取环节:选对编码是核心
你遇到的œ被转成o的问题,本质是编码不匹配:iso-8859-1(Latin-1)不包含œ这类扩展西欧字符,而原文件大概率采用Windows-1252编码(兼容Latin-1但支持更多特殊字符)。
不需要自定义File.ReadAllLines的编码器,.NET内置了所有常用编码,直接选对即可:
- 先确认原文件的真实编码(用Notepad++打开,查看「编码」菜单);
- 用对应编码读取:
// 示例:Windows-1252编码读取 string[] lines = File.ReadAllLines("input.txt", Encoding.GetEncoding(1252));
如果不确定编码,也可以尝试Encoding.Default(对应系统默认西欧编码),或通过文件BOM自动检测:
using var reader = new StreamReader("input.txt", detectEncodingFromByteOrderMarks: true); string[] lines = reader.ReadToEnd().Split(Environment.NewLine);
二、JSON序列化环节:避免字符转义与编码不匹配
默认JSON序列化会对非ASCII字符转义成\uXXXX格式,或写入文件时编码不匹配导致字符变形。只需配置序列化选项并统一编码即可:
1. 定义存储文本的对象
public class TextContainer { public string[] Lines { get; set; } }
2. 序列化并写入文件
// 读取文件(用正确编码) var container = new TextContainer { Lines = File.ReadAllLines("input.txt", Encoding.GetEncoding(1252)) }; // 配置序列化选项:保留原始字符不转义 var jsonOptions = new JsonSerializerOptions { Encoder = JavaScriptEncoder.UnsafeRelaxedJsonEscaping, WriteIndented = true // 可选,格式化输出 }; // 序列化后用相同编码写入文件 string jsonContent = JsonSerializer.Serialize(container, jsonOptions); File.WriteAllText("output.txt", jsonContent, Encoding.GetEncoding(1252));
JavaScriptEncoder.UnsafeRelaxedJsonEscaping会跳过非ASCII字符的转义,确保œ、æ、Ÿ等字符原样保留;- 全程使用同一编码(如Windows-1252),避免读写时的编码转换丢失字符。
验证测试
针对你提供的测试文本:sfør、Är du säker på a、kolejnoœæ numeró等,采用上述方法后,所有特殊字符均可完整保留,无变形或丢失。
内容的提问来源于stack exchange,提问作者Miguel Azzopardi
相关产品推荐
相关产品推荐

