PowerShell读取UTF-8-BOM文件与硬编码变量输出差异原因及转换方法
UTF-8-BOM文件读取与硬编码字符串的输出差异问题解析
问题场景
我有一个编码为UTF-8-BOM的input.txt文件,内容为PDVSA PETROCEDEÑO。执行以下PowerShell脚本:
$input = Get-Content -Path input.txt foreach ($line in $input) { Write-Output $line } Write-Output "PDVSA PETROCEDEÑO"
得到的输出为:
- PDVSA PETROCEDEÑO
- PDVSA PETROCEDEOÃ'O
需求:明确输出差异的原因,并将读取文件的字符串格式调整为与硬编码一致,用于SOAP消息。
差异原因
- 文件读取编码不匹配:
Get-Content默认编码在不同PowerShell版本中存在差异,未指定编码时,UTF-8-BOM文件可能被错误识别为Windows-1252编码,导致特殊字符Ñ被错误解码,输出时出现乱码。 - 硬编码字符串的编码逻辑:脚本中的硬编码字符串会采用PowerShell当前的控制台编码或脚本文件本身的编码(通常为UTF-16LE或UTF-8),解码过程正确,因此输出正常。
解决方法
方法1:指定读取编码
直接在Get-Content中明确指定UTF-8编码,PowerShell会自动识别BOM并正确解码:
$input = Get-Content -Path input.txt -Encoding UTF8 foreach ($line in $input) { Write-Output $line } Write-Output "PDVSA PETROCEDEÑO"
方法2:强制统一编码格式
如果需要确保字符串编码完全匹配硬编码的UTF-8格式(适配SOAP消息需求),可以通过字节数组转换来标准化:
# 一次性读取文件内容(-Raw参数避免分行处理) $inputContent = Get-Content -Path input.txt -Raw -Encoding UTF8 # 转换为UTF-8字节数组再转回字符串,消除编码差异 $normalizedString = [System.Text.Encoding]::UTF8.GetString([System.Text.Encoding]::UTF8.GetBytes($inputContent)) Write-Output $normalizedString Write-Output "PDVSA PETROCEDEÑO"
内容的提问来源于stack exchange,提问作者keyserxose
相关产品推荐
相关产品推荐

