You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PowerShell读取UTF-8-BOM文件与硬编码变量输出差异原因及转换方法

UTF-8-BOM文件读取与硬编码字符串的输出差异问题解析

问题场景

我有一个编码为UTF-8-BOM的input.txt文件,内容为PDVSA PETROCEDEÑO。执行以下PowerShell脚本:

$input = Get-Content -Path input.txt
foreach ($line in $input) {
Write-Output $line
}
Write-Output "PDVSA PETROCEDEÑO"

得到的输出为:

  1. PDVSA PETROCEDEÑO
  2. PDVSA PETROCEDEOÃ'O

需求:明确输出差异的原因,并将读取文件的字符串格式调整为与硬编码一致,用于SOAP消息。

差异原因

  • 文件读取编码不匹配:Get-Content默认编码在不同PowerShell版本中存在差异,未指定编码时,UTF-8-BOM文件可能被错误识别为Windows-1252编码,导致特殊字符Ñ被错误解码,输出时出现乱码。
  • 硬编码字符串的编码逻辑:脚本中的硬编码字符串会采用PowerShell当前的控制台编码或脚本文件本身的编码(通常为UTF-16LE或UTF-8),解码过程正确,因此输出正常。

解决方法

方法1:指定读取编码

直接在Get-Content中明确指定UTF-8编码,PowerShell会自动识别BOM并正确解码:

$input = Get-Content -Path input.txt -Encoding UTF8
foreach ($line in $input) {
    Write-Output $line
}
Write-Output "PDVSA PETROCEDEÑO"

方法2:强制统一编码格式

如果需要确保字符串编码完全匹配硬编码的UTF-8格式(适配SOAP消息需求),可以通过字节数组转换来标准化:

# 一次性读取文件内容(-Raw参数避免分行处理)
$inputContent = Get-Content -Path input.txt -Raw -Encoding UTF8
# 转换为UTF-8字节数组再转回字符串,消除编码差异
$normalizedString = [System.Text.Encoding]::UTF8.GetString([System.Text.Encoding]::UTF8.GetBytes($inputContent))
Write-Output $normalizedString
Write-Output "PDVSA PETROCEDEÑO"

内容的提问来源于stack exchange,提问作者keyserxose

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.06 23:15:52