You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Google Cloud OCR返回字符串无法用preg_replace移除指定非允许字符

问题原因及解决方案

核心原因:正则未启用UTF-8模式,OCR返回的特殊字符为多字节Unicode字符

你遇到的问题本质是PHP正则默认不处理UTF-8多字节字符:Google Cloud OCR返回的特殊字符(比如你看到的√)是Unicode多字节字符,同时你要保留的德语变音符号(öÖäÄüÜß)也属于多字节范畴。

当你直接把字符串写在PHP文件测试时,文件本身是UTF-8编码,字符串以单字节形式存储(或刚好匹配正则的单字节解析逻辑),所以代码能生效;但OCR返回的是标准UTF-8多字节字符串,正则没有u修饰符时,会把多字节字符拆成单个字节处理,导致你的排除规则[^A-Za-z0-9öÖäÄüÜß\- ]无法匹配到目标特殊字符。

修复步骤

  1. 给正则添加u修饰符:这是关键,让PHP正则引擎以UTF-8模式解析字符串和正则表达式,正确识别多字节字符。
  2. 强制统一字符串编码:用mb_convert_encoding将字符串转为UTF-8,避免编码不一致问题。
  3. 优化空白字符处理:用preg_replace('/\s+/', ' ', $txt)替代多次str_replace,更高效处理所有换行、空格类字符。

修改后的代码:

$txt = '';
$tadaa = $vision->annotate($img);
$obj = $tadaa->text();
if(isset($obj) && $obj[0] != null){
    $arr = $obj[0]->info();
    $txt = $arr['description'];
    
    // 强制转成UTF-8,消除编码差异
    $txt = mb_convert_encoding($txt, 'UTF-8', 'auto');
    
    // 替换所有空白字符为单个空格
    $txt = preg_replace('/\s+/', ' ', $txt);
    
    // 添加u修饰符,启用UTF-8正则解析模式
    $txt = trim(preg_replace('/[^A-Za-z0-9öÖäÄüÜß\- ]/u', ' ', $txt));
}

额外验证技巧

如果想确认OCR返回的具体字符,可使用bin2hex($txt)输出字符的十六进制编码(比如√的UTF-8十六进制为e2889a),以此准确判断是否为视觉上的混淆字符。

内容的提问来源于stack exchange,提问作者TheGreatCornholio

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.17 14:40:04