如何自动识别并过滤翻译质量不佳的自动翻译网站?
如何自动识别并过滤翻译质量不佳的自动翻译网站?
嘿,这个问题我太有共鸣了——那些机翻得稀烂的网站真的浪费好多时间!我来分享几个实际可行的思路,帮你自动识别过滤它们:
基于浏览器语言标识反向拦截
既然这些网站是读取你的浏览器语言设置来自动触发机翻,那你可以用浏览器扩展自定义HTTP请求头里的Accept-Language字段,把它改成网站的原始语言(比如英文网站就设为en-US)。这样大部分网站会直接展示原始内容,不会触发蹩脚的机翻。不过要注意,少数网站可能会强制跳转翻译版本,这时候就得结合其他方法了。用用户脚本识别机翻特征
你可以借助Tampermonkey这类用户脚本工具,写个简单的脚本自动检测页面里的机翻痕迹。机翻文本通常有这些共性:- 大量语法错误,比如介词乱用、主谓搭配混乱
- 固定词组的翻译完全不符合语境,比如把“break a leg”翻成“打断一条腿”
- 页面里混合出现原始语言和翻译语言的内容
脚本可以抓取页面文本,用提前定义的正则规则或者轻量语法检查逻辑判断,如果判定是机翻页面,就自动弹出提示,甚至帮你跳转到原始语言版本(如果能找到对应入口的话)。要是自己写脚本嫌麻烦,也可以找找社区里现成的类似脚本。
借助广告过滤扩展的自定义规则
像uBlock Origin这类广告过滤工具,其实也能用来对付机翻网站。你可以先观察这类网站的共性:比如URL里带有?lang=xx、/translate/这类标识翻译的参数,或者页面顶部有固定的“已自动翻译”提示条(可以查看它的CSS类名)。然后在uBlock里添加自定义过滤规则,要么直接隐藏翻译后的糟糕内容,要么阻止访问这类机翻页面。进阶玩法:训练简单的文本分类模型
如果你有一点机器学习基础,可以收集一批机翻页面和正常页面的文本数据,训练一个简单的分类模型来识别机翻内容。之后把模型集成到浏览器脚本里,就能实现更精准的自动识别过滤。不过这个方法门槛稍高,适合愿意折腾的朋友。
备注:内容来源于stack exchange,提问作者Fred Sculla
相关产品推荐
相关产品推荐

