Linux终端无PHP环境,如何将curl输出的HTML实体转中文
解决Linux终端中HTML实体转中文/韩文的问题
嘿,我来帮你搞定这个HTML实体解码的麻烦!既然没法用PHP的html_entity_decode,咱们用Linux终端里默认就有的工具就能解决,下面给你两个靠谱的方法:
方法一:用Python(推荐,兼容性最强)
几乎所有现代Linux发行版都预装了Python3,直接用它的html.unescape函数就能轻松解码。把你的curl命令和这个Python命令用管道连起来就行:
curl [你的目标URL] | python3 -c "import html, sys; print(html.unescape(sys.stdin.read()))"
举个例子,用你给出的实体字符串测试:
echo "기타/부재시 집 앞에 놓고가셔되" | python3 -c "import html, sys; print(html.unescape(sys.stdin.read()))"
执行后就能得到你想要的结果:기타/부재시 집 앞에 놓고가셔되
方法二:用Perl
如果你的系统预装了Perl(大部分服务器版Linux都有),可以用Perl的HTML::Entities模块来解码:
curl [你的目标URL] | perl -MHTML::Entities -pe 'decode_entities($_)'
这个命令会自动把所有HTML实体转换成对应的正常文本,不管是中文还是韩文都能处理。
这两个方法都不需要额外安装软件,直接用系统自带工具就能搞定,试试哪个更顺手吧!
内容的提问来源于stack exchange,提问作者Vijay Varma
相关产品推荐
相关产品推荐

