You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

MATLAB调用extractHTMLText提取网页文本时出现空XML命名空间错误的解决求助

MATLAB调用extractHTMLText提取网页文本时出现空XML命名空间错误的解决求助

我最近在尝试用MATLAB读取一个词典网页(具体是vocabulary.com上的river词条页面),想通过extractHTMLText函数把HTML数据转换成文本,以此提取我需要的信息,但MATLAB却抛出了一个关于XML命名空间的错误。我不是专业程序员,对命名空间相关的问题完全不熟悉,实在不知道该怎么解决,希望有人能帮我看看。

我的代码如下:

url='https://www.vocabulary.com/dictionary/river';
options = weboptions('Timeout', 10);
code = webread(url,options);
textData = extractHTMLText(code);

完整的报错信息(我的脚本文件名为test):

Error using htmlTree (line 67)
Error in XML: xmlns:fb: Empty XML namespace is not allowed

Error in extractHTMLText (line 40)
tree = htmlTree(code);

Error in test (line 12)
textData = extractHTMLText(code)

我自己排查过:我查看了code变量,并且在命令行窗口打印了它的内容,确认webread已经成功获取到了网页的HTML代码,所以问题应该不是出在获取网页的环节,而是在后续的文本解析步骤里。

有没有人能告诉我该怎么修复这个错误?谢谢大家!

备注:内容来源于stack exchange,提问作者AEP

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.22 15:08:14