MATLAB调用extractHTMLText提取网页文本时出现空XML命名空间错误的解决求助
MATLAB调用extractHTMLText提取网页文本时出现空XML命名空间错误的解决求助
我最近在尝试用MATLAB读取一个词典网页(具体是vocabulary.com上的river词条页面),想通过extractHTMLText函数把HTML数据转换成文本,以此提取我需要的信息,但MATLAB却抛出了一个关于XML命名空间的错误。我不是专业程序员,对命名空间相关的问题完全不熟悉,实在不知道该怎么解决,希望有人能帮我看看。
我的代码如下:
url='https://www.vocabulary.com/dictionary/river'; options = weboptions('Timeout', 10); code = webread(url,options); textData = extractHTMLText(code);
完整的报错信息(我的脚本文件名为test):
Error using htmlTree (line 67) Error in XML: xmlns:fb: Empty XML namespace is not allowed Error in extractHTMLText (line 40) tree = htmlTree(code); Error in test (line 12) textData = extractHTMLText(code)
我自己排查过:我查看了code变量,并且在命令行窗口打印了它的内容,确认webread已经成功获取到了网页的HTML代码,所以问题应该不是出在获取网页的环节,而是在后续的文本解析步骤里。
有没有人能告诉我该怎么修复这个错误?谢谢大家!
备注:内容来源于stack exchange,提问作者AEP
相关产品推荐
相关产品推荐

