如何在EMR集群的Jupyter Notebook中实现HTML内容渲染
EMR集群Jupyter Notebook渲染HTML可行方案
方案1:单元格内直接渲染
你遇到IPython display不渲染的核心原因大概率是EMR上PySpark内核内置的display方法覆盖了IPython的display接口,优先用以下两种方法:
- 方法1:指定调用IPython的display方法
import IPython example = '<html><head><title>Dummy</title></head><body><h1>Dummy</h1></body></html>' IPython.display.display(IPython.display.HTML(example))
- 方法2:使用
%%html单元格魔法,直接把HTML内容写在单元格内,不需要额外导入包:
%%html <html> <head> <title>Dummy</title> </head> <body> <h1>Dummy</h1> </body> </html>
方案2:新浏览器标签页打开(无需依赖S3存储)
避开S3同步延迟、文件被还原的问题,直接把HTML内容编码为Data URI触发新标签打开:
import base64 import IPython html_content = '<html><head><title>Dummy</title></head><body><h1>Dummy</h1></body></html>' # 编码HTML内容为base64 b64_content = base64.b64encode(html_content.encode('utf-8')).decode('utf-8') # 生成触发新标签打开的按钮 IPython.display.display(IPython.display.HTML(f''' <button onclick="window.open('data:text/html;base64,{b64_content}')">打开HTML页面</button> '''))
运行单元格后点击按钮即可在新浏览器标签页加载完整HTML内容。
方案3:JupyterLab新标签页打开
如果需要在JupyterLab内的新标签打开,不要将文件存入S3同步的笔记本根目录,存入实例本地/tmp路径即可,该路径不会被S3同步逻辑覆盖、修改实时生效:
import IPython html_content = '<html><head><title>Dummy</title></head><body><h1>Dummy</h1></body></html>' # 写入本地临时路径 with open('/tmp/custom_page.html', 'w', encoding='utf-8') as f: f.write(html_content) # 生成JupyterLab访问链接 IPython.display.display(IPython.display.HTML(''' <a href="/files/tmp/custom_page.html" target="_blank">在JupyterLab新标签打开</a> '''))
内容的提问来源于stack exchange,提问作者kohoutek
相关产品推荐
相关产品推荐

