如何从archive.org的CDX搜索结果获取WARC文件
从CDX搜索结果关联WARC.gz文件的方法
1. 调整CDX请求获取WARC元数据
调用CDX接口时,通过fl参数指定返回WARC相关字段,示例请求格式:
https://web.archive.org/cdx/search/cdx?url=目标网页URL&output=json&fl=timestamp,url,digest,warc_filename,warc_offset,warc_length
返回的每条结果包含关键字段:
warc_filename:对应记录所在的WARC.gz文件名(如1813843-20170423215801.warc.gz)warc_offset:目标页面记录在WARC文件中的起始字节位置warc_length:目标页面记录的字节长度
2. 获取WARC.gz文件
拿到warc_filename后,构造下载路径:
https://archive.org/download/webarchive/{warc_filename}
若知晓WARC所属的集合ID(如示例中的1813843),也可使用:
https://archive.org/download/{集合ID}/{warc_filename}
3. 提取单个页面的WARC记录
如果仅需要目标页面的记录,无需下载整个WARC文件,可利用warc_offset和warc_length截取对应片段,示例命令:
curl -r {warc_offset}-$((warc_offset+warc_length-1)) https://archive.org/download/webarchive/{warc_filename} -o target-page.warc
补充说明
- 部分早期捕获的记录可能缺失
warc_filename等字段,可通过CDX结果中的digest(页面内容的SHA-1哈希值)在archive.org搜索栏匹配对应的WARC文件 - 多数WARC文件可直接下载,少数可能因版权限制无法获取
内容的提问来源于stack exchange,提问作者BnMcGn
相关产品推荐
相关产品推荐

