You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从archive.org的CDX搜索结果获取WARC文件

从CDX搜索结果关联WARC.gz文件的方法

1. 调整CDX请求获取WARC元数据

调用CDX接口时,通过fl参数指定返回WARC相关字段,示例请求格式:

https://web.archive.org/cdx/search/cdx?url=目标网页URL&output=json&fl=timestamp,url,digest,warc_filename,warc_offset,warc_length

返回的每条结果包含关键字段:

  • warc_filename:对应记录所在的WARC.gz文件名(如1813843-20170423215801.warc.gz)
  • warc_offset:目标页面记录在WARC文件中的起始字节位置
  • warc_length:目标页面记录的字节长度

2. 获取WARC.gz文件

拿到warc_filename后,构造下载路径:

https://archive.org/download/webarchive/{warc_filename}

若知晓WARC所属的集合ID(如示例中的1813843),也可使用:

https://archive.org/download/{集合ID}/{warc_filename}

3. 提取单个页面的WARC记录

如果仅需要目标页面的记录,无需下载整个WARC文件,可利用warc_offset和warc_length截取对应片段,示例命令:

curl -r {warc_offset}-$((warc_offset+warc_length-1)) https://archive.org/download/webarchive/{warc_filename} -o target-page.warc

补充说明

  • 部分早期捕获的记录可能缺失warc_filename等字段,可通过CDX结果中的digest(页面内容的SHA-1哈希值)在archive.org搜索栏匹配对应的WARC文件
  • 多数WARC文件可直接下载,少数可能因版权限制无法获取

内容的提问来源于stack exchange,提问作者BnMcGn

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.26 00:44:50