Skip to content

离线包

把一个在线站点抓取为自包含的离线包,然后像 HTML 应用一样包装。

适用场景

把网站归档为离线使用 —— 阅读材料、文档,或任何你想在无网络时可用的站点。

核心配置(抓取器)

爬取范围

  • 最大深度(maxDepth)—— 跟随多少层链接。
  • 跟随链接(followLinks)—— 切换是否在站点内爬取。
  • 最大文件数(maxFiles)与 最大总大小(maxTotalSizeMb)—— 抓取的上限。

过滤

  • 跳过模式(skipPatterns)—— 要排除的 URL 模式。

网络

  • 超时(timeoutSeconds)—— 每请求超时。
  • 下载 CDN 资源(downloadCdnResources)—— 是否把 CDN 托管的资源拉到本地。

重写什么

HTML、CSS、JS、图片和字体 —— 包括 url()srcset@import 引用 —— 带路径重写,受同域、深度和大小限制。

说明

  • 结果是一个本地离线副本;动态服务端行为不会被捕获。
  • 保持在线的站点,用网页

Released under the Unlicense.