离线包
把一个在线站点抓取为自包含的离线包,然后像 HTML 应用一样包装。
适用场景
把网站归档为离线使用 —— 阅读材料、文档,或任何你想在无网络时可用的站点。
核心配置(抓取器)
爬取范围
- 最大深度(
maxDepth)—— 跟随多少层链接。 - 跟随链接(
followLinks)—— 切换是否在站点内爬取。 - 最大文件数(
maxFiles)与 最大总大小(maxTotalSizeMb)—— 抓取的上限。
过滤
- 跳过模式(
skipPatterns)—— 要排除的 URL 模式。
网络
- 超时(
timeoutSeconds)—— 每请求超时。 - 下载 CDN 资源(
downloadCdnResources)—— 是否把 CDN 托管的资源拉到本地。
重写什么
HTML、CSS、JS、图片和字体 —— 包括 url()、srcset 和 @import 引用 —— 带路径重写,受同域、深度和大小限制。
说明
- 结果是一个本地离线副本;动态服务端行为不会被捕获。
- 保持在线的站点,用网页。
