Internet Archive · 存档与快照 · UA 特征「archive.org_bot」· 支持识别与真伪验证
返回 蜘蛛大全(蜘蛛识别 · IP 真伪校验) 您还可以使用 全国DNS大全 HTTP状态码大全 Windows CMD命令大全 一键提交外链工具存档与快照 所属机构:Internet Archive 无公开 rDNS 验证域名
Mozilla/5.0 (compatible; archive.org_bot; Wayback Machine Live Record; +http://archive.org/details/archive.org_bot)
识别特征:请求头的 User-Agent 中包含
archive.org_bot 或 ia_archiver 或 special_archiver (大小写不敏感)。
存档类爬虫为公开网页存档服务抓取内容,遇到"站点将关停"的消息时可能出现突发性大并发抓取。
Wayback Machine 网页时光机的内容抓取器,把网页存档供公众回溯。
名称:Internet Archive
运营方:Internet Archive
分类:存档与快照
抓取身份:UA 特征词「archive.org_bot」
出现频率不定,与你的站点类型和它的采集目标相关。
在访问日志中查看请求的 UA,包含特征词「archive.org_bot」即可初判为 Internet Archive。
Internet Archive 没有公开固定的反向解析域名,无法用 PTR 后缀法直接验证。可先查 IP 的 Whois 归属是否与 Internet Archive 相关,再结合抓取频率、路径与响应行为综合判断。
把上一步得到的主机名再解析回 IP:Google、必应、Yandex 等会返回原 IP,反向/正向闭环成立;百度、字节跳动的部分网段不提供回解析,PTR 命中官方网段即可判定,此步不是必要条件。
nslookup 反向解析得到的主机名
核心依据始终是 PTR 主机名是否落在官方域名下——伪装者很难在官方域下拿到主机名;若正向解析指向了别的 IP,则按伪装处理。
不想敲命令,可以打开 蜘蛛大全:把 UA 粘进「蜘蛛识别」查身份与伪装特征,把 IP 粘进「IP 真伪校验」自动完成官方名单核对与反向/正向验证。
屏蔽全站(正规蜘蛛会遵守):
User-agent: archive.org_bot Disallow: /
robots.txt 默认就是允许抓取,放行无需任何配置;如果之前全局屏蔽过,为它单独开绿灯:
User-agent: archive.org_bot Allow: / Disallow: /private/ # 仅禁私密目录
当确认它不应抓取你的站点时,可在 server 或 location 段按 UA 拒绝:
if ($http_user_agent ~* "archive.org_bot") {
return 403;
}
注意:UA 可以被任何人伪造,按 UA 拦截只对"自报家门"的访问有效;要精确拦截伪装流量,应对自称 archive.org_bot 的请求做上面的反向 DNS 校验。
任何 UA 都可以伪造。若 Internet Archive 的访问伴随异常高频、集中扫描路径或大量 404,按可疑流量处理,用 IP 反查与频率限制兜底。
Internet Archive 是 Internet Archive 运营的存档与快照。Wayback Machine 网页时光机的内容抓取器,把网页存档供公众回溯。日志中通过 User-Agent 里包含「archive.org_bot」即可初判它的身份。
Internet Archive 没有公开固定的反向解析域名,无法用 PTR 后缀法直接验证。建议先对照 UA 特征词「archive.org_bot」,再结合 IP 的 Whois 归属(是否真属于 Internet Archive)、抓取频率与路径综合判断。
希望内容进入公共网页存档就放行;不希望可用 robots.txt 屏蔽,正规存档服务会遵守。
如果本站工具对你有帮助,欢迎请作者喝杯咖啡