百余款常见蜘蛛爬虫UA速查 · 粘贴UA一键识别身份 · IP反向DNS验证真假 · 让假蜘蛛无处遁形
返回 Favicon & ICO 在线生成器 您还可以使用 全国DNS大全 HTTP状态码大全 Windows CMD命令大全 一键提交外链工具网站每天都有搜索引擎蜘蛛、AI 采集器、安全扫描与 SEO 检测来访,借助本工具核对蜘蛛身份,已收录 - 款蜘蛛(含 - 款主流搜索引擎蜘蛛)。
快捷键:Ctrl + Enter 直接识别。工具会同时检查 UA 是否混有程序库标识、是否多家机构蜘蛛混写等伪装特征。
原理:亚马逊系蜘蛛(Amazonbot / Amzn-SearchBot / Amzn-User)按官方公布的 IP 名单核对;其余先反向解析(PTR)确认官方网段(主判定),再做正向解析辅助验证——Google、必应、Yandex 会解析回原 IP;百度、字节跳动部分网段不提供回解析,PTR 命中官方网段即判定为真。DNS 查询走 AliDNS / dns.google 公共接口。
| 蜘蛛名称 | 分类 | 所属机构 | UA 示例 / 识别特征 | 说明 | 操作 |
|---|---|---|---|---|---|
| Googlebot | 搜索引擎蜘蛛 | Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) |
谷歌搜索主力蜘蛛,桌面端与移动端收录共用该 UA,抓取量通常居全站前列。 | 文档 | |
| Googlebot Image | 搜索引擎蜘蛛 | Googlebot-Image/1.0 |
谷歌图片搜索收录蜘蛛,负责发现与抓取可索引的图片资源。 | ||
| Googlebot News | 搜索引擎蜘蛛 | (以包含「Googlebot-News」为特征) |
谷歌新闻(Google News)内容收录蜘蛛。 | ||
| Googlebot Video | 搜索引擎蜘蛛 | (以包含「Googlebot-Video」为特征) |
谷歌视频搜索收录蜘蛛,抓取视频页面与视频元数据。 | ||
| Bingbot | 搜索引擎蜘蛛 | Microsoft 必应 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm) |
微软必应搜索主力蜘蛛,其索引同时被多个中小搜索引擎复用。 | 文档 |
| adidxbot | 搜索引擎蜘蛛 | Microsoft 必应 | (以包含「adidxbot」为特征) |
微软广告质量评估蜘蛛,检查广告着陆页内容。 | |
| BingPreview | 搜索引擎蜘蛛 | Microsoft 必应 | Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) BingPreview/1.0b |
必应用于生成搜索结果页面快照与缩略图的抓取器。 | |
| Baiduspider | 搜索引擎蜘蛛 | 百度 | Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html) |
百度搜索主力蜘蛛,中文站长日志中最常见的搜索引擎蜘蛛之一。 | 文档 |
| Baiduspider-image | 搜索引擎蜘蛛 | 百度 | (以包含「Baiduspider-image」为特征) |
百度图片搜索收录蜘蛛。 | |
| Baiduspider-video | 搜索引擎蜘蛛 | 百度 | (以包含「Baiduspider-video」为特征) |
百度视频搜索收录蜘蛛。 | |
| Baiduspider-news | 搜索引擎蜘蛛 | 百度 | (以包含「Baiduspider-news」为特征) |
百度新闻收录蜘蛛。 | |
| Sogou web spider | 搜索引擎蜘蛛 | 搜狗 | Sogou web spider/4.0(+https://www.sogou.com/docs/help/webmasters.htm#07) |
搜狗搜索网页蜘蛛,UA 不带 Mozilla 前缀,是最容易在日志里一眼认出的蜘蛛之一。 | |
| Sogou inst spider | 搜索引擎蜘蛛 | 搜狗 | (以包含「Sogou inst spider」为特征) |
搜狗对已收录页面的更新校验蜘蛛,抓取频率低于网页蜘蛛。 | |
| Sogou News Spider | 搜索引擎蜘蛛 | 搜狗 | (以包含「Sogou News Spider」为特征) |
搜狗新闻内容收录蜘蛛。 | |
| 360Spider | 搜索引擎蜘蛛 | 奇虎 360 | Mozilla/5.0 (compatible; 360Spider; +https://www.so.com/help/help_3_2.html) |
360 搜索(so.com)网页蜘蛛。 | |
| HaoSouSpider | 搜索引擎蜘蛛 | 奇虎 360 | (以包含「HaoSouSpider」为特征) |
360 搜索更名"好搜"时期的旧 UA,如今日志中出现多为旧版本或伪装。 | |
| YisouSpider | 搜索引擎蜘蛛 | 神马搜索(阿里) | YisouSpider/5.0(+http://www.yisou.com/spider.html) |
神马移动搜索蜘蛛,只抓移动端页面,抓取量大且夜间活跃。 | |
| YandexBot | 搜索引擎蜘蛛 | Yandex(俄罗斯) | Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots) |
俄罗斯最大搜索引擎 Yandex 的主力蜘蛛。 | |
| YandexImages | 搜索引擎蜘蛛 | Yandex(俄罗斯) | (以包含「YandexImages」为特征) |
Yandex 图片搜索收录蜘蛛。 | |
| DuckDuckBot | 搜索引擎蜘蛛 | DuckDuckGo | Mozilla/5.0 (compatible; DuckDuckBot/1.0; +http://duckduckgo.com/duckduckbot.html) |
隐私搜索引擎 DuckDuckGo 的网页蜘蛛。 | |
| Applebot | 搜索引擎蜘蛛 | Apple | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.4 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot) |
Apple 的抓取蜘蛛,服务 Safari 推荐、Spotlight 与 Siri 搜索建议,也是 Apple 智能功能的数据来源。 | 文档 |
| PetalBot | 搜索引擎蜘蛛 | 华为 | Mozilla/5.0 (compatible;PetalBot; +https://webmaster.petalsearch.com/site/petalbot) |
华为 Petal 搜索(花瓣搜索)的网页蜘蛛,结果用于 Petal 搜索、华为助手与 AI 搜索。官方验证:PTR 需落在 petalsearch.com / aspiegel.com 域下(同网段部分 IP 的 PTR 是华为云通用主机名,无法通过官方验证)。 | 文档 |
| Yeti | 搜索引擎蜘蛛 | Naver(韩国) | Mozilla/5.0 (compatible; Yeti/1.1; +http://naver.me/spd) |
韩国 Naver 搜索引擎蜘蛛,UA 中带 Yeti 标识与 naver.me 链接。 | |
| SeznamBot | 搜索引擎蜘蛛 | Seznam(捷克) | Mozilla/5.0 (compatible; SeznamBot/4.0; +http://napoveda.seznam.cz/en/seznambot-intro/) |
捷克主流搜索引擎 Seznam 的网页蜘蛛。 | |
| Yahoo! Slurp(已退役) | 搜索引擎蜘蛛 | Yahoo | Mozilla/5.0 (compatible; Yahoo! Slurp; http://help.yahoo.com/help/us/ysearch/slurp) |
雅虎搜索蜘蛛早已退役,如今日志中出现基本可判定为伪装,建议立即用 IP 反查核实。 | |
| MojeekBot | 搜索引擎蜘蛛 | Mojeek(英国) | Mozilla/5.0 (compatible; MojeekBot/0.6; https://www.mojeek.com/bot.html) |
英国独立搜索引擎 Mojeek 的爬虫,坚持自建索引。 | |
| Bravebot | 搜索引擎蜘蛛 | Brave Search | (以包含「Bravebot」为特征) |
Brave 浏览器旗下独立搜索引擎的爬虫。 | |
| Qwantify | 搜索引擎蜘蛛 | Qwant(法国) | Mozilla/5.0 (compatible; Qwantify/2.4w; +https://www.qwant.com/) |
法国搜索引擎 Qwant 的爬虫。 | |
| GPTBot | AI 数据采集 | OpenAI | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.1; +https://openai.com/gptbot) |
OpenAI 用于采集模型训练数据的蜘蛛,遵守 robots.txt,可用其单独放行或封禁。 | 文档 |
| ClaudeBot | AI 数据采集 | Anthropic | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com) |
Anthropic 用于模型训练数据采集的蜘蛛。 | |
| anthropic-ai | AI 数据采集 | Anthropic | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; anthropic-ai/1.0; +anthropic-ai@anthropic.com) |
Anthropic 早期的训练数据采集 UA,新抓取多已改由 ClaudeBot 承担。 | |
| CCBot | AI 数据采集 | Common Crawl | CCBot/2.0 (https://commoncrawl.org/faq/) |
开放网页语料库 Common Crawl 的爬虫,其语料被全球众多 AI 公司用于训练。 | |
| Bytespider | AI 数据采集 | 字节跳动 | Mozilla/5.0 (compatible; Bytespider; https://zhanzhang.toutiao.com/) |
字节跳动(今日头条等)蜘蛛,抓取频率极高,是中文站长日志里的常客,robots 屏蔽争议较多。 | |
| Google-Extended | AI 数据采集 | (以包含「Google-Extended」为特征) |
robots.txt 控制项而非独立蜘蛛:用于声明内容是否可用于 Gemini 训练,实际抓取由 Googlebot 执行,日志中不会出现该 UA。 | ||
| Applebot-Extended | AI 数据采集 | Apple | (以包含「Applebot-Extended」为特征) |
robots.txt 控制项而非独立蜘蛛:用于退出 Apple 智能功能的训练用途,实际抓取仍由 Applebot 执行。 | |
| Amazonbot | AI 数据采集 | Amazon | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amazonbot/0.1) Chrome/W.X.Y.Z Safari/537.36 |
亚马逊官方爬虫,用于改进亚马逊产品与服务(含 Alexa AI 模型训练)。亚马逊不提供反向解析验证,而是官方公布 IP 名单,本页 IP 校验会自动核对名单命中。 | 文档 |
| Amzn-SearchBot | AI 搜索 | Amazon | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amzn-SearchBot/0.1) Chrome/W.X.Y.Z Safari/537.36 |
亚马逊搜索体验蜘蛛:允许它抓取后,内容才有机会出现在 Alexa 等亚马逊旗下搜索场景中。以官方公布的 IP 名单为验证依据。 | 文档 |
| Amzn-User | AI 助手(用户触发) | Amazon | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amzn-User/0.1) Chrome/W.X.Y.Z Safari/537.36 |
亚马逊实时取回蜘蛛:用户向 Alexa 提问、需要最新网页信息时按需抓取,与 Amazonbot、Amzn-SearchBot 三者独立控制、独立验证。 | 文档 |
| FacebookBot | AI 数据采集 | Meta | Mozilla/5.0 (compatible; FacebookBot/1.0; +https://developers.facebook.com/docs/sharing/webmasters/crawler) |
Meta 用于训练 AI 助手的采集蜘蛛(注意与分享预览用的 facebookexternalhit 是两回事)。 | |
| meta-externalagent | AI 数据采集 | Meta | meta-externalagent/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
Meta 训练数据采集的新版 UA,用于抓取网页内容供模型训练与产品评测。 | |
| Diffbot | AI 数据采集 | Diffbot | (以包含「Diffbot」为特征) |
结构化网页知识抽取服务,常被用于 AI 数据管道,按页面付费解析。 | |
| ImagesiftBot | AI 数据采集 | Hive | (以包含「ImagesiftBot」为特征) |
Hive 公司的图像数据采集蜘蛛,用于构建图片检索与多模态数据集。 | |
| AI2Bot | AI 数据采集 | Allen Institute for AI | (以包含「AI2Bot」为特征) |
艾伦人工智能研究所(AI2)的学术语料采集蜘蛛,与 Semantic Scholar 相关。 | |
| cohere-ai | AI 数据采集 | Cohere | (以包含「cohere-ai」为特征) |
Cohere 公司的大模型训练数据采集蜘蛛。 | |
| PanguBot | AI 数据采集 | 华为云 | (以包含「PanguBot」为特征) |
华为盘古大模型的训练数据采集蜘蛛。 | |
| Omgilibot | AI 数据采集 | Webz.io | (以包含「Omgilibot」为特征) |
论坛与讨论区内容采集蜘蛛,数据用于商业情报与 AI 语料转售,历史上曾因抓取策略引发广泛讨论。 | |
| KimiBot | AI 数据采集 | 月之暗面 Kimi | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; KimiBot/1.0; +https://www.kimi.com/policies/kimi-crawlers |
月之暗面(Moonshot AI)用于 Kimi 大模型训练数据采集的蜘蛛,官方发布爬虫政策并声明遵守 robots.txt。 | 文档 |
| DeepSeekBot | AI 数据采集 | DeepSeek | (以包含「DeepSeekBot」为特征) |
疑似 DeepSeek 内容采集蜘蛛,UA 来自站长日志观测,官方暂未发布爬虫文档,真伪需结合反向解析判断。 | |
| QwenBot | AI 数据采集 | 阿里·通义千问 | (以包含「QwenBot」为特征) |
疑似通义千问内容采集蜘蛛,阿里无正式爬虫文档,UA 为社区流传版本,遇到时建议先核验来源 IP。 | |
| ChatGLM-Spider | AI 数据采集 | 智谱AI | (以包含「ChatGLM-Spider」为特征) |
疑似智谱 AI 内容采集蜘蛛,可能用于大模型训练,UA 来自日志观测,官方未正式确认。 | |
| MinimaxBot | AI 数据采集 | MiniMax | (以包含「MinimaxBot」为特征) |
疑似 MiniMax 模型训练数据采集蜘蛛,UA 为第三方记录的实验性版本,尚待厂商确认。 | |
| Google-CloudVertexBot | AI 数据采集 | Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/141.0.7390.122 Mobile Safari/537.36 (compatible; Google-CloudVertexBot; +https://cloud.google.com/enterprise-search) |
Vertex AI Agent Builder 的抓取代理,仅应站长主动请求抓取内容,不影响 Google 搜索收录。 | 文档 | |
| PerplexityBot | AI 搜索 | Perplexity | Mozilla/5.0 (compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot) |
AI 答案引擎 Perplexity 的索引蜘蛛,用于构建自己的搜索索引。 | |
| OAI-SearchBot | AI 搜索 | OpenAI | OAI-SearchBot/1.0; +https://openai.com/searchbot |
ChatGPT 搜索功能专用的索引蜘蛛,与训练用的 GPTBot 分开控制,可单独放行以进入 ChatGPT 搜索结果。 | |
| Claude-SearchBot | AI 搜索 | Anthropic | (以包含「Claude-SearchBot」为特征) |
Anthropic 用于搜索场景的索引蜘蛛,与训练用 ClaudeBot 分开控制。 | |
| YouBot | AI 搜索 | You.com | Mozilla/5.0 (compatible; YouBot/1.0; +https://about.you.com/youbot/) |
AI 搜索引擎 You.com 的索引蜘蛛。 | |
| Kimi-SearchBot | AI 搜索 | 月之暗面 Kimi | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; Kimi-SearchBot/1.0; +https://www.kimi.com/policies/kimi-crawlers |
Kimi AI 搜索的索引蜘蛛,与训练用的 KimiBot 分开控制,放行有助于内容进入 Kimi 搜索引用。 | 文档 |
| Meta-WebIndexer | AI 搜索 | Meta | meta-webindexer/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
Meta 用于改进 Meta AI 搜索的索引蜘蛛,与训练采集用的 meta-externalagent 分开控制。 | |
| DuckAssistBot | AI 搜索 | DuckDuckGo | DuckAssistBot/1.2; (+http://duckduckgo.com/duckassistbot.html) |
DuckDuckGo AI 回答(DuckAssist)的索引蜘蛛,抓取维基百科等权威来源生成 AI 摘要。 | |
| ChatGPT-User | AI 助手(用户触发) | OpenAI | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ChatGPT-User/1.0; +https://openai.com/bot) |
用户在 ChatGPT 对话中主动要求浏览网页时使用的 UA,不是自动化索引,被封禁后用户代访问会失败。 | |
| Claude-User | AI 助手(用户触发) | Anthropic | (以包含「Claude-User」为特征) |
用户在 Claude 中触发实时网页访问时使用的 UA,与训练采集用的 ClaudeBot 互不影响。 | |
| Perplexity-User | AI 助手(用户触发) | Perplexity | (以包含「Perplexity-User」为特征) |
用户发起查询时 Perplexity 实时取回网页内容所用的 UA,非索引蜘蛛。 | |
| MistralAI-User | AI 助手(用户触发) | Mistral AI | (以包含「MistralAI-User」为特征) |
Le Chat 助手在用户请求下抓取网页时使用的 UA。 | |
| Kimi-User | AI 助手(用户触发) | 月之暗面 Kimi | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; Kimi-User/1.0; +https://www.kimi.com/policies/kimi-crawlers |
用户向 Kimi 提问并要求联网检索时按需抓取网页的 UA,仅在用户触发时出现。 | 文档 |
| Minimax-User | AI 助手(用户触发) | MiniMax | (以包含「Minimax-User」为特征) |
疑似 MiniMax 用户触发抓取所用 UA,第三方记录的实验性版本,尚待厂商确认。 | |
| meta-externalfetcher | AI 助手(用户触发) | Meta | meta-externalfetcher/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
Meta AI 在用户触发实时联网时抓取网页所用的 UA,非索引蜘蛛,robots.txt 合规性存在争议。 | |
| Google-GeminiNotebook | AI 助手(用户触发) | Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/137.0.0.0 Safari/537.36 (compatible; Google-GeminiNotebook; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-gemininotebook) |
Gemini Notebook(原 NotebookLM)在用户添加来源 URL 时抓取网页所用的 UA,通常忽略 robots.txt。 | 文档 | |
| Google-Agent | AI 助手(用户触发) | Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko; compatible; Google-Agent; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-agent) Chrome/W.X.Y.Z Safari/537.36 |
Google 托管智能体(如 Project Mariner)代表用户访问网页的代理,桌面与移动端共用 Google-Agent Token,通常忽略 robots.txt。 | 文档 | |
| Gemini-Deep-Research | AI 助手(用户触发) | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Gemini-Deep-Research; +https://gemini.google/overview/deep-research/) Chrome/135.0.0.0 Safari/537.36 |
Gemini Deep Research 深度研究功能的资料收集代理,用户发起研究任务时抓取公开网页。 | ||
| AhrefsBot | SEO 与营销工具 | Ahrefs | Mozilla/5.0 (compatible; AhrefsBot/7.0; +http://ahrefs.com/robot/) |
知名外链分析工具 Ahrefs 的爬虫,维护全球反链数据库,抓取量大且持续。 | |
| AhrefsSiteAudit | SEO 与营销工具 | Ahrefs | (以包含「AhrefsSiteAudit」为特征) |
Ahrefs Site Audit 站点健康审计蜘蛛,仅在被授权分析的目标站点上运行。 | |
| SemrushBot | SEO 与营销工具 | Semrush | Mozilla/5.0 (compatible; SemrushBot/7~bl; +http://www.semrush.com/bot.html) |
数字营销平台 Semrush 的数据采集蜘蛛,分析流量、关键词与反链。 | |
| MJ12bot | SEO 与营销工具 | Majestic | Mozilla/5.0 (compatible; MJ12bot/v1.4.8; http://mj12bot.com/) |
英国反链分析平台 Majestic 的爬虫。 | |
| DotBot | SEO 与营销工具 | Moz | dotbot/1.0 (+http://www.opensiteexplorer.org/dotbot) |
Moz 反链数据库(Open Site Explorer 血统)的爬虫。 | |
| rogerbot | SEO 与营销工具 | Moz | Mozilla/5.0 (compatible; rogerbot/1.0; +https://moz.com/help/guides/seo-crawlers/rogerbot) |
Moz Pro 站点审计功能使用的爬虫。 | |
| Screaming Frog SEO Spider | SEO 与营销工具 | Screaming Frog | Mozilla/5.0 (compatible; Screaming Frog SEO Spider/20.0) |
桌面端技术 SEO 审计工具,由人工发起运行,特征是同一 IP 短时间内高并发抓取。 | |
| BLEXBot | SEO 与营销工具 | WebMeUp | Mozilla/5.0 (compatible; BLEXBot/1.0; +http://webmeup-crawler.com/) |
WebMeUp 平台的反链采集蜘蛛。 | |
| SerpstatBot | SEO 与营销工具 | Serpstat | Mozilla/5.0 (compatible; SerpstatBot/1.0; +http://serpstatbot.com/abuse.html) |
SEO 平台 Serpstat 的数据采集蜘蛛。 | |
| SeobilityBot | SEO 与营销工具 | Seobility | (以包含「SeobilityBot」为特征) |
德国在线 SEO 审计工具 Seobility 的蜘蛛。 | |
| ZoominfoBot | SEO 与营销工具 | ZoomInfo | (以包含「ZoominfoBot」为特征) |
B2B 商业情报公司 ZoomInfo 的企业信息采集蜘蛛,常被归入营销数据爬虫。 | |
| facebookexternalhit | 分享与快照预览 | Meta | facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php) |
链接被分享到 Facebook/Instagram 时抓取 Open Graph 标签生成预览卡片的抓取器。 | |
| Twitterbot | 分享与快照预览 | X(Twitter) | Twitterbot/1.0 |
链接分享到 X 时生成预览卡片的抓取器,依赖 twitter: 卡片或 OG 标签。 | |
| LinkedInBot | 分享与快照预览 | Mozilla/5.0 (compatible; LinkedInBot/1.0; +https://www.linkedin.com) |
链接分享到领英时的预览抓取器。 | ||
| Slackbot | 分享与快照预览 | Slack | Slackbot-LinkExpanding 1.0 (+https://api.slack.com/robots) |
链接粘贴到 Slack 频道时的展开预览抓取器。 | |
| Discordbot | 分享与快照预览 | Discord | Mozilla/5.0 (compatible; Discordbot/2.0; +https://discordapp.com) |
链接分享到 Discord 频道时的预览抓取器。 | |
| 分享与快照预览 | Meta | WhatsApp/2.23.20.0 |
WhatsApp 聊天中分享链接时的预览抓取器。 | ||
| TelegramBot | 分享与快照预览 | Telegram | TelegramBot (like TwitterBot) |
链接分享到 Telegram 时的预览抓取器。 | |
| SkypeUriPreview | 分享与快照预览 | Microsoft | Mozilla/5.0 (Windows NT 6.1; WOW64) SkypeUriPreview Preview/0.5 |
Skype 消息中链接预览的抓取器。 | |
| Pinterestbot | 分享与快照预览 | Mozilla/5.0 (compatible; Pinterestbot/1.0; +http://www.pinterest.com/bot.html) |
Pinterest 保存/分享链接时的页面解析抓取器。 | ||
| AdsBot-Google | 站长平台与广告 | Mozilla/5.0 (compatible; AdsBot-Google; +http://www.google.com/adsbot.html) |
Google 广告着陆页质量检测蜘蛛(含 AdsBot-Google-Mobile 移动版),影响广告质量得分。 | ||
| Mediapartners-Google | 站长平台与广告 | (以包含「Mediapartners-Google」为特征) |
AdSense 广告内容匹配蜘蛛,分析页面内容以投放相关广告,投 AdSense 的站点必须放行。 | ||
| Feedly | 站长平台与广告 | Feedly | Feedly/1.0 (+http://www.feedly.com/fetcher.html; like FeedFetcher-Google) |
RSS 阅读器 Feedly 的订阅源抓取器,仅在用户订阅了你的源之后才会来抓。 | |
| UptimeRobot | 监控与测速 | UptimeRobot | Mozilla/5.0 (compatible; UptimeRobot/2.0; http://www.uptimerobot.com/) |
免费网站可用性监控服务,按设定间隔定时访问探测地址。 | |
| Pingdom | 监控与测速 | SolarWinds Pingdom | Pingdom.com_bot_version_1.4_(http://www.pingdom.com/) |
老牌网站可用性与性能监控服务。 | |
| Site24x7 | 监控与测速 | Site24x7 | (以包含「Site24x7」为特征) |
IT 运维监控平台的可用性探测蜘蛛。 | |
| StatusCake | 监控与测速 | StatusCake | (以包含「StatusCake」为特征) |
网站在线率监控服务的探测蜘蛛。 | |
| NewRelicPinger | 监控与测速 | New Relic | (以包含「NewRelicPinger」为特征) |
New Relic 可用性监控的探测蜘蛛。 | |
| Uptime-Kuma | 监控与测速 | 开源自托管 | (以包含「Uptime-Kuma」为特征) |
开源自建监控面板,UA 带版本号且支持自定义,日志中见到说明有人把你的站加进了监控。 | |
| Better Uptime Bot | 监控与测速 | Better Stack | (以包含「Better Uptime Bot」为特征) |
Better Stack 旗下 uptime 监控服务的探测蜘蛛。 | |
| Chrome-Lighthouse | 监控与测速 | Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/125.0.0.0 Safari/537.36 Chrome-Lighthouse |
PageSpeed Insights / Lighthouse 性能评分用的无头浏览器,特征是 UA 末尾带 Chrome-Lighthouse 标识。 | ||
| WebPageTest | 监控与测速 | WebPageTest | (以包含「PTST」为特征) |
知名性能测试平台,测试代理的 UA 中带 PTST 标识。 | |
| GTmetrix | 监控与测速 | GTmetrix | (以包含「GTmetrix」为特征) |
网站性能评分服务,测试节点定期抓取被监控页面。 | |
| Internet Archive | 存档与快照 | Internet Archive | Mozilla/5.0 (compatible; archive.org_bot; Wayback Machine Live Record; +http://archive.org/details/archive.org_bot) |
Wayback Machine 网页时光机的内容抓取器,把网页存档供公众回溯。 | |
| ArchiveTeam ArchiveBot | 存档与快照 | ArchiveTeam | (以包含「ArchiveTeam ArchiveBot」为特征) |
社区志愿存档组织的抓取机器人,遇"站点将关停"消息时会出现突发性大并发抓取。 | |
| sqlmap | 安全扫描 | 开源渗透测试工具 | (以包含「sqlmap」为特征) |
自动 SQL 注入检测工具,日志中出现即说明有人在探测你的接口参数,建议直接封禁。 | |
| Nikto | 安全扫描 | 开源渗透测试工具 | (以包含「Nikto」为特征) |
经典 Web 服务器漏洞扫描器,UA 常直接自报家门。 | |
| Nessus | 安全扫描 | Tenable | (以包含「Nessus」为特征) |
主机与服务漏洞扫描器,扫描行为特征明显。 | |
| Acunetix | 安全扫描 | Acunetix(Invicti) | (以包含「Acunetix」为特征) |
商业 Web 应用漏洞扫描器,商业版可自定义 UA,但默认 UA 带 acunetix 字样。 | |
| WPScan | 安全扫描 | 开源渗透测试工具 | (以包含「WPScan」为特征) |
WordPress 专用漏洞与弱口令扫描器,WordPress 站点日志中需要重点关注。 | |
| DirBuster | 安全扫描 | OWASP | (以包含「DirBuster」为特征) |
目录与路径爆破工具,配合大量 404 请求出现。 | |
| Nuclei | 安全扫描 | ProjectDiscovery | (以包含「Nuclei」为特征) |
基于模板的漏洞扫描器,默认 UA 自报项目名与仓库地址。 | |
| ffuf | 安全扫描 | 开源渗透测试工具 | (以包含「Fuzz Faster U Fool」为特征) |
目录与参数模糊测试工具,默认 UA 就是一句"Fuzz Faster U Fool"。 | |
| Arachni | 安全扫描 | 开源安全项目 | (以包含「Arachni」为特征) |
开源 Web 应用安全扫描框架。 | |
| zgrab | 安全扫描 | Censys 系研究项目 | (以包含「zgrab」为特征) |
互联网范围扫描研究工具,多用于全网指纹普查,配合大段 IP 轮询出现。 | |
| curl | 通用工具与程序库 | 开源命令行工具 | curl/8.6.0 |
最常用的命令行 HTTP 客户端,日志中出现可能是脚本调试、接口联调或采集脚本。 | |
| Wget | 通用工具与程序库 | 开源命令行工具 | Wget/1.21.4 |
命令行下载工具,整站递归抓取时请求量会很大。 | |
| python-requests | 通用工具与程序库 | Python 生态 | python-requests/2.32.0 |
Python 最常用的 HTTP 库,是自编采集脚本最常见的 UA。 | |
| Python-urllib | 通用工具与程序库 | Python 生态 | Python-urllib/3.12 |
Python 标准库 HTTP 客户端,同 python-requests 一样多为脚本访问。 | |
| Go-http-client | 通用工具与程序库 | Go 生态 | Go-http-client/2.0 |
Go 语言默认 HTTP 客户端,高并发采集程序的常见 UA。 | |
| Java HttpClient | 通用工具与程序库 | Java 生态 | Java/17.0.10 |
JVM 程序默认 UA,爬虫与接口调用都会出现。 | |
| Apache-HttpClient | 通用工具与程序库 | Java 生态 | Apache-HttpClient/4.5.14 (Java/17.0.10) |
Java 广泛使用的 HTTP 客户端库,常见于企业级采集与对接程序。 | |
| OkHttp | 通用工具与程序库 | Java/Android 生态 | okhttp/4.12.0 |
Android 与 Java 端流行的 HTTP 库。 | |
| Scrapy | 通用工具与程序库 | Python 生态 | Scrapy/2.11 (+https://scrapy.org) |
Python 知名爬虫框架,礼貌的实现会保留默认 UA 并遵守 robots。 | |
| aiohttp | 通用工具与程序库 | Python 生态 | Python/3.12 aiohttp/3.9.5 |
Python 异步 HTTP 库,异步批量采集脚本常用。 | |
| httpx | 通用工具与程序库 | Python 生态 | python-httpx/0.27.0 |
Python 新一代 HTTP 客户端库,默认 UA 为 python-httpx/版本号。 | |
| libwww-perl | 通用工具与程序库 | Perl 生态 | libwww-perl/6.77 |
Perl 的 HTTP 库,历史悠久的蜘蛛 UA,也常被老旧脚本使用。 | |
| axios | 通用工具与程序库 | Node.js 生态 | axios/1.6.8 |
Node.js 与浏览器端流行的请求库。 | |
| Node.js fetch | 通用工具与程序库 | Node.js 生态 | (以包含「undici」为特征) |
Node.js 内置 fetch(undici 引擎)与 node-fetch 库的默认 UA。 | |
| HeadlessChrome | 通用工具与程序库 | 自动化浏览器 | (以包含「HeadlessChrome」为特征) |
Chrome 无头模式,广泛用于自动化测试、截图与渲染采集;若 UA 同时自称搜索引擎蜘蛛,基本可判定伪装。 | |
| PhantomJS | 通用工具与程序库 | 自动化浏览器 | (以包含「PhantomJS」为特征) |
已停更的老一代无头浏览器,如今日志中出现多为老脚本或低质量采集工具。 |
从访问日志取出 UA,用本页「蜘蛛识别」核对特征词是否为已知蜘蛛。注意检查是否混有 HeadlessChrome、python-requests、curl、Scrapy 等程序库标识,或同时出现两家机构的蜘蛛——正规蜘蛛的 UA 干净且唯一,混写即伪装。
对来源 IP 做反向解析,正规蜘蛛的 IP 一定解析到官方域名。以 Googlebot 为例:nslookup -type=PTR 66.249.66.1 应得到 crawl-66-249-66-1.googlebot.com。各大蜘蛛的官方网段:Google 在 .googlebot.com、必应在 .search.msn.com、百度在 .crawl.baidu.com、字节在 .crawl.bytedance.com、华为 PetalBot 在 .petalsearch.com / .aspiegel.com(亚马逊系按官方 IP 名单核对)。
把上一步得到的主机名再解析回 IP:nslookup crawl-66-249-66-1.googlebot.com。Google、必应、Yandex 等会返回原 IP,闭环成立;百度、字节跳动的部分网段不提供回解析,PTR 命中官方网段即可判定。核心依据始终是 PTR 主机名是否落在官方域名下——伪装者很难在官方域下拿到主机名。
验证通过:放心放行,检查 robots.txt 与站点地图确保抓取顺畅;验证失败:按伪装处理,在 nginx / 宝塔防火墙 / CDN 按 IP 封禁,或对自称搜索引擎 UA 的请求强制做反向校验后再放行;无法验证:观察抓取频率与路径再决定限流还是封禁。
蜘蛛(Spider / Crawler / Bot)是自动抓取网页的程序:沿着链接逐页访问,把内容带回自己的数据库或语料库。搜索引擎收录、AI 训练数据、反链分析、可用性监控,全都靠它们。
搜索引擎蜘蛛(Googlebot、Baiduspider)、AI 数据采集(GPTBot、ClaudeBot、Bytespider)、SEO 工具(AhrefsBot、SemrushBot)、分享预览(Twitterbot、Discordbot)、监控测速(UptimeRobot、Chrome-Lighthouse)、安全扫描(sqlmap、Nessus)等。
中大型站点日志里蜘蛛流量常占三成以上:正规蜘蛛带来收录与流量,值得放行;伪装蜘蛛采集内容、探测漏洞、刷量耗带宽,需要识别并封禁。分清"来的是谁"是流量运营的第一步。
蜘蛛通过 User-Agent 表明身份,但 UA 写在请求头里、任何人都能伪造,所以还要用 IP 反向 DNS 交叉验证。本页把两步都搬到了浏览器里:UA 特征库本地匹配,IP 验证走公共 DNS 接口。
蜘蛛(也叫爬虫、Bot、机器人)是自动访问网页的程序。搜索引擎靠它们收录页面,AI 公司靠它们采集训练数据,SEO 工具靠它们分析反链与关键词,监控服务靠它们探测可用性,同时也混杂着采集站、漏洞扫描器等不请自来的访问。中大型站点的日志里蜘蛛流量占到三成以上很常见,因此分清来的是谁、是不是真的,是站长的基础功课。
标准做法分三步:第一步对照 User-Agent,看 UA 中的特征词(如 Googlebot、Baiduspider)是否为已知蜘蛛,并检查 UA 是否混有 HeadlessChrome、python-requests 之类的程序库标识——正规蜘蛛不会这样组合;第二步对来源 IP 做反向 DNS 解析(PTR 记录),例如 Googlebot 的 IP 一定解析到 googlebot.com 域名下、Baiduspider 解析到 crawl.baidu.com、Bytespider 解析到 crawl.bytedance.com,PTR 命中官方网段即可判定为真;第三步做正向验证辅助确认,Google、必应、Yandex 的 PTR 主机名会解析回原 IP 形成闭环,而百度、字节跳动的部分网段不提供回解析,正向查到别处 IP 才算伪装。本页的 UA 识别与 IP 真伪校验功能就是按这套流程实现的。
伪装成搜索引擎蜘蛛的访问通常没安好心:可能是整站采集搬运内容、探测漏洞与弱口令、刷量消耗带宽与配额,或者绕过针对普通访客的风控。它们会污染你的统计数据、拖慢服务器,还可能让真实搜索引擎蜘蛛被误伤式的一刀切封禁连坐。
robots.txt 只对守规矩的蜘蛛生效,伪装蜘蛛根本不会理会它。对付假蜘蛛要在服务器层面下手:在 nginx、宝塔防火墙或 CDN 防火墙规则中按 IP 封禁;对自称搜索引擎 UA 的请求启用反向 DNS 校验(正规蜘蛛通过、其余拒绝);对明显是程序库的 UA(curl、python-requests、Scrapy 等)按需限制频率或拒绝。屏蔽后建议观察一段时间日志,避免误杀真实蜘蛛。
希望获得搜索流量的站点应当放行 Googlebot、Baiduspider、Bingbot 等搜索引擎蜘蛛;做 AdSense 的站点必须放行 Mediapartners-Google;希望进入 ChatGPT 搜索、Perplexity 等 AI 搜索结果的站点可以放行 OAI-SearchBot、PerplexityBot。AI 训练类采集(GPTBot、ClaudeBot、Bytespider 等)是否放行取决于你对内容授权的态度,可在 robots.txt 中按 UA 逐个声明允许或禁止。
UA 识别、蜘蛛大全查询全部在浏览器本地完成,不会发送到任何服务器。IP 真伪校验需要做 DNS 解析,页面会向公共 DNS 服务的 HTTPS 接口(AliDNS、dns.google)发起解析请求,查询内容只有域名记录本身,不会经过也不上传到 ico5.net 的服务器。各标签页的「刚刚有人识别」记录面板仅保存识别结论(命中的蜘蛛名称、判定结果、掩码后的蜘蛛 IP),不保存你粘贴的原始 User-Agent,也不记录访问者自己的任何信息。
如果本站工具对你有帮助,欢迎请作者喝杯咖啡