如何检查网站死链:检查前需要准备哪些信息

📍 WDQWDWQD987AAAAA:216.73.216.39
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /2e15eca0b511.html
📄

如何检查网站死链:检查前需要准备哪些信息

检查网站死链之前,最需要准备的不是工具账号,而是一份能说明“检查范围、判断标准、交付对象”的基础信息。至少要拿到网站域名清单、希望检查的目录或栏目范围、允许抓取的频率、内链与外链的区分要求,以及最终报告要给谁看。缺了这些,多人协作时很容易出现一个人抓全站、另一个人只想要栏目页,最后报告口径不一致而返工。

先确定检查范围:域名、子域和目录边界

死链检查的第一步是明确边界。一个网站可能有主域名、多个子域名、独立博客或帮助中心,如果范围没写清,抓取结果会混在一起,后续分工和复核都会变乱。

如果团队只关心导航和正文里的链接,可以准备一份“必须检查的入口页清单”;如果要做全站巡检,则要准备站点地图或主要栏目入口,方便抓取工具顺着链接发现页面。站点地图不保证收录,也不能替代真实抓取,它只是帮助发现 URL 的线索之一。

准备判断标准:什么算死链,什么只是暂时异常

检查前必须约定“死链”的定义,否则同一份结果,有人把 404 算死链,有人把 500 也算死链,有人把超时当成死链,最后报告无法统一。

把这些判断标准写成一张简单表格,交给参与检查的人共用。多人协作时,标准比工具更重要,因为工具只给状态码,是否要修、先修哪个,仍然依赖统一口径。

准备抓取与访问条件:权限、频率和 robots 限制

开始抓取前,要确认执行者是否有权访问目标页面。如果网站有登录限制、IP 白名单、验证码或访问频率限制,直接抓取可能得到大量假死链。此时应准备测试账号、允许的抓取时间段和并发上限。

还要查看 robots.txt。它规定爬虫可以抓取哪些路径,但要注意:robots.txt 的抓取限制不等于可靠的索引移除。也就是说,某个 URL 被 robots 禁止抓取,不代表它一定不会出现在搜索结果里,也不代表它一定不是死链。检查时应把 robots 禁止的路径单独列出,判断是“不允许抓”还是“页面真的坏了”。

如果使用第三方工具,要提前确认它是否遵守 robots、是否支持自定义 User-Agent、是否允许导出明细。不同工具对 JavaScript 渲染页面的支持不同,单页应用或大量动态加载的网站,可能需要浏览器渲染后再抓取。

准备交付格式:报告字段和责任人

多人协作最容易返工的环节,是报告字段不统一。检查前先约定输出列,后续整理会省很多时间。

如果外链占比较多,还要准备外链归属信息,例如对方网站名称、联系页面或合作记录。没有这些信息,外链死链只能标记,无法推进替换或删除。

实施、验证与维护:最关键的一步是复测

准备完成后,按“抓取—筛选—复测—分派—修复—再验证”的顺序执行。最关键的一步是复测:第一次抓取到的错误里,可能混有超时、限流、临时 503 或抓取工具误判。把同一批错误链接间隔一段时间再跑一次,只把复测仍失败的结果列为待修死链,能明显减少无效工单。

复测时可以用下面这个检查项:

  1. 对每个错误 URL 单独访问一次,记录状态码和页面内容。
  2. 如果返回 200,检查页面是否显示正常内容,排除软 404。
  3. 如果返回 301 或 302,记录最终落地页,判断是否相关。
  4. 如果仍返回 404 或 410,标记为确认死链,进入修复队列。
  5. 修复后再次复测,确认来源页面上的链接已更新或移除。

维护阶段要约定巡检频率。内容更新频繁的栏目可以每月检查一次,稳定页面可以每季度检查一次。每次检查都沿用同一份范围清单和判断标准,避免人员更换后重新定义规则。

下一步,先把域名范围、目录边界、判断标准和报告字段写成一张检查前确认单,发给参与协作的人确认。确认单没有争议后,再开始抓取和复测。

图1 图2

nginx