SEO死链处理:检查前需要准备哪些信息
📍 WDQWDWQD987AAAAA:216.73.216.250
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /4c17431f3491.html
📄
SEO死链处理:检查前需要准备哪些信息
在动手检查死链之前,需要先准备好四类信息:站点范围与URL样本、服务器与日志的访问权限、当前robots.txt与站点地图状态、以及历史URL变更记录。缺少这些信息,检查结果往往只能发现零散404,无法判断哪些死链值得修复、哪些应该保留404或做301跳转。
先确定检查范围:全站还是重点目录
死链检查不是一上来就爬全站。先明确范围,才能决定用哪种工具和多大的抓取量。
- 要查什么:站点根目录、主要栏目路径、以及已知改版过的目录。
- 怎么查:在服务器或CMS后台导出当前URL列表,按目录归类;同时记录域名是否已启用HTTPS、是否有www与无www两个版本。
- 结果说明什么:如果同一内容存在多个URL版本,检查时会把它们当成不同页面,死链统计会偏大。先统一规范版本,再统计才准确。
适用条件:站点URL数量在可导出范围内。若URL超过数万条,先按目录抽样,而不是一次性全量爬取。
准备服务器日志与访问权限
工具爬取只能模拟访问,真实死链更多来自用户和搜索引擎的实际请求。日志是判断死链来源的关键依据。
- 要查什么:最近30天的访问日志中,状态码为404、410、500的请求路径,以及请求来源(用户浏览器还是搜索引擎爬虫)。
- 怎么查:从服务器或CDN导出日志,用命令行筛选状态码,例如
grep " 404 " access.log,再按路径统计出现次数。
- 结果说明什么:高频404且来源是站内链接的,属于必须处理的内链死链;仅被外部旧链接请求、站内已无入口的,可以评估是否值得做301。
注意:日志中的404不一定都是死链。有些是扫描器请求不存在的路径,这类不应纳入修复清单,判断依据是请求是否对应过真实存在的内容。
核对robots.txt、站点地图与跳转规则
在检查前必须确认这些文件不会干扰结果,否则会把“被禁止抓取”误判为“死链”。
- 要查什么:robots.txt中是否有Disallow规则挡住了待检查目录;站点地图里列出的URL是否仍返回200;是否存在整站或目录级的301、302规则。
- 怎么查:直接访问
/robots.txt 和站点地图文件,逐条比对;用 curl -I 查看目标URL返回的状态码和Location头。
- 结果说明什么:被robots.txt禁止抓取的URL,工具可能报错但不代表页面不存在;站点地图中的URL返回404,说明地图需要更新;若返回301,要确认跳转目标是否相关。
需要区分:robots.txt的抓取限制不等于可靠的索引移除,站点地图也不保证收录。检查时应把“抓取受阻”和“页面不存在”分开记录。
整理历史URL变更记录
死链大多来自URL结构变更。没有变更记录,就只能靠猜哪些旧地址曾经存在。
- 要查什么:改版时间点、旧URL规则、新旧URL的对应关系、是否已配置过跳转。
- 怎么查:从CMS修订记录、版本控制、旧站点地图备份或归档快照中提取旧URL;与当前URL列表做差集。
- 结果说明什么:能一一对应的旧URL适合做301;无对应内容的旧URL适合返回410或保留404;对应关系模糊的,需要人工确认后再决定。
两种处理方案的比较条件
检查完成后,常见选择是301跳转与保留404/410。判断依据如下:
- 301跳转:适用于旧URL有对应新内容、且仍有外部链接或搜索流量的情况。跳转目标必须内容相关,否则会被视为软404。
- 404或410:适用于内容已彻底删除、无替代页面的情况。410表示明确删除,但不同搜索引擎对410与404的处理速度存在差异,需分别核查,不能假定两者效果完全一致。
假设某旧产品页已下线且无新产品替代,站内也无入口,仅有少量外部旧链接指向它——这种条件下保留404比强行跳转到首页更合理。若该页面仍有稳定外部链接和访问量,则应寻找内容最接近的替代页做301。
下一步:按上述清单逐项收集信息后,先输出一份“URL—状态码—来源—建议处理方式”的表格,再决定哪些进入301清单、哪些保留404,避免在信息不全时批量修改跳转规则。