尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

网站链接检查神器:broken-link-checker 帮你 5 分钟扫完整站 404

网站链接检查神器:broken-link-checker 帮你 5 分钟扫完整站 404 网站链接检查神器broken-link-checker 帮你 5 分钟扫完整站 404【免费下载链接】broken-link-checkerFind broken links, missing images, etc within your HTML.项目地址: https://gitcode.com/gh_mirrors/br/broken-link-checkerbroken-link-checker 是一个免费的 Node.js 网站链接检查库一条命令递归爬取整站自动排查 404 坏链、缺失图片与失效资源。它并发快、配置全、输出清晰新手也能直接上手是 SEO 运维和内容维护的省心之选。一个 404到底毁掉什么先说点扎心的。用户点击一篇文章里的配图转圈半天弹出一张 404客户顺着官网导航找到产品页页面空白。坏链这种东西平时你感觉不到它的存在直到有人投诉、有人流失。更麻烦的是内容站一篇老文里埋着十几个链接改版之后哪个断了根本无从查起电商站商品图挂了不报 404 就少一张卖点图等运营发现已经过了活动期文档站API 文档之间的交叉引用人肉点一遍要一下午还总会漏。手动点链接页面多时就是体力活。正则抓a href会漏掉图片、样式表、meta 跳转。这时就需要一个真正的坏链检测工具——broken-link-checker下文简称 blc。网站链接检查工具运行效果能力拆解为什么它扫得快、扫得准blc 不是遍历链接挨个请求的朴素实现它把几件性能关键的事都做对了。用大白话讲并发队列 温和限速默认所有 URL 并发检查同时用maxSocketsPerHost默认每主机 2 个限制对单台服务器的压力。翻译过来扫得猛但不会把目标站打挂。想更温和就调rateLimit和--requests想快就放开——节奏自己定。流式解析 响应缓存HTML 不是下完再读而是边流边解析parse5-parser-stream驱动核心逻辑在lib/internal/streamHTML.js页面没下完就开始提链接。同时请求结果会缓存cacheResponses默认开启缓存 1 小时同一个 URL 被十篇文章引用也只真正检查一次。大站的收益非常直观。按 WHATWG 标准解析不只盯a href它遵循 WHATWG 的 HTML 与 URL 规范检查范围远不止超链接和图片media 标签、frames、meta 跳转、样式表、脚本、表单甚至 metadata都能按filterLevel分级纳入检查。页面里写了base href相对 URL 照样能被正确还原。中文、日文这类 Unicode 链接名也不在话下。礼貌地爬robots 协议支持默认遵守 robots.txt、X-Robots-Tag头、relnofollow和 meta 声明被排除的链接会明确标注BLC_ROBOTS原因而不是默默跳过。想强制跟遍所有链接加一个-f即可。合规和彻底二选一由你决定。重定向与压缩全自动处理301/302 跟到哪里检查的就是最终落点gzip、deflate 响应自动解压带 Basic 认证的后台页面也能进。这些边角料恰恰是别的工具最容易出假报的地方。谁在用它三类真实场景内容团队 / 电商 / 文档库版本发布前跑一遍把坏链和裂图在用户之前揪出来。文档库特别适合配--exclude关键词过滤只盯站内路径几百篇页面几分钟出结果。教育与政务站点资源链接多、更新慢、责任大。定期比如每月一次全量扫描并归档报告BLC_INVALID、HTTP_404这类原因码直接能当工单内容用方便排期修复。CI/CD 流水线它同时是一个正经的 Node.js 库SiteChecker、HtmlChecker等类暴露了完整事件link、page、site、end可以嵌入构建流程发现坏链就让流水线变红。详见 lib/public/ 下的公开类。亮点速览一张表看懂维度说明检查范围超链接、图片、media、frames、meta 跳转、CSS/JS/表单按filterLevel分级速度默认全并发 响应缓存maxSockets/--requests可调解析能力WHATWG 规范 HTML/URL 解析支持base href与 Unicode网络处理重定向、gzip/deflate 解压、Basic 认证、HEAD 失败自动重试 GET礼貌爬取默认遵守 robots.txt / nofollow / X-Robots-Tag可一键关闭过滤includedKeywords/excludedKeywords通配词过滤内外链可分别排除报告每个链接带原因码如HTTP_404、BLC_ROBOTS可直接生成报告集成CLI 与事件式 API 双形态天然适合 CI/CD许可MIT免费可商用Node.js ≥ 14原因码对照表见 lib/internal/reasons.js每个坏链为什么坏一目了然。快速上手一条命令排查整站坏链前提是装了 Node.js≥ 14。第 1 步全局安装npm install broken-link-checker -g第 2 步递归扫描你的站点blc http://yoursite.com -r -o-r表示递归爬整站-o表示按页面中链接出现顺序输出。本地文件也行blc path/to/index.html -r。第 3 步看报告终端会实时显示进度和每条链接的结果坏链红色标注并附原因码Getting links from: http://yoursite.com/ ├─ OK─── http://yoursite.com/about.html ├─ OK─── http://yoursite.com/images/logo.png ├─ BROKEN─ http://yoursite.com/images/banner-old.png (HTTP_404) ├─ SKIP── http://yoursite.com/admin (BLC_ROBOTS)常用选项按需加-e只查站内链接跳过外链外部站不背你的锅--include *.pdf只检查 PDF 链接--exclude temp/*排除临时目录--host-requests 1对目标站更温和blc --help查看完整选项源码在 lib/cli.js。进阶写进代码里const {SiteChecker} require(broken-link-checker); const siteChecker new SiteChecker() .on(link, (result) { if (result.get(isBroken)) { console.log(result.get(rebasedURL) ?? result.get(originalURL), -, result.get(brokenReason)); } }) .on(end, () console.log(扫描完成)); siteChecker.enqueue(new URL(http://yoursite.com));想暂停随时pause()想继续resume()工程化程度相当高。一句话总结网站链接检查、404 排查、缺图定位——三件事一条blc命令全包。装完它你会爱上发版前先扫一遍的踏实感。现在就打开终端给你的站点做一次全面体检吧。【免费下载链接】broken-link-checkerFind broken links, missing images, etc within your HTML.项目地址: https://gitcode.com/gh_mirrors/br/broken-link-checker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表