新站点上线后的第3天搜索引挚日志文件access.log记录下大量数据。一家企业周一开通服务器周三下午14点查询搜狗放出15个页面。在百度搜索框输入完全一致的标题结果显示0条记录。查看宝塔面板的服务器日志发现IP段为116.179.32.x的Baiduspider在周二凌晨2点访问首页3次返回状态码200。IP段为123.125.71.x的Sogou web spider访问12次。两家搜索引擎的爬虫程序对待新域名的抓取频次与放出时间有着完全不同的设定。百度对新注册域名的考察期长达21天到28天。新域名在百度的初始信誉分15分满分100分。前端展示及格线60分。500个小时的考察期百度蜘蛛把下载的HTML文件存放在名为sandbox-temp的临时数据库里。爬虫提取网页底部的ICP备案号与工信部数据库里的18位统一社会信用代码进行比对。备案号对不上信誉分扣除15分。备案号完全一致系统加20分。网页在这个阶段不会出现在前端搜索结果中。搜狗的数据库每天补充5000万个新网页来维持信息量。搜狗对新域名的初始信誉分要求仅10分。服务器在48小时内能正常通信延迟低于300毫秒搜狗蜘蛛把抓取到的网页标题和描述强制渲染出来。排位安排在第15页或者第20页之后。搜狗爬虫无视域名有没有3年的建站历史抓取到300个汉字的内容塞进数据库。百度的文本提取算法剥离掉网页里的div、span等标签专门计算纯汉字的数量。一篇包含200个汉字和5张图片的企业简介被系统打上低质短内容标签。普通资讯文章的最低字数门槛800字。蜘蛛读取这800字计算纯文本词频。文章内容与百度现有数据库里的老文章有75%的重复率系统判定抄袭临时数据库里的这篇网页被永久删除。搜狗的HTML解析标准放宽要求。网页里有300个汉字搜狗建库存储。相似度检测的容忍度高达90%。改换文章首尾段落通过搜狗的去重检测。搜狗蜘蛛每次下载网页分配50KB的内存放弃读取复杂的CSS和JS脚本文件。百度蜘蛛分配150KB以上的内存把整个网页的视觉排版完全模拟出来排版错乱扣除10分。百度搜索资源平台官方指南提到加载时间超过1.5秒的网页蜘蛛中断抓取进程当天的抓取配额减少50%。百度蜘蛛抓取新站的6个硬性指标设定首字节响应时间控制在200毫秒以内。过去36个月该域名的历史解析记录里0条被惩罚痕迹。每周一上午9点网站有3篇全新的纯原创文章发布。网页的标题标签内包含15个汉字长度的精准短句。100%的图片属性填写10个字以内的图片内容说明。单个网页向外导出的友情链接数量上限5个。百度的蜘蛛与搜狗蜘蛛抓取参数对比数据表抓取参数项目百度蜘蛛 (Baiduspider)搜狗蜘蛛 (Sogou web spider)新站初始信誉分15分10分考察期天数21天 - 28天1天 - 2天纯文本字数下限800字300字内容重复度上限25%10%内存分配大小150KB50KB每日抓取配额100个URL不限量延迟容忍度1.5秒内3.0秒内网站管理员登录宝塔面板或阿里云控制台下载当天的access.log日志。使用代码编辑器打开按快捷键搜索爬虫标识符。统计返回的状态码。200代表蜘蛛成功带走文件。404代表文件丢失。503代表服务器中央处理器占用率达到100%。一个正常运行一周的新站每天有50个200状态码。连续出现5个503状态码百度蜘蛛停止抓取48小时。新站的抓取配额限制在每天100个网页以内超过部分全部丢弃。应对百度抓取规则的7个执行操作在百度搜索资源平台绑定站点提交包含100个条目的可扩展标记语言格式地图文件。撰写字数达到1200字的行业技术评测文章包含具体的型号和参数。上传的5张产品实拍图使用压缩工具将单张大小限制在80KB以内。寻找2个建站时间超过5年的同行业网站交换首页链接。在文章底部放置3篇相关阅读文章的链接把跳出率控制在60%以下。开启服务器的代码压缩功能将网页体积从120KB压缩到30KB。安装数字证书把明文传输协议替换为加密协议开启443端口通信。花钱购买10000个论坛群发外链24小时内触发百度的反作弊系统。域名的信誉分掉到负50分。从负分恢复到正常状态保持网站连续180天无违规操作每天更新2篇纯手工原创文章。使用采集软件一天生成500个没有排版、没有段落的机翻网页访客停留时间不足3秒跳出率高达95%。三个月的时间跨度搜索引擎把这500个页面连同网站首页一起从数据库中彻底抹除。服务器的物理位置距离访客的真实地理位置相差3000公里页面加载时间增加400毫秒。在北京备案的网站服务器放在海外机房跨洋光缆的数据传输产生15%的丢包率。百度蜘蛛的爬取节点部署在国内的北京、上海、广州三大数据中心。爬虫每次发起网络握手连接耗时超过800毫秒系统判定该站点不符合国内用户的浏览标准拒绝分配展示排名。降低惩罚风险的4个操作动作不在同一台物理主机上绑定超过10个没有任何真实流量的空壳域名。不在文章内容的头部、中部、尾部塞入超过3次完全一样的长尾词。修改网页大标题标签的频率不超过每个月1次每次改动字数不超过5个字。不使用脚本代码把真实的文字替换成图片格式躲避审查。使用Nginx架构的服务器抗并发能力优于Apache架构。100个用户在同一秒钟点击网页Nginx占用的内存仅2.5MB。蜘蛛在高峰期凌晨2点到4点之间进行批量抓取稳定的内存占用率保证状态码维持在200。内存飙升到8GB上限服务器宕机重启蜘蛛抓取到空白文件。连续3天发生宕机该域名的沙盒期延长30天放行时间无限期搁置。网页代码的层级嵌套深度严重影响抓取成功率。企业网站的代码主体标签到正文段落标签中间隔了8个布局区块层级百度蜘蛛解析到第5层放弃读取。搜狗蜘蛛停留在第3层。网页源码体积超过2MB蜘蛛提取有效文本的耗时超过1.2秒抓取状态强制转为206断点续传。当天的收录配额按作废处理。精简网页代码的3个硬性指标删除无用的样式表冗余类名将排版文件体积控制在50KB内。把所有的特效脚本调用代码放在网页底部的闭合标签上方。整体代码的层级嵌套保持在4层以内。手机端与电脑端的适配状态被计入抓取评分。百度移动端蜘蛛占比达到85%。使用自适应设计的网站同一个排版文件在375像素宽度的屏幕上加载时间低于1秒。蜘蛛分配的移动端初始信誉分增加15分。电脑端网页使用代码强制跳转到移动端二级目录两次重定向消耗600毫秒蜘蛛抓取成功率下降40%。