使用SEMrush做站点审计时,最终能检查多少页面,并不完全取决于网站本身有多少URL。SEMrush站点审计怎么设置抓取范围SEMrush站点审计抓取页面不完整如何排查,需要同时检查抓取来源、页面数量上限、站内链接结构以及服务器是否允许SiteAuditBot访问。尤其是页面数量明显少于Sitemap中的URL数量时,先不要直接判断页面丢失,应从Site Audit项目的抓取配置开始核对。
一、SEMrush站点审计怎么设置抓取范围
Site Audit并不是固定从整个网站抓取。创建项目时可以指定不同的URL发现方式,因此同一个网站采用不同抓取来源,最终得到的页面数量也会不同。
1、选择合适的抓取来源
①进入对应项目并打开【Site Audit】,点击页面右上角的齿轮图标进入设置。
②找到页面抓取范围设置,根据审计目的选择Website、Robots.txt sitemap、Sitemap URL或URLs from file。
③需要检查网站实际内部链接能否被爬虫发现时,选择Website。SiteAuditBot会从首页开始,根据页面代码中的内部链接继续向下抓取。
④只想检查Sitemap已经提交的页面时,选择Sitemap URL,并填写对应的Sitemap地址。
⑤需要审核一批指定页面时,选择URLs from file,再上传准备好的URL列表。
SEMrush目前提供上述四种主要抓取来源。Website更适合检查真实爬行路径,而Sitemap和URL文件更适合控制审计范围。
2、设置需要检查的页面数量
抓取来源确定后,还要检查项目允许抓取的页面数量。如果网站有数万个URL,而当前项目只设置检查几千个页面,Site Audit达到数量上限后便不会继续扩展。
①进入Site Audit设置,找到检查页面数量限制。
②根据网站实际规模提高页面上限,尽量覆盖需要审计的主要栏目。
③网站规模较大时,可以先按目录分别审计产品页、资讯页和其他重点区域,避免大量低价值参数页占用抓取额度。
④重新启动审计,再比较实际抓取数量。
抓取页面受到项目和套餐额度限制,因此设置值不能超过当前账户允许的范围。
3、需要检查特定目录时限制范围
大型网站没有必要每次都做全站审计。某次只修改了产品目录,可以把抓取范围集中在该目录,从而更快发现改版后的问题。
①设置抓取入口时选择对应目录或URL集合。
②排除后台、搜索结果、筛选参数和测试目录等不需要审计的区域。
③重新运行Site Audit,并在【Crawled Pages】中查看实际抓取URL。
④切换到站点结构视图,确认目标目录是否已经进入本轮审计。
需要注意,Site Audit中的站点结构是根据实际抓到的页面生成的。主动限制了页面数量或只审核某个目录后,这里的结构本身就不会代表完整网站。
二、SEMrush站点审计抓取页面不完整如何排查
页面数量不足时,应先判断是“没有发现URL”,还是“已经发现但无法访问”。两种情况看起来都是页面缺失,解决方向却完全不同。
1、先比较Sitemap和实际抓取数量
①打开Site Audit中的【Statistics】。
②查看Sitemap与已抓取页面数量的对比。
③如果Sitemap包含大量URL,而实际抓取页面明显偏少,再检查这些页面有没有站内入口。
④打开【Crawled Pages】,查看页面的抓取深度和传入内部链接。
选择Website作为抓取来源后,SiteAuditBot依靠页面代码中的链接不断发现新页面。某个产品页虽然存在于Sitemap,但整个网站没有页面链接到它,爬虫从首页开始时就可能无法沿内部链接找到。SEMrush也建议关注Sitemap页面数量与实际抓取数量之间的差异。
2、检查robots.txt和页面访问限制
robots.txt禁止SiteAuditBot访问,是抓取数量突然变少时需要优先检查的问题。
①打开网站根目录下的robots.txt,检查是否存在针对SiteAuditBot或所有爬虫的Disallow规则。
②重点查看产品目录、文章目录和资源目录是否被整段禁止。
③确认没有误把站点根目录设置为禁止抓取。
④修改规则后重新运行Site Audit,再查看被阻止页面数量是否下降。
站点还可能通过登录页、网关、防火墙或服务器安全策略拦截Semrush爬虫。页面在普通浏览器中能够打开,也不能证明SiteAuditBot一定能够访问。
3、检查noindex、JavaScript和服务器响应
页面没有明显robots限制时,还要继续看页面本身和服务器状态。
①检查缺失页面是否存在限制爬虫访问的robots元标记。
②确认导航、分类和分页链接是否只依靠JavaScript动态生成。
③检查Site Audit记录的HTTP状态码,排除大量4xx和5xx响应。
④如果网站开启Cloudflare、防火墙或安全插件,检查是否把短时间连续访问识别为异常流量。
⑤服务器承受能力有限时,降低Site Audit的抓取速度,再重新运行审计。
Semrush支持处理包含JavaScript的页面,但JavaScript结构仍可能造成部分抓取问题;服务器主动限制爬虫或短时间返回异常响应,也可能使正常页面在审计结果中表现为无法访问。
三、页面仍然缺失时怎么继续定位
经过范围和访问权限检查后仍有固定页面没有被抓取,可以直接选取几个缺失URL做对照,不必反复进行全站抓取。
1、用指定URL验证页面
①整理几条始终缺失的页面地址。
②把这些URL加入单独的抓取列表,重新执行一次小范围审计。
③能够正常抓取时,重点检查原来的内部链接和抓取深度。
④指定URL仍然无法抓取时,继续检查服务器响应、robots规则和访问权限。
2、检查网站链接结构
Site Audit从Website开始抓取时,页面距离首页越深,发现难度越高。统计报告会显示抓取深度,达到四层以上的页面尤其值得检查。可以补充分类页入口、面包屑、相关推荐和分页链接,让重要页面形成稳定的内部链接路径。
总结
处理SEMrush站点审计怎么设置抓取范围SEMrush站点审计抓取页面不完整如何排查,应先确认Website、Sitemap还是URL列表哪一种抓取来源更符合本次审计目的,再核对页面数量限制。出现页面缺失后,则从Sitemap差异、内部链接、robots.txt、页面访问权限、JavaScript和服务器拦截逐层检查。抓取数量恢复正常后,再根据站点结构和抓取深度优化内部链接,才能让后续Site Audit得到更完整、稳定的数据。希望本文对大家排查SEMrush站点审计抓取问题有所帮助,如需进一步了解相关功能,可联系咨询。