如果日志用于判断二级域名的访问、抓取或跳转是否正常,最该先核对的是主机名(host)字段,再看请求路径、状态码、响应大小、User-Agent 和 Referer。主机名决定这条记录属于哪个二级域名,其余字段负责解释它发生了什么。只盯着状态码而不核对主机名,很容易把主域、其他子域和 CDN 回源混在一起,得出错误结论。
二级域名是主域名左侧多出的一层名称,例如 blog.example.com 中的 blog,而 example.com 是主域。日志中它可能出现在不同位置:Web 服务器访问日志的 host 字段、CDN 日志的请求主机名、DNS 查询日志的查询名称。核对前要先确认日志来源,因为同一台服务器可能同时服务多个二级域名,字段含义并不完全一致。
适用前提是:你手上有一份可读的原始日志,且知道它来自 Web 服务器、CDN 还是 DNS。若日志已被聚合工具加工过,字段名可能被重命名,需要先找到原始字段与展示字段的对应关系,再开始核对。
第一步,按主机名过滤出目标二级域名的记录,统计各状态码数量。第二步,抽取状态码非 200 的记录,逐条查看请求路径、响应大小和 User-Agent。第三步,把同一时间戳下主域与其他二级域名的记录放在一起对比,看异常是只出现在一个子域,还是全站共有。
判断规则可以这样设定:如果某二级域名的 404 集中在少数路径,通常是链接或资源引用问题;如果 5xx 在多个路径同时出现,更可能是后端或回源问题;如果响应大小为 0 且状态码为 200,需要检查是否返回了空内容。以上都只是可能原因,只有结合路径、时间和后端日志才能定位为已确认原因。
日志字段能说明请求发生了什么,但不能直接证明搜索引擎是否收录。robots.txt 的抓取限制不等于可靠的索引移除,站点地图也不保证收录。若日志里出现抓取程序的 User-Agent,只能说明它访问过,不能据此推断排名或索引状态。HTTPS 同样不保证安全无漏洞或排名,它只是传输层的一个条件。不同搜索引擎的抓取程序标识和支持情况需要分别核查,不要用一份日志的结论覆盖所有来源。
下一步:取一段包含目标二级域名的原始日志,按主机名过滤后导出状态码分布,再挑出异常记录逐条核对路径与响应大小,形成一份可复查的字段对照表。