跟着示例核对
示例内容用于说明方法,非本站探测记录。复核于 2026-10-03。
模拟 robots.txt(无真实抓取)
User-agent: *
Disallow: /draft/
Allow: /draft/public/
Sitemap: https://example.com/sitemap.xml
对照 URL:/draft/private.html、/draft/public/card.html
模拟 HTML:<meta name="robots" content="noindex">怎样解释结果
按此处 Google 的路径匹配语义,private.html 被禁止抓取,public/card.html 的更具体允许规则可匹配。robots.txt 的禁止抓取不保证 URL 不出现在索引中;HTML noindex 需要爬虫能读取才可生效。
不符合预期时
先区分禁止抓取、禁止索引和保护私人资料。需要隐藏敏感内容时使用认证,不以 robots.txt 代替访问控制;读取失败或规则不清楚时停止发布规则。
修改后复查
用目标搜索引擎的官方工具核对两条 URL 的规则和实际抓取条件;再分别检查 noindex、canonical 和抓取记录。索引更新有时延,不能据单次请求宣称移除成功。
