# 全局通用爬虫规则(适用于所有爬虫,含 GPTBot/PerplexityBot/ByteSpider 等 AI 爬虫) User-agent: * Allow: / # 屏蔽后台、临时缓存、配置目录、遗留目录 Disallow: /admin/ Disallow: /admin.php Disallow: /tmp/ Disallow: /uploads/temp/ Disallow: /config/ # 屏蔽静态资源目录,避免爬虫抓取预算浪费在 CSS/JS/字体上(日志显示大量爬虫在下载这些资产) Disallow: /assets/css/ Disallow: /assets/js/ Disallow: /assets/fonts/ Disallow: /uploads/products/thumb/ # 仅精确屏蔽分页/排序/分面等无收录价值的参数,避免 URL 增殖与权重分散 # 合法内容分页(/articles/?page=2 等)保持可抓取;索引策略由页面 meta robots/canonical 决定 Disallow: /*?p= Disallow: /*?sort= Disallow: /*?order= Disallow: /*?case_page= Disallow: /*?review_page= Disallow: /*?brand= Disallow: /*?tag= Disallow: /*?price= Disallow: /*?stock= Disallow: /*?form= Disallow: /*?cat= Disallow: /search/ Disallow: /*?cid= # 百度/谷歌 图片爬虫放行产品+配送实拍图(GEO 核心流量) # 注意:实拍原图位于 /upload/delivery/(不带 s),授权证据位于 /assets/evidence/,QR/logo 位于 /assets/images/ User-agent: Baiduspider-image Allow: /upload/ Allow: /uploads/ Allow: /assets/evidence/ Allow: /assets/images/ User-agent: Googlebot-Image Allow: /upload/ Allow: /uploads/ Allow: /assets/evidence/ Allow: /assets/images/ # 双站点地图 Sitemap: https://www.hftg0551.com/sitemap.xml Sitemap: https://www.hftg0551.com/sitemap-delivery.xml # 供 AI 直接读取的站点说明 LLMS: /llms.txt # 显式允许主流 AI 爬虫(不写 Disallow,避免挡住前述结构化数据) User-agent: GPTBot Allow: / User-agent: Claude-Web Allow: / User-agent: Google-Extended Allow: / # GEO 优化(2026-08-09):显式放行主流 AI 爬虫 User-agent: PerplexityBot Allow: / User-agent: ClaudeBot Allow: / User-agent: Bytespider Allow: / User-agent: Applebot-Extended Allow: / # AI 搜索引擎 / 助手机器人显式放行(2026-08-15 补充) # 覆盖 OAI-SearchBot、ChatGPT 浏览器、Common Crawl 及主流 AI 采集爬虫,避免 WAF 误拦 403 User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: CCBot Allow: / User-agent: Amazonbot Allow: / User-agent: cohere-ai Allow: / User-agent: FacebookBot Allow: / User-agent: meta-externalagent Allow: / User-agent: DoubaoBot Allow: / # 纯文本URL清单,与上方XML Sitemap并列供爬虫读取 Sitemap: https://www.hftg0551.com/sitemap.txt