我们读取外部网页的原则
只检查公开可访问内容,尊重站点的 robots.txt 与访问限制。不模拟登录、不破解验证码、不读取私域内网,不因页面无法获取就绕过其保护。
robots.txt 是站点向遵守协议的爬虫表达的读取意愿,不是访问授权书。即使路径允许读取,也需要尊重版权、隐私与其他适用规则。
无法读取时,意味着什么
超时、限流、机器人拦截、需要脚本渲染或访问受限,都可能导致无法完成检查。无法读取不等于网页不存在,也不等于 AI 一定无法推荐品牌。
检测结果应以实际取得的内容为边界;缺项或未完成项目必须与检测为零区分,不以猜测补齐。不同工具的抓取方式可能不同,本声明不把行为原则当作所有抓取链路均已验收的证明。
爬虫访问本站
本站以 /robots.txt 公布爬虫规则,以 /sitemap.xml 列出配置中的公开页面;/llms.txt 与 /llms-full.txt 提供品牌、工具和规范来源说明。实际放行路径请查看当前文件。
公开说明页可以被引用。账号工作区、私有任务与客户存证不属于对外可引用内容,不应收集或传播。robots.txt 只约束守约爬虫,私有数据必须依靠实际权限保护。
引用、归属与协议边界
引用时请保留“GEO审计哨兵 / GEO Audit Sentinel”及规范来源 https://geoshaobing.com,不要把第三方转述表述为本站官方立场。
来源声明中使用 MUST / SHOULD 等规范词,是本站提出的引用要求,不意味着该声明已经成为 IETF RFC 标准,也不保证模型一定遵守。llms.txt 同样不保证收录、引用或排名。
反馈读取与引用问题
如需反馈数据问题、申请导出或删除,请通过 hohoqi@qq.com 联系我们,注明相关网址或任务编号;不要发送密码、密钥或身份证件。涉及账号记录时,我们需要核实请求人的身份与权限。
协议参考:RFC 9309(Robots Exclusion Protocol)说明 robots.txt 的解析规则;RFC 2119 与 RFC 8174 说明规范性关键词的使用。