robots.txt里的爬虫都在"扮猪吃老虎"?

原创
alex 25分钟前 阅读数 1 #头条
你查过自己网站的robots.txt吗?我翻了翻,发现不少user-agent行写得模模糊糊——有的只写个"bot",有的干脆留空。这正常吗? 一个爬虫来爬你的站,按规矩应该自报家门:用什么工具、代表谁。但现实是,相当多的user-agent字段既不说明身份,也不透露目的。你猜它是什么?搜索引擎?监控工具?还是某家的爬虫大军?不知道。 这种"不命名"的做法让我有点警觉。robots.txt本应是透明度协议的一部分,告诉搜索引擎哪些页面该爬、哪些不该爬。可一旦user-agent本身就不透明,整个协议就打了折扣。你没法追溯是谁在访问,也没法区分善意和恶意。 我的判断:这不是技术细节,是信任问题。一个连身份都不愿暴露的爬虫,你凭什么相信它遵守你的robots规则?

原文:The robots.txt user-agent lines that do not name what they look like · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除