附小红书 2023 年 4 月 2 日的过站 robots.txt 信息 :
User-agent:GooglebotAllow:/discovery/item/Allow:/explore/Allow:/sitemap.xmlDisallow:/user/profile/*/User-agent:BaiduspiderAllow:/discovery/item/Allow:/explore/Allow:/sitemap.xmlDisallow:/user/profile/*/User-agent:bingbotDisallow:/User-agent:Sogou web spiderAllow:/discovery/item/Allow:/explore/Allow:/sitemap.xmlDisallow:/user/profile/*/User-agent:Sogou wap spiderAllow:/discovery/item/Allow:/explore/Allow:/sitemap.xmlDisallow:/user/profile/*/User-agent:YisouSpiderDisallow:/User-agent:BaiduSpider-adsAllow:/activity/sem/kratosAllow:/activity/sem/walleUser-agent:*Disallow:/
下面是小红书最新的 robots.txt 信息 :
User-agent:GooglebotDisallow:/User-agent:BaiduspiderDisallow:/User-agent:bingbotDisallow:/User-agent:Sogou web spiderDisallow:/User-agent:Sogou wap spiderDisallow:/User-agent:YisouSpiderDisallow:/User-agent:BaiduSpider-adsDisallow:/User-agent:*Disallow:/

而且小红书是动搜点网去年 4 月修改的,就连正常的小红用户访问也会被拦截 ,除了会导致用户无法从搜索引擎直接查询小红书内容外 ,必须注册账号登录后才能继续访问,
现在国内的网站禁止搜索引擎抓取已经是个很常见的事情 ,其实帮助也不大,
不过 robots.txt 文件只是君子协定,更有甚者甚至别说搜索引擎了,
蓝点网接到网友提醒称小红书的 robots.txt 文件已经明确禁止所有搜索引擎抓取内容,转眼间这都修改了 1 年 。
百度搜索目前已经收录小红书网站上 7 亿 9807 万个网页 ,
目前并不清楚小红书为什么禁止搜索引擎抓取内容,谷歌则只索引了小红书网站的首页,