网站常为爬虫提供 robots.txt。本题要确认:robots.txt 要求不抓取的文件,是否仍能被直接访问。
先访问 /robots.txt
查看 `Disallow` 指定了哪个路径
在浏览器中直接访问该路径