宝塔nginx服务器简单禁止Python网络爬虫爬取网站
- 2021年9月16日
- 1,512 次
今日在学习Python网络爬虫过程中,见识到了Python爬虫的厉害,所以就拿自己网站做了一个测试,结果在未设置UA头的情况下,直接输出了网站的信息,所以就对服务器做了简单设置,使宝塔nginx服务器简单禁止Python了网络爬虫请求爬取网站。
如图所示:
设置步骤如下:
宝塔控制面板——网站——设置——配置文件中添加以下代码:
if ($http_user_agent ~* "Python|Java|Wget|Scrapy|Curl|HttpClient|Bytespider|FISPIDER|YisouSpider") { return 403; }
重启服务器后,再次在Pycharm启动requests模块请求的时候,就直接显示了403禁止访问错误。这里只是简单的在服务器里禁止了Python网络爬虫爬取网站,如果添加了user_agent头之后,还是可以爬取到。后续在学习Python过程中将继续学习和研究如何防范伪装的UA头爬虫。
若非作者标注皆为李涛自留地原创文章,转载或复制请以超链接形式并注明出处。
- 图片网站建设之图片加速优化 2020-12-28
- 安装Python解释器及测试是否安装成功 2021-07-28
- Phpcms v9 列表页、内容页目录式(拼音格式)伪静态 2021-11-18
- Python列表操作:如何给列表添加新元素? 2021-11-07
- Html中Form表单enctype属性有哪些?Form表单enctype的作用 2022-11-16
- Nginx 504 Gateway Timeout超时详解:原因与优化方案 2026-07-02
