不用写代码适合0编程基础的谷歌浏览器爬虫插件:webscraper
- 2021年12月31日
- 1,034 次
最近看到了一个很牛逼的谷歌浏览器爬虫插件:webscraper。这款爬虫插件非常适合0编程基础的人使用,不用写任何编程代码,很快就能爬取到自己所需要的数据,当然笔者也只是偶尔看到这款插件,这几日也是简单的使用这款插件简单的爬取了一些网站数据,至于能否向Python一样爬取更多复杂的数据,目前还没有研究过。下面就简单的先介绍下webscraper的使用方法。
webscraper官方网站:https://www.webscraper.io/
官方网站中有简单的使用方法,可以简单的了解一下。简单的看了下,其实他的浏览器插件是免费使用的,还有收费版本的,如果爬取一些简单的数据,浏览器插件版本的基本上就够用了。
webscraper安装:
webscraper谷歌浏览器插件可以自行找个插件网站自行下载,下载好的文件是一个crx后缀的文件,将crx后缀名修改为rar或者是zip格式或者是其他的压缩文件后缀,然后再打开谷歌浏览器的开发者调试模式进行安装即可,这里就不过多进行介绍。
webscraper谷歌浏览器中创建爬虫:
1、在谷歌浏览器中打开目标网站并打开谷歌的开发者工具(快捷键F12).
2、找到web scraper下的Create new sitemap再点击Create sitemap。
根据上图提示就可创建一个爬虫了。
3、填写完毕后点击最下面的Create sitemap便可以开始设置所需要爬取的网站内容了。
需要注意的问题:
1、Sitemap name的名字不能以数字开头。
2、Start URL中必须是完整正确的网址链接,并要带上http头或者是https的头。
设置webscraper爬虫所需要爬取的网站内容:
:
根据上图所示,填写各项内容即可。
Id:填写需要爬取内容的名称,这个也是最后导出文件的文件名,可以根据自己的习惯命名,最好是以英文或者是拼音的形式命名。
Type:这个就是所需要爬取内容的类型,这里因只是简单记载爬取网站标题,这里我就选择Text类型。
Selector:就是选择器的意思,这里就选择Select,然后下面的multiple是多个意思,意思就是要爬取多个内容。选择了Selector下的这两个必选项后,在目标站页面就会出现选择器的界面。
选择好所需要的内容后,根据上图所示,勾选后点击Done Selecting就会在Selector中自动添加上所选择的区域的Css的区域,就是我们要抓取的内容区域。
设置完毕以上内容后,点击Save Selector后,选择Sitemap(sitemap的id)下的Scrape后便可以开始爬取所需要的内容部分了。
查看所爬取到内容点击Browse,如果需要导出所爬取的内容则点击Export data as CSV。
若非作者标注皆为李涛自留地原创文章,转载或复制请以超链接形式并注明出处。
- WordPress代码实现文章目录功能 WordPress不用插件自动文章目录效果 2022-05-29
- 宝塔及robots禁止BLEXBot垃圾蜘蛛爬虫爬行 2022-09-19
- 谷歌浏览器爬虫插件webscraper如何爬取多页面内容? 2021-12-31
- 制作思维导图简单又漂亮 使用前端助手快速制作思维导图 2022-11-12
- ZblogPHP目录索引插件不生效问题及解决办法 2022-10-20
- WordPress文章页显示和Markdown编辑器预览效果中表格一样的css样式 2022-06-10
