李涛自留地
回到顶部
首页 > 应用 > 不用写代码适合0编程基础的谷歌浏览器爬虫插件:webscraper

不用写代码适合0编程基础的谷歌浏览器爬虫插件:webscraper

最近看到了一个很牛逼的谷歌浏览器爬虫插件:webscraper。这款爬虫插件非常适合0编程基础的人使用,不用写任何编程代码,很快就能爬取到自己所需要的数据,当然笔者也只是偶尔看到这款插件,这几日也是简单的使用这款插件简单的爬取了一些网站数据,至于能否向Python一样爬取更多复杂的数据,目前还没有研究过。下面就简单的先介绍下webscraper的使用方法。

webscraper官方网站:https://www.webscraper.io/

官方网站中有简单的使用方法,可以简单的了解一下。简单的看了下,其实他的浏览器插件是免费使用的,还有收费版本的,如果爬取一些简单的数据,浏览器插件版本的基本上就够用了。

webscraper安装:

webscraper谷歌浏览器插件可以自行找个插件网站自行下载,下载好的文件是一个crx后缀的文件,将crx后缀名修改为rar或者是zip格式或者是其他的压缩文件后缀,然后再打开谷歌浏览器的开发者调试模式进行安装即可,这里就不过多进行介绍。

webscraper谷歌浏览器中创建爬虫:

1、在谷歌浏览器中打开目标网站并打开谷歌的开发者工具(快捷键F12).

2、找到web scraper下的Create new sitemap再点击Create sitemap。

不用写代码适合0编程基础的谷歌浏览器爬虫插件:webscraper

根据上图提示就可创建一个爬虫了。

3、填写完毕后点击最下面的Create sitemap便可以开始设置所需要爬取的网站内容了。

需要注意的问题:

1、Sitemap name的名字不能以数字开头。

2、Start URL中必须是完整正确的网址链接,并要带上http头或者是https的头。

设置webscraper爬虫所需要爬取的网站内容:

不用写代码适合0编程基础的谷歌浏览器爬虫插件:webscraper:

根据上图所示,填写各项内容即可。

Id:填写需要爬取内容的名称,这个也是最后导出文件的文件名,可以根据自己的习惯命名,最好是以英文或者是拼音的形式命名。

Type:这个就是所需要爬取内容的类型,这里因只是简单记载爬取网站标题,这里我就选择Text类型。

Selector:就是选择器的意思,这里就选择Select,然后下面的multiple是多个意思,意思就是要爬取多个内容。选择了Selector下的这两个必选项后,在目标站页面就会出现选择器的界面。

不用写代码适合0编程基础的谷歌浏览器爬虫插件:webscraper

选择好所需要的内容后,根据上图所示,勾选后点击Done Selecting就会在Selector中自动添加上所选择的区域的Css的区域,就是我们要抓取的内容区域。

设置完毕以上内容后,点击Save Selector后,选择Sitemap(sitemap的id)下的Scrape后便可以开始爬取所需要的内容部分了。

不用写代码适合0编程基础的谷歌浏览器爬虫插件:webscraper

查看所爬取到内容点击Browse,如果需要导出所爬取的内容则点击Export data as CSV。

若非作者标注皆为李涛自留地原创文章,转载或复制请以超链接形式并注明出处。