前言
scrapy是一个开源的网络爬虫框架,python编写的。最初设计用于网页抓取,也可以用来提取数据使用api或作为一个通用的网络爬虫。是数据采集不可必备的利器。
安装
1
|
pip install scrapy |
如果使用上面的命令太慢。国内可以使用豆瓣源进行加速。
1
|
pip install - i https: / / pypi.douban.com / simple scrapy |
注意要写错了,是 https://pypi.douban.com/simple 很多包都可以使用这个源进行加速,这也是pip的一个技巧,还可以使用阿里云进行加速。
安装完成之后在命令行输入
1
|
scrapy - v |
如果出现了相应的版本号就说明安装成功。
创建项目
目前还没有ide 能够创建scrapy的项目,我们必须手动初始化项目。
1、找一个目录
输入命令
1
|
scrapy startproject spiderobject |
命令行出现这样的结果说明创建成果
1
2
3
|
you can start your first spider with: cd spiderobject scrapy genspider example example.com |
去文件夹中看看
初始化项目
使用pycharm打开该项目
如果出现这个页面就说明对了。
下面生成一个模板
打开pycharm的terminal
输入
1
|
scrapy genspider biduspider http: / / www.baidu.com |
我们的spider 包下面会多一个文件
这说明我们的spider创建成功。可以在pytharm中使用这个 强大的框架了。
以上这篇pycharm+scrapy安装并且初始化项目的方法就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持服务器之家。
原文链接:https://blog.csdn.net/skullFang/article/details/78607942