当前位置: 移动技术网 > IT编程>脚本编程>Python > python爬虫爬取赶集网数据

python爬虫爬取赶集网数据

2019年04月14日  | 移动技术网IT编程  | 我要评论

李晓波 诺贝尔,海底避难所,刘战零

一.创建项目

scrapy startproject putu

二.创建spider文件

scrapy genspider  patubole patubole.com


 

三.利用chrome浏览器分析出房价和标题的两个字段的xpath表达式,开始编写patubole.py文件。网络的爬取是通过这个文件进行的

以下代码是最终的代码

所建的patubole.py文件必须实现name,parse函数,start_url这三个属性


 

四.将爬取的数据保存到数据库sufang中。

(1)在pycharm中新建数据库


 

 

完成后会出现


 

(2)将数据存放在新建的数据库zufang的数据表sufang中

数据的爬取是有patubole.py实现的,数据的存储是由pipelines.py实现的,pipelines.py又是有items.py提供数据的支持

所以编写items.py


 

此时就要回过头来修改刚开是为了测试编写的patubole.py 文件

代码如下


 

3)在settings.py中进行patupipeline文件配置

item_pipelines = {

      'patu.pipelines.patupipeline': 300,

 }

(5)pipelines.py文件代码,实现存储数据到数据库中

其中包含sql的相关知识


 

最终结果


 

 其中main.py文件是为了调式方便而添加的,可以不用,直接用相关命令启动爬虫


 

如对本文有疑问,请在下面进行留言讨论,广大热心网友会与你互动!! 点击进行留言回复

相关文章:

验证码:
移动技术网