当前位置：移动技术网 > IT编程>脚本编程>Python > Python 【爬虫】

Python 【爬虫】

2019年08月31日 | 移动技术网IT编程 | 我要评论

郑家彬,招商骗局,wuyeweibo

爬虫的工作原理

首先，爬虫可以模拟浏览器去向服务器发出请求；

其次，等服务器响应后，爬虫程序还可以代替浏览器帮我们解析数据；

接着，爬虫可以根据我们设定的规则批量提取相关数据，而不需要我们去手动提取；

最后，爬虫可以批量地把数据存储到本地

爬虫的步骤

第0步：获取数据。爬虫程序会根据我们提供的网址，向服务器发起请求，然后返回数据。

第1步：解析数据。爬虫程序会把服务器返回的数据解析成我们能读懂的格式。

第2步：提取数据。爬虫程序再从中提取出我们需要的数据。

第3步：储存数据。爬虫程序把这些有用的数据保存起来，便于你日后的使用和分析。

#######################################################################

mac pip3 install requests

win pip install requests

requests库可以帮我们下载网页源代码、文本、图片，甚至是音频

import requests

#引入requests库

res = requests.get('url')

#requests.get是在调用requests库中的get()方法，它向服务器发送了一个请求，括号里的参数是你需要的数据所在的网址，然后服务器对请求作出了响应。

#我们把这个响应返回的结果赋值在变量res上。

##############################################################

response对象的常用属性

response.status_code

print(变量.status_code)

用来检查请求是否正确响应，如果响应状态码为200，即代表请求成功

response.content

把response对象的内容以二进制数据的形式返回，适用于图片、音频、视频的下载

import requests

res = requests.get('https://res.pandateacher.com/2018-12-18-10-43-07.png')

#发出请求，并把返回的结果放在变量res中

pic=res.content

#把reponse对象的内容以二进制数据的形式返回

photo = open('ppt.jpg','wb')

#新建了一个文件ppt.jpg，这里的文件没加路径，它会被保存在程序运行的当前目录下。

#图片内容需要以二进制wb读写。你在学习open()函数时接触过它。

photo.write(pic)

#获取pic的二进制内容

photo.close()

#关闭文件

response.text

把response对象的内容以字符串的形式返回，适用于文字、网页源代码的下载

import requests

#引用requests库

res = requests.get('https://localprod.pandateacher.com/python-manuscript/crawler-html/sanguo.md')

#下载《三国演义》第一回，我们得到一个对象，它被命名为res

novel=res.text

#把response对象的内容以字符串的形式返回

print(novel[:800])

#现在，可以打印小说了，但考虑到整章太长，只输出800字看看就好。在关于列表的知识那里，你学过[:800]的用法。

k = open('《三国演义》.txt', 'a+')

k.write(novel)

k.close()

response.encoding

#语法：res.encoding=''

import requests

#引用requests库

res = requests.get('https://localprod.pandateacher.com/python-manuscript/crawler-html/sanguo.md')

#下载《三国演义》第一回，我们得到一个对象，它被命名为res

res.encoding='utf-8'

#定义reponse对象的编码为utf-8。

novel=res.text

#把response对象的内容以字符串的形式返回

print(novel[:800])

#打印小说的前800个字。

定义response对象的编码

遇上文本的乱码问题，才考虑用res.encoding

目标数据本身是什么编码是未知的。

用requests.get()发送请求后，我们会取得一个response对象，其中，requests库会对数据的编码类型做出自己的判断。

但是！这个判断有可能准确，也可能不准确。

如果它判断准确的话，我们打印出来的response.text的内容就是正常的、没有乱码的，那就用不到res.encoding；

如果判断不准确，就会出现一堆乱码，那我们就可以去查看目标数据的编码，然后再用res.encoding把编码定义成和目标数据一致的类型即可。

####################################################################

robots协议

“网络爬虫排除标准”（robots exclusion protocol），这个协议用来告诉爬虫，哪些页面是可以抓取的，哪些不可以。

#查看robots协议网站的域名后加上/robots.txt

user-agent: baiduspider #百度爬虫

allow: /article #允许访问 /article.htm

allow: /oshtml #允许访问 /oshtml.htm

allow: /ershou #允许访问 /ershou.htm

allow: /$ #允许访问根目录，即淘宝主页

disallow: /product/ #禁止访问/product/

disallow: / #禁止访问除 allow 规定页面之外的其他所有页面

user-agent: googlebot #谷歌爬虫

allow: /article

allow: /oshtml

allow: /product #允许访问/product/

allow: /spu

allow: /dianpu

allow: /oversea

allow: /list

allow: /ershou

allow: /$

disallow: / #禁止访问除 allow 规定页面之外的其他所有页面

…… # 文件太长，省略了对其它爬虫的规定，想看全文的话，点击上面的链接

user-agent: * #其他爬虫

disallow: / #禁止访问所有页面

爬取时，先看看网站的robots协议是否允许你去爬取

限制好爬虫的速度

您可能感兴趣的文章:

如对本文有疑问，请在下面进行留言讨论，广大热心网友会与你互动！！点击进行留言回复

Python爬虫:Request Payload和Form Data的简单区别说明

request payload 和 form data 请求头上的参数差别在于：content-typeform datapost表单请求代码示例headers... [阅读全文]
如何基于python实现不邻接植花

有 n 个花园，按从 1 到 n 标记。在每个花园中，你打算种下四种花之一。paths[i] = [x, y] 描述了花园 x 到花园 y 的双向路径。另外，没... [阅读全文]
构建高效的python requests长连接池详解

前文：最近在搞全网的cdn刷新系统，在性能调优时遇到了requests长连接的一个问题，以前关注过长连接太多造成浪费的问题，但因为系统都是分布式扩展的，针对这种... [阅读全文]
python中threading开启关闭线程操作

在python中启动和关闭线程：首先导入threadingimport threading然后定义一个方法def serial_read():......然后定... [阅读全文]
浅谈Python中threading join和setDaemon用法及区别说明

python多线程编程时，经常会用到join()和setdaemon()方法，今天特地研究了一下两者的区别。1、join ()方法：主线程a中，创建了子线程b，... [阅读全文]
Python3-异步进程回调函数(callback())介绍

废话不多说，大家之家看代码吧！#异步'''举例：你喊你朋友吃饭，你朋友正忙，如果你一直在那等他，等你朋友忙完了，你们一块去。--同步调用你喊你朋友吃饭，你朋友正... [阅读全文]
python继承threading.Thread实现有返回值的子类实例

继承与threading.thread实现有返回值的子类mythread，废话不多说，大家直接看代码import threadingclass mythread... [阅读全文]
浅谈Python3多线程之间的执行顺序问题

一个多线程的题：定义三个线程id分别为abc，每个线程打印10遍自己的线程id，按abcabc……的顺序进行打印输出。我的解法：from threading i... [阅读全文]
Python中使用threading.Event协调线程的运行详解

threading.event机制类似于一个线程向其它多个线程发号施令的模式，其它线程都会持有一个threading.event的对象，这些线程都会等待这个事件... [阅读全文]
python 实现两个线程交替执行

我就废话不多说，直接看代码吧！import threadingimport timedef a(): while true: lockb.acquire... [阅读全文]

网友评论


验证码：

Python 【爬虫】

2019年08月31日 | 移动技术网IT编程 | 我要评论

您可能感兴趣的文章:

相关文章:

网友评论