当前位置：移动技术网 > IT编程>脚本编程>Python > 荐 python 爬虫获取动漫截图

荐 python 爬虫获取动漫截图

2020年07月05日 | 移动技术网IT编程 | 我要评论

引言

之前有些无聊（呆在家里实在玩的腻了），然后就去B站看了一些python爬虫视频，没有进行基础的理论学习，也就是直接开始实战，感觉跟背公式一样的进行爬虫，也算行吧，至少还能爬一些东西，hhh。我今天来分享一个我的爬虫代码。

正文

话不多说，直接上完整代码

ps：这个代码有些问题每次我爬到fate的图片它就给我报错，我只好用个try来跳过了，如果有哪位大佬能帮我找出错误并给与纠正，我将不胜感激

import requests as r
import re
import os
import time
file_name = "动漫截图"
if not os.path.exists(file_name):
	os.mkdir(file_name)
                
for p in range(1,34):
        print("--------------------正在爬取第{}页内容------------------".format(p))
        url = 'https://www.acgimage.com/shot/recommend?page={}'.format(p)
        headers = {"user-agent"
           : "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.162 Safari/537.36"}
           
        resp = r.get(url, headers=headers)  
        html = resp.text

        images = re.findall('src="(.*?)" ', html)
        names =re.findall('title="(.*?)"', html)
        #print(images)
        #print(names)
        dic = dict(zip(images, names))
        for image in images:
                time.sleep(1)
                print(image, dic[image])
                name = dic[image]
                #name = image.split('/')[-1]
                i = r.get(image, headers=headers).content
                try:
                     with open(file_name + '/' + name  + '.jpg' , 'wb') as f:
                         f.write(i)
                except FileNotFoundError:
                    continue

先导入要使用的库

import requests as r
import re
import os
import time

然后去分析要去爬的网址：动漫截图网

下图是网址的内容：
在这里插入图片描述
好了 url已经确定

下面去寻找headers
在这里插入图片描述
找到user-agent 将其内容复制到headers中

第一步就完成了

下面是代码展示

url = 'https://www.acgimage.com/shot/recommend?page={}'.format(p)
headers = {"user-agent"
           : "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.162 Safari/537.36"
           }

然后检索要爬的图片内容
在这里插入图片描述
从上图就可以找到图片的位置：data-origina=后面的内容
以及图片的名字：title=后面的内容

然后用正则表达式re来检索就行了

images = re.findall('src="(.*?)" ', html)
names =re.findall('title="(.*?)"', html)

最后将其保存就好了

i = r.get(image, headers=headers).content
with open(file_name + '/' + name  + '.jpg' , 'wb') as f:
         f.write(i)

还有就是一些细节了
比如换页
第一页网址：
https://www.acgimage.com/shot/recommend
第二页网址：https://www.acgimage.com/shot/recommend?page=2

然后将page后面的数字改动就可以跳到相应的页面
换页的问题也就解决了

or p in range(1,34):
        url = 'https://www.acgimage.com/shot/recommend?page={}'.format(p)

以及将爬到的图片放到自己建立的文件zh
使用了os库

 file_name = "动漫截图"
 if not os.path.exists(file_name):
      os.mkdir(file_name)

以及为了不影响爬取的网站使用了sleep函数
虽然爬取的速度慢了一些
但是这是应遵守的道德

time.sleep(1)

以上这就是我的爬虫过程
还是希望大佬能解决我的错误之处
万分感谢

本文地址：https://blog.csdn.net/qq_45843334/article/details/106174204

您可能感兴趣的文章:

如对本文有疑问，点击进行留言回复！！

[机器学习] Yellowbrick使用笔记4-目标可视化

目标可视化工具专门用于直观地描述用于监督建模的因变量，通常称为y目标。代码下载当前实现了以下可视化：平衡箱可视化... [阅读全文]
pandas中category类型的数据处理

pandas中category类型的数据用途和特点常见的问题处理Categorical 数据用途和特点categ... [阅读全文]
Leetcode刷题记录——72. 编辑距离

设word1的长度是mword2的长度是ndp是一个m+1行 n+1列的矩阵dp[0][0] = 0其中第0行... [阅读全文]
Numpy中的dot运算

1.数组和数组之间的运算[In] import numpy as np a = np.array([1,2,3]... [阅读全文]
PAT 甲级真题 1006 Sign In and Sign Out (25分) python实现

1006 Sign In and Sign Out (25分)At the beginning of every... [阅读全文]
OpenCV计算机视觉实战（Python）| 03、阈值与平滑处理

文章目录简介总结图像阈值图像平滑均值滤波方框滤波高斯滤波中值滤波简介本节为《OpenCV计算机视觉实战（Pyth... [阅读全文]
python基础——异常处理——try

本人会先介绍几种异常处理的常见语句，然后以一个猜数大小游戏来使用部分异常处理，其中包括Python自带的异常... [阅读全文]
动态规划_leetcode.64.最小路径和

题目给定一个包含非负整数的 m x n 网格，请找出一条从左上角到右下角的路径，使得路径上的数字总和为最小。说明... [阅读全文]
Flask学习笔记（十六）Flask—Mail

Flask—Mail在开发过程中，很多应用程序都需要通过邮件提醒用户，Flask的扩展包Flask-Mail通过... [阅读全文]
python 05异常处理

python 05 异常处理练习题：题目描述:电脑产生一个零到100之间的随机数字，然后让用户来猜，如果用户猜的... [阅读全文]

网友评论


验证码：

荐 python 爬虫 获取动漫截图

2020年07月05日 | 移动技术网IT编程 | 我要评论

引言

正文

您可能感兴趣的文章:

相关文章:

网友评论

荐 python 爬虫获取动漫截图