Python有许多强大的库用于爬虫,如beautifulsoup、requests等,本文将以网站https://www.xiurenji.cc/XiuRen/为例(慎点!!),讲解网络爬取图片的一般步骤。
为什么选择这个网站?其实与网站的内容无关。主要有两项技术层面的原因:①该网站的页面构造较有规律,适合新手对爬虫的技巧加强认识。②该网站没有反爬虫机制,可以放心使用爬虫。
第三方库需求
- beautifulsoup
- requests
步骤
打开网站,点击不同的页面:
发现其首页是https://www.xiurenji.cc/XiuRen/,而第二页是https://www.xiurenji.cc/XiuRen/index2.html,第三页第四页以此类推。为了爬虫代码的普适性,我们不妨从第二页以后进行构造url。
选中封面图片,点击检查:
可以发现,图片的信息,都在'div',class_='dan'
里,而链接又在a
标签下的href
里。据此我们可以写一段代码提取出每一个封面图片的url:
def getFirstPage(page): url='https://www.xiurenji.cc/XiuRen/index'+str(page)+'.html'#获得网站每一个首页的网址 res=requests.get(url)#发送请求 res.encoding="gbk"#设置编码方式为gbk html=res.text soup=BeautifulSoup(html,features='lxml') lists=soup.find_all('div',class_='dan')#找到储存每一个封面图片的标签值 urls=[] for item in lists: url1=item.find('a').get('href')#寻找每一个封面对应的网址 urls.append('https://www.xiurenji.cc'+url1)#在列表的尾部添加一个元素,达到扩充列表的目的,注意要把网址扩充完整 return urls#返回该主页每一个封面对应的网址
点击封面图片,打开不同的页面,可以发现,首页的网址是https://www.xiurenji.cc/XiuRen/xxxx.html,而第二页的网址是https://www.xiurenji.cc/XiuRen/xxxx_1.html,第三第四页同理。同样为了普适性,我们从第二页开始爬取。
右键,点击“检查”:
可以发现所有的图片信息都储存在'div',class_='img'
中,链接、标题分别在img
标签中的src
和alt
中,我们同样也可以将它们提取出来。
def getFirstPage(page): url='https://www.xiurenji.cc/XiuRen/index'+str(page)+'.html'#获得网站每一个首页的网址 res=requests.get(url)#发送请求 res.encoding="gbk"#设置编码方式为gbk html=res.text soup=BeautifulSoup(html,features='lxml') lists=soup.find_all('div',class_='dan')#找到储存每一个封面图片的标签值 urls=[] for item in lists: url1=item.find('a').get('href')#寻找每一个封面对应的网址 urls.append('https://www.xiurenji.cc'+url1)#在列表的尾部添加一个元素,达到扩充列表的目的,注意要把网址扩充完整 return urls#返回该主页每一个封面对应的网址
完整代码
import requests from bs4 import BeautifulSoup def getFirstPage(page): url='https://www.xiurenji.cc/XiuRen/index'+str(page)+'.html'#获得网站每一个首页的网址 res=requests.get(url)#发送请求 res.encoding="gbk"#设置编码方式为gbk html=res.text soup=BeautifulSoup(html,features='lxml') lists=soup.find_all('div',class_='dan')#找到储存每一个封面图片的标签值 urls=[] for item in lists: url1=item.find('a').get('href')#寻找每一个封面对应的网址 urls.append('https://www.xiurenji.cc'+url1)#在列表的尾部添加一个元素,达到扩充列表的目的,注意要把网址扩充完整 return urls#返回该主页每一个封面对应的网址 def download(urls): for url1 in urls: print("prepare to download pictures in "+url1) getEveryPage(url1)#下载页面内的图片 print("all pictures in "+url1+"are downloaded") def getEveryPage(url1): total=0#total的作用:对属于每一个封面内的图片一次编号 for n in range (1,11):#每一个封面对应下载10张图,可自行调整 temp=url1.replace('.html','') url2=temp+'_'+str(n)+'.html'#获得每一内部页面的网址 res=requests.get(url2) res.encoding="gbk" html=res.text soup=BeautifulSoup(html,features='lxml') lists1=soup.find_all('div',class_='img')#储存图片的路径 for item in lists1: url=item.find('img').get('src') title=item.find('img').get('alt')#获取图片及其标题 picurl='https://www.xiurenji.cc'+url#获取完整的图片标题 picture=requests.get(picurl).content#下载图片 address='D:\pythonimages'+'\\'#自定义保存图片的路径 with open(address+title+str(total)+'.jpg','wb') as file:#保存图片 print("downloading"+title+str(total)) total=total+1 file.write(picture) if __name__ == "__main__": page=int(input('input the page you want:')) urls=getFirstPage(page) download(urls)
本文仅供学习参考,切勿用作其他用途!
《魔兽世界》大逃杀!60人新游玩模式《强袭风暴》3月21日上线
暴雪近日发布了《魔兽世界》10.2.6 更新内容,新游玩模式《强袭风暴》即将于3月21 日在亚服上线,届时玩家将前往阿拉希高地展开一场 60 人大逃杀对战。
艾泽拉斯的冒险者已经征服了艾泽拉斯的大地及遥远的彼岸。他们在对抗世界上最致命的敌人时展现出过人的手腕,并且成功阻止终结宇宙等级的威胁。当他们在为即将于《魔兽世界》资料片《地心之战》中来袭的萨拉塔斯势力做战斗准备时,他们还需要在熟悉的阿拉希高地面对一个全新的敌人──那就是彼此。在《巨龙崛起》10.2.6 更新的《强袭风暴》中,玩家将会进入一个全新的海盗主题大逃杀式限时活动,其中包含极高的风险和史诗级的奖励。
《强袭风暴》不是普通的战场,作为一个独立于主游戏之外的活动,玩家可以用大逃杀的风格来体验《魔兽世界》,不分职业、不分装备(除了你在赛局中捡到的),光是技巧和战略的强弱之分就能决定出谁才是能坚持到最后的赢家。本次活动将会开放单人和双人模式,玩家在加入海盗主题的预赛大厅区域前,可以从强袭风暴角色画面新增好友。游玩游戏将可以累计名望轨迹,《巨龙崛起》和《魔兽世界:巫妖王之怒 经典版》的玩家都可以获得奖励。
更新日志
- 中国武警男声合唱团《辉煌之声1天路》[DTS-WAV分轨]
- 紫薇《旧曲新韵》[320K/MP3][175.29MB]
- 紫薇《旧曲新韵》[FLAC/分轨][550.18MB]
- 周深《反深代词》[先听版][320K/MP3][72.71MB]
- 李佳薇.2024-会发光的【黑籁音乐】【FLAC分轨】
- 后弦.2012-很有爱【天浩盛世】【WAV+CUE】
- 林俊吉.2012-将你惜命命【美华】【WAV+CUE】
- 晓雅《分享》DTS-WAV
- 黑鸭子2008-飞歌[首版][WAV+CUE]
- 黄乙玲1989-水泼落地难收回[日本天龙版][WAV+CUE]
- 周深《反深代词》[先听版][FLAC/分轨][310.97MB]
- 姜育恒1984《什么时候·串起又散落》台湾复刻版[WAV+CUE][1G]
- 那英《如今》引进版[WAV+CUE][1G]
- 蔡幸娟.1991-真的让我爱你吗【飞碟】【WAV+CUE】
- 群星.2024-好团圆电视剧原声带【TME】【FLAC分轨】