神剑山庄资源网 Design By www.hcban.com
python爬虫-梨视频短视频爬取(线程池)
示例代码
import requests from lxml import etree import random from multiprocessing.dummy import Pool # 多进程要传的方法,多进程pool.map()传的第二个参数是一个迭代器对象 # 而传的get_video方法也要有一个迭代器参数 def get_video(dic): headers = { 'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.96 Safari/537.36 Edg/88.0.705.56' } video_data = requests.get(url = dic['url'] , headers = headers).content print(dic['name']+'开始下载') # 有的文件名中包含空格,在并发执行时会报错,这里用随机数给文件起名了 #path = dic['name']+'.mp4'会报错 path = "./lishipin/"+str(int(random.random()*100)) + '.mp4' with open(path,'wb') as fp: fp.write(video_data) print(dic['name']+'下载成功') def main(): # web_url:梨视频官网 web_url = 'https://www.pearvideo.com/category_5' headers = { 'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.96 Safari/537.36 Edg/88.0.705.56' } # web_page_tex:官网页面 web_page_text = requests.get(url = web_url,headers = headers).text tree = etree.HTML(web_page_text) # 解析梨视频官网“生活栏”中的所有li标签,遍历li标签,提取视频的url li_list = tree.xpath('//*[@id="listvideoListUl"]/li') rea_urls=[] for li in li_list: # video_name获取视频的名称 video_name = li.xpath('./div/a/div[2]/text()')[0]+'.mp4' # 加上'https://www.pearvideo.com/'得到完整的video_url video_url = 'https://www.pearvideo.com/'+li.xpath("./div/a/@href")[0] # 通过官网界面提取的url,并不是真正的url, # 因为MP4的视频是动态加载出来的,所以通过ajax请求获取视频的真实网址 # 但是通过分析发现,ajax请求获取的网址是一个伪网址,和真实网址有区别(cont...) ##真地址:https://video.pearvideo.com/mp4/third/20210208/cont-1719874-15690592-205957-ld.mp4 ## 1719874 ##伪地址:https://video.pearvideo.com/mp4/third/20210208/1612867876612-15690592-205957-ld.mp4 # 通过得到的video_url可以分析到 真假网址 不同的细节之处--countId # 通过ajax请求向video_url发起get请求,需要加countId和mrd参数 # 分析video_url得到countId,mrd是一个随机小树 countId = video_url.split("/")[-1].split("_")[1] mrd = random.random() # 加'Referer'参数,否则会显示该视频已下架了 headers = { 'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.96 Safari/537.36 Edg/88.0.705.56', 'Referer': 'https://www.pearvideo.com/video_' + countId } ajax_url = 'https://www.pearvideo.com/videoStatus.jsp' # 利用ajax请求获取伪地址 # https://www.pearvideo.com/videoStatus.jsp"-") end_url = "" #end_url是一个结尾字符串 for i in range(len(end_list)-1): end_url = end_url + "-"+ end_list[i+1] # 真实的地址,先用假地址,然后组合countId rea_url="" for element in fake_url_list: rea_url=rea_url+element+"/" rea_url=rea_url+"cont-"+str(countId) + end_url # print(rea_url) dic = { 'url':rea_url, 'name':video_name } rea_urls.append(dic) #print(rea_urls) pool = Pool(4) pool.map(get_video,rea_urls) pool.close() pool.join() if __name__ == '__main__': main()
知识点扩展:
Python爬虫下载视频(梨视频)
梨视频示例:Ctrl+Alt+L格式化代码
import re import requests import hashlib import time # print(respose.status_code)# 响应的状态码 # print(respose.content) #返回字节信息 # print(respose.text) #返回文本内容 mainurl = "https://www.pearvideo.com/" videourl = "http://www.pearvideo.com/video_1499584" headers={ 'User-Agent':'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36', 'Accept-Encoding':'gzip, deflate, sdch', 'Accept':'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8', 'Accept-Language':'zh-CN,zh;q=0.8', } # 获取视频链接列表 def geturls(url): res=requests.get(url) urls=re.findall('class="vervideo-tbd".*"(.*" rel="external nofollow" ',res.text,re.S) urllist=[] for i in urls: prefix='https://www.pearvideo.com/' urllist.append(prefix+i) return urllist # 获取视频链接并下载(写入到硬盘) def getvideo(url): res=requests.get(url,headers) mp4url=re.findall('srcUrl="(.*"',res.text,re.S)[0] video=requests.get(mp4url) m = hashlib.md5() m.update(url.encode('utf-8')) m.update(str(time.time()).encode('utf-8')) filename = r'%s.mp4' % m.hexdigest() print(filename) with open("/home/tony/文档/爬虫视频/%s.mp4"%filename,'wb') as f: f.write(video.content) def main(): video_urllist=geturls(mainurl) for i in video_urllist: getvideo(i) if __name__=='__main__': main()
神剑山庄资源网 Design By www.hcban.com
神剑山庄资源网
免责声明:本站文章均来自网站采集或用户投稿,网站不提供任何软件下载或自行开发的软件!
如有用户或公司发现本站内容信息存在侵权行为,请邮件告知! 858582#qq.com
神剑山庄资源网 Design By www.hcban.com
暂无python爬虫线程池案例详解(梨视频短视频爬取)的评论...
《魔兽世界》大逃杀!60人新游玩模式《强袭风暴》3月21日上线
暴雪近日发布了《魔兽世界》10.2.6 更新内容,新游玩模式《强袭风暴》即将于3月21 日在亚服上线,届时玩家将前往阿拉希高地展开一场 60 人大逃杀对战。
艾泽拉斯的冒险者已经征服了艾泽拉斯的大地及遥远的彼岸。他们在对抗世界上最致命的敌人时展现出过人的手腕,并且成功阻止终结宇宙等级的威胁。当他们在为即将于《魔兽世界》资料片《地心之战》中来袭的萨拉塔斯势力做战斗准备时,他们还需要在熟悉的阿拉希高地面对一个全新的敌人──那就是彼此。在《巨龙崛起》10.2.6 更新的《强袭风暴》中,玩家将会进入一个全新的海盗主题大逃杀式限时活动,其中包含极高的风险和史诗级的奖励。
《强袭风暴》不是普通的战场,作为一个独立于主游戏之外的活动,玩家可以用大逃杀的风格来体验《魔兽世界》,不分职业、不分装备(除了你在赛局中捡到的),光是技巧和战略的强弱之分就能决定出谁才是能坚持到最后的赢家。本次活动将会开放单人和双人模式,玩家在加入海盗主题的预赛大厅区域前,可以从强袭风暴角色画面新增好友。游玩游戏将可以累计名望轨迹,《巨龙崛起》和《魔兽世界:巫妖王之怒 经典版》的玩家都可以获得奖励。
更新日志
2024年11月17日
2024年11月17日
- 中国武警男声合唱团《辉煌之声1天路》[DTS-WAV分轨]
- 紫薇《旧曲新韵》[320K/MP3][175.29MB]
- 紫薇《旧曲新韵》[FLAC/分轨][550.18MB]
- 周深《反深代词》[先听版][320K/MP3][72.71MB]
- 李佳薇.2024-会发光的【黑籁音乐】【FLAC分轨】
- 后弦.2012-很有爱【天浩盛世】【WAV+CUE】
- 林俊吉.2012-将你惜命命【美华】【WAV+CUE】
- 晓雅《分享》DTS-WAV
- 黑鸭子2008-飞歌[首版][WAV+CUE]
- 黄乙玲1989-水泼落地难收回[日本天龙版][WAV+CUE]
- 周深《反深代词》[先听版][FLAC/分轨][310.97MB]
- 姜育恒1984《什么时候·串起又散落》台湾复刻版[WAV+CUE][1G]
- 那英《如今》引进版[WAV+CUE][1G]
- 蔡幸娟.1991-真的让我爱你吗【飞碟】【WAV+CUE】
- 群星.2024-好团圆电视剧原声带【TME】【FLAC分轨】