神剑山庄资源网 Design By www.hcban.com
本文实例讲述了Python实现的爬取网易动态评论操作。分享给大家供大家参考,具体如下:
打开网易的一条新闻的源代码后,发现并没有所要得评论内容。
经过学习后发现,源代码只是一个完整页面的“骨架”,而我所需要的内容是它的填充物,这时候需要打开工具里面的开发人员工具,从加载的“骨肉”里找到我所要的评论
圈住的是类型
找到之后打开网页,发现json类型的格式,用我已学过的正则,bs都不好闹,于是便去了解了正则,发现把json的格式换化成python的格式后,用列表提取内容是一条明朗的道路。。。
但是在细致分析的时候也发现了问题
从这里获得每条评论时,感觉有点不对,观察发现如果是回复评论的评论会出现他回复那条评论的数据,于是用正则提取了一下
最终的代码如下:
#coding=utf-8 __author__ = 'kongmengfan123' import urllib import re import json import time def gethothtml(url):#最热评论 page=urllib.urlopen(url) html=page.read() get_json(html) def gethnewtml():#最新评论有5页 for i in range(1,6): url = 'http://comment.news.163.com/api/v1/products/a2869674571f77b5a0867c3d71db5856/threads/C4QFIJNS0001875O/comments/newList"commentIds"]#获得每条评论的键 n=0 for i in range(1,len(lis)): try: xulie=re.compile('\d{10,}')#取得准确评论的键(去掉回复) bia=re.findall(xulie,lis[n]) w.write(ajson['comments'][bia[len(bia)-1]]['user']['nickname'].encode('utf-8')+'|') except KeyError: w.write(ajson['comments'][bia[len(bia)-1]]['user']['location'].encode('utf-8')+'|') if (len(lis[n])>13): xulie=re.compile('\d{10,}') bia=re.findall(xulie,lis[n]) w.write(ajson['comments'][bia[len(bia)-1]]['content'].encode('utf-8')+'\n') else: w.write(ajson['comments'][lis[n]]['content'].encode('utf-8')+'\n') n=n+1 return lis w=open('wangyi.txt','w') w.write('用户名'+'|'+'热门评论'+'\n') hot_=gethothtml('http://comment.news.163.com/api/v1/products/a2869674571f77b5a0867c3d71db5856/threads/C4QFIJNS0001875O/comments/hotList"_blank" href="https://www.jb51.net/Special/648.htm">Python Socket编程技巧总结》、《Python正则表达式用法总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》希望本文所述对大家Python程序设计有所帮助。
标签:
Python,爬取,网易动态评论
神剑山庄资源网 Design By www.hcban.com
神剑山庄资源网
免责声明:本站文章均来自网站采集或用户投稿,网站不提供任何软件下载或自行开发的软件!
如有用户或公司发现本站内容信息存在侵权行为,请邮件告知! 858582#qq.com
神剑山庄资源网 Design By www.hcban.com
暂无Python实现的爬取网易动态评论操作示例的评论...
更新日志
2024年10月02日
2024年10月02日
- 孙悦.1996-伙伴【正大国际】【WAV+CUE】
- 纪钧瀚《钢琴阅读时光 雨中书店聆听轻音乐》[FLAC/分轨][399.62MB]
- 证声音乐图书馆《走向自然 疗心爵士乐》[320K/MP3][87.4MB]
- 证声音乐图书馆《走向自然 疗心爵士乐》[FLAC/分轨][184.94MB]
- 陈慧娴.2018-Priscilla-Ism演唱会3CD(2024环球红馆40复刻系列)【环球】【WAV+CUE】
- 郑秀文.1999-我应该得到(国)【华纳】【WAV+CUE】
- 陈家慧.2011-钢琴酒吧2CD【龙吟唱片】【WAV+CUE】
- 证声音乐图书馆《雨季 蓝调吉他 Rainy Blues》[320K/MP3][45.01MB]
- 证声音乐图书馆《雨季 蓝调吉他 Rainy Blues》[FLAC/分轨][109.13MB]
- 赞多《序章》[320K/MP3][45.54MB]
- 许巍.2004-每一刻都是崭新的【步升大风】【WAV+CUE】
- 群星.2024-四方馆影视原声带【韶愔音乐】【FLAC分轨】
- 陈雷.1997-安锁咧【金圆唱片】【WAV+CUE】
- 关淑怡.2013-MY.FAVORITE.SK.3CD【环球】【WAV+CUE】
- Sweety.2006-花言乔语【丰华】【WAV+CUE】