神剑山庄资源网 Design By www.hcban.com
本文实例讲述了Python爬虫爬取、解析数据操作。分享给大家供大家参考,具体如下:
爬虫 当当网 http://search.dangdang.com/"htmlcode">
import requests import re import csv import pymysql from bs4 import BeautifulSoup from lxml import etree import lxml from lxml import html
类代码实现部分
class DDSpider(object): #对象属性 参数 关键字 页数 def __init__(self,key='python',page=1): self.url = 'http://search.dangdang.com/"]name[\'\"].*"]title[\'\"].*"](.*"].*"](.*"].*"]itemlist-title[\'\"].*"]detail[\'\"].*?>(.*"]search_now_price[\'\"].*?>(.*"]search_book_author[\'\"].*?><span>.*"]itemlist-author[\'\"].*"](.*"].*"search_nature_rg"]/ul/li') result = [] for i in range(len(li_all)): title = html.xpath('//div[@id="search_nature_rg"]/ul/li[{}]/p[@class="name"]/a/@title'.format(i+1)) url = html.xpath('//div[@id="search_nature_rg"]/ul/li[{}]/p[@class="name"]/a/@href'.format(i+1)) price = html.xpath('//div[@id="search_nature_rg"]/ul/li[{}]//span[@class="search_now_price"]/text()'.format(i+1)) author_num = html.xpath('//div[@id="search_nature_rg"]/ul/li[{}]/p[@class="search_book_author"]/span[1]/a'.format(i+1)) if len(author_num) != 0: #有作者 a标签 author = html.xpath('//div[@id="search_nature_rg"]/ul/li[{}]/p[@class="search_book_author"]/span[1]/a[1]/@title'.format(i+1)) else: #没有作者 a标签 author = html.xpath('//div[@id="search_nature_rg"]/ul/li[{}]/p[@class="search_book_author"]/span[1]/text()'.format(i+1)) desc = html.xpath('//div[@id="search_nature_rg"]/ul/li[{}]/p[@class="detail"]/text()'.format(i+1)) my_tuple = (" ".join(title)," ".join(url)," ".join(desc)," ".join(price)," ".join(author)) result.append(my_tuple) return result #私有对象方法 存储数据 1 txt 2 csv 3 mysql def __my_save(self,data,save_type=1): #循环遍历 for value in data: if save_type == 1: with open('ddw.txt','a+',encoding="utf-8") as f: f.write('【名称】:{}【作者】:{}【价格】:{}【简介】:{}【链接】:{}'.format(value[0],value[4],value[3],value[2],value[1])) elif save_type == 2: with open('ddw.csv','a+',newline='',encoding='utf-8-sig') as f: writer = csv.writer(f) #转化为列表 存储 writer.writerow(list(value)) else: conn = pymysql.connect(host='127.0.0.1',user='root',passwd='',db='',port=3306,charset='utf8') cursor = conn.cursor() sql = '' cursor.execute(sql) conn.commit() cursor.close() conn.close() #公有对象方法 执行所有爬虫操作 def my_run(self,parser_type=1,save_type=1): my_url = self.__my_url() for value in my_url: result = self.__my_request(value,parser_type) self.__my_save(result,save_type)
调用爬虫类实现数据获取
if __name__ == '__main__': #实例化创建对象 dd = DDSpider('python',0) #参数 解析方式 my_run(parser_type,save_type) # parser_type 1 利用正则 2 bs4 3 xpath #存储方式 save_type 1 txt 2 csv 3 mysql dd.my_run(2,1)
==总结一下: ==
1. 总体感觉正则表达式更简便一些 , 代码也会更简便 , 但是正则部分相对复杂和困难
2. bs4和xpath 需要对html代码有一定了解 , 取每条数据多个值时相对较繁琐
更多关于Python相关内容可查看本站专题:《Python Socket编程技巧总结》、《Python正则表达式用法总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》
希望本文所述对大家Python程序设计有所帮助。
神剑山庄资源网 Design By www.hcban.com
神剑山庄资源网
免责声明:本站文章均来自网站采集或用户投稿,网站不提供任何软件下载或自行开发的软件!
如有用户或公司发现本站内容信息存在侵权行为,请邮件告知! 858582#qq.com
神剑山庄资源网 Design By www.hcban.com
暂无Python爬虫爬取、解析数据操作示例的评论...
更新日志
2024年11月20日
2024年11月20日
- 罗大佑-无法盗版的青春套装版10CD【WAV】
- 张学友《意乱情迷》蜚声环球 2024 [WAV+CUE][1G]
- 柏菲《好歌30年特别版2CD》最好听的影视歌曲[低速原抓WAV+CUE][1G]
- 张学友《世纪10星·永恒篇》香港版[WAV+CUE][1G]
- 模拟之声慢刻CD《刘德海.琵琶独奏精逊【低速原抓WAV+CUE】
- Jamettone-18052023—improv(EDit)(2024)【FLAC】
- 【索尼精芽20首最棒的苏格兰歌曲集【FLAC】
- 池约翰C.J《少年白马醉春风2 动画原声带》[320K/MP3][26.67MB]
- 池约翰C.J《少年白马醉春风2 动画原声带》[FLAC/分轨][144.13MB]
- 陈致逸《幻想乐园 Fantasyland》[320K/MP3][120.54MB]
- 席卷全球最红舞曲《火辣辣DJ[英文版]》[DTS-WAV]
- 群星-席卷全球最红舞曲《火辣辣DJ中文版》【WAV】
- 模拟之声慢刻CD《声入人心[年度发烧人声严选]》[低速原抓WAV+CUE]
- 陈致逸《幻想乐园 Fantasyland》[FLAC/分轨][554.27MB]
- Rhymist / LusciousBB《年轮》[320K/MP3][76.52MB]