编写Python脚本来获取Google搜索结果的示例

脚本专栏 2024/10/3 佚名

2 0 1

神剑山庄资源网 Design By www.hcban.com

前一段时间一直在研究如何用python抓取搜索引擎结果，在实现的过程中遇到了很多的问题，我把我遇到的问题都记录下来，希望以后遇到同样问题的童鞋不要再走弯路。

1. 搜索引擎的选取

　　选择一个好的搜索引擎意味着你能够得到更准确的搜索结果。我用过的搜索引擎有四种：Google、Bing、Baidu、Yahoo!。作为程序员，我首选Google。但当我看见我最爱的Google返回给我的全是一堆的js代码，根本没我想要的搜索结果。于是我转而投向了Bing的阵营，在用过一段时间后我发现Bing返回的搜索结果对于我的问题来说不太理想。正当我要绝望时，Google拯救了我。原来Google为了照顾那些禁止浏览器使用js的用户，还有另外一种搜索方式，请看下面的搜索URL：

https://www.google.com.hk/search"htmlcode">

def search(self, queryStr):
   queryStr = urllib2.quote(queryStr)
   url = 'https://www.google.com.hk/search"htmlcode">

user_agents = ['Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20130406 Firefox/23.0',      'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:18.0) Gecko/20100101 Firefox/18.0',      'Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US) AppleWebKit/533+      (KHTML, like Gecko) Element Browser 5.0',      'IBM WebExplorer /v0.94', 'Galaxy/1.0 [en] (Mac OS X 10.5.6; U; en)',      'Mozilla/5.0 (compatible; MSIE 10.0; Windows NT 6.1; WOW64; Trident/6.0)',      'Opera/9.80 (Windows NT 6.0) Presto/2.12.388 Version/12.14',      'Mozilla/5.0 (iPad; CPU OS 6_0 like Mac OS X) AppleWebKit/536.26 (KHTML, like Gecko)      Version/6.0 Mobile/10A5355d Safari/8536.25',      'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko)      Chrome/28.0.1468.0 Safari/537.36',      'Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.0; Trident/5.0; TheWorld)']
 def search(self, queryStr):
   queryStr = urllib2.quote(queryStr)
   url = 'https://www.google.com.hk/search?hl=en&q=%s' % queryStr
   request = urllib2.Request(url)
   index = random.randint(0, 9)
   user_agent = user_agents[index]
   request.add_header('User-agent', user_agent)
   response = urllib2.urlopen(request)
   html = response.read()
   results = self.extractSearchResults(html)





　　不要被user_agents那个list吓到，那其实就是10个user agent 字符串，这么做是让我们伪装的更好一些，如果你需要更多的user agent 请看这里 UserAgentString。
17-19行表示随机选择一个user agent 字符串，然后用request 的add_header方法伪装一个user agent。
　　通过伪装user agent能够让我们持续抓取搜索引擎结果，如果这样还不行，那我建议在每两次查询间随机休眠一段时间，这样会影响抓取速度，但是能够让你更持续的抓取结果，如果你有多个IP，那抓取的速度也就上来了。
　　github上有本文所有源代码，需要的同学可从下面的网址下载:
https://github.com/meibenjin/GoogleSearchCrawler

Python

标签：

Python

神剑山庄资源网 Design By www.hcban.com

神剑山庄资源网 免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com

神剑山庄资源网 Design By www.hcban.com

评论“编写Python脚本来获取Google搜索结果的示例”

暂无编写Python脚本来获取Google搜索结果的示例的评论...

P70系列延期，华为新旗舰将在下月发布

3月20日消息，近期博主@数码闲聊站透露，原定三月份发布的华为新旗舰P70系列延期发布，预计4月份上市。

而博主@定焦数码爆料，华为的P70系列在定位上已经超过了Mate60，成为了重要的旗舰系列之一。它肩负着重返影像领域顶尖的使命。那么这次P70会带来哪些令人惊艳的创新呢？
根据目前爆料的消息来看，华为P70系列将推出三个版本，其中P70和P70 Pro采用了三角形的摄像头模组设计，而P70 Art则采用了与上一代P60 Art相似的不规则形状设计。这样的外观是否好看见仁见智，但辨识度绝对拉满。

更新日志

2024年10月03日

编写Python脚本来获取Google搜索结果的示例

Python

python实现将元祖转换成数组的方法

编写Python脚本来获取mp3文件tag信息的教程

评论“编写Python脚本来获取Google搜索结果的示例”

P70系列延期，华为新旗舰将在下月发布

更新日志

友情链接