python抓取百度百科点赞数等动态数据

利用selenium 模拟浏览器打开页面，加载后抓取数据

#!/usr/bin/env python

# coding=utf-8

import urllib2

import re

from bs4 import BeautifulSoup

from selenium import webdriver

import time 

import sys

reload(sys)

sys.setdefaultencoding('utf-8')

class BaikeSpider():

    def __init__(self):

        self.queue = ["http://baike.baidu.com/view/8095.htm",

                      "http://baike.baidu.com/view/2227.htm"]

        self.base = "http://baike.baidu.com"

        self.crawled = set()

        self.crawled_word = set()

#        client = MongoClient("localhost",27017)

#        self.db = client["baike_db"]["html"]

    def crawl(self):

        browser = webdriver.Chrome()

        cnt = 0

        fw = open('./baike_keywords.txt','wb')

        while self.queue:

            url = self.queue.pop(0)

            if url in self.crawled :

                continue

            self.crawled.add(url)

            try:

                browser.get(url)

                res = {}

                links = BeautifulSoup(urllib2.urlopen(url).read(),'lxml').find_all("a")

                links = list(set(links))

                for link in links:

                    if 'href' not in dict(link.attrs) or re.search(u"javascript",link['href']) or len(link['href'])<8:

                        continue

                    url = link['href']

                    if re.search(u"baike\.baidu\.com/view/\d+|baike\.baidu\.com/subview/\d+/\d+.htm",url) and url not in self.crawled:

                        self.queue.append(url)

                    elif re.match(u"view/\d+",url):

                        url = self.base+ url

                        if url not in self.crawled:

                            self.queue.append(url)

                cnt += 1

                print cnt

                if cnt % 10 == 0:

                    print 'queue',len(self.queue)

                    fw.close()

                    fw = open('./baike_keywords.txt','a+')

                res['url'] = url

                res['title'] = browser.title.split(u"_")[0]

                if res['title'] in self.crawled_word:

                    print 'title',res['title'],'has crawled'

                    continue

                vote = browser.find_element_by_class_name("vote-count")

                view = browser.find_element_by_id("j-lemmaStatistics-pv")

                res['voted'] = vote.text

                res['viewed'] = view.text

                line = []

                line.append(res['title'])

                line.append(res['viewed'])

                line.append(res['voted'])

                line.append(res['url'])

                line = '\t'.join(line)

                fw.write(line+'\n')

                self.crawled_word.add(res["title"])

            except Exception,e:

                print e

                continue

if __name__=='__main__':

    test = BaikeSpider()

    test.crawl()

另外，使用chrome加载会比firefox快，且少报错，异常退出！

python抓取百度百科点赞数等动态数据的更多相关文章

Python抓取百度百科数据
前言本文整理自慕课网<Python开发简单爬虫>,将会记录爬取百度百科"python"词条相关页面的整个过程. 抓取策略确定目标:确定抓取哪个网站的哪些页面的哪部分 ...
python3 - 通过BeautifulSoup 4抓取百度百科人物相关链接
导入需要的模块需要安装BeautifulSoup from urllib.request import urlopen, HTTPError, URLError from bs4 import Be ...
Python爬虫之小试牛刀——使用Python抓取百度街景图像
之前用.Net做过一些自动化爬虫程序,听大牛们说使用python来写爬虫更便捷,按捺不住抽空试了一把,使用Python抓取百度街景影像. 这两天,武汉迎来了一个德国总理默克尔这位大人物,又刷了一把武汉 ...
Python——爬取百度百科关键词1000个相关网页
Python简单爬虫——爬取百度百科关键词1000个相关网页——标题和简介网站爬虫由浅入深:慢慢来分析: 链接的URL分析: 数据格式: 爬虫基本架构模型: 本爬虫架构: 源代码: # codin ...
python抓取360百科踩过的坑！
学习python一周,学着写了一个爬虫,用来抓取360百科的词条,在这个过程中.因为一个小小的修改,程序出现一些问题,又花了几天时间研究,问了各路高手,都没解决,终于还是自己攻克了,事实上就是对lis ...
爬虫实战(一) 用Python爬取百度百科
最近博主遇到这样一个需求:当用户输入一个词语时,返回这个词语的解释我的第一个想法是做一个数据库,把常用的词语和词语的解释放到数据库里面,当用户查询时直接读取数据库结果但是自己又没有心思做这样一个数 ...
使用python抓取百度搜索、百度新闻搜索的关键词个数
由于实验的要求,需要统计一系列的字符串通过百度搜索得到的关键词个数,于是使用python写了一个相关的脚本. 在写这个脚本的过程中遇到了很多的问题,下面会一一道来. ps:我并没有系统地学习过pyth ...
C#运用实例.读取csv里面的词条，对每一个词条抓取百度百科相关资料，然后存取到数据库
第一步:首先需要将csv先装换成datatable,这样我们就容易进行对datatable进行遍历: /// 将CSV文件的数据读取到DataTable中 /// CSV文件路径 /// 返回读取了C ...
Python抓取百度汉字笔画的gif
偶然发现百度汉语里面,有一笔一划的汉字顺序: 觉得这个动态的图片,等以后娃长大了,可以用这个教写字.然后就去找找常用汉字,现代汉语常用字表 .拿到这里面的汉字,做两个数组出来,一共是 ...

随机推荐

UserDefault的使用，保存小数据到本地－iOS
//保持到本地数据 NSArray *array=@[@"234",@"sdfe"]; NSUserDefaults *userDefault=[NSUserD ...
C#基础：Lambda表达式
从委托的角度来看,Lambda表达式与匿名方法没有区别.在[C#基础:匿名方法]一文中,我使用了匿名方法来调用List<T>的FindAll方法.从C# 3.0开始,在使用匿名方法的地方, ...
Python面向对象编程——引言
1.类和实例:类是对象的定义,而实例是真正的事物.他存放了类中所定义的对象的具体信息关键字是class,后面紧跟着一个类名,随后是定义类的雷替代码.通常有各种各样的定义和声明组成. class ...
datagrid combobox事件更新编辑状态下的datagrid行
请问如何从上图状态点击下拉的combobox中值然后在不取消datagrid编辑状态下更新这一行另一列的数据,达到下图这样的效果: 非常感谢! 给你的combobox 绑定一个onSelect 事 ...
css之cursor,float
鼠标形状: 在html中可以任意定义各个标签的显示形状,也可以此用来做些标签显示假像. <body> <p style="cursor: pointer"> ...
【Android代码片段之八】监听Android屏幕是否锁屏
实现方法:1)通过BroadcastReceiver接收广播Intent.ACTION_SCREEN_ON和Intent.ACTION_SCREEN_OFF可以判断屏幕状态是否锁屏,但是只有屏幕状态发 ...
Android视录视频示例
这几天需要搞一个Android视频通话功能,从最简单的视频录制开始,网上例子大多不完整.下面的示例参考过别人的代码,还是拿出来给需要的朋友分享下. Activity类:VideoActivity pa ...
class的使用
class test(object): """ get被称之为test对象的方法 """ def __init__(self,var1): ...
ASP.NET SignalR 与 LayIM2.0 配合轻松实现Web聊天室实战系列。开源啦！！！
自此系列博客开写以来,好多同学关心开源问题,之前由于网络问题,发布到Github上老是失败,今天终于在精简了好多无用的文件之后发布上去了. 注意:layim源代码并不开源,由于版权问题,请大家去官网了 ...
maven学习笔记（定制一个Web项目）
创建web项目: mvn archetype:generate -DgroupId=cn.net.comsys.ut4.simpleweb -DartifactId=simple-web -Dpack ...

python抓取百度百科点赞数等动态数据

python抓取百度百科点赞数等动态数据的更多相关文章

随机推荐

热门专题