Python爬虫——抓取贴吧帖子

按照这个学习教程，一步一步写出来，中间遇到很多的问题，一一列举

首先，获得标题和贴子总数

# -*- coding:utf-8 -*-

#!/user/bin/python

import urllib

import urllib2

import re

class BDTB:

    #初始化，传入基地址，是否只看楼主的参数

    def __init__(self, baseUrl, seeLZ):

        self.baseURL = baseUrl

        self.seeLZ = '?see_lz=' + str(seeLZ)

    #传入页码，获取该页帖子的代码

    def getPage(self, pageNum):

        try:

            url = self.baseURL + self.seeLZ + '&pn=' + str(pageNum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            return response.read()

        except urllib2.URLError, e:

            if hasattr(e, "reason"):

                print u"连接百度贴吧失败,错误原因", e.reason

                return None

    def getTitle(self):

        page = self.getPage(1)

        pattern = re.compile('<h3 class="core_title_txt.*?>(.*?)</h3>', re.S)

        result = re.search(pattern, page)

        if result:

            print result.group(1)

            return result.group(1).strip()

        else:

            return None

    #得到帖子页数

    def getPageNum(self):

        page = self.getPage(1)

        pattern = re.compile('<li class="l_reply_num.*?<span.*?>(.*?)</span',re.S)

        result = re.search(pattern, page)

        if result:

            print "回复个数："

            print result.group(1)

            return result.group(1).strip()

        else:

            return None

baseURL = 'http://tieba.baidu.com/p/3138733512'

bdtb = BDTB(baseURL, 1)

bdtb.getTitle()

bdtb.getPageNum()

PS：我用的火狐浏览器，查看网页源代码，鼠标右击查看获得快捷键 Ctrl-U

接下来抓取楼层的内容，写好的程序如下

import urllib

import urllib2

import re

class BDTB:

    #初始化，传入基地址，是否只看楼主的参数

    def __init__(self, baseUrl, seeLZ):

        self.baseURL = baseUrl

        self.seeLZ = '?see_lz=' + str(seeLZ)

    #传入页码，获取该页帖子的代码

    def getPage(self, pageNum):

        try:

            url = self.baseURL + self.seeLZ + '&pn=' + str(pageNum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            return response.read()

        except urllib2.URLError, e:

            if hasattr(e, "reason"):

                print u"连接百度贴吧失败,错误原因", e.reason

                return None

    def getTitle(self):

        page = self.getPage(1)

        pattern = re.compile('<h3 class="core_title_txt.*?>(.*?)</h3>', re.S)

        result = re.search(pattern, page)

        if result:

            print result.group(1)

            return result.group(1).strip()

        else:

            return None

    #得到帖子页数

    def getPageNum(self):

        page = self.getPage(1)

        pattern = re.compile('<li class="l_reply_num.*?<span.*?>(.*?)</span',re.S)

        result = re.search(pattern, page)

        if result:

            print "回复个数："

            print result.group(1)

            return result.group(1).strip()

        else:

            return None

    def getContent(self,page):

        pattern = re.compile('<div id="post_content_.*? class="d_post_content j_d_post_content ">(.*?)</div>',re.S)

        items = re.findall(pattern,page)

        for item in items:

            print item

baseURL = 'http://tieba.baidu.com/p/3138733512'

bdtb = BDTB(baseURL, 1)

bdtb.getTitle()

bdtb.getPageNum()

bdtb.getContent(1)

但是运行之后一直报错，如下图：

检查代码无数次后，终于.....发现 getContent中没有获取页码 T_T 在这个函数首句加上

page = self.getPage(1)

即可！！！

终于得到了内容部分，用一下工具类可将乱七八糟的图片什么的代码去掉

#处理页面标签类

class Tool:

    #去除img标签,7位长空格

    removeImg = re.compile('<img.*?>| {7}|')

    #删除超链接标签

    removeAddr = re.compile('<a.*?>|</a>')

    #把换行的标签换为\n

    replaceLine = re.compile('<tr>|<div>|</div>|</p>')

    #将表格制表<td>替换为\t

    replaceTD= re.compile('<td>')

    #把段落开头换为\n加空两格

    replacePara = re.compile('<p.*?>')

    #将换行符或双换行符替换为\n

    replaceBR = re.compile('<br><br>|<br>')

    #将其余标签剔除

    removeExtraTag = re.compile('<.*?>')

    def replace(self,x):

        x = re.sub(self.removeImg,"",x)

        x = re.sub(self.removeAddr,"",x)

        x = re.sub(self.replaceLine,"\n",x)

        x = re.sub(self.replaceTD,"\t",x)

        x = re.sub(self.replacePara,"\n    ",x)

        x = re.sub(self.replaceBR,"\n",x)

        x = re.sub(self.removeExtraTag,"",x)

        #strip()将前后多余内容删除

        return x.strip()

最后最后，就是这样的了..

# -*- coding:utf-8 -*-

#!/user/bin/python

import urllib

import urllib2

import re

#处理页面标签类

class Tool:

    #去除img标签,7位长空格

    removeImg = re.compile('<img.*?>| {7}|')

    #删除超链接标签

    removeAddr = re.compile('<a.*?>|</a>')

    #把换行的标签换为\n

    replaceLine = re.compile('<tr>|<div>|</div>|</p>')

    #将表格制表<td>替换为\t

    replaceTD= re.compile('<td>')

    #把段落开头换为\n加空两格

    replacePara = re.compile('<p.*?>')

    #将换行符或双换行符替换为\n

    replaceBR = re.compile('<br><br>|<br>')

    #将其余标签剔除

    removeExtraTag = re.compile('<.*?>')

    def replace(self,x):

        x = re.sub(self.removeImg,"",x)

        x = re.sub(self.removeAddr,"",x)

        x = re.sub(self.replaceLine,"\n",x)

        x = re.sub(self.replaceTD,"\t",x)

        x = re.sub(self.replacePara,"\n    ",x)

        x = re.sub(self.replaceBR,"\n",x)

        x = re.sub(self.removeExtraTag,"",x)

        #strip()将前后多余内容删除

        return x.strip()

class BDTB:

    #初始化，传入基地址，是否只看楼主的参数

    def __init__(self, baseUrl, seeLZ, floorTag):

        self.baseURL = baseUrl

        self.seeLZ = '?see_lz=' + str(seeLZ)

        self.tool = Tool()

        #全局file变量，文件写入操作对象

        self.file = None

        #楼层标号， 初始化为1

        self.floor = 1

        #默认标题

        self.defaultTitle = u"百度某某贴吧"

        #是否写入楼层分隔符标记

        self.floorTag = floorTag

    #传入页码，获取该页帖子的代码

    def getPage(self, pageNum):

        try:

            url = self.baseURL + self.seeLZ + '&pn=' + str(pageNum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            return response.read().decode('utf-8')

        except urllib2.URLError, e:

            if hasattr(e, "reason"):

                print u"连接百度贴吧失败,错误原因", e.reason

                return None

    #获得帖子标题

    def getTitle(self,page):

        page = self.getPage(1)

        pattern = re.compile('<h3 class="core_title_txt.*?>(.*?)</h3>', re.S)

        result = re.search(pattern, page)

        if result:

            #print result.group(1)

            return result.group(1).strip()

        else:

            return None

    #得到帖子页数

    def getPageNum(self,page):

        page = self.getPage(1)

        pattern = re.compile('<li class="l_reply_num.*?<span.*?>(.*?)</span',re.S)

        result = re.search(pattern, page)

        if result:

            #print "回复个数："

            #print result.group(1)

            return result.group(1).strip()

        else:

            return None

    #获得帖子的内容

    def getContent(self,page):

        page = self.getPage(1)

        pattern = re.compile('<div id="post_content_.*?>(.*?)</div>',re.S)

        items = re.findall(pattern,page)

        contents = []

        floor = 1

        for item in items:

            content = "\n" + self.tool.replace(item) + "\n"

            contents.append(content.encode('utf-8'))

            #print self.tool.replace(item)

            #floor += 1

        return contents

    def setFileTitle(self,title):

        if title is not None:

            self.file = open(title + ".txt", "w+")

        else:

            self.file = open(self.defaultTitle + ".txt", "w+")

    def writeData(self,contents):

        for item in contents:

            if self.floorTag == '':

                floorline = "\n" + str(self.floor) + u"-------------------------------------\n"

                self.file.write(floorline)

            self.file.write(item)

            self.floor += 1

    def start(self):

        indexPage = self.getPage(1)

        pageNum = self.getPageNum(indexPage)

        title = self.getTitle(indexPage)

        self.setFileTitle(title)

        if pageNum == None:

            print "URL已失效，请重试"

            return

        try:

            print "该帖子共有" + str(pageNum) + "页"

            for i in range(1,int(pageNum) + 1):

                print "正在写入第" + str(i) + "页数据"

                page = self.getPage(i)

                contents = self.getContent(page)

                self.writeData(contents)

        except IOError,e:

            print "写入异常，原因" + e.message

        finally:

            print "Succeed~"

print u"请输入帖子代码"

baseURL = 'http://tieba.baidu.com/p/' + str(raw_input(u'http://tieba.baidu.com/p/'))

seeLZ = raw_input("是否只看楼主，是输入1，否输入0\\n")

floorTag = raw_input("是否写入楼层信息，是输入1，否输入0\\n")

bdtb = BDTB(baseURL, seeLZ,floorTag)

bdtb.start()

关于decode和encode知识，查看 这个
关于raw_input, 查看 这个

Python爬虫——抓取贴吧帖子的更多相关文章

python 爬虫抓取心得
quanwei9958 转自 python 爬虫抓取心得分享 urllib.quote('要编码的字符串') 如果你要在url请求里面放入中文,对相应的中文进行编码的话,可以用: urllib.quo ...
Python爬虫----抓取豆瓣电影Top250
有了上次利用python爬虫抓取糗事百科的经验,这次自己动手写了个爬虫抓取豆瓣电影Top250的简要信息. 1.观察url 首先观察一下网址的结构 http://movie.douban.com/to ...
Python爬虫抓取东方财富网股票数据并实现MySQL数据库存储
Python爬虫可以说是好玩又好用了.现想利用Python爬取网页股票数据保存到本地csv数据文件中,同时想把股票数据保存到MySQL数据库中.需求有了,剩下的就是实现了. 在开始之前,保证已经安装好 ...
python爬虫抓取哈尔滨天气信息（静态爬虫）
python 爬虫爬取哈尔滨天气信息 - http://www.weather.com.cn/weather/101050101.shtml 环境: windows7 python3.4(pip i ...
Python爬虫 -- 抓取电影天堂8分以上电影
看了几天的python语法,还是应该写个东西练练手.刚好假期里面看电影,找不到很好的影片,于是有个想法,何不搞个爬虫把电影天堂里面8分以上的电影爬出来.做完花了两三个小时,撸了这么一个程序.反正蛮简单 ...
Python 爬虫: 抓取花瓣网图片
接触Python也好长时间了,一直没什么机会使用,没有机会那就自己创造机会!呐,就先从爬虫开始吧,抓点美女图片下来. 废话不多说了,讲讲我是怎么做的. 1. 分析网站想要下载图片,只要知道图片的地址 ...
python爬虫抓取一个网站的所有网址链接
sklearn实战-乳腺癌细胞数据挖掘 https://study.163.com/course/introduction.htm?courseId=1005269003&utm_campai ...
Python爬虫抓取某音乐网站MP3（下载歌曲、存入Sqlite）
最近右胳膊受伤,打了石膏在家休息.为了实现之前的想法,就用左手打字.写代码,查资料完成了这个资源小爬虫.网页爬虫, 最主要的是协议分析(必须要弄清楚自己的目的),另外就是要考虑对爬取的数据归类,存储. ...
Python爬虫--抓取糗事百科段子
今天使用python爬虫实现了自动抓取糗事百科的段子,因为糗事百科不需要登录,抓取比较简单.程序每按一次回车输出一条段子,代码参考了 http://cuiqingcai.com/990.html 但该 ...

随机推荐

(转)函数中使用 ajax 异步同步返回值错误主函数显示返回值总是undefined -- ajax使用总结
aaarticlea/png;base64,iVBORw0KGgoAAAANSUhEUgAAAloAAAE0CAIAAAB7LwoKAAAgAElEQVR4nO2dy6sc152A6+/R2mXwSn ...
转载：mysql-Auto_increment值修改
转载网址:http://libo93122.blog.163.com/blog/static/1221893820125282158745/ | 2012-03-13 11:19:10 | 2012- ...
smarty 基本介绍及示例
什么是smarty? Smarty是一个使用PHP写出来的模板引擎,是业界最著名的PHP模板引擎之一.Smarty分离了逻辑代码和外在的内容,提供一种易于管理和使用的方法,用来将原本与HTML代码混杂 ...
rsync相关整理
第一部分 rsync服务端配置 1.下载安装 a. yum安装. yum install rsync b. 下载rsync安装文件安装 #tar zxvf rsync-2.6.9 ...
iOS学习之自定义UItableViewCell
在项目开发中,大部分情况下我们都需要自定义UITableViewCell, 今天就重点整理一下目前自己已经学过的自定义Cell的一些注意事项; 分步骤来写吧: 1.将自定义的Cell定义为属性; 2. ...
[linux服务器][bash]让切换目录更方便
本文转载:[linux服务器][bash]让切换目录更方便: 一,为何要使用这几个命令? 可能大家会有疑问,为何要使用这几个命令, 难道用cd不就可以切换目录了吗? 没错,使用cd就可以切 ...
vim 折叠代码技巧汇总
以下命令输入的方式: 如zo命令,先按z键,松开后按o键即可展开折叠. 一.打开.关闭折叠 zo 展开折叠,只展开最外层的折叠. zO 对所在范围内所有嵌套的折叠点展开,包括嵌套折叠. zc 折叠,只 ...
Qt for Windows - Deployment和它的参数
http://doc.qt.io/qt-5/windows-deployment.html
使用ngrok让微信公众平台通过80端口访问本机
最近在做微信开发,感觉测试不怎么方便,在网上找了找一下帖子,发现了这个好工具哈,与大家一同分享一下... 原文:http://blog.csdn.net/liuxiyangyang/article/d ...
PHP 面向对象中常见关键字使用（final、static、const和instanceof）
PHP 面向对象中常见关键字的使用: 1.final :final关键字可以加在类或者类中方法之前,但是不能使用final标识成员属性. 作用: 使用final标识的类,不能被继承. 在类中使用fin ...

Python爬虫——抓取贴吧帖子

Python爬虫——抓取贴吧帖子的更多相关文章

随机推荐

热门专题