Python爬虫爬取贴吧的帖子内容

最近在看一个大神的博客，从他那里学会了很多关于python爬虫的知识，其实python如果想用在实际应用中，你需要了解许多，比如正则表达式、引入库、过滤字段等等，下面不多说，我下面的程序是爬取Ubuntu吧的一个帖子，要是问我为什么选择Ubuntu吧，没为什么，win、mac、linux我都用，但毫无疑问，我最喜欢的系统就是ubuntu linux，这个系统让我学会了很多东西，从基本命令到shell编程等等，这个系统让我深入了解了操作系统，也让我对操作系统的概念有了进一步的学习和了解，ok，下面就是我的代码，作为参考：

#coding=utf-8

# __author__ = 'Abel'

import urllib

import urllib2

import re

#处理页面标签类

class Tool:

    #去除img标签,7位长空格

    removeImg = re.compile('<img.*?>| {7}|')

    #删除超链接标签

    removeAddr = re.compile('<a.*?>|</a>')

    #把换行的标签换为\n

    replaceLine = re.compile('<tr>|<div>|</div>|</p>')

    #将表格制表<td>替换为\t

    replaceTD= re.compile('<td>')

    #把段落开头换为\n加空两格

    replacePara = re.compile('<p.*?>')

    #将换行符或双换行符替换为\n

    replaceBR = re.compile('<br><br>|<br>')

    #将其余标签剔除

    removeExtraTag = re.compile('<.*?>')

    def replace(self,x):

        x = re.sub(self.removeImg,"",x)

        x = re.sub(self.removeAddr,"",x)

        x = re.sub(self.replaceLine,"\n",x)

        x = re.sub(self.replaceTD,"\t",x)

        x = re.sub(self.replacePara,"\n    ",x)

        x = re.sub(self.replaceBR,"\n",x)

        x = re.sub(self.removeExtraTag,"",x)

        #strip()将前后多余内容删除

        return x.strip()

#百度贴吧爬虫类

class BDTB:

    #初始化，传入基地址，是否只看楼主的参数

    def __init__(self,baseUrl,seeLZ,floorTag):

        #base链接地址

        self.baseURL = baseUrl

        #是否只看楼主

        self.seeLZ = '?see_lz='+str(seeLZ)

        #HTML标签剔除工具类对象

        self.tool = Tool()

        #全局file变量，文件写入操作对象

        self.file = None

        #楼层标号，初始为1

        self.floor = 1

        #默认的标题，如果没有成功获取到标题的话则会用这个标题

        self.defaultTitle = u"百度贴吧"

        #是否写入楼分隔符的标记

        self.floorTag = floorTag

    #传入页码，获取该页帖子的代码

    def getPage(self,pageNum):

        try:

            #构建URL

            url = self.baseURL+ self.seeLZ + '&pn=' + str(pageNum)

            request = urllib2.Request(url)

            response = urllib2.urlopen(request)

            #返回UTF-8格式编码内容

            return response.read().decode('utf-8')

        #无法连接，报错

        except urllib2.URLError, e:

            if hasattr(e,"reason"):

                print u"连接百度贴吧失败,错误原因",e.reason

                return None

    #获取帖子标题

    def getTitle(self,page):

        #得到标题的正则表达式

        pattern = re.compile('<h1 class="core_title_txt.*?>(.*?)</h1>',re.S)

        result = re.search(pattern,page)

        if result:

            #如果存在，则返回标题

            return result.group(1).strip()

        else:

            return None

    #获取帖子一共有多少页

    def getPageNum(self,page):

        #获取帖子页数的正则表达式

        pattern = re.compile('<li class="l_reply_num.*?</span>.*?<span.*?>(.*?)</span>',re.S)

        result = re.search(pattern,page)

        if result:

            return result.group(1).strip()

        else:

            return None

    #获取每一层楼的内容,传入页面内容

    def getContent(self,page):

        #匹配所有楼层的内容

        pattern = re.compile('<div id="post_content_.*?>(.*?)</div>',re.S)

        items = re.findall(pattern,page)

        contents = []

        for item in items:

            #将文本进行去除标签处理，同时在前后加入换行符

            content = "\n"+self.tool.replace(item)+"\n"

            contents.append(content.encode('utf-8'))

        return contents

    def setFileTitle(self,title):

        #如果标题不是为None，即成功获取到标题

        if title is not None:

            self.file = open(title + ".txt","w+")

        else:

            self.file = open(self.defaultTitle + ".txt","w+")

    def writeData(self,contents):

        #向文件写入每一楼的信息

        for item in contents:

            if self.floorTag == '':

                #楼之间的分隔符

                floorLine = "\n" + str(self.floor) + u"-----------------------------------------------------------------------------------------\n"

                self.file.write(floorLine)

            self.file.write(item)

            self.floor += 1

    def start(self):

        indexPage = self.getPage(1)

        pageNum = self.getPageNum(indexPage)

        title = self.getTitle(indexPage)

        self.setFileTitle(title)

        if pageNum == None:

            print "URL已失效，请重试"

            return

        try:

            print "该帖子共有" + str(pageNum) + "页"

            for i in range(1,int(pageNum)+1):

                print "正在写入第" + str(i) + "页数据"

                page = self.getPage(i)

                contents = self.getContent(page)

                self.writeData(contents)

        #出现写入异常

        except IOError,e:

            print "写入异常，原因" + e.message

        finally:

            print "写入任务完成"

print u"请输入帖子代号"

baseURL = 'http://tieba.baidu.com/p/3560761301' + str(raw_input(u'http://tieba.baidu.com/p/3560761301'))

seeLZ = raw_input("是否只获取楼主发言，是输入1，否输入0\n")

floorTag = raw_input("是否写入楼层信息，是输入1，否输入0\n")

bdtb = BDTB(baseURL,seeLZ,floorTag)

bdtb.start()

程序运行结果：

然后打开工程文件里生成的ubuntu.txt文件，爬取的内容如下:

是不是很神奇，反正我是感觉很神奇:-)

Python爬虫爬取贴吧的帖子内容的更多相关文章

Python爬虫-爬取百度贴吧帖子
这次主要学习了替换各种标签,规范格式的方法.依然参考博主崔庆才的博客. 1.获取url 某一帖子:https://tieba.baidu.com/p/3138733512?see_lz=1&p ...
Python爬虫爬取糗事百科段子内容
参照网上的教程再做修改,抓取糗事百科段子(去除图片),详情见下面源码: #coding=utf-8#!/usr/bin/pythonimport urllibimport urllib2import ...
Python爬虫爬取搜狗搜索到的内容页面
废话不多说,直接上代码 import requests def main(): url='https://www.sogou.com/web' headers={ 'User_Agent':'Mozi ...
Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
用Python爬虫爬取广州大学教务系统的成绩（内网访问）
用Python爬虫爬取广州大学教务系统的成绩(内网访问) 在进行爬取前,首先要了解: 1.什么是CSS选择器? 每一条css样式定义由两部分组成,形式如下: [code] 选择器{样式} [/code ...
使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...
Python爬虫|爬取喜马拉雅音频
"GOOD Python爬虫|爬取喜马拉雅音频喜马拉雅是知名的专业的音频分享平台,用户规模突破4.8亿,汇集了有声小说,有声读物,儿童睡前故事,相声小品等数亿条音频,成为国内发展最快.规模 ...
python爬虫爬取内容中，-xa0，-u3000的含义
python爬虫爬取内容中,-xa0,-u3000的含义 - CSDN博客 https://blog.csdn.net/aiwuzhi12/article/details/54866310
Python爬虫爬取全书网小说，程序源码+程序详细分析
Python爬虫爬取全书网小说教程第一步:打开谷歌浏览器,搜索全书网,然后再点击你想下载的小说,进入图一页面后点击F12选择Network,如果没有内容按F5刷新一下点击Network之后出现如下 ...

随机推荐

【java基础】基础小总结
学习java,将自己的心得或总结写下来吧. Java 标识符标识符由字母,下划线(_),美元符($)和数字组成. 标识符不能以数字开头. 标识符不能使java关键字. 标识符对大小写敏感. Java ...
IDEA项目搭建二——使用SpringBoot创建Web层
一.编写底层代码 1.demo-common中创建FormatString类先在默认com.tyh中创建package命名为common 删除自动生成的app.java,在common包下创建新类 ...
Python学习笔记之—— File(文件) 对象常用函数
file 对象使用 open 函数来创建,下表列出了 file 对象常用的函数: 1.file.close() close() 方法用于关闭一个已打开的文件.关闭后的文件不能再进行读写操作, 否则会触 ...
分享几款常用的MySQL管理工具
MySQL数据库以体积小.速度快.总体拥有成本低等优点,深受广大中小企业的喜爱,像我们常见的MySQL管理工具都有那些呢?下面给大家推荐六个常用的MySQL管理工具! phpMyAdmin ...
Oracle EBS 创建 RMA
DECLARE l_api_version_number NUMBER := 1; l_return_status VARCHAR2(2000); l_msg_count NUMBER; l_msg_ ...
8086CPU的出栈(pop)和入栈(push) 都是以字为单位进行的
8086CPU的出栈(pop)和入栈(push) 都是以字为单位进行的
Angular 服务的简单使用
<!DOCTYPE html> <html lang="en"> <head> <meta charset="UTF-8&quo ...
[转]Redis学习---Redis高可用技术解决方案总结
[原文]https://www.toutiao.com/i6591646189714670093/ 本文主要针对Redis常见的几种使用方式及其优缺点展开分析. 一.常见使用方式 Redis的几种常见 ...
MySQL基础之外键参照讲解
外键: 定义:如果表A的主关键字是表B中的字段,则该字段称为表B的外键,表A称为主表,表B称为从表. 作用:外键是用来实现参照完整性的,不同的外键约束方式将可以是两张表紧密的结合起来.比如修改或者删除 ...
You are not late! You are not early!
Do you think you are going No Where in Life? STOP! Take a deep breathe THINK! New York is three hour ...

Python爬虫爬取贴吧的帖子内容

Python爬虫爬取贴吧的帖子内容的更多相关文章

随机推荐

热门专题