Python 爬虫实例（4）—— 爬取网易新闻

自己闲来无聊，就爬取了网易信息，重点是分析网页，使用抓包工具详细的分析网页的每个链接，数据存储在sqllite中，这里只是简单的解析了新闻页面的文字信息，并未对图片信息进行解析

仅供参考，不足之处请指正

# coding:utf-8

import random, re

import sqlite3

import json

from bs4 import BeautifulSoup

import sys

reload(sys)

sys.setdefaultencoding('utf-8')

import uuid

import requests

session = requests.session()

def md5(str):

    import hashlib

    m = hashlib.md5()

    m.update(str)

    return m.hexdigest()

def wangyi():

    for i in range(1,3):

        if i ==1:

            k = ""

        else:

            k = "_0" + str(i)

        url = "http://temp.163.com/special/00804KVA/cm_yaowen"  + k + ".js?callback=data_callback"

        print url

        headers = {

            "Host":"temp.163.com",

            "Connection":"keep-alive",

            "Accept":"*/*",

            "User-Agent":"Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/49.0.2623.75 Safari/537.36 LBBROWSER",

            "Referer":"http://news.163.com/",

            "Accept-Encoding":"gzip, deflate, sdch",

            "Accept-Language":"zh-CN,zh;q=0.8",

        }

        result = session.get(url=url,headers=headers).text

        try:

            result1 = eval(eval((json.dumps(result)).replace('data_callback(','').replace(')','').replace(' ','')))

        except:

            pass

        try:

            for i in result1:

                tlink = i['tlink']

                headers2 = {

                        "Host":"news.163.com",

                        "Connection":"keep-alive",

                        "Accept":"text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8",

                        "Upgrade-Insecure-Requests":"",

                        "User-Agent":"Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/49.0.2623.75 Safari/537.36 LBBROWSER",

                        "Accept-Encoding":"gzip, deflate, sdch",

                        "Accept-Language":"zh-CN,zh;q=0.8",

                }

                print "tlinktlinktlinktlink",tlink

                return_data = session.get(url=tlink,headers=headers2).text

                try:

                    soup = BeautifulSoup(return_data, 'html.parser')

                    returnSoup = soup.find_all("div", attrs={"id": "endText"})[0]

                    print returnSoup

                    print "==============================="

                    try:

                        returnList = re.findall('<p>(.*?)</p>',str(returnSoup))

                        content1 = '<-->'.join(returnList)

                    except:

                        content1 =""

                    try:

                        returnList1 = re.findall('<p class="f_center">(.*?)</p>',str(returnSoup))

                        content2 = '<-->'.join(returnList1)

                    except:

                        content2 =""

                    content = content1 +content2

                except:

                    content = ""

                cx = sqlite3.connect("C:\\Users\\xuchunlin\\PycharmProjects\\study\\db.sqlite3", check_same_thread=False)

                cx.text_factory = str

                try:

                    print "正在插入链接   %s   数据" % (url)

                    tlink = i['tlink']

                    title = (i['title']).decode('unicode_escape')

                    commenturl = i['commenturl']

                    tienum = i['tienum']

                    opentime = i['time']

                    print title

                    print tlink

                    print commenturl

                    print tienum

                    print opentime

                    print content

                    url2 = md5(str(tlink))

                    cx.execute("INSERT INTO wangyi (title,tlink,commenturl,tienum,opentime,content,url)VALUES (?,?,?,?,?,?,?)",(str(title), str(tlink), str(commenturl), str(tienum), str(opentime), str(content), str(url2)))

                except Exception as e:

                    print e

                    print "cha ru shi bai "

                cx.commit()

                cx.close()

        except:

            pass

wangyi()

Python 爬虫实例（4）—— 爬取网易新闻的更多相关文章

Python爬虫实例：爬取B站《工作细胞》短评——异步加载信息的爬取
很多网页的信息都是通过异步加载的,本文就举例讨论下此类网页的抓取. <工作细胞>最近比较火,bilibili 上目前的短评已经有17000多条. 先看分析下页面右边 li 标签中的就是短 ...
Python爬虫实例：爬取猫眼电影——破解字体反爬
字体反爬字体反爬也就是自定义字体反爬,通过调用自定义的字体文件来渲染网页中的文字,而网页中的文字不再是文字,而是相应的字体编码,通过复制或者简单的采集是无法采集到编码后的文字内容的. 现在貌似不少网 ...
Python爬虫实例：爬取豆瓣Top250
入门第一个爬虫一般都是爬这个,实在是太简单.用了 requests 和 bs4 库. 1.检查网页元素,提取所需要的信息并保存.这个用 bs4 就可以,前面的文章中已经有详细的用法阐述. 2.找到下一 ...
Python爬虫实战教程：爬取网易新闻
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: Amauri PS:如有需要Python学习资料的小伙伴可以加点击 ...
Python爬虫实战教程：爬取网易新闻；爬虫精选高手技巧
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. stars声明很多小伙伴学习Python过程中会遇到各种烦恼问题解决不了.为 ...
如何利用python爬取网易新闻
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: LSGOGroup PS:如有需要Python学习资料的小伙伴可以 ...
Python爬虫教程-17-ajax爬取实例（豆瓣电影）
Python爬虫教程-17-ajax爬取实例(豆瓣电影) ajax: 简单的说,就是一段js代码,通过这段代码,可以让页面发送异步的请求,或者向服务器发送一个东西,即和服务器进行交互对于ajax: ...
【转载】教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神
原文:教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http:/ ...
python爬虫-基础入门-爬取整个网站《3》
python爬虫-基础入门-爬取整个网站<3> 描述: 前两章粗略的讲述了python2.python3爬取整个网站,这章节简单的记录一下python2.python3的区别 python ...
python爬虫-基础入门-爬取整个网站《2》
python爬虫-基础入门-爬取整个网站<2> 描述: 开场白已在<python爬虫-基础入门-爬取整个网站<1>>中描述过了,这里不在描述,只附上 python3 ...

随机推荐

Linux环境redis集群搭建
集群后tomcat context.xml的配置  <Valve className="com.radiadesign.catalina.sessi ...
asmack xmpp 获取离线消息
原文:http://plplum.blog.163.com/blog/static/31032400201503015345948/ 注意事项: 1.登录前要将状态设置为离线: ConnectionC ...
[mark]如何删除地址栏的记录?
比如,我输入字母a ..因为经常访问.它首先会自动帮我补填 amazon.cn 第二行出现 ali213...第三行是 alipay... 这个很简单,没必要搞得很复杂很Geek.比如楼主的情况,首先 ...
.NET：在C#中模拟Javascript的setTimeout方法
背景每种语言都有自己的定时器(Timer),很多人熟悉Javascript中的setInterval和setTimeout,在Javascript中为了实现平滑的动画一般采用setTimeout模拟 ...
There is no Action mapped for namespace [/] and action name [Login] associated with context path [/e
近期学习web开发时,就遇到这个令人头疼的问题. 百度谷歌了N遍,最终在博客http://blog.csdn.net/liu578182160/article/details/17266879中找到了 ...
iOS设计模式:静态工厂相关
工厂方法模式定义创建对象的接口,让子类决定实例化哪一个类,工厂方法使得一个类的实例化延迟到其子类. *最初的定义出现于<设计模式>(Addison-Wesley,1994) 注意:我讲解 ...
Windows Server 2012 R2搭建IIS服务器
1-单击宫格菜单的第一个“服务器管理器”: 2 2-在“快速启动(Q)”子菜单下,单击“2 添加角色和功能”: 3 3-点击左边“安装类型”,然后单击“基于角色或基于功能的安装”,再单击“下一步(N) ...
Resin install document
Centos6快速安装文档 resin3.1.13 软件下载地址: http://caucho.com/products/resin/download/gpl#download #系统环境[root@ ...
如何从头开始确定虚拟SharePoint服务器场的配置(compute resource, network和storage)
让我们来设想一下, 假设你被上级要求设计一个SharePoint场, 用于满足自己公司的需求. 那么, 你会怎么做呢? 首先, 摆在你面前的是一系列的问题: 1. 用实体机搭建还是选用虚拟机平台? ...
Ubuntu下如何安装与运行Redis
内容中包含 base64string 图片造成字符过多,拒绝显示

Python 爬虫实例（4）—— 爬取网易新闻

Python 爬虫实例（4）—— 爬取网易新闻的更多相关文章

随机推荐

热门专题