使用scrapy爬虫,爬取今日头条首页推荐新闻（scrapy+selenium+PhantomJS）

爬取今日头条https://www.toutiao.com/首页推荐的新闻，打开网址得到如下界面

查看源代码你会发现

全是js代码，说明今日头条的内容是通过js动态生成的。

用火狐浏览器F12查看得知

得到了今日头条的推荐新闻的接口地址：https://www.toutiao.com/api/pc/focus/

单独访问这个地址得到

此接口得到的数据格式为json数据

我们用scrapy+selenium+PhantomJS的方式获取今日头条推荐的内容

下面是是scrapy中最核心的代码，位于spiders中的toutiao_example.py

# -*- coding: utf-8 -*-

import scrapy

import json

from selenium import webdriver

from selenium.webdriver.common.desired_capabilities import DesiredCapabilities

import time

import re

class ToutiaoExampleSpider(scrapy.Spider):

    name = 'toutiao_example'

    allowed_domains = ['toutiao.com']

    start_urls = ['https://www.toutiao.com/api/pc/focus/'] ###今日头条焦点的api接口

    def parse(self, response):

        conten_json=json.loads(response.text) 
        conten_news=conten_json['data'] ###从json数据中抽取data字段数据，其中data字段数据里面包含了pc_feed_focus这个字段，其中这个字段包含了：新闻的标题title，链接url等信息

        for aa in  conten_news['pc_feed_focus']:

            title=aa['title']

            link_url='https://www.toutiao.com'+aa['display_url'] ###如果写（www.toutiao.com'+aa['display_url']）会报错，加上https://,(https://www.toutiao.com'+aa['display_url'])则不会报错！

            link_url_new=link_url.replace('group/','a')###把链接https://www.toutiao.com/group/6574248586484122126/，放到浏览器中，地址会自动变成https://www.toutiao.com/a6574248586484122126/这个。所以我们需要把group/ 替换成a

            yield scrapy.Request(link_url_new, callback=self.next_parse)

    def next_parse(self, response):

        dcap = dict(DesiredCapabilities.PHANTOMJS)  # 设置useragent信息

        dcap['phantomjs.page.settings.userAgent'] = (

        'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.9; rv:25.0) Gecko/20100101 Firefox/25.0 ')  # 根据需要设置具体的浏览器信息

        driver = webdriver.PhantomJS(desired_capabilities=dcap)  #封装浏览器信息) # 指定使用的浏览器,

        #driver.set_page_load_timeout(5)  # 设置超时时间

        driver.get(response.url)##使用浏览器请求页面

        time.sleep(3)#加载3秒，等待所有数据加载完毕

        title=driver.find_element_by_class_name('title').text  ###.text获取元素的文本数据

        content1=driver.find_element_by_class_name('abstract-index').text###.text获取元素的文本数据

        content2=driver.find_element_by_class_name('abstract').text###.text获取元素的文本数据

        content=content1+content2

        print(title,content,6666666666666666)

        driver.close()

      #data = driver.page_source# 获取网页文本

      #driver.save_screenshot('1.jpg')  # 系统截图保存

运行代码我们得到结果为标题加内容呈现方式如下

使用scrapy爬虫,爬取今日头条首页推荐新闻（scrapy+selenium+PhantomJS）的更多相关文章

使用scrapy爬虫,爬取今日头条搜索吉林疫苗新闻（scrapy+selenium+PhantomJS）
这一阵子吉林疫苗案,备受大家关注,索性使用爬虫来爬取今日头条搜索吉林疫苗的新闻依然使用三件套(scrapy+selenium+PhantomJS)来爬取新闻以下是搜索页面,得到吉林疫苗的搜索信息, ...
Python 爬虫爬取今日头条街拍上的图片
# 今日头条--街拍 import requests from urllib.parse import urlencode import os from hashlib import md5 from ...
使用python-aiohttp爬取今日头条
http://blog.csdn.net/u011475134/article/details/70198533 原出处在上一篇文章<使用python-aiohttp爬取网易云音乐>中, ...
Python3从零开始爬取今日头条的新闻【二、首页热点新闻抓取】
Python3从零开始爬取今日头条的新闻[一.开发环境搭建] Python3从零开始爬取今日头条的新闻[二.首页热点新闻抓取] Python3从零开始爬取今日头条的新闻[三.滚动到底自动加载] Pyt ...
PYTHON 爬虫笔记九:利用Ajax+正则表达式+BeautifulSoup爬取今日头条街拍图集（实战项目二）
利用Ajax+正则表达式+BeautifulSoup爬取今日头条街拍图集目标站点分析今日头条这类的网站制作,从数据形式,CSS样式都是通过数据接口的样式来决定的,所以它的抓取方法和其他网页的抓取方 ...
爬虫七之分析Ajax请求并爬取今日头条
爬取今日头条图片这里只讨论出现的一些问题,代码在最下面github链接里. 首先,今日头条取消了"图集"这一选项,因此对于爬虫来说效率降低了很多: 在所有代码都完成后,也许是爬取 ...
Python3从零开始爬取今日头条的新闻【一、开发环境搭建】
Python3从零开始爬取今日头条的新闻[一.开发环境搭建] Python3从零开始爬取今日头条的新闻[二.首页热点新闻抓取] Python3从零开始爬取今日头条的新闻[三.滚动到底自动加载] Pyt ...
Python3从零开始爬取今日头条的新闻【四、模拟点击切换tab标签获取内容】
Python3从零开始爬取今日头条的新闻[一.开发环境搭建] Python3从零开始爬取今日头条的新闻[二.首页热点新闻抓取] Python3从零开始爬取今日头条的新闻[三.滚动到底自动加载] Pyt ...
Python3从零开始爬取今日头条的新闻【三、滚动到底自动加载】
Python3从零开始爬取今日头条的新闻[一.开发环境搭建] Python3从零开始爬取今日头条的新闻[二.首页热点新闻抓取] Python3从零开始爬取今日头条的新闻[三.滚动到底自动加载] Pyt ...

随机推荐

Spring Boot 集成Swagger
Spring Boot 集成Swagger - 小单的博客专栏 - CSDN博客https://blog.csdn.net/catoop/article/details/50668896 Spring ...
Windows服务器上使用phpstudy部署PHP程序
一.下载并安装PHPStudy 官网地址:http://phpstudy.php.cn/(安装包下载地址:链接:https://pan.baidu.com/s/1WOmbOwmLuUPt3_nmY6- ...
js判断iPhone XS、iPhone XS Max、iPhone XR
// iPhone X.iPhone XS && window.screen.width === && window.screen.height === ; // iP ...
nginx配置https双向验证（ca机构证书+自签证书）
nginx配置https双向验证服务端验证(ca机构证书) 客户端验证(服务器自签证书) 本文用的阿里云签发的免费证书实验,下载nginx安装ssl,文件夹有两个文件这两个文件用于做服务器http ...
springdata 一对多级联操作在注解里面开启级联操作@OneToMany(mappedBy = "customer",cascade = CascadeType.ALL)
vscode 配置c++
https://zhuanlan.zhihu.com/p/36654741 按照以上教程配置时出现"preLaunchTask": "build", erro ...
XMLHttpRequest的使用
XMLHttpRequest的使用标签(空格分隔): JavaScript 前端编程 function sendAjax() { //构造表单数据 var formData = new FormD ...
java-最大连续子数组和（最大字段和）
1.题目要求给定n个整数(可能为负数)组成的序列a[1],a[2],a[3],-,a[n],求该序列如a[i]+a[i+1]+-+a[j]的子段和的最大值.当所给的整数均为负数时定义子段和为0, ...
Spring定时器配置与运用，及Cron表达式的详解
一:首先在spring的配置文件里配置一个定时器 <task:executor id="executor" pool-size="5" /> < ...
DataReader转Dictionary数据类型之妙用
datareader转dictionary有很多用处,可以输出表中部分字段转实体字段,以前需要全部字段输出或者再建一个实体模型才行,这样就可以减少数据库的输出量了,特别是某些接口的格式化输出很方便. ...

使用scrapy爬虫,爬取今日头条首页推荐新闻（scrapy+selenium+PhantomJS）

使用scrapy爬虫,爬取今日头条首页推荐新闻（scrapy+selenium+PhantomJS）的更多相关文章

随机推荐

热门专题