python 爬取文章后存储excel 以及csv

import requests

from bs4 import BeautifulSoup

import random

import openpyxl

xls=openpyxl.Workbook()

sheet=xls.active

sheet.title='movies'

sheet['A1']='序号'

sheet['B1']='名称'

sheet['C1']='评分'

sheet['D1']='推荐语'

sheet['E1']='链接'

for i in range(11):

    params={

        'start': str(i*25),

        'filter':''

    }

    headers={

        'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/78.0.3904.70 Safari/537.36'

    }

    url='https://movie.douban.com/top250'

    res=requests.get(url,params=params,headers=headers)

    con=res.text

    soup=BeautifulSoup(con,'html.parser')

    maindiv=soup.find(class_="grid_view")

    for titles in maindiv.find_all('li'):

        try:

            num = titles.find('em',class_="").text

            #查找序号

            title = titles.find('span', class_="title").text

            #查找电影名

            tes = titles.find('span',class_="inq").text

            #查找推荐语

            comment = titles.find('span',class_="rating_num").text

            #查找评分

            url_movie = titles.find('a')['href']

            print(num + '.' + title + '——' + comment + '\n' + '推荐语：' + tes +'\n' + url_movie)

            sheet.append([num,title,comment,tes,url_movie])

        except:

            continue

xls.save('douban.xlsx')

csv:

import requests

from bs4 import BeautifulSoup

import random

import openpyxl

import csv

url="https://www.zhihu.com/api/v4/members/zhang-jia-wei/articles"

headers={

    'referer': 'https://www.zhihu.com/people/zhang-jia-wei/posts/posts_by_votes?page=1',

    'user-agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/78.0.3904.108 Safari/537.36'

}

csv_file=open('dazhangwei.csv','w',newline='',encoding='utf-8')

writer=csv.writer(csv_file)

header=['标题','简介','连接']

writer.writerow(header)

x=0

while True:

    params={

        'include': 'data[*].comment_count,suggest_edit,is_normal,thumbnail_extra_info,thumbnail,can_comment,comment_permission,admin_closed_comment,content,voteup_count,created,updated,upvoted_followees,voting,review_info,is_labeled,label_info;data[*].author.badge[?(type=best_answerer)].topics',

        'offset': str((x*10)),

        'limit': '10',

        'sort_by': 'voteups'

    }

    res=requests.get(url,headers=headers,params=params)

    res_json=res.json()

    con=res_json['data']

    for i in con:

        lists=[i['title'],i['url'],i['excerpt']]

        writer.writerow(lists)

    if res_json['paging']['is_end'] == True:

        break

    x+=1

csv_file.close()

python 爬取文章后存储excel 以及csv的更多相关文章

Python爬取豆瓣音乐存储MongoDB数据库(Python爬虫实战1)
1. 爬虫设计的技术 1)数据获取,通过http获取网站的数据,如urllib,urllib2,requests等模块: 2)数据提取,将web站点所获取的数据进行处理,获取所需要的数据,常使用的技 ...
python 爬取文章
这里我们利用强大的python爬虫来爬取一篇文章.仅仅做一个示范,更高级的用法还要大家自己实践. 好了,这里就不啰嗦了,找到一篇文章的url地址:http://www.duanwenxue.com/a ...
python爬取数据保存到Excel中
# -*- conding:utf-8 -*- # 1.两页的内容 # 2.抓取每页title和URL # 3.根据title创建文件,发送URL请求,提取数据 import requests fro ...
Python爬取新浪微博评论数据，写入csv文件中
因为新浪微博网页版爬虫比较困难,故采取用手机网页端爬取的方式操作步骤如下: 1. 网页版登陆新浪微博 2.打开m.weibo.cn 3.查找自己感兴趣的话题,获取对应的数据接口链接 4.获取cook ...
用Python爬取文章，并转PDF格式电子书
wkhtmltopdf [软件],这个是必学准备好的,不然这个案例是实现不出来的获取文章内容代码 (https://jq.qq.com/?_wv=1027&k=QgGWqAVF) 发送请求, ...
python爬取旅游数据+matplotlib简单可视化
题目如下: 共由6个函数组成: 第一个函数爬取数据并转为DataFrame: 第二个函数爬取数据后存入Excel中,对于解题来说是多余的,仅当练手以及方便核对数据: 后面四个函数分别对应题目中的四个m ...
Python爬虫教程-13-爬虫使用cookie爬取登录后的页面(人人网)（下）
Python爬虫教程-13-爬虫使用cookie爬取登录后的页面(下) 自动使用cookie的方法,告别手动拷贝cookie http模块包含一些关于cookie的模块,通过他们我们可以自动的使用co ...
Python爬取招聘信息，并且存储到MySQL数据库中
前面一篇文章主要讲述,如何通过Python爬取招聘信息,且爬取的日期为前一天的,同时将爬取的内容保存到数据库中:这篇文章主要讲述如何将python文件压缩成exe可执行文件,供后面的操作. 这系列文章 ...
Python爬虫教程-12-爬虫使用cookie爬取登录后的页面(人人网)（上）
Python爬虫教程-12-爬虫使用cookie(上) 爬虫关于cookie和session,由于http协议无记忆性,比如说登录淘宝网站的浏览记录,下次打开是不能直接记忆下来的,后来就有了cooki ...

随机推荐

解决tomcat7控制台中文乱码问题
控制台启动会有乱码,找了很多方法都不行,最后找到一个可用的方法,非常简单打开tomcat/conf/logging.properties找到java.util.logging.ConsoleHand ...
验证HashSet和HashMap不是线程安全
JAVA集合类: java.util包下的HashSet和HashMap类不是线程安全的, java.util.concurrent包下的ConcurrentHashMap类是线程安全的. 写2个测试 ...
Jetson TX2介绍
Jetson TX2是NIVDIA瞄准人工智能在Jetson TK1和TX1推出后的升级 TX2的GPU和CPU都进行了升级,内存增加到了8GB.存储增加到了32GB,支持Wifi和蓝牙,编解码支持H ...
hadoop1.2.1安装配置
原文地址环境:ubuntu13 使用的用户为普通用户.如:用户ru jdk安装略 1.安装ssh (1) sudo apt-get install openssh-server (2)配置ssh面密 ...
Swift 条件语句
条件语句通过设定的一个或多个条件来执行程序,在条件为真时执行指定的语句,在条件为 false 时执行另外指定的语句. 可以通过下图来简单了解条件语句的执行过程: Swift 提供了以下几种类型的条件语 ...
海康大华RTSP格式
海康实时流:rtsp://admin:12345@192.2.82.50:554/h264/ch4/main/av_stream海康回放流(模拟通道):rtsp://admin:12345@192.2 ...
PJzhang:exiftool图片信息提取工具和短信接口调用工具TBomb
猫宁!!! 作者:Phil Harvey 这是图片信息提取工具的地址: https://sno.phy.queensu.ca/~phil/exiftool/ 网站隶属于Sudbury 中微子天文台,从 ...
牛客竞赛（gcd，快速幂）
一.最大公约数和最小公倍数问题题目描述: 输入2个正整数x0,y0(2<=x0<100000,2<=y0<=1000000),求出满足下列条件的P,Q的个数. 条件:1.P, ...
Tomcat 部署web 项目
转载,原文链接: https://www.cnblogs.com/ysocean/p/6893446.html 侵删回到顶部 3.Tomcat 的目录结构回到顶部 4.部署项目的第一种方法(项目直 ...
【ARM-Linux开发】Linux下查看机器的CPU负载
负载(load)是Linux机器的一个重要指标,直观了反应了机器当前的状态.如果机器负载过高,那么对机器的操作将难以进行. Linux的负载高,主要是由于CPU使用.内存使用.IO消耗三部分构成.任意 ...

python 爬取文章后存储excel 以及csv

python 爬取文章后存储excel 以及csv的更多相关文章

随机推荐

热门专题