Python学习笔记之爬取网页保存到本地文件

爬虫的操作步骤：

爬虫三步走

爬虫第一步：使用requests获得数据： （request库需要提前安装，通过pip方式，参考之前的博文）
1.导入requests
2.使用requests.get获取网页源码

import requests

r = requests.get('https://book.douban.com/subject/1084336/comments/').text

爬虫第二步：使用BeautifulSoup4解析数据： （BeautifulSoup4库需要提前安装，通过pip方式，参考之前的博文）
1.导入bs4
2.解析网页数据
3.寻找数据
4.for循环打印

from bs4 import BeautifulSoup

soup = BeautifulSoup(r,'lxml')

pattern = soup.find_all('p','comment-content')

for item in pattern:

print(item.string)

爬虫第三步：使用pandas保存数据： （pandas库需要提前安装，通过pip方式，参考之前的博文）
1.导入pandas
2.新建list对象
3.使用to_csv写入

import pandas

comments = []

for item in pattern:

comments.append(item.string)

df = pandas.DataFrame(comments)

df.to_csv('comments.csv')

完整的爬虫(值得注意的是关于BeautifulSoup和pandas两个包，都需要事先在电脑上安装，可以使用pip命令方式安装，具体方法可查看之前的博文命令 pip install beautifulsoup & pip install pandas)

import requests

r = requests.get('https://book.douban.com/subject/1084336/comments/').text

from bs4 import BeautifulSoup

soup = BeautifulSoup(r,'lxml')

pattern = soup.find_all('p','comment-content')

for item in pattern:

print(item.string)

import pandas

comments = []

for item in pattern:

comments.append(item.string)

df = pandas.DataFrame(comments)

df.to_csv('comments.csv')#当然这里可以指定文件路径，如 D:/PythonWorkSpace/TestData/comments.csv

代码运行结果：（注意的是，运行结果为csv，可能你用Excel打开之后会出现乱码，那是因为csv格式不对，怎么解决呢？

你可以将csv文件用Notepad++打开，编码Encoding选择 Encode in UTF-8-BOM）

如果是多页的话，为了防止保存到CSV 文件中的数据被上一页覆盖，可以这样用：

mode='a', header = False

df.to_csv('D:/Python....csv', mode='a', header = False)

Python学习笔记之爬取网页保存到本地文件的更多相关文章

吴裕雄--天生自然python学习笔记：爬取我国 1990 年到 2017年 GDP 数据并绘图显示
绘制图形所需的数据源通常是不固定的,比如,有时我们会需要从网页抓取, 也可能需从文件或数据库中获取. 利用抓取网页数据技术,把我国 1990 年到 2016 年的 GDP 数据抓取出来 ,再利用 Ma ...
【python爬虫】对喜马拉雅上一个专辑的音频进行爬取并保存到本地
>>>内容基本框架: 1.爬虫目的 2.爬取过程 3.代码实现 4.爬取结果 >>>实验环境: python3.6版本,pycharm,电脑可上网. [一爬虫目 ...
【知识积累】使用Httpclient实现网页的爬取并保存至本地
程序功能实现了爬取网页页面并且将结果保存到本地,通过以爬取页面出发,做一个小的爬虫,分析出有利于自己的信息,做定制化的处理. 其中需要的http*的jar文件,可以在网上自行下载 import jav ...
【Python】python3 正则爬取网页输出中文乱码解决
爬取网页时候print输出的时候有中文输出乱码例如: \\xe4\\xb8\\xad\\xe5\\x8d\\x8e\\xe4\\xb9\\xa6\\xe5\\xb1\\x80 #爬取https:// ...
Python学习笔记（15）- os\os.path 操作文件
程序1 编写一个程序,统计当前目录下每个文件类型的文件数,程序实现如图: import os def countfile(path): dict1 = {} # 定义一个字典 all_files = ...
python学习--第二天爬取王者荣耀英雄皮肤
今天目的是爬取所有英雄皮肤在爬取所有之前,先完成一张皮肤的爬取打开anacond调出编译器Jupyter Notebook 打开王者荣耀官网下拉找到位于网页右边的英雄/皮肤点击[+更多] 进入 ...
Python入门,以及简单爬取网页文本内容
最近痴迷于Python的逻辑控制,还有爬虫的一方面,原本的目标是拷贝老师上课时U盘的数据.后来发现基础知识掌握的并不是很牢固.便去借了一本Python基础和两本爬虫框架的书.便开始了自己的入坑之旅言 ...
python爬虫笔记之爬取足球比赛赛程
目标:爬取某网站比赛赛程,动态网页,则需找到对应ajax请求(具体可参考:https://blog.csdn.net/you_are_my_dream/article/details/53399949 ...
python使用requests库爬取网页的小实例：爬取京东网页
爬取京东网页的全代码: #爬取京东页面的全代码 import requests url="https://item.jd.com/2967929.html" try: r=requ ...

随机推荐

RK哈希（Rabin_Karp 哈希）
Rabin_Karp 哈希通过比较hash值是否相等来比较每个字符串是否相等有概率出错(很小)字符串x1,x2,x3……xk基底e;模数mo;hash=(xk*e^0+xk-1*e^1+......+ ...
洛谷 P2862 [USACO06JAN]把牛Corral the Cows 解题报告
P2862 [USACO06JAN]把牛Corral the Cows 题目描述 Farmer John wishes to build a corral for his cows. Being fi ...
SPOJ6340 ZUMA - ZUMA
题意:n个珠子排成一排,都有各自的颜色. 你可以选择不少于w个连续同色的珠子消掉,也可以先放着.你还可以任意插入任意颜色的珠子. 求全部消掉至少要插入几个珠子. 解: 什么毒瘤东西...... 有个十 ...
【洛谷P1522】牛的旅行
题目大意:给定一个 N 个顶点的无向图,图中有若干联通块,现定义联通块的直径为该联通块中距离最远的两个点的距离,定义无向图的直径为这个图中所有联通块直径的最大值.现在在图上加一条边,使得两个本不连通的 ...
nodejs读取json文件，写入mongodb数据库
最近又一点时间,开始使用mongodb存储json模型文件,然后可以实现模型文件的在线编辑和管理.今天上午实现了json文件入库的代码,如下: var fs=require("fs" ...
bzoj千题计划287：bzoj1228: [SDOI2009]E&D
http://www.lydsy.com/JudgeOnline/problem.php?id=1228 打SG函数表,找规律: 若n是奇数m是奇数,则SG(n,m)=0 若n是偶数m是偶数,则SG( ...
【转载】RESTful API 设计指南
作者: 阮一峰日期: 2014年5月22日网络应用程序,分为前端和后端两个部分.当前的发展趋势,就是前端设备层出不穷(手机.平板.桌面电脑.其他专用设备......). 因此,必须有一种统一的机制 ...
keepalived vrrp_script脚本不执行解决办法
首先打开日志观察: tail -f /var/log/messages 然后新开一个客户端重启keepalived , systemctl restart keepalived.service 看日志 ...
CodeForces Contest #1110: Global Round 1
比赛传送门:CF #1110. 比赛记录:点我. 涨了挺多分,希望下次还能涨. [A]Parity 题意简述: 问 \(k\) 位 \(b\) 进制数 \(\overline{a_1a_2\cdots ...
通过JavaScript自由切换iframe
我发现我有很大的强迫症,如果看到别人的文章没有最终的效果图,我会毫不犹豫关掉这个页面.真的很炸毛这种,让我有很不舒服的体验:所以纵使网上有类似的了,我还是写一篇给那些跟我有同样症状的人阅读. 首先来学 ...

Python学习笔记之爬取网页保存到本地文件

爬虫三步走

完整的爬虫(值得注意的是关于BeautifulSoup和pandas两个包，都需要事先在电脑上安装，可以使用pip命令方式安装，具体方法可查看之前的博文命令 pip install beautifulsoup & pip install pandas)

Python学习笔记之爬取网页保存到本地文件的更多相关文章

随机推荐

热门专题