您好，我是 @马哥python说，一枚10年程序猿。

一、爬取目标

前些天我分享过一篇微博的爬虫：

https://www.cnblogs.com/mashukui/p/16414027.html

但是知乎平台和微博平台的不同之处在于，微博平台的数据用于分析社会舆论热点事件是极好的，毕竟是个偏娱乐化的社交平台。但知乎平台的评论更加客观、讨论内容更加有深度，更加有专业性，基于此想法，我开发出了这个知乎评论的爬虫。

二、展示爬取结果

我在知乎上搜索了5个关于”考研“的知乎回答，爬取了回答下方的评论数据，共计2300+条数据。

https://www.zhihu.com/question/291278869/answer/930193847

https://www.zhihu.com/question/291278869/answer/802226501

https://www.zhihu.com/question/291278869/answer/857896805

https://www.zhihu.com/question/291278869/answer/910489150

https://www.zhihu.com/question/291278869/answer/935352960

爬取字段，含：

回答url、页码、评论作者、作者性别、作者主页、作者头像、评论时间、评论内容、评论级别。

部分数据截图：

三、爬虫代码讲解

3.1 分析知乎页面

任意打开一个知乎回答，点开评论界面：

同时打开chrome浏览器的开发者模式，评论往下翻页，就会找到目标链接：

作为爬虫开发者，看到这种0-19的json数据，一定要敏感，这大概率就是评论数据了。猜测一下，每页有20条评论，逐级打开json数据：

基于此数据结构，开发爬虫代码。

3.2 爬虫代码

首先，导入用到的库：

import requests

import time

import pandas as pd

import os

从上面的截图可以看到，评论时间created_time是个10位时间戳，因此，定义一个转换时间的函数：

def trans_date(v_timestamp):

	"""10位时间戳转换为时间字符串"""

	timeArray = time.localtime(v_timestamp)

	otherStyleTime = time.strftime("%Y-%m-%d %H:%M:%S", timeArray)

	return otherStyleTime

作者的性别gender是0、1，所以也定义一个转换函数：

def tran_gender(gender_tag):

	"""转换性别"""

	if gender_tag == 1:

		return '男'

	elif gender_tag == 0:

		return '女'

	else:  # -1

		return '未知'

准备工作做好了，下面开始写爬虫。

请求地址url，从哪里得到呢？

打开Headers，找到Request URL，直接复制下来，然后替换：

先提取出一共多少评论，用于计算后面的翻页次数：

url0 = 'https://www.zhihu.com/api/v4/answers/{}/root_comments?order=normal&limit=20&offset=0&status=open'.format(answer_id)

r0 = requests.get(url0, headers=headers)  # 发送请求

total = r0.json()['common_counts']  # 一共多少条评论

print('一共{}条评论'.format(total))

计算翻页次数，直接用评论总数除以20就好了：

# 判断一共多少页（每页20条评论）

max_page = int(total / 20)

print('max_page:', max_page)

下面，再次发送请求，获取评论数据：

url = 'https://www.zhihu.com/api/v4/answers/{}/root_comments?order=normal&limit=20&offset={}&status=open'.format(answer_id,str(offset))

r = requests.get(url, headers=headers)

print('正在爬取第{}页'.format(i + 1))

j_data = r.json()

comments = j_data['data']

现在，所有数据都在comments里面了，开始for循环遍历处理：

字段过多，这里以评论作者、评论性别为例，其他字段同理：

for c in comments:  # 一级评论

	# 评论作者

	author = c['author']['member']['name']

	authors.append(author)

	print('作者：', author)

	# 作者性别

	gender_tag = c['author']['member']['gender']

	genders.append(tran_gender(gender_tag))

其他字段不再赘述。

需要注意的是，知乎评论分为一级评论和二级评论（二级评论就是一级评论的回复评论），所以，为了同时爬取到二级评论，开发以下逻辑：（同样以评论作者、评论性别为例，其他字段同理）

if c['child_comments']:  # 如果二级评论存在

	for child in c['child_comments']:  # 二级评论

		# 评论作者

		print('子评论作者：', child['author']['member']['name'])

		authors.append(child['author']['member']['name'])

		# 作者性别

		genders.append(tran_gender(child['author']['member']['gender']))

待所有字段处理好之后，把所有字段的列表数据拼装到DataFrame，to_csv保存到csv文件里，完毕！

df = pd.DataFrame(

	{

		'回答url': answer_urls,

		'页码': [i + 1] * len(answer_urls),

		'评论作者': authors,

		'作者性别': genders,

		'作者主页': author_homepages,

		'作者头像': author_pics,

		'评论时间': create_times,

		'评论内容': contents,

		'评论级别': child_tag,

	}

)

# 保存到csv文件

df.to_csv(v_result_file, mode='a+', index=False, header=header, encoding='utf_8_sig')

完整代码中还涉及到避免数据重复、字段值拼接、判断翻页终止等细节逻辑，详细了解请见文末。

四、同步视频

演示视频：

https://www.zhihu.com/zvideo/1545723927430979584

五、完整源码

附：微信公众号"老男孩的平凡之路"后台回复"爬知乎评论"即可获取。

此处点击完整源码

更多爬虫源码: 点击前往

【2023知乎爬虫】我用Python爬虫爬了2386条知乎评论！的更多相关文章

python爬虫-基础入门-python爬虫突破封锁
python爬虫-基础入门-python爬虫突破封锁 >> 相关概念 >> request概念:是从客户端向服务器发出请求,包括用户提交的信息及客户端的一些信息.客户端可通过H ...
【爬虫集合】Python爬虫
一.爬虫学习教程 1. https://www.jianshu.com/u/c32d557edfa3 2. WebMagic是一个简单灵活的Java爬虫框架.基于WebMagic,你可以快速开发出一个 ...
抖音爬虫教程，python爬虫采集反爬策略
一.爬虫与反爬简介爬虫就是我们利用某种程序代替人工批量读取.获取网站上的资料信息.而反爬则是跟爬虫的对立面,是竭尽全力阻止非人为的采集网站信息,二者相生相克,水火不容,到目前为止大部分的网站都还是可 ...
【Python】【爬虫】如何学习Python爬虫？
如何学习Python爬虫[入门篇]? 路人甲 1 年前想写这么一篇文章,但是知乎社区爬虫大神很多,光是整理他们的答案就够我这篇文章的内容了.对于我个人来说我更喜欢那种非常实用的教程,这种教程对于想直 ...
Python爬虫入门一之综述
大家好哈,最近博主在学习Python,学习期间也遇到一些问题,获得了一些经验,在此将自己的学习系统地整理下来,如果大家有兴趣学习爬虫的话,可以将这些文章作为参考,也欢迎大家一共分享学习经验. Pyth ...
[python]爬虫学习（一）
要学习Python爬虫,我们要学习的共有以下几点(python2): Python基础知识 Python中urllib和urllib2库的用法 Python正则表达式 Python爬虫框架Scrapy ...
Python爬虫入门：综述
大家好哈,最近博主在学习Python,学习期间也遇到一些问题,获得了一些经验,在此将自己的学习系统地整理下来,如果大家有兴趣学习爬虫的话,可以将这些文章作为参考,也欢迎大家一共分享学习经验. Pyth ...
Python爬虫：用BeautifulSoup进行NBA数据爬取
爬虫主要就是要过滤掉网页中没用的信息.抓取网页中实用的信息一般的爬虫架构为: 在python爬虫之前先要对网页的结构知识有一定的了解.如网页的标签,网页的语言等知识,推荐去W3School: W3s ...
1.Python爬虫入门一之综述
要学习Python爬虫,我们要学习的共有以下几点: Python基础知识 Python中urllib和urllib2库的用法 Python正则表达式 Python爬虫框架Scrapy Python爬虫 ...
python爬虫的教程
来源:http://cuiqingcai.com/1052.html 大家好哈,我呢最近在学习Python爬虫,感觉非常有意思,真的让生活可以方便很多.学习过程中我把一些学习的笔记总结下来,还记录了一 ...

随机推荐

java实战字符串2：中英字符串相互转换
题目描述输入字符串为中文拼音号码串或者英文号码串,如果输入是中文拼音号码串则转成英文号码串,如果输入是英文号码串则转成中文号码串. 特殊情况是英文号码串会出现Double + 英文数字或者拼音数值. ...
Echarts入门案例教程
一.定义容器变量并获取页面div元素 1 var chartDom = document.getElementById('chart3'); 二.初始化容器 1 var myChart = echar ...
#树形依赖背包，点分治#BZOJ 4182 Shopping
题目给定一棵大小为 \(n\) 的树,每个点代表一种物品,其具有体积.价值和数量的属性, 现在选择一个连通块,使得里面所有点都被选中且体积不超过 \(m\),问最大价值. \(n\leq 500,m ...
一文弄懂EnumMap和EnumSet
目录简介 EnumMap 什么时候使用EnumMap EnumSet 总结一文弄懂EnumMap和EnumSet 简介一般来说我们会选择使用HashMap来存储key-value格式的数据,考虑 ...
一文弄懂String的所有小秘密
目录简介 String是不可变的传值还是传引用 substring() 导致的内存泄露总结简介 String是java中非常常用的一个对象类型.可以说java中使用最多的就是String了.那 ...
C#中yield return的作用
C#中yield return的作用 yield return作用在 return 时,保存当前函数的状态,下次调用时继续从当前位置处理.示例说明如下代码所示,主函数使用 foreach 输出 Get ...
记录C++，base64解码写PDF文件遇到的坑
不得不bb一下, 场景:用户传base64数据,我生成PDF文件保存到指定路径下背景:在前人写好的工程上增加这个功能,工程中有base64的.h, .cpp 文件,我试了base64编码没有问题,所 ...
Mysql之备份工具
一.备份工具 1. mysqldump mysql服务自带的备份工具:mysqldump备份方式是采用的逻辑备份,其最大的缺陷是备份和恢复速度较慢,如果数据库大于50G,mysqldump备份就不太适 ...
史上最全的中高级JAVA工程师-面试题汇总
史上最全的中高级JAVA工程师-面试题汇总置顶 2019-10-15 18:58:32 Jeff.Smile 阅读数 34460更多分类专栏: # 随笔版权声明:本文为博主原创文章,遵循CC 4 ...
docker 应用篇————portainer[九]
前言简单介绍一下portainer. 正文运行一下. docker run -d -p 8088:9000 --restart=always -v /var/run/docker.sock:/va ...

【2023知乎爬虫】我用Python爬虫爬了2386条知乎评论！