微博搜索爬虫

网页分析

由于网页端反爬虫机制比较完善所以才去移动端进行爬虫。

url地址：https://m.weibo.cn/

搜索框，输入关键词进行搜索

对网页进行抓包，找到相关数据

查看数据是否与网页的内容相同

分析多组数据的请求头

编写程序

构造url地址

通过网页分析构造url地址对，地址信息访问。

import requests

#构造搜索内容

data = {

	'containerid':'100103type=1&q=电影',

	'page_type':'searchall',

	'page':'1',

}

#反爬虫，模拟游览器访问

headers = {

    'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.149 Safari/537.36',}

url = "https://m.weibo.cn/api/container/getIndex?"

#通过GET方式访问该网站

html = requests.get(url,headers=headers,params=data)

#打印结果，如果返回200,则访问成功

print(html)

获取相关数据

通过对网页分析，该网页获取的数据为json格式的数据

import json

......

#对返回结果判断，如果是200，则把数据转为json格式

if html.content:

    response = html.json()

数据为字典类型

import re

.......

#提取数据

cards = response["data"]["cards"]

result = []

#遍历cards列表

for card in cards:

    #判断"mblog"键是否存在该字典中

	mblogs = "mblog"

	if mblogs in card:

        #提取正文内容

		text = card[mblogs]["text"]

        #对正文进行提取，利用正则表达式删除HTML标签

        #re.compile正则表达式的字符串创建模式对象,re.S使.匹配包括换行在内的所有字符

		dr = re.compile(r'<[^>]+>',re.S)

        #把数据以字典的形式保存在列表中

		result.append({

			'发布时间':card[mblogs]["created_at"],

			'用户id':card[mblogs]["user"]["id"],

			'用户名':card[mblogs]["user"]["screen_name"],

			'微博地址':card[mblogs]["user"]["profile_url"],

			'转发数':card[mblogs]["reposts_count"],

			'评论数':card[mblogs]["comments_count"],

			'点赞数':card[mblogs]["attitudes_count"],

			'正文':dr.sub('',text)})

        print(result)

查看结果

获取到的数据保存到.cvs文件中

import csv

import time

from csv import DictWriter

......

#保存文件

#文件的名字

file_name = '电影.csv'

header = ['发布时间','用户id','用户名','微博地址','转发数','评论数','点赞数','正文']

with open(file_name,'a',newline = "",encoding = 'gb18030') as f:

	f_csv = DictWriter(f,header)	#DictWriter以字典形式写入

    #防止header重复写入

	with open(file_name, 'r', encoding='gb18030', newline="") as file:

		reader = csv.reader(file)

		if not [row for row in reader]:

			f_csv.writeheader()

			f_csv.writerows(result)

		else:

			f_csv.writerows(result)

        #延时，防止反爬机制

		time.sleep(0.1)

查看是否生成 “电影.csv” 文件

完成程序编写。

对源代码进行改进

目前只是爬取一页的结果，以及每次搜索不同的关键词都要改源代码内容。

为了让该程序实用美观，引用tkinter建立GUI界面。

from tkinter import *	#tkinter可以快速创建GUI应用程序

from csv import DictWriter

......

#创建一个窗口

root = Tk()

#设计窗口大小以及位置  宽高400*100 	位置(650,400)

root.geometry('405x80+650+400') 

#设计窗口标题

root.title('微博搜索')

#标签控件

labl1 = Label(root,text = '关键词:',font = ('华文行楷',18))

#网格显示标签,靠左显示

labl1.grid(sticky=W)

#输入框

entry = Entry(root,font = ('华文行楷',18))

#网格显示标签

entry.grid(row=0,column=1,sticky=W)

#搜索按钮

button = Button(root,text = '搜索',font = ('华文行楷',15),command=sign)

#command=sign对程序进行对接

#网格式显示

button.grid(row=0,column=3,sticky=E)

#显示窗口

root.mainloop()

对程序改进

def sign():

	#获取输入结果

	key_word = entry.get()

	#去除输入框的空格

	key_word = key_word.strip()

	#判断输入是否为空

	if key_word == '':

		#提示信息

		messagebox.showinfo(title = '提示',message = '请输入关键词')

	#构造搜索内容

    else：

    	for i in range(1,20):

			data = {

				'containerid':'100103type=1&q{}'.format(key_word),

				'page_type':'searchall',

				'page':i,

			}

    	......

        #文件的名字

        file_name = key_word + '.csv'

         ......

        #显示生成文件

        #标签控件

        labl2 = Label(root,text = '查询完成：{}'.format(file_name),font = ('华文行楷',15))

        #网格显示标签,靠左显示

        labl2.grid(row=1,column=1)

Python 微博搜索爬虫的更多相关文章

简单的抓取淘宝关键字信息、图片的Python爬虫|Python3中级玩家：淘宝天猫商品搜索爬虫自动化工具（第一篇）
Python3中级玩家:淘宝天猫商品搜索爬虫自动化工具(第一篇) 淘宝改字段,Bugfix,查看https://github.com/hunterhug/taobaoscrapy.git 由于Gith ...
初探爬虫 ——《python 3 网络爬虫开发实践》读书笔记
零.背景之前在 node.js 下写过一些爬虫,去做自己的私人网站和工具,但一直没有稍微深入的了解,借着此次公司的新项目,体系的学习下. 本文内容主要侧重介绍爬虫的概念.玩法.策略.不同工具的列举和 ...
Python 开发轻量级爬虫07
Python 开发轻量级爬虫 (imooc总结07--网页解析器BeautifulSoup) BeautifulSoup下载和安装使用pip install 安装:在命令行cmd之后输入,pip i ...
Python编写网页爬虫爬取oj上的代码信息
OJ升级,代码可能会丢失. 所以要事先备份. 一開始傻傻的复制粘贴, 后来实在不能忍, 得益于大潇的启示和聪神的原始代码, 网页爬虫走起! 已经有段时间没看Python, 这次网页爬虫的原始代码是 p ...
python 3.x 爬虫基础---常用第三方库（requests，BeautifulSoup4，selenium，lxml ）
python 3.x 爬虫基础 python 3.x 爬虫基础---http headers详解 python 3.x 爬虫基础---Urllib详解 python 3.x 爬虫基础---常用第三方库 ...
Ruby用百度搜索爬虫
Ruby用百度搜索爬虫博主ruby学得断断续续,打算写一个有点用的小程序娱乐一下,打算用ruby通过百度通道爬取网络信息. 第三方库准备 mechanize:比较方便地处理网络请求,类似于Pytho ...
python 3.x 爬虫基础---正则表达式
python 3.x 爬虫基础 python 3.x 爬虫基础---http headers详解 python 3.x 爬虫基础---Urllib详解 python 3.x 爬虫基础---Requer ...
python 3.x 爬虫基础---Requersts,BeautifulSoup4（bs4）
python 3.x 爬虫基础 python 3.x 爬虫基础---http headers详解 python 3.x 爬虫基础---Urllib详解 python 3.x 爬虫基础---Requer ...
Python学习网络爬虫--转
原文地址:https://github.com/lining0806/PythonSpiderNotes Python学习网络爬虫主要分3个大的版块:抓取,分析,存储另外,比较常用的爬虫框架Scra ...

随机推荐

spring框架常见的10个问题
一.找不到配置文件的异常org.springframework.beans.factory.BeanDefinitionStoreException: IOException parsing XML ...
hql常用查询语句
// HQL: Hibernate Query Language.// 特点:// >> 1,与SQL相似,SQL中的语法基本上都可以直接使用.// >> 2,SQL查询的是表 ...
vue中判断页面滚动开始和结束
参考链接:https://www.jianshu.com/p/adad39705ced 和 https://blog.csdn.net/weixin_44309374/article/deta ...
es5语法下，javascript如何判断函数是new还是()调用
es5语法没有支持类class,但是可以通关函数来申明一个类,如下: function Person(name){ this.name=name; } var john=new Person('joh ...
caioj 1031: [视频]递归1（全排列）【DFS】【全排列】
题目大意:先给一个正整数 n( 1 < = n < = 10 ),输出1到n的所有全排列. 题解:这道题目我们可以用递归来实现,递归在图论中又称为"深度优先搜索"(De ...
servlet和action的区别
1.Servlet:默认在第一次访问时被创建,创建一次,单实例对象 2.Action:访问时被创建,每次访问action的时候,都会创建action对象,创建多次,多实例对象
使用 Nginx 实现 URL 的重定向
1. 概述老话说的好:取乎上,得其中:取乎中,得其下.因此我们不妨把目标定的高一些,去努力,才能得到更好回报. 言归正传,今天我们来聊聊使用 Nginx 实现 URL 的重定向. 2. 使用 Ng ...
pt-osc又又出现死锁了
今天使用pt-osc修改mysql表结构,又出现死锁了,老大让尽量解决这个问题,我们先分析一下pt-osc容易出现死锁的原因,再来解决这个问题. 根据pt-osc打印的日志,可以看到pt-osc执行原 ...
在vue项目中配置webpack
首先我们来看一下使用Vue-cli2与Vue-cli2之后的版本(这里以Vue-cli4版本为例)创建项目目录结构的不同: Vue-cli2(左图)与Vue-cli4(右图)创建项目的目录从上图可以 ...
node.js - 包、express
首先,要先在这里分享一下我的喜悦,从昨天开始其实一直都在喜悦当中的,我收到了我的第一份offer,这感觉不摆了,比第一桶金都还舒服,虽然我还没收到第一桶金哈哈,不过offer都得了应该也快了. 今天的 ...

Python 微博搜索爬虫