python简单爬虫用beautifulsoup爬取百度百科词条

目标：爬取“湖南大学”百科词条并处理数据

需要获取的数据：

源代码：

<div class="basic-info cmn-clearfix">

<dl class="basicInfo-block basicInfo-left">

<dt class="basicInfo-item name">中文名</dt>

<dd class="basicInfo-item value">

湖南大学

</dd>

<dt class="basicInfo-item name">外文名</dt>

<dd class="basicInfo-item value">

Hunan University

</dd>

<dt class="basicInfo-item name">简&nbsp;&nbsp;&nbsp;&nbsp;称</dt>

<dd class="basicInfo-item value">

<a target="_blank" href="/item/%E6%B9%96%E5%A4%A7/406102" data-lemmaid="406102">湖大</a>·<a target="_blank" href="/item/HNU">HNU</a>

</dd>

<dt class="basicInfo-item name">创办时间</dt>

<dd class="basicInfo-item value">

1903年

</dd>

<dt class="basicInfo-item name">类&nbsp;&nbsp;&nbsp;&nbsp;别</dt>

<dd class="basicInfo-item value">

公立大学

</dd>

<dt class="basicInfo-item name">类&nbsp;&nbsp;&nbsp;&nbsp;型</dt>

<dd class="basicInfo-item value">

综合类<a target="_blank" href="/item/%E7%A0%94%E7%A9%B6%E5%9E%8B%E5%A4%A7%E5%AD%A6">研究型大学</a>

</dd>

.......

<dd class="basicInfo-item value">

<a target="_blank" href="/item/%E9%92%9F%E5%BF%97%E5%8D%8E">钟志华</a>、<a target="_blank" href="/item/%E8%B0%AD%E8%94%9A%E6%B3%93">谭蔚泓</a>、<a target="_blank" href="/item/%E4%BD%95%E4%BA%BA%E5%8F%AF">何人可</a>、<a target="_blank" href="/item/%E7%86%8A%E6%99%93%E9%B8%BD">熊晓鸽</a>、<a target="_blank" href="/item/%E8%92%8B%E8%B6%85%E8%89%AF">蒋超良</a>、<a target="_blank" href="/item/%E9%82%93%E9%A3%9E/1525913" data-lemmaid="1525913">邓飞</a>、<a target="_blank" href="/item/%E8%B0%AD%E8%80%95">谭耕</a>等

</dd>

</dl></div>

库：由于百度有反爬机制，所以使用urllib.request库获取网页；BeautifulSoup

代码：

from bs4 import BeautifulSoup

import urllib.request

url = "https://baike.baidu.com/item/%E6%B9%96%E5%8D%97%E5%A4%A7%E5%AD%A6/179157?fr=aladdin"

response = urllib.request.urlopen(url)  # 访问并打开url

html = response.read()  # 创建html对象读取页面源代码

soup = BeautifulSoup(html, 'html.parser')  # 创建soup对象，获取html代码

title = soup.find_all('dt', class_="basicInfo-item name")  # 找到所有dt标签，返回一个列表

node = soup.find_all('dd', class_="basicInfo-item value")  # 找到所有dd标签，返回一个列表

allunivinfo = []

titlelist = []

infolist = []

for i in title:  # 将所有dt标签内容存入列表

    title = i.get_text()

    titlelist.append(title)

for i in node:  # 将所有dd标签内容存入列表

    info = i.get_text()

    infolist.append(info)

for i, j in zip(titlelist, infolist):  # 多遍历循环，zip()接受一系列可迭代对象作为参数，将对象中对应的元素打包成一个个tuple（元组），然后返回由这些tuples组成的list（列表）。

    info = ''.join((str(i)+':'+str(j)).split())

    allunivinfo.append(info)

print(allunivinfo)

运行结果：

python简单爬虫用beautifulsoup爬取百度百科词条的更多相关文章

<爬虫>利用BeautifulSoup爬取百度百科虚拟人物资料存入Mysql数据库
网页情况: 代码: import requests from requests.exceptions import RequestException from bs4 import Beautiful ...
java 如何爬取百度百科词条内容(java如何使用webmagic爬取百度词条)
这是老师所布置的作业说一下我这里的爬去并非能把百度词条上的内容一字不漏的取下来(而是它分享链接的一个主要内容概括...)(他的主要内容我爬不到也不想去研究大家有好办法可以call me) 例如互 ...
R语言爬虫：爬取百度百科词条
抓取目标:抓取花儿与少年的百度百科中成员信息 url <- "http://baike.baidu.com/item/%E8%8A%B1%E5%84%BF%E4%B8%8E%E5%B0 ...
从0开始学爬虫8使用requests/pymysql和beautifulsoup4爬取维基百科词条链接并存入数据库
从0开始学爬虫8使用requests和beautifulsoup4爬取维基百科词条链接并存入数据库 Python使用requests和beautifulsoup4爬取维基百科词条链接并存入数据库参考 ...
Python开发简单爬虫（二）---爬取百度百科页面数据
一.开发爬虫的步骤 1.确定目标抓取策略: 打开目标页面,通过右键审查元素确定网页的url格式.数据格式.和网页编码形式. ①先看url的格式, F12观察一下链接的形式;② 再看目标文本信息的标签格 ...
爬虫实战(一) 用Python爬取百度百科
最近博主遇到这样一个需求:当用户输入一个词语时,返回这个词语的解释我的第一个想法是做一个数据库,把常用的词语和词语的解释放到数据库里面,当用户查询时直接读取数据库结果但是自己又没有心思做这样一个数 ...
Python爬虫实战之爬取百度贴吧帖子
大家好,上次我们实验了爬取了糗事百科的段子,那么这次我们来尝试一下爬取百度贴吧的帖子.与上一篇不同的是,这次我们需要用到文件的相关操作. 本篇目标对百度贴吧的任意帖子进行抓取指定是否只抓取楼主发帖 ...
Python——爬取百度百科关键词1000个相关网页
Python简单爬虫——爬取百度百科关键词1000个相关网页——标题和简介网站爬虫由浅入深:慢慢来分析: 链接的URL分析: 数据格式: 爬虫基本架构模型: 本爬虫架构: 源代码: # codin ...
【学习笔记】Python 3.6模拟输入并爬取百度前10页密切相关链接
[学习笔记]Python 3.6模拟输入并爬取百度前10页密切相关链接问题描述通过模拟网页,实现百度搜索关键词,然后获得网页中链接的文本,与准备的文本进行比较,如果有相似之处则代表相关链接. me ...

随机推荐

WEB API系列（一）：WEB API的适用场景、第一个实例
在我前一篇博客中已经给各位简单介绍了HTTP协议与RestFul API的关系,以及一些基本的HTTP协议知识,在这些知识的铺垫下,今天,我们一起来讨论一下WEB API的适用场景,然后写我们第一个W ...
TF-IDF 提取关键词
<?php class Document { protected $words; protected $tf_matrix; protected $tfidf_matrix; public fu ...
Git仓库删除大文件
Git仓库删除大文件背景当用Git久了,难免会手误或临时添加一些大文件到仓库中,即使以后添加进了.gitignore,甚至做了git rm,但是Git为了保证版本可回退,history pack里 ...
Pycharm快捷键设置（鼠标滚动控制字体大小）
一.pycharm字体放大的设置 File —> setting —> Keymap —>在搜寻框中输入:increase —> Increase Font Size(双击) ...
leecode第二百三十六题（二叉树的最近公共祖先）
/** * Definition for a binary tree node. * struct TreeNode { * int val; * TreeNode *left; * TreeNode ...
opencv的一些功能代码
opencv调用摄像头 #include<opencv2/opencv.hpp> using namespace cv; void main(){ VideoCapture cap; ca ...
创建springboot项目
springboot 就是为简化spring的创建配置部署运行而创建的. springboot 直接引入依赖jar包就行了,无须配置xml 一创建springboot 1.创建一个mave ...
prometheus监控示例
prometheus架构图 prometheus 各组件介绍 Prometheus Server: 使用pull方式采集监控数据,在该组件上配置监控数据的采集和告警规则. Client Library ...
jQueryEasyUI应用 – datagrid之CRUD应用
本文 jQueryEasyUI + SpringBoot + Mybatis整合Datagrid的CRUD应用一.前言准备 1.我们将使用下面的插件: datagrid:向用户展示列表数据. dia ...
selenium chromedriver geckodriver iedriverserver下载
chromedriver与chrome的的对应版整理: chromedriver版本 chrome版本 v2.9 v31-v34 v2.10 v33-v36 v2.11 v36-v40 v2.12 v ...

python简单爬虫 用beautifulsoup爬取百度百科词条

python简单爬虫 用beautifulsoup爬取百度百科词条的更多相关文章

随机推荐

热门专题

python简单爬虫用beautifulsoup爬取百度百科词条

python简单爬虫用beautifulsoup爬取百度百科词条的更多相关文章