python第一个爬虫的例子抓取数据到mysql，实测有数据

python3.5

先安装库或者扩展

1 requests第三方扩展库

pip3 install requests

2 pymysql

pip3 install pymysql

3 lxml

pip3 install lxml

4 贴个代码

#!/usr/bin/env python

# coding=utf-8

import requests

from bs4 import BeautifulSoup

import pymysql

print('连接到mysql服务器...')

db = pymysql.connect("localhost","root","root","python")

print('连接上了!')

cursor = db.cursor()

cursor.execute("DROP TABLE IF EXISTS COLOR")

sql = """CREATE TABLE COLOR (

        Color CHAR(20) NOT NULL,

        Value CHAR(10),

        Style CHAR(50) )"""

cursor.execute(sql)

hdrs = {'User-Agent':'Mozilla/5.0 (X11; Fedora; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko)'}

url = "http://html-color-codes.info/color-names/"

r = requests.get(url, headers = hdrs)

soup = BeautifulSoup(r.content.decode('gbk', 'ignore'), 'lxml')

trs = soup.find_all('tr')   # 获取全部tr标签成为一个列表

for tr in trs:              # 遍历列表里所有的tr标签单项

    style = tr.get('style') # 获取每个tr标签里的属性style

    tds = tr.find_all('td') # 将每个tr标签下的td标签获取为列表

    td = [x for x in tds]   # 获取的列表

    name = td[1].text.strip()       # 直接从列表里取值

    hex = td[2].text.strip()

    # print u'颜色: ' + name + u'颜色值: '+ hex + u'背景色样式: ' + style

    # print 'color: ' + name + '\tvalue: '+ hex + '\tstyle: ' + style

    insert_color = ("INSERT INTO COLOR(Color,Value,Style)" "VALUES(%s,%s,%s)")

    data_color = (name, hex, style)

    cursor.execute(insert_color, data_color)

    db.commit()

    # print '******完成此条插入!'

print ('爬取数据并插入mysql数据库完成...')

5 运行这个代码 ptyhon demo3.py

6 看看运行的结果

7 数据库里面看看结果

支持完成，成功，等会抓个别的例子练练手

python第一个爬虫的例子抓取数据到mysql，实测有数据的更多相关文章

python写的爬虫工具，抓取行政村的信息并写入到hbase里
python的版本是2.7.10,使用了两个第三方模块bs4和happybase,可以通过pip直接安装. 1.logger利用python自带的logging模块配置了一个简单的日志输出 2.get ...
读书笔记--用Python写网络爬虫02--数据抓取
抓取(scraping)---爬虫从网页中抽取一些数据用以实现某些用途. 三种抽取网页数据的方法:正则表达式.Beautiful Soup和lxml. 2.1 分析网页通过浏览器自带选项,查看网页源 ...
第三百四十一节，Python分布式爬虫打造搜索引擎Scrapy精讲—编写spiders爬虫文件循环抓取内容—meta属性返回指定值给回调函数—Scrapy内置图片下载器
第三百四十一节,Python分布式爬虫打造搜索引擎Scrapy精讲—编写spiders爬虫文件循环抓取内容—meta属性返回指定值给回调函数—Scrapy内置图片下载器编写spiders爬虫文件循环 ...
二十 Python分布式爬虫打造搜索引擎Scrapy精讲—编写spiders爬虫文件循环抓取内容—meta属性返回指定值给回调函数—Scrapy内置图片下载器
编写spiders爬虫文件循环抓取内容 Request()方法,将指定的url地址添加到下载器下载页面,两个必须参数, 参数: url='url' callback=页面处理函数使用时需要yield ...
如何让Python爬虫一天抓取100万张网页
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: 王平源自:猿人学Python PS:如有需要Python学习资料的 ...
python3.4学习笔记(十七) 网络爬虫使用Beautifulsoup4抓取内容
python3.4学习笔记(十七) 网络爬虫使用Beautifulsoup4抓取内容 Beautiful Soup 是用Python写的一个HTML/XML的解析器,它可以很好的处理不规范标记并生成剖 ...
[python]初试页面抓取——抓取沪深股市交易龙虎榜数据
[python]抓取沪深股市交易龙虎榜数据 python 3.5.0下运行没做自动建立files文件夹,需要手动在py文件目录下建立files文件夹后运行 #coding=utf-8 import ...
爬虫 - 动态分页抓取游民星空的资讯 - bs4
# coding=utf-8 # !/usr/bin/env python ''' author: dangxusheng desc : 动态分页抓取游民星空的资讯 date : 2018-08- ...
python实现一个栏目的分页抓取列表页抓取
python实现一个栏目的分页抓取列表页抓取 #!/usr/bin/env python # coding=utf-8 import requests from bs4 import Beautifu ...

随机推荐

Python 实现画一个小猪佩奇
===================================== 看到佩奇的广告片刷红,为了迎接猪年,咱们也来用Python 画板实现一个效果吧 from turtle import* ...
SQL Server常用SQL集合
================================================ 1.SQL查询一年之内的数据记录 select * from 表名 where CreateDate& ...
相邻行列相互影响的状态类问题（类似状压dp的搜索）（POJ3279）
POJ3279http://poj.org/problem?id=3279 题意:黑白的板,每次选择一个十字形翻转(十字板内黑白互换,若是边界则不管),求最小将原图变为全白的策略. 这是一道对于每个格 ...
hdu 5183 hash表
BC # 32 1002 题意:给出一个数组 a 和一个数 K ,问是否存在数对( i , j ),使 a i - a i + 1 +……+ (-1)j - i a j : 对于这道题,一开始就 ...
浏览器通过http协议通过nginx访问ftp服务器上的文件
1.修改nginx配置文件 2.修改nginx默认目录为ftp默认目录 3.修改成自定义路径后,并修改此目录第一行,修改为root或是nginx用户 4.重新加载 cd /usr/local/ngin ...
通过torodb && hasura graphql 让mongodb 快速支持graphql api
torodb 可以方便的将mongo 数据实时同步到pg,hasura graphql 可以方便的将pg 数据暴露为graphql api,集成在一起真的很方便环境准备 docker-compose ...
streamsets 集成 minio s3测试
具体streamsets crate 集成可以参考 streamsets crate 以下文档只关注minio 集成的配置 minio 服务搭建具体搭建参考: https://www.cnblog ...
无法对数据库'XXXXX' 执行删除，因为它正用于复制
无法对数据库'XXXXX' 执行删除,因为它正用于复制. (.Net SqlClient Data Provider) 使用以下方式一般可以解决 sp_removedbreplication 'X ...
smarty学习——变量调节器（过滤器）
变量调节器用于变量,自定义函数和字符串. 请使用 | 符号和调节器名称应用调节器.变量调节器由赋予的参数值决定其行为.参数由:符号分开. 比如进行大写转换的: upper demo: <br&g ...
winform 子窗体刷新父窗体的数据
建一个接口比如 iMainForm接口内声明个方法比如 Refresh()主窗体实现这个接口主窗体打开子窗体时这样写子窗体.Owner = this;子窗体.ShowDialog(); -- ...

python第一个爬虫的例子抓取数据到mysql，实测有数据

python第一个爬虫的例子抓取数据到mysql，实测有数据的更多相关文章

随机推荐

热门专题