python3实践-从网站获取数据(Carbon Market Data-GD) （bs4/Beautifulsoup）

结合个人需求，从某个网站获取一些数据，发现网页链接是隐藏的，需要通过浏览器看后面的代码来获取真实的链接。

下面这个案例，直接是从真实的链接中爬去数据。

此外，发现用pandas的read_html不能直接解析“lxml”的表格，有待后续研究。

另外，爬去的数据发现有很多空格符号，主要是 "\r"、"\n"、"\t"，

字符串的去除 "\r"、"\n"、"\t" 的方法也一并添加在这个案例中。

具体代码如下：

 # Code based on Python 3.x

 # _*_ coding: utf-8 _*_

 # __Author: "LEMON"

 from bs4 import BeautifulSoup

 import requests

 import csv

 url2 = 'http://ets.cnemission.com/carbon/portalIndex/markethistory?Top=1'

 req = requests.get(url2)

 # soup = BeautifulSoup(req.content, 'html5lib')

 soup = BeautifulSoup(req.content, 'lxml')

 # 用“lxml”解析，可以获得数据，但csv文件中每行有空行

 table = soup.table

 trs = table.find_all('tr')

 list1 = []

 for tr in trs:

     td = tr.find_all('td')

     # 去除每个单元格数据后面的"\r"和"\n"和"\t"，

     # 下面两种方法都可以生成csv文件，

     # 但method1生成的csv文件较小，应该是优化性能较好，暂时不明白其中原理

     # method1

     row = [i.text.replace('\r', '').replace('\n', '').replace('\t', '') for i in td]

     # method 2

     # row = [i.text.replace('\r\n\t', '') for i in td]

     list1.append(row)

 with open('MktDataGuangdong.csv', 'a', errors='ignore', newline='') as f:

     f_csv = csv.writer(f)

     f_csv.writerows(list1)

python3实践-从网站获取数据(Carbon Market Data-GD) （bs4/Beautifulsoup）的更多相关文章

python3实践-从网站获取数据(Carbon Market Data-BJ) （pandas，bs4）
自己边看边实践一些简单的实际应用,下面的程序是从某个网站上获取需要的数据. 在编写的过程中,通过学习陆续了解到一些方法,发现Python真的是很便捷. 尤其是用pandas获取网页中的表格数据,真的是 ...
Python Socket请求网站获取数据
Python Socket请求网站获取数据 ---阻塞 I/O ->收快递,快递如果不到,就干不了其他的活 ---非阻塞I/0 ->收快递,不断的去问,有没有送到,有没有送到,. ...
ASP.NET Web API实践系列07,获取数据, 使用Ninject实现依赖倒置,使用Knockout实现页面元素和视图模型的双向绑定
本篇接着上一篇"ASP.NET Web API实践系列06, 在ASP.NET MVC 4 基础上增加使用ASP.NET WEB API",尝试获取数据. 在Models文件夹下创 ...
CTreeItem保存和获取数据
保存数据: std::string val = "test data"; CString* pNodeData = new CString; *pNodeData = val.c_ ...
《大型网站系统与JAVA中间件实践》读书笔记-数据访问层
数据访问层 5.1.2数据库垂直/水平拆分的困难随着网站业务的快速发展,数据量和访问量不断上升,数据库的压力越来越大. 更换更好的硬件(Scale Up)是一种解决方案,而且在我们能付得起硬件费用并 ...
Python3爬取王者官方网站英雄数据
爬取王者官方网站英雄数据众所周知,王者荣耀已经成为众多人们喜爱的一款休闲娱乐手游,今天就利用python3 爬虫技术爬取官方网站上的几十个英雄的资料,包括官方给出的人物定位,英雄名称,技能名称,CD ...
Python3.x：定时获取页面数据存入数据库
Python3.x:定时获取页面数据存入数据库 #间隔五分钟采集一次数据入库 import pymysql import urllib.request from bs4 import Beautifu ...
HttpWebRequest 模拟网站登录获取数据
此文档仅仅是一个BaseCode,已做后续查阅项目使用IBM Platform Symphony分布式平台,所有业务处理都在这个分布式平台上计算,需求是获取这些计算机机群的运行状态,和每一个服务的的 ...
winpcap编程设置过滤器之指定获取某个网站的数据
下面,我将以乱世隋唐页游为例,通过编码获取这里面的数据. 游戏图: 我是乱世隋唐的网址是:www.917st.com 这个是官网网址的服务器地址. 42.62.0.14 我玩的游戏服是84区.网 ...

随机推荐

linux命令查看服务器的型号、序列号、内存插槽数（转）
1,查看服务器型号.序列号: dmidecode|grep "System Information" -A9|egrep "Manufacturer|Product|S ...
【BZOJ】1031 [JSOI2007]字符加密Cipher
[算法]后缀数组 [题解]把数组复制一遍然后SA处理即可. 后缀数组 #include<cstdio> #include<algorithm> #include<cstr ...
静态资源（JS/CSS）存储在localStorage
一.简单了解SEO SEO由英文Search Engine Optimization缩写而来, 中文意译为“搜索引擎优化”.SEO是指从自然搜索结果获得网站流量的技术和过程. 搜索引擎不优化的网站分为 ...
边绘边理解prototype跟__proto__
网上流传着一张讲解prototype跟__proto__关系的图,尽管他已经描绘的很清楚了,但对于初学者来说,江太公感觉还是过于纠结,于是起心重绘,让他们之间的关系更加明晰可理解,一方面出于分享目的, ...
Ubuntu 修改IP地址
Ubuntu 修改IP地址1.ubuntu系统修改IP地址:sudo vim /etc/network/interfacesauto eth0iface eth0 inet staticaddress ...
Django【设计】settings方案
配置文件: 目标:配置文件,默认配置和手动配置分开,参考django的配置文件方案,默认配置文件放在内部,只让用户做常用配置 /bin/settings.py(手动配置) PLUGIN_ITE ...
vue路由-编程式导航
除了使用 <router-link> 创建 a 标签来定义导航链接,我们还可以借助 router 的实例方法,通过编写代码来实现. router.push(location, onComp ...
比 file_get_contents() 更优的 cURL 详解（附实例）
PHP 可以使用 file_get_content() 函数抓取网页内容,但却无法进行更复杂的处理,譬如文件的上传或下载. Cookie 操作等等.而 cURL 提供了这些功能. 一.cURL简介在 ...
移动端测试===Android内存管理: 理解App的PSS
Android内存管理: 理解App的PSS 原文链接:http://www.littleeye.co/blog/2013/06/11/android-memory-management-unders ...
linux和ubuntu防火墙相关命令
1.永久有效开启: chkconfig iptables on 关闭: chkconfig iptables off 2.即刻生效开启: service iptables start 关闭: se ...

python3实践-从网站获取数据(Carbon Market Data-GD) （bs4/Beautifulsoup）

python3实践-从网站获取数据(Carbon Market Data-GD) （bs4/Beautifulsoup）的更多相关文章

随机推荐

热门专题