python BeautifulSoup 获取页面多个子节点中的各个节点的内容

页面html格式为

 import httplib

 from BeautifulSoup import BeautifulSoup

 def main():

     f = open('result','a')

     headers = {'Content-Type':'application/x-www-form-urlencoded',

         'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',

         'Accept-Language': 'zh-CN,zh;q=0.8,en-US;q=0.5,en;q=0.3',

         'Accept-Encoding': 'gzip, deflate',

         'Referer': 'http://xxx.xxx.com/admin/userlist',

         'Cookie': 'JSESSIONID=9F6F2D03D2C11400B3D6731E90D73117',

         'User-Agent': 'User-Agent: Mozilla/5.0 (Windows NT 6.1; rv:46.0) Gecko/20100101 Firefox/46.0',

     }

     conn = httplib.HTTPConnection('*.*.*.*', timeout=50)

     for p in range(1,1287):

         print p

         conn.request(method='GET',

                         url="/admin/userlist?toPage=%s&sessionID=" % str(p),

                         headers=headers)

         resp = conn.getresponse()

         html_doc = resp.read()

         mainSoup = BeautifulSoup(html_doc)

         for s in mainSoup.findAll('tr', attrs={'bgcolor':'#7bb5de'}):

             if 'style' not in str(s):

                 continue

             for d in s.findAll('td'):

                 print d.getText(),

                 f.write("%s " % d.getText().encode('utf-8'))   #f.write("%s " % d.getText())==> UnicodeEncodeError: 'ascii' codec can't encode characters in position 0-2: ordinal not in range(128)

             f.write("%s\n" % d.getText().encode('utf-8'))

             print

     f.close()

     conn.close()

 if __name__ == '__main__':

     main()

python BeautifulSoup 获取页面多个子节点中的各个节点的内容的更多相关文章

zTree实现单独选中根节点中第一个节点
zTree实现单独选中根节点中第一个节点 1.实现源码 <!DOCTYPE html> <html> <head> <title>zTree实现基本树& ...
python beautifulsoup获取特定html源码
beautifulsoup 获取特定html源码(无需登录页面) import refrom bs4 import BeautifulSoupimport urllib2 url = 'http:// ...
python中用ElementTree.iterparse()读取xml文件中的多层节点
我在使用Python解析比较大型的xml文件时,为了提高效率,决定使用iterparse()方法,但是发现根据网上的例子:每次if event == 'end':之后elem.clear()或者是每次 ...
python实现剑指offer删除链表中重复的节点
题目描述在一个排序的链表中,存在重复的结点,请删除该链表中重复的结点,重复的结点不保留,返回链表头指针. 例如,链表1->2->3->3->4->4->5 处理后 ...
python之获取页面标签的方法
from urllib.request import urlopen from urllib.error import HTTPError from bs4 import BeautifulSoup ...
python 自动获取（打印）代码中的变量的名字字串
方法一: import inspectimport re def varname(p): for line in inspect.getframeinfo(inspect.currentframe() ...
JS(基础)_总结获取页面中元素和节点的方式
一.前言 1.元素和节点的区别 2.总结获取元素的方式 3.总结获取节点的方式二.主要内容 1.结点和元素的区别 (1)一些常见基本概念: 文档:document 元素:页面中所有的标签结点:页面 ...
python爬虫主要就是五个模块：爬虫启动入口模块，URL管理器存放已经爬虫的URL和待爬虫URL列表，html下载器，html解析器，html输出器同时可以掌握到urllib2的使用、bs4（BeautifulSoup）页面解析器、re正则表达式、urlparse、python基础知识回顾（set集合操作）等相关内容。
本次python爬虫百步百科,里面详细分析了爬虫的步骤,对每一步代码都有详细的注释说明,可通过本案例掌握python爬虫的特点: 1.爬虫调度入口(crawler_main.py) # coding: ...
webAPI(DOM) 2.1 获取页面元素 | 事件1 | 属性操作 | 节点 | 创建元素 | 事件2
js分三个部分: ECMAScript标准:js的基本语法 DOM:Ducument Object Model--->文档对象模型--->操作页面的元素 BOM:Browser Objec ...

随机推荐

SPOJ 694/705 后缀数组
思路: 论文题*n Σn-i-ht[i]+1 就是结果 O(n)搞定~ //By SiriusRen #include <cstdio> #include <cstring> ...
WPF学习（三）－依赖属性
学习WPF时,我在看一本叫做“深入浅出WPF”的书.整整20页都在讲依赖性性和附加属性,反复看了几遍居然还是不懂,真是郁闷. 上一篇中WPF绑定的例子,其实已经用到了依赖属性. // 作为被绑定的目标 ...
navigator.clipboard 浏览器原生剪贴板
浏览器原生剪贴板 navigator.clipboard 写入 navigator.clipboard.writeText navigator.clipboard.writeText('Linr Te ...
利用canvas做一个简单个gif停止和播放
var ImagePlayer = function(options) { this.control = options.control; this.image = options.image; th ...
cg基础
1. row-major or column-major 2.orthogonal matrices 3.why cameras always point along the world coordi ...
ZBrush功能特性之变形
使用ZBrush内置的变形功能可以让用户对三维网格轻松应用扭曲.拉伸.弯曲及其他各种变化.在ZBrush当中,有超过20种的强大变形类型,可以应用于任何轴向.用户只需单击几次即可创造出高级形状,如图所 ...
中级前端工程师要掌握的JavaScript 技巧
1.判断对象的数据类型 2.Es5实现数组map方法 3.使用reduce实现数组map方法 4.ES5 实现数组filter方法 5.使用reduce实现filter方法 6.ES5 实现数组som ...
php>$_SERVER服务的一些常用命令
$_SERVER['REMOTE_ADDR'] //当前用户 IP . $_SERVER['REMOTE_HOST'] //当前用户主机名 $_SERVER['REQUEST_URI'] //UR ...
微信小程序微信支付的一些坑
使用的是Node.js作为后端统一下单: appid:这里的appid是调起微信支付的appid mch_id:商户号,需要注意的是商户号要与appid对应 nonce_str:Math.rando ...
性能测试中的TPS与HPS
性能测试中的TPS与HPS TPS(Transaction per second) 是估算应用系统性能的重要依据.其意义是应用系统每秒钟处理完成的交易数量.一般的,评价系统性能均以每秒钟完成的技术交易 ...

python BeautifulSoup 获取页面多个子节点中的各个节点的内容

python BeautifulSoup 获取页面多个子节点中的各个节点的内容的更多相关文章

随机推荐

热门专题