BeautifulSoup抓取列表页锚文本

素闻BeautifulSoup提取效率低，艾玛，第一印象果然是很要命的，反正比Re 和 Lxml 是要慢的，不过就无奈Re的正则折腾来折腾去，没写出来，Lxml 的 Xpath 又用得不好。

不过就这三个模版来看，BeautifulSoup的表现还是不错的，够简单，顺便测试了一下时间，抓10个列表页花不了1分钟，当然我是菜鸟，没事不会纠结终结速度。

核心就是这部分，用 Find_all 和 Find 都搞了半天不成功，最后用CSS提取搞定，也怪我太着急。

用Find比较麻烦，一层层的Class找，多次索引效率肯定不能保证

用Urllib2 或者 Pycurl 抓都可以

key_list = open('title.txt','a+')

for page in xrange(0,101):　　＃要抓的列表数量

    url = 'http://www.xxx.net/wangwen/list_205_%s.html' % page

    soup = bs(gethtml(url,headers),"lxml")

    for i in soup.select('.thread_list a'):　　＃这句是核心，CSS组合查找，找到.thread_list 下的 a 标签

        i = i.text.encode('utf-8')　　＃提取a标签内的文笔内容，也就是锚文本 <a href="http://aaa.com">我是锚文本</a> 此时代码编译为utf-8

        key_list.write(i + '\n')

        print i,ctime()　　#装B的写了ctime看时间，其实没啥米鸟用

        time.sleep(3)

key_list.close()

import pycurl,StringIO,json,time,re,sys

from time import ctime

from lxml import etree

from bs4 import BeautifulSoup as bs

reload(sys)

sys.setdefaultencoding('utf-8')　　#设定系统默认编码，Windows设置gbk呗，没这句容易出错

BeautifulSoup抓取列表页锚文本的更多相关文章

python实现一个栏目的分页抓取列表页抓取
python实现一个栏目的分页抓取列表页抓取 #!/usr/bin/env python # coding=utf-8 import requests from bs4 import Beautifu ...
控制台js常用解决方案，字符串替换和抓取列表页链接
抓取列表页链接由于测试站没有jquery所以,我用了原生的js var obj = document.getElementsByClassName('class1'); for(let i = 0; ...
利用BeautifulSoup抓取新浪网页新闻的内容
第一次写的小爬虫,python确实功能很强大,二十来行的代码抓取内容并存储为一个txt文本直接上代码 #coding = 'utf-8' import requests from bs4 impor ...
使用selenium+BeautifulSoup 抓取京东商城手机信息
1.准备工作: chromedriver 传送门:国内:http://npm.taobao.org/mirrors/chromedriver/ vpn: selenium BeautifulSo ...
python3用BeautifulSoup抓取id='xiaodeng',且正则包含‘elsie’的标签
# -*- coding:utf-8 -*- #python 2.7 #XiaoDeng #http://tieba.baidu.com/p/2460150866 #使用多个指定名字的参数可以同时过滤 ...
python3用BeautifulSoup抓取a标签
# -*- coding:utf-8 -*- #python 2.7 #XiaoDeng #http://tieba.baidu.com/p/2460150866 from bs4 import Be ...
一、使用 BeautifulSoup抓取网页信息信息
一.解析网页信息 from bs4 import BeautifulSoup with open('C:/Users/michael/Desktop/Plan-for-combating-master ...
python3用BeautifulSoup抓取div标签
# -*- coding:utf-8 -*- #python 2.7 #XiaoDeng #http://tieba.baidu.com/p/2460150866 #标签操作 from bs4 imp ...
爬虫初体验：Python+Requests+BeautifulSoup抓取广播剧
可以看到一个DIV下放一个广播剧的信息,包括名称和地址,第一步我们先收集所有广播剧的收听地址: # 用requests的get方法访问novel_list_resp = requests.get(&q ...

随机推荐

WebAPI的压缩
看见老外写了一篇ASP.NET Web API GZip compression ActionFilter with 8 lines of code 说实话被这标题吸引了,8行代码实现GZip压缩过滤 ...
讲解——Trie树（字典树）
Trie树(字典树) 一.引入字典是干啥的?查找字的. 字典树自然也是起查找作用的.查找的是啥?单词. 看以下几个题: 1.给出n个单词和m个询问,每次询问一个单词,回答这个单词是否在单 ...
微信小程序前置课程：flex布局（二）
原文:http://www.ruanyifeng.com/blog/2015/07/flex-examples.html 上一篇文章介绍了Flex布局的语法,今天介绍常见布局的Flex写法. 你会看到 ...
CentOS6.5自带Python2.6.6升级至Python2.7
CentOS6.5中Python2.6升级到Python2.7 由于Python开发团队已不再支持2.6版本,且该版本对一些软件不支持,因此将2.6升级到2.7. 1.安装Python2.7: 下载源 ...
记JavaScript的入门学习（三）
2016.12.6晚上十点半完成JavaScript的第二章学习,看了点第三章的开头总述,都说原生js每一个知识点都可以分分钟钟让你放弃,而我在努力探索着.月末的时候就回家放假了,希望在家也可以有个小 ...
android下拉刷新控件 android-pulltorefresh
运行效果: 介绍:ListView.ViewPager.WevView.ExpandableListView.GridView.(Horizontal)ScrollView.Fragment上下左右拉 ...
moodle笔记之-数据库操作
<?php require_once('../config.php'); // config.php under root folder require_once($CFG->dirroo ...
Linq to Sql 左连接查询
var query = from t0 in context.ExpressSendMaster join t1 in context.Supplier on t0.SupplierCode equa ...
Java代理模式汇总
简介代理模式即Proxy Pattern,23种java常用设计模式之一.其定义为:对其他对象提供一种代理以控制对这个对象的访问. UML类图静态代理目标接口 public interface ...
Mysq 5.7l服务无法启动，没有报告任何错误
昨天系统崩溃了,然后重装了Mysql 5.7 安装步骤和遇到问题及解决方案. 去官网下载Mysql 5.7的解压包(zip),解压到你要安装的目录. 我的安装目录是:D:\Java\Mysql 安装步 ...

BeautifulSoup抓取列表页锚文本

BeautifulSoup抓取列表页锚文本的更多相关文章

随机推荐

热门专题