Python获取Origin官网视频

程序说明：最近学习origin，看到官网有入门视频（http://www.originlab.com/index.aspx?go=SUPPORT/VideoTutorials），看着挺多的，就用python写了个简单的爬虫程序，把origin的这些视频下载下来了。利用了requests和bs4解析html，利用re.match方法匹配获取相关连接，最后下载。程序代码没有进行进一步整理，看着有些乱。

#!/usr/bin/python

# -*- coding:utf-8 -*-

"""

Created on Sun Dec 12 14:21:15 2015

Notes: Downloading turtorial vedios from Origin support.

@author: zhigang

"""

import requests

from bs4 import BeautifulSoup as bs

import re

import urllib

def download_url(url,outdir):

    print('Resolving.....from '+url+'....')

    import os.path

    if not os.path.exists(outdir):os.mkdir(outdir)

    response = requests.get(url)

    soup = bs(response.text,"lxml")

    all_links = []

    all_names = []    

    for x in soup.findAll("a"):

            #通配符匹配获得想要的文件名保存到list中

       if "href" in x.attrs.keys():

           if re.match('.*VideoTutorials&pid.*',x['href']):

               information = [x['href'],x.string]

               cur_url = 'http://www.originlab.com/'+information[0]

               res_new = requests.get(cur_url)

               soup_new = bs(res_new.text,"lxml")

               for new_alink in soup_new.findAll('a'):

                   if 'href' in new_alink.attrs.keys():

                       if re.match('.*mp4',new_alink['href']):

                           all_links.append(new_alink['href'])

                           all_names.append(information[1]+'.mp4')

    #start downloads

    print(str(len(all_links))+' tasks found. Started downloading...')

    for (i,link) in enumerate(all_links):

        print(str(i)+' : '+all_names[i]+'\t url: '+link)

        urllib.request.urlretrieve(link,outdir+'\\'+all_names[i])

        print(str(i)+' : '+link+'\t completed...')

    print('All tasks completed.')

if __name__=='__main__':

    url = 'http://www.originlab.com/index.aspx?go=SUPPORT/VideoTutorials'

    outdir = r'D:\Origin_turtorials'

    download_url(url,outdir)

Python获取Origin官网视频的更多相关文章

Python第三方库官网
Python第三方库官网 https://pypi.python.org/pypi 包下载后的处理: 下载后放到Python的scripts文件夹中(D:\Python3.5\Scripts),用cm ...
RPA UiPath 官网视频
RPA UiPath 官网视频相关学习有一些官网的截图翻译,本来打算把考试题也整理出来,结果没整,另附官网视频 RPA的好处: 广泛的自动化:跨越越来越多的行业,RPA加速在银行和金融,保险,医疗 ...
Python访问Amazon官网异常
使用Python访问亚马逊(Amazon)官网,如果没有将headers更改为浏览器的信息, 有几率会触发:检测到当前可能是自动程序,需要输入验证码: 将header修改成浏览器后,需要等一段时间或者 ...
ajax的post请求获取kfc官网数据
# _*_ coding : utf-8 _*_# @Time : 2021/11/2 13:45# @Author : 秋泊酱 # 1页 # http://www.kfc.com.cn/kfccda ...
python爬虫 beutifulsoup4_1官网介绍
http://www.crummy.com/software/BeautifulSoup/bs4/doc/ Beautiful Soup Documentation Beautiful Soup is ...
python 爬虫 scrapy1_官网教程
Python爬虫视频教程零基础小白到scrapy爬虫高手-轻松入门 https://item.taobao.com/item.htm?spm=a1z38n.10677092.0.0.482434a6E ...
python常用包官网
Pandas http://pandas.pydata.org/pandas-docs/stable/reference/api/pandas.Series.reset_index.html?high ...
#使用parser获取图片信息,输出Python官网发布的会议时间、名称和地点。
# !/usr/bin/env/Python3 # - * - coding: utf-8 - * - from html.parser import HTMLParser import urllib ...
Python自学笔记-生成器（来自廖雪峰的官网Python3）
感觉廖雪峰的官网http://www.liaoxuefeng.com/里面的教程不错,所以学习一下,把需要复习的摘抄一下. 以下内容主要为了自己复习用,详细内容请登录廖雪峰的官网查看. 生成器通过列 ...

随机推荐

CSS样式的优先级
1.相同权值情况下,CSS样式的优先级总结来说,就是--就近原则(离被设置元素越近优先级别越高): 内联样式表(标签内部)> 嵌入样式表(当前文件中)> 外部样式表(外部文件中). 2.权 ...
[BZOJ 3888] [Usaco2015 Jan] Stampede 【线段树】
题目链接:BZOJ - 3888 题目分析首先,计算出每个线段在 x 坐标 0 处出现的时间开始点和结束点,就转成了时间轴上的线段. 然后就是看每条线段是否被 y 比它小的线段完全覆盖了.注意求出的 ...
【Itext】解决Itext5大并发大数据量下输出PDF发生内存溢出outofmemery异常
尼玛,这个问题干扰了我两个星期!! 关键字 itext5 outofmemery 内存溢出大数据高并发多线程 pdf 导出报表 itext 并发在读<<iText in Acti ...
Supporting Multiple Screens 翻译支持各种屏幕（上）
Supporting Multiple Screens 支持各种各样的屏幕尺寸.屏幕密度 Android runs on a variety of devices that offer differe ...
BZOJ1669: [Usaco2006 Oct]Hungry Cows饥饿的奶牛
1669: [Usaco2006 Oct]Hungry Cows饥饿的奶牛 Time Limit: 5 Sec Memory Limit: 64 MBSubmit: 665 Solved: 419 ...
踩过的坑之-----selector
打算踏踏实实的做技术了,以前总是毛毛躁躁的将代码粘贴复制完事能跑起来就行.最近慢慢感觉这样真的对自己的时间和经历是一种浪费. 就从最基本的做起吧,今天做了一个selector,在按钮上面添加效果, & ...
Apache Mesos_百度百科
Apache Mesos_百度百科 Apache Mesos
简单粗暴地理解 JavaScript 原型链
尼玛!你特么也是够了! Don’t BB! Show me the code! function Person (name) { this.name = name; } function Mother ...
top N彻底解秘
本博文内容: 1.基础Top N算法实战 2.分组Top N算法实战 3.排序算法RangePartitioner内幕解密 1.基础Top N算法实战 Top N是排序,Take是直接拿出几个元素,没 ...
SQL第二课-创建数据表
查看有多少数据库 SHOW DATABASES; 进入数据库:USE <数据库名> 举例:USE test;//进入test数据库查看当前进入的是哪个数据库 SELECT DATABAS ...

Python获取Origin官网视频

Python获取Origin官网视频的更多相关文章

随机推荐

热门专题