PP视频(PPTV聚力)web接口分析
前言
前几天我想看一个番剧, 正好搜索到了 PP视频,我才知道PP视频就是PPTV聚力,我想把番剧下载下来,结果发现视频竟然不是m3u8格式,而是多段mp4,所以简单的写了个脚本,可以在不登录的情况下直接下载vip和付费视频蓝光画质(只能说明这个视频网站做的不行)
开始分析
经过调试我首先得到了视频地址的url
https://10314.vcdn.pplive.cn/0/0/1/2de8f8694a79c437a11b09941fb1cb0a.mp4?h5vod.ver=2.1.3&k=0b6a74e50374776203bd05d55a090fba-e800-1588284812&type=mhpptv
当然,我当时拿到的url 是很长的一段还有其他参数,但是我发现那些参数都是无用的影响访问的参数只有这几个
h5vod.ver : 固定值
type : 固定值
k : 变值
说明 k 是一个接口得到的, 所以我需要找到对应的接口就可以了
但是现在还有一个问题就是 这个只是视频的一段, 其他视频分段地址又是什么样的呢?
经过我反复调试发现 url 中的
https://10314.vcdn.pplive.cn/a/b/c/
(对应位置我用字母来代替数字了,为了描述方便)
a 为分段视频的第几段
b 默认为0 就可以(具体表示什么不清楚,但是瞎填肯定是不行的)
c 这个数字可以随意瞎填,因为后台解析没用到这个参数,但是要有这个参数
a 为 0 为第一段视频, a 为 1 为第二段视频
所以接下来的问题就是找到那个接口了
经过调试发现了一个接口
https://web-play.pptv.com/webplay3-0-12407631.xml?o=0&version=6&type=mhpptv&appid=pptv.web.h5&appplt=web&appver=4.0.7&cb=a
这个接口参数只有一个变量 那就是12407631,也就是id,每一集都有唯一的 id ,而这个id 我们也可以通过访问对应视频播放界面的url后返回的html源码中查看到
返回的不只是一集,而是全剧的每一集id都可以通过一个url来获取到
那么我们来看看 这个接口返回了哪些内容
几种画质的 mp4,知道这些那么我们还查一个 k参数就可以构造视频的url了
经过我查找发现了k值, 一个视频的一种清晰度对应唯一一个k值
这里用了url编码看起来乱七八糟,用python解码一下
from urllib.parse import unquote
print(unquote("4e6a8848fb388e09708a132bf4caeb4e-5775-1588285899%26bppcataid%3D17"))
输出:
4e6a8848fb388e09708a132bf4caeb4e-5775-1588285899&bppcataid=17
可以看到 & 符号前面的就是k ,所以到时候我们可以用& 进行分割然后取 k
到此看起来问题全部解决了我们也可以构造视频url 了,但是还有一个问题, 那就是视频到底分多少段我们还不知道, 毕竟我们不能遍历去访问直到访问不到数据(那样太傻了)
其实接口里面也存在这样的数据了
画质下面mp4 字段 childNodes 是一个列表,这个列表的长度减1 就是不同画质的分段数, 减1 是因为最后一个元素是别的内容不是描述视频分段信息的, 不得不说这个接口返回的数据构造的真是及其混乱, 我解析的时候都费了很大劲!
到此问题全部解决
代码实现
import requests
import re
import json
import os
from threading import Thread
import sys
import time
requests.packages.urllib3.disable_warnings()
def progress():
width=30
while True:
global all_num
global now_num
percent = now_num/all_num * 100
left = int(width * percent // 100)
right = width - left
print('\r[', '#' * left, ' ' * right, ']',f' {percent:.0f}%',sep='', end='', flush=True)
if all_num == now_num:
break
time.sleep(1)
def hecheng(sh,path):
# 判断是否只是一段视频
if len(os.listdir(path)) <= 2:
os.remove(path+os.sep+"1.txt")
else:
os.system(sh)
for i in os.listdir(path):
if i != 'output.mp4':
os.remove(path+os.sep+i)
def download(url,id_,name):
global now_num
data = requests.get(url,headers={"Range": "bytes=0-"},stream=True).content
with open(name+os.sep+str(id_)+'.mp4','wb') as f:
f.write(data)
now_num += 1
def api_get(id_):
global all_num
global now_num
all_num = 0
now_num = 0
api_url = f"https://web-play.pptv.com/webplay3-0-{id_}.xml?o=0&version=6&type=mhpptv&appid=pptv.web.h5&appplt=web&appver=4.0.7&cb=a"
s = requests.get(api_url,verify=False,headers=headers)
data = json.loads(s.text[2:-4])
try:
name = data['childNodes'][2]['nm']
except Exception:
name = data['childNodes'][0]['nm']
print("正在下载:"+name)
rid = data['childNodes'][-4]['rid']
all_num = len(data['childNodes'][-4]['childNodes']) -1
kk = data['childNodes'][-5]['childNodes'][-1]['childNodes'][0].split('%26')[0]
if not os.path.exists(name):
os.makedirs(name)
# 合成命令
a1 = os.path.abspath(name+os.sep+'1.txt')
a2 = os.path.abspath(name+os.sep+'output.mp4')
sh = f'ffmpeg -f concat -safe 0 -i "{a1}" -c copy "{a2}" -loglevel error'
path = os.path.dirname(a1)
# 启动进度条线程
progress_t = Thread(target=progress)
progress_t.start()
t_list = []
t_list.append(progress_t)
f = open(name+os.sep+'1.txt','w')
for i in range(all_num):
video_url = f"https://10314.vcdn.pplive.cn/{i}/0/1/{rid}?h5vod.ver=2.1.3&k={kk}&type=mhpptv"
f.write("file "+ os.path.abspath(name+os.sep+f'{i}.mp4')+"\n")
t = Thread(target=download,args=(video_url,i,name))
t_list.append(t)
t.start()
if not mul_t:
t.join()
f.close()
for t in t_list:
t.join()
# print(sh)
print("\n"+name+" 正在合成...")
hecheng(sh,path)
print(name+" 合并成功")
def start(url,is_all,s,e,mul_t):
response = requests.get(url,verify=False,headers=headers)
if response.status_code == 200:
result = re.findall("var webcfg = (.*?);",response.text)
data = json.loads(result[0])
if is_all:
# 下载剧集
try:
for item in data['playList']['data']['list'][s-1:e]:
api_get(item['id'])
except Exception:
for item in data['playList']['data']['list']:
api_get(item['id'])
else:
# 下载单集
api_get(data['id'])
if __name__ == "__main__":
all_num = 0
now_num = 0
headers = {
"User-Agent": "Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.149 Safari/537.36"
}
url = input("输入地址:")
is_all = input("是否下载全剧(默认否):")
if is_all:
r = input("请输入下载剧集(例如1-5,默认全部):")
if r:
s,e = r.split("-")
s = int(s)
if e:
e = int(e)
else:
e = None
else:
s = None
e = None
mul_t = input("是否启用多线程下载(默认否):")
start(url,is_all,s,e,mul_t)
也是做了一个简单的命令行工具,功能有
- 通过一次输入可以下载全集的蓝光画质视频
- 下载vip 视频
- 下载付费视频
- 下载完分段视频自动调用 ffmpeg 命令进行合成
- 选择性 下载 m-n 集视频
- 多线程下载(下载电影时候最好不要开启)
使用方法: 视频播放界面的url输入进去,然后回车, 剩下的参数不写直接回车相当于默认
, 随意写什么相当与是
其他注意 : windows 使用调用 ffmpeg先要把其加入系统环境变量里面,另外 第 81 行代码应改为
f.write("file "+ (os.path.abspath(name+os.sep+f'{i}.mp4')+"\n").replace("\\","\\\\"))
这个主要是windows 脑残的文件路径问题
PP视频(PPTV聚力)web接口分析的更多相关文章
- TensorFlow.训练_资料(有视频)
ZC:自己训练 的文章 貌似 能度娘出来很多,得 自己弄过才知道哪些个是坑 哪些个好用...(在CSDN文章的右侧 也有列出很多相关的文章链接)(貌似 度娘的关键字是"TensorFlow ...
- 使用you-get下载视频网站视频或其他
使用you-get下载视频网站视频或其他 文/玄魂 目录 使用you-get下载视频网站视频或其他 前言 1.1 下载.安装 依赖 exe安装 pip安装 Antigen安装 Git 克隆源码 Hom ...
- You-Get 一键下载全网视频资源
下载视频 无论是单纯的下载视频收藏,还是以便离线收看,都离不开“下载”,好的工具让你把注意力更好的放在视频的本身,而不用考虑要如何下载视频.下载视频从来不乏方法,之前也介绍了下载 Youtube ...
- 如何下载哔哩哔哩、爱奇艺、腾讯视频、优酷、斗鱼、TED、YouTube网页视频
这里使用you-get工具进行下载 github地址:https://github.com/soimort/you-get/ github项目文档:https://github.com/soimort ...
- pptv泥够了!pptv“关闭”事件为营销炒作坐实!
昨天还让人心生怜悯的pptv聚力,今天下午2点07分又再一次发布微博,而几天发布的内容是see U again!再次证实了pptv昨天的“关闭”还是“倒闭”消息为营销炒作.不过马浩周要问了,真的要这么 ...
- 2016中国APP分类排行榜参选入围产品公示
2016中国APP分类排行榜参选入围产品公示 由中国科学院<互联网周刊>.中国社会科学院信息化研究中心.eNet硅谷动力共同主办的2016中国APP分类排行榜发布暨颁奖晚宴即将举行.此 ...
- you-get中文说明
来源于:https://github.com/soimort/you-get/wiki/%E4%B8%AD%E6%96%87%E8%AF%B4%E6%98%8E You-Get 乃一小小哒命令行程序, ...
- OpenWrt 路由器过滤广告的N种方法
路由器已经成为每个家庭不可缺少的角色,手机.电脑.电视,凡是需要互联网的设备都要用到它.那么路由器除了给我们的网络设备分发网络外,还有其他用途吗? 现在很多人家里都用着智能路由器,智能路由器究竟怎么智 ...
- 发现一个直播录制工具you-get
地址:https://github.com/soimort/you-get 截至到今天,支持的平台如下: Site URL Videos? Images? Audios? YouTube https: ...
- 融云SDK触达用户数破20亿 王者风范双倍展现
11月1日,融云SDK触达用户数突破20亿,业务增长速度及用户覆盖量再创即时通讯云领域新高.自去年11月10日公布SDK触达用户数破10亿以来,融云仅用了一年时间,便取得了触达用户数翻倍的成绩,迅猛的 ...
随机推荐
- Shell分析日志文件
文章转载自:https://mp.weixin.qq.com/s/o63aIM2p9rc2OjhxiC6wgA 1.查看有多少个IP访问: awk '{print $1}' log_file|sort ...
- Linux下从零开始创建lvm虚拟磁盘阵列+脚本化解决方案
逻辑卷管理器(英语:Logical Volume Manager,缩写为LVM),又译为逻辑卷宗管理器.逻辑扇区管理器.逻辑磁盘管理器,是Linux核心所提供的逻辑卷管理(Logical volume ...
- CentOS7使用tar方式安装Containerd,配置文件介绍
主机:centos 7.9 下载 官网GitHub上下载地址:https://github.com/containerd/containerd/releases 问题: 创建容器后,运行的时候报错: ...
- Beats:运用 Filebeat 来对微服务 API 进行分析
文章转载自:https://elasticstack.blog.csdn.net/article/details/118145104 需要学习的是httpjson请求的写法 使用 Filebeat 的 ...
- 15. Fluentd输入插件:in_tail用法详解
in_tail输入插件内置于Fluentd中,无需安装. 它允许fluentd从文本文件尾部读取日志事件,其行为类似linux的tail -F命令(按文件名来tail). 这几乎是最常用的一个输入插件 ...
- 利用msg_msg实现任意地址读写
利用msg_msg实现任意地址读写 msgsnd和msgrcv的源码分析 内核通过msgsnd和msgrcv来进行IPC通信.内核消息分为两个部分,一个是消息头msg_msg(0x30),以及后面跟着 ...
- Java导出带格式的Excel数据到Word表格
前言 在Word中创建报告时,我们经常会遇到这样的情况:我们需要将数据从Excel中复制和粘贴到Word中,这样读者就可以直接在Word中浏览数据,而不用打开Excel文档.在本文中,您将学习如何使用 ...
- 企业信息化建PLM系统、ERP系统、MES系统是单个逐步建设好,还是同时上比较好?
企业信息化建PLM系统.ERP系统.MES系统肯定是单个逐步建设好啊,不仅仅是各个系统单独建设,系统内各模块的实施也应该先后逐步推进,切不可想着一口吃个大胖子,一股脑的全上,求全求快是很多系统实施失败 ...
- 分享一个Vue实现图片水平瀑布流的插件
这里给大家分享我在网上总结出来的一些知识,希望对大家有所帮助 一.需求来源 今天碰到了一个需求,需要在页面里,用水平瀑布流的方式,将一些图片进行加载,这让我突然想起我很久以前写的一篇文章<JS两 ...
- 【强烈推荐】用glob库的一行命令显著加速批量读取处理数据
在我们气象领域,对数据进行批处理随处可见,尤其是在处理模式数据的时候.为了能让这个过程加速,很多大佬们提出了不同的方法,比如使用numba库进行计算.使用dask库进行并行等等,都是非常好的加速手段. ...