【.net】获取网页CDM的下载链接的地址

using System;

using System.Collections.Generic;

using System.Linq;

using System.Runtime.InteropServices;

using System.Text;

using System.Threading.Tasks;

using System.Windows.Forms;

using Framework.Core.Crawl;

using HtmlAgilityPack;

namespace WebCaptureSolution

{

    static class Program

    {

        /// <summary>

        /// 应用程序的主入口点。

        [DllImport("urlmon.dll", CharSet = CharSet.Ansi)]

        private static extern int UrlMkSetSessionOption(int dwOption, string pBuffer, int dwBufferLength, int dwReserved);

        const int URLMON_OPTION_USERAGENT = 0x10000001;

        const string SPUserAgent = "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36";

        [STAThread]

        static void Main(string[] args)

        {

            Application.EnableVisualStyles();

            Application.SetCompatibleTextRenderingDefault(false);

            string log_url = "http://www.handsupowo.pl/member.php?action=login";

            string url1 = "http://www.handsupowo.pl/archive/index.php?forum-13.html";

            List<string> aList = new List<string>();

            List<string> lastinfo = new List<string>();

            var form = new WebCapture();

            form.DocumentOK = false;

            #region ログイン

            if (!string.IsNullOrEmpty(SPUserAgent))

            {

                UrlMkSetSessionOption(URLMON_OPTION_USERAGENT, SPUserAgent, SPUserAgent.Length, 0);

            }

            form.Navigate(log_url);

            while (!form.DocumentOK)

            {

                Application.DoEvents();

            }

            //step 1 login

            var s = form.WebBrowser.Document.GetElementById("content");

            var input = s.GetElementsByTagName("input");

            for (int i = 0; i < input.Count; i++)

            {

                var p = input[i];

                if (p.OuterHtml.Contains("username"))

                {

                    p.SetAttribute("value", "id");

                }

                else if (p.OuterHtml.Contains("pass"))

                {

                    p.SetAttribute("value", "password");

                }

                else if (p.OuterHtml.Contains("submit"))

                {

                    p.InvokeMember("Click");

                    break;

                }

            }

            var startTime = System.DateTime.Now;

            while ((System.DateTime.Now - startTime).TotalSeconds <= 10)

            {

                Application.DoEvents();

            }

            // System.IO.File.WriteAllText(form.SavePath, form.WebBrowser.Document.GetElementsByTagName("html")[0].OuterHtml, System.Text.Encoding.UTF8);

            // step 2

            #endregion

            form.DocumentOK = false;

            form.Navigate(url1);

            while (!form.DocumentOK)

            {

                Application.DoEvents();

            }

            HtmlAgilityPack.HtmlDocument htmldoc = new HtmlAgilityPack.HtmlDocument();

            htmldoc.LoadHtml(form.WebBrowser.Document.GetElementsByTagName("html")[0].OuterHtml);

            //  div[contains(@class,'ads-creative')]

            var anodes = htmldoc.DocumentNode.SelectNodes("//div[@class='threadlist']//a");

            foreach (var tn in anodes)

            {

                aList.Add(tn.Attributes["href"].Value);

            }

            // 循环访问a

            foreach (var cdmurl in aList)

            {

                form.DocumentOK = false;

                form.Navigate(cdmurl);

                while (!form.DocumentOK)

                {

                    Application.DoEvents();

                }

                startTime = System.DateTime.Now;

                while ((System.DateTime.Now - startTime).TotalSeconds <= 5)

                {

                    Application.DoEvents();

                }

                htmldoc.LoadHtml(form.WebBrowser.Document.GetElementsByTagName("html")[0].OuterHtml);

                var downloadurl = htmldoc.DocumentNode.SelectNodes("//a[@rel='nofollow']");

                var info = htmldoc.DocumentNode.SelectSingleNode("//div[@id='fullversion']//a");

                if (downloadurl == null)

                {

                    downloadurl = htmldoc.DocumentNode.SelectNodes("//a[@target='_blank']");

                }

                List<string> dllist = new List<string>();

                if (downloadurl.Count == 1)

                {

                    dllist.Add(info.InnerText);

                    dllist.Add(downloadurl[0].Attributes["href"].Value);

                }

                else

                {

                    foreach (var dl in downloadurl)

                    {

                        if (dllist.Count == 0)

                        {

                            dllist.Add(info.InnerText);

                        }

                        else

                        {

                            dllist.Add(dl.Attributes["href"].Value);

                        }

                    }

                }

                lastinfo.Add(string.Join(Environment.NewLine, dllist.ToArray()));

                lastinfo.Add(Environment.NewLine);

            }

            System.IO.File.WriteAllLines(@"D:\Nodejs\myjs\DownLoadUrl.txt", lastinfo.ToArray(), Encoding.UTF8);

        }

    }

}

【.net】获取网页CDM的下载链接的地址的更多相关文章

使用htmlparse爬虫技术爬取电影网页的全部下载链接
昨天,我们利用webcollector爬虫技术爬取了网易云音乐17万多首歌曲,而且还包括付费的在内,如果时间允许的话,可以获取更多的音乐下来,当然,也有小伙伴留言说这样会降低国人的知识产权保护意识,诚 ...
【Python项目】简单爬虫批量获取资源网站的下载链接
简单爬虫批量获取资源网站的下载链接项目链接:https://github.com/RealIvyWong/GotDownloadURL 1 由来自己在收集剧集资源的时候,这些网站的下载链接还要手动 ...
使用htmlparser爬虫技术爬取电影网页的全部下载链接
昨天,我们利用webcollector爬虫技术爬取了网易云音乐17万多首歌曲,而且还包括付费的在内,如果时间允许的话,可以获取更多的音乐下来,当然,也有小伙伴留言说这样会降低国人的知识产权保护意识,诚 ...
C# 网络编程之webBrowser获取网页url和下载网页中图片
该文章主要是通过C#网络编程的webBrowser获取网页中的url并简单的尝试瞎子啊网页中的图片,主要是为以后网络开发的基础学习.其中主要的通过应用程序结合网页知识.正则表达式实现浏览.获取url. ...
一篇文章教会你利用Python网络爬虫获取电影天堂视频下载链接
[一.项目背景] 相信大家都有一种头疼的体验,要下载电影特别费劲,对吧?要一部一部的下载,而且不能直观的知道最近电影更新的状态. 今天小编以电影天堂为例,带大家更直观的去看自己喜欢的电影,并且下载下来 ...
使用selenium的方式获取网页中图片的链接和网页的链接，来判断是否是死链（二）
上一篇使用Java正则表达式来判断和获取图片的链接以及跳转的网址,这篇使用selenium的自带的API(getAttribute)来获取网页中指定的内容实现内容:获取下面所有图片的链接地址以及跳转 ...
Java正则表达式获取网页所有网址和链接文字
; pos1= urlContent.indexOf(strAreaBegin)+strAreaBegin.length(); pos2=urlContent.inde ...
生成Ipa安装包的plist文件后生成下载链接
假设生成的plist文件的下载链接是: https://www.xx.com/download/xx.plist 那么如果想让苹果手机的浏览器点击后开始下载苹果软件包,则网页中的下载链接需要拼接成 i ...
获取youku视频下载链接（wireshark抓包分析）
随便说两句前两天写了一个python脚本,试图以分析网页源码的方式得到优酷视频的下载地址,结果只得到视频的纯播放地址,下载纯播放地址得到的文件也无法正常播放视频. 这里共享一下播放地址得到的方法(想 ...

随机推荐

学习Spring Boot：（二十）使用 MongoDB
前言 MongoDB 1 是可以应用于各种规模的企业.各个行业以及各类应用程序的开源数据库.基于分布式文件存储的数据库.由C++语言编写.旨在为WEB应用提供可扩展的高性能数据存储解决方案.Mongo ...
Android：更好的自定义字体方案
http://ryanhoo.github.io/blog/2014/05/05/android-better-way-to-apply-custom-font/ 情景解决方案 1)Android默 ...
pacman安装软件包出现损坏
状况 File .pkg.tar.xz is corrupted (invalid or corrupted package (PGP signature)).Do you want to delet ...
【洛谷P1376】机器工厂
题目大意:给定两个有 N 个数的序列 A,B,每个点有一个对应的权值,现需要计算答案的贡献:\(B[i]*min\{A[j]+s*(i-j),j\in[1,i] \}\) 的最小值. 题解:由于 B ...
【POJ3613】Cow Relays 离散化+倍增+矩阵乘法
题目大意:给定一个 N 个顶点,M 条边的无向图,求从起点到终点恰好经过 K 个点的最短路. 题解:设 \(d[1][i][j]\) 表示恰好经过一条边 i,j 两点的最短路,那么有 \(d[r+m] ...
Android: 网络随时需要在3G和Wifi切换，网络程序需要注意
平时,3G和WIFI 都开着的时候,Android默认使用Wifi,但现实环境中不可能到处都有wifi,所以手机会经常自动切换网络. 有的时候,手机一开始使用wifi上网,当进入待机后10-30分钟, ...
Netty 4.1 Getting Start （翻译） + Demo
一.先来官方入门页面的翻译(翻译不好请多包涵) 入门本章以简单的例子来介绍Netty的核心概念,以便让您快速入门.当您阅读完本章之后,您就能立即在Netty的基础上写一个客户端和一个服务器. 如果您 ...
MySQL常用辅助语句
查看索引: mysql> show index from user_info; +-----------+------------+----------+--------------+----- ...
idea常用的插件
ignore 插件可以自动生成.ignore文件非常的实用 gitee 插件搜所gitee安装即可码云的插件 maven helper 插件 idea 中解决maven 包冲突的问题 a ...
在 golang 中使用 Json
序列化序列化对象将使用 encoding/json 中的 Marshal 函数. 函数原型为:func Marshal(v interface{}) ([]byte, error) 以下是官网给出的 ...

【.net】获取网页CDM的下载链接的地址

【.net】获取网页CDM的下载链接的地址的更多相关文章

随机推荐

热门专题