1. 首页
  2. Python

Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例

“u003Cdivu003E u003Cbodyu003E u003Cpu003E在我们学习的过程中,打开一个网站就想抓一次数据,但是并不是所有的网站都可以用一种方式抓到数据的,有的是网页结构特殊,有的是json数据包不一样,慢慢的写一些自己在抓站过程中遇到的奇特的网站,分享思路和抓取方法给大家!u003Cu002Fpu003E u003Cpu003Eu003Cspanu003E工具、目标u003Cu002Fspanu003Eu003Cbru003Eu003Cu002Fpu003E u003Cpu003E工具:pycharm、python3.6版本u003Cu002Fpu003E u003Cpu003E库:requests库u003Cu002Fpu003E u003Cpu003E目标:谱时网热门图片直播页面,所有的图片信息u003Cu002Fpu003E u003Cpu003E说明:该网站有热门图片页面,里面有活动的相关照片,按活动将所有的图片信息写入txt文档(不下载图片,是为了不对服务器造成影响)!u003Cu002Fpu003E u003Cpu003Eu003Cspanu003E目标分析u003Cu002Fspanu003Eu003Cbru003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp3.pstatp.comu002Flargeu002Fpgc-imageu002F1536993891744eda46b7c29″ img_width=”640″ img_height=”343″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003E首先,如上图打开主页,其它的不用管,直接点击右上角,出现选项后,点击进入热门图片直播选项(注意:有的浏览器要缩放页面,才可以看到热门图片直播的选项),进入后页面如下所示u003Cbru003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp1.pstatp.comu002Flargeu002Fpgc-imageu002F153699389192586255b1198″ img_width=”640″ img_height=”328″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003E这里我是缩放到了30%,下方呢,就是一个个的活动图片直播的页面了。随便点开一个活动,我们看看页面u003Cbru003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp3.pstatp.comu002Flargeu002Fpgc-imageu002F15369938921499168452d0f” img_width=”640″ img_height=”231″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003E看页面的图片加载这么慢,应该是动态加载的,右键查看源代码,果不其然!u003Cbru003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp1.pstatp.comu002Flargeu002Fpgc-imageu002F153699389225826e1405df5″ img_width=”640″ img_height=”244″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003E没有任何的图片信息,那么我们就需要用到浏览器的页面审查工具了!我这里用的是火狐浏览器,摁F12就可以打开,然后点击网络,清除内容,刷新页面,看看它加载了什么数据进来u003Cbru003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp1.pstatp.comu002Flargeu002Fpgc-imageu002F1536993892487c2c7228235″ img_width=”640″ img_height=”339″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003E简单查看后,发现了2个包含有我们要的数据u003Cbru003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp1.pstatp.comu002Flargeu002Fpgc-imageu002F15369938927279e6e11aaa3″ img_width=”640″ img_height=”374″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp1.pstatp.comu002Flargeu002Fpgc-imageu002F1536993892964af3e8ece7f” img_width=”640″ img_height=”343″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003E一个是活动相关信息,一个是图片相关信息,都是json格式加载的,这样就简单了,请求相关url就可以获取到,这时忽然想到,如果之前的多个活动页面也是动态加载的,那么是否可以通过这种方式将所有的活动也抓到呢?来看看u003Cbru003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp1.pstatp.comu002Flargeu002Fpgc-imageu002F1536993893147e3f40921e8″ img_width=”640″ img_height=”437″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003E这个json数据中,存在了所有的页面加载的活动信息!没有翻页。。。怪不得加载那么慢呢[手动委屈]。u003Cbru003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp1.pstatp.comu002Flargeu002Fpgc-imageu002F153699389333670448892e0″ img_width=”640″ img_height=”427″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003Eu003Cspanu003E代码实现u003Cu002Fspanu003Eu003Cbru003Eu003Cu002Fpu003E u003Cpu003E通过上述的分析,我们明白了目标数据所在的位置,那么就可以开始试着写代码了u003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp1.pstatp.comu002Flargeu002Fpgc-imageu002F1536993893580f939db8726″ img_width=”1007″ img_height=”219″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003E导入requests库,然后直接请求真实网址,获得name和对应的url(真实网址在消息头中),然后构建页面中的真实网址,上面所拿到的url其实是网页的url,并不是该网页的json包所在的真实地址,怎么拿到真实地址呢?我们多拿几个获得页面的真实网址对比,不难发现它的规律u003Cbru003Eu003Cu002Fpu003E u003Cblockquoteu003E u003Cpu003Ehttps:u002Fu002Fwx.plusx.cnu002Factivityu002Fliveu002Fpics?activityNo=1341537&picIndex=0&isNew=false&count=3000&ppSign=u003Cu002Fpu003E u003Cpu003Ehttps:u002Fu002Fwx.plusx.cnu002Factivityu002Fliveu002Fpics?activityNo=3321860&picIndex=0&isNew=false&count=3000&ppSign=u003Cu002Fpu003E u003Cpu003Ehttps:u002Fu002Fwx.plusx.cnu002Factivityu002Fliveu002Fpics?activityNo=1341537&picIndex=0&isNew=false&count=3000&ppSign=u003Cu002Fpu003E u003Cpu003Ehttps:u002Fu002Fwx.plusx.cnu002Factivityu002Fliveu002Fpics?activityNo=451977&picIndex=0&isNew=false&count=3000&ppSign=u003Cu002Fpu003E u003Cu002Fblockquoteu003E u003Cpu003E对比下就发现,其实就是activityNo的值不一样而已,而这个值在上述抓到的json包里也是存在的!u003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp3.pstatp.comu002Flargeu002Fpgc-imageu002F15369938938495c097226ae” img_width=”1100″ img_height=”352″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003E构建下一页的真实请求地址,然后抓json包,获取所有图片url!至此,核心代码已经写完,将它完善一下,整体代码和效果如下:u003Cbru003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp3.pstatp.comu002Flargeu002Fpgc-imageu002F15369938941139c6ed84e3e” img_width=”1248″ img_height=”361″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp1.pstatp.comu002Flargeu002Fpgc-imageu002F1536993894274c195435262″ img_width=”640″ img_height=”330″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003E不到1分钟,该页面全部的活动及活动图片url保存完毕,整体代码也不到20行,很简单的一个网站!如果要下载图片,可以将url全部复制到下载工具中,批量下载哦!u003Cbru003Eu003Cu002Fpu003E u003Cpu003Eu003Cimg src=”http:u002Fu002Fp9.pstatp.comu002Flargeu002Fpgc-imageu002F1536993894525bd1e8b403d” img_width=”640″ img_height=”480″ alt=”Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例” inline=”0″u003Eu003Cu002Fpu003E u003Cpu003Eu003Cspanu003E后记u003Cu002Fspanu003Eu003Cbru003Eu003Cu002Fpu003E u003Cpu003E这个网站的整体结构比较清晰,数据也很简单就获取了,而今天之所以拿这个网站来分享,是因为开始抓包的时候,自己都不敢相信,一个页面之间加载了400多张图片。。。而且看页面结构也没想到有这么简单!u003Cu002Fpu003E u003Cpu003E总的来说,该网站比较适合新手去学习抓包获取数据,希望能帮助到大家,加油!u003Cu002Fpu003E u003Cu002Fbodyu003Eu003Cu002Fdivu003E”

原文始发于:Python爬虫,哪些奇特的网站值得一爬!谱时网爬虫实例

主题测试文章,只做测试使用。发布者:敢吻,转转请注明出处:http://www.cxybcw.com/13148.html

联系我们

13687733322

在线咨询:点击这里给我发消息

邮件:1877088071@qq.com

工作时间:周一至周五,9:30-18:30,节假日休息

QR code