BET365的websocket实时数据采集分析_365bet网站-程序员宅基地

技术标签: 爬虫技术分享  python  websocket  

BET365网站websocket实时数据采集分析

**

前语:

**

本文仅用于交流学习,请勿用于非法用途,后果自负!

bet365是全球顶尖的涵盖足球篮球等各项赛事的赛事信息提供网站以及博彩网站。为啥要去爬这个网站呢?因为它赛事更新快,准,专业,赛事信息丰富。国内的很多赛事网站都是直接或者间接跟bet365的赛事信息有关系。
Bet365的赛事信息之所以更新快,这跟他的数据传输方式分不开,现在bet365的赛事信息更新是采用websocket的方式进行实时传输的。下图就是bet365的数据展示
这个就是效果图,赛事比分,赛事指数等都是使用websocket进行传输的
赛事比分,赛事指数等都是使用websocket进行传输的
在这里插入图片描述
红色框的内容,左边的就是websocket的请求连接,右边的就是实时传输过来的一些赛事数据,包括实时指数,实时比分等。
相信能搜到我这篇文章的朋友应该都对websocket这种传输方式有所了解了,我这里就不赘述了(我总不能说自己也不是很熟悉吧,哈哈)。好了,下面就让我们开始破解bet365的破解之路吧。

第一段,websocket需要我们发送握手请求过去,握手的请求我上面也说了,就是wss://premws-pt3.365lpodds.com/zap/?uid=03829507192487869类似于这种格式的,这里有个uid,后面的这一串数字应该是有用的,我们拿去全局搜索一下在这里插入图片描述
但是很可惜,没有。这说明,这个参数应该是js生成的。这个时候就要开始逆向了在这里插入图片描述
右边红色框额都代表着这个这个url在发出去之前都经历了什么,可以点击最右边的蓝色字体进入响应的代码块进行查看在这里插入图片描述
点进去后,是不是有种似曾相识的赶脚,没错,红色框的就是生成websocket请求地址的地方,不信的朋友可以设个断点看看,但是因为这个js代码是服务器动态生成发送过来的,所以,你断点重启后,会重新生成一个文件给你,不过不碍事,也可以在断点停住。接下来就一步步逆推了,逆推后面,你会定位到下图
![在这里插入图片描述](https://img-blog.csdnimg.cn/20200726233508331.png?x-oss-process=image/watermark,type_ZmFuZ3poZW5naGVpdGk,shadow_10,text_aHR0cHM6Ly9ibG9nLmNzZG4ubmV0L0xJQ0FPUElORw==,size_16,color_FFFFFF,t_70
红色字体就是我们生成uid的地方,我们可以点进去黄色底色的函数里查看在这里插入图片描述
看到没,右边红色框的就是uid的生成代码,你说你不信?不行的话,可以点击左边的e函数进去里面瞅瞅,你就会发现,这就是了,但是这个。。。懂得的人都懂,这就是js中随机生成一个随机数的函数。这就是随机生成随机数的函数,不用问度娘了,那为啥会这样呢,原因很简单,bet365的uid就是虚的反爬手段,其实只要是符合位数的随机数字都可以,哈哈。
第二段,只需要随机数字组合就可以获取到数据了么,很显然,不行的。通过查看前面的截图,我们知道接下来,需要session_id:D27057904C7715589A932B1B1DCA70AC000003,token值(最难获取的):m7AdXw==.yZly3XRicdw/1HkKKgFpxWRAkKOS0zKvQXzyzivNxsk=,其中:
session_id可以从https://www.bet365.com/defaultapi/sports-configuration这里请求而来,token则需要经过两层加密处理才能得到。细心的朋友可能已经注意到了,是的,在上面的截图中,其实,token已经出现过了。
在这里插入图片描述
很明显S(称第二token)就是我们最终需要获取的数据,但是看第一个红色框的数据(称第一token),跟S是类似的,但不一致的,这说明,fe函数是一个加密函数,把第一个token值加密生成第二个加密token值,点进去是这样的在这里插入图片描述
简单点说,就是把每一个第一token的值拆出来跟e.charMap的数组中的数据进行对应互换,然后再组合就生成了第二token,这里有两种方式进行操作,第一种:把加密代码直接拷下来,然后使用nodejs或者python的框架execjs进行执行js生成。
pip3 install PyExecJS
第二种是直译,理解代码然后把相应的加密函数翻译成python代码,也可以执行。
token值的获取从我们发现第一token的地方开始,逆推上去,会推到一个叫C的函数那里在这里插入图片描述
之前都是穿进去的init对象/token值,而在这个函数中,原本e是空的,但是C执行完后就出现了,说明第一tokenC中生成的理解C函数就知道,e = ae.join("") + String.fromCharCode(46) + se.join("")生成的46就是十进制的ASCII中的句号,ae在这里插入图片描述
se在这里插入图片描述
组合起来,第一token值就出现了。那ae,se又是哪来的呢?
通过当前文件搜索可知,在C函数下面,先定义了ae,se两个数组,然后通过下面两个函数ef,gh把符合条件的o赋值给指定位置。
而ef,gh函数是e对象的方法,e是传进去的对象,继续往下看可以看到e对象即是后面的boot对象,同时在这里插入图片描述

在这里找到了调用的地方,说明ae,se是在这里进行正式生成的(3号代码块中的绿色框代码),但是这个_0x271cd1又是什么呢?其实,这是bet365使用了一种叫做js代码混淆的技术,把原本比较易看的js代码进行了混淆,增加反爬难度,对js代码混淆的可以点击此处了解
bet365的代码混淆比较简单,比较容易理解,重点的就几个地方
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

在1号处定义了一个具有上百数据内容的数组,然后使用2号函数进行数组内元素位置调整,调整完毕后跳转至3号代码块进行for循环操作,在for循环中跳转至4号代码块中执行对应函数。在3跟4执行期间需要经常跳转至5、6、7代码中进行数据提取,数据提取完成后再把提取出来的数据传给boot.gh函数进行ae、se赋值,for循环完成后,第一token值就生成了。看起来很复杂,其实,只要理解了代码运行流程,就执行比较繁琐了点。因为上述代码是服务器动态生成的,起始的_0x4d8a数组的元素也是动态生成的,所以我们不能直接通过直接拷贝响应代码进行生成参数。我这边采用的是通过请求https://www.bet365.com/,获取到响应后使用re正则动态提取相应代码,动态生成token值。

当我们把上面的参数都能自己生成了之后,我们就可以使用框架携带响应请求参数发送握手请求,获取数据了,当然我们还需要设置一些websocket的基础,比如设置请求的子协议:zap-protocol-v1,设置数据传输的数据格式:permessage-deflate (permessage-deflate 标头在握手中用于指示连接是否应使用压缩)。当把这些都设置好后,正常来说,是可以获取到数据了。但对于我们python来说,还有个难关,就是框架选择,那就是选择哪个websocket方面的框架来请求呢?事实上,对于一般的websocket连接,基本上都可以的,但对已bet365来说:并不是所有都能用,当你使用websocket/websocket-client框架进行操作时,会在获取到第一个响应之后报错断开连接在这里插入图片描述
折腾一段时间后,我改用了asyncio+webscokets框架,成功的获取到了数据
pip3 install websockets在这里插入图片描述
分享讲到这里,已经可以完工了。是的,可以完工了,只要设置断线重连,基本上数据都不会断了。

某些细心的小伙伴可能会发现一个细节,就是在最开始的webscoket请求url列表里,还有个url跟数据请求url很相似:wss://pshudws.365lpodds.com/zap/?uid=13386056174193506,而且每次都有,这个对数据获取是不是有什么影响呢?
观察那个url及数据交互的情况,在这里插入图片描述
当数据返回有这个数据之后,获取数据的url连接就会发送下图的数据
在这里插入图片描述
经过验证,这是发送的数据里也包含一个token值,而这个token值就是看似没关系的ulr连接返回来的token值经过第二次加密获取到的。那这些有什么用呢?通过对比实验,只有获取数据的ur链接运行的时候,获取数据的连接异常率会很高,平均五分钟自动断线重启一次,当两个都连接时,基本不会出现五分钟重启的现象。这对设置了异常断线自动重启的代码来说,没啥影响,算运行优化。
总结:
bet365实时数据获取的反爬处理流程可以概括为如下:1,url中的uid为指定位数的随机数字组合,发送的数据中的pstk可以通过https://www.bet365.com/defaultapi/sports-configuration请求得到,最难得token值首先通过首页的js代码中加密得到第一个token,把获取到的第一token值经过二次加密函数即可获取到正确的token值,获取到参数之后,把连接参数配置好,使用websockets框架即可获取到数据。
finally

本文仅用于交流学习,请勿用于非法用途,后果自负!

本人只是菜鸟一只,如果有说的不对的,欢迎大家指出,本人也没有啥python学习教程可以分享,就不留啥联系方式了,如果有小伙伴对上面的有疑问,可以留言,我看到会回的。
最后,谢谢大家观看。

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/LICAOPING/article/details/107623612

智能推荐

c# 调用c++ lib静态库_c#调用lib-程序员宅基地

文章浏览阅读2w次,点赞7次,收藏51次。四个步骤1.创建C++ Win32项目动态库dll 2.在Win32项目动态库中添加 外部依赖项 lib头文件和lib库3.导出C接口4.c#调用c++动态库开始你的表演...①创建一个空白的解决方案,在解决方案中添加 Visual C++ , Win32 项目空白解决方案的创建:添加Visual C++ , Win32 项目这......_c#调用lib

deepin/ubuntu安装苹方字体-程序员宅基地

文章浏览阅读4.6k次。苹方字体是苹果系统上的黑体,挺好看的。注重颜值的网站都会使用,例如知乎:font-family: -apple-system, BlinkMacSystemFont, Helvetica Neue, PingFang SC, Microsoft YaHei, Source Han Sans SC, Noto Sans CJK SC, W..._ubuntu pingfang

html表单常见操作汇总_html表单的处理程序有那些-程序员宅基地

文章浏览阅读159次。表单表单概述表单标签表单域按钮控件demo表单标签表单标签基本语法结构<form action="处理数据程序的url地址“ method=”get|post“ name="表单名称”></form><!--action,当提交表单时,向何处发送表单中的数据,地址可以是相对地址也可以是绝对地址--><!--method将表单中的数据传送给服务器处理,get方式直接显示在url地址中,数据可以被缓存,且长度有限制;而post方式数据隐藏传输,_html表单的处理程序有那些

PHP设置谷歌验证器(Google Authenticator)实现操作二步验证_php otp 验证器-程序员宅基地

文章浏览阅读1.2k次。使用说明:开启Google的登陆二步验证(即Google Authenticator服务)后用户登陆时需要输入额外由手机客户端生成的一次性密码。实现Google Authenticator功能需要服务器端和客户端的支持。服务器端负责密钥的生成、验证一次性密码是否正确。客户端记录密钥后生成一次性密码。下载谷歌验证类库文件放到项目合适位置(我这边放在项目Vender下面)https://github.com/PHPGangsta/GoogleAuthenticatorPHP代码示例://引入谷_php otp 验证器

【Python】matplotlib.plot画图横坐标混乱及间隔处理_matplotlib更改横轴间距-程序员宅基地

文章浏览阅读4.3k次,点赞5次,收藏11次。matplotlib.plot画图横坐标混乱及间隔处理_matplotlib更改横轴间距

docker — 容器存储_docker 保存容器-程序员宅基地

文章浏览阅读2.2k次。①Storage driver 处理各镜像层及容器层的处理细节,实现了多层数据的堆叠,为用户 提供了多层数据合并后的统一视图②所有 Storage driver 都使用可堆叠图像层和写时复制(CoW)策略③docker info 命令可查看当系统上的 storage driver主要用于测试目的,不建议用于生成环境。_docker 保存容器

随便推点

网络拓扑结构_网络拓扑csdn-程序员宅基地

文章浏览阅读834次,点赞27次,收藏13次。网络拓扑结构是指计算机网络中各组件(如计算机、服务器、打印机、路由器、交换机等设备)及其连接线路在物理布局或逻辑构型上的排列形式。这种布局不仅描述了设备间的实际物理连接方式,也决定了数据在网络中流动的路径和方式。不同的网络拓扑结构影响着网络的性能、可靠性、可扩展性及管理维护的难易程度。_网络拓扑csdn

JS重写Date函数,兼容IOS系统_date.prototype 将所有 ios-程序员宅基地

文章浏览阅读1.8k次,点赞5次,收藏8次。IOS系统Date的坑要创建一个指定时间的new Date对象时,通常的做法是:new Date("2020-09-21 11:11:00")这行代码在 PC 端和安卓端都是正常的,而在 iOS 端则会提示 Invalid Date 无效日期。在IOS年月日中间的横岗许换成斜杠,也就是new Date("2020/09/21 11:11:00")通常为了兼容IOS的这个坑,需要做一些额外的特殊处理,笔者在开发的时候经常会忘了兼容IOS系统。所以就想试着重写Date函数,一劳永逸,避免每次ne_date.prototype 将所有 ios

如何将EXCEL表导入plsql数据库中-程序员宅基地

文章浏览阅读5.3k次。方法一:用PLSQL Developer工具。 1 在PLSQL Developer的sql window里输入select * from test for update; 2 按F8执行 3 打开锁, 再按一下加号. 鼠标点到第一列的列头,使全列成选中状态,然后粘贴,最后commit提交即可。(前提..._excel导入pl/sql

Git常用命令速查手册-程序员宅基地

文章浏览阅读83次。Git常用命令速查手册1、初始化仓库git init2、将文件添加到仓库git add 文件名 # 将工作区的某个文件添加到暂存区 git add -u # 添加所有被tracked文件中被修改或删除的文件信息到暂存区,不处理untracked的文件git add -A # 添加所有被tracked文件中被修改或删除的文件信息到暂存区,包括untracked的文件...

分享119个ASP.NET源码总有一个是你想要的_千博二手车源码v2023 build 1120-程序员宅基地

文章浏览阅读202次。分享119个ASP.NET源码总有一个是你想要的_千博二手车源码v2023 build 1120

【C++缺省函数】 空类默认产生的6个类成员函数_空类默认产生哪些类成员函数-程序员宅基地

文章浏览阅读1.8k次。版权声明:转载请注明出处 http://blog.csdn.net/irean_lau。目录(?)[+]1、缺省构造函数。2、缺省拷贝构造函数。3、 缺省析构函数。4、缺省赋值运算符。5、缺省取址运算符。6、 缺省取址运算符 const。[cpp] view plain copy_空类默认产生哪些类成员函数

推荐文章

热门文章

相关标签