异常值检验实战3_NBA球员表现稳定性分析
机器学习_深度学习_入门经典(博主永久免费教学视频系列)
https://study.163.com/course/courseMain.htm?courseId=1006390023&share=2&shareId=400000000398149
微信扫二维码,免费学习更多python资源
转载https://www.jianshu.com/p/bdcf0407979a
统计概率思维-描述统计分析
1# 为什么要学统计学?
- 人工智能的基础知识
- 投资领域的必备知识
- 时代的入口
2# 描述统计分析
2.1 描述统计学定义
● 将复杂的数据集简化,总结出可以起到高度概括、有代表性、能够起到描述作用的数字。
2.2 描述统计常用指标
平均值
● 例子:A,B,C,D收入分别为10,11,12,13万元,人均收入为(10+11+12+13)/4=11.5万元
但是也有缺点,就是当数据中有异常值(极大或者极小)则用平均值结果来描述数据集是不准确的,如把D的收入替换成10亿元,那么人均收入约等于29000万元,虽然说这样的描述没有错误,但是不能正确体现数据集的特征(A,B,C的收入没有那么高)。
中位数
● 中位数计算方法:
- 按从小到大顺序排列数据
- 计算中间位置(假设有N个数,如果N是奇数则是中间数值,如果N是偶数则是中间两个数的平均值)
● 例子:找出5,7,3,8的中位数
- 从大到小排列3,5,7,8
- 计算中间位置,因为N=4,则其中位数是(5+7)/2=6
四分位数
● 四分位数的计算方法:
- 找到中位数(叫做Q2)
- 求出中位数左边部分的中位数(叫做Q1,成为下四分位数)
- 求出中位数右边部分的中位数(叫做Q3,成为上四分位数)
● 可视化例子(箱线图):
● 可视化例子2(比较不同类型数据集的数据分布情况)
横轴x是对数据分析师需求top6的城市,纵轴y是薪资情况。
结论:深圳的工资水平较高,行业顶薪也是位居六大城市之首。
横轴x是对数据分析师参与工作年数,纵轴y是薪资情况。
结论:数据分析师的薪资水平随着工作年限增长,在3-5年阶段增长、跨度尤为明显。
● 识别异常值(极大或者极小的值)
处理方法:
- 对错误数据进行修正
- 对错误数据删除
- 确认出异常值符合现实以后,选择保留
● Turkey‘s test
- 最小估计值:Q1-k(Q3-Q1)
- 最大估计值:Q3+k(Q3-Q1)
如果K=1.5 中度异常;K=3 极度异常
案例(识别出温度中的异常值):
● 总结箱线图(四分位数)优点:避免受到异常值的影响;通过turkey test识别异常值
● 总结箱线图(四分位数)的局限:无法告诉数据集的波动
标准差
● 概念打通
标准差就是计算出数据相对于平均值的波动大小,也就是衡量出一组数据的离散程度(波动大小)
离散程度=变异性=波动大小
● 标准差计算方法
方差算法:
u等于一组数据的平均值
也可以是下面的式子:
Ps:这里用平方的原因是有时候数字和平均数的偏离是反向偏离(负数),如果不进行平方可能就和正向偏离抵消。
标准差算法:
● 案例分析(哪个nba球员更加稳定):
可以推到出结论:球员1加内特的发挥更加稳定,球员2库里的发挥波动比较大
● 标准差需要注意的两个问题
- 标准差的单位
和前面引入数据的单位是相同的 - 标准差是大一点好还是小一点好
要看具体的数据,如生产零件那么标准差小好;公司的工资分布应该要是比较大的标准差好
标准分
● 标准分的定义
选定值和平均值相差多少个的标准差
如果标准分=0,那就就是=平均值,标准分>0则是>平均值
● 计算方法
使用平均值u和标准差σ计算出来
● 案例(摩托罗拉6σ管理)
距离平均值6个标准差σ,相当于6个标准差就是每百万件抽样中,有3.4个不合格
总结
异常值检验实战3_NBA球员表现稳定性分析的更多相关文章
- 异常值检验实战1--风控贷款年龄变量(附python代码)
python风控评分卡建模和风控常识(博客主亲自录制视频教程) https://study.163.com/course/introduction.htm?courseId=1005214003&am ...
- python异常值检验实战2_医美手术价格
python信用评分卡建模(附代码,博主录制) https://study.163.com/course/introduction.htm?courseId=1005214003&utm_ca ...
- R语言︱异常值检验、离群点分析、异常值处理
每每以为攀得众山小,可.每每又切实来到起点,大牛们,缓缓脚步来俺笔记葩分享一下吧,please~ --------------------------- 笔者寄语:异常值处理一般分为以下几个步骤:异常 ...
- R语言︱处理缺失数据&&异常值检验、离群点分析、异常值处理
在数据挖掘的过程中,数据预处理占到了整个过程的60% 脏数据:指一般不符合要求,以及不能直接进行相应分析的数据 脏数据包括:缺失值.异常值.不一致的值.重复数据及含有特殊符号(如#.¥.*)的数据 数 ...
- Atitit.提升稳定性-----分析内存泄漏PermGen OOM跟解决之道...java
Atitit.提升稳定性-----分析内存泄漏PermGen OOM跟解决之道...java 1. 内存区域的划分 1 2. PermGen内存溢出深入分析 1 3. PermGen OOM原因总结 ...
- 【代码周边】MongoDB与Mysql对比以及插入稳定性分析(指定主键的影响)
在数据库存放的数据中,有一种特殊的键值叫做主键,它用于惟一地标识表中的某一条记录.也就是说,一个表不能有多个主键,并且主键不能为空值. 无论是MongoDB还是MySQL,都存在着主键的定义. 对于M ...
- Http实战之Wireshark抓包分析
Http实战之Wireshark抓包分析 Http相关的文章网上一搜一大把,所以笔者这一系列的文章不会只陈述一些概念,更多的是通过实战(抓包+代码实现)的方式来跟大家讨论Http协议中的各种细节,帮助 ...
- 夯实Java基础系列3:一文搞懂String常见面试题,从基础到实战,更有原理分析和源码解析!
目录 目录 string基础 Java String 类 创建字符串 StringDemo.java 文件代码: String基本用法 创建String对象的常用方法 String中常用的方法,用法如 ...
- 机器学习理论与实战(十一)关联规则分析Apriori
<机器学习实战>的最后的两个算法对我来说有点陌生,但学过后感觉蛮好玩,了解了一般的商品数据关联分析和搜索引擎智能提示的工作原理.先来看看关联分析(association analysis) ...
随机推荐
- Ansible-概念
控住节点 任何装有Ansible的机器.您可以从任何控制节点调用/usr/bin/ansible或来运行命令和剧本/usr/bin/ansible-playbook.您可以将任何安装了Python的计 ...
- Mac 设置redis开机启动
1.创建一个plist文件 首先我们需要在/Library/LaunchDaemons目录下创建一个plist文件,使用如下命令: 复制代码代码如下: sudo vim /Library/Launch ...
- Mycat配置项详解
schema.xml文件配置中的balance属性和writeType属性: . balance=", 不开启读写分离机制,所有读操作都发送到当前可用的 writeHost 上. . ba ...
- Odoo Qweb语法
转载请注明原文地址:https://www.cnblogs.com/ygj0930/p/10826202.html 一:简介 QWeb是一个基于xml的模板引擎,用于生成HTML片段和页面. 模板指令 ...
- 使用MPU6050陀螺仪自制Arduino数字量角器
MPU6050惯性单元是一个3轴加速度计和一个3轴陀螺仪组合的单元.它还包含温度传感器和DCM,可执行复杂的任务. MPU6050通常用于制作无人机和其他远程控制机器人,如自平衡机器人.在本篇文章中, ...
- js定时器关闭,js定时器停止,一次关闭所有正在运行的定时器,自定义函数clearIntervals()一次关闭所有正在运行的定时器
js定时器关闭,一次关闭所有正在运行的定时器,自定义函数clearIntervals()一次关闭所有正在运行的定时器,原理:利用数组存储定时器id,然后遍历数组,关闭定时器 附上页面的截图,代码在截图 ...
- moya
https://juejin.im/post/5ac2cf34f265da23a1421483 https://juejin.im/post/5a69e9f9f265da3e290c6782
- NSData、数据结构与数据转换
数据结构公式:Data_Structure=(D,R): 只要数据元素与数据(组织关系)能够保持:同一个数据(结构)可以在各种存贮形式间进行转换. 字节流或字符串是所有转化的中间节点(中转站).相当于 ...
- podium服务器端的微前端开发框架
podium 是一个比较全的微前端开发框架. 具有以下特性 自治开发 强大的组合能力 基于约定的开发模式 podium 包含的组件 podlets 页面片段,是一个独立的http 服务,独立运行的,实 ...
- system.stat[resource,<type>]
系统信息. 整型或者浮点型 ent - 该分区有权接收的处理器单元数(float) kthr, - 关于内核线程状态的信息: r - 平均可运行内核线程数(float) b - 虚拟内存管理器等待队列 ...