
之前我写过一篇呼吁重视锂电数据分析的文章【AI锂电】同样的失效问题,她查了1个月,他只要3分钟,引起了不少锂电人的共鸣;也在星球里放过一些数据分析的培训视频和资料JMP公开课学习资源整理(含锂电案例),在公众号分享过AI锂电方面的知识AI 锂电学习笔记。
很多人问我有没有数据分析方面的学习资料。
对有基础的人来说,这些视频、知识是宝物,但是对于零基础、还在用 Excel做数据分析的人来说,视频讲得比较深,缺少统计学基础的学员不是很容易理解。
我的学员都是有多年工作经验的,但是对于稍微有点难度的统计学知识,比如F分布、卡方检验、中心极限定理、方差可加性这些,理解起来还是有些困难。国内的一些统计学教材,比如大学常用的贾俊平《统计学》,在概念精华上非常浓缩,几乎只保留了公式推导。在校生还好,毕业后的上班族去看就非常累。
我在教学的时候,为了让学员直观理解卡方分布、ANOVA分析为什么是这个图形、数据怎么出来的,会用 Excel+公式把图形做一遍。但这个过程必须我手动演示。大家上课听懂的东西,下课就忘了。而且授课能带的人是有限的。
所以我就想:能不能做一个锂电版的数据分析学习网站?
说实话这事从零开始挺难的。我借鉴了一个海外的开源项目:Seeing Theory。逐页核对时发现并修复了几处问题。比如方差分析表头那一列,原版整列都标成了 SSE,但这一列装的是组间、组内、总和三个平方和,列名应该是 SS(平方和)才对;SSE 只是其中”组内误差”那一项。底部的公式也跟着标错了。
大部分人看公众号都是靠手机,所以我又花了大量时间进行了手机端的阅读优化,包括公式和图。不过还是推荐大家用电脑:datalab.xiaofeng.dpdns.org
因为概率论和数理统计是统计学基础,统计学是数据分析基础。我觉得用交互游戏的方式,更容易让概率和统计理论变得直观易懂。
举个例子:
中心极限定理告诉我们,只要单次抽样的样本量足够大,独立同分布样本的样本均值就会近似正态分布。这是统计学上非常重要的定理。是我们不要求总体分布服从正态分布时,也能够进行显著性检验、做差异对比的前提。
统计学教材是用掷骰子来举例的:
单个骰子均匀分布在 1~6,均值 μ=3.5,标准差 σ≈1.71。若每次掷 100 次,样本均值 X 近似服从 N(3.5,1.71²/100)。
大家会说:哦,要抛100次,就会服从正态。那不就是说抽样次数越多越好?
这里大家就开始把”抽样次数”和”单次样本量”的概念混淆了。很多人会认为“只要抽样次数多,样本均值就会服从正态分布。”其实抛100次骰子,代表了单次取100个样本。而不是100次抽样。
为了让大家直观理解这个概念,我还用Python来给大家演示抽样次数多和单次抽样数量多的最终结果的区别。但不是所有人都有Python环境,而且py一多也容易丢。(当然网站多了也容易丢,所以我后面要做个门户网站,把工具/知识库/资料集合起来。)
而在这个网页的第三章概率分布_中心极限定理篇章中,这个抽样统计的过程就很直观。大家可以试一下。

**
**
自己懂、会教是一回事,做网站是另一回事,过程没有想象的那么简单。
目前六章,从基础概率、概率分布,到频率学派和贝叶斯两套统计推断,再到回归分析,从互动性来说,基本上统计学重要的概念都覆盖了。
但工作里真正要解的是另一类题:K-value 异常了怎么分析?容量下降,是哪些参数在起作用、怎么做主次排序?这些光懂原理还不够。
目前走法有2条:
1.按分析目的来的传统的理论教学板块
如:描述性分析、推断性分析、估计、EDA(探索性数据分析)里的多变量分析
2.按分析流程来的结合数据分析实战篇
如:从数据怎么来、怎么清洗,到描述、推断、预测。
我有计划搭建第二条,不过这是个大工程。先等大家把原理玩明白之后,再进入实战就容易多了。至于后面的理论篇和实战篇,我会在知识星球「晓风数据锂航」内部逐步开放、慢慢完善。
有什么不懂的、需要提问/讨论的,欢迎加入。
