1. 首页
  2. 综合百科
  3. 统计和数据科学口诀(不可不知的数据科学入门数学指南)

统计和数据科学口诀(不可不知的数据科学入门数学指南)

简介:关于统计和数据科学口诀(不可不知的数据科学入门数学指南)的相关疑问,相信很多朋友对此并不是非常清楚,为了帮助大家了解相关知识要点,小编为大家整理出如下讲解内容,希望下面的内容对大家有帮助!
如果有更好的建议或者想看更多关于综合百科技术大全及相关资讯,可以多多关注茶馆百科网。

展示宇宙,普及科学知识。为你分享有趣的百科人文。单纯的看世界。传播生活小窍门,解决大家生活中的烦恼,开心每一天。本文内容转自机器之心微信微信官方账号。

关注多多数学网,每天获取更多有趣的数学文章。

选自dataquest

作者:兰德尔霍尔

机器心脏编译

参加:极客AI,高璇。

想入坑数据科学却不知道如何下手?让我们来看看这本数据科学入门数学指南!

数学就像一只章鱼:它的触角几乎可以触及所有的学科。虽然有些学科只触及数学的边缘,但有些学科却被数学的触角紧紧缠住。数据科学属于后者。如果你想从事数据科学的工作,你必须解决数学问题。如果你已经获得了数学学位或其他强调数学技能的学位,你可能想知道你所学的所有知识是否都是必要的。而如果你没有相关背景,你可能想知道:从事数据科学工作需要多少数学知识?在本文中,我们将讨论数据科学意味着什么,以及我们需要多少数学知识。先说“数据科学”的实际含义。

理解数据科学是一件“仁者见仁,智者见智”的事情!在Dataquest,我们将数据科学定义为使用数据和高级统计学进行预测的学科。这是一门专业学科,侧重于理解有时令人困惑和不一致的数据(虽然数据科学家解决的问题因人而异)。统计学是这个定义中唯一提到的数学学科,但是数据科学经常涉及数学中的其他领域。学习统计学是一个很好的开始,但是数据科学也是用算法来做预测的。这些算法叫做机器学习算法,有好几百种。讨论每种算法需要多少数学知识,不在本文讨论范围之内。本文将讨论以下常用算法所需的数学知识:

朴素贝叶斯线性回归Logistic回归K-Means聚类决策树现在我们来看看每个算法实际需要哪些数学知识!

朴素贝叶斯分类器

定义:朴素贝叶斯分类器是基于相同原理的一系列算法,即特定特征值独立于任何其他特征值。朴素贝叶斯允许我们根据已知的相关事件的条件来预测事件发生的概率。名字来源于贝叶斯定理,数学公式如下:

有事件a和事件B,P(B)不等于0。这看起来很复杂,但是我们可以把它分成三个部分:

P(A|B)是一个条件概率。也就是事件B发生的条件下,事件A发生的概率。P(B|A)也是条件概率。也就是事件A发生的条件下,事件B发生的概率。P(A)和P(B)是事件A和事件B分别发生的概率,它们是相互独立的。所需数学知识:如果想了解朴素贝叶斯分类器算法的基本原理和贝叶斯定理的所有用途,一门概率论课程就够了。

线性回归

定义:线性回归是最基本的回归类型。它帮助我们理解两个连续变量之间的关系。简单的线性回归就是得到一组数据点,画出一条趋势线,可以用来预测未来。线性回归是参数化机器学习的一个例子。在参数化机器学习中,训练过程使机器学习算法成为一个数学函数,它可以拟合在训练集中找到的模式。然后,您可以使用这个数学函数来预测未来的结果。在机器学习中,数学函数被称为模型。在线性回归的情况下,模型可以表示为:

其中a_1,a_2,…,a_n代表数据集的具体参数值,x_1,x_2,…,x_n代表我们选择在最终模型中使用的特征列,y代表目标列。线性回归的目标是找到能够描述特征列和目标列之间关系的最佳参数值。换句话说,就是找到最符合数据的直线,从而根据直线的趋势来预测未来的结果。

为了找到线性回归模型的最佳参数,应该使模型的残差平方和最小。残差也叫误差,用来描述预测值与真实值之间的差异。残差平方和的公式可以表示为:

其中y是目标列的预测值,y是真实值。

所需数学知识:如果你只是想对线性回归有一个简单的了解,那就上一门基础统计学的课程。如果你想对概念有深入的理解,你可能需要知道如何推导残差平方和的公式,这个公式在大多数高级统计课程中都有介绍。

逻辑回归

定义:Logistic回归主要是在因变量为二元(即只有两个值,0和1代表输出结果)的情况下,估计事件发生的概率。像线性回归一样,逻辑回归是参数化机器学习的一个例子。所以这些机器学习算法的训练结果就是得到一个最能近似训练集中模式的数学函数。不同之处在于,线性回归模型输出实数,而逻辑回归模型输出概率值。

正如线性回归算法生成线性函数模型一样,逻辑回归算法生成逻辑函数模型。也称为Sigmoid函数,它将所有输入值映射到0到1之间的概率结果。Sigmoid函数可以表示如下:

那么为什么Sigmoid函数总是返回0到1之间的值呢?记住,代数中任何一个数的负幂都等于这个数的正幂的倒数。

必要的数学知识:我们已经在这里讨论了指数和概率。你需要对代数和概率有充分的了解,才能理解Logistic算法的工作原理。

。如果你想深入了解概念,我建议你学习概率论以及离散数学或实数分析。

K-Means 聚类

定义:K Means 聚类算法是一种无监督机器学习,用于对无标签数据(即没有定义的类别或分组)进行归类。该算法的工作原理是发掘出数据中的聚类簇,其中聚类簇的数量由 k 表示。然后进行迭代,根据特征将每个数据点分配给 k 个簇中的一个。K 均值聚类依赖贯穿于整个算法中的距离概念将数据点「分配」到不同的簇中。距离的概念是指两个给定项之间的空间大小。在数学中,描述集合中任意两个元素之间距离的函数称为距离函数或度量。其中有两种常用类型:欧氏距离和曼哈顿距离。欧氏距离的标准定义如下:

其中 (x1,y1) 和 (x2,y2) 是笛卡尔平面上的坐标点。虽然欧氏距离应用面很广,但在某些情况下也不起作用。假设你在一个大城市散步;如果有一个巨大的建筑阻挡你的路线,这时你说「我与目的地相距 6.5 个单位」是没有意义的。为了解决这个问题,我们可以使用曼哈顿距离。曼哈顿距离公式如下:

其中 (x1,y1) 和 (x2,y2) 是笛卡尔平面上的坐标点。

所需数学知识:实际上你只需要知道加减法,并理解代数的基础知识,就可以掌握距离公式。但是为了深入了解每种度量所包含的基本几何类型,我建议学习一下包含欧氏几何和非欧氏几何的几何学。为了深入理解度量和度量空间的含义,我会阅读数学分析并选修实数分析的课程。

决策树

定义:决策树是类似流程图的树结构,它使用分支方法来说明决策的每个可能结果。树中的每个节点代表对特定变量的测试,每个分支都是该测试的结果。决策树依赖于信息论的理论来确定它们是如何构建的。在信息论中,人们对某个事件的了解越多,他们能从中获取的新信息就越少。信息论的关键指标之一被称为熵。熵是对给定变量的不确定性量进行量化的度量。熵可以被表示为:

在上式中,P(x_i) 是随机事件 x_i 发生的概率。对数的底数 b 可以是任何大于 0 的实数;通常底数的值为 2、e(2.71)和 10。像「S」的花式符号是求和符号,即可以连续地将求和符号之外的函数相加,相加的次数取决于求和的下限和上限。在计算熵之后,我们可以通过利用信息增益开始构造决策树,从而判断哪种分裂方法能最大程度地减少熵。信息增益的公式如下:

信息增益可以衡量信息量,即获得多少「比特」信息。在决策树的情况下,我们可以计算数据集中每列的信息增益,以便找到哪列将为我们提供最大的信息增益,然后在该列上进行分裂。

所需数学知识:想初步理解决策树只需基本的代数和概率知识。如果你想要对概率和对数进行深入的概念性理解,我推荐你学习概率论和代数课程。

最后的思考

如果你还在上学,我强烈建议你选修一些纯数学和应用数学课程。它们有时肯定会让人感到畏惧,但是令人欣慰的是,当你遇到这些算法并知道如何最好地利用它们时,你会更有能力。如果你目前没有在上学,我建议你去最近的书店,阅读本文中提到的相关书籍。如果你能找到涉及概率论、统计学和线性代数的书籍,我强烈建议你选择涵盖这些主题的书籍,以真正了解本文涉及到的和那些未涉及到的机器学习算法背后的原理。

原文链接:https://www.dataquest.io/blog/math-in-data-science/

关注 哆嗒数学网 每天获得更多数学趣文

, 纪录美好生活,一起观趣事,这里包罗万象,这里是信息的海洋,这里有你看不见的故事。

本文主要介绍了关于统计和数据科学口诀(不可不知的数据科学入门数学指南)的相关养殖或种植技术,综合百科栏目还介绍了该行业生产经营方式及经营管理,关注综合百科发展动向,注重系统性、科学性、实用性和先进性,内容全面新颖、重点突出、通俗易懂,全面给您讲解综合百科技术怎么管理的要点,是您综合百科致富的点金石。
以上文章来自互联网,不代表本人立场,如需删除,请注明该网址:http://23.234.50.4:8411/article/1069743.html