Oasis's Cloud

一个人的首要责任,就是要有雄心。雄心是一种高尚的激情,它可以采取多种合理的形式。
—— 《一个数学家的辩白》

白话机器学习的数学

作者:oasis


机器学习的两个方向:回归和分类。

  • 回归:例如根据历史数据预测未来广告点击率。
  • 分类:分类等同于标签,例如学生在某个分数线之上打成绩良好、此分数线之下打成绩一般。分类是对数据特征的学习,需要使用向量进行计算。

机器学习的工程实践步骤如下:

  1. 需求与问题定义:明确业务目标、判定任务类型(分类 / 回归 / 聚类等)
  2. 数据收集:获取原始数据集
  3. 数据预处理:清洗、降噪、特征工程、数据集划分(训练 / 验证 / 测试集)
  4. 模型选型与建模:挑选适配算法、搭建模型结构
  5. 模型训练:输入训练集,借助梯度下降等优化算法迭代更新参数、拟合数据
  6. 模型评估与验证:用验证 / 测试集检验效果,查看指标、排查过拟合 / 欠拟合
  7. 模型调优:调参、优化特征、更换模型,反复迭代
  8. 部署与监控:模型上线,线上持续监控效果

前置数学知识

微分和偏微分

微分

  • 规则 1(幂函数):若 f(x)=xn,则 f(x)=nxn1
  • 规则 2(常数倍):若 f(x)=cg(x),则 f(x)=cg(x)
  • 规则 3(和与差):(f±g)=f±g
  • 规则 4(乘积法则):(fg)=fg+fg
  • 规则 5(链式法则):若 h(x)=f(g(x)),则 h(x)=f(g(x))g(x)

向量

T=[ab]

直线的法向量 与 该直线的方向向量,内积一定为 0。 wx=0

内积的大小,反映了「另一条直线」偏向法线方向的程度:

  • 内积 = 0:完全不偏向法线(和原直线平行)
  • 内积 > 0:偏向法线一侧
  • 内积 < 0:偏向法线反方向
  • 绝对值越大,越靠近法线方向

实向量空间的内积是各相应元素乘积的和。

wx=inwixi=0

回归

《白话机器学习的数学》通过广告投放和点击量的例子讲解回归:

  1. 根据问题设计模型函数:fθ(x)=θ0+θ1x
  2. 根据模型函数设计目标函数:E(θ)=12i=1n(y(i)fθ(x(i)))2

目标函数的思想是:对每条样本,计算真实广告点击量 y(i) 与预测值 fθ(x(i)) 之差的平方,将所有样本求和后乘以 12

  1. 求解目标函数的方式
    • 梯度下降θj:=θjηθjE(θ),其中 η 为学习率。此值需要根据数据尝试;太大则下降过快、可能出现震荡甚至无法收敛
    • 多项式回归:将 fθ(x)=θ0+θ1x 扩展为 fθ(x)=θ0+θ1x+θ2x2。一次函数表示直线,而实际数据分布往往更适合用曲线拟合
    • 多重回归:利用多个特征 x1,x2,,模型形如 fθ(x)=θ0+θ1x1+θ2x2+。之后分别求解每个特征的解。
    • 随机梯度下降:每次只取一个(或一小批)样本计算梯度并更新 θ,适合大规模数据。为什么引入随机梯度下降?像爬山算法出现局部最优解,所以增加随机游走的机制,寻找到全局最优解。

整体算法的目标:求出合适的 θ。随机初始化 θ,计算当前目标函数值;根据自行设置的迭代次数或误差变化量作为循环终止条件,通过梯度下降更新 θ,再计算新的误差值。

分类

《白话机器学习的数学》通过图像面积分类为长方形或正方形的例子讲解分类:

  1. 问题分析。将图像分为长方形或正方形是二分类问题。

  2. 从图标的方式可直观看到二分类问题中间有一条明显的分界线,数学中的向量内积可以表示这样的模型。

  3. 如何找到分界线? 感知机:模拟神经元链接的实现方式。感知机只能处理线性可分。

感知机是接受多个输入后将每个值和各自的权重相乘,最后输出总和的模型。

  1. 逻辑回归解决线性不可分问题:

    • sigmoid 函数
    • 决策边界
  2. 求解参数的更新表达式

    • 似然函数
    • 对数似然函数

评估