视频加载失败

Lec1: 机器学习导论

训练与推断、学习任务、模型族、决策边界、泛化能力和建模流程。

课程导航与课程讲次
课程讲次
文章目录

基本概念#

机器学习通过数据或交互经验确定模型参数,使模型能够处理新输入。训练根据数据拟合参数,推断使用已有参数生成预测。

D={(xi,yi)}i=1N,y^=fθ^(x).\mathcal D=\{(x_i,y_i)\}_{i=1}^{N},\qquad \hat y=f_{\hat\theta}(x).

NN 是样本数,xi∈Rdx_i\in\mathbb R^d 是特征向量,yiy_i 是标签。将样本按行排列,得到特征矩阵:

X=[x1T⋮xNT]∈RN×d.X=\begin{bmatrix}x_1^{\mathsf T}\\\vdots\\x_N^{\mathsf T}\end{bmatrix} \in\mathbb R^{N\times d}.

AI 包括学习、搜索、规划、推理等方法;ML 是其中一类方法;深度学习使用多层神经网络进行学习。类别编号、邮政编码等数值不一定具有连续数量或距离的含义。

学习任务#

范式训练信号典型任务
监督学习输入与目标配对分类、回归
无监督学习主要使用输入本身聚类、降维、密度估计
自监督学习从数据本身构造目标根据文本前缀预测下一个词元
强化学习与环境交互获得奖励多步决策、控制

分类预测离散类别,回归预测连续数值。无监督学习没有外部标签,但仍需要学习目标;“生成式”描述建模或输出方式,可以与上述训练范式交叉。

模型与决策边界#

模型族是候选函数的集合:

H={fθ:θ∈Θ}.\mathcal H=\{f_\theta:\theta\in\Theta\}.

二分类线性模型为:

fw,b(x)=1{wTx+b≥0}.f_{w,b}(x)=\mathbf1\{w^{\mathsf T}x+b\geq0\}.

决策边界满足:

wTx+b=0.w^{\mathsf T}x+b=0.

ww 决定边界法向方向,bb 决定位置。二维边界为直线,高维为超平面。决策树通过一系列条件划分输入空间,单特征阈值分裂产生与坐标轴平行的边界。

课件饮料例子的规则为:

f(A,S)=1{A+S≥1.3}.f(A,S)=\mathbf1\{A+S\geq1.3\}.

它在五个训练样本上全部预测正确,但仍需独立数据判断泛化表现。

泛化与过拟合#

经验风险衡量训练表现:

R^(f)=1N∑i=1Nℓ(f(xi),yi).\hat R(f)=\frac1N\sum_{i=1}^{N}\ell(f(x_i),y_i).

真正希望控制的是目标分布上的期望损失:

R(f)=E(X,Y)∼P[ℓ(f(X),Y)].R(f)=\mathbb E_{(X,Y)\sim P}[\ell(f(X),Y)].

查表模型可以记住训练标签,却不一定能处理新输入。过拟合指模型对训练数据的偶然性过度适应,未能改善新数据上的表现。

多个模型可能同样符合训练数据。选择模型族、特征和正则化,相当于引入归纳偏置,决定优先相信哪些规律能够推广。

建模流程#

阶段关键问题
定义任务预测什么、何时预测、怎样衡量成功
准备数据样本是什么、输入是否可获得、如何划分数据
设计模型使用什么特征、函数集合和假设
优化参数用什么损失与算法拟合模型
评价预测是否优于基线、各类错误代价如何

模型形式、损失函数、优化算法是不同概念。训练目标最优不等于泛化最优;测试表现也只对相应评估分布提供证据。

适合机器学习的问题通常容易通过样例展示、输出可以评价,但完整规则难以直接描述。已有准确且成本低的确定算法时,应优先使用该算法。

文章目录