Lec1: 机器学习导论
训练与推断、学习任务、模型族、决策边界、泛化能力和建模流程。
课程导航与课程讲次
课程讲次
文章目录
基本概念
机器学习通过数据或交互经验确定模型参数,使模型能够处理新输入。训练根据数据拟合参数,推断使用已有参数生成预测。
是样本数, 是特征向量, 是标签。将样本按行排列,得到特征矩阵:
AI 包括学习、搜索、规划、推理等方法;ML 是其中一类方法;深度学习使用多层神经网络进行学习。类别编号、邮政编码等数值不一定具有连续数量或距离的含义。
学习任务
| 范式 | 训练信号 | 典型任务 |
|---|---|---|
| 监督学习 | 输入与目标配对 | 分类、回归 |
| 无监督学习 | 主要使用输入本身 | 聚类、降维、密度估计 |
| 自监督学习 | 从数据本身构造目标 | 根据文本前缀预测下一个词元 |
| 强化学习 | 与环境交互获得奖励 | 多步决策、控制 |
分类预测离散类别,回归预测连续数值。无监督学习没有外部标签,但仍需要学习目标;“生成式”描述建模或输出方式,可以与上述训练范式交叉。
模型与决策边界
模型族是候选函数的集合:
二分类线性模型为:
决策边界满足:
决定边界法向方向, 决定位置。二维边界为直线,高维为超平面。决策树通过一系列条件划分输入空间,单特征阈值分裂产生与坐标轴平行的边界。
课件饮料例子的规则为:
它在五个训练样本上全部预测正确,但仍需独立数据判断泛化表现。
泛化与过拟合
经验风险衡量训练表现:
真正希望控制的是目标分布上的期望损失:
查表模型可以记住训练标签,却不一定能处理新输入。过拟合指模型对训练数据的偶然性过度适应,未能改善新数据上的表现。
多个模型可能同样符合训练数据。选择模型族、特征和正则化,相当于引入归纳偏置,决定优先相信哪些规律能够推广。
建模流程
| 阶段 | 关键问题 |
|---|---|
| 定义任务 | 预测什么、何时预测、怎样衡量成功 |
| 准备数据 | 样本是什么、输入是否可获得、如何划分数据 |
| 设计模型 | 使用什么特征、函数集合和假设 |
| 优化参数 | 用什么损失与算法拟合模型 |
| 评价预测 | 是否优于基线、各类错误代价如何 |
模型形式、损失函数、优化算法是不同概念。训练目标最优不等于泛化最优;测试表现也只对相应评估分布提供证据。
适合机器学习的问题通常容易通过样例展示、输出可以评价,但完整规则难以直接描述。已有准确且成本低的确定算法时,应优先使用该算法。

