← Back to Home

这一课讲什么

问一个学生"你怎么认出 8",多半答"两个圈"。可数据说:真实手写的 8 只有 58.5% 真有两个圈, 开口的 4 更是只有 9% 有洞——人类以为自己靠结构认字,但结构特征在潦草笔迹面前碎了一地。 这一课从这个认知冲突出发,走一条反直觉的路:什么特征都不设计,把图像当向量、 拿距离说话,一路从 82% 爬到 97%+,途中经过质心、k-NN、预处理、切割、域偏移、 距离函数七个站点——每个站点都有真实数据和可以上手玩的页面。

方法阶梯(MNIST 测试集 1 万张实测)
拓扑特征(数洞)25.6%
质心:每类平均成 1 张82.1%
30 模板:每类 3 种写法87.2%
k-NN:6 万张全背下来95.8%
+ 平移容忍(线上页面)96.6%
+ 软匹配距离(离线实验)97.8%

一条轴讲完"抽象 ↔ 记忆":平均得越狠越轻巧,记得越多越准确;再往上的每一格都来自"换一把更宽容的尺子"。 神经网络(99%+)留作下一课的悬念。

四个页面

课堂流程建议

1. 开场打脸(10 分钟)
"你怎么认出 8?"——收集答案,用数据揭晓:两个圈的 8 只有 58.5%,数洞分类只有 25.6%。人类的特征直觉在潦草笔迹前失效。
2. 图像即向量(15 分钟)
8×8 手算示例:图像就是数字表格,就是 784 维空间里的点。"训练"退化成求平均——板书算一次质心距离。
3. 实验室互动(20 分钟)
Part 1 页面轮流上手:写怪字骗模型、切换四种模式看阶梯、观察 k-NN 的"判案证据"。顺带讲训练/测试分离。
4. 预处理的功劳(10 分钟)
平移实验:挪 5 个像素,82% 跌回 13%(瞎猜水平)。MNIST 帮你做了裁剪、缩放、居中——真实世界里这是你自己的活。
5. 从一个字到一串字(20 分钟)
Part 2 页面:切割模块登场。故意写连笔看"连笔点补刀",关掉自动切割体会固定阈值的两难。96% 的单字 = 0.96¹¹ ≈ 64% 的串——系统的短板效应。
6. 出门考试(15 分钟)
Part 3 案例页:域偏移、本地题库、标签泄漏三课连上。帽子 1 被冤枉成 4 的案例让"分布匹配"变得具体。
7. 专题收尾(10 分钟)
Part 4 解剖 8:几何上它被五面包围,但换把宽容的尺子(软匹配)错误砍掉四分之三。距离函数就是模型的"相似性理论"——而让机器自己学特征和尺子,就是神经网络,下一课见。

贯穿全课的一句话

识别系统的上限,往往不在最后那个分类器,而在它前面的每一步:数据怎么整理(预处理)、 问题怎么切(分割)、相似怎么定义(距离)、数据从哪来(分布)。 模型只是最后一公里——这句话对数学建模竞赛同样成立。