9.18
一、 上午:数据库原理概述与跆拳道的“基本功”
上午的数据库原理课,老师为我们讲解了数据库的概述知识。结合之前的工业软件展示,我现在越来越能理解,数据库绝不仅仅是“存数据的地方”,它是现代软件系统中保障数据一致性、安全性和可用性的地基。无论是桥梁测试系统还是小型企业的出账入账系统,底层的核心逻辑都离不开数据库的支撑。
到了体育课,我选的是跆拳道。今天了解了跆拳道的基本知识,学习了正踢腿和相关的准备动作。虽然只是基础动作,但一次次练习正踢腿,体会发力点和身体平衡的过程,让我联想到了编程。
无论是跆拳道的踢腿,还是写代码、学数学,基本功都是最重要的。 动作不标准,后面就无法进行高难度组合;同理,数据预处理没做好,后面的机器学习模型就不可能准确。
二、 下午:中华民族共同体概论与AI数学基础
下午的中华民族共同体概论课,老师进行了基础知识的铺垫。虽然作为工科生,这类课程看似与代码无关,但它带给我们的宏观视野、大局观以及思考问题的多维角度,对我们未来设计复杂软件系统、理解用户社会需求同样大有裨益。
但今天真正让我“烧脑”并大呼过瘾的,是下午的人工智能数学基础课。老师在课件上展示的内容,堪称机器学习入门的一站式框架。我结合课件和自己的思考,把它系统地梳理出来:
-
监督学习与分类任务
课程从“计算机判断西瓜是否好瓜”的案例切入。我们了解了数据集、样本、属性/特征、特征值、标签这些核心概念。监督学习(Supervised Learning)是指我们拥有带有标签的数据(比如“好瓜”或“坏瓜”),常用的任务包括分类(带有离散分类标签,如垃圾邮件分类、肿瘤良性/恶性判断)和回归。常见的分类算法包括逻辑回归、支持向量机(SVM)、决策树、随机森林、朴素贝叶斯和神经网络等。 -
数据规范化与离散化(核心预处理)
课件非常详细地讲解了数据变换的方法。由于不同特征的单位量级差异很大,必须消除量纲影响。
数据规范化:
Min-Max规范化:公式为 x' = (x - min) / (max - min)。它把特征线性缩放到 [0,1] 范围。适合特征有明确上下界的情况,保留原始分布形状,但缺点是受异常值影响大,新极值会改变缩放结果。
Z-score标准化:公式为 z = (x - μ) / σ。转化为均值为0、标准差为1的尺度。它适合近似正态分布的数据,含义清晰(离平均多少标准差),常用于逻辑回归、SVM、KNN等算法。
小数定标规范化:公式为 x' = x / 10^j。通过移动小数点位置缩放数据,计算简单、速度快,适合作为快速处理方案。
数据离散化:
等宽离散化:公式 区间宽度 = (max - min) / K。实现简单,但如果数据分布不均匀,某些区间的样本会过多或过少。
等频离散化:按频率划分区间,每个区间包含相近数量的数据点。样本数量均衡,但区间宽度可能不自然,边界解释性弱。
基于聚类与决策树的离散化:K-means算法能根据数据分布自动划分(计算复杂度高);决策树利用连续变量切分形成可解释区间(依赖标签,可能过拟合)。
课堂判断:离散化并非总是提升性能!当需要高可解释性时更常用,连续模型则未必需要。
- 特征选择与特征提取
课件特别提醒,维度过高会带来稀疏、过拟合、计算成本和解释性问题。
特征选择:从原始特征集中选出最有代表性的子集,保留原始特征含义,即“挑出原特征”。
特征提取:通过变换或映射构造新的特征空间,减少维度并保留主要信息,例如主成分分析(PCA),即“变换出新特征”。
- 文本特征提取:从词袋模型到Word2Vec
词袋模型(Bag of Words):将文本看作词语的集合,忽略语法和语序,只关注词频。就像把所有词放进一个“袋子”,统计出现次数。
TF-IDF模型:用于评估一个字词对某份文档的重要程度。词频(TF)越高,逆文档频率(IDF)越大,说明该词区分能力强。
课堂剖析的局限:TF-IDF主要统计出现情况,并不真正理解语义和上下文。例如“苹果很好吃”和“苹果公司发布新手机”中的“苹果”,TF-IDF看到的可能是同一个词,但实际上一个指水果,一个指公司。
Word2Vec:包含两个经典模型——CBOW(通过上下文预测目标单词)和Skip-gram(通过目标单词预测上下文),可以将单词映射到低维向量空间(如 [0.12, 0.34, ...])。
n-gram:基于马尔可夫假设,当前词只与前面 n-1 个词有关。用来估计一个词序列出现的概率。
- 图像特征提取
要想让计算机“理解”图像,就需要提取有用的数据或信息。
颜色特征:描述表面性质(颜色直方图、RGB/HSV统计)。
纹理特征:描述表面纹理(粗糙度、重复模式、LBP/GLCM/Gabor)。
形状特征:描述外形边界(边缘、轮廓、角点/区域矩)。
空间关系特征:描述位置关系(邻接、包含、距离/相对位置)。
完整流程:原始图像像素矩阵 -> 预处理(缩放、去噪、灰度化/归一化) -> 特征提取 -> 特征向量 -> 模型学习(分类/检测/识别) -> 输出结果(如:Dog)。
工程提醒:特征提取不是越多越好,要同时考虑区分性、稳定性、冗余度和计算成本。
- 经验误差与过拟合(最重要的反思)
机器学习的目标是让模型很好地适用于“新样本”,这种能力叫泛化能力。但我们在训练过程中往往会遇到“过拟合”。
我们通过错误率 E = a/m 来评估。误差分为训练误差、测试误差和泛化误差。
什么是过拟合和欠拟合? 老师用了一个非常直观的类比:训练样本都是带有锯齿的树叶。
过拟合模型看到一片没有锯齿的树叶,会分类为“不是树叶”(误以为树叶必须有锯齿)。
欠拟合模型看到一棵绿色的树,会分类为“是树叶”(误以为绿色的都是树叶)。
过拟合的常见成因:模型复杂度过高、参数过多;训练时间过长,追逐了噪声;样本量小、特征维度高;标签噪声或异常值多;数据泄露。
常见的缓解手段:L1/L2正则化、剪枝、Dropout;早停(Early Stopping);增加数据或数据增强;降维、特征选择、简化模型;严格隔离训练/验证/测试流程。
课堂辨析:
现象A:训练准确率65%,测试63% -> 两者都低,首先怀疑欠拟合。
现象B:训练99%,测试76% -> 差距很大,典型过拟合。
现象C:都在持续改善,差距稳定 -> 继续训练可能仍有收益。
现象D:测试先升后降,训练持续上升 -> 可在验证最优点早停。
判断关键:不要只看单个误差值,而要同时看训练误差、测试误差及其随训练过程的变化。
三、 今日反思与总结
今天的信息量非常大,但我感到非常充实。无论是上午的跆拳道正踢腿、数据库原理,还是下午的中华民族共同体概论,以及这堂干货满满的AI数学基础课,其实都在传递一个核心逻辑:万丈高楼平地起。
机器学习模型的准确率,不取决于花哨的算法,而取决于数据预处理(规范化、离散化)、特征提取(文本、图像)这些最基础、最耗时的环节。同样,我们的学习也是一个不断“调参”和“防止过拟合”的过程。不能死记硬背(过拟合),也不能浅尝辄止(欠拟合),要掌握背后的规律,具备泛化能力。
晚上背单词的时候,我脑海里还在回想着今天课堂上讲到的“特征提取”。也许我们背单词,也是在为大脑提取“文本特征”,让自己能更好地理解这个世界。

浙公网安备 33010602011771号