性能评估 发表于 2024-08-07 | 更新于 2026-08-28 | 分类于 机器学习 , 经典算法 针对分类 准确率(Accuracy)准确率:这是机器学习中最直接的指标之一。它定义了模型的准确度。如果你建立的模型能准确分类100条数据中的90条数据,那么你的准确率就是 90% 或 0.90。评估的就是预测结果和真实结果的一致性。 12345678910111213141516# 从头实现def ... 阅读全文 »
交叉检验 发表于 2024-08-07 | 更新于 2026-08-28 | 分类于 机器学习 , 经典算法 交叉检验是构建机器学习模型过程中的一个步骤,它可以帮助我们确保模型准确拟合数据,同时确保我们不会过拟合。起始随着深度学习的兴起,我们可以想想一下,只要我们的特征足够多,那么任何问题我们都可以在训练集达到 100% 的性能。甚至最极端的方法,我们的分析方法甚至于完全可以采用枚举的方法(当然这是不对的) ... 阅读全文 »
特征工程-数据标准化-sklearn 发表于 2024-08-07 | 更新于 2026-08-28 | 分类于 机器学习 , 经典算法 数据标准化sklearn 数据标准化StandardScalerStandardScaler 通过去除均值并缩放至单位方差来标准化特征。数据粗粒逻辑为 $x_{fit} = (x_{row}-mean(x))/std(x)$ 1234from sklearn.preprocess ... 阅读全文 »
数据预处理-特征降维 - PCA 发表于 2024-08-07 | 更新于 2026-08-28 | 分类于 机器学习 , 经典算法 主成分分析,PCA (Principal Component Analysis)主成分分析(PCA)是一种降维方法,通常用于降低大型数据集的维度,通过将大型变量集转换为仍包含大型变量集中大部分信息的较小变量。减少数据集的变量数量自然会以牺牲准确性为代价,但降维的技巧是牺牲一点准确性来换取简单性。因为 ... 阅读全文 »
数据预处理-特征降维 发表于 2024-08-07 | 更新于 2026-08-28 | 分类于 机器学习 , 经典算法 奇异值分解(Singular Value Decomposition,以下简称SVD)是在机器学习领域广泛应用的算法,它不光可以用于降维算法中的特征分解,还可以用于推荐系统,以及自然语言处理等领域。是很多机器学习算法的基石。本文就对SVD的原理做一个总结,并讨论在在PCA降维算法中是如何运用运用S ... 阅读全文 »
数据预处理-特征降维 发表于 2024-08-07 | 更新于 2026-08-28 | 分类于 机器学习 , 经典算法 随着数据爆炸,针对一个项目,我们可以获得许多测量结果,但其中只有一部分对于决策任务有用。尽管机器学习算法(MLA)可以处理大数据,但其性能会随着维度的增加而下降。当属性数量增加时,观察数量也会成比例增加,结果学习模型变得更加复杂。对许多特征进行训练的模型变得强烈依赖于数据,因此导致对未见过的数据的过 ... 阅读全文 »
机器学习和人工智能相关学习资料 发表于 2024-08-07 | 更新于 2026-08-28 | 分类于 机器学习 , 经典算法 《解决几乎所有机器学习问题》是一个打 kaggle 比赛的大佬整理的相关笔记,Approaching (Almost) Any Machine Learning Problem.pdf中文译本在线阅读中文译本 github 仓库 阅读全文 »
VSCode中使用 markdown 的快捷键 发表于 2024-08-06 | 更新于 2026-08-28 | 分类于 工具与环境 , Windows Cell命令模式目前支持的Jupyter Notebook快捷 快捷键 响应 Enter 转入编辑模式 Shift-Enter 运行本单元,选中或插入(最后一个Cell的时候)下个单元 Ctrl-Enter 运行本单元 Alt-Enter 运行本单元,在其下插入新单元 Y ... 阅读全文 »
VSCode中使用 markdown 的快捷键 发表于 2024-08-06 | 更新于 2026-08-28 | 分类于 工具与环境 , Windows 快捷键 响应 Ctrl + k + s 查看与更改键盘快捷方式 Ctrl + b 加粗 加粗 Ctrl + m 放大 放 大 放大 放大 Ctrl + g 跳转到?行 Ctrl + h 查找与替换 Ctrl + j 调出电脑 cmd 控制终端 Ctrl + l 向 ... 阅读全文 »
归一化层(Normalization Layers) 发表于 2024-08-06 | 更新于 2026-08-28 | 分类于 机器学习 , 神经网络 Normalization 层主要解决的问题是希望输入数据能大致分布在相同的空间内,从而让训练更好更快的收敛。 最先提出的 Batch normalization 层对于深度网络的收敛起到了很大的促进作用,于是后续又有多种normalization层提出,这里总结下normlization的相关知识 ... 阅读全文 »