1.特征编码1.1独热编码。如红\绿\蓝没有顺序高低差异。可以用0,1,21,2,3分别表示进行赋值。1.2标签编码。如小学\初中\高中\大学 存在递进高低顺序。可以用三个数值表示一个对象100,010,001来分别表示。2.划分数据集通常按8:2或7:3来划分训练集通常多一些。3.常见模型逻辑回归决策数支持向量机随机森林XGboost4.机器学习和深度学习的区别。机器学习的模型是已封装的而深度学习的模型内容还有修改的空间5.人为设定的参数信息称为外参超参。在模型训练后得到的参数信息称为内参这部分参数信息是拟合后的不可人为修改。6.模型实例化其实就是训练模型中选择模型并选择外参的过程讲得很厉害的样子只是为了理论化在老板面前装b。6.1外参也可以不选择这样模型会使用默认的外参。7.混淆矩阵分类问题的一种评估办法。分四种情况tp预测正确的是fp预测错误的是tn预测正确的否fn预测错误的否。7.1用医疗患病预测举例tp和tn为最佳预测结果其次是fp虽然可能提高成本但不会造成更严重的问题fn最差预测结果病情恶化应尽量避免。要减少漏报采用召回率进行模型评估7.2用邮件拦截举例tp和tn为最佳预测结果其次是fn虽然不能拦截垃圾邮件但还可以手动再清除fp最差预测结果可能把重要文件拦截删除应尽量避免。要减少误报采用精确率进行模型评估7.3准确率适合综合效果的模型评估。8.回归问题的模型评估。8.1 mse对大误差敏感关注极端值的误差但脱落实际数值误差8.2 rmse对大误差敏感误差单位不变8.3 mae对大误差不敏感少量异常值使用9.1 r^2,数值越大预测越精准误差越小10.评估指标选择的依据1.模型处理本身的需要 2.前人的科学做法。