分享
Task2:入门lightgbm,开始特征工程
输入“/”快速插入内容
⚡
Task2:入门lightgbm,开始特征工程
2024年7月4日创建
14897
19665
29
24
💡
教程贡献者说:
前面我们在
从零入门机器学习竞赛
(
即Task1
)
中介绍了赛题
,并给出基于经验模型的baseline完成了预测任务。
本Task中,我们的任务是
使用进阶的
机器学习模型lightgbm
解决本次问题,以达到更好的预测效果。
你可以从中学会
•
使用数据集绘制柱状图和折线图
,
•
使用时间序列数据构建历史平移特征和窗口统计特征
,
•
使用lightgbm模型进行训练并预测
。
特征工程
是参
与机器学习竞赛
的重要环节
,可以通过
观察数据
并
结合专业背景知识
改善特征或者构建新的
特征
。
机器学习中的一个经典理论是:
数据和特征决定了机器学习的上限,而模型和算法只是逼近这个上限
。
进阶思路Q&A
•
解决该问题常见的几种思路是什么?
本次问题是回归预测,能够取得不错效果的话,
常规思路一般为使用机器学习
模型
,如LightGBM、XGBoost,或者使用深度学习
模型(神经网络等)
进行实践,在模型的搭建上就比较复杂,需要自己构建模型结构,对于数值数据需要进行标准化处理;
•
Task2版本的教程使用什么思路?
task1 的baseline我们是基于经验模型(使用均值作为结果数据)来解决的问题
Task2
版本教程
将
使用机器学习模型解决本次问题,模型使用简单,数据不需要过多预处理;
使用机器学习方法一般主要需要从
获取数据&增强
、
特征提取
和
模型
三个方面下手。
•
使用机器学习方法
有哪几个步骤?
一般的使用机器学习模型解决问题的
主要步骤为
探索性数据分析、
数据预处理、提取特征、切分训练集与验证集、训练模型、预测结果。
基础概念入门
GBDT
GBDT (Gradient Boosting Decision Tree) 是机器学习中一个长盛不衰的模型,其主要思想是利用弱分类器(决策树)迭代训练以得到最优模型,该模型具有训练效果好、不易过拟合等优点。
GBDT不仅在工业界应用广泛,通常被用于多分类、点击率预测、搜索排序等任务;在各种数据挖掘竞赛中也是致命武器,
据统计
Kaggle
上的比赛有一半以上的冠军方案都是基于GBDT
。
LightGBM
LightGBM(Light Gradient Boosting Machine)是一个实现GBDT算法的框架,支持高效率的并行训练,并且具有更快的训练速度、更低的内存消耗、更好的准确率、支持分布式可以快速处理海量数据等优点。
LightGBM 框架中还包括随机森林和逻辑回归等模型。通常应用于二分类、多分类和排序等场景。
例如:在个性化商品推荐场景中,通常需要做点击预估模型。使用用户过往的行为(点击、曝光未点击、购买等)作为训练数据,来预测用户点击或购买的概率。根据用户行为和用户属性提取一些特征,包括:
•
类别特征(Categorical Feature):字符串类型,如性别(男/女)。
•
物品类型:服饰、玩具和电子等。
•
数值特征(Numrical Feature):整型或浮点型,如用户活跃度或商品价格等。
更多内容可见
LightGBM 中文文档
、
LightGBM英文文档
进阶代码详解
完整代码如下:
(1)导入模块
此部分包含代码所需的模块