一次失败的kaggle比赛Santander Customer Satisfaction：赛题简介与初次尝试

题目描述：https://www.kaggle.com/c/santander-customer-satisfaction

简单总结：一堆匿名属性；label是0/1；目标是最大化AUC(ROC曲线下的面积)。

第一次尝试：

特征：

由于比赛已经关闭，只能作为测试，我就直接用了暴力搜索提取较好的特征：

[python] view plain copy

一次失败的kaggle比赛Santander Customer Satisfaction：赛题简介与初次尝试

#!!!!!!!!!!!!!!!!!!!!!!!!!!!!!! better use a RFC or GBC as the clf
#!!!!!!!!!!!!!!!!!!!!!!!!!!!!!! because the final predict model are those two
#!!!!!!!!!!!!!!!!!!!!!!!!!!!!!! we should select better feature for RFC or GBC, not for LR
clf = LogisticRegression(class_weight='balanced', penalty='l2', n_jobs=-1)
selectedFeaInds=GreedyFeatureAdd(clf, trainX, trainY, scoreType="auc", goodFeatures=[], maxFeaNum=150)
joblib.dump(selectedFeaInds, 'modelPersistence/selectedFeaInds.pkl')
#selectedFeaInds=joblib.load('modelPersistence/selectedFeaInds.pkl')
trainX=trainX[:,selectedFeaInds]
testX=testX[:,selectedFeaInds]
print trainX.shape

模型：

直接使用sklearn中最常用的三个模型：

[python] view plain copy

一次失败的kaggle比赛Santander Customer Satisfaction：赛题简介与初次尝试

trainN=len(trainY)
print "Creating train and test sets for blending..."
#!!!!!!!!!!!!!!!!!!!!!!!!!!!!!! always use a seed for randomized procedures
models=[
RandomForestClassifier(n_estimators=1999, criterion='gini', n_jobs=-1, random_state=SEED),
RandomForestClassifier(n_estimators=1999, criterion='entropy', n_jobs=-1, random_state=SEED),
ExtraTreesClassifier(n_estimators=1999, criterion='gini', n_jobs=-1, random_state=SEED),
ExtraTreesClassifier(n_estimators=1999, criterion='entropy', n_jobs=-1, random_state=SEED),
GradientBoostingClassifier(learning_rate=0.1, n_estimators=101, subsample=0.6, max_depth=8, random_state=SEED)
]
#StratifiedKFold is a variation of k-fold which returns stratified folds: each set contains approximately the same percentage of samples of each target class as the complete set.
#kfcv=KFold(n=trainN, n_folds=nFold, shuffle=True, random_state=SEED)
kfcv=StratifiedKFold(y=trainY, n_folds=nFold, shuffle=True, random_state=SEED)
dataset_trainBlend=np.zeros( ( trainN, len(models) ) )
dataset_testBlend=np.zeros( ( len(testX), len(models) ) )
meanAUC=0.0
for i, model in enumerate(models):
print "model ", i, "=="*20
dataset_testBlend_j=np.zeros( ( len(testX), nFold ) )
for j, (trainI, testI) in enumerate(kfcv):
print "Fold ", j, "^"*20

最终结果：

通过blending所有模型的结果：

[python] view plain copy

一次失败的kaggle比赛Santander Customer Satisfaction：赛题简介与初次尝试

print "Blending models..."
#!!!!!!!!!!!!!!!!!!!!!!!!!!!!!! if we want to predict some real values, use RidgeCV
model=LogisticRegression(n_jobs=-1)
C=np.linspace(0.001,1.0,1000)
trainAucList=[]
for c in C:
model.C=c
model.fit(dataset_trainBlend,trainY)
trainProba=model.predict_proba(dataset_trainBlend)[:,1]
trainAuc=metrics.roc_auc_score(trainY, trainProba)
trainAucList.append((trainAuc, c))
sortedtrainAucList=sorted(trainAucList)
for trainAuc, c in sortedtrainAucList:
print "c=%f => trainAuc=%f" % (c, trainAuc)

[python] view plain copy

一次失败的kaggle比赛Santander Customer Satisfaction：赛题简介与初次尝试

model.C=sortedtrainAucList[-1][1] #0.05
model.fit(dataset_trainBlend,trainY)
trainProba=model.predict_proba(dataset_trainBlend)[:,1]
print "train auc: %f" % metrics.roc_auc_score(trainY, trainProba) #0.821439
print "model.coef_: ", model.coef_
print "Predict and saving results..."
submitProba=model.predict_proba(dataset_testBlend)[:,1]
df=pd.DataFrame(submitProba)
print df.describe()
SaveFile(submitID, submitProba, fileName="1submit.csv")

归一化：

[python] view plain copy

一次失败的kaggle比赛Santander Customer Satisfaction：赛题简介与初次尝试

print "MinMaxScaler predictions to [0,1]..."
mms=preprocessing.MinMaxScaler(feature_range=(0, 1))
submitProba=mms.fit_transform(submitProba)
df=pd.DataFrame(submitProba)
print df.describe()
SaveFile(submitID, submitProba, fileName="1submitScale.csv")

从测试结果中总结经验：

第一：暴力搜索特征的方式在特征数较多的情况下不可取；较少的情况下可以考虑（<200）

第二：sklearn中的这几个模型，ExtraTreesClassifier效果最差，RandomForestClassifier效果较好且速度比较快，GradientBoostingClassifier结果最好但速度非常慢（因为不能并行）

第三：当某一个模型（GradientBoostingClassifier）比其他模型效果好很多时，不要使用blending的方法（尤其是特征空间一样，分类器类似的情况，比如这里的五个分类器都在同一组特征上建模，而且都是基于树的分类器），因为blending往往会使整体效果低于单独使用最好的一个模型

第四：对于AUC，实际上关心的是样本间的排名，而不是具体数值的大小，所以结果没必要做归一化处理；关于这个结论，自行搜索资料理解

持续更新后续经验，欢迎关注^_^

一次失败的kaggle比赛Santander Customer Satisfaction：赛题简介与初次尝试

继续阅读

[小技巧]- Github访问慢?Kaggle访问慢?

MDD Cup 2017 小记（美团点评内部算法比赛）

NLP原理及基础

kaggle|泰坦尼克号生存预测1.数据分析2.数据处理3.建立模型

Kaggle 泰坦尼克号生存分析(数据概览和缺失值处理部分）Kaggle 泰坦尼克号生存分析缺失值处理

word2vec和常见CNN+RNN网格结构组成的文本分类模型加了word2vec的CNN模型加入了word2vec的RNN模型加入了word2vec的Bi-GRU加入了word2vec的CNN+RNN 串联加入了word2vec的 CNN+RNN 并联

Kaggle Animal Shelter Outcome整个流程

大数据竞赛平台——Kaggle入门

ubuntu 16.04 通过kaggle api从kaggle上快速下载数据

IMDB 5000 Movie Dataset(来自IMDB的5000个电影的数据集)描述

机器学习/深度学习实战——kaggle房价预测比赛实战（机器学习回归算法）

拓端tecdat|R语言Kaggle泰坦尼克号性别阶级模型数据分析案例

XGBoost、LightGBM参数讲解及实战XGBoostLightgbm：对比表

预训练网络的模型微调方法预训练网络的模型微调方法

【Kaggle——Liberty Mutual Group: Property Inspection Prediction】：如何刷入TOP-10

秋招面试准备——机器学习面经统计学习方法部分：