文章分类 - 机器学习
1
摘要:转自:https://www.jianshu.com/p/f59bf24850c9 一.互联网广告特征工程 博文《互联网广告综述之点击率系统》论述了互联网广告的点击率系统,可以看到,其中的logistic regression模型是比较简单而且实用的,其训练方法虽然有多种,但目标是一致的,训练结果对
阅读全文
摘要:转自:https://zhuanlan.zhihu.com/p/40231966 kaggle竞赛本质上是套路的竞赛。这篇文章讲讲kaggle竞赛里categorical feature的常用处理套路,主要基于树模型(lightgbm,xgboost, etc.)。重点是target encodin
阅读全文
摘要:转自:https://blog.csdn.net/anshuai_aw1/article/details/83275299 本篇文章主要参考柯国霖大神在知乎上的回答,以及自己阅读LGBM的部分源码整理而来。 1、one-hot编码弊端 one-hot编码是处理类别特征的一个通用方法,然而在树模型中,
阅读全文
摘要:转自:https://www.jianshu.com/p/d07f0b0726da 之前一直使用的集成回归树模型都是RF,Xgboost,GBDT这三个,其中RF是bagging思想,Xgboost和GBDT是boosting思想。但是在尝试了微软开源的Lightgbm之后,感觉再也回不去了。这款横
阅读全文
摘要:转自:https://zhuanlan.zhihu.com/p/28768447 机器学习模型的可解释性是个让人头痛的问题。在使用LightGBM模型的肯定对生成的GBDT的结构是好奇的,我也好奇,所以就解析一个LightGBM的模型文件看看,通过这个解析,你可以看懂GBDT的结构。 另外,了解模型
阅读全文
摘要:转自:https://blog.csdn.net/lanyu_01/article/details/80097350?utm_source=blogxgwz0 目录: 1 Continuous Bag-of-Word Model 1.1 One-word context Update equatio
阅读全文
摘要:转载:https://www.cnblogs.com/ybf-yyj/p/8111498.html paddlepaddle是百度提出来的深度学习的框架,个人感觉其实和tensorflow差不多(语法上面),因为本人也是初学者,也不是很懂tensorflow,所以,这些都是个人观点。 百度的padd
阅读全文
摘要:转自:https://blog.csdn.net/SEUer_jeff/article/details/79450152 本博主最近在准备学习入手百度的深度学习架构-PaddlePaddle,本博客是本博主在学习的过程中的一些心得,写下是为了分享一些自己的心得,也是为了方便自己以后查看。 本文章主要
阅读全文
摘要:转自:https://blog.csdn.net/qq_35571432/article/details/78629782 首先先放其代码,期间我加了注释 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27
阅读全文
摘要:转自:http://blog.csdn.net/chuchus/article/details/78703260 简介 DSSM, Deep Semantic Similarity Model, 深度语义匹配模型, 它是基于深度神经网络的一项建模技术,可以将具有成对关系的, 不同类型的文本(e.g.
阅读全文
摘要:转载自:http://alexkong.net/2013/06/introduction-to-auc-and-roc/ ROC(Receiver Operating Characteristic)曲线和AUC常被用来评价一个二值分类器(binary classifier)的优劣,对两者的简单介绍见
阅读全文
摘要:参考来源:http://blog.sina.com.cn/s/blog_4a0824490102vb2c.html 这两天在看关于boosting算法时,看到一篇不错的文章讲bootstrap, jackknife, bagging, boosting, random forest 都有介绍,以下是
阅读全文
摘要:原文地址:http://blog.csdn.net/ice110956/article/details/10077717 作为集成学习的二个方法,其实bagging和boosting的实现比较容易理解,但是理论证明比较费力。下面首先介绍这两种方法。 所谓的集成学习,就是用多重或多个弱分类器结合为一个
阅读全文
摘要:1、DBSCAN简介 DBSCAN(Density-Based Spatial Clustering of Applications with Noise,具有噪声的基于密度的聚类方法)是一种基于密度的空间聚类算法。该算法将具有足够密度的区域划分为簇,并在具有噪声的空间数据库中发现任意形状的簇,它将
阅读全文
摘要:转载自:http://blog.csdn.net/huagong_adu/article/details/7937616 上个月参加了在北京举办SIGKDD国际会议,在个性化推荐、社交网络、广告预测等各个领域的workshop上都提到LDA模型,感觉这个模型的应用挺广泛的,会后抽时间了解了一下LDA
阅读全文
摘要:最近要花一些图,本来是打算用matlab的,但是matlab有时候莫名其妙的挂掉,忍受不了,便找到了matplotlib。我熟悉并且喜欢Python,所以matplotlib替代了matlab。 使用了几天,感觉还好,不过觉得文档不够全,网页版的有些链接打不开,pdf版本内容也就那么多,很多想找的内
阅读全文
摘要:信息检索(IR)的评价指标介绍 - 准确率、召回率、F1、mAP、ROC、AUC:http://blog.csdn.net/marising/article/details/6543943 ROC曲线:接收者操作特征(receiveroperating characteristic) 比较分类模型的
阅读全文
摘要:转自:http://www.cnblogs.com/fengfenggirl/p/classification_evaluate.html 一、引言 分类算法有很多,不同分类算法又用很多不同的变种。不同的分类算法有不同的特定,在不同的数据集上表现的效果也不同,我们需要根据特定的任务进行算法的选择,如
阅读全文
摘要:转自:http://blog.csdn.net/abcjennifer/article/details/7359370 ROC曲线指受试者工作特征曲线 / 接收器操作特性曲线(receiver operating characteristic curve), 是反映敏感性和特异性连续变量的综合指标,
阅读全文
摘要:转载自:http://taoo.iteye.com/blog/760589 前面的一个帖子中谈到了在决策树模型下计算AUC的问题,主要是讨论如何用决策树得到test samples的更为合理的rank。但是,关于怎么计算AUC却没有详细说明。本文试图总结和理清楚AUC计算这个问题,这么做,除了因为A
阅读全文
1

浙公网安备 33010602011771号