随笔分类 -  数据挖掘

摘要:SEM翻译过来叫搜索引擎营销,个人认为是随着搜索引擎竞价排名出现的一个行业,已经有了好多年的历史,做sem的公司这些年里手里应该都积攒着大量的cookie,关键词等与SEM和追踪相关的数据,这些数据现在更多是用来给用户报表使用的,但其实个人认为这些数据通过RTB即可以变现又可以为广告主提供更好的解决方案,只不过现在好多SEM公司没有找办挖掘的办法而已. DSP(需求方平台)是随着RTB(实时竞价)而兴起的一个产业,这个东西的规则就是当一个用户访问了一个网页,这个网页上有些广告位是给了RTB的,则rtb会将这个用户的ID和广告位等信息下发到在它这注册的DSP们,而DSP需要在一段时间内(通常是. 阅读全文
posted @ 2013-06-23 22:59 frog_ww 阅读(702) 评论(0) 推荐(0)
摘要:这篇文章主要阐明了如何给广告合约分配流量,理论上的方法是用求对偶函数的方法来求最优解,跟SVM一样,最后提供了一个可工程化的HWM方法。合约广告系统原作者:刘鹏@北冥乘海生编辑:Koala++/屈伟视频课程:师徒网推荐拙译:在线分配问题的High Water Mark算法论文。在线分配(Online Allocation)问题在线分配问题前面提到过广告是三方博弈,用户,广告主,媒体之间的博弈,而推荐系统是用户与媒体的博弈。它们之间的区别其一是广告主通媒体reach用户是有量的需求的,推荐系统是自己把内容推给用户,不见得有明显的量的需求。广告的量的需求体现在两个方面,一种是我前面提到的GD广告系 阅读全文
posted @ 2013-06-11 13:16 frog_ww 阅读(588) 评论(0) 推荐(0)
摘要:softmax回归是由多项分布推导回来的一种回归,主要的做用就是能进行二种以上的分类,它也是广义线性模型中的一种,不过它的特点是它的T(y)和η都是向量值。 p(y;Φ)=Φ11{y=1}Φ21{y=2}...Φk1{y=k};设(T(y))i=1{y=i} =Φ11{y=1}Φ21{y=2}...Φk1-Σ1{y=i};i=1....k-1 =Φ1(T(y))1Φ2(T(y))2...Φk1-Σ(T(y))i =exp((T(y))1log(Φ1)+(T(y))2log(Φ2)+...(1-Σ(T(y))i)log(Φk)) =exp((T(y))... 阅读全文
posted @ 2013-01-06 01:32 frog_ww 阅读(1057) 评论(0) 推荐(0)
摘要:logistic回归: logistic回归一般是用来解决二元分类问题,它是从贝努力分布转换而来的 hθ(x) = g(z)=1/1+e-z ;z=θTx 最大似然估计L(θ) = p(Y|X;θ) =∏p(y(i)|x(i);θ) =∏(hθ(x))y(i)(1-hθ(x))1-y(i) l(θ) = logL(θ) =Σy(i)loghθ(x(i))+(1-y(i))log(1-hθ(x(i))) θ的优化目的就是让最大似然估计最大,用梯度上升法求θ θj=θj+α∂l(θ)/∂θj=θj+α(y(i)-hθ(x(i)))x(i)... 阅读全文
posted @ 2013-01-06 00:15 frog_ww 阅读(3491) 评论(3) 推荐(2)
摘要:线性回归公式:hθ(x) =θ0+θ1x1+...+θnxn ;设x0=1 =θTx所有的求解方法都是在求θ,目标是让J(θ)最小化;J(θ)=1/2∑(hθ(x(i))-y(i))2 i=1...m(训练集的数量)如何求θ 方法1:梯度下降法:θj:=θj-α∂J(θ)/∂θj,其中α是学习速率,代表着你一步走多长,一般由人工指定,判断收敛的条件为多次叠代后θ的值稳定了 因为∂J(θ)/∂θj=∂(1/2(hθ(x)-y)2)/∂θj =2*1/2(hθ(x)-y)∂(hθ(x)-y)/∂θj ... 阅读全文
posted @ 2013-01-04 00:23 frog_ww 阅读(414) 评论(0) 推荐(1)