上一页 1 2 3 4 5 6 7 8 9 ··· 12 下一页
摘要: 背景 需要解决本地访问内部集群中各台机器上的内部web服务,但是内部集群不能直接访问,只能通过edge node节点跳转。 前提:edge node可以通过ssh方式访问,在edge node上可以访问内部集群的各个服务。 解决方法 通过ssh隧道连接edge node,并开启动态代理隧道,同时在本 阅读全文
posted @ 2018-01-18 11:18 wlu 阅读(4400) 评论(0) 推荐(0)
摘要: notebook方式运行spark程序是一种比较agile的方式,一方面可以体验像spark shell那样repl的便捷,同时可以借助notebook的作图能力实现快速数据可视化,非常方便快速验证和demo。notebook有两种选择,一种是ipython notebook,主要针对pyspark 阅读全文
posted @ 2017-12-16 12:39 wlu 阅读(1535) 评论(0) 推荐(0)
摘要: 神经网络模型 每个node包含两种操作:线性变换(仿射变换)和激发函数(activation function)。 其中仿射变换是通用的,而激发函数可以很多种,如下图。 MLLib中实现ANN 使用两层(Layer)来对应模型中的一层: AffineLayer 仿射变换: output = W · 阅读全文
posted @ 2017-11-16 13:18 wlu 阅读(990) 评论(0) 推荐(0)
摘要: 参考'LogisticRegression in MLLib' (http://www.cnblogs.com/luweiseu/p/7809521.html) 通过pySpark MLlib训练logistic模型,再利用Matplotlib作图画出分类边界。 最终结果: 阅读全文
posted @ 2017-11-13 15:50 wlu 阅读(1755) 评论(0) 推荐(1)
摘要: SVD分解: $A=U\Sigma V^T$,变换:$\hat{A}=A\cdot V=U\Sigma$ 分解时先计算$A^TA=U\Sigma^2U^T$,再进行SVD分解 SVD分解: 调用Breeze的SVD库,得到$U,\Sigma$ Explained Variance Ratio exp 阅读全文
posted @ 2017-11-13 12:58 wlu 阅读(393) 评论(0) 推荐(0)
摘要: Voting classifier 多种分类器分别训练,然后分别对输入(新数据)预测/分类,各个分类器的结果视为投票,投出最终结果: 训练: 投票: 为什么三个臭皮匠顶一个诸葛亮。通过大数定律直观地解释: 一个硬币P(H)=0.51。大数定律保证抛硬币很多次之后,平均得到的正面频数接近$0.51 \ 阅读全文
posted @ 2017-11-13 09:05 wlu 阅读(1814) 评论(0) 推荐(0)
摘要: 例子 iris数据训练Logistic模型。特征petal width和petal height,分类目标有三类。 训练结果 模型将特征空间划分结果(画图代码参见 http://www.cnblogs.com/luweiseu/p/7826679.html): ML LogisticRegress算 阅读全文
posted @ 2017-11-09 15:43 wlu 阅读(595) 评论(0) 推荐(0)
摘要: 问题描述 给定 g 个group, n 个id, n 阅读全文
posted @ 2017-11-07 21:28 wlu 阅读(3148) 评论(5) 推荐(0)
摘要: "GeneralizedLinearAlgorithm" SparkMllib涉及到的算法 Classification Linear Support Vector Machines (SVMs) Logistic regression Regression Linear least squares 阅读全文
posted @ 2017-11-07 16:10 wlu 阅读(726) 评论(0) 推荐(0)
摘要: 决策树类模型 ml中的classification和regression主要基于以下几类: classification:决策树及其相关的集成算法,Logistics回归,多层感知模型; regression:决策树及其相关集成算法,线性回归。 主要的模型有两类:线性模型\(GLM\)和决策树: 其 阅读全文
posted @ 2017-11-02 11:24 wlu 阅读(814) 评论(0) 推荐(0)
上一页 1 2 3 4 5 6 7 8 9 ··· 12 下一页