Loading

10 2021 档案

摘要:特征归一化 目的:消除数据特征之间的量纲影响 方法: 名称 线性函数归一化(Min-Max Scaling) 零均值归一化(Z-Score Normalization) 方法 对原始数据进行线性变换,使结果映射到[0,1]的范围 将数据映射到均值为0,标准差为1的分布上 公式 \(X_{norm}= 阅读全文
posted @ 2021-10-31 15:53 笑云博文 阅读(125) 评论(0) 推荐(0)
摘要:数据的探索型分析 数据的特征探索 数据探索性分析需要从两种方面来看: 字段vs标签 字段vs字段 数据分布分析 有可能因为训练集和验证集分布不一样,比如出现本地和线上得分变换趋势相反的情况。 可以构造一个分类器区分训练集和验证集,如果无法分辨样本(AUC接近0.5)说明数据分布一致,否则,说明训练集 阅读全文
posted @ 2021-10-29 14:50 笑云博文 阅读(607) 评论(0) 推荐(0)
摘要:主成分分析(Principal Component Analysis, PCA )是一种利用线性映射来进行数据降维的方法,并去除数据的相关性; 且最大限度保持原始数据的方差信息 线性映射,去相关性,方差保持 线性映射 \[ F = \sum_{i=1}^{p}u_iX_i = u^{T}X \] 相 阅读全文
posted @ 2021-10-28 11:21 笑云博文 阅读(518) 评论(0) 推荐(0)
摘要:bagging原理 bagging的思路是训练k个独立的基学习器,对于每个基学习器的结果进行结合(加权或者多数投票)来获得一个强学习器。 boostrap boost最早用于经济学,为了研究大样本中的特征值,通过有放回的多次采样研究样本的特征。 在原有的样本中通过重抽样抽取一定数量(比如100)的新 阅读全文
posted @ 2021-10-28 11:13 笑云博文 阅读(531) 评论(0) 推荐(0)
摘要:是《自然语言处理》课程的小作业之一,内容是基于隐马尔科夫模型进行命名实体识别任务。 引言 本文要求基于HMM模型进行命名实体识别任务,数据集中共有十个标签类别,分别为: 地址(address),书名(book),公司(company),游戏 (game)政府(government), 电影(movi 阅读全文
posted @ 2021-10-28 10:56 笑云博文 阅读(2603) 评论(1) 推荐(0)
摘要:首先定义绘制图像的函数,注意,opencv中的图像为BGR格式,与平时的RGB格式不符,所以需要在jupyternotebook中绘制的时候需要先转化。 def cv_imshow(image): img_to_plot = cv2.cvtColor(image, cv2.COLOR_BGR2RGB 阅读全文
posted @ 2021-10-18 17:25 笑云博文 阅读(169) 评论(0) 推荐(0)
摘要:学习重点 torchvision包的使用 代码实现 导入相关的库 from __future__ import print_function, division import torch import torch.nn as nn import torch.nn.functional as F im 阅读全文
posted @ 2021-10-15 18:52 笑云博文 阅读(915) 评论(0) 推荐(0)
摘要:Matplotlib文档 https://www.matplotlib.org.cn/ Seaborn文档 https://seaborn.apachecn.org/#/ 阅读全文
posted @ 2021-10-11 23:44 笑云博文 阅读(34) 评论(0) 推荐(0)