上一页 1 2 3 4 5 6 7 8 ··· 11 下一页
摘要: 一、函数基础:train_test_split 是什么? train_test_split 是 sklearn 提供的数据集划分工具,核心功能是: 随机打乱原始数据(避免数据有序性导致的偏差); 按指定比例拆分数据为「两部分」(默认是训练集和测试集); 保证拆分后,x 和 y 的对应关系不混乱(即某 阅读全文
posted @ 2025-11-28 21:56 wangya216 阅读(219) 评论(0) 推荐(0)
摘要: 一、完整语法与参数解释 np.random.normal(loc=0, scale=1, size=None) 是 NumPy 中生成「正态分布(高斯分布)」随机数的核心函数,参数含义如下: 参数名 默认值 作用说明 对应代码中的含义 loc 0 正态分布的「均值(μ)」,决定分布的中心位置 噪声的 阅读全文
posted @ 2025-11-28 21:41 wangya216 阅读(210) 评论(0) 推荐(0)
摘要: 在编程(尤其是数据科学、机器学习)中,随机种子(Random Seed)是一个用于初始化随机数生成器的“起始值”,核心作用是让「随机过程可复现」——简单说,用相同的随机种子,每次运行代码得到的随机结果(如随机划分数据、生成随机噪声、模型初始化权重)完全一致;不设置种子则每次结果都不同。 一、先看直观 阅读全文
posted @ 2025-11-28 21:31 wangya216 阅读(1047) 评论(0) 推荐(0)
摘要: 多项式次数选择完整演示(Python) 本文将通过 人工生成数据→数据划分→多次数模型训练→验证集筛选最优次数→测试集评估 的全流程,演示多项式回归中如何通过验证集选择最优次数,所有代码逐行解释,兼顾理论与实践。 核心逻辑 多项式回归的核心是通过增加高次项(如 (x^2, x^3))拟合复杂数据,但 阅读全文
posted @ 2025-11-28 21:25 wangya216 阅读(47) 评论(0) 推荐(0)
摘要: 需要预先指定多项式的次数,且这个次数属于「超参数」,需通过验证集优化选择,核心逻辑和实操步骤如下: 一、关键结论 多项式回归中,“一次(线性)、二次、三次”本质是模型的结构超参数(决定模型复杂度),不能由数据自动学习,必须先指定候选次数(如1、2、3、4次),再通过训练+验证的流程筛选最优解。 二、 阅读全文
posted @ 2025-11-28 20:25 wangya216 阅读(48) 评论(0) 推荐(0)
摘要: 除了 %matplotlib inline:Matplotlib 相关魔法命令全解析(结构化指南) 一、核心渲染模式配置(替换/扩展 inline) 这类命令用于指定 Matplotlib 在 Jupyter 环境中的图表渲染方式,是 %matplotlib inline 的直接替代或进阶版本,核心 阅读全文
posted @ 2025-11-27 12:45 wangya216 阅读(113) 评论(0) 推荐(0)
摘要: 模糊匹配在不同场景下有不同的常用库,以下是主流选择及适用场景: 1. 字符串模糊匹配 FuzzyWuzzy(Python) 基于编辑距离(Levenshtein距离),支持字符串相似度计算、匹配和搜索 适合:字符串纠错、重复检测、部分匹配场景 示例:from fuzzywuzzy import fu 阅读全文
posted @ 2025-11-26 10:56 wangya216 阅读(90) 评论(0) 推荐(0)
摘要: 是的,正则表达式 支持模糊匹配,但需注意:标准正则(如 Python 内置 re 模块)的模糊匹配能力有限,而扩展库(如 Python regex 模块)提供了更完善的模糊匹配功能。以下是具体说明: 一、标准正则的“模糊匹配”(有限支持) 标准正则本身没有专门的“模糊匹配”语法,但可通过以下方式间接 阅读全文
posted @ 2025-11-26 10:53 wangya216 阅读(67) 评论(0) 推荐(0)
摘要: Python中的模式匹配与模糊匹配:从精确到容错的智能识别 在日常编程中,我们常常需要判断一段文本是否符合某种“格式”或“规则”,或者在一堆数据中找出“看起来差不多”的内容。这两种需求分别对应着模式匹配(Pattern Matching)和模糊匹配(Fuzzy Matching)。它们看似相似,实则 阅读全文
posted @ 2025-11-26 10:35 wangya216 阅读(191) 评论(0) 推荐(0)
摘要: 这个词其实非常形象,英文是 Broadcasting。下面我为你详细解释一下为什么用“广播”这个词。 英文原词:Broadcasting 中文直译: 广播、播放、撒播。 核心含义: 从一个中心点向周围广阔的区域广泛地发送信号、信息或内容。比如: 电视/无线电广播: 电视台向所有观众发送节目信号。 种 阅读全文
posted @ 2025-11-26 10:26 wangya216 阅读(26) 评论(0) 推荐(0)
摘要: 非常好的问题!np.array([10, 20]).reshape(-1, 1) 是 NumPy 中将一维数组转为列向量的常用写法。 下面我将从 基本用法、-1 的含义、与 [:, None] 的对比、常见场景 四个方面,彻底讲清楚 reshape 怎么用,尤其是这种带 -1 的写法。 一、resh 阅读全文
posted @ 2025-11-25 19:42 wangya216 阅读(192) 评论(0) 推荐(0)
摘要: NumPy 广播机制深度解析:从报错到精通,搞定维度对齐的核心逻辑 在使用 NumPy 处理数组运算时,你是否常被这些问题困扰: 为什么同样是 A + B,有时能算出结果,有时却报 ValueError? 为什么加个 [:, np.newaxis],原本失败的运算突然就成功了? 广播的“自动扩展”到 阅读全文
posted @ 2025-11-25 19:20 wangya216 阅读(140) 评论(0) 推荐(0)
摘要: 在 Jupyter Notebook / IPython 环境中,默认开启 “自动显示模式”(%matplotlib inline 或 %matplotlib notebook),绘图后会自动渲染图像,无需手动调用 plt.show()。以下是具体分析: 1. 无需写 plt.show() 的场景 阅读全文
posted @ 2025-11-25 13:52 wangya216 阅读(119) 评论(0) 推荐(0)
摘要: Pyplot vs Seaborn 功能实现对比(直方图+箱线图) 以下通过 相同数据、相同图表类型 的代码对比,直观展示两者的核心差异:Seaborn 基于 Matplotlib 封装,代码更简洁、默认样式更美观,且无缝对接 Pandas DataFrame;Pyplot 更灵活但需手动配置细节。 阅读全文
posted @ 2025-11-25 13:51 wangya216 阅读(78) 评论(0) 推荐(0)
摘要: Matplotlib 核心类与常用函数使用说明(精准聚焦高频场景) 以下按「核心类 → 常用函数 → 实战示例」结构,聚焦实际开发中80%场景用到的功能,明确类与函数的调用关系、参数含义,避开冗余细节: 一、核心类(基础骨架,必须掌握) 1. Figure 类(画布) 作用:顶层容器,承载所有绘图元 阅读全文
posted @ 2025-11-25 13:45 wangya216 阅读(207) 评论(0) 推荐(0)
摘要: 一、发音(国际音标+中文谐音,附重音提示) 单词 国际音标 重音位置 中文谐音(便于记忆) 发音要点 Axis /ˈæksɪs/ 第1音节 阿克西斯(“阿”重读) 开头“ax”发 /æks/(类似“艾克斯”快速连读),结尾“is”发 /ɪs/(短音“伊斯”) Axes /ˈæksiːz/ 第1音节 阅读全文
posted @ 2025-11-25 13:39 wangya216 阅读(208) 评论(0) 推荐(0)
摘要: ## 📌 `Series` / `DataFrame` 与 `ndarray` 的规范称谓指南 在数据科学生态中,准确使用术语有助于避免概念混淆。以下是针对 pandas 和 NumPy 核心组件的推荐命名方式,按**准确性、通用性和场景适配性**排序。 一、pandas.Series 与 pan 阅读全文
posted @ 2025-11-25 13:27 wangya216 阅读(37) 评论(0) 推荐(0)
摘要: 要理清这个问题,核心是区分 “容器类型”(用于“装数据”的结构)和 “数据类型”(容器中“单个数据”的存储格式)——这是两个不同维度的概念。下面先分别拆解 NumPy 和 Pandas 的容器类型,再明确“Int64”与“Series/DataFrame”的本质区别。 一、先明确核心概念:容器类型 阅读全文
posted @ 2025-11-25 13:22 wangya216 阅读(69) 评论(0) 推荐(0)
摘要: Pandas 的核心数据对象有3类,是数据处理的基础,底层均基于 NumPy 优化内存布局: 1. Series(一维带标签数组) 核心特点:单列数据,索引(标签)可自定义(默认整数序列),数据类型(dtype)支持数值、字符串、时间等。 通俗类比:像带行号的 Excel 单列,或字典(键=索引,值 阅读全文
posted @ 2025-11-25 13:09 wangya216 阅读(55) 评论(0) 推荐(0)
摘要: Pandas 数据类型全景解析:从 NumPy 继承到高级扩展 本文系统梳理 Pandas 的数据类型体系,深入对比其与 NumPy 的异同,并对 string、category 及 nullable 类型进行深度剖析,助你写出更高效、更健壮的数据分析代码。 1. 引言:Pandas 与 NumPy 阅读全文
posted @ 2025-11-25 12:36 wangya216 阅读(192) 评论(0) 推荐(0)
摘要: 长文阐述:ndarray、Series/DataFrame、List 的内存模型对比与场景选型 引言 在 Python 数据科学领域,我们每天都在与数据结构打交道。其中,Python 内置的 List、NumPy 库的 ndarray,以及 Pandas 库的 Series 和 DataFrame 阅读全文
posted @ 2025-11-25 12:24 wangya216 阅读(102) 评论(0) 推荐(0)
摘要: 不一定需要,但推荐使用。 直接使用 pd.read_csv('file.csv'):Pandas 会内部处理文件的打开和关闭。在大多数情况下,这很方便且是安全的,因为如果操作成功完成,Pandas 会确保文件被关闭。但是,如果在读取过程中发生错误(例如,文件损坏、权限问题),理论上存在文件句柄没有被 阅读全文
posted @ 2025-11-25 12:20 wangya216 阅读(55) 评论(0) 推荐(0)
摘要: Pandas 入门教程:从安装到核心操作(零基础友好) Pandas 是 Python 数据分析的“瑞士军刀”,基于 NumPy 构建,专为表格数据处理设计。本教程从安装到核心操作,用通俗语言+实战代码,帮你快速上手 Pandas 核心能力。 一、环境准备:安装 Pandas 1. 安装命令(终端/ 阅读全文
posted @ 2025-11-25 12:14 wangya216 阅读(1271) 评论(0) 推荐(1)
摘要: Pandas Series 与 DataFrame:核心定义、区别与使用场景 Pandas 是基于 NumPy 构建的数据分析库,核心数据结构是 Series(一维标签数组) 和 DataFrame(二维表格数据),二者均支持标签索引、缺失值处理和高效数据操作,是数据分析的基石。 一、Series: 阅读全文
posted @ 2025-11-25 12:05 wangya216 阅读(222) 评论(0) 推荐(0)
摘要: NumPy ndarray 与 Python 列表的核心区别 核心差异:ndarray 是面向向量/矩阵的数值计算容器,列表是通用对象存储容器,底层设计和适用场景完全不同。 1. 存储本质:同构 vs 异构 ndarray:强制存储同一数据类型(如 int64、float32),数据在内存中连续排列 阅读全文
posted @ 2025-11-25 11:52 wangya216 阅读(57) 评论(0) 推荐(0)
上一页 1 2 3 4 5 6 7 8 ··· 11 下一页