刷新
用递归消除法优化“特征子集”

博主头像 机器学习的模型训练中,特征不是越多越好,而是要找到那个 "刚刚好"的子集。 今天介绍的方法 "简单粗暴",通过递归的方式,不断淘汰一个个特征,直到找到那个最优的 "特征子集"。 核心思想 核心思想用一句话来说,就是用"淘汰赛"选出最强特征组合。 递归消除的思路特别像公司搞末位淘汰: 1. 把所有"员 ...

奇摩带你玩转:WorkBuddy驱动机器学习项目的自动化实践

博主头像 奇摩带你玩转:WorkBuddy驱动机器学习项目的自动化实践 一、机器学习项目开发的典型痛点 做过ML项目的工程师都知道,机器学习项目的开发流程远比传统软件开发复杂。真正的问题在于,大量时间被消耗在数据清洗、特征工程、环境配置、模型调参与实验结果整理这些重复性工作中,而非真正的算法创新和模型优化。 ...

基于模型的重要性评分进行“特征排序”

博主头像 前几篇介绍了使用方差阈值,相关性分析以及统计检验等方式来过滤特征,这些方法都有一个共同点,就是由人来决定如何打分。 今天介绍一种让模型自己给特征“打分”的方式,也就是让模型自己判断哪些特征重要,哪些特征是无关紧要的。 与其我自己猜,不如让模型告诉我。 核心思路 这种特征选择方式的核心思想总结起来就一 ...

奇摩带你玩转:WorkBuddy数据分析与可视化实战

博主头像 ML实验管理的碎片化之痛 机器学习工程师的日常往往被大量重复性工作占据:数据清洗、特征工程、模型训练、超参调优、结果记录。客观来说,这些环节中的每一步都有成熟的工具支持,但缺乏一个统一的编排层将它们串联起来。结果就是实验记录散落在不同平台的笔记本、表格和脚本中,团队协作靠口头沟通和截图传递信息。 深 ...

奇摩深度解析:WorkBuddy本地工具链集成原理

博主头像 AI助手与本地工具的"最后一公里" AI编程助手面临的一个核心挑战是:模型很聪明,但它无法直接操作你本地的文件、运行你本地的脚本、访问你本地的数据库。 究其原因,大多数AI助手的架构是"云端推理 + 浏览器展示",与开发者本地的工具生态之间隔着一条鸿沟。这意味着任何一个需要"实际执行"的任务——跑个 ...

用统计检验来确定“重要特征”

博主头像 在做机器学习建模的时候,经常遇到一个让人头疼的问题:手上有几十甚至上百个特征,到底哪些该留、哪些该丢? 之前两篇介绍了通过 方差阈值 和 相关性分析 来过滤特征,今天这篇介绍一种新的过滤特征的方式,也就是用统计检验来判断一个特征到底跟目标变量有没有关系。 核心思路很简单 说白了,统计检验做特征选择的 ...

奇摩干货铺:WorkBuddy赋能ML项目开发的五项技巧

博主头像 背景:机器学习项目的工程化痛点在哪里 机器学习项目的落地,一直存在"算法强、工程弱"的尴尬。数据科学家能把模型精度调上0.95,但到了部署环节却要花几周时间处理环境依赖、接口对接、监控告警等工程问题。 值得一提的是,这些工程化痛点并非无解。随着AI编程工具的成熟,大量原本需要专业MLOps工程师处理 ...

用相关性分析消除“冗余特征”

博主头像 刚开始学机器学习时,我也像大部分人 一样,有个很朴素的想法:特征越多,模型能学到的信息就越多,效果自然越好。 所以每次拿到数据,我就拼命往模型里塞特征——能算出来的统计量全加上,能衍生出来的比率全拼上。 一个原本 20 列的数据集,经常被我搞到七八十列。 然后我就发现事情不太对劲了: 训练时间明显变 ...

PCB检测算法YOLO-EMAC(1)

博主头像 YOLO-EMAC(YOLO-efficient-multiscale-adaptive-channel)是一种针对PCB检测中目标过小的特点提出的一种算法,基础是YOLOv12. 在卷积神经网络中,存在两个问题:(1)下采样带来的浅层特征损失,特征图越来越小,小目标卷积几次以后特征就没有了;(2) ...

用方差阈值过滤掉“惰性特征”

博主头像 在机器学习实战中,我们常常把精力花在调参和选模型上,却忽略了一个更基础的问题:喂给模型的数据里,有多少特征是真正有用的? 刚开始学机器学习那会儿,我特别喜欢堆特征,不管有用没用先一股脑全塞进去,总觉得特征越多模型越聪明。 直到有一次跑练习数据集,X_train.shape 直接干到了 (50000, ...

高光谱拼接算法(八)从特征匹配到图像拼接

博主头像 本篇代码仓位:ImageStitching 经过前面七篇的铺垫,我们已经得到了精确匹配的内点集和一个描述图像间几何关系的全局单应性矩阵。 虽然在现代拼接管道中仍有很多其他处理步骤和相应算法,但就我们目前所拥有的材料,已经可以尝试进行一次最简易的图像拼接。 复述一下我们现有的材料: 图像 A 和图像 ...

<123···13>