机器学习的模型训练中,特征不是越多越好,而是要找到那个 "刚刚好"的子集。 今天介绍的方法 "简单粗暴",通过递归的方式,不断淘汰一个个特征,直到找到那个最优的 "特征子集"。 核心思想 核心思想用一句话来说,就是用"淘汰赛"选出最强特征组合。 递归消除的思路特别像公司搞末位淘汰: 1. 把所有"员 ...
奇摩带你玩转:WorkBuddy驱动机器学习项目的自动化实践 一、机器学习项目开发的典型痛点 做过ML项目的工程师都知道,机器学习项目的开发流程远比传统软件开发复杂。真正的问题在于,大量时间被消耗在数据清洗、特征工程、环境配置、模型调参与实验结果整理这些重复性工作中,而非真正的算法创新和模型优化。 ...
WorkBuddy数据处理实战:从45分钟到8分钟,特征工程效率提升5.5倍。奇摩计算机结合金融评分卡项目案例,拆解数据清洗、特征编码到模型训练的全流程自动化方法。 ...
前几篇介绍了使用方差阈值,相关性分析以及统计检验等方式来过滤特征,这些方法都有一个共同点,就是由人来决定如何打分。 今天介绍一种让模型自己给特征“打分”的方式,也就是让模型自己判断哪些特征重要,哪些特征是无关紧要的。 与其我自己猜,不如让模型告诉我。 核心思路 这种特征选择方式的核心思想总结起来就一 ...
ML工程师35%的项目时间花在环境配置而非模型设计上。WorkBuddy将数据流水线、实验管理、模型部署串联为自动化流程,项目时间从14小时压缩到1.5小时。 ...
ML项目中60%的时间浪费在非建模工作上。本文拆解WorkBuddy在数据预处理、实验管理和结果可视化三个环节的提效机制,用一个文本分类实验的完整周期数据,展示AI工具如何让ML工程师聚焦真正有创造力的工作。 ...
数据科学项目中大量时间消耗在环境配置数据管道等非算法环节。本文通过真实ML项目案例展示WorkBuddy如何用AI加速从数据获取到模型部署的全生命周期让工程师回归建模和业务洞察的核心工作。 ...
ML实验管理的碎片化之痛 机器学习工程师的日常往往被大量重复性工作占据:数据清洗、特征工程、模型训练、超参调优、结果记录。客观来说,这些环节中的每一步都有成熟的工具支持,但缺乏一个统一的编排层将它们串联起来。结果就是实验记录散落在不同平台的笔记本、表格和脚本中,团队协作靠口头沟通和截图传递信息。 深 ...
ML工程师有大量时间花在非核心建模工作上。本文分享如何借助WorkBuddy加速数据预处理、特征工程、模型训练到评估的全流程,大幅提升ML项目开发效率。 ...
机器学习项目最头疼的不是模型训练,而是实验版本的管理和团队的协作对齐。WorkBuddy提供了一条新的解决思路。 ...
搭环境是每个ML开发者的痛点——CUDA版本、PyTorch兼容、依赖冲突,每天浪费1-2小时。本文介绍WorkBuddy如何通过硬件自动检测和智能依赖解析,将ML环境部署时间从30分钟压缩到5分钟。 ...
AI助手与本地工具的"最后一公里" AI编程助手面临的一个核心挑战是:模型很聪明,但它无法直接操作你本地的文件、运行你本地的脚本、访问你本地的数据库。 究其原因,大多数AI助手的架构是"云端推理 + 浏览器展示",与开发者本地的工具生态之间隔着一条鸿沟。这意味着任何一个需要"实际执行"的任务——跑个 ...
在做机器学习建模的时候,经常遇到一个让人头疼的问题:手上有几十甚至上百个特征,到底哪些该留、哪些该丢? 之前两篇介绍了通过 方差阈值 和 相关性分析 来过滤特征,今天这篇介绍一种新的过滤特征的方式,也就是用统计检验来判断一个特征到底跟目标变量有没有关系。 核心思路很简单 说白了,统计检验做特征选择的 ...
背景:机器学习项目的工程化痛点在哪里 机器学习项目的落地,一直存在"算法强、工程弱"的尴尬。数据科学家能把模型精度调上0.95,但到了部署环节却要花几周时间处理环境依赖、接口对接、监控告警等工程问题。 值得一提的是,这些工程化痛点并非无解。随着AI编程工具的成熟,大量原本需要专业MLOps工程师处理 ...
ML工程化瓶颈不在模型调参,奇摩实测用WorkBuddy串联数据预处理到模型部署全流程,客户流失预测模型从2.5个工作日压缩到5小时,ML脚本一次通过率达78%。 ...
展示如何利用WorkBuddy搭建ML实验自动化流水线,覆盖数据探索、特征工程、模型选型、部署全流程,实测各环节效率提升数据。 ...
刚开始学机器学习时,我也像大部分人 一样,有个很朴素的想法:特征越多,模型能学到的信息就越多,效果自然越好。 所以每次拿到数据,我就拼命往模型里塞特征——能算出来的统计量全加上,能衍生出来的比率全拼上。 一个原本 20 列的数据集,经常被我搞到七八十列。 然后我就发现事情不太对劲了: 训练时间明显变 ...
YOLO-EMAC(YOLO-efficient-multiscale-adaptive-channel)是一种针对PCB检测中目标过小的特点提出的一种算法,基础是YOLOv12. 在卷积神经网络中,存在两个问题:(1)下采样带来的浅层特征损失,特征图越来越小,小目标卷积几次以后特征就没有了;(2) ...
在机器学习实战中,我们常常把精力花在调参和选模型上,却忽略了一个更基础的问题:喂给模型的数据里,有多少特征是真正有用的? 刚开始学机器学习那会儿,我特别喜欢堆特征,不管有用没用先一股脑全塞进去,总觉得特征越多模型越聪明。 直到有一次跑练习数据集,X_train.shape 直接干到了 (50000, ...
本篇代码仓位:ImageStitching 经过前面七篇的铺垫,我们已经得到了精确匹配的内点集和一个描述图像间几何关系的全局单应性矩阵。 虽然在现代拼接管道中仍有很多其他处理步骤和相应算法,但就我们目前所拥有的材料,已经可以尝试进行一次最简易的图像拼接。 复述一下我们现有的材料: 图像 A 和图像 ...