两个 Subagent 模拟学生与 AI 完成课程作业管理 GUI:记录三轮提示词、课程冲突修复、截止提醒改进、10 项测试与尚未完成的真实窗口验收。 ...
做数据科学和机器学习,范数(Norm)这个东西你迟早会碰到。 损失函数正则化、向量相似度计算、矩阵分解——这些场景背后都有范数的影子。 但很多同学对范数的理解停留在"好像是个求长度的东西"这个层面,具体怎么算、不同范数之间有什么区别,一问就含糊了。 其实范数没那么抽象,用 NumPy 的 linal ...
做数据工程的人大概都有过这样的经历:每天到工位第一件事,打开终端敲几条 SQL,看看关键表的行数是不是正常、最新数据更新到几点了、字段空值有没有突然飙高。 这套检查做完,可能半个小时就过去了。 如果某天查出来有问题,还得翻日志、查上下游、挨个通知相关的人。 这些任务虽然不复杂,但琐碎且需每天重复。 ...
数据工程师每天打交道的东西,很大一部分是文本: 应用日志 Nginx access log CSV 里混着脏数据的字段 API 返回的 JSON 片段 配置文件 爬下来的 HTML 这些文本往往不是完全结构化的,或者格式五花八门,用传统的 split、replace 处理起来很累,写一堆条件判断也不 ...
时间序列数据里,趋势、周期和随机波动经常是混在一起的。 直接看原始曲线,很容易被短期波动带偏,比如把一次促销当成长期增长,或者把季节性回落当成业务衰退。 时间序列分解要解决的就是这个问题,把一条看起来乱七八糟的曲线拆成几个更有解释性的部分,让我们分别看: 长期方向 重复周期 剩下的随机噪声。 本文的 ...
前阵子对账,一笔订单 3 件、单价 19.99,脚本算出来的应收是 59.96999999999999531041794398。写这段代码的人其实已经"用了 Decimal",问题出在 Decimal(19.99) 少了一对引号。 金额计算换成 Decimal 只是第一步,后面还有舍入、精度、序列化 ...
时间序列分析听起来有点学术,但其实干起来挺直接的。 你有一串按时间排列的数据,想知道里面有没有趋势、有没有周期性、噪声有多大,或者两个序列之间有没有延迟关系。 SciPy 这个库在信号处理、统计检验方面提供了不少现成的工具,配合 Matplotlib 画图,基本能覆盖日常分析的大部分需求。 本文不是 ...
dsh 生成学习文档, 一份面向纯 CPU 环境的大语言模型实战指南:从数据、分词、注意力、GPT 实现, 到预训练、推理加速、分类微调、指令微调、LoRA、评估与部署,全部代码均可直接运行。 但所有示例不依赖 GPU,不依赖网络下载,采用确定性生成的语料与数据集,因此任何人都能在普通电脑上复现的每 ...
Python 的 datetime 有个很阴的设计:同一个类型既可以带时区(aware),也可以不带(naive),两种对象长得一样、方法一样,大多数时候混着用也不报错。等它出问题的时候,通常是某个定时任务早跑了八个小时,或者报表里凭空多出一天。 下面七个坑都是实跑出来的,环境 Python 3.1 ...
日常数据处理中,经常遇到需要把一批 CSV 文件汇总到一个 Excel 工作簿的场景——每个 CSV 对应一个工作表,方便统一查看和分发。Python 原生 csv 模块可以读取数据,但要逐个写入 Excel 的不同工作表,还需要额外的写入逻辑。使用 Free Spire.XLS for Pytho ...
金融圈里用 AI 的不止量化交易一个行当:银行和消费金融公司每天审批的贷款背后,是另一套模型——风控评分。它和量化是两种手艺:量化赌市场,风控赌人。 ...
Pycharm 是一款 Python 专业的集成开发工具, 由知名公司 JetBrains 专门为 Python 开发量身定制。Pycharm 社区版与 Pycharm 专业版比较: 对比项目Pycharm 社区版Pycharm 专业版 费用 开源,免费 订阅收费 功能 智能代码,语法高亮,代码、本 ...
数据清洗是每个和数据打交道的人都绕不开的日常。 无论是做分析、跑模型,还是给业务方出报表,拿到的原始数据往往都带着重复记录、缺失值、格式错误,甚至一些明显违背常识的条目。 我以前习惯每次遇到问题就临时写几行 drop_duplicates() 或 fillna(),但下次换一份数据,同样的脏法又得重 ...
XGBoost 和 LightGBM 你已经调得很熟了,但只要数据里有一堆字符串类型的类别列,就免不了一段重复劳动:pd.get_dummies() 一下炸出几百列,或者 LabelEncoder 随手写上却悄悄引入了不存在的大小关系。 CatBoost 解决的就是这一件事——类别特征可以直接喂进去 ...
你大概用过不少健康管理类的App——输入年龄、性别、BMI、血压,再填几项血液指标,它就能给出一个风险评分或健康提示。 这个评分背后,往往是一个训练好的机器学习模型在实时计算。 但模型在Jupyter Notebook里跑通,和让它变成成千上万用户都能调用的服务,中间隔着一条不小的鸿沟。 今天我们就 ...
训练一个 XGBoost 模型要等十分钟,换 LightGBM 同样的数据只要一分钟,精度还差不多。这不是玄学,是两者在构造决策树的方式上有根本差异。 这篇文章解决四件事:LightGBM 为什么快、三个核心优化各自解决什么问题、Python 从训练到调参的完整代码、以及我踩过的 5 个坑。看完你能 ...
前两天帮朋友看一个后台系统,他问了个问题:用户点了「退出登录」,前端把 token 删了,但如果这个 token 之前已经被人抓包拿走,拿着它还能调接口吗? 答案是能,一直能用到它过期为止。这是 JWT 最常被问到、也最容易被忽略的一件事:JWT 本身是无状态的,服务端验的只是签名和过期时间,它不知 ...
处理数据的时候,最让人头大的往往不是复杂的模型调参,而是那些藏在角落里的异常值。 你是不是也遇到过这种糟心事:明明业务逻辑看着没毛病,一跑统计指标就飘红;或者模型效果突然断崖式下跌,排查半天发现是几个极端值在捣乱。 今天我们来聊聊最常用的 5 种异常值检测方法:Z-Score、IQR、LOF、Iso ...
处理 PDF 表格数据的场景很常见:季度报表、对账单、业务台账,业务方给一份 PDF 过来,需要结构化后进数据库做后续分析。本文分享一个完整的 Python 实现,覆盖从表格提取、字段清洗、动态建表到批量入库的全流程。代码依赖免费库 Free Spire.PDF 完成 PDF 解析,其余全部基于标准 ...
使用 Python Tkinter 与 AIGC 完成飞剑主题“一箭又一箭”小游戏,记录五个可解关卡、动画反馈、提示撤销、存档、测试过程和五天开发经历。 ...