关于数据问题-以及如何解决-或预防-它们
关于数据问题,以及如何解决(或预防)它们
原文:
towardsdatascience.com/on-data-problems-and-how-to-solve-or-prevent-them/不要错过《变量》的最新版本,我们的每周通讯精选了编辑们的精选内容、深度分析、社区新闻等。
数据代表人类的行为、决策和观点——或者人类构建的工具的输出。这意味着,很多时候,它都是混乱的。
随着近年来可用数据的量和复杂性的指数级增长,数据科学和机器学习专业人士的重要性也随之增长。为了帮助您跟上有效的解决问题的方法和洞察力收集方法,我们精选了几篇关于可以帮助保持您的数据整洁、专注和可操作的流程的优秀文章。让我们深入探讨。
从数据中挖掘规则
Mariya Mansurova 的新必读作品既全面又易于理解。它展示了您如何利用可用数据生成以业务为导向的规则,并通过一个动手示例(带有完整的 Python 实现)展示了决策树的力量。
没有更多 Tableau 停机时间:用于主动数据健康的元数据 API
在您分析数据之前,您需要确保其可用性。Alle Sravani 解释了您如何预先使您的数据管道更加健壮。
Ivory Tower Notes: The Problem
Marina Tosic 分享了经过时间考验的见解,关于您应该采取的步骤来有系统地解决商业问题并关注根本原因。
当标签嘈杂时如何衡量真实模型的准确性
Krishna Rao 的文章清晰简洁,解开了“真实”准确性和误差相关性的数学原理。
其他推荐阅读
为什么不拓展到数据、ML 和 AI 广阔世界中的其他一些迷人的领域呢?
- 当我们结合 CNN 和 transformers 会发生什么?Eric Chung 邀请我们探索混合架构的新前沿。
- 每项复杂技术都依赖于一套集成的工具和系统。Ed Izaguirre概述了人工智能堆栈的不同层.
- 更具体地关注生成式人工智能技术栈的组件,Sarah Schürch涵盖了基础模型、代理、向量数据库等。
- 对于一次沉浸式的技术深度探索,不要错过Muhammad Ardi关于如何使用 PyTorch 从头开始实现扩散模型的优秀指南《噪声的艺术》.
认识我们的新作者
探索我们最近添加的贡献者中的顶级作品:
- Felipe Bandeira(以及合著者 Giselle Fretta、Thu Than 和 Elbion Redenica)展示了关于如何评估 MCMC 采样器性能的尖端工作。
- Swapnil Patil在谷歌从事产品分析工作;他的 TDS 处女作深入讨论了 ROC 曲线的力量。
- Nikhil Dasari刚刚推出了一系列面向初学者的系列,这是一个经久不衰的重要主题:时间序列预测。
为 TDS 贡献力量
我们热爱发布新作者的文章,所以如果你最近撰写了一个有趣的项目教程、教程或对我们核心主题的理论反思,为什么不考虑与我们分享?

浙公网安备 33010602011771号