第一性原理思考对数据科学家的重要性
第一性原理思考对数据科学家的重要性
原文:
towardsdatascience.com/first-principles-thinking-for-data-scientists/
然后他们做了一件激进的事情:他们质疑了所有这些。
当他们的滑翔机没有按照已发布的数据预测的性能表现时,莱特兄弟并没有假设他们自己有错。他们自己建造了风洞,并亲自测试了 200 多种机翼设计。他们当时发现的结果让他们震惊。利林塔尔的升力系数——整个领域都依赖的数字——是错误的,而且不仅仅是有一点错误。完全、彻底的错误。
莱特兄弟并不是出于傲慢而质疑这一点;他们是在运用第一性原理思考。这也是他们 1903 年的首次飞行与兰利之间的区别——兰利拥有更多的资金、声望和资源,但他的飞机在九天前就坠入了波托马克河。
当今的数据科学家面临着类似的挑战。我们周围充满了剧本、框架和最佳实践——A/B 测试指南、指标分类法、模型选择清单。这些工具是无价的。但就像兰利的表格一样,如果盲目应用,它们也可能将我们引入歧途。
我认识的最有战略眼光的数据科学家不会在框架和第一性原理之间做出选择。他们两者都使用。框架提供速度。第一性原理提供清晰度。结合起来,它们将任务执行者与战略合作伙伴区分开来。
什么是第一性原理思考?
第一性原理思考意味着将问题分解为其基本真理,并从头开始重建。亚里士多德将其描述为寻找“事物已知的第一基础”。
在实践中,这意味着要问:
-
我们知道哪些是绝对真实的?
-
我们在假设什么?
-
我们可以挑战哪些假设?
这并不意味着要拒绝现有知识:莱特兄弟研究了当时所有可用的研究;他们只是没有将其视为圣经。
对于数据科学家来说,情况也是如此。框架就像是地图——穿越熟悉地形的既定捷径。第一性原理就像是指南针,当地图变得模糊不清时,它能帮助我们保持方向感。
为什么数据科学家现在需要这种思考方式?
数据科学中到处都是框架,这并非没有原因。它们帮助我们快速进行实验、定义指标和构建模型。但它们也可能导致错误的自信。
我见过团队运行完美的 A/B 测试,但回答了错误的问题。我见过标准指标产生看似令人印象深刻但衡量无意义的仪表板。这些失败并不是因为框架有缺陷。它们发生是因为没有人停下来问第一性原理问题:我们实际上试图了解什么决策?我们真正试图衡量什么价值?我们甚至需要这种程度的复杂性吗?
这比以往任何时候都更重要,因为人工智能正在自动化数据科学的执行方面。通用人工智能可以查询数据、生成可视化并出色地应用框架。但它不能决定你是否提出了正确的问题。
第一性原理思维是你的差异化因素。它是使框架立足于现实的能力——而且它正成为战略数据科学家最具防御力的能力。
第一性原理改变一切的地方
这里有三个例子,数据科学剧本写得很好,但盲目地严格遵循它会产生不良结果。
超越教科书式的 A/B 测试
框架说:定义你的假设,随机化用户,衡量你的主要指标,检查显著性。如果你提出了正确的问题,这会完美地工作。
但第一性原理问题出现得更早:我们试图了解什么决策?我们试图解决什么不确定性?
我曾经建议一个团队测试一个新的推荐算法。框架思维说:随机化用户,衡量点击率,运行两周。发货获胜者。
但第一性原理的暂停揭示了一个不同的情况。我们不确定点击量——早期信号表明它们会上升。我们不确定这些点击是否会推动真正的参与度,或者只是噪音。
因此,我们改变了我们衡量的内容。不再是点击量,而是关注回头客、会话深度和长期参与度。结果?新算法使点击量增加了 12%,但回头客减少了 8%。标准框架会说“发货”。第一性原理方法会说“还不行”。
我们决定新算法太“点击诱人”。框架给了我们方法。第一性原理给了我们正确的问题。
我们的指标真正衡量的是什么?
指标框架——如北极星、OKR、HEART——之所以强大,是因为它们提供了结构。但它们也可能造成一种错觉,即我们已衡量了重要的事物。
第一性原理思维询问:我们关心的基本行为或价值是什么?这个指标实际上是否捕捉到了它?
考虑参与度。许多框架建议日活跃用户数、会话长度或每会话动作数。合理的代理指标——但它们正确吗?
-
对于一个冥想应用来说,更长的会话可能看起来“更好”,但基本目标是可持续的练习。这可能意味着随着时间的推移,会进行更短的会话。
-
对于一个分析工具来说,每个用户更多的查询可能意味着更深入的使用,或者可能意味着用户在寻找答案时遇到了困难。真正的价值是更快、更有针对性的洞察。
我曾经开始了一份新工作,并继承了一个自豪地报告每周活跃用户的仪表板,将其作为主要成功指标。但当我深入调查时,我意识到大多数“活跃”用户只是登录、四处看看,然后什么任务都没完成就离开了。从第一性原理的角度来看,我决定真正的价值在于完成的任务。一旦我改变了指标,我们就发现(正如预期的那样)在新定义下使用率远低于以前,但新的框架为我们提供了关于如何推动有意义的采用的清晰方向。
框架为你提供了一系列指标。第一性原理思维告诉你,其中任何一项是否真正反映了你产品的价值。有时标准指标是完美的,但有时它可能会误导。
当第一性原理拯救了一次发布
我经历的一个最清晰的例子是在我的职业生涯早期,我的团队被分配了一个任务,即构建一个“用户质量评分”,以帮助销售优先处理潜在客户。
框架方法很明显:监督学习,预测转换概率,按分数排序。我们有数据,有特征,有方法论。
两周后,当我们努力争取逐步提高性能分数时,有人问: 销售实际上会根据这个分数做出什么决定?
我们询问了销售。答案不是“给我精确的概率。”而是:我应该花时间和个性化来打电话给这个潜在客户,还是只发送一封快速标准化的电子邮件?
这一切发生了变化。我们不需要一个覆盖整个概率范围的复杂模型。我们需要一个简单、可解释的分类器,围绕一个阈值进行优化。
通过重新定义,我们从一个集成模型转变为逻辑回归,减少了半数特征,三周内就发货了——并交付了销售真正使用的成果。
通过回归第一性原理,我们明确了真正的问题,然后回到标准框架去构建解决方案。
指南针和地图
这是教训:战略数据科学家不会在框架和第一性原理之间做出选择。他们结合它们。
-
框架是地图——它们让你快速移动并利用积累的知识。
-
第一性原理是指南针——当地图没有清楚地显示你的路径时,它们能让你保持一致。
惠特兄弟并没有拒绝他们那个时代的科研成果。他们在此基础上进行了建设,但他们也知道何时回归基础。
这就是将战略数据科学家与战术数据科学家区分开来的心态转变。这不仅仅是关于知道更多方法或更努力工作。这是关于知道何时遵循地图,何时检查指南针。
在人工智能的指导下,框架将变得越来越容易应用。但指南针——那是你自己的构建。而且它将使你在未来的几年里保持相关、战略和不可或缺。
这是我在新书 《战略数据科学家:在人工智能时代升级并茁壮成长 (亚马逊联盟链接) 中探讨的核心主题之一。它讲述了将基础思维与经过验证的框架相结合,以创造影响、影响路线图,并使你成为战略合作伙伴——而不仅仅是技术执行者。*
如果你在思考随着人工智能能力的增强,你的工作将如何改变,或者只是希望作为数据科学家有更大的影响力,并朝着晋升的方向迈进**,请查看亚马逊上的这本书!

浙公网安备 33010602011771号