Polars vs Pandas 在生产 Pipeline 中的对比

大多数 Python 数据工程师最早学的是 pandas。因为它是行业标准,能用而且一直够用,所以一般也没人质疑过它。

Pandas 设计于 2008 年,面向的是那个时代的数据问题:假设每个操作都要立即返回结果,假设单个 CPU 核心足够,假设数据能放进内存。这些假设成立了很多年。随着 Pipeline 规模增长,它们越来越站不住脚。

这里说的并不是 pandas 好不好,因为它很好而且我现在也在用。现在的问题是问题在于它是否还匹配你实际在跑的工作负载。

对于超过约 1 GB 的文件型 ETL 来说,并不是pandas 出了问题,而是整个生态已经为这类工作产出了一个结构上更优越的工具——Polars。两者之间的差距不是量级上的小打小闹。

 

https://avoid.overfit.cn/post/da28f678d72c42729ccef7af469c1731

posted @ 2026-06-29 21:12  deephub  阅读(8)  评论(0)    收藏  举报