今天系统学习了Spark SQL与DataFrame
内容要点如下:
Spark SQL架构:Catalyst优化器、Tungsten执行引擎。

编程抽象对比:RDD vs DataFrame(Schema约束) vs DataSet(类型安全)。

DataFrame创建:从JSON/CSV/Parquet文件读取、从RDD转换(需定义Schema)。

常用操作:

DSL语法:select、filter、groupBy、agg。

SQL语法:创建临时视图(createOrReplaceTempView),执行SQL查询。

与Hive集成:配置Hive Metastore,直接查询Hive表。