今天系统学习了Spark SQL与DataFrame
内容要点如下:
Spark SQL架构:Catalyst优化器、Tungsten执行引擎。
编程抽象对比:RDD vs DataFrame(Schema约束) vs DataSet(类型安全)。
DataFrame创建:从JSON/CSV/Parquet文件读取、从RDD转换(需定义Schema)。
常用操作:
DSL语法:select、filter、groupBy、agg。
SQL语法:创建临时视图(createOrReplaceTempView),执行SQL查询。
与Hive集成:配置Hive Metastore,直接查询Hive表。
浙公网安备 33010602011771号