上一页 1 ··· 8 9 10 11 12 13 14 15 16 ··· 36 下一页
摘要: 一、介绍 SeaTunnel 是一个非常好用、超高性能的分布式数据集成平台,架构于 Apache Spark 和 Apache Flink 之上,实现了海量数据的实时同步与转换。每天可以稳定高效地同步数百亿数据,目前已接近百家公司在生产上使用 依赖环境:Spark3.2.1、FLink 运行服务器: 阅读全文
posted @ 2024-01-02 09:54 Robots2 阅读(2197) 评论(0) 推荐(0)
摘要: 一、服务配置 已配置好gt_oneline_2,其它集群还需按照下面方式特殊配置 1、需要腾讯Oceanus同学在后端修改高途flink集群配置core-site.xml文件,增加如下配置。只能绑定一个chdfs环境,这边绑定的测试环境,线上环境需要改qcloud.object.storage.zk 阅读全文
posted @ 2024-01-02 09:50 Robots2 阅读(121) 评论(0) 推荐(0)
摘要: 一、集群配置 1、版本使用 技术 版本 iceberg 1.3.1 flink 1.16.1 spark 3.2.1 hive 2.3.7 dlc-presto 待定 2、集群配置调整 (1)使用hive查询的话所有hiveserver2节点修改hive-site.xml文件,添加jar包,添加如下 阅读全文
posted @ 2024-01-02 09:45 Robots2 阅读(942) 评论(0) 推荐(0)
摘要: 一、开发注意事项 1、Iceberg选择合适的表版本 简述:Iceberg目前有两个表版本(V1和V2),根据数据选择合适的表版本。 V1表只支持增量数据插入,适合做纯增量写入场景,如埋点数据。 V2表才支持行级更新,适合做状态变化的更新,如订单表同步。 使用方式:建表语句时指定版本'format- 阅读全文
posted @ 2024-01-02 09:35 Robots2 阅读(405) 评论(0) 推荐(0)
摘要: 一、建表优化 1、iceberg表支持更新操作。 文档:https://iceberg.apache.org/docs/latest/configuration/ 功能描述:因v1只支持insert,如果有更新场景,则需要建表时指定format为V2版本 参数:'format-version'='2 阅读全文
posted @ 2024-01-02 09:34 Robots2 阅读(635) 评论(0) 推荐(0)
摘要: 一、简述 Kyuubi调用Spark来查询iceberg表,修改Spark配置信息即可。 二、服务配置 1、上传jar包到Kyuubi server节点 可以选择emr spark组件后,按照配置组(kyuubi-spark321)筛选kyuubi节点。 hadoop用户上传jar包:tx-iceb 阅读全文
posted @ 2024-01-02 09:32 Robots2 阅读(280) 评论(0) 推荐(0)
摘要: 一、背景 1、遇到问题描述 通过Flink同步mysql到iceberg中,任务一直在运行中,但是在目标表看不到数据。经排查发现job manager一直在做切片工作,切了一小时还没开始同步数据,日志如下: 2023-12-28 16:58:36.251 [snapshot-splitting] I 阅读全文
posted @ 2023-12-28 17:18 Robots2 阅读(1460) 评论(0) 推荐(0)
摘要: 报错内容Plugin Python was not installed: Cannot download 'https://plugins.jetbrains. 解决办法 file -> settings -> System Settings -> Updates 把 Use secure conn 阅读全文
posted @ 2023-12-22 16:07 Robots2 阅读(324) 评论(0) 推荐(0)
摘要: 一、日期处理 1、查询当前日期 SELECT current_date() 2023-12-22 2、查询当前时间戳 select current_timestamp() 2023-12-22 14:50:19.213 3、查询当前时间戳-1小时 select current_timestamp() 阅读全文
posted @ 2023-12-22 14:51 Robots2 阅读(258) 评论(0) 推荐(0)
摘要: 一、假数据解析 SELECT r1.col.dataSourceId, r1.col.database, r1.col.dataTable FROM (SELECT explode(r.json) AS col FROM ( SELECT from_json('[{"dataSourceId":4, 阅读全文
posted @ 2023-12-20 14:43 Robots2 阅读(472) 评论(0) 推荐(0)
上一页 1 ··· 8 9 10 11 12 13 14 15 16 ··· 36 下一页