尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

大数据-259 离线数仓 - Griffin架构 修改配置 pom.xml sparkProperties 编译启动

大数据-259 离线数仓 - Griffin架构 修改配置 pom.xml sparkProperties 编译启动 点一下关注吧非常感谢持续更新----------------------Java篇开始了---------目前开始更新 MyBatis一起深入浅出目前已经更新到了---------* Hadoop已更完* HDFS已更完* MapReduce已更完* Hive已更完* Flume已更完* Sqoop已更完* Zookeeper已更完* HBase已更完* Redis 已更完* Kafka已更完* Spark已更完* Flink已更完* ClickHouse已更完* Kudu已更完* Druid已更完* Kylin已更完* Elasticsearch已更完* DataX已更完* Tez已更完* 数据挖掘已更完* Prometheus已更完* Grafana已更完* 离线数仓正在更新…章节内容----* Griffin架构 配置安装* Livy 架构设计* 解压配置 Hadoop Hive主要特点----### 数据质量评估Apache Griffin 支持基于规则和模型的质量评估。用户可以为数据集定义不同的质量规则例如完整性、准确性、一致性、有效性和及时性等。通过这些规则系统可以自动识别和标记质量问题。### 质量规则定义和管理用户可以自定义规则使用 JSON 或其他标准格式来描述数据质量的各项要求。这些规则能够对数据进行周期性检查并在发现问题时发出警报或进行自动修复。### 灵活的数据源支持Griffin 可以与多种数据源和平台集成支持数据从 HDFS、Hive、Kafka、HBase 等数据存储中读取。它能够处理批处理和流处理两种模式的数据。### 多维度数据质量监控Apache Griffin 提供了多维度的数据质量监控功能允许用户基于时间、地点、数据源等多个维度进行数据质量评估。这使得用户能够灵活地设置监控指标获得更精细的质量控制。### 可视化界面Griffin 提供了一个可视化的界面用户可以在其中查看数据质量评估的结果、数据质量报告、警告信息等。该界面使得管理者能够直观地监控和分析数据质量问题。### 集成与兼容性Griffin 与多种大数据平台高度集成能够与现有的大数据基础设施兼容使用。例如它可以与 Hadoop、Spark 等数据处理引擎协同工作确保数据处理过程中的质量问题被及时发现和修正。### 自动化修复除了检测数据质量问题Apache Griffin 还支持自动修复部分数据质量问题比如自动填补缺失值或调整数据格式减少人工干预。### 扩展性Griffin 提供了扩展的接口和插件机制允许用户根据需要扩展数据质量检测功能适应不同场景下的需求。上节到了Griffin配置部分 下面继续--------------------### 配置修改#### pom.xml修改 pom cd /opt/servers/griffin-0.5.0 vim service/pom.xml 修改内容约113行加入MySQL的依赖 mysql mysql-connector-java ${mysql.java.version} 修改结果如下这里注意MySQL的版本我这里是MySQL8版本#### application.properties cd /opt/servers/griffin-0.5.0 vim service/src/main/resources/application.properties server.port 9876 spring.application.namegriffin_service spring.datasource.urljdbc:mysql://h123.wzk.icu:3306/quartz?autoReconnecttrueuseSSLfalse spring.datasource.usernamehive spring.datasource.passwordhivewzk.icu spring.jpa.generate-ddltrue spring.datasource.driver-class-namecom.mysql.jdbc.Driver spring.jpa.show-sqltrue # Hive metastore hive.metastore.uristhrift://h123.wzk.icu:9083 hive.metastore.dbnamehivemetadata hive.hmshandler.retry.attempts15 hive.hmshandler.retry.interval2000ms # Hive cache time cache.evict.hive.fixedRate.in.milliseconds900000 # Kafka schema registry kafka.schema.registry.urlhttp://localhost:8081 # Update job instance state at regular intervals jobInstance.fixedDelay.in.milliseconds60000 # Expired time of job instance which is 7 days that is604800000 milliseconds.Time unit only supports milliseconds jobInstance.expired.milliseconds604800000 # schedule predicate job every 5 minutes and repeat 12 timesat most #interval time unit s:second m:minute h:hour d:day,onlysupport these four units predicate.job.interval5m predicate.job.repeat.count12 # external properties directory location external.config.location # external BATCH or STREAMING env external.env.location # login strategy (“default” or “ldap”) login.strategydefault # ldap ldap.urlldap://hostname:port ldap.emailexample.com ldap.searchBaseDCorg,DCexample ldap.searchPattern(sAMAccountName{0}) # hdfs default name fs.defaultFS # elasticsearch elasticsearch.hosth123.wzk.icu elasticsearch.port9200 elasticsearch.schemehttp # elasticsearch.user user # elasticsearch.password password # livy livy.urihttp://0.0.0.0:8998/batches livy.need.queuefalse livy.task.max.concurrent.count20 livy.task.submit.interval.second3 livy.task.appId.retry.count3 # yarn url yarn.urihttp://h123.wzk.icu:8088 # griffin event listener internal.event.listenersGriffinJobEventHook 对应的截图如下所示备注* 默认是8080防止冲突修改为9876* 需要启动Hive的Metastore服务* 如果Griffin、MySQL没有在同一台节点上需要确认可以远程登录#### quartz.properties cd /opt/servers/griffin-0.5.0 vim service/src/main/resources/quartz.properties 修改内容 # 将第26行修改为以下内容 org.quartz.jobStore.driverDelegateClassorg.quartz.impl.jdbcjobstore.StdJDBCDelegate 修改内容如下所示#### sparkProperties.json修改配置文件 cd /opt/servers/griffin-0.5.0 vim service/src/main/resources/sparkProperties.json 修改内容如下spark.yarn.dist.files { “file”: “hdfs:///griffin/griffin-measure.jar”, “className”: “org.apache.griffin.measure.Application”, “name”: “griffin”, “queue”: “default”, “numExecutors”: 2, “executorCores”: 1, “driverMemory”: “1g”, “executorMemory”: “1g”, “conf”: { “spark.yarn.dist.files”: “hdfs:///spark/spark_conf/hive-site.xml” }, “files”: [ ] } 修改的内容如下所示#### env_batch.json继续修改对应的配置文件 cd /opt/servers/griffin-0.5.0 vim service/src/main/resources/env/env_batch.json 修改的内容如下 { “spark”: { “log.level”: “WARN” }, “sinks”: [ { “type”: “CONSOLE”, “config”: { “max.log.lines”: 10 } }, { “type”: “HDFS”, “config”: { “path”: “hdfs:///griffin/persist”, “max.persist.lines”: 10000, “max.lines.per.file”: 10000 } }, { “type”: “ELASTICSEARCH”, “config”: { “method”: “post”, “api”: “http://h123.wzk.icu:9200/griffin/accuracy”, “connection.timeout”: “1m”, “retry”: 10 } } ], “griffin.checkpoint”: [] } 备注* 修改config.api的地址### 正式编译 cd /opt/servers/griffin-0.5.0 mvn -Dmaven.test.skiptrue clean install 备注* 编译过程中需要下载500M的jar包* 如果修改了前面的配置文件 需要重新编译执行过程如下所示### Jar拷贝编译完成之后会在service和measure模块的target目录下分别看到service-0.5.0.jar 和 measure-0.5.0.jar 两个jar将这两个jar分别拷贝到服务器de 目录下 cd /opt/servers/griffin-0.5.0/service/target cp service-0.5.0.jar /opt/servers/griffin-0.5.0/ cd /opt/servers/griffin-0.5.0/measure/target cp measure-0.5.0.jar /opt/lagou/servers/griffin-0.5.0/griffin-measure.jar cd /opt/lagou/servers/griffin-0.5.0 hdfs dfs -mkdir /griffin hdfs dfs -put griffin-measure.jar /griffin 备注Spark在YARN集群上执行任务时需要到HDFS的/griffin目录下加载griffin-measure.jar避免发生org.apache.griffin.measure.Application找不到的错误### 启动服务启动Griffin管理后台 cd /opt/servers/griffin-0.5.0 nohup java -jar service-0.5.0.jarservice.out 21 启动之后我们需要访问地址 http://h122.wzk.icu:9876 访问的结果如下图所示
返回列表