更新时间:2022-07-19 GMT+08:00
场景说明
场景说明
用户可以使用Spark调用HBase的接口来操作HBase表的功能。在Spark应用中,用户可以自由使用HBase的接口来实现创建表、读取表、往表中插入数据等操作。
数据规划
首先需要把数据文件放置在HDFS系统里。
- 本地新建文本文件,将以下内容复制保存到input_data1.txt。
20,30,40,xxx
- 在HDFS上建立一个文件夹,“/tmp/input”,并上传input_data1.txt到此目录,命令如下。
如果开启了kerberos认证,需要将客户端的配置文件“spark-defaults.conf”中的配置项spark.yarn.security.credentials.hbase.enabled置为true。
开发思路
- 创建HBase表。
- 往HBase表中插入数据。
- 通过Spark Application读取HBase表的数据。
父主题: Spark on HBase程序