登录社区云,与社区用户共同成长
邀请您加入社区
hadoop fs -chmod -R 777 /sparkdata
大数据技术之高频面试题第1章 项目涉及技术1.1 Linux&Shell相关总结序号命令命令解释1top查看内存2df-h查看磁盘存储情况3iotop查看磁盘IO读写(yum intsall iotop安装)4iotop -o直接查看比较高的磁盘读写程序5netstat -tunlp | grep 端口号查看端口占用情况6uptime查看报告
Kettle(传统的ETL工具)特性:纯Java编写,通过建立资源库可多端访问,直接在windows上进行作业开发,同步资源库,在linux上执行定时任务优点:可在Windows、linux、Unix上执行;数据抽取高效稳定;子组件spoon有丰富的Steps可以开发复杂业务逻辑场景,方便实现全量、增量同步;可视化界面缺点:通过定时运行,实时性较差;组成部分:Spoon:允许使用图形...
我使用的是CDH6版本,开源版类似。/etc/hadoop/conf/hdfs-site.xmlhdfs-site.xml中配置了HA通过以下命令查看两个namenode的状态:hdfs haadmin -getServiceState namenode202hdfs haadmin -getServiceState namenode177例子:判断nameno...
Hive具有一个可选的组件叫HiveServer或HiveThrift,其允许通过指定端口访问Hive。启动Thrift Server进入Hive安装目录 使用如下命令开启服务hive --service hiveserver &检查HiveServer是否启动成功使用如下命令 netstat -nl | grep 10000配置Groovy使用HiveSe
限制空间大小:hdfs dfsadmin -setSpaceQuota限流大小【(128*3)的倍数】/路径清除限制空间大小:hdfs dfsadmin -clrSpaceQuota/路径
一、背景HDFS集群中只有一个Namenode,这就会引入单点问题;即如果Namenode故障,那么这个集群将不可用,直到Namenode重启或者其他Namenode接入。有两种方式会影响集群的整体可用性:1. 意外的突发事件,比如物理机器crash,集群将不可用,直到管理员重启Namenode。2. 系统维护,比如软件升级等,需要关闭Namenode,也会导致集群暂时性的失效。
1.HDFS的基本框架与工作过程1.1 基本组成结构与文件访问过程HDFS是一个建立在一组分布式服务器节点的本地文件系统之上的分布式文件系统。其采用经典的主-从式结构,其基本组成结构如图1所示。图1HDFS的基本组成结构一个HDFS文件系统包括一个主控节点NameNode和一组DataNode从节点。NameNode是一个主服务器,用来管理整个文件系统的命名空间和元数