cxin 发表于 2018-10-30 10:17:55

Hadoop子项目介绍

Hadoop家族项目图谱
  http://www.sxt.cn/editor/attached/image/20150504/269663359/5aa1da2a-36b6-44c3-9478-dcde7265f636.jpg
  各子项目介绍
  (1)Pig
  Hadoop客户端,解决非Java程序员使用Hadoop难题
  使用类似于SQL的面向数据流的语言Pig Latin
  Pig Latin可以完成排序,过滤,求和,聚组,关联等操作,可以支持自定义函数
  Pig自动把Pig Latin映射为Map-Reduce作业上传到集群运行,减少用户编写Java程序的苦恼
  三种运行方式:Grunt shell,脚本方式,嵌入式
  (2)Hbase
  Google Bigtable的开源实现
  列式数据库,提高响应速度和IO量
  可集群化
  可以使用shell、web、api等多种方式访问
  适合高读写(insert)的场景
  HQL查询语言
  NoSQL的典型代表产品
  (3)Hive
  数据仓库工具。可以把Hadoop下的原始结构化数据变成Hive中的表
  支持一种与SQL几乎完全相同的语言HiveQL。除了不支持更新、索引和事务,几乎SQL的其它特征都能支持
  可以看成是从SQL到Map-Reduce的映射器
  提供shell、JDBC/ODBC、Thrift、Web等接口
  (4)Zookeeper
  Google Chubby的开源实现
  用于协调分布式系统上的各种服务。例如确认消息是否准确到达,防止单点失效,处理负载均衡等
  应用场景:Hbase,实现Namenode自动切换
  工作原理:领导者,跟随者以及选举过程
  (5)Sqoop
  用于在Hadoop和关系型数据库之间交换数据
  通过JDBC接口连入关系型数据库
  (6)Avro
  数据序列化工具,由Hadoop的创始人Doug Cutting主持开发
  用于支持大批量数据交换的应用。支持二进制序列化方式,可以便捷,快速地处理大量数据
  动态语言友好,Avro提供的机制使动态语言可以方便地处理 Avro数据
  Thrift接口
  (7)Chukwa
  架构在Hadoop之上的数据采集与分析框架
  主要进行日志采集和分析
  通过安装在收集节点的“代理”采集最原始的日志数据
  代理将数据发给收集器
  收集器定时将数据写入Hadoop集群
  指定定时启动的Map-Reduce作业队数据进行加工处理和分析
  Hadoop基础管理中心(HICC)最终展示数据
  (8)Cassandra
  NoSQL,分布式的Key-Value型数据库,由Facebook贡献
  与Hbase类似,也是借鉴Google Bigtable的思想体系
  只有顺序写,没有随机写的设计,满足高负荷情形的性能需求

页: [1]
查看完整版本: Hadoop子项目介绍