Hadoop子项目介绍

cxin 发表于 2018-10-30 10:17:55

Hadoop家族项目图谱
　　http://www.sxt.cn/editor/attached/image/20150504/269663359/5aa1da2a-36b6-44c3-9478-dcde7265f636.jpg
　　各子项目介绍
　　（1）Pig
　　Hadoop客户端，解决非Java程序员使用Hadoop难题
　　使用类似于SQL的面向数据流的语言Pig Latin
　　Pig Latin可以完成排序，过滤，求和，聚组，关联等操作，可以支持自定义函数
　　Pig自动把Pig Latin映射为Map-Reduce作业上传到集群运行，减少用户编写Java程序的苦恼
　　三种运行方式：Grunt shell，脚本方式，嵌入式
　　（2）Hbase
　　Google Bigtable的开源实现
　　列式数据库，提高响应速度和IO量
　　可集群化
　　可以使用shell、web、api等多种方式访问
　　适合高读写（insert）的场景
　　HQL查询语言
　　NoSQL的典型代表产品
　　（3）Hive
　　数据仓库工具。可以把Hadoop下的原始结构化数据变成Hive中的表
　　支持一种与SQL几乎完全相同的语言HiveQL。除了不支持更新、索引和事务，几乎SQL的其它特征都能支持
　　可以看成是从SQL到Map-Reduce的映射器
　　提供shell、JDBC/ODBC、Thrift、Web等接口
　　（4）Zookeeper
　　Google Chubby的开源实现
　　用于协调分布式系统上的各种服务。例如确认消息是否准确到达，防止单点失效，处理负载均衡等
　　应用场景：Hbase，实现Namenode自动切换
　　工作原理：领导者，跟随者以及选举过程
　　（5）Sqoop
　　用于在Hadoop和关系型数据库之间交换数据
　　通过JDBC接口连入关系型数据库
　　（6）Avro
　　数据序列化工具，由Hadoop的创始人Doug Cutting主持开发
　　用于支持大批量数据交换的应用。支持二进制序列化方式，可以便捷，快速地处理大量数据
　　动态语言友好，Avro提供的机制使动态语言可以方便地处理 Avro数据
　　Thrift接口
　　（7）Chukwa
　　架构在Hadoop之上的数据采集与分析框架
　　主要进行日志采集和分析
　　通过安装在收集节点的“代理”采集最原始的日志数据
　　代理将数据发给收集器
　　收集器定时将数据写入Hadoop集群
　　指定定时启动的Map-Reduce作业队数据进行加工处理和分析
　　Hadoop基础管理中心（HICC）最终展示数据
　　（8）Cassandra
　　NoSQL，分布式的Key-Value型数据库，由Facebook贡献
　　与Hbase类似，也是借鉴Google Bigtable的思想体系
　　只有顺序写，没有随机写的设计，满足高负荷情形的性能需求

页: [1]

运维网's Archiver

Hadoop子项目介绍