✨[hadoop3.x]新一代的存储格式Apache Arrow(四)
文章目录
前言
目前博客Hadoop文章大都停留在Hadoop2.x阶段,本系列将依据黑马程序员大数据Hadoop3.x全套教程,对2.x没有的新特性进行补充更新,一键三连加关注,下次不迷路!
历史文章
[hadoop3.x系列]HDFS REST HTTP API的使用(一)WebHDFS
[hadoop3.x系列]HDFS REST HTTP API的使用(二)HttpFS
[hadoop3.x系列]Hadoop常用文件存储格式及BigData File Viewer工具的使用(三)
✨[hadoop3.x]新一代的存储格式Apache Arrow(四)
新一代的存储格式Apache Arrow
Arrow简介
l Apache Arrow是一个跨语言平台,是一种列式内存数据结构,主要用于构建数据系统。Apache Arrow在2016年2月17日作为顶级Apache项目引入。
l Apache Arrow发展非常迅速,并且在未来会有更好的发展空间。 它可以在系统之间进行高效且快速的数据交换,而无需进行序列化,而这些成本已与其他系统(例如Thrift,Avro和Protocol Buffers)相关联。
l 每一个系统实现,它的方法(method)都有自己的内存存储格式,在开发中,70%-80%的时间浪费在了序列化和反序列化上。
l Arrow促进了许多组件之间的通信。 例如,使用Python(pandas)读取复杂的文件并将其转换为Spark DataFrame。
Arrow是如何提升数据移动性能的
l 利用Arrow作为内存中数据表示的两个过程可以将数据从一种方法“重定向”到另一种方法,而无需序列化或反序列化。 例如,Spark可以使用Python进程发送Arrow数据来执行用户定义的函数。
l 无需进行反序列化,可以直接从启用了Arrow的数据存储系统中接收Arrow数据。 例如,Kudu可以将Arrow数据直接发送到Impala进行分析。
以将Arrow数据直接发送到Impala进行分析。
l Arrow的设计针对嵌套结构化数据(例如在Impala或Spark Data框架中)的分析性能进行了优化。
后记
博客主页:https://manor.blog.csdn.net 本文由 manor 原创,首发于 CSDN博客 Hadoop系列文章会每天更新!✨
相关文章
- 突破:芯片存储容量提高1000倍
- 10大高性能开发宝石,我要消灭一半程序员!
- 今天这个时代到底需要什么样的技术思维?
- 希望我这是最后一次谈SaaS
- CPU:别再拿我当搬砖工!一个故事看懂零拷贝技术
- 比尔.盖茨:TikTok的美国数据将获得微软的安全保证
- 收购TikTok,对微软有什么意义?
- React 中请求远程数据的四种方法
- 《麻省理工科技评论》2020年“全球十大突破性技术”,18位顶级专家联手深度解读
- 别再用数据库生成的ID了
- 集合啦,NLP数据增强技术!超全资源汇总
- 4个常用的查询函数都不掌握,那就真的Out了
- 首次曝光的计算模型!对标阿里?有没有想过你的中台只是废纸?
- HTTP/3 来了 !未来可期
- 数据科学家小贴士:10个优秀的可视化工具
- 聊天机器人是如何通过知识图谱回答问题的?
- 一言难尽,Jpa这个功能差点让我丢了工作
- 无代码的未来?
- 探索自然本源!谷歌2022年终总结第七弹:「生化环材」如何吃上机器学习红利?
- 一文通览自动驾驶三大主流芯片架构