实现Spark集群部署 这些公司都经历了什么?
软件公司Intuit和Novantas经过深思熟虑,决定部署他们的***个Spark集群,限制初始用户访问并寻找坚实的商业用途。
Intuit公司建立了Spark集群,最初用于在网站和进入在线表单的数据用户的财务和会计软件分析点击流记录。但是Intuit的副总裁Bill Loconzolo并不打算使用开源数据处理引擎。
Loconzolo表示,在他的印象中,Spark似乎并不是很灵活。但是尽管Spark集群设置是实验性质的,数据科学家团队也可以使用。Loconzolo说,2016年年底之前,他不打算开放系统。
他想要建立一个基于Cloudera公司Hadoop分布的大数据分析架构,他准备使用Spark等新技术至少六个月,以便判断公司是否做好了准备。
“以前使用大数据技术时,我们有过类似的教训,”他解释说,“有时候,提前做准备是我们避免失败的有效方式。”
Novantas公司的***技术官和工程主管Kaushik Deka表示,开始使用Hadoop时,他的团队也采取了非常谨慎的战略模式。
“一年前,我们从未使用过大数据平台,”Deka说,“我们完全认同这样的技术,但想要使用这些技术,公司内部文化需要做些真正的努力和转变。”Novantas还必须通过对现有员工进行培训,建立像Spark一样的内部专业工具。
为了避免偏离轨道,该公司非常谨慎地寻找一个坚实的初始业务用于大数据技术。达到搜索高峰时,银行利用其分析服务和软件结合不同的数据集来支持个人客户如何应对市场营销的预测模型。Spark非常适合该应用程序,可以作为一个引擎完成提取、转换和加载数据集成工作。
Gartner分析师Nick Heudecker说,咨询公司获得了客户关于Spark评价的 “实质性”调查。但这项技术尚未成熟,企业用户中关于Spark集群的产品相对较少。他说,“我们对这项技术很感兴趣,Spark是否转化为部署是我们密切关注的事情。”
相关文章
- 数据孤岛是业务效率的无声杀手
- 2023展望:新的一年将给大数据分析领域带来什么?
- 阿里云ADB基于Hudi构建Lakehouse的实践
- 大数据在医疗保健领域的使用案例
- 微软增加说明:KB5021751 更新扫描已经 / 即将过时 Office 过程中不会触碰用户隐私
- 2022 Gartner全球云数据库管理系统魔力象限发布 腾讯云数据库入选
- 场景化、重实操,分享一个实时数仓实践案例
- Arctic的湖仓一体践行之路
- 分布式计算MapReduce究竟是怎么一回事?
- 淘系数据模型治理优秀实践
- 大数据分析对医疗保健的影响
- 当我们说大数据Hadoop,究竟在说什么?
- 2022年及以后大数据的五个发展趋势
- 网易严选离线数仓治理实践
- 2023 年数据治理趋势
- 一份“靠谱”的年度经营计划,你学会了吗?
- 漫谈对大数据的思考
- 测试一下,读懂数据的能力,你有吗?
- 用艺术的眼光探索数据之美
- 聊聊数据分析成果如何落地