Spark

  Spark是UC Berkeley AMP lab所开源的类Hadoop MapReduce的通用的并行计算框架,Spark基于map reduce算法实现的分布式计算, 拥有Hadoop MapReduce所具有的优点;但不同于MapReduce的是Job中间输出和结果可以保存在内存中,从而不再需要读写HDFS, 因此Spark能更 好地适用于数据挖掘与机器学习等需要迭代的map reduce的算法

7
推荐
4813
阅读

windows下虚拟机配置spark集群最强攻略!

1、虚拟机安装首先需要在windows上安装vmware和ubuntu虚拟机,这里就不多说了vmware下载地址:直接百度搜索,使用百度提供的链接下载,这里附上一个破解码5A0...
4
推荐
2474
阅读

使用scala开发spark入门总结

一、spark简单介绍关于spark的介绍网上有很多,可以自行百度和google,这里只做简单介绍。推荐简单介绍连接:http://blog.jobbole.com/89446/1、  ...
4
推荐
1689
阅读

Spark Streaming相关的0到1计划

最近计划流相关的技术改进, Goldengate到Kafka的连接已经打通, 最近在准备Spark Streaming相关内容, 把计划工作列一下.0了解阶段--Spark能实现什么内容 0.1 ...
3
推荐
3780
阅读

Hive on Spark

注:若需转载,请注明出处!Hive on Spark大数据平台搭建 hive 2.0.0 spark 1.5.0Hive on Spark1. 修改$HIVE_HOME/conf/hive-site.xml2. 添加spark...
3
推荐
2878
阅读

最全的Spark基础知识解答

一. Spark基础知识 1.Spark是什么?UCBerkeley AMPlab所开源的类HadoopMapReduce的通用的并行计算框架。dfsSpark基于mapreduce算法实现的分布式计算,拥...
3
推荐
2890
阅读

ELK 在 Spark 集群的应用

概述大数据处理技术越来越火,云计算平台也如火如荼,二者犹如 IT 列车的两个车轮,相辅相成,高速发展。如果我们将大数据处理平台比作一个可能会得病的人的话,...
3
推荐
1630
阅读

spark与hadoop

在网上摘取的一些关于两者的对比,待增加。。sparkSpark是小数据集上处理复杂迭代的交互系统,并不擅长大数据集,也没有稳定性。但是最近的风评已经变化,尤...
3
推荐
2753
阅读

Spark学习总结(一)

最近一周学习了scala编程基础和spark核心编程,现主要对所学的spark部分做个总结。RDD及其特点1、RDD是Spark的核心数据模型,但是个抽象类,全称为Resillient...
3
推荐
4586
阅读

Idea下使用maven打包可执行jar包并小案例演示

这一阵子在学习spark,有些本地执行不了,需要到集群上才能执行,奈何打包后的jar包放到集群上跑后一直找不到主类,折腾了好一会才搞出来,所以来此记录一下...
3
推荐
2104
阅读

在 Spark 中使用 IPython Notebook

本文是从 IPython Notebook 转化而来,效果没有本来那么好。主要为体验 IPython Notebook。至于题目,改成《在 IPython Notebook 中使用 Spark》也可以,没什...
3
推荐
3997
阅读

Hadoop + Hive + Spark 完整安装攻略

Prerequisites 桌面环境: Mac OSX虚拟机管理软体: Vagrant虚拟机: Virtual BoxClone repogit clone https://github.com/bryanyang0528/hellobicd h...
3
推荐
2736
阅读

虚拟机安装CentOS系统,并在系统里安装python、spark、kafka,建立postgreSQL数据库

虚拟机直接网上下载后,按照流程一键安装就行,这个比较简单就不多叙述一、安装linux系统1.1  安装好虚拟机后,直接去官网下载CentOS7,链接http://mirr...
2
推荐
1677
阅读

Spark知识体系完整解读

摘要:2014年6月至今工作于北京亚信智慧数据科技有限公司 BDX大数据事业部,从2014年9月开始从事项目spark相关应用开发。Spark简介Spark是整个BDAS的核心组件...
2
推荐
2084
阅读

Spark2.0,重要更新与改进

01 引言就在前天(2016.07.26号),Spark2.0正式版本发布了。来看看当今最世上最强大的全栈数据处理框架吧!作为数据科学人员,如果一生只能学一个框架,那就...
2
推荐
2088
阅读

Sparklyr 0.5 已在CRAN正式发布

Sparklyr 0.5 包已经在CRAN正式发布,新的版本在以下几个方面做了优化:1)加强对dplyr支持,如do( )和n_distinct( )2)增加新的函数,如sdf_quantile( )、ft...

887 人关注

最佳回复者

改版

反馈