“决胜云计算大数据时代”

Spark亚太研究院100期公益大讲堂【第8期互动问答分享】

Q1:spark线上用什么版本好？

建议从最低使用的Spark 1.0.0版本，Spark在1.0.0开始核心API已经稳定；

从功能的角度考虑使用最新版本的Spark 1.0.2也是非常好的，Spark 1.0.2在Spark 1.0.1的基础上做了非常多的改进；

Spark 1.0.2改进参考 http://spark.apache.org/releases/spark-release-1-0-2.html

Q2:希望可以细细讲讲推荐系统

推荐系统是机器学习中主要用武之地，Spark亚太研究院决胜大数据时代100期公益大讲堂后续会至少开设三期专题细细讲解；

Q3:用yarn mesos standalone 这几种方式那种用在线上好？spark线上用什么版本好？

如果以前没有部署过其它的大数据集群，集群中的计算框架只有Spark，建议直接使用Standalone，简洁而高效，这样有利于获得最大化的集群执行效率；

如果集群中在运行Spark计算平台的同时还运行了Hadoop的MapReduce、Storm等其它框架，建议使用mesos或者yarn；

在中国建议使用Yarn，因为淘宝已经在生产环境下大规模的使用了Yarn，同时Yarn有非常的中文资料；

Q4:机器学习是不是需要很深的数学功底还是别人实现了能运行跑起来就ok啦？？

Spark的MLLib极大的简化了机器学习库的使用，如果只是简单的使用，不要数学功底，只需要按照官方的示例直接使用即可。

如果进行复制的算法实现，需要数学功底，例如线性代数、统计学等

Q5:还是要深入学习机器学习的那些算法？

从实际应用的角度考虑，最重要的机器学习算法时协同过滤，基于协同过滤的推荐系统在应用系统中有广泛的应用，需要最为第一重点掌握；

分类、聚类、线性回归等也是非常常用而重要的；

Q6:请教下，如果目前应用主要是结构化数据的ORCALE，语言是PLSQL，转换到SPARKSQL是否难度很大，需要完全代码重写呢？

在实际生产环境下，数据和大数据系统是并行存在的，数据库一般直接负责线上交互，大数据系统负责数据分析、实时流处理、交互式查询等；

如果熟练使用PLSQL，可以轻而易举的掌握Spark SQL

Spark SQL的内容可以参考http://edu.51cto.com/lesson/id-33429.html

【互动问答分享】第8期决胜云计算大数据时代Spark亚太研究院公益大讲堂的更多相关文章

【互动问答分享】第15期决胜云计算大数据时代Spark亚太研究院公益大讲堂
"决胜云计算大数据时代" Spark亚太研究院100期公益大讲堂 [第15期互动问答分享] Q1:AppClient和worker.master之间的关系是什么? AppClien ...
【互动问答分享】第13期决胜云计算大数据时代Spark亚太研究院公益大讲堂
“决胜云计算大数据时代” Spark亚太研究院100期公益大讲堂 [第13期互动问答分享] Q1:tachyon+spark框架现在有很多大公司在使用吧? Yahoo!已经在长期大规模使用: 国内也有 ...
【互动问答分享】第10期决胜云计算大数据时代Spark亚太研究院公益大讲堂
“决胜云计算大数据时代” Spark亚太研究院100期公益大讲堂 [第10期互动问答分享] Q1:Spark on Yarn的运行方式是什么? Spark on Yarn的运行方式有两种:Client ...
【互动问答分享】第7期决胜云计算大数据时代Spark亚太研究院公益大讲堂
“决胜云计算大数据时代” Spark亚太研究院100期公益大讲堂 [第7期互动问答分享] Q1:Spark中的RDD到底是什么? RDD是Spark的核心抽象,可以把RDD看做“分布式函数编程语言”. ...
【互动问答分享】第6期决胜云计算大数据时代Spark亚太研究院公益大讲堂
“决胜云计算大数据时代” Spark亚太研究院100期公益大讲堂 [第6期互动问答分享] Q1:spark streaming 可以不同数据流 join吗? Spark Streaming不同的数据流 ...
【互动问答分享】第5期决胜云计算大数据时代Spark亚太研究院公益大讲堂
Spark亚太研究院100期公益大讲堂 [第5期互动问答分享] Q1:spark怎样支持即席,应该不是spark sql吧,是hive on spark么? Spark1.0 以前支持即席查询的技术是 ...
【互动问答分享】第11期决胜云计算大数据时代Spark亚太研究院公益大讲堂
Q1:docker成熟度如何? Docker是2013年和2014年最火爆的云计算开源项目: Baidu公司是中国使用Docker最为深入和最大规模的公司,线上稳定运行数十万个Docker容器,目前已 ...
【互动问答分享】第18期决胜云计算大数据时代Spark亚太研究院公益大讲堂
Q1:Master和Driver的是同一个东西吗? 两者不是同一个东西,在Standalone模式下Master是用于集群资源管理和调度的,而Driver适用于指挥Worker上的Executor通过 ...
如何成为云计算大数据Spark高手
Spark是发源于美国加州大学伯克利分校AMPLab的集群计算平台,它立足于内存计算,性能超过Hadoop百倍,从多迭代批量处理出发,兼收并蓄数据仓库.流处理和图计算等多种计算范式,是罕见的全能选手. ...

随机推荐

【bzoj4009】[HNOI2015]接水果 DFS序+树上倍增+整体二分+树状数组
题目描述给出一棵n个点的树,给定m条路径,每条路径有一个权值.q次询问求一个路径包含的所有给定路径中权值第k小的. 输入第一行三个数 n和P 和Q,表示树的大小和盘子的个数和水果的个数. 接下来n ...
DataBase -- JOIN
SQL JOIN:用于根据两个或多个表中列的关系,从这些表中查数据. (为了得到完整数据,我们需要从两个或多个表中获取结果.) 例如W3School中列出的实例,使用如下语句: select Pers ...
POJ - 1017 贪心训练
Packets Time Limit: 1000MS Memory Limit: 10000K Total Submissions: 59725 Accepted: 20273 Descrip ...
两个数组的交集 II [ LeetCode - 350 ]
原题地址:https://leetcode-cn.com/problems/intersection-of-two-arrays-ii/description/ 给定两个数组,写一个方法来计算 ...
tomcat发布web项目的三种方式
tomcat发布web项目的三种方式方式一: 配置tomcat 安装目录下的conf/server.xml <Host name="loaclhost">标签里面添加 ...
gitlab之：gitlab 403 forbidden 并发引起ip被封
步骤: * 打开/etc/gitlab/gitlab.rb文件. * 查找gitlab_rails['rack_attack_git_basic_auth']关键词. * 取消注释 * 修改ip_wh ...
打砖块（codevs 1257）
题目描述 Description 在一个凹槽中放置了n层砖块,最上面的一层有n块砖,第二层有n-1块,……最下面一层仅有一块砖.第i层的砖块从左至右编号为1,2,……i,第i层的第j块砖有一个价值a[ ...
全排列---（dfs）
全排列输入一个数n,按字典序输出1-n的全排列 #include "cstdio" #include "cstring" ],ans[],n; void dfs ...
Python基础(6)_函数
一为何要有函数? 不加区分地将所有功能的代码垒到一起,问题是: 代码可读性差代码冗余代码可扩展差如何解决? 函数即工具,事先准备工具的过程是定义函数,拿来就用指的就是函数调用结论:函数使用必 ...
403 Forbidden 错误
Forbidden You don't have permission to access /a.php on this server. apache昨天调试 httpd.conf 文件:<Di ...

【互动问答分享】第8期决胜云计算大数据时代Spark亚太研究院公益大讲堂

“决胜云计算大数据时代”

Spark亚太研究院100期公益大讲堂 【第8期互动问答分享】

【互动问答分享】第8期决胜云计算大数据时代Spark亚太研究院公益大讲堂的更多相关文章

随机推荐

热门专题

Spark亚太研究院100期公益大讲堂【第8期互动问答分享】