温馨提示×

温馨提示×

您好，登录后才能下订单哦！

密码登录×

忘记密码？

登录注册×

获取短信验证码

其他方式登录

点击登录注册即表示同意《亿速云用户服务条款》

用户登录×

账户密码登录

请使用微信扫描上方二维码

使用帮助

请求超时！

请点击重新获取二维码

spark线上用哪个版本好

发布时间：2021-12-16 14:31:54 阅读：162 作者：iii 栏目：云计算

开发者测试专用服务器限时活动，0元免费领，库存有限，领完即止！点击查看>>

这篇文章主要介绍“spark线上用哪个版本好”，在日常操作中，相信很多人在spark线上用哪个版本好问题上存在疑惑，小编查阅了各式资料，整理出简单好用的操作方法，希望对大家解答”spark线上用哪个版本好”的疑惑有所帮助！接下来，请跟着小编一起来学习吧！

Q1:spark线上用什么版本好？

建议从最低使用的Spark 1.0.0版本，Spark在1.0.0开始核心API已经稳定；
从功能的角度考虑使用最新版本的Spark 1.0.2也是非常好的，Spark 1.0.2在Spark 1.0.1的基础上做了非常多的改进；

Q2:希望可以细细讲讲推荐系统

推荐系统是机器学习中主要用武之地，Spark亚太研究院决胜大数据时代100期公益大讲堂后续会至少开设三期专题细细讲解；

Q3:用yarn mesos standalone 这几种方式那种用在线上好？spark线上用什么版本好？

如果以前没有部署过其它的大数据集群，集群中的计算框架只有Spark，建议直接使用Standalone，简洁而高效，这样有利于获得最大化的集群执行效率；
如果集群中在运行Spark计算平台的同时还运行了Hadoop的MapReduce、Storm等其它框架，建议使用mesos或者yarn；
在中国建议使用Yarn，因为淘宝已经在生产环境下大规模的使用了Yarn，同时Yarn有非常的中文资料；

Q4:机器学习是不是需要很深的数学功底还是别人实现了能运行跑起来就ok啦？？

Spark的MLLib极大的简化了机器学习库的使用，如果只是简单的使用，不要数学功底，只需要按照官方的示例直接使用即可。
如果进行复制的算法实现，需要数学功底，例如线性代数、统计学等

Q5:还是要深入学习机器学习的那些算法？

从实际应用的角度考虑，最重要的机器学习算法时协同过滤，基于协同过滤的推荐系统在应用系统中有广泛的应用，需要最为第一重点掌握；
分类、聚类、线性回归等也是非常常用而重要的；

Q6:请教下，如果目前应用主要是结构化数据的ORCALE，语言是PLSQL，转换到SPARKSQL是否难度很大，需要完全代码重写呢？

在实际生产环境下，数据和大数据系统是并行存在的，数据库一般直接负责线上交互，大数据系统负责数据分析、实时流处理、交互式查询等；
如果熟练使用PLSQL，可以轻而易举的掌握Spark SQL

到此，关于“spark线上用哪个版本好”的学习就结束了，希望能够解决大家的疑惑。理论与实践的搭配能更好的帮助大家学习，快去试试吧！若想继续学习更多相关知识，请继续关注亿速云网站，小编会继续努力为大家带来更多实用的文章！

亿速云「云服务器」，即开即用、新一代英特尔至强铂金CPU、三副本存储NVMe SSD云盘，价格低至29元/月。点击查看>>

向AI问一下细节

推荐阅读：

免责声明：本站发布的内容（图片、视频和文字）以原创、转载和分享为主，文章观点不代表本网站立场，如果涉及侵权请联系站长邮箱：is@yisu.com进行举报，并提供相关证据，一经查实，将立刻删除涉嫌侵权内容。

原文链接：https://my.oschina.net/u/1791057/blog/305044

上一篇新闻：
spark on yarn跟on docker有什么区别
下一篇新闻：
Linux sftp命令的用法是怎样的

猜你喜欢

AI
助
手

产品服务

地区划分

专题活动

帮助支持

关于我们

售后咨询

7*24小时在线电话：400-100-2938

7*24小时在线 QQ：800811969

关注亿速云

亿速云公众号

手机网站二维码