Spark快速大数据分析(注释版)
北京清数教育科技有限公司 译
出版时间:2026年07月
页数:337
”对于所有需要了解搭建大数据应用程序最流行框架的人,我首选推荐本书。“
——Ben Lorica
O'Reilly Media首席数据科学家
在科技迅速发展的今天,所有领域的数据都在迅速增加。如何高效地使用数据?本书介绍了开源的集群计算系统Apache Spark,帮助您快速且高效地编写和运行数据分析程序。通过调用Python、Java和Scala中的Spark API,您可以迅速地处理大型数据集。
本书由Spark的作者们编写,可以指导数据科学家和工程师们立即投入使用您将学习如何用几行代码执行并行的计算任务,运行从简单的批处理到流处理以及机器学习等各种应用程序。
● 通过阅读本书,您可以快速并深入地了解Spark的功能,如分布式数据集、内存缓存及交互式编程。
● 运用SparkSQL、SparkStreaming和MLlib 等强大的Spark内置库。
● 在脚本中使用同一种编程范式,而非混杂各种工具,如HiveHadoop、Mahout和Storm等。
● 了解如何部署交互式、批式和流式应用程序。
● 连接不同的数据源,例如HDFS、Hive、JSON和S3等。
● 掌握数据分区和共享变量等高级知识。
书名:Spark快速大数据分析(注释版)
译者:北京清数教育科技有限公司 译
国内出版社:清华大学出版社
出版时间:2026年07月
页数:337
书号:978-7-302-69832-6
原版书书名:Learning Spark
原版书出版商:O'Reilly Media
Holden Karau
Holden Karau是一位加拿大人,在IBM的Spark技术中心担任软件开发工程师。同时作为一位Spark committer,经常在PySpark和机器学习方面进行贡献。另外曾在多次国际会议中发表关于Spark的演讲。
Databricks的软件开发工程师,活跃于开源社区。她还著有《Spark快速数据处理》。
Andy Konwinski
Databricks联合创始人,Apache Spark项目技术专家,还是Apache Mesos项目的联合发起人。
Patrick Wendell
Databricks联合创始人,也是Apache Spark项目技术专家。他还负责维护Spark核心引擎的几个子系统。
Matei Zaharia
Matei Zaharia是斯坦福大学计算机科学系助理教授和Databricks的首席技术官。他于2009年在加州大学伯克利分校立了Spark项目,那时他是一名博士生,并继续担任pache Spark项目的副主席。Matei Zaharia还是Apache Mesos项目的联合创始人,也 是Apache Hadoop项目的贡献者。Matei Zaharia以他出色的研究工作获得了2014年美国计算机学会博士论文奖(ACM Doctoral Dissertation Award)和VMware系统研究奖(VMware Systems Research Award)。