Spark快速大数据分析(注释版)
Spark快速大数据分析(注释版)
Holden Karau, Andy Konwinski, Patrick Wendell, Matei Zaharia
北京清数教育科技有限公司 译
出版时间:2026年07月
页数:337
”对于所有需要了解搭建大数据应用程序最流行框架的人,我首选推荐本书。“
——Ben Lorica
O'Reilly Media首席数据科学家

在科技迅速发展的今天,所有领域的数据都在迅速增加。如何高效地使用数据?本书介绍了开源的集群计算系统Apache Spark,帮助您快速且高效地编写和运行数据分析程序。通过调用Python、Java和Scala中的Spark API,您可以迅速地处理大型数据集。
本书由Spark的作者们编写,可以指导数据科学家和工程师们立即投入使用您将学习如何用几行代码执行并行的计算任务,运行从简单的批处理到流处理以及机器学习等各种应用程序。
● 通过阅读本书,您可以快速并深入地了解Spark的功能,如分布式数据集、内存缓存及交互式编程。
● 运用SparkSQL、SparkStreaming和MLlib 等强大的Spark内置库。
● 在脚本中使用同一种编程范式,而非混杂各种工具,如HiveHadoop、Mahout和Storm等。
● 了解如何部署交互式、批式和流式应用程序。
● 连接不同的数据源,例如HDFS、Hive、JSON和S3等。
● 掌握数据分区和共享变量等高级知识。

  1. Chapter 1 Introduction to Data Analysis with Spark/Spark数据分析简介
  2. What Is Apache Spark?/什么是Apache Spark?
  3. A Unified Stack/统一的Spark组件栈
  4. Who Uses Spark, and for What?/Spark的目标用户及用途
  5. A Brief History of Spark/Spark发展简史
  6. Spark Versions and Releases/Spark版本及更新
  7. Storage Layers for Spark/Spark的存储层
  8. Chapter 2 Downloading Spark and Getting Started/Spark下载和使用入门
  9. Downloading Spark/Spark 下载
  10. Introduction to Spark’s Python and Scala Shells/Spark Python Shell和Scala Shell简介
  11. Introduction to Core Spark Concepts/Spark核心概念介绍
  12. Passing Functions to Spark
  13. Standalone Applications/Spark独立应用
  14. Building Standalone Applications/构建Spark独立应用程序
  15. Conclusion/本章小结
  16. Chapter 3 Programming with RDDs/认识弹性分布式数据集(RDD)
  17. RDD Basics/RDD的基本概念
  18. Creating RDDs/新建RDD
  19. RDD Operations/对RDD的操作
  20. Passing Functions to Spark/向Spark中传递函数
  21. Common Transformations and Actions/常用的RDD转化操作及行动操作
  22. Converting Between RDD Types
  23. Persistence (Caching)/RDD的持久化(缓存)
  24. Conclusion/本章小结
  25. Chapter 4 Working with Key/Value Pairs/键值对操作
  26. Motivation/动机
  27. Creating Pair RDDs/创建Pair RDD
  28. Transformations on Pair RDDs/Pair RDD的转化操作
  29. Aggregations/聚合
  30. Actions Available on Pair RDDs/用于Pair RDD的行动操作
  31. Data Partitioning (Advanced)/数据分区(进阶)
  32. Determining an RDD’s Partitioner/确认RDD的分区方式
  33. Operations That Benefit from Partitioning/通过数据分区能提升Spark处理效率的操作
  34. Operations That Affect Partitioning/会影响数据分区的操作
  35. Custom Partitioners/自定义分区器
  36. Conclusion/本章小结
  37. Chapter 5 Loading and Saving Your Data/数据的读取与保存
  38. Motivation/动机
  39. File Formats/文件格式
  40. JSON
  41. Comma-Separated Values and Tab-Separated Values
  42. Filesystems/文件系统
  43. Structured Data with Spark SQL/Spark SQL中的结构化数据
  44. Databases/数据库
  45. Conclusion/本章小结
  46. Chapter 6 Advanced Spark Programming/Spark编程进阶
  47. Introduction/介绍
  48. Accumulators/累加器
  49. Accumulators and Fault Tolerance/累加器和容错性
  50. Custom Accumulators/自定义累加器
  51. Broadcast Variables/广播变量
  52. Optimizing Broadcasts/最优化广播变量
  53. Working on a Per-Partition Basis/基于分区进行的操作
  54. Piping to External Programs/在Spark 中调用外部程序的管道
  55. Numeric RDD Operations/针对数值格式的RDD的操作
  56. Conclusion
  57. Chapter 7 Running on a Cluster/在集群上运行Spark
  58. Introduction/简介
  59. Spark Runtime Architecture/Spark 运行时架构
  60. Packaging Your Code and Dependencies/打包程序代码和依赖
  61. A Java Spark Application Built with Maven/使用Maven编译Spark Java应用程序
  62. Scheduling Within and Between Spark Applications/在不同Spark应用程序之间调度
  63. Cluster Managers/集群管理器
  64. Hadoop YARN
  65. Which Cluster Manager to Use?/应该用哪一个集群管理器?
  66. Conclusion
  67. Chapter 8 Tuning and Debugging Spark/Spark程序调试与调优
  68. Configuring Spark with SparkConf/通过SparkConf设置Spark
  69. Components of Execution: Jobs, Tasks, and Stages/Spark任务运行的组成部分:Jobs, Tasks and Stages
  70. Finding Information/查看Spark运行信息
  71. Key Performance Considerations/影响Spark程序运行性能的方面
  72. Conclusion
  73. Chapter 9 Spark SQL/Spark SQL组件
  74. Linking with Spark SQL/与SparkSQL进行连接
  75. Using Spark SQL in Applications/在应用中使用Spark SQL
  76. Loading and Saving Data/读取和存储数据
  77. JDBC/ODBC Server/JDBC/ODBC服务器
  78. User-Defined Functions/用户自定义函数
  79. Spark SQL Performance/Spark SQL运行表现调优
  80. Conclusion
  81. Chapter 10 Spark Streaming/Spark流计算
  82. A Simple Example/一个简单的例子
  83. Architecture and Abstraction/架构和抽象
  84. Output Operations/输出操作
  85. Input Sources/输入源
  86. Multiple Sources and Cluster Sizing/多数据源与集群规模
  87. 24/7 Operation/24/7 不间断运行
  88. Worker Fault Tolerance/工作节点容错
  89. Receiver Fault Tolerance/接收器容错
  90. Streaming UI/Streaming 用户界面
  91. Performance Considerations/性能注意事项
  92. Garbage Collection and Memory Usage/垃圾回收与内存使用
  93. Conclusion
  94. Chapter 11 Machine Learning with MLlib/使用MLlib实现机器学习
  95. Overview/本章总览
  96. System Requirements/系统需求
  97. Machine Learning Basics/机器学习简要介绍
  98. Data Types/数据类型
  99. Working with Vectors/使用向量
  100. Algorithms/机器学习算法
  101. Classification and Regression/分类与回归算法
  102. Collaborative Filtering and Recommendation/协同过滤与推荐算法
  103. Tips and Performance Considerations/使用提示及性能调优
  104. Pipeline API/基于Pipeline 的机器学习API
  105. Conclusion
书名:Spark快速大数据分析(注释版)
译者:北京清数教育科技有限公司 译
国内出版社:清华大学出版社
出版时间:2026年07月
页数:337
书号:978-7-302-69832-6
原版书书名:Learning Spark
原版书出版商:O'Reilly Media
Holden Karau
 
Holden Karau是一位加拿大人,在IBM的Spark技术中心担任软件开发工程师。同时作为一位Spark committer,经常在PySpark和机器学习方面进行贡献。另外曾在多次国际会议中发表关于Spark的演讲。
Databricks的软件开发工程师,活跃于开源社区。她还著有《Spark快速数据处理》。
 
 
Andy Konwinski
 
Databricks联合创始人,Apache Spark项目技术专家,还是Apache Mesos项目的联合发起人。
 
 
Patrick Wendell
 
Databricks联合创始人,也是Apache Spark项目技术专家。他还负责维护Spark核心引擎的几个子系统。
 
 
Matei Zaharia
 
Matei Zaharia是斯坦福大学计算机科学系助理教授和Databricks的首席技术官。他于2009年在加州大学伯克利分校立了Spark项目,那时他是一名博士生,并继续担任pache Spark项目的副主席。Matei Zaharia还是Apache Mesos项目的联合创始人,也 是Apache Hadoop项目的贡献者。Matei Zaharia以他出色的研究工作获得了2014年美国计算机学会博士论文奖(ACM Doctoral Dissertation Award)和VMware系统研究奖(VMware Systems Research Award)。
 
 
购买选项
定价:99.00元
书号:978-7-302-69832-6
出版社:清华大学出版社