数据架构知识体系指南
数据架构知识体系指南
James Serra
张兵兵, 张燕妮 等译
出版时间:2026年06月
页数:241
“James Serra擅长将晦涩的技术概念转化为通俗易懂的讲解,令人佩服。”
——Annie Xu
谷歌高级数据客户工程师
“这本书值得摆在案头,你会时常翻阅参考。”
——Sawyer Nyquist
The Data Shop创始人、撰稿人及咨询顾问

数据编织、数据湖仓与数据网格,近期已成为现代数据仓库的主流替代架构。这类新型架构优势显著,但同时也充斥着大量夸大宣传与认知误区。这本实战指南将逐一解读上述架构,帮助数据领域从业者厘清它们的优势与短板。
本书作者James Serra是微软大数据与数据仓库解决方案架构师。书中讲解了主流数据架构相关概念,包括数据仓库为适配数据湖所做出的演进。你将了解数据湖仓能实现哪些业务目标,同时拨开迷雾,认清数据网格的实际价值,摒弃不实噱头。最终,你可以结合自身业务需求,选出最合适的数据架构。
通过阅读本书,你将:
● 掌握多种主流数据架构的实际应用逻辑。
● 明晰各类架构的优势与短板。
● 能够区分数据架构的理论模型与落地现状。
● 能够结合业务场景选出最优架构方案。
● 掌握数据仓库与数据湖的核心差异。
● 理解通用数据架构理念,助力打造更完善的解决方案。
● 梳理数据架构的发展历程与核心特征。
● 掌握架构设计研讨、团队分工的实操要点,以及保障项目成功的关键要素。
  1. 前言
  2. 第一部分 基础
  3. 第1章 大数据
  4. 1.1 大数据的定义及用途
  5. 1.2 数据成熟度
  6. 1.2.1 第一阶段:被动反应
  7. 1.2.2 第二阶段:信息化
  8. 1.2.3 第三阶段:预测
  9. 1.2.4 第四阶段:变革
  10. 1.3 自助式商业智能
  11. 1.4 总结
  12. 第2章 数据架构类型
  13. 2.1 数据架构的演进
  14. 2.2 关系数据仓库
  15. 2.3 数据湖
  16. 2.4 现代数据仓库
  17. 2.5 数据编织
  18. 2.6 数据湖仓
  19. 2.7 数据网格
  20. 2.8 总结
  21. 第3章 架构设计会议
  22. 3.1 什么是架构设计会议
  23. 3.2 架构设计会议的必要性
  24. 3.3 架构设计会议的准备工作
  25. 3.3.1 准备
  26. 3.3.2 邀请与会者
  27. 3.4 进行架构设计会议
  28. 3.4.1 介绍
  29. 3.4.2 探索
  30. 3.4.3 白板讨论
  31. 3.5 架构设计会议之后
  32. 3.6 进行架构设计会议的技巧
  33. 3.7 总结
  34. 第二部分 通用数据架构概念
  35. 第4章 关系数据仓库
  36. 4.1 什么是关系数据仓库
  37. 4.2 非数据仓库案例
  38. 4.3 自顶向下的方法
  39. 4.4 关系数据仓库的优点
  40. 4.5 关系数据仓库的缺点
  41. 4.6 构建数据仓库
  42. 4.6.1 提取数据的频率
  43. 4.6.2 提取方法
  44. 4.6.3 如何确定自上次提取之后的数据变化情况
  45. 4.7 关系数据仓库之死被过分夸大了
  46. 4.8 总结
  47. 第5章 数据湖
  48. 5.1 什么是数据湖
  49. 5.2 选择数据湖的理由
  50. 5.3 自底向上的方法
  51. 5.4 数据湖设计的最佳实现方案
  52. 5.5 多数据湖
  53. 5.5.1 优点
  54. 5.5.2 缺点
  55. 5.6 总结
  56. 第6章 数据存储解决方案和数据处理
  57. 6.1 数据存储解决方案
  58. 6.1.1 数据集市
  59. 6.1.2 运营数据存储
  60. 6.1.3 数据中心
  61. 6.2 数据处理
  62. 6.2.1 主数据管理
  63. 6.2.2 数据虚拟化和数据联邦
  64. 6.2.3 数据目录
  65. 6.2.4 数据市场
  66. 6.3 总结
  67. 第7章 设计方法
  68. 7.1 联机事务处理与联机分析处理
  69. 7.2 运营数据和分析数据
  70. 7.3 对称多处理和大规模并行处理
  71. 7.4 Lambda架构
  72. 7.5 Kappa架构
  73. 7.6 混合持久化和多种数据存储
  74. 7.7 总结
  75. 第8章 数据建模方法
  76. 8.1 关系建模
  77. 8.1.1 键
  78. 8.1.2 实体关系图
  79. 8.1.3 规范化规则和形式
  80. 8.1.4 跟踪变更
  81. 8.2 维度建模
  82. 8.2.1 事实、维度和键
  83. 8.2.2 跟踪变更
  84. 8.2.3 反规范化
  85. 8.3 通用数据模型
  86. 8.4 数据保险库
  87. 8.5 Kimball和Inmon数据仓库方法论
  88. 8.5.1 Inmon的自顶向下方法
  89. 8.5.2 Kimball的自底向上方法
  90. 8.5.3 方法选择
  91. 8.5.4 混合模型
  92. 8.6 方法学神话
  93. 8.7 总结
  94. 第9章 数据导入方法
  95. 9.1 ETL与ELT
  96. 9.2 反向ETL
  97. 9.3 批量处理与实时处理
  98. 9.3.1 批量处理的优缺点
  99. 9.3.2 实时处理的优缺点
  100. 9.4 数据治理
  101. 9.5 总结
  102. 第三部分 数据架构
  103. 第10章 现代数据仓库
  104. 10.1 现代数据仓库架构
  105. 10.2 MDW架构的利弊
  106. 10.3 结合RDW和数据湖
  107. 10.3.1 数据湖
  108. 10.3.2 关系数据仓库
  109. 10.4 MDW的阶梯型架构
  110. 10.4.1 增强型EDW
  111. 10.4.2 临时数据湖加EDW
  112. 10.4.3 一体化
  113. 10.5 案例研究:Wilson & Gunkerk公司的MDW战略转变
  114. 10.5.1 挑战
  115. 10.5.2 解决方案
  116. 10.5.3 成果
  117. 10.6 总结
  118. 第11章 数据编织
  119. 11.1 数据编织架构
  120. 11.1.1 数据访问策略
  121. 11.1.2 元数据目录
  122. 11.1.3 主数据管理
  123. 11.1.4 数据虚拟化
  124. 11.1.5 实时处理
  125. 11.1.6 应用程序接口
  126. 11.1.7 服务
  127. 11.1.8 产品
  128. 11.2 迁移到数据编织的理由
  129. 11.3 潜在缺陷
  130. 11.4 总结
  131. 第12章 数据湖仓
  132. 12.1 Delta Lake的特性
  133. 12.2 性能提升
  134. 12.3 数据湖仓架构
  135. 12.4 无关系数据湖仓
  136. 12.5 关系服务层
  137. 12.6 总结
  138. 第13章 数据网格基础
  139. 13.1 去中心化框架
  140. 13.2 数据网格技术成熟曲线
  141. 13.3 Dehghani的数据网格四原则
  142. 13.3.1 原则1:域所有权
  143. 13.3.2 原则2:数据即产品
  144. 13.3.3 原则3:自助数据基础设施即平台
  145. 13.3.4 原则4:联邦计算管理
  146. 13.4 “纯”数据网格
  147. 13.5 数据域
  148. 13.6 数据网格逻辑架构
  149. 13.7 不同拓扑
  150. 13.8 数据网格与数据编织
  151. 13.9 用例
  152. 13.10 总结
  153. 第14章 是否该采用数据网格?神话、疑虑及未来
  154. 14.1 神话
  155. 14.1.1 神话:使用数据网格是快速解决所有数据难题的灵丹妙药
  156. 14.1.2 神话:数据网格将取代数据湖和数据仓库
  157. 14.1.3 神话:如果数据仓库都失败,数据网格将解决该问题
  158. 14.1.4 神话:构建数据网格代表一切进行了中心化
  159. 14.1.5 神话:可使用数据虚拟化创建数据网格
  160. 14.2 疑虑
  161. 14.2.1 哲学和概念问题
  162. 14.2.2 在去中心化环境中组合数据
  163. 14.2.3 去中心化的其他问题
  164. 14.2.4 复杂性
  165. 14.2.5 重复
  166. 14.2.6 可行性
  167. 14.2.7 人员
  168. 14.2.8 域层面的障碍
  169. 14.3 组织评估:应该使用数据网格吗
  170. 14.4 成功实施数据网格的建议
  171. 14.5 数据网格的未来
  172. 14.6 各个数据架构的适用性
  173. 14.7 总结
  174. 第四部分 人员、流程和技术
  175. 第15章 人员和流程
  176. 15.1 团队组织:分工和职责
  177. 15.1.1 MDW、数据编织或数据湖仓的分工
  178. 15.1.2 数据网格的分工
  179. 15.2 项目失败的原因:隐患和预防
  180. 15.2.1 隐患:让高管认为BI很容易
  181. 15.2.2 隐患:使用错误的技术
  182. 15.2.3 隐患:收集过多的业务需求
  183. 15.2.4 隐患:收集的业务需求太少
  184. 15.2.5 隐患:在验证内容之前就展示报告
  185. 15.2.6 隐患:雇用经验不足的咨询公司
  186. 15.2.7 隐患:雇用将开发外包给离岸工作者的咨询公司
  187. 15.2.8 隐患:将项目所有权移交给顾问
  188. 15.2.9 隐患:忽视将知识传递回组织的需求
  189. 15.2.10 隐患:项目中途削减预算
  190. 15.2.11 隐患:先确定截止日期,项目倒推进行
  191. 15.2.12 隐患:构建数据仓库来反映源数据而不是业务需求
  192. 15.2.13 隐患:向终端用户展示的解决方案存在响应慢或其他性能问题
  193. 15.2.14 隐患:过度设计(或设计不足)的数据架构
  194. 15.2.15 隐患:IT和业务领域之间的沟通不畅
  195. 15.3 成功的技巧
  196. 15.3.1 不要吝啬投资
  197. 15.3.2 让用户参与,向用户展示结果,调动用户的积极性
  198. 15.3.3 为新报告和仪表盘增加价值
  199. 15.3.4 要求终端用户构建原型
  200. 15.3.5 寻找项目支持者/赞助商
  201. 15.3.6 制订一个旨在实现80%效率的项目计划
  202. 15.4 总结
  203. 第16章 技术
  204. 16.1 选择平台
  205. 16.1.1 开源解决方案
  206. 16.1.2 内部部署解决方案
  207. 16.1.3 云提供商解决方案
  208. 16.2 云服务模型
  209. 16.2.1 主要云服务提供商
  210. 16.2.2 多云解决方案
  211. 16.3 软件框架
  212. 16.3.1 Hadoop
  213. 16.3.2 Databricks
  214. 16.3.3 Snowflake
  215. 16.4 总结
书名:数据架构知识体系指南
作者:James Serra
译者:张兵兵, 张燕妮 等译
国内出版社:机械工业出版社
出版时间:2026年06月
页数:241
书号:978-7-111-80666-0
原版书书名:Deciphering Data Architectures
原版书出版商:O'Reilly Media
James Serra
 
James Serra在微软担任大数据与数据仓库解决方案架构师。他在大数据、高级分析技术的落地应用领域颇具影响力,深耕现代数据仓库、数据湖仓、数据编织、数据网格等各类数据架构。
 
 
本书封面上的动物是蓝色盘丽鱼(Symphysodon aequifasciata),这是一种生活在亚马逊河支流的淡水鱼。它波纹状的标记和颜色使蓝色盘丽鱼成为水族馆中的热门选择,但其自然栖息地难以复制和维护。
蓝色盘丽鱼以蠕虫和小型甲壳动物为食,体长可达9英寸(约23厘米)。幼鱼依靠父母分泌的物质为生。O'Reilly封面上的许多动物都处于濒危状态,它们对世界都至关重要。
购买选项
定价:89.00元
书号:978-7-111-80666-0
出版社:机械工业出版社