金融数据工程:设计和构建数据驱动的金融产品
金融数据工程:设计和构建数据驱动的金融产品
Tamer Khraisha
谭励 译
出版时间:2026年06月
页数:401
“本书针对金融领域的复杂场景,对数据工程展开了深度剖析。”
——Vipul Bharat Marlecha
Netflix高级数据工程师

如今,金融科技投资与数字化转型正在重塑金融行业格局,并催生出大量机遇。但金融机构的技术人员与从业者往往难以系统、全面地掌握搭建现代化、高可靠、可扩展金融数据基础设施所需的理论知识、
业务难点、技术方法与工具。金融数据工程正是为解决这一痛点而生的。
负责金融产品数据基础设施搭建的数据工程师不仅要具备扎实的数据工程技术能力,还要深入理解金融行业特有的业务难题、实施方法、数据生态、数据服务商、数据格式、技术限制、标识体系、业务实
体、行业标准、监管要求以及数据治理规范。
本书立足行业场景、侧重实践落地,以业务需求为导向,全面讲解金融数据工程知识,书中配有真实业务案例、行业实操经验以及实战项目。
通过学习本书,你将了解:
● 金融行业的数据工程全貌。
● 金融数据工程面临的各类典型问题。
● 金融数据领域的结构、参与方与行业特性。
● 金融数据标识体系与实体系统的设计方案。
● 金融数据治理框架、核心概念及最佳实践。
● 从数据接入到正式投产的金融数据工程全流程。
● 金融数据工作流的类型与主要特征。
● 基于开源工具与API搭建金融数据管道的方法
  1. 前言
  2. 第一部分 金融数据工程基础
  3. 第1章 金融数据工程释义
  4. 1.1 金融数据工程的定义
  5. 1.1.1 什么是金融
  6. 1.1.2 数据工程的定义
  7. 1.1.3 金融数据工程的定义
  8. 1.2 为什么是金融数据工程
  9. 1.2.1 金融数据的三大特征:规模、速率和多样性
  10. 1.2.2 金融领域的数据特征和难点
  11. 1.2.3 金融机器学习
  12. 1.2.4 颠覆性的金融科技格局
  13. 1.2.5 监管要求和合规性
  14. 1.3 金融数据工程师的角色
  15. 1.3.1 角色描述
  16. 1.3.2 金融数据工程师的工作环境
  17. 1.3.3 金融数据工程师的职责范围和工作内容
  18. 1.3.4 金融数据工程师的技能
  19. 1.4 总结
  20. 第2章 金融数据生态系统
  21. 2.1 金融数据的来源
  22. 2.1.1 公共金融数据
  23. 2.1.2 证券交易所
  24. 2.1.3 金融数据商、服务提供商及分销机构
  25. 2.1.4 调查数据
  26. 2.1.5 另类数据
  27. 2.1.6 机密和专有数据
  28. 2.2 金融数据的结构
  29. 2.2.1 时间序列数据
  30. 2.2.2 横截面数据
  31. 2.2.3 面板数据
  32. 2.2.4 矩阵数据
  33. 2.2.5 图数据
  34. 2.2.6 文本数据
  35. 2.3 金融数据类型
  36. 2.3.1 基本面数据
  37. 2.3.2 市场数据
  38. 2.3.3 交易数据
  39. 2.3.4 分析数据
  40. 2.3.5 另类数据
  41. 2.3.6 参考数据
  42. 2.3.7 实体数据
  43. 2.4 基准金融数据集
  44. 2.4.1 证券价格研究中心
  45. 2.4.2 Compustat财务数据
  46. 2.4.3 交易和报价数据库
  47. 2.4.4 机构经纪人估值系统
  48. 2.4.5 期权交易公司艾维数据库
  49. 2.4.6 交易报告和合规引擎
  50. 2.4.7 奥比斯全球数据库
  51. 2.4.8 SDC铂金数据库
  52. 2.4.9 标准普尔道琼斯指数
  53. 2.4.10 另类数据集
  54. 2.5 总结
  55. 第3章 金融标识系统
  56. 3.1 金融标识符
  57. 3.1.1 金融标识符与标识系统的定义
  58. 3.1.2 金融标识符的必要性
  59. 3.1.3 谁创建金融标识系统
  60. 3.2 金融标识符的理想属性
  61. 3.2.1 唯一性
  62. 3.2.2 全局性
  63. 3.2.3 可扩展性
  64. 3.2.4 完整性
  65. 3.2.5 可访问性
  66. 3.2.6 时效性
  67. 3.2.7 可靠性
  68. 3.2.8 粒度
  69. 3.2.9 永久性
  70. 3.2.10 不可变性
  71. 3.2.11 安全性
  72. 3.3 金融标识系统概况
  73. 3.3.1 国际证券标识码
  74. 3.3.2 金融工具分类代码
  75. 3.3.3 金融工具简称
  76. 3.3.4 统一证券标识程序委员会
  77. 3.3.5 法人实体识别编码
  78. 3.3.6 交易标识符
  79. 3.3.7 证券交易所每日官方清单
  80. 3.3.8 股票代码
  81. 3.3.9 衍生品标识符
  82. 3.3.10 金融工具全球标识符
  83. 3.3.11 FactSet永久标识符
  84. 3.3.12 LSEG永久标识符
  85. 3.3.13 数字资产标识符
  86. 3.3.14 行业和部门标识符
  87. 3.3.15 银行标识符
  88. 3.4 总结
  89. 第4章 金融实体系统
  90. 4.1 金融实体的定义
  91. 4.2 金融命名实体识别
  92. 4.2.1 命名实体识别描述
  93. 4.2.2 命名实体识别是如何工作的
  94. 4.2.3 命名实体识别方法
  95. 4.2.4 命名实体识别软件库
  96. 4.3 金融实体解析
  97. 4.3.1 实体解析描述
  98. 4.3.2 金融领域中实体消歧的重要性
  99. 4.3.3 实体解析如何工作
  100. 4.3.4 实体解析的方法
  101. 4.3.5 实体解析软件库
  102. 4.4 总结
  103. 第5章 金融数据治理
  104. 5.1 金融数据治理概述
  105. 5.1.1 金融数据治理的定义
  106. 5.1.2 金融数据治理的合理性
  107. 5.2 数据质量
  108. 5.2.1 维度1:数据错误
  109. 5.2.2 维度2:数据离群值
  110. 5.2.3 维度3:数据偏差
  111. 5.2.4 维度4:数据粒度
  112. 5.2.5 维度5:数据重复
  113. 5.2.6 维度6:数据可用性与完整性
  114. 5.2.7 维度7:数据时效性
  115. 5.2.8 维度8:数据约束
  116. 5.2.9 维度9:数据相关性
  117. 5.3 数据完整性
  118. 5.3.1 原则1:数据标准
  119. 5.3.2 原则2:数据备份
  120. 5.3.3 原则3:数据归档
  121. 5.3.4 原则4:数据聚合
  122. 5.3.5 原则5:数据血缘
  123. 5.3.6 原则6:数据目录
  124. 5.3.7 原则7:数据所有权
  125. 5.3.8 原则8:数据合同
  126. 5.3.9 原则9:数据核对
  127. 5.4 数据安全与隐私
  128. 5.4.1 数据隐私
  129. 5.4.2 数据匿名化
  130. 5.4.3 数据加密
  131. 5.4.4 访问控制
  132. 5.5 总结
  133. 第二部分 金融数据工程生命周期
  134. 第6章 金融数据工程全生命周期综述
  135. 6.1 金融数据工程生命周期的定义
  136. 6.2 构建金融数据工程技术栈的准则
  137. 6.2.1 标准1:开源软件与商业软件
  138. 6.2.2 标准2:易用性与性能
  139. 6.2.3 标准3:本地部署与云计算
  140. 6.2.4 标准4:公有云、私有云和混合云
  141. 6.2.5 标准5:单一云与多云
  142. 6.2.6 标准6:单体式与模块化代码库
  143. 6.3 总结
  144. 第7章 数据摄入层
  145. 7.1 数据传输和到达流程
  146. 7.1.1 数据传输协议
  147. 7.1.2 数据到达流程
  148. 7.2 数据摄入格式
  149. 7.2.1 通用格式
  150. 7.2.2 大数据格式
  151. 7.2.3 内存格式
  152. 7.2.4 标准化的金融格式
  153. 7.3 数据摄入技术
  154. 7.3.1 金融API
  155. 7.3.2 金融数据流
  156. 7.3.3 安全文件传输
  157. 7.3.4 云访问
  158. 7.3.5 网络访问
  159. 7.3.6 专业金融软件
  160. 7.4 数据摄入最佳实践
  161. 7.4.1 满足业务需求
  162. 7.4.2 为变化而设计
  163. 7.4.3 实施数据治理
  164. 7.4.4 进行基准测试和压力测试
  165. 7.5 总结
  166. 第8章 数据存储层
  167. 8.1 数据存储系统设计原则
  168. 8.1.1 原则1:业务需求
  169. 8.1.2 原则2:数据建模
  170. 8.1.3 原则3:事务保障
  171. 8.1.4 原则4:一致性权衡
  172. 8.1.5 原则5:可扩展性
  173. 8.1.6 原则6:安全性
  174. 8.2 数据存储建模
  175. 8.2.1 SQL与NoSQL
  176. 8.2.2 主存储与次存储
  177. 8.2.3 操作型与分析型
  178. 8.2.4 原生与非原生
  179. 8.2.5 多模型与多语言持久化
  180. 8.3 数据存储模型
  181. 8.3.1 数据湖模型
  182. 8.3.2 关系模型
  183. 8.3.3 文档模型
  184. 8.3.4 时间序列模型
  185. 8.3.5 消息代理模型
  186. 8.3.6 图模型
  187. 8.3.7 仓库模型
  188. 8.3.8 区块链模型
  189. 8.4 总结
  190. 第9章 数据转换与交付层
  191. 9.1 数据查询
  192. 9.1.1 查询模式
  193. 9.1.2 查询优化
  194. 9.2 数据转换
  195. 9.2.1 转换操作
  196. 9.2.2 转换模式
  197. 9.2.3 计算需求
  198. 9.3 数据交付
  199. 9.3.1 数据消费者
  200. 9.3.2 交付机制
  201. 9.4 总结
  202. 第10章 监控层
  203. 10.1 指标、事件、日志和跟踪
  204. 10.1.1 指标
  205. 10.1.2 事件
  206. 10.1.3 日志
  207. 10.1.4 跟踪
  208. 10.2 数据质量监控
  209. 10.3 性能监控
  210. 10.4 成本监控
  211. 10.5 业务和分析监控
  212. 10.6 数据可观测性
  213. 10.7 总结
  214. 第11章 金融数据工作流
  215. 11.1 面向工作流的软件架构
  216. 11.2 什么是数据工作流
  217. 11.3 工作流管理系统
  218. 11.3.1 灵活性
  219. 11.3.2 可配置性
  220. 11.3.3 依赖管理
  221. 11.3.4 协调模式
  222. 11.3.5 可扩展性
  223. 11.3.6 集成性
  224. 11.4 金融数据工作流的类型
  225. 11.4.1 提取—转换—加载工作流
  226. 11.4.2 流处理工作流
  227. 11.4.3 微服务工作流
  228. 11.4.4 机器学习工作流
  229. 11.5 总结
  230. 第12章 实践项目
  231. 12.1 前提条件
  232. 12.2 项目1:基于PostgreSQL开发银行账务管理系统
  233. 12.2.1 概念模型:业务需求
  234. 12.2.2 逻辑模型:实体关系图
  235. 12.2.3 物理模型:数据定义语言和数据操作语言
  236. 12.2.4 项目1:本地测试
  237. 12.2.5 项目1:清理
  238. 12.2.6 项目1:总结
  239. 12.3 项目2:基于Mage和Python设计金融数据ETL流程
  240. 12.3.1 项目2:工作流定义
  241. 12.3.2 项目2:数据库设计
  242. 12.3.3 项目2:本地测试
  243. 12.3.4 项目2:清理
  244. 12.3.5 项目2:总结
  245. 12.4 项目3:基于Netflix Conductor、PostgreSQL和Python设计微服务工作流
  246. 12.4.1 项目3:工作流定义
  247. 12.4.2 项目3:数据库设计
  248. 12.4.3 项目3:本地测试
  249. 12.4.4 项目3:清理
  250. 12.4.5 项目3:总结
  251. 12.5 项目4:基于OpenFIGI、PermID和GLEIF API设计金融参考数据库
  252. 12.5.1 项目4:先决条件
  253. 12.5.2 项目4:本地测试
  254. 12.5.3 项目4:清理
  255. 12.5.4 项目4:总结
  256. 12.6 结论
  257. 12.7 关注这些项目的更新
  258. 12.8 报告问题或提问
  259. 前进的道路:塑造金融市场的趋势
  260. 后记
书名:金融数据工程:设计和构建数据驱动的金融产品
作者:Tamer Khraisha
译者:谭励 译
国内出版社:机械工业出版社
出版时间:2026年06月
页数:401
书号:978-7-111-81024-7
原版书书名:Financial Data Engineering
原版书出版商:O'Reilly Media
Tamer Khraisha
 
Tamer Khraisha博士,高级软件工程师、专业撰稿人,拥有十余年产业界与科研领域从业经验,兼具扎实的金融市场知识和深厚的软件工程与数据工程专业能力。他曾任职于多家金融科技初创企业,主导设计并搭建面向金融研究、人工智能、资产管理及跨境支付系统的数据驱动型解决方案。
 
 
本书封面上的动物是一只珍珠牡蛎。
盐水牡蛎中,珍珠贝属(Pinctada)的所有物种均能产珍珠,部分其他牡蛎及非牡蛎类软体动物也可形成珍珠。珍珠的形成,是牡蛎为防御外来颗粒刺激,通过珍珠层(主要成分为碳酸钙和有机物质,亦是其贝壳的核心成分)逐层包裹异物的结果。
在野外,每约一万只牡蛎中仅有一只能自然形成珍珠,且其中仅有极少数具备理想的形状和色泽。因此,商业珠宝市场上大部分珍珠都通过人工养殖获得--这一方式不仅提高了产量,也促进了行业的可持续发展。
购买选项
定价:139.00元
书号:978-7-111-81024-7
出版社:机械工业出版社