第三章 基础数据和技术指标
一、原始数据及预处理
数据是整个系统的基础,大数据是量化金融的根本。相比传统数据,期权量化大数据:
1、数据规模大、更新快:大数据的数据量非常大,实时更新,不能用传统静态工具和传统数据库分析工具分析。
2、非结构化数据、维度高:传统数据主要在关系性数据库中分析,而大数据需要从更高维度挖掘和处理。
3、数据表征处理方式不同:为以后机器学习和样本模型化表征,需要用高维度数据表征工具进行预处理,python 的 numpy 和 pandas 是基础必备的高效率工具。
通过第三方数据接口及接口解析获取秒级实时行情原始数据。进行数据加工和存储。
为保障实时性,采用MongoDB数据库进行线上处理加工(秒级),采用MySQL进行历史存储备份(每日)。
下图是对实时及历史数据的数据清洗及分析,数据加工,数据诊断预警,数据可视化及数据储存备份。