异构数据对比

本文详述了一次编程比赛的经历,涉及异构数据对比的解决方案。利用Python实现数据库连接、图形化界面、数据处理模块(Comparator、DataGenerator、IOWriter)。遇到的问题包括线程内存管理、DataFrame效率及内存占用。其他队伍采用分而治之、数据有序化等策略提高效率。总结了多线程、内存管理、数据处理和交互设计的经验教训。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

  • 前阵子参加了一个比赛,编程方面是异构数据对比,特意记录回顾下当时比赛时整体的设计思路~
  • 赛题内容:两张表A与B,分别来源于两个数据库,表的大致内容应该是一样的,但是可能存在部分行内容(相同主键),部分的列字段内容不一样,需要挑出这些不同列,以及单属于A表的行,以及单属于B表的行
  • 比赛主要基于Python实现,程序设计时分为以下几个模块:
  1. GUI:主要是基于Thinker实现一个图形化操作。这个包其实挺容易上手的,里面内置了各种页面的不同物件,通过简单的物件 + 摆放 + 定义事件 即可实现有关程序的逻辑输入选择功能。主要做了以下几个页面:数据库选择页面,数据库配置页面,数据表的比较列选择页面,从而实现连接数据库,选择数据表进行比较等一系列操作。
  2. Database:主要是定义了一个Database父类,并且实现了 Mysql 以及 PostgreSQL的实现。内部主要有定义方法如从元数据库读取列信息,主键字段等。
  • 接下来是程序的核心部分:主要是Comparator,DataGenerator 以及 IOWriter。由于比赛要求的数据量是千万级别,以及结果的数据量未可知,所以当时DataGenerator和IOWriter主要是另起进程进行数据的加载以及写入操作。
  1. DataGenerator: 数据表的读取可以支持批量读取的操作。且每批量加载,由于数据会加载进python的进程,并且转换成tuple形式,所以会耗费一定量的时间。因为设计程序时希望相关的数据处理可以达成一个类似于pipeline数据流动加载的形式。这个进
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值