PostgreSql删除重复数据的方法

1. 常规删除方法

最容易想到的方法就是判断数据是否重复,对于重复的数据只保留ctid最小(或最大)的数据,删除其他的。

explain analyse delete from deltest a where a.ctid <> (select min(t.ctid) from deltest t where a.id=t.id);

可以看到,id相同的数据,保留ctid最小的,其他的删除。相当于把deltest表中的数据删掉一半,耗时达到67s多。相当慢。

2. group by删除方法

group by方法通过分组找到ctid最小的数据,然后删除其他数据。

explain analyse delete from deltest a where a.ctid not in (select min(ctid) from deltest group by id);

可以看到同样是删除一半的数据,使用group by的方式,时间节省了一半。但仍含需要30s,下面试一下第三种删除操作。

3. 高效删除方法

explain analyze delete from deltest a where a.ctid = any(array (select ctid from (select row_number() over (partition by id), ctid from deltest) t where t.row_number > 1));

可以看到,只要98ms

  • 0
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
你可以使用 PostgreSQL 的 pgAgent 插件来实现定时删除数据的脚本。以下是一个示例: 1. 首先,确保你已经安装了 PostgreSQL 数据库和 pgAgent 插件。 2. 创建一个用于删除数据的 SQL 脚本,比如 `delete_data.sql`,并将你想要删除数据的 SQL 语句写入其中。例如,下面的语句会删除名为 `my_table` 的表中创建时间早于当前日期的数据: ```sql DELETE FROM my_table WHERE create_date < current_date; ``` 3. 打开 pgAdmin 或其他 PostgreSQL 管理工具,连接到你的数据库。 4. 在左侧的 "pgAgent" 节点下,右键单击 "Jobs" 并选择 "New Job"。 5. 在 "General" 选项卡中,填写一个名称和描述,选择一个数据库连接,并将 "Enabled" 设置为 true。 6. 在 "Steps" 选项卡中,点击 "New" 创建一个新的步骤。 7. 在步骤中,填写一个名称和描述,选择数据库连接,并将 "Type" 设置为 "SQL". 8. 在 "SQL" 字段中,输入以下 SQL 命令来执行你的删除数据脚本: ```sql \i /path/to/delete_data.sql ``` 确保将 `/path/to/delete_data.sql` 替换为你实际保存删除数据脚本的路径。 9. 保存并关闭步骤对话框。 10. 在 "Schedules" 选项卡中,点击 "New" 创建一个新的计划。 11. 在计划中,填写一个名称和描述,并选择适当的重复方式和执行时间。 12. 保存并关闭计划对话框。 13. 最后,保存并关闭作业对话框。 现在,你已经创建了一个定时删除数据的作业。它将按照你设置的计划定期执行删除数据的脚本。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值