数据库根据指定字段去重

需求：对一张用户表根据name/email/card_num字段去除重复数据；

思路：用group by方法可以查询出'去重'后的数据，将这些数据存储到一张临时表中，然后将临时表的数据存储到指定的表中；

误区及解决方案：group by方法只能获取部分字段（去重指定字段），不能一次获取到完整的数据，但是可以通过max函数获取group by结果集中的id，再根据id集合查询出全部的记录。

测试思路

查询去重后的数据

SELECT max(id) as id,name,email,card_num FROM users GROUP BY name,email,card_num;

从去重后的数据中获取id集合

SELECT ID from (SELECT max(id) as id,name,email,card_num FROM users GROUP BY name,email,card_num) as T;

根据去重后的数据中获取id集合，从源数据中获得记录列表

SELECT * from users where id in (SELECT ID from (SELECT max(id) as id,name,email,card_num FROM users GROUP BY name,email,card_num) as T);

实际方法

根据去重后的数据中获取id集合，从源数据中获得记录列表，将这些列表数据存入一个临时表中

create TEMP TABLE tmp_data as SELECT * from users where id in (SELECT ID from (SELECT max(id) as id,name,email,card_num FROM users GROUP BY name,email,card_num) as T);

将临时表中的数据存入指定的数据表中，完毕

insert into users_copy1 select * from tmp_data;

检测

检测结果是不是和第一步查询去重后的数据总数相同

select count(*) from users_copy1;

测试结果：1.4w条数据中有2300条数据重复，实际运行结果为0.07s，基本满足现在的需求。

数据库根据指定字段去重

测试思路

实际方法

检测

Twilight

引用和评论

腾讯云服务器Centos7.7搭建Lnmp

MySQL慢查询日志：性能优化的终极指南

MySQL 备份 Shell 脚本：支持远程同步与阿里云 OSS 备份

《SQL应用场景解析：如何通过SQL解决实际业务问题》

放弃 Rust 选择 Zig，Xata 团队推出 pgzx —— 计划使用 Zig 开发基于 PG 的分布式数据库

Devin 发布 DeepWiki，2 星的项目直接装出万星的气场

php+mysql 搭建一个在线游戏网站目前已有2000+游戏【代码解析一】

数据库根据指定字段去重

测试思路

实际方法

检测

Twilight

引用和评论

腾讯云服务器Centos7.7搭建Lnmp

MySQL慢查询日志：性能优化的终极指南

MySQL 备份 Shell 脚本：支持远程同步与阿里云 OSS 备份

《SQL应用场景解析：如何通过SQL解决实际业务问题》

放弃 Rust 选择 Zig，Xata 团队推出 pgzx —— 计划使用 Zig 开发基于 PG 的分布式数据库

Devin 发布 DeepWiki，2 星的项目直接装出万星的气场

php+mysql 搭建一个在线游戏网站目前已有2000+游戏【代码解析 一】

php+mysql 搭建一个在线游戏网站目前已有2000+游戏【代码解析一】