sqoop将hdfs下的数据导入到mysql如何去重？

Question

sqoop将hdfs下的数据导入到mysql如何去重？

发布于
2016-01-07

新手上路，请多包涵

sqoop执行的脚本我是这样写的
sqoop export --connect jdbc:mysql://localhost:3306/movie --username root --password welcome1 --table movieRecommend --fields-terminated-by ',' --export-dir /recommendout

recommendout是我mapreduce程序处理后的输出目录，包括用户id，电影id，经mapreduce计算处理得出的该电影对该用户的推荐度。mysql中的表movieRecommend的字段包括user_id,movie_id,rating，没有设置主键。正常的结果是最终mysql中每个用户对每个商品有唯一的一个推荐度，即（用户id+电影id）字段应该是unique的。但mapreduce和sqoop的job是定时多次执行的，这样每次执行，recommendout目录中的数据都会导入到mysql中，造成重复。。

初次接触hadoop平台和其组件，请问这种问题是怎么解决的？

hadoop sqoop

阅读 6k

1 个回答

得票最新

VitoLiao

2335

发布于
2016-03-02

为什么不在mysql中设置主键呢？sqoop是多map task完成的，很难在sqoop端去重

撰写回答