多从库时半同步复制不工作的BUG分析

**作者：胡呈清、黄炎**

问题描述

MySQL版本：5.7.16，5.7.17，5.7.21

存在多个半同步从库时，如果参数 rpl_semi_sync_master_wait_for_slave_count=1，启动第1个半同步从库时可以正常启动，启动第2个半同步从库后有很大概率 slave_io_thread 停滞（复制状态正常，Slave_IO_Running: Yes，Slave_SQL_Running: Yes，但是完全不同步主库 binlog ）

复现步骤

1.主库配置参数如下：
rpl_semi_sync_master_wait_for_slave_count = 1
rpl_semi_sync_master_wait_no_slave = OFF
rpl_semi_sync_master_enabled = ON
rpl_semi_sync_master_wait_point = AFTER_SYNC
2.启动从库A的半同步复制 start slave，查看从库A复制正常
3.启动从库B的半同步复制 start slave，查看从库B，复制线程正常，但是不同步主库 binlog

分析过程

首先弄清楚这个问题，需要先结合MySQL其他的一些状态信息，尤其是主库的 dump 线程状态来进行分析：

从库A启动复制后，主库的半同步状态已启动：

图片描述

再看主库的 dump 线程，也已经启动：
图片描述

再看主库的 error log，也显示 dump 线程（21824）启动成功，其启动的半同步复制：
图片描述

2.从库B启动复制后，主库的半同步状态，还是只有1个半同步从库 Rpl_semi_sync_master_clients=1：
图片描述

再看主库的 dump 线程，这时有3个 dump 线程，但是新起的那两个一直为 starting 状态：
图片描述

再看主库的 error log，21847 这个新的 dump 线程一直没起来，直到1分钟之后从库 retry ( Connect_Retry 和 Master_Retry_Count 相关)，主库上又启动了1个 dump 线程 21850，还是起不来，并且 21847 这个僵尸线程还停不掉：

图片描述

3.到这里我们可以知道，从库B slave_io_thread 停滞的根本原因是因为主库上对应的 dump 线程启动不了。如何进一步分析线程调用情况？推荐使用 gstack 或者 pstack（实为gstack软链）来查看线程调用栈，其用法很简单：gstack <process-id>

4.看主库的 gstack，可以看到 24102 线程（旧的复制 dump 线程）堆栈：
图片描述

可以看到 24966 线程（新的复制 dump 线程）堆栈：
图片描述

两线程都在等待 Ack_Receiver 的锁，而线程 21875 在持有锁，等待select：

图片描述

理论上 select 不应hang， Ack_receiver 中的逻辑也不会死循环，请教公司大神黄炎进行一波源码分析。

5.semisync_master_ack_receiver.cc 的以下代码形成了对互斥锁的抢占, 饿死了其他竞争者：
图片描述

在 mysql_mutex_unlock 调用后，应适当增加其他线程的调度机会。
试验: 在 mysql_mutex_unlock 调用后增加 sched_yield();，可验证问题现象消失。

结论

1.从库 slave_io_thread 停滞的根本原因是主库对应的 dump thread 启动不了；
2.rpl_semi_sync_master_wait_for_slave_count=1 时，启动第一个半同步后，主库 ack_receiver 线程会不断的循环判断收到的 ack 数量是否 >= rpl_semi_sync_master_wait_for_slave_count，此时判断为 true，ack_receiver基本不会空闲一直持有锁。此时启动第2个半同步，对应主库要启动第2个 dump thread，启动 dump thread 要等待 ack_receiver 锁释放，一直等不到，所以第2个 dump thread 启动不了。

相信各位DBA同学看了后会很震惊，“什么？居然还有这样的bug...”，这里要说明一点，这个bug 触发是有几率的，但是几率又很大。这个问题已经由我司大神在1月份提交了 bug 和 patch：https://bugs.mysql.com/bug.ph...，加上本人提交SR后时不时的催一催，昨天官方终于确认将修复在 5.7.23（官方最终另有修复方法，没采纳这个 patch，期待我司大神下期分析官方的修复代码）。

多从库时半同步复制不工作的BUG分析

爱可生开源社区

引用和评论

SQLShift 重大更新：Oracle→PostgreSQL 存储过程转换功能上线！

MySQL慢查询日志：性能优化的终极指南

MySQL 备份 Shell 脚本：支持远程同步与阿里云 OSS 备份

《SQL应用场景解析：如何通过SQL解决实际业务问题》

Devin 发布 DeepWiki，2 星的项目直接装出万星的气场

php+mysql 搭建一个在线游戏网站目前已有2000+游戏【代码解析一】

一键实现 Oracle 数据整库同步至 Apache Doris

多从库时半同步复制不工作的BUG分析

爱可生开源社区

引用和评论

SQLShift 重大更新：Oracle→PostgreSQL 存储过程转换功能上线！​​

MySQL慢查询日志：性能优化的终极指南

MySQL 备份 Shell 脚本：支持远程同步与阿里云 OSS 备份

《SQL应用场景解析：如何通过SQL解决实际业务问题》

Devin 发布 DeepWiki，2 星的项目直接装出万星的气场

php+mysql 搭建一个在线游戏网站目前已有2000+游戏【代码解析 一】

一键实现 Oracle 数据整库同步至 Apache Doris

SQLShift 重大更新：Oracle→PostgreSQL 存储过程转换功能上线！

php+mysql 搭建一个在线游戏网站目前已有2000+游戏【代码解析一】