先说结论
在 31 名参与者的公开 Apple Watch 数据中,使用心率衍生信息与时间上下文的研究模型,与五阶段多导睡眠监测(PSG)的偶然校正一致性为 κ=0.221。另一个由 35 名参与者组成的临床心电图(ECG)实验得到 κ=0.244,但两组并非同一批人,因此不能认为两种信号等效。67 条整夜摘要记录使用的是临床 ECG,而不是 Apple Watch。这些结果不能说明 Apple 原生功能有多准确,也不能说明可穿戴 App 的 REM 百分比普遍准确。
本文要点
- 评估对象是使用心率衍生信息与时间上下文的研究模型,不是 Apple 原生睡眠阶段功能;具体设计不公开
- 31 名 Apple Watch 参与者中 κ=0.221,另一组 35 名临床 ECG 参与者中 κ=0.244;不同队列不能证明等效
- 去掉相邻时间信息后,κ 降至 0.092 和 0.119,提示时间上下文对该模型有帮助
- 67 条整夜摘要来自临床 ECG,没有测试 Apple Watch 的 REM 百分比
- 三个留出队列的分类性能指标 AUROC 为 0.621–0.649,范围为 0.028;这不能证明模型不存在过拟合
- 结果属于未经同行评审、没有公开外部预注册的内部二次分析
首先,把它与 Apple 原生功能区分开
Apple 原生睡眠阶段功能以 Apple Watch 的加速度计信号为输入,估计清醒、REM、核心和深度睡眠四种状态。Apple 已发布该功能的技术报告,也有独立研究把 Apple Watch Series 8 与 PSG 进行比较。
我们的内部分析不同。研究模型使用公开 Apple Watch 数据集的心率衍生信息和前后时间信息,估计清醒、N1、N2、N3 和 REM 五个阶段。具体特征设计、预处理和模型结构不公开。输入和阶段定义与 Apple 原生功能不同,因此不能用本结果替代 Apple 自身的验证结果。
参照标准是什么?使用了哪些数据?
我们把多导睡眠监测(PSG)的睡眠阶段作为参照。PSG 会记录脑活动、眼动、肌肉活动等多种信号,再由受过训练的判读者为每个 30 秒时段标注睡眠阶段。
Apple Watch 实验使用 Walch 等人公开的同夜 Watch 与 PSG 数据,共 31 名参与者、25,813 个时段。另一项临床 ECG 实验使用 35 名 HMC 参与者。两项实验都按参与者分组进行五折评估,但参与者与信号不同,是两个独立实验。
结果 1:两个小型实验的点估计接近
两个点估计接近,但这不是同一批参与者同时佩戴 Apple Watch 并记录临床 ECG 的比较。我们没有估计差异的置信区间,也没有进行等效性或非劣效性检验。因此,不能得出 Apple Watch 心率等效于临床 ECG 的结论。
Cohen 的 κ 衡量扣除偶然一致后的一致程度。我们直接报告数值,不给它套上“良好”或“足够”等固定标签。是否适合某种用途,还需要不确定性估计和各阶段性能。
- 临床 PSG 衍生 HRV:macro AUROC 0.711,一致性 κ 0.244
- 公开 Apple Watch 数据集:macro AUROC 0.708,一致性 κ 0.221
结果 2:相邻时间信息帮助了该模型
我们比较了研究模型加入和不加入前后时间信息时的结果。加入时间上下文时一致性更高;具体覆盖范围和输入方式不公开。
- 临床 PSG 衍生 HRV,有上下文 → 无上下文:κ 0.244 → 0.119
- 公开 Apple Watch 数据集,有时间上下文 → 无时间上下文:κ 0.221 → 0.092
结果 3:67 条整夜摘要来自另一项临床 ECG 分析
之后,我们在 67 条临床 ECG 记录中汇总了整夜预测阶段:HMC 35 条、CAP 15 条、MIT-BIH Polysomnographic Database 17 条。该分析没有任何 Apple Watch 记录。我们把与 PSG 摘要之间的 Pearson 相关系数和事先设定的内部目标进行比较;目标细节不公开。
- 入睡后清醒时间(WASO):r = 0.42
- 深度睡眠比例(N3%):r = 0.32
- 睡眠效率:r = 0.30
- 入睡潜伏期:r = −0.007
- REM 睡眠比例:r = 0.003
结果 4:如实报告三个留出队列的范围
对三个临床 ECG 队列,我们还用其中两个训练、在剩下一个上测试。这叫 leave-one-dataset-out(LODO)评估。留出 AUROC 分别为 HMC 0.621、CAP 0.647、SLPDB 0.649;对应 κ 为 0.117、0.172、0.107。
0.028 是最大与最小留出 AUROC 之间的范围,不是从同域结果到外部数据所测得的“性能下降”。三个队列的点估计相近,并不能证明模型没有过拟合,也不能保证在新用户中表现相同。
可以得出什么结论?不能得出什么结论?
在这些小型公开数据集中,心率衍生特征加相邻时间信息,使自建模型能在有限程度上区分睡眠阶段。但在没有 EEG 的情况下,一致性仍然有限;另一项临床 ECG 分析的整夜摘要也未达到内部目标。
本研究没有证明 Apple 原生功能的准确性、Apple Watch 与临床 ECG 的等效性、可穿戴设备 REM 百分比的普遍准确性,也没有证明诊断睡眠疾病的能力。每个问题都需要针对具体产品、信号和人群设计专门研究。
透明度与局限
- 这是 Feelmo 进行的未经同行评审的内部二次分析,尚未由独立研究者重复
- 评估标准写在内部材料中;具体目标不公开,而且在查看结果前没有向第三方服务公开预注册
- Apple Watch 实验有 31 名参与者,临床 ECG 实验有 35 名,整夜摘要分析有 67 条记录;分析未用置信区间完整描述不确定性
- Apple Watch 与临床 ECG 的结果使用不同参与者、信号和特征,不是两种方式的直接比较
- LODO AUROC 范围 0.028 不能证明没有过拟合
- 所有评估均使用公开数据集,没有使用 Feelmo 用户数据
- 分析并非为诊断睡眠疾病、指导治疗或评估 Apple 原生睡眠阶段功能而设计
参考资料
- 使用 Apple Watch 估计睡眠阶段(原生功能技术报告) — Apple
- 三款商用可穿戴设备在健康成人睡眠跟踪中的准确性 — Sensors
- 利用原始加速度和 PPG 心率数据预测睡眠阶段 — Sleep
- 腕戴设备的活动、心率与 PSG 标注睡眠 — PhysioNet
- Haaglanden Medisch Centrum 睡眠分期数据库 — PhysioNet
- CAP 睡眠数据库 — PhysioNet
- MIT-BIH 多导睡眠监测数据库 — PhysioNet
