睡眠

用 Apple Watch 数据估计睡眠阶段的研究模型显示了什么?

首先必须分清一件事:本文没有评估 Apple 原生的睡眠阶段功能。我们进行的是一项小型实验,模型使用公开数据中的心率衍生信息与时间上下文。具体实现不公开。下面说明这些数字能说明什么、不能说明什么。

用 Apple Watch 数据估计睡眠阶段的研究模型显示了什么?

先说结论

在 31 名参与者的公开 Apple Watch 数据中,使用心率衍生信息与时间上下文的研究模型,与五阶段多导睡眠监测(PSG)的偶然校正一致性为 κ=0.221。另一个由 35 名参与者组成的临床心电图(ECG)实验得到 κ=0.244,但两组并非同一批人,因此不能认为两种信号等效。67 条整夜摘要记录使用的是临床 ECG,而不是 Apple Watch。这些结果不能说明 Apple 原生功能有多准确,也不能说明可穿戴 App 的 REM 百分比普遍准确。

本文要点

  • 评估对象是使用心率衍生信息与时间上下文的研究模型,不是 Apple 原生睡眠阶段功能;具体设计不公开
  • 31 名 Apple Watch 参与者中 κ=0.221,另一组 35 名临床 ECG 参与者中 κ=0.244;不同队列不能证明等效
  • 去掉相邻时间信息后,κ 降至 0.092 和 0.119,提示时间上下文对该模型有帮助
  • 67 条整夜摘要来自临床 ECG,没有测试 Apple Watch 的 REM 百分比
  • 三个留出队列的分类性能指标 AUROC 为 0.621–0.649,范围为 0.028;这不能证明模型不存在过拟合
  • 结果属于未经同行评审、没有公开外部预注册的内部二次分析

首先,把它与 Apple 原生功能区分开

Apple 原生睡眠阶段功能以 Apple Watch 的加速度计信号为输入,估计清醒、REM、核心和深度睡眠四种状态。Apple 已发布该功能的技术报告,也有独立研究把 Apple Watch Series 8 与 PSG 进行比较。

我们的内部分析不同。研究模型使用公开 Apple Watch 数据集的心率衍生信息和前后时间信息,估计清醒、N1、N2、N3 和 REM 五个阶段。具体特征设计、预处理和模型结构不公开。输入和阶段定义与 Apple 原生功能不同,因此不能用本结果替代 Apple 自身的验证结果。

参照标准是什么?使用了哪些数据?

我们把多导睡眠监测(PSG)的睡眠阶段作为参照。PSG 会记录脑活动、眼动、肌肉活动等多种信号,再由受过训练的判读者为每个 30 秒时段标注睡眠阶段。

Apple Watch 实验使用 Walch 等人公开的同夜 Watch 与 PSG 数据,共 31 名参与者、25,813 个时段。另一项临床 ECG 实验使用 35 名 HMC 参与者。两项实验都按参与者分组进行五折评估,但参与者与信号不同,是两个独立实验。

结果 1:两个小型实验的点估计接近

两个点估计接近,但这不是同一批参与者同时佩戴 Apple Watch 并记录临床 ECG 的比较。我们没有估计差异的置信区间,也没有进行等效性或非劣效性检验。因此,不能得出 Apple Watch 心率等效于临床 ECG 的结论。

Cohen 的 κ 衡量扣除偶然一致后的一致程度。我们直接报告数值,不给它套上“良好”或“足够”等固定标签。是否适合某种用途,还需要不确定性估计和各阶段性能。

  • 临床 PSG 衍生 HRV:macro AUROC 0.711,一致性 κ 0.244
  • 公开 Apple Watch 数据集:macro AUROC 0.708,一致性 κ 0.221

结果 2:相邻时间信息帮助了该模型

我们比较了研究模型加入和不加入前后时间信息时的结果。加入时间上下文时一致性更高;具体覆盖范围和输入方式不公开。

  • 临床 PSG 衍生 HRV,有上下文 → 无上下文:κ 0.244 → 0.119
  • 公开 Apple Watch 数据集,有时间上下文 → 无时间上下文:κ 0.221 → 0.092

结果 3:67 条整夜摘要来自另一项临床 ECG 分析

之后,我们在 67 条临床 ECG 记录中汇总了整夜预测阶段:HMC 35 条、CAP 15 条、MIT-BIH Polysomnographic Database 17 条。该分析没有任何 Apple Watch 记录。我们把与 PSG 摘要之间的 Pearson 相关系数和事先设定的内部目标进行比较;目标细节不公开。

  • 入睡后清醒时间(WASO):r = 0.42
  • 深度睡眠比例(N3%):r = 0.32
  • 睡眠效率:r = 0.30
  • 入睡潜伏期:r = −0.007
  • REM 睡眠比例:r = 0.003

结果 4:如实报告三个留出队列的范围

对三个临床 ECG 队列,我们还用其中两个训练、在剩下一个上测试。这叫 leave-one-dataset-out(LODO)评估。留出 AUROC 分别为 HMC 0.621、CAP 0.647、SLPDB 0.649;对应 κ 为 0.117、0.172、0.107。

0.028 是最大与最小留出 AUROC 之间的范围,不是从同域结果到外部数据所测得的“性能下降”。三个队列的点估计相近,并不能证明模型没有过拟合,也不能保证在新用户中表现相同。

可以得出什么结论?不能得出什么结论?

在这些小型公开数据集中,心率衍生特征加相邻时间信息,使自建模型能在有限程度上区分睡眠阶段。但在没有 EEG 的情况下,一致性仍然有限;另一项临床 ECG 分析的整夜摘要也未达到内部目标。

本研究没有证明 Apple 原生功能的准确性、Apple Watch 与临床 ECG 的等效性、可穿戴设备 REM 百分比的普遍准确性,也没有证明诊断睡眠疾病的能力。每个问题都需要针对具体产品、信号和人群设计专门研究。

透明度与局限

  • 这是 Feelmo 进行的未经同行评审的内部二次分析,尚未由独立研究者重复
  • 评估标准写在内部材料中;具体目标不公开,而且在查看结果前没有向第三方服务公开预注册
  • Apple Watch 实验有 31 名参与者,临床 ECG 实验有 35 名,整夜摘要分析有 67 条记录;分析未用置信区间完整描述不确定性
  • Apple Watch 与临床 ECG 的结果使用不同参与者、信号和特征,不是两种方式的直接比较
  • LODO AUROC 范围 0.028 不能证明没有过拟合
  • 所有评估均使用公开数据集,没有使用 Feelmo 用户数据
  • 分析并非为诊断睡眠疾病、指导治疗或评估 Apple 原生睡眠阶段功能而设计

参考资料

  1. 使用 Apple Watch 估计睡眠阶段(原生功能技术报告)Apple
  2. 三款商用可穿戴设备在健康成人睡眠跟踪中的准确性Sensors
  3. 利用原始加速度和 PPG 心率数据预测睡眠阶段Sleep
  4. 腕戴设备的活动、心率与 PSG 标注睡眠PhysioNet
  5. Haaglanden Medisch Centrum 睡眠分期数据库PhysioNet
  6. CAP 睡眠数据库PhysioNet
  7. MIT-BIH 多导睡眠监测数据库PhysioNet
用 Apple Watch 数据估计睡眠阶段的研究模型显示了什么? | Feelmo