睡眠

用 Apple Watch 資料估計睡眠階段的研究模型顯示了什麼?

首先必須分清楚:本文沒有評估 Apple 原生的「睡眠階段」功能。我們進行的是小型實驗,模型使用公開資料中的心率衍生資訊與時間脈絡,具體實作不公開。以下說明數字能支持什麼,以及不能支持什麼。

用 Apple Watch 資料估計睡眠階段的研究模型顯示了什麼?

先說結論

在 31 名參與者的公開 Apple Watch 資料中,使用心率衍生資訊與時間脈絡的研究模型,與五階段 PSG 的一致性為 κ=0.221。另一個 35 人的臨床心電圖實驗為 κ=0.244,但兩組不是同一批人,不能據此認定兩種信號等效。67 筆整夜摘要使用的是臨床心電圖,不是 Apple Watch。這些結果無法回答 Apple 原生功能有多準,也不能代表一般穿戴式 App 的 REM 百分比是否準確。

本文要點

  • 評估的是使用心率衍生資訊與時間脈絡的研究模型,不是 Apple 原生「睡眠階段」功能;具體設計不公開
  • 31 名 Apple Watch 參與者的一致性為 κ=0.221;另一個 35 人臨床心電圖隊列為 κ=0.244,分開的隊列不能證明等效
  • 移除前後時間脈絡後,κ 降至 0.092 與 0.119,顯示時間脈絡對這個模型有幫助
  • 67 筆整夜摘要分析使用臨床心電圖,沒有檢驗 Apple Watch 的 REM 百分比
  • 三個留出隊列的 AUROC 為 0.621–0.649,範圍 0.028;這不能證明模型沒有過度擬合
  • 這是未經同儕審查的內部二次分析,且沒有公開的外部預先註冊

先把它和 Apple 原生功能分開

Apple 原生「睡眠階段」功能以 Apple Watch 的加速度計訊號為輸入,估計清醒、REM、核心與深層睡眠四種狀態。Apple 已發布該功能的技術報告,也有獨立研究把 Apple Watch Series 8 與 PSG 比較。

我們的內部分析不同。研究用模型使用公開 Apple Watch 資料集的心率衍生資訊與前後時間資訊,估計清醒、N1、N2、N3 與 REM 五個階段。具體特徵設計、前處理與模型架構不公開。輸入與階段定義不同,因此不能用本分析結果替代 Apple 自己的驗證結果。

參考標準與使用的資料是什麼?

我們以多項生理睡眠檢查(PSG)的睡眠階段為參考。PSG 同時記錄腦波、眼球活動、肌肉活動等多種信號,再由受訓判讀者為連續的短時段標記階段。

Apple Watch 實驗使用 Walch 等人公開資料集中的 31 名參與者、25,813 個區段;該資料在同一夜同步記錄 Watch 與 PSG。另一項臨床心電圖實驗使用 HMC 的 35 名參與者。兩者都採依參與者分組的五折評估,但人員與訊號不同,是兩個獨立實驗。

結果一:兩個小型實驗的點估計接近

兩個點估計接近,但這不是同一批參與者同時佩戴 Apple Watch 並記錄臨床心電圖的直接比較。我們沒有估計差值的信賴區間,也沒有進行等效性或非劣性檢驗,因此不能推論 Apple Watch 心率等同於臨床心電圖。

Cohen’s κ 衡量扣除偶然一致後的符合程度。我們直接報告數值,不套用「良好」或「足夠」等固定標籤。要判斷特定用途是否可行,還需要不確定性與各階段表現。

  • 臨床 PSG 衍生 HRV:macro AUROC 0.711、一致性 κ 0.244
  • 公開 Apple Watch 資料集:macro AUROC 0.708、一致性 κ 0.221

結果二:前後時間資訊對模型有幫助

我們比較研究用模型有無加入前後時間資訊的結果。加入時間脈絡時一致性較高;具體涵蓋範圍與輸入方式不公開。

  • 臨床 PSG 衍生 HRV,有脈絡 → 無脈絡:κ 0.244 → 0.119
  • 公開 Apple Watch 資料集,有時間脈絡 → 無時間脈絡:κ 0.221 → 0.092

結果三:67 筆整夜摘要來自另一項臨床心電圖分析

接著,我們在 67 筆臨床心電圖紀錄中整理整夜預測階段:HMC 35 筆、CAP 15 筆、MIT-BIH Polysomnographic Database 17 筆。這項分析完全沒有 Apple Watch 紀錄。我們把預測摘要與 PSG 摘要的 Pearson 相關和事先設定的內部目標比較;目標細節不公開。

  • 入睡後清醒時間(WASO):r = 0.42
  • 深層睡眠比例(N3%):r = 0.32
  • 睡眠效率:r = 0.30
  • 入睡潛伏期:r = −0.007
  • REM 睡眠比例:r = 0.003

結果四:如實報告三個留出隊列的範圍

對三個臨床心電圖隊列,我們也用其中兩個訓練,再以剩下一個測試;這稱為 leave-one-dataset-out(LODO)。留出 AUROC 在 HMC 為 0.621、CAP 為 0.647、SLPDB 為 0.649;對應 κ 分別為 0.117、0.172、0.107。

0.028 是最大與最小留出 AUROC 之間的範圍,不是從同領域結果到外部資料集所量得的「效能下降」。三個隊列點估計接近,也不能證明模型沒有過度擬合,或在新使用者上表現相同。

可以與不可以下的結論

在這些小型公開資料集中,心率衍生特徵配合鄰近時間資訊,讓自訂模型能有限度區分睡眠階段。然而,沒有 EEG 時的一致性仍有限,另一項臨床心電圖分析的整夜摘要也未達內部目標。

本研究不能證明 Apple 原生功能的準確度、Apple Watch 與臨床心電圖的等效性、一般穿戴裝置 REM 百分比的準確度,也不能診斷睡眠障礙。每個問題都需要針對特定產品、訊號與族群設計研究。

透明度與限制

  • 這是 Feelmo 未經同儕審查的內部二次分析,尚未由獨立研究者重現
  • 評估標準記載於內部資料;具體目標不公開,且在檢視結果前沒有向第三方服務公開預先註冊
  • Apple Watch 實驗有 31 人、臨床心電圖實驗有 35 人、整夜摘要有 67 筆紀錄;分析沒有以信賴區間完整呈現所有不確定性
  • Apple Watch 與臨床心電圖結果使用不同參與者、訊號與特徵,並非兩種模式的直接比較
  • LODO AUROC 範圍 0.028 不能證明不存在過度擬合
  • 所有評估均使用公開資料集,沒有使用 Feelmo 使用者資料
  • 分析並非為診斷睡眠障礙、指導治療或評估 Apple 原生「睡眠階段」功能而設計

參考資料

  1. 從 Apple Watch 估計睡眠階段(原生功能技術報告)Apple
  2. 三款消費型穿戴裝置追蹤健康成人睡眠的準確度Sensors
  3. 以原始加速度與 PPG 心率資料預測睡眠階段Sleep
  4. 腕戴裝置的動作、心率與 PSG 標記睡眠資料PhysioNet
  5. Haaglanden Medisch Centrum 睡眠分期資料庫PhysioNet
  6. CAP Sleep DatabasePhysioNet
  7. MIT-BIH Polysomnographic DatabasePhysioNet
用 Apple Watch 資料估計睡眠階段的研究模型顯示了什麼? | Feelmo