先說結論
在 31 名參與者的公開 Apple Watch 資料中,使用心率衍生資訊與時間脈絡的研究模型,與五階段 PSG 的一致性為 κ=0.221。另一個 35 人的臨床心電圖實驗為 κ=0.244,但兩組不是同一批人,不能據此認定兩種信號等效。67 筆整夜摘要使用的是臨床心電圖,不是 Apple Watch。這些結果無法回答 Apple 原生功能有多準,也不能代表一般穿戴式 App 的 REM 百分比是否準確。
本文要點
- 評估的是使用心率衍生資訊與時間脈絡的研究模型,不是 Apple 原生「睡眠階段」功能;具體設計不公開
- 31 名 Apple Watch 參與者的一致性為 κ=0.221;另一個 35 人臨床心電圖隊列為 κ=0.244,分開的隊列不能證明等效
- 移除前後時間脈絡後,κ 降至 0.092 與 0.119,顯示時間脈絡對這個模型有幫助
- 67 筆整夜摘要分析使用臨床心電圖,沒有檢驗 Apple Watch 的 REM 百分比
- 三個留出隊列的 AUROC 為 0.621–0.649,範圍 0.028;這不能證明模型沒有過度擬合
- 這是未經同儕審查的內部二次分析,且沒有公開的外部預先註冊
先把它和 Apple 原生功能分開
Apple 原生「睡眠階段」功能以 Apple Watch 的加速度計訊號為輸入,估計清醒、REM、核心與深層睡眠四種狀態。Apple 已發布該功能的技術報告,也有獨立研究把 Apple Watch Series 8 與 PSG 比較。
我們的內部分析不同。研究用模型使用公開 Apple Watch 資料集的心率衍生資訊與前後時間資訊,估計清醒、N1、N2、N3 與 REM 五個階段。具體特徵設計、前處理與模型架構不公開。輸入與階段定義不同,因此不能用本分析結果替代 Apple 自己的驗證結果。
參考標準與使用的資料是什麼?
我們以多項生理睡眠檢查(PSG)的睡眠階段為參考。PSG 同時記錄腦波、眼球活動、肌肉活動等多種信號,再由受訓判讀者為連續的短時段標記階段。
Apple Watch 實驗使用 Walch 等人公開資料集中的 31 名參與者、25,813 個區段;該資料在同一夜同步記錄 Watch 與 PSG。另一項臨床心電圖實驗使用 HMC 的 35 名參與者。兩者都採依參與者分組的五折評估,但人員與訊號不同,是兩個獨立實驗。
結果一:兩個小型實驗的點估計接近
兩個點估計接近,但這不是同一批參與者同時佩戴 Apple Watch 並記錄臨床心電圖的直接比較。我們沒有估計差值的信賴區間,也沒有進行等效性或非劣性檢驗,因此不能推論 Apple Watch 心率等同於臨床心電圖。
Cohen’s κ 衡量扣除偶然一致後的符合程度。我們直接報告數值,不套用「良好」或「足夠」等固定標籤。要判斷特定用途是否可行,還需要不確定性與各階段表現。
- 臨床 PSG 衍生 HRV:macro AUROC 0.711、一致性 κ 0.244
- 公開 Apple Watch 資料集:macro AUROC 0.708、一致性 κ 0.221
結果二:前後時間資訊對模型有幫助
我們比較研究用模型有無加入前後時間資訊的結果。加入時間脈絡時一致性較高;具體涵蓋範圍與輸入方式不公開。
- 臨床 PSG 衍生 HRV,有脈絡 → 無脈絡:κ 0.244 → 0.119
- 公開 Apple Watch 資料集,有時間脈絡 → 無時間脈絡:κ 0.221 → 0.092
結果三:67 筆整夜摘要來自另一項臨床心電圖分析
接著,我們在 67 筆臨床心電圖紀錄中整理整夜預測階段:HMC 35 筆、CAP 15 筆、MIT-BIH Polysomnographic Database 17 筆。這項分析完全沒有 Apple Watch 紀錄。我們把預測摘要與 PSG 摘要的 Pearson 相關和事先設定的內部目標比較;目標細節不公開。
- 入睡後清醒時間(WASO):r = 0.42
- 深層睡眠比例(N3%):r = 0.32
- 睡眠效率:r = 0.30
- 入睡潛伏期:r = −0.007
- REM 睡眠比例:r = 0.003
結果四:如實報告三個留出隊列的範圍
對三個臨床心電圖隊列,我們也用其中兩個訓練,再以剩下一個測試;這稱為 leave-one-dataset-out(LODO)。留出 AUROC 在 HMC 為 0.621、CAP 為 0.647、SLPDB 為 0.649;對應 κ 分別為 0.117、0.172、0.107。
0.028 是最大與最小留出 AUROC 之間的範圍,不是從同領域結果到外部資料集所量得的「效能下降」。三個隊列點估計接近,也不能證明模型沒有過度擬合,或在新使用者上表現相同。
可以與不可以下的結論
在這些小型公開資料集中,心率衍生特徵配合鄰近時間資訊,讓自訂模型能有限度區分睡眠階段。然而,沒有 EEG 時的一致性仍有限,另一項臨床心電圖分析的整夜摘要也未達內部目標。
本研究不能證明 Apple 原生功能的準確度、Apple Watch 與臨床心電圖的等效性、一般穿戴裝置 REM 百分比的準確度,也不能診斷睡眠障礙。每個問題都需要針對特定產品、訊號與族群設計研究。
透明度與限制
- 這是 Feelmo 未經同儕審查的內部二次分析,尚未由獨立研究者重現
- 評估標準記載於內部資料;具體目標不公開,且在檢視結果前沒有向第三方服務公開預先註冊
- Apple Watch 實驗有 31 人、臨床心電圖實驗有 35 人、整夜摘要有 67 筆紀錄;分析沒有以信賴區間完整呈現所有不確定性
- Apple Watch 與臨床心電圖結果使用不同參與者、訊號與特徵,並非兩種模式的直接比較
- LODO AUROC 範圍 0.028 不能證明不存在過度擬合
- 所有評估均使用公開資料集,沒有使用 Feelmo 使用者資料
- 分析並非為診斷睡眠障礙、指導治療或評估 Apple 原生「睡眠階段」功能而設計
參考資料
- 從 Apple Watch 估計睡眠階段(原生功能技術報告) — Apple
- 三款消費型穿戴裝置追蹤健康成人睡眠的準確度 — Sensors
- 以原始加速度與 PPG 心率資料預測睡眠階段 — Sleep
- 腕戴裝置的動作、心率與 PSG 標記睡眠資料 — PhysioNet
- Haaglanden Medisch Centrum 睡眠分期資料庫 — PhysioNet
- CAP Sleep Database — PhysioNet
- MIT-BIH Polysomnographic Database — PhysioNet
