まず、短く答えると
31人のApple Watch公開データでは、研究用モデルと睡眠検査(PSG)の一致度κ(カッパ)は0.221でした。κは、偶然に答えが一致する分を差し引いた数字です。別の35人の病院の心電図ではκ=0.244でした。ただし、同じ人を同じ条件で比べたわけではないため、Apple Watchと病院の心電図が「同じ精度」とは言えません。一晩の結果をまとめた67件も、Apple Watchではなく病院の心電図です。この研究では、Apple純正の睡眠機能や、一般のアプリが示すREM睡眠の割合が正しいかは判断できません。
この記事の要点
- Apple純正機能ではなく、心拍の情報を使ったFeelmoの研究用モデルを調べた
- Apple Watch 31人でκ(偶然の一致を差し引いた数字)=0.221、別の病院の心電図35人でκ=0.244。ただし、別々の参加者なので同じ精度とは言えない
- 入力する情報を減らすと、κ(偶然の一致を差し引いた数字)は0.092と0.119へ下がった
- 一晩の結果を調べた67件は病院の心電図で、Apple WatchのREM睡眠を調べたものではない
- 3つの集団で、睡眠段階を見分ける力を示すAUROCは0.621〜0.649(差は0.028)だったが、未知の人でも同じ成績になるとは限らない
- 結果はほかの研究者による審査前の内部解析で、研究開始前の公開事前登録は行っていない
まず、Apple純正の睡眠機能とは別です
Apple純正の機能は、Apple Watchがとらえた手首の動きを主に使い、覚醒・REM・コア・深い睡眠の4つを推定します。Appleの技術資料のほか、Apple Watch Series 8と睡眠検査(PSG)を比べた第三者の研究もあります。
今回調べたのは別の仕組みです。公開されたApple Watchの心拍情報から、覚醒・N1・N2・N3・REMの5段階を推定する、Feelmoの研究用モデルを評価しました。どの情報を使い、どう計算したかという詳しい仕組みは公開していません。純正機能とは使うデータも段階の分け方も異なるため、今回の結果を純正機能の成績として読むことはできません。
何を基準に、どのデータで試したか
比べる基準には、PSG(睡眠ポリグラフ検査)の結果を使いました。PSGは、脳波、目の動き、筋肉の活動などを病院や検査施設で記録する検査です。専門家が30秒ごとに睡眠段階を判定するため、睡眠研究の基準として使われます。
Apple Watchの実験では、同じ夜にApple WatchとPSGを記録した31人分の公開データを使いました。30秒の区間にすると25,813個です。病院の心電図の実験には、HMCという公開データの35人分を使いました。どちらもデータを5つに分け、ある人のデータで学習したモデルを別の人で試しました。ただし、参加者も入力方法も異なる、別々の実験です。
結果1:2つの実験で近い数字が出た
AUROCは、各睡眠段階をどのくらい見分けられたかを見る数字です。1に近いほど区別できています。κ(カッパ)は、偶然に同じ答えになる分を差し引いた一致度です。
2つの結果は近く見えます。ただし、同じ参加者にApple Watchと病院の心電図を両方着けて比べたわけではありません。数字の差がどれくらい不確かかも十分に調べていないため、「Apple Watchの心拍は病院の心電図と同じ精度」とは結論できません。
また、κを一つ見るだけで「よい」「十分」とは決められません。何に使うモデルなのか、各睡眠段階をどれくらい正しくとらえたかも確認する必要があります。
- 病院の心電図:全段階をまとめたAUROC 0.711、一致度κ 0.244
- Apple Watchの心拍情報:全段階をまとめたAUROC 0.708、一致度κ 0.221
結果2:入力する情報を減らすと一致度が下がった
結果が計算方法にどれくらい左右されるかを確かめる追加テストを、「感度分析」と呼びます。通常の研究用モデルと、入力する情報の一部を省いたモデルを比べたところ、情報を減らしたモデルでは一致度が下がりました。使った情報や計算方法の詳細は、独自技術のため公開していません。
- 病院の睡眠検査で記録した心電図(通常構成 → 簡略構成):κ 0.244 → 0.119
- Apple Watchの心拍から得た情報(通常構成 → 簡略構成):κ 0.221 → 0.092
結果3:一晩のまとめは、病院の心電図だけで調べた
次に、病院の心電図67件(HMC 35件、CAP 15件、MIT-BIH SLPDB 17件)について、推定した睡眠段階を一晩分にまとめました。Apple Watchの記録は含まれていません。PSGから求めた比較基準と、どのくらい同じ方向に動くかを示す「Pearson相関」を調べました。評価する目標は解析前に内部資料で決めましたが、具体的な数値と合格の決め方は公開していません。
- 寝ついたあとに目覚めていた時間(WASO):r = 0.42
- 深い睡眠の割合(N3%):r = 0.32
- 睡眠効率:r = 0.30
- 寝つくまでの時間:r = −0.007
- REM睡眠の割合:r = 0.003
結果4:3つの集団で試した成績
ここでいう「コホート」は、研究に使った参加者の集団です。病院の心電図にある3つの集団について、2つで学習し、残り1つを初めて見るデータとして試す評価(LODO)も行いました。試した集団でのAUROCは、HMC 0.621、CAP 0.647、SLPDB 0.649でした。最大と最小の差は0.028です。対応するκは0.117、0.172、0.107でした。
0.028は、「新しいデータで性能が0.028下がった」という意味ではありません。3つの結果の最大と最小の差です。数字が近かったことはわかりますが、モデルが学習データだけを覚えすぎていないことや、未知の利用者でも同じ成績になることまでは証明できません。
ここまでで言えること・言えないこと
今回わかったのは、少人数の公開データでは、心拍情報を使う研究用モデルが睡眠段階をある程度見分けたことです。一方、脳波を使うPSGとの一致度は限られていました。病院の心電図で調べた一晩のまとめも、内部目標には届きませんでした。
一方、この研究だけでは、次のことはわかりません。
- Apple純正の睡眠機能がどれくらい正確か
- Apple Watchと病院の心電図が同じ精度か
- 一般のウェアラブルが示すREM睡眠の割合が正しいか
- ウェアラブルで睡眠障害を診断できるか
研究の限界
- Feelmoが公開データをもう一度分析した研究で、まだほかの研究者による審査や再現を受けていません
- 評価目標は先に内部資料で決めましたが、具体的な値と判定方法は非公開です。結果を見る前に第三者サービスへ登録する「公開事前登録」もしていません
- Apple Watchは31人、病院の心電図は35人、一晩のまとめは67件と少なく、結果の不確かさを十分には評価できていません
- Apple Watchと病院の心電図では、参加者、記録する信号、モデルに渡す情報が違うため、二つの機器を直接比べた研究ではありません
- LODOで見たAUROCの差0.028だけでは、モデルが学習データを覚えすぎていないとは証明できません
- 使う情報、モデルの仕組み、学習条件は独自技術として非公開です。そのため、ほかの研究者が同じ解析を完全に再現することはできません
- 評価に使ったのは公開データセットで、Feelmoの利用者データは一切使っていません
- 睡眠障害の診断や治療の判断、Apple純正睡眠機能の評価を目的とした研究ではありません
参考資料
- Estimating Sleep Stages from Apple Watch(純正機能の技術資料) — Apple
- Accuracy of Three Commercial Wearable Devices for Sleep Tracking in Healthy Adults — Sensors
- Sleep stage prediction with raw acceleration and PPG heart rate data — Sleep
- Motion and heart rate from a wrist-worn wearable and labeled sleep from PSG — PhysioNet
- Haaglanden Medisch Centrum sleep staging database — PhysioNet
- CAP Sleep Database — PhysioNet
- MIT-BIH Polysomnographic Database — PhysioNet
