只靠 HRV 能讀出情緒嗎?——在 3 個世代研究中檢驗的結果
心率變異(HRV)包含與自律神經運作有關的線索。那麼,如果只把這個數字交給 AI,它能不能連「愉快」「難受」等當下情緒也猜出來?
本次內部研究得到的結論有其限定範圍:
以本次測試的 HRV 衍生資訊與研究用模型,無法跨越 3 個公開世代研究,以實用的準確度預測未知人物的情緒。
這並不證明「HRV 完全不含情緒資訊」。以下依序說明已確認到哪裡,以及仍有哪些未知。
研究定位
這是重新分析已公開資料的內部研究,尚未經同儕審查。它不是醫學診斷方法,也不是驗證 Feelmo 本身效果的臨床試驗。
首先,HRV 與情緒不是同一件事
HRV 表示每次心搏間隔的變動程度。它會受到呼吸、姿勢、運動、睡眠、時段、藥物與身體狀況等多種因素影響。
情緒則至少有以下 2 種觀察方式:
- 情緒價性(valence):感覺愉快或不愉快
- 喚醒度(arousal):感覺平靜或激動
例如,即使心率加快、HRV 發生變化,原因也可能是「期待」,也可能是「焦慮」「運動」或「咖啡因」。同一種身體反應可能有多種意義,因此只靠 HRV 為情緒命名,是一個困難的問題。
如何進行檢驗?
研究使用 3 個包含情緒標籤與心跳訊號的公開資料集。
| 世代研究 | 主要訊號 | 引發情緒的方法 |
|---|---|---|
| CASE | ECG(心電圖) | 影片 |
| AMIGOS | ECG(心電圖) | 短片與長片 |
| DEAP | 指尖 PPG(光體積描記) | 音樂影片 |
研究從心搏間隔建立多項 HRV 衍生資訊,並切分資料,避免同一人的資料同時混入訓練端與評估端,再讓模型預測訓練時未見人物的情緒價性與喚醒度。這項「跨人物評估」非常重要,因為只記住同一個人的特徵,不能代表模型可用於新使用者。
研究嘗試了連續值迴歸、二元分類與影片多類別分類等多種任務,並以統計方式整合各世代研究的結果。特徵選擇、前處理、模型構成、訓練條件等實作細節屬於 Feelmo 的專有技術,因此不公開。第三方無法完整重現相同模型,也是本研究的限制之一。
初學者如何解讀結果?
情緒價性的整合結果為 R² = −0.40(內部分析的參考95%區間 −0.61〜−0.19)。原始資料的名目人數為 CASE 30 人、AMIGOS 40 人、DEAP 32 人,共 102 人;但 CASE 的分析 fold 為 29(內部產物沒有記錄 1 人未納入的原因)。整合分析包含的受試者 fold 共 101 個,而且只來自 3 個世代研究(k=3)。此區間以各 LOSO fold 的 R² 變異進行常態近似,對世代研究數少或 R² 偏態分布較不穩健,因此只能視為參考值,不能代表對廣泛群體的確定性。
R² 是表示「模型能解釋多少情緒變異」的指標。越接近 1 越好;0 代表與「對每個人都回答平均值」的簡單方法相近。負的 R² 並不是負面情緒,而是預測表現比只回答平均值的方法更差。
3 個世代研究的結果方向一致,表示本次 HRV 衍生資訊與研究用模型未能泛化到訓練時沒見過的人。但嚴格的雙側等效性檢定並非在所有分析中都成立,因此不能斷言「真實效果嚴格等於零」或「任何 AI 都不可能做到」。
這項研究能說什麼、不能說什麼?
能說的事
- 本次測試的 HRV 衍生資訊與研究用模型,未能在 CASE、AMIGOS、DEAP 3 個世代研究中泛化到個人未見條件
- 即使納入 PPG 而非只用 ECG,在相同分析條件下也未達實用的情緒價性預測
- 產品若只看 HRV 就斷定情緒名稱,需要特別審慎
不能說的事
- 不能說 HRV 完全不含與情緒有關的資訊
- 不能說未來使用其他特徵、基礎模型或更大資料也一定不可能
- 這項結果沒有否定結合個人長期基準、呼吸、體動、聲音、情境與自我紀錄的個人內推估
- 這也不代表 HRV 不能作為思考睡眠、恢復、壓力等生理狀態的線索
「沒有預測準確」也是重要結果
AI 研究不只需要呈現高準確度,也應說明「在哪些條件下無法泛化」。清楚界定做不到的範圍,可以避免對使用者過度斷言,也能具體指出下一步需要哪些資料。
下一步需要的驗證
若要提高準確度,只把模型做得更大還不夠。需要依序檢驗以下事項:
- 長期追蹤同一個人,學習相對於其平常狀態的變化
- 同時記錄睡眠、呼吸、體動、時段、咖啡因等會影響 HRV 的脈絡
- 在測量的同一時間蒐集本人對「愉快/不愉快」的自我報告
- 在訓練未包含的人、裝置與環境中重新驗證效能
- 不只公開準確度,也公開校準、失敗案例與不確定性
如何反映在 Feelmo 的設計中?
Feelmo 會在裝置內以專有處理,將可用的 HRV 衍生資訊與使用者自己的過往趨勢,摘要成便於回顧的顯示。詳細方法不公開。Feelmo 不會從 HRV 直接推斷特定情緒。
重要的是,不應把 AI 顯示放在本人感受之上。Feelmo 不會斷言情緒名稱,而是希望使用者以產品內顯示為契機,確認自己實際的感受與情境。
研究資料
- 內部分析:Paper 1(尚未經同儕審查、尚未公開)。在重現性、授權與隱私稽核完成前,不公開分析程式碼與個人層級的中間產物
- CASE:Sharma K, et al. A dataset of continuous affect annotations and physiological signals for emotion analysis. Scientific Data. 2019. doi:10.1038/s41597-019-0209-0
- AMIGOS:Miranda-Correa JA, et al. AMIGOS: A Dataset for Affect, Personality and Mood Research on Individuals and Groups. IEEE Transactions on Affective Computing. 2021. doi:10.1109/TAFFC.2018.2884461
- DEAP:Koelstra S, et al. DEAP: A Database for Emotion Analysis Using Physiological Signals. IEEE Transactions on Affective Computing. 2012. doi:10.1109/T-AFFC.2011.15
- HRV 與情緒的回顧:Kreibig SD. Autonomic nervous system activity in emotion: A review. Biological Psychology. 2010. doi:10.1016/j.biopsycho.2010.03.010
※ 這項內部研究並未驗證 Feelmo App 的有效性。