仅凭 HRV 能读懂情绪吗?——在三个队列中的验证结果
心率变异性(HRV)包含有关自主神经活动的线索。那么,只把这个数值交给 AI,它能否判断一个人此刻是“愉快”还是“难受”呢?
本次内部研究得出的结论是有限的。
本研究测试的 HRV 衍生信息和研究模型,在三个公开队列中都无法以实用准确度预测未见过的人的情绪。
这并不是在证明“HRV 完全不含情绪信息”。下面依次说明研究确认了什么,还有什么尚不清楚。
研究定位
这是对已公开数据进行再分析的、未经同行评审的内部研究。它不是医学诊断方法,也不是验证 Feelmo 本身效果的临床试验。
首先,HRV 和情绪并不是同一回事
HRV 表示相邻心搏间隔的波动程度。呼吸、姿势、运动、睡眠、时段、药物和身体状况等多种因素都会影响它。
另一方面,情绪至少可以从下面两个维度理解:
- 效价(valence):愉快还是不愉快
- 唤醒度(arousal):平静还是激动
例如,即使心率加快、HRV 发生变化,原因也可能是“期待”,也可能是“焦虑”“运动”或“咖啡因”。同一种身体反应可能具有多种含义,因此很难仅凭 HRV 给情绪命名。
如何进行验证?
研究使用了三个同时含有情绪标签和心率信号的公开数据集。
| 队列 | 主要信号 | 引发情绪的方法 |
|---|---|---|
| CASE | ECG(心电图) | 视频 |
| AMIGOS | ECG(心电图) | 短视频和长视频 |
| DEAP | 手指 PPG(光电容积脉搏波) | 音乐视频 |
研究从心搏间隔中生成多种 HRV 衍生信息,并确保同一个人的数据不会同时混入训练集和评估集,再预测训练时未见过的人的效价和唤醒度。这种“跨人评估”很重要,因为只记住同一个人的特点,并不代表模型能用于新用户。
研究测试了连续值回归、二分类和视频多分类等多种任务,并对各队列结果进行统计汇总。特征选择、预处理、模型结构和训练条件等实现细节作为 Feelmo 的专有技术未公开。因此,第三方无法完整复现同一模型,这也是本研究的局限之一。
初学者该怎样理解结果?
效价的汇总结果为 R² = −0.40(内部分析参考 95% 区间为 −0.61 至 −0.19)。原始数据名义上包括 CASE 30 人、AMIGOS 40 人和 DEAP 32 人,共 102 人,但 CASE 的分析 fold 为 29 个(内部产物没有记录 1 人未纳入的原因)。汇总中实际纳入的参与者 fold 共 101 个,而且只有三个队列(k=3)。该区间采用各 LOSO fold 的 R² 方差进行正态近似,容易受队列数量少和 R² 分布偏斜影响。因此,它应被视为参考值,而不是对广泛人群的确定性估计。
R² 表示“模型能解释多少情绪差异”。越接近 1 越好;0 表示与“对所有人都回答平均值”的简单方法相当。负 R² 并不表示负面情绪,而是表示预测效果比只回答平均值更差。
三个队列的结果方向一致,说明本研究的 HRV 衍生信息和研究模型没有泛化到训练中未见过的人。不过,并非所有分析都通过了严格的双侧等效性检验。因此,不能得出“真实效应严格为零”或“任何 AI 都不可能做到”的结论。
这项研究能说明什么、不能说明什么?
能说明的
- 本研究测试的 HRV 衍生信息和研究模型,没有在 CASE、AMIGOS、DEAP 三个队列的未见个体条件下实现泛化
- 即使不仅包含 ECG 还包含 PPG,在相同分析条件下也没有达到实用的效价预测水平
- 仅凭 HRV 就断定情绪名称的产品设计需要谨慎
不能说明的
- 不能说 HRV 完全不含与情绪有关的信息
- 不能说未来使用其他特征、基础模型或更大数据也不可能实现
- 该结果没有否定结合个人长期基线、呼吸、活动、声音、情境和自我记录进行个体内估计的可能性
- 该结果也不表示 HRV 对理解睡眠、恢复、压力等生理状态毫无参考价值
“没有预测成功”也是重要结果
在 AI 研究中,除了高准确率,说明“在哪些条件下没有泛化”也很重要。明确能力边界可以避免对用户过度断言,并帮助具体确定下一步需要的数据。
下一步需要怎样的验证?
要提高准确度,仅仅把模型做大并不够。需要依次验证以下事项。
- 长期跟踪同一个人,学习相对其日常水平的变化
- 同时记录睡眠、呼吸、活动、时段、咖啡因等会改变 HRV 的情境
- 在测量的同一时刻收集“愉快/不愉快”的自我报告
- 在训练未包含的人、设备和环境中重新验证性能
- 不仅公开准确度,也公开校准情况、失败案例和不确定性
如何反映到 Feelmo 的设计中?
Feelmo 使用设备端专有处理,将可用的 HRV 衍生信息和用户自身的历史趋势汇总为便于回顾的产品内显示。具体细节未公开。它不会直接根据 HRV 推断某种特定情绪。
重要的是,不要把 AI 显示置于用户自身感受之上。Feelmo 不会断定情绪名称,而是让用户借助产品内显示,再确认自己的实际感受和所处情境。
研究资料
- 内部分析:Paper 1(未经同行评审、尚未公开发布)。分析代码和个人级中间产物将在复现性、许可和隐私审核完成前保持不公开
- CASE:Sharma K, et al. A dataset of continuous affect annotations and physiological signals for emotion analysis. Scientific Data. 2019. doi:10.1038/s41597-019-0209-0
- AMIGOS:Miranda-Correa JA, et al. AMIGOS: A Dataset for Affect, Personality and Mood Research on Individuals and Groups. IEEE Transactions on Affective Computing. 2021. doi:10.1109/TAFFC.2018.2884461
- DEAP:Koelstra S, et al. DEAP: A Database for Emotion Analysis Using Physiological Signals. IEEE Transactions on Affective Computing. 2012. doi:10.1109/T-AFFC.2011.15
- HRV 与情绪综述:Kreibig SD. Autonomic nervous system activity in emotion: A review. Biological Psychology. 2010. doi:10.1016/j.biopsycho.2010.03.010
※ 这项内部研究没有验证 Feelmo 应用的有效性。