准备度评分:手腕上最自信的那个数字
有一种早晨,是从一纸判决开始的。你醒来,伸手去够手腕或床头柜,脚还没落地,一个数字已经替你决定了今天可以过成什么样。六十一。琥珀色。今天悠着点。
这是一出相当精彩的戏,而台上越来越挤。最近几周,又一个大型智能手表平台把早晨的准备度评分放上了锁屏,这意味着市面上几乎每一款主流可穿戴设备,现在都在早餐前给你的恢复打分。分数带着两位数的精度和一种颜色抵达。它们不带出处。
我们自己也做可穿戴设备和应用,所以这是我们的本行,不是隔岸的冷箭。正因如此,把诚实的那个版本说出口才更有必要:你手腕上的那个数字,是用几十年真实的生理学拼起来的,然后几乎没有被检验过。

配料被研究过,配方没有
2025年4月,都柏林大学学院由 Cailbhe Doherty 带领的团队做了一件此前没人愿意做的事:把市面上的复合评分逐一梳理,问每一个究竟是由什么构成的。他们在十家厂商那里找到了十四种——准备度、恢复、负荷、韧性、能量、身体储备,这个品类的日常词汇一应俱全。
结论不是这些分数错了,而是你无从判断。底层算法不公开,权重不披露,最终数字的生理学含义在作者看来并不清楚。两台设备看同一个夜晚,可以相差二十分,而没有任何一把尺子能说清哪一台更接近正确。
这正是被跳过的那一段。心率变异性的文献可以追溯到1990年代,睡眠结构的研究更早。训练负荷这件事,运动生理学家已经争论了四十年。但准备度——把这三样东西用一个保密函数组合起来、以百分制表示的数字——是一个新事物,它并不继承其配料的证据。你可以用认证过的钢材造一座桥,桥本身仍然不是认证过的。
图示
三项被测量的输入、一个不公开的数字、一条指令——以及检验停止的位置
输入。 光学脉搏变异、睡眠时段与活动负荷都有公开发表的准确性研究。它们并不完美,但可以核查。
数字。 十家厂商的十四种复合评分,全部是封闭算法。最终数字本身没有任何公开的验证。
建议。 几乎没有试验去问:照着每日指令做的人,是否真的比无视它的人结果更好。
你手腕上的传感器究竟在看什么
从评分往下走一层,走到贴着你皮肤的那束绿光。手腕上的光学传感器并不记录心脏的电信号,它记录的是血液脉搏的时序——心率变异性的近亲,但不是同一个测量。按它本来的名字,应该叫脉搏变异性。
有多近的亲?2026 年发表于 Sensors 的一项荟萃分析汇总了 43 项研究,并在其中十项上做了计算。在受控的安静状态下,一致性相当体面:多数可穿戴设备依赖的两项变异指标中,RMSSD 的合并标准化误差为 0.188,SDNN 为 0.134,研究之间几乎没有异质性。在安静的房间里坐着不动时,手腕干得不错。
接着就是那句应该印在每一块准备度面板上的话。作者提醒,这个结果不应推广到睡眠、运动、压力或真实生活场景,在那些条件下一致性明显更不稳定。换句话说:这项测量被验证得最好的,恰恰是没有人会去测的情形;被验证得最差的是夜间——而那正是你的准备度评分被算出来的时候。
这不是指控谁造假。这是在描述一处空白,而空白值得在被一种颜色盖住之前先被叫出名字。
还没有人回答的那个问题
就算我们承认传感器的准确性,下面仍然压着一个更难的问题,而且那才是早上七点站在厨房里的人真正在意的:如果我照这个数字说的做,我会更好吗?
2026 年 8 月,Anna Zucker 在 Journal of Medical Internet Research 上把这个问题抛给了照看活跃人群的临床医生。他们的回答比营销话术谨慎得多。准备度评分并不以任何直白的方式预测受伤。值得读的是几周的趋势,而不是某个早晨的那位数字。三项配料里,睡眠被认为是最强、最稳定的信号。而智能手表的心率变异性,单独拿出来,不该被当作判决来信任。
今年发表在 Journal of Orthopaedic Reports 的一篇叙述性综述,从临床一侧走到了同一个位置。在十六项针对身体活跃的可穿戴用户的研究中,数据反映的是恢复能力与负荷暴露——都是值得了解的真实情况——而不是预告谁即将受伤。放在时间轴上读,并结合对真实的人做出的真实评估,这些趋势是有用的背景。当成每日神谕来读,则不是。
能一锤定音的试验很好描述,却很少有人做:找几百个人,随机让一半照自己的分数行事、另一半忽略它,一年后看谁更有体能、更能坚持、更少伤病。在有人把它做到足够规模之前,你屏幕上的那条指令,只是一个穿着结论外衣的假设。
证据所在之处,是一条规则,不是一个数字
这里才是比单纯辟谣更有意思的地方。有很好的证据表明,让每天的波动来调整训练是奏效的。只不过,那并不是支持这个分数的证据。
Granero-Gallegos 等人 2020 年的一项荟萃分析汇集了六项针对耐力运动员、以心率变异性指导训练的随机对照试验——总计 195 人,多数是在几周基线测量之后进行的八周干预。那些按自己晨间变异性安排高强度课次的运动员,VO₂max 的提升幅度大于照着事先写好的固定计划训练的人。
仔细看看被检验的到底是什么。不是一个封闭指数,而是一条透明、乏味、可供审视的规则:用几周时间确定你自己的滚动基线,当天的读数落在你自己的正常区间内就练重一点,掉到区间以下就放轻。任何人都能把这条规则说出来、核对它、反驳它、复现它。这正是它成为证据而非产品功能的原因。关于这些试验,我们在HRV 指导训练究竟说明了什么里写得更细。
这个反讽漂亮得值得停一停。背后有研究的那个版本,是你能看懂的那个。背后没有研究的那个版本,是替你思考的那个。
如何使用这个数字,而不被它使用
这一切都不是在劝你把设备塞进抽屉。测量是你察觉漂移的方式,否则你会为那种漂移自圆其说——从很好滑向还行的缓慢过程,没有人在发生时能感觉到。但一个数字挣得它的位置,靠的是纠正你的幻想,而不是取代你的体感。
诚实地读一个晨间分数的六种方法
读区间,不读那位数字。 单独一个早晨是噪声。信号是你自己一到两周的滚动区间,而唯一值得做的比较,是和两周前的自己比。
问是什么让它动了。 在接受判决之前先打开明细。如果分数下跌是因为你只睡了五个小时,你本来就不需要算法来告诉你,而解决办法也不是一次更轻的训练。
把它当成问题,而不是指令。 「有什么理由让我今天恢复不足吗?」是一个有用的提醒。先从身体里给出答案,再看那个数字,看看你们俩是否一致。
让它改变剂量,而不是决定。 在大多数分数偏低的早晨,合理的反应是把训练量或强度降一档,而不是取消一整周。真正持续的低谷,才是有计划的减量周要处理的事。
对从不反驳你的分数保持警惕——对总在反驳你的也一样。 一个只会确认计划的指标是装饰。一个对每次高强度课次都投否决票的指标,是对你的基线校准错了,而不是对你的生活。
永远不要跨品牌比较。 不存在共同的尺度。一台设备上的 74 和另一台上的 74,是穿着同一身戏服的两种不同意见。
这就是我们在 Agen app 和 Agen Band 上呈现恢复趋势时所依据的想法:可以被追问的趋势,构成部分可见,并且被当作健康状态的估计值而非临床级测量来呈现。它们不是诊断,也不是指令。它们是一种看见的方式——看见那些在成为问题之前一直隐形的东西。
如果你想看同样的怀疑被用在别处,我们把它对准过睡眠评分和生物年龄检测,两者失灵的方式属于同一类。而做这一切最古老的仪器,仍然是你出生时就拿到的那件:察觉自己身体的能力,而这种能力是可以练出来的。
结论
准备度评分建立在真实的测量之上,由一套没人会给你看的算术合成,最后变成几乎没人检验过的建议。这是三个主张,只有第一个站在坚实的地面上。合理的回应既不是服从这个数字,也不是嘲笑它,而是给它降级:从判决降为输入,从指令降为问题,从某个早晨的一位数字降为你连看几周的一条线。
透明的规则胜过自信的数字,向来如此。区别只在于,自信的数字更好卖——而手腕,是一个非常适合从那里开卖的位置。


