하룻밤을 숫자 하나로: AI가 1만 건의 수면검사에서 찾아낸 것
병원 수면검사는 여덟 시간 동안 신체의 열세 개 채널을 지켜보고, 결국 사실상 하나의 숫자를 보고합니다.
두피 세 지점에서 잡은 뇌파. 눈의 움직임. 턱 근육의 긴장도. 코에서의 공기 흐름. 가슴과 배의 호흡 노력을 따로. 산소포화도. 심전도. 자기 코 고는 소리. 기사가 머리에 전선을 붙여 모은, 사람의 한밤 약 1기가바이트. 그리고 병원이 보고서에서 동그라미를 치는 줄은 시간당 사건 수입니다.
8월 3일, Nature Communications 에 실린 논문이 그 기록에 또 무엇이 있었는지를 물었습니다. 답은 이번 주 수면과학에서 가장 흥미로운 것이며, 사실 인공지능에 관한 이야기가 전혀 아닙니다. 사십 년 동안 하룻밤을 숫자 하나로 서술하기로 합의하면 무슨 일이 벌어지는가에 관한 이야기입니다.
만 개의 밤, 열세 개의 채널, 하나의 숫자
Erhan Bilal과 Jeffrey Rogers가 이끌고 Reena Mehra가 임상 책임저자로 참여한 팀은, 트랜스포머 모델 — 1억 2,600만 개의 파라미터, 언어 모델을 받치는 것과 같은 큰 틀의 구조 — 을 클리블랜드 클리닉 STARLIT 레지스트리의 1만 건이 넘는 임상 수면 기록 원신호로 학습시켰습니다. 요약 보고서가 아니라 파형으로요.
기록은 2012년부터 2022년까지이며 전자의료기록과 연결되어 있어서, 연구자들은 그 사람들에게 이후 무슨 일이 있었는지 따라갈 수 있었습니다. 평균 14.5년입니다. 그리고 그들은 의도적으로 화려하지 않은 일을 했습니다. 모델에게 진단을 예측하게 하는 대신, 수면 생리의 구조를 배우게 하고 밤들이 스스로 어떻게 나뉘는지를 지켜본 것입니다.
밤들은 다섯 그룹으로 나뉘었습니다. 그리고 그 그룹들의 미래는 매우 달랐습니다.
밤을 삼켜버린 지표
왜 그것이 중요한지 보려면 무호흡-저호흡지수가 무엇인지 알아야 합니다. AHI는 호흡이 끊긴 횟수를 세어 수면 시간으로 나눕니다. 시간당 5~15회는 경증, 15~30회는 중등증, 30회 초과는 중증입니다. 1970년대 이후 임상 수면의학, 보험 수가, 그리고 호흡 장애에 관한 모든 대화를 이 지표가 조직해 왔습니다.
동시에 이것은, 이 분야가 스스로 인정하듯 거친 도구입니다. 2021년 SLEEP에 실린 합의 리뷰는 Atul Malhotra를 필두로 이 분야의 상당 부분이 참여해 문제를 분명히 정리했습니다. AHI는 이용 가능한 지표 중 가장 잘 연구된 것이며, 불완전하고, 두 사실을 함께 붙들어야 한다는 것입니다. 10초의 멈춤과 90초의 멈춤이 똑같이 한 번으로 셉니다. 산소가 93%로 떨어지는 것도 78%로 떨어지는 것도 같습니다. 깊은 수면 중의 사건도 졸다 깨는 중의 사건도 같습니다.
AHI의 문제는 정확성이 아니었습니다. 가독성이었습니다. 서식에 들어가기 때문에 살아남은 것입니다.
지표가 볼 수 없었던 다섯 그룹
널리 퍼져야 할 결과는 이것입니다. 나이, 성별, BMI, 동반질환 그리고 AHI 자체를 보정한 뒤에도 모델의 위험군은 사망률에서 계속 갈라졌습니다. 2군부터 4군의 위험비는 1.43, 1.54, 1.75였고 가장 위험이 높은 군은 2.38 — 가장 낮은 군의 두 배가 넘습니다. 같은 최상위군에서 심방세동은 2.23(95% 신뢰구간 1.47~3.38), 인지기능 저하는 1.93(1.42~2.62)이었습니다.
반면 같은 환자들을 경증·중등증·중증 AHI로 줄 세우면 그런 단계적 증가는 전혀 나타나지 않았습니다.
이것을 단순한 모델링 장식 이상으로 만드는 두 가지 세부가 있습니다. 이 양상은 완전히 별개의 전국 코호트인 Sleep Heart Health Study에서도 유지되었습니다 — 거기서도 그룹은 심부전과 사망률을 따라갔습니다. 그리고 여성과 남성에서 똑같이 유지되었는데, AHI는 역사적으로 그렇지 못했습니다. 이 지표는 남성에 치우친 집단에서 만들어지고 검증되었고, 그 뒤로 조용히 여성을 더 못 설명해 왔습니다. 요약된 숫자는 누구에게 맞춰 교정되었는지를 늘 안에 담고 있습니다.
그림 — 지표가 버린 것
하나의 밤, 그것을 읽는 두 가지 방식
5년 이상 사망률, 모델의 위험군별
같은 환자들을 AHI 중증도로 줄 세우면
수면검사실에 가 볼 일이 없는 사람에게 이것이 바꾸는 것
세 가지 옮겨 담을 것, 어느 것도 의학적 조언은 아닙니다:
1. 요약된 숫자는 무엇을 버릴지에 대한 선택 이며, 그것을 만든 사람이 내린 것입니다 — 당신의 밤이 가진 성질이 아닙니다.
2. 숫자가 전혀 움직이지 않는다면, 밤이 안정적이라는 뜻일 수도 있고 숫자가 너무 거칠어 알아차리지 못한다는 뜻일 수도 있습니다. 안에서는 둘이 똑같게 느껴집니다.
3. 여러 밤에 걸친 양상으로 만든 지표는, 한 밤을 점수로 평균해 버리는 지표보다 더 잘 버텨 왔습니다.
위험비는 Bilal 등, Nature Communications (2026년 8월 3일)에서. 나이, 성별, BMI, 동반질환, AHI를 보정했으며 1군이 기준이고 막대 길이는 보고된 위험비에 비례합니다. AHI 부분은 기준선 위에 놓인 빈 표식으로 그렸습니다. 같은 코호트의 Cox 회귀에서 경증·중등증·중증 사이에 사망률도 질병 발생률도 증가하지 않았기 때문입니다. 세 값이 똑같이 측정된 것이 아니라, 차이가 '없다'는 뜻입니다. 연관성이며 인과의 증명은 아닙니다.
당신의 수면 점수도 같은 문제를 안고 있다
여기서부터 이 이야기는 병원 이야기가 아닙니다.
매일 아침 수천만 명이 자기 밤을 설명한다는 0에서 100 사이의 숫자 하나를 받습니다. 열셋이 아니라 몇 개의 채널에서, 누군가가 고른 가중치로 계산되며, 무엇보다 읽기 쉽도록 설계되어 있습니다 — 깨어나 커피에 손을 뻗기까지의 4초 안에 읽을 수 있는 숫자로.
그것이 바로 AHI의 설계 요구사항입니다. 웰니스 산업은 압축 문제를 해결한 것이 아니라, 더 예쁜 서체로 다시 풀었을 뿐입니다. 정말로 다른 두 밤 — 앞부분이 조각난 밤과, 후반이 얕고 뒤척인 밤 — 이 둘 다 82로 돌아올 수 있습니다. 그리고 점수가 3주 동안 82에 머물면, 수면이 안정적인 것인지 아니면 지표에 변화를 볼 해상도가 없는 것인지 구별할 수 없습니다.
여기서는 조심하고 싶습니다. 이 주장의 정직한 형태는 양쪽을 다 겨누기 때문입니다. 소비자용 수면 측정은 몇 가지에서 정말 좋아졌습니다 — 시각, 길이, 밤과 밤 사이의 일관성, 밤 동안의 심박수 — 그리고 그것들이야말로 가질 만한 부분입니다. 할 수 없는 일은 무엇이 중요하지 않은지 정하지 않고 한 밤을 압축하는 것입니다. 병원도 못 합니다. 차이는, 병원은 자기 압축에 대해 사십 년간 공개적으로 다퉈 왔고 손목의 점수는 그러지 않았다는 것입니다. 이 점은 따로 다뤘습니다 — 웨어러블이 측정할 수 있는 것과 없는 것, 그리고 수면 단계가 말해 주는 것과 말해 주지 않는 것。
깊이와 지속, 횟수만이 아니라
AI가 이 문제를 발견한 것이 아닙니다. 값을 매긴 것입니다.
수면 연구자들은 여러 해 동안 더 나은 요약을 만들어 왔고, 가장 분명한 예는 저산소 부담입니다. 호흡 사건을 세는 대신 Ali Azarbarzin과 동료들은 산소가 떨어질 때마다 그 아래 면적 — 깊이 곱하기 지속시간 — 을 재어 하룻밤 동안 합했습니다. 2019년 European Heart Journal에서 이 측정치는 독립된 두 코호트, Osteoporotic Fractures in Men Study와 Sleep Heart Health Study에서 심혈관질환으로 인한 사망률과 함께 움직였습니다. 사건 횟수는 그러지 못한 곳에서요.
같은 기록. 같은 밤. 무엇을 남길지에 대한 다른 결정, 그리고 신호가 나타납니다. 그것이 이번 주 논문의 논지 전체이며, 7년 전에 트랜스포머가 아니라 산술로 이미 도달했던 것입니다.
압축을 견디는 단 하나의 요약 숫자
숫자 하나가 정보를 잃는다면, 유용한 질문은 이렇게 됩니다. 어느 것이 가장 덜 잃는가?
지금까지의 근거로 보면 일상생활에 가장 좋은 답은 규칙성입니다. 2024년 Daniel Windred와 동료들은 UK Biobank 참가자 60,977명의 1,000만 시간이 넘는 가속도계 자료에서 수면규칙성지수를 계산했습니다. 중앙값과 비교해 규칙성이 5백분위인 사람의 전체 원인 사망 위험비는 1.53(95% 신뢰구간 1.41~1.66), 95백분위인 사람은 0.90(0.81~1.00)이었습니다. 규칙성은 수면 시간 — 실제로 모두가 쫓는 그 숫자 — 을 앞질렀습니다.
밤마다의 점수는 버티지 못하는데 규칙성은 왜 버틸까요? 한 밤 안의 평균이 아니기 때문입니다. 그것은 여러 밤에 걸친 모양에서 계산되므로, 평탄하게 만드는 대신 양상을 보존합니다. 구조를 지키는 압축은 살아남고, 단정함을 지키는 압축은 살아남지 못합니다. 작동 원리는 수면 규칙성 대 수면 시간。
그래서 이번 주에 해 볼 것 하나. 7일 동안 점수 읽기를 멈추고 두 개의 숫자만 적으세요. 침대에 들어간 시각과 일어난 시각입니다. 그다음 밤 동안의 안정시 심박수 와 HRV 를 집단 기준 범위가 아니라 자기 자신의 기준선에 대한 추세로 보세요. 시각의 일관성, 그리고 그 두 값이 움직이는 방향. 이는 수면검사실보다 낮고 점수보다 높은 해상도의 그림이며, 대부분의 사람이 실제로 원하는 거래가 바로 이것입니다. 이는 더 큰 측정하고, 실행하고, 조정하는 순환 안에 있습니다.
이 연구가 말하지 않는 것
알고리즘이 당신이 어떻게 잤는지 말해 줄 수 있다고 말하지 않습니다. 이 연구는 두피에 전극을 붙인 완전한 임상 수면다원검사에서, 이미 무언가 문제가 있어 수면센터로 의뢰된 사람들을 대상으로 이뤄졌습니다. 손목이 아니고, 일반 인구도 아닙니다.
후향적 연구이므로 자료에 둘 다 들어맞는 두 가지 해석을 갈라낼 수 없습니다. 흐트러진 수면 생리가 이후의 질병에 기여한다는 해석과, 이른 시기의 질병이 드러나기 몇 년 전부터 수면을 흐트러뜨린다는 해석입니다. 저자들은 약물 정보와 양압 치료의 객관적 사용 자료가 없었다고도 적었습니다 — 밤에도 결과에도 작용하는, 측정되지 않은 큰 영향 두 가지입니다. 다섯 그룹은 군집화 단계에서 나온 것이어서 그 경계는 자연스러운 구분이 아니라 모델링 상의 결정입니다. 다른 알고리즘이라면 넷, 혹은 일곱을 그렸을지도 모릅니다.
그리고 여기 있는 것은 임상 도구로서 전향적으로 검증되지 않았습니다. 저자들은 분명히 말합니다. 다음은 더 다양한 데이터셋에서의 검증이라고요.
유보가 아닌 것 하나. 코를 심하게 골거나, 숨이 막혀 깨거나, 겉보기에 정상인 여덟 시간을 자고도 부서진 느낌이라면, 그것은 앱이 아니라 의사와 할 대화입니다. 어떤 소비자용 기기도 무엇을 진단할 수 없고, 어느 것도 그러려 해서는 안 됩니다.
결론
AI가 만 개의 밤을 읽고, 의학이 쓰기로 합의했던 숫자가 두 배의 위험 차이를 감추고 있었음을 찾아냈습니다. 좋은 결과입니다. 그러나 오래 남을 교훈은 더 나은 모델이 온다는 것이 아닙니다. 모든 요약 숫자는 무엇이 중요한가에 대한 주장이고, 우리 대부분은 그 주장을 읽지 않은 채 받아들인다는 것입니다.
숫자는 경험을 대체하기 위해서가 아니라 환상을 고치기 위해 쓰세요. 점수는 당신의 밤이 아닙니다. 당신의 밤에 대한 누군가의 의견을 반올림한 것입니다.


