你的穿戴式裝置「深層睡眠分數」有多準確?
你的穿戴式裝置所顯示的深層睡眠分數,是一種估算值,並不是直接測量大腦實際處於 N3 睡眠多久。智慧手錶與智慧戒指通常較擅長判斷你是否已經睡著,但要精確辨識目前處於哪一個睡眠階段,難度更高。因此,某一晚顯示「43 分鐘深層睡眠」,不應直接當成睡眠實驗室的檢查結果。
真正有用的問題,不是單看某一個數字是否完全正確,而是同一台裝置長期下來是否呈現穩定、合理的趨勢,以及這些趨勢是否與你的實際感受相符。這篇更新版指南會說明目前的市場背景、PPG 睡眠追蹤背後的光學訊號流程、與 PSG 比較的驗證研究,以及如何較安全、合理地使用這些資料。

為什麼現在更需要理解穿戴式裝置的睡眠資料
睡眠追蹤已經從少數產品才有的功能,逐漸成為消費性電子產品的常見應用。IDC 預估 2024 年全球穿戴式裝置出貨量為 5.379 億台,其中包括 1.565 億支智慧手錶、3,520 萬條腕帶,以及 170 萬枚智慧戒指。IDC 也預估智慧戒指在 2024 年的年成長率可達 88.4%,不過從整體市場規模來看,戒指仍遠小於手錶與穿戴式音訊裝置 [1]。
商業市場估值之所以不同,是因為有些報告只統計穿戴式睡眠追蹤器,有些則把床墊、App、感測器與臨床設備也納入。Grand View Research 估計,全球穿戴式睡眠追蹤器市場在 2023 年約為 134 億美元,並預測到 2030 年可能達到約 277.6 億美元,年複合成長率為 10.8% [2]。這些數字屬於市場估值,不是臨床證據,但也反映出「準不準」這個問題,對產業與一般使用者都愈來愈重要。
人口調查資料也看得到穿戴式裝置的普及。一項使用三個 Health Information National Trends Survey 調查週期、具全美代表性的研究發現,使用穿戴式裝置監測健康的成人比例,從 2020 年的 30.2% 上升到 2024 年的 41.1%;而在使用者之中,2024 年有 45.6% 表示每天都會使用 [3]。長期追蹤可以幫助觀察作息規律性、睡眠時間變化,以及與白天行為之間的關聯,但前提是使用者必須先了解感測器實際量到的是什麼。
長期追蹤資料不等於臨床診斷。例如,All of Us Research Program 使用多年商用穿戴式裝置資料,研究睡眠型態與慢性疾病風險之間的關聯;但大型觀察性資料中出現關聯,並不能證明穿戴式裝置真的量到了臨床睡眠結構,也不能證明它造成了某個健康結果 [4]。
穿戴式裝置顯示「深層睡眠」時,實際上量到的是什麼?

在睡眠實驗室中,N3 睡眠是透過多項生理睡眠檢查(PSG)來判定。PSG 會結合腦電圖(EEG)記錄腦波活動、眼電圖記錄眼球運動、肌電圖記錄肌肉張力,並搭配心律、呼吸與血氧飽和度等訊號。受過訓練的專業人員會依照標準,把睡眠以 30 秒為一個區段進行分期。
大多數消費型智慧手錶與智慧戒指並不會記錄 EEG。它們通常會結合動作、光體積描記法(PPG)、心率、脈搏間變異,以及部分裝置的溫度或血氧相關訊號,再由專屬演算法把這些周邊生理訊號轉換成預測的睡眠階段。
|
睡眠實驗室 / PSG |
消費型穿戴式裝置 |
|
透過 EEG 直接測量腦部活動 |
通常不會測量 EEG |
|
直接評估臨床睡眠分期所使用的訊號 |
根據周邊生理訊號推估睡眠階段 |
|
產生臨床睡眠結構 |
產生估算的睡眠結構 |
|
可用於診斷情境 |
主要設計用於日常健康與生活管理 |
核心概念很簡單:穿戴式裝置並不是直接「看到」深層睡眠,而是辨識某種生理訊號模式,再由演算法判斷它可能屬於 N3。2024 年一篇針對 EEG 型穿戴式裝置的系統性回顧發現,不同裝置在單一區段層級的準確度差異很大,也指出許多驗證研究仍以受控實驗室樣本為主,而不是更貼近居家情境的多元族群 [5]。
從光學訊號到脈搏波峰
PPG 是利用光學方式測量血液容積隨脈搏產生的變化。發光二極體會照射皮膚,光電二極體則記錄有多少光被吸收或反射回來。每次心跳時,動脈血液容積都會有些微變化,進而改變量到的光學波形。手腕脈搏感測常使用綠光,因為能取得較明顯的脈動訊號;若要估算血氧飽和度,則常搭配紅光與紅外線。
一個重要的技術差異是:PPG 感測器不會直接偵測 ECG 的 R 波峰。ECG 的 R 波峰代表心室去極化所產生的電訊號,是透過電極量測。PPG 波形會較晚出現在手腕等周邊部位,因為壓力脈波需要從心臟沿著動脈系統傳遞。因此,PPG 演算法偵測的是脈搏波起始點、收縮期波峰,或經數學推導得到的特徵點,而不是電訊號本身的 R 波峰 [6]。
|
訊號處理步驟 |
穿戴式裝置估算的內容 |
為什麼與睡眠判讀有關 |
|
光學訊號擷取 |
原始 PPG 波形與訊號品質資訊 |
動作、接觸壓力、皮膚灌流與環境光都會影響品質 |
|
脈搏偵測 |
周邊脈搏波峰或脈搏波起始點 |
漏掉或多抓到的波峰會扭曲逐拍間隔 |
|
建立時間間隔 |
逐拍間隔與脈搏率變異性(PRV) |
PRV 特徵是心血管輸入訊號,不是直接用 EEG 進行睡眠分期 |
|
特徵擷取 |
心率、間隔變異、動作、溫度或 SpO₂ 特徵 |
這些特徵會隨睡眠、喚醒程度、姿勢與呼吸改變 |
|
睡眠階段分類 |
預測為清醒、淺眠、深層睡眠或 REM |
模型將周邊生理模式對應到由 PSG 定義的睡眠階段標籤 |
如果裝置同時配有 ECG 電極,就可能更直接偵測到電訊號的 R 波峰。若裝置只有 PPG,較精確的用語會是「脈搏間隔」與「脈搏率變異性」。在一般消費者溝通中,把 PPG 推估出的變異稱為「HRV」並不少見,但在活動、血管狀態改變或心律不整時,PRV 與由 ECG 計算出的 HRV 並不完全相同。
從脈搏間隔到睡眠階段預測
在排除雜訊並進行動作補償後,裝置可能會在短時間窗內計算心率與變異相關特徵,再與活動量紀錄結合;視產品而定,也可能加入溫度、血氧飽和度或呼吸特徵。分類模型接著會為每一個睡眠階段計算機率,常見做法同樣以 30 秒為一個區段。因此,深層睡眠是演算法根據心血管與動作模式所做的推估,而不是直接讀取大腦皮質的慢波活動。
這項差異也解釋了,為什麼感測器可以用來觀察長期趨勢,卻仍可能無法精確對應臨床上的 N3 定義。裝置戴得太鬆、周邊灌流較差、皮膚偏冷、手腕姿勢特殊、身體移動、環境條件或心律不整,都可能降低訊號品質。不同品牌的演算法在訓練資料、軟體更新、判定閾值,以及如何處理缺失區段等方面也可能不同 [7, 8]。
穿戴式裝置追蹤深層睡眠到底有多準?
|
問題 |
整體可靠度 |
|
你當時是在睡覺,還是清醒? |
通常較可靠 |
|
你總共睡了多久? |
通常有參考價值,但不是完全精準 |
|
你實際有多少 N3 睡眠? |
可靠度較低 |
|
N3 究竟在什麼時間出現? |
更受裝置與演算法影響 |
判斷「有沒有睡著」比判斷「睡眠階段」容易
穿戴式裝置相對擅長辨識持續不活動、同時伴隨特定心率模式的狀態。在一項 2025 年比較六款手腕裝置與 PSG 的研究中,所有裝置都能偵測超過 90% 的 PSG 睡眠區段,但辨識清醒狀態的特異度只有 29.39%–52.15%,整體一致性僅落在普通到中等程度 [9]。判斷睡著或清醒是二元分類問題;要在淺眠、N3 與 REM 之間做多分類,則會遇到周邊生理訊號彼此重疊的問題。
深層睡眠的準確度會因裝置與研究而不同

一項 2025 年的獨立研究,讓 62 名成人在睡眠實驗室過夜,並同時比較六款商用裝置與 PSG。下表顯示各裝置把 PSG 判定為 N3 的區段正確標成深層睡眠的比例。這是特定研究條件下的結果,不應視為固定不變的品牌排名。
|
裝置 |
正確分類的 PSG N3 區段 |
|
WHOOP 4.0 |
69.63% |
|
Withings ScanWatch* |
66.74% |
|
Fitbit Charge 5 |
51.50% |
|
Fitbit Sense |
50.86% |
|
Apple Watch Series 8 |
50.66% |
|
Garmin Vivosmart 4 |
47.46% |
*在這項研究中,Withings 將 N3 與 REM 合併在它的「深層睡眠」類別中,因此這個數值不能完全等同於一般四階段睡眠分期中的 N3 推估 [9]。結果也可能因裝置世代、韌體、演算法版本、受試族群、睡眠障礙症狀、身體組成與研究設計而改變。2023 年一項針對 11 款裝置的多中心研究發現,macro-F1 介於 0.26 到 0.69,表現會隨 BMI、睡眠效率與呼吸中止低通氣指數而變化 [10]。
深層睡眠總分鐘數看起來正確,也可能只是剛好
假設 PSG 記錄到 70 分鐘 N3,而你的穿戴式裝置顯示 72 分鐘,這並不能證明裝置有正確辨識 N3。它可能漏掉了 25 分鐘真正的 N3,同時又把另一個睡眠階段的 27 分鐘誤標成深層睡眠。總分鐘數很接近,但實際時間點與分類仍可能錯誤。
這也是為什麼驗證研究會報告逐區段一致性、敏感度、特異度、F1 分數、Cohen’s kappa,以及各種摘要指標的一致程度。2024 年一項 Oura Gen3 研究中,睡眠/清醒敏感度約為 94%,整體睡眠準確度約為 92%,但在 421,045 個區段中,REM 仍被低估數分鐘 [11]。另一項研究則發現,三款受測裝置在深層睡眠分鐘數上的組內相關係數都偏低,即使睡眠/清醒敏感度都超過 95% [12]。
近期 IEEE 的研究從演算法角度也得到類似結論。SleepPPG-Net 在公開、以 PSG 標記的資料集上,中位 kappa 約為 0.75;另一項外部手腕式轉移學習研究則發現,手腕 PPG 與 PSG 的一致程度低於臨床訊號 [13, 14]。2025 年一項智慧戒指研究,使用同步 PSG 標籤,在僅九名健康參與者中得到四階段 kappa 0.647 [15]。這些技術結果值得關注,但不能因此認為所有商用睡眠分數都可以在臨床上直接取代 PSG。
這些驗證指標代表什麼?
|
指標 |
白話意義 |
|
敏感度或召回率 |
PSG 標記為目標類別的區段中,裝置能正確偵測到多少 |
|
特異度 |
不屬於目標類別的區段中,裝置能正確排除多少 |
|
F1 分數 |
綜合考量敏感度與精確率;漏判與誤判都會拉低分數 |
|
Cohen’s kappa |
扣除隨機一致後的吻合程度;1 代表完全一致,0 代表與隨機結果相當 |
|
組內相關係數(ICC) |
用來看連續型摘要數值的一致性,例如總睡眠時間或深層睡眠分鐘數 |
當大多數區段都是睡眠而不是清醒時,整體區段準確率可能看起來很高。資訊更完整的研究通常會同時提供各類別的結果、信賴區間、混淆矩陣、PSG 評分方法,以及裝置與軟體的確切版本。穿戴式裝置可能在總睡眠時間上表現不錯,卻仍會把個別睡眠階段分錯。
如果穿戴式裝置顯示你的深層睡眠很少,該怎麼看?

1. 不要只看單一晚。旅行、飲酒、太晚運動、生病、壓力、房間太熱,或裝置戴得太鬆,都可能改變估算結果。
2. 先看總睡眠時間。睡眠機會不足、夜間頻繁醒來或作息不規律,都會壓縮各睡眠階段可出現的時間。也可以參考相關指南:不同年齡需要多少深層睡眠。
3. 看同一台裝置的長期趨勢。盡量在相似佩戴條件下,比較連續數週的資料。不要把某一晚的 Apple Watch 與另一晚的 Oura 直接相比,彷彿兩者的「深層睡眠」標籤完全可以互換。
4. 把數字和白天的實際感受一起看。清醒程度、專注力、嗜睡感,以及醒來後是否覺得恢復,都能提供重要脈絡。
5. 症狀比分數更重要。大聲打鼾、睡眠中喘氣、被旁人觀察到呼吸中止、持續失眠、異常動作、明顯白天嗜睡,或白天功能持續下降,都值得接受專業評估。消費型穿戴式裝置不能取代 PSG,也不能取代醫療專業人員的評估。
有些人會出現所謂的「睡眠數據焦慮(orthosomnia)」:看到 App 分數不好,就開始擔心睡眠,並反覆修改自己的作息,只為了「修正」隔天的數字。比較好的做法,是把分數當成找出長期模式的工具,而不是每天晚上的成績單 [16]。
哪些穿戴式睡眠指標,比深層睡眠分鐘數更值得看?
|
Metric |
建議怎麼使用 |
|
入睡與起床時間 |
適合用來了解作息與規律性 |
|
總睡眠時間 |
通常比細分睡眠階段更有參考價值 |
|
睡眠規律性 |
累積多晚資料後最有意義 |
|
靜息心率 |
觀察相較於個人基準值是否出現持續變化 |
|
HRV 或 PRV 趨勢 |
看長期變化,不要用單一數字下結論 |
|
入睡後清醒時間 |
可幫助觀察睡眠破碎程度,但會受裝置影響 |
|
深層睡眠分鐘數 |
屬於估算值;不要過度解讀小幅變化 |
|
整體睡眠分數 |
各品牌採用自家演算法,沒有統一標準 |
Oura 的「82 分」並不等於 Fitbit、WHOOP 或 ZenoBand 的「82 分」。即使兩個品牌使用相同名稱,背後也可能使用不同的判定閾值、感測器與訓練資料。2025 年一篇納入 24 項研究、798 名參與者的統合分析發現,手腕式睡眠追蹤器與 PSG 在總睡眠時間、睡眠效率、入睡潛伏期與入睡後清醒時間等指標上,整體存在顯著差異 [17]。
你應該怎麼使用自己的深層睡眠分數?
比較適合用它來問實際問題:固定時間上床後,睡眠有沒有改變?新的作息是否伴隨更長的睡眠時間、較少的夜間醒來?這些變化是否持續數週都看得到?這類問題較符合日常健康管理的用途。
不要用深層睡眠分數診斷睡眠障礙、證明精確的 N3 分鐘數、直接比較不同品牌,或取代症狀與臨床檢查。2024 年一篇現況綜述指出,消費型穿戴式裝置在長期睡眠/清醒型態的追蹤上具有價值,但現有證據仍偏向年輕、健康成人與受控環境,而且各裝置對睡眠階段的準確度差異很大 [7]。
如果你使用像 ZenoWell taVNS 這類可與相容穿戴式資料搭配的健康管理方式,可以把過程理解為「Track、Understand、Improve」,也就是追蹤、理解、改善。ZenoWell taVNS 的設計用途,是以溫和、非侵入性的經皮耳部迷走神經刺激,作為個人化放鬆與睡眠健康日常的一部分。穿戴式資料可以協助追蹤睡眠時間、夜間醒來、靜息心率與 HRV/PRV 的長期變化,而 taVNS 使用紀錄與日常習慣,則能提供額外脈絡,幫助判斷這些變化是否持續、是否具有一致性。

重點不是追求更高的分數,也不是把單一晚的深層睡眠估算當成臨床測量。更好的做法,是用一段時間累積的資料,觀察睡眠如何受到作息調整、壓力、訓練、固定上床時間與健康習慣影響。這樣可以建立一個實用的回饋循環:追蹤睡眠與生理趨勢、理解哪些因素和較好或較差的夜晚有關,再透過持續、個人化的小幅調整改善睡眠習慣。當睡眠問題持續存在或出現值得注意的症狀時,ZenoWell taVNS 與穿戴式資料應該作為輔助資訊,而不是取代臨床評估。
常見問題
穿戴式裝置追蹤深層睡眠有多準?
一般來說,穿戴式裝置在估算「精確的深層睡眠分鐘數」方面,不如判斷睡著或清醒可靠。準確度會受到裝置、演算法、受試族群、睡眠狀況與驗證方法影響。
Apple Watch 的深層睡眠準確嗎?
Apple Watch 可以提供具有參考價值的個人長期趨勢,但它的深層睡眠數值仍是演算法估算。2024 年一項 PSG 研究顯示,它在睡眠/清醒辨識上的敏感度較高,但深層睡眠分鐘數的一致性較差,因此不應把單一晚的結果當成睡眠實驗室數據。
Oura Ring 的深層睡眠準確嗎?
Oura 已在多個族群中與 PSG 進行驗證,可用來觀察長期變化。不過,它的睡眠階段標籤仍然是預測結果,而且某一代產品或某個軟體版本的表現,不應直接推論到未來所有版本。
為什麼我的穿戴式裝置顯示幾乎沒有深層睡眠?
可能原因包括睡眠時間短或較破碎、作息和平常不同、佩戴或感測器問題、正常的夜間波動,或睡眠階段分類誤差。如果這個結果長期持續,而且你同時有明顯症狀,建議和醫療專業人員討論。
睡眠實驗室會比較準嗎?
如果目的是評估睡眠結構與 N3 分期,答案是會。PSG 會直接測量腦部與其他臨床睡眠分期所使用的生理訊號,因此仍是驗證與診斷的參考標準。
重點整理
穿戴式裝置可以讓睡眠變得更容易觀察,但手錶或戒指並不會因此變成攜帶式睡眠實驗室。把深層睡眠分鐘數視為估算值,優先觀察多晚趨勢與總睡眠時間;是否需要尋求醫療建議,應以實際症狀為主,而不是只看品牌自訂的睡眠分數。
參考資料
[1] International Data Corporation. (2024, September 26). IDC forecasts continued growth for wearables but growth will be uneven across product categories. https://s24.q4cdn.com/622300748/files/doc_news/IDC-Forecasts-Continued-Growth-for-Wearables-But-Growth-Will-Be-Uneven-Across-Product-Categories-2024.pdf
[2] Grand View Research. (2024). Wearable sleep trackers market to reach USD 27.76 billion by 2030. https://www.grandviewresearch.com/press-release/global-wearable-sleep-trackers-market
[3] Pedroso, A. F., Dhingra, L. S., Aminorroaya, A., & Khera, R. (2026). Wearable devices and data sharing in the US. JAMA Network Open, 9(6), e2617733. https://doi.org/10.1001/jamanetworkopen.2026.17733
[4] Zheng, N. S., Annis, J., Master, H., Han, L., Gleichauf, K., Ching, J. H., ... Brittain, E. L. (2024). Sleep patterns and risk of chronic disease as measured by long-term monitoring with commercial wearable devices in the All of Us Research Program. Nature Medicine, 30, 2648–2656. https://doi.org/10.1038/s41591-024-03155-8
[5] de Gans, C. J