SMART Error Synology: dấu hiệu ổ sắp hỏng và cách xử lý

SMART Error Synology: dấu hiệu ổ sắp hỏng và cách xử lý

S.M.A.R.T. (Self-Monitoring, Analysis and Reporting Technology) là hệ thống tự chẩn đoán được nhét sẵn vào firmware của gần như mọi ổ HDD/SSD từ hơn hai chục năm nay. Ổ cứng tự theo dõi sức khỏe của c

SMART là gì, sao NAS lại quan tâm chuyện này nhiều hơn PC

S.M.A.R.T. (Self-Monitoring, Analysis and Reporting Technology) là hệ thống tự chẩn đoán được nhét sẵn vào firmware của gần như mọi ổ HDD/SSD từ hơn hai chục năm nay. Ổ cứng tự theo dõi sức khỏe của chính nó — nhiệt độ, số lần đọc/ghi lỗi, số sector hỏng — rồi ghi lại thành một bảng chỉ số. DSM chỉ là bên đọc bảng đó và hiển thị cho bạn dễ hiểu hơn một chút, qua công cụ tên Storage Manager.

Nghe thì đơn giản, nhưng đây chính là thứ đứng giữa bạn và một buổi tối ngồi khóc vì mất ảnh cưới. Ổ cứng trong NAS không giống ổ trong laptop — nó chạy 24/7, quay liên tục cả năm, và thường ôm dữ liệu mà bạn không muốn mất: ảnh gia đình, phim đã rip cả tủ, backup công việc. RAID/SHR giúp bạn sống sót qua một ổ hỏng, nhưng RAID không cảnh báo trước — nó chỉ phản ứng sau khi sự cố đã xảy ra. SMART thì khác: nó là hệ thống cảnh báo sớm, cho bạn cơ hội hành động trước khi mọi chuyện thành thảm họa.

Storage Manager làm được ba việc chính mà người dùng NAS gia đình cần nhất:

  • Hiển thị tình trạng sức khỏe từng ổ, nhiệt độ, số giờ hoạt động (Power On Hours) — không cần tháo ổ ra khỏi máy.
  • Cho lên lịch chạy SMART test tự động định kỳ, không phải nhớ tự kiểm tra bằng tay.
  • Tự động gửi email/Notification khi phát hiện bất thường — bạn biết chuyện ngay cả khi không mở DSM cả tuần.

Vài tình huống thực tế hay gặp: bạn đang dùng ngon lành một chiếc DS220+ hay DS923+ được 2-3 năm, bỗng một sáng nhận email "Bad sector detected on Drive 2" nhưng Storage Pool vẫn hiện Healthy — thay ổ ngay hay theo dõi thêm? Hoặc tệ hơn, Storage Pool đột nhiên chuyển "Degraded" — dữ liệu có còn không, 24 giờ tới phải làm gì? Cũng có trường hợp ổ cũ lắp lại liên tục bị rớt kết nối dù SMART báo Normal — hóa ra do khe cắm lỏng chứ ổ chẳng hỏng gì. Bài này đi qua từng tình huống đó, theo đúng thứ tự bạn sẽ gặp ngoài đời.

So với cách cũ — tháo ổ ra cắm vào PC Windows rồi chạy CrystalDiskInfo — Storage Manager gọn hơn hẳn: mọi thông tin cần thiết hiện ngay trên NAS, không phải tắt máy hay tháo lắp gì cả.

Sơ đồ luồng SMART giám sát ổ cứng NAS và cảnh báo sớm trước khi mất dữ liệu

Vì sao dùng Storage Manager là đủ, không cần công cụ ngoài

Storage Manager có sẵn 100% trong DSM — không Package Center, không Docker, không SSH. Đây là lý do nó phù hợp với đa số người dùng:

  • Không rủi ro thao tác sai dòng lệnh, không có gì để cài đặt hay cấu hình phức tạp.
  • Chủ động: DSM tự gửi cảnh báo, bạn không cần nhớ lịch tự kiểm tra ổ mỗi tuần.
  • Đủ thông tin để biết "có nên lo hay không" cho phần lớn tình huống — không cần đọc từng chỉ số SMART thô mới hiểu chuyện gì đang xảy ra.

Nếu bạn là dân kỹ thuật muốn đào sâu hơn vào các chỉ số gốc, mục "Tùy chọn nâng cao" cuối bài có nói tới, nhưng với 90% người dùng gia đình/SOHO thì các bước dưới đây là đủ.

Đọc Health Info: ổ đang khỏe hay đang có vấn đề

Vào Storage Manager > HDD/SSD, bạn sẽ thấy danh sách toàn bộ ổ đang lắp trong máy, mỗi ổ kèm trạng thái, nhiệt độ hiện tại và model. Bấm vào một ổ cụ thể để xem chi tiết, trong đó có mục Health Info — đây là nơi quan trọng nhất.

Ba thứ cần nhìn đầu tiên:

  • Overall health status: Normal, Warning hay Critical. Đây là điểm tổng hợp DSM tính từ các chỉ số SMART.
  • Temperature: ổ HDD chạy 24/7 nên nhiệt độ cao kéo dài (trên 50°C thường xuyên) là dấu hiệu đáng để ý về luồng gió trong case, không riêng gì bản thân ổ.
  • Power On Hours: số giờ ổ đã chạy. Không phải chỉ số cảnh báo, nhưng hữu ích để biết ổ nào "cao tuổi" nhất trong dàn, ưu tiên theo dõi kỹ hơn.

Kéo xuống mục History, bạn xem lại được các lần SMART test đã chạy — ngày giờ, loại test (Quick/Extended), kết quả Passed/Failed. Nếu mục này trống trơn nghĩa là NAS của bạn chưa từng tự test lần nào — sang phần tiếp theo để bật nó lên.

Bật lịch SMART test tự động và thông báo

Vào Storage Manager > HDD/SSD > Settings > Test Scheduler, bấm Create để tạo lịch mới. DSM cho bạn chọn giữa hai loại test:

  • Quick Test: chỉ quét khoảng 1GB đầu ổ, chạy vài phút là xong, không ảnh hưởng gì tới hiệu năng NAS.
  • Extended Test (còn gọi Full Test): quét toàn bộ sector trên ổ, tùy dung lượng có thể mất cả ngày hoặc hơn. Test này bắt được nhiều lỗi hơn Quick Test vì nó thực sự đọc qua từng sector.

Cấu hình khuyến nghị cho NAS gia đình: Quick Test chạy hàng tuần (ví dụ mỗi Chủ Nhật lúc 3 giờ sáng, giờ ít người dùng NAS nhất), Extended Test chạy hàng tháng hoặc mỗi quý. Chọn khung giờ đêm khuya để tránh Extended Test làm chậm NAS lúc bạn đang xem phim hay copy file.

Sau khi có lịch test, đừng quên bật thông báo — vào Control Panel > Notification, bật kênh email và/hoặc Synology Chat/DSM Notification Center. Bước này nghe hiển nhiên mà lại hay bị bỏ qua nhất: đặt lịch test xong tưởng thế là yên tâm, ai dè quên bật thông báo thì NAS vẫn âm thầm test đều, còn bạn thì vẫn phải tự mò vào Storage Manager kiểm tra bằng tay — cả hệ thống "chủ động" coi như về lại vạch xuất phát.

Đọc hiểu các cảnh báo DSM hay gửi

Ba trạng thái Storage Pool bạn cần phân biệt rõ, xếp theo mức độ nghiêm trọng tăng dần:

Trạng tháiÝ nghĩaDữ liệuCần làm ngay
HealthyBình thườngAn toànKhông
DegradedMột ổ lỗi/bị rútCòn nguyênBackup + thay ổ sớm
CrashedMất khả năng chịu lỗiRủi ro caoLiên hệ Synology/khôi phục backup

"Bad sector detected" mà Storage Pool vẫn Healthy: đây là cảnh báo mức nhẹ nhất. Ổ phát hiện một hoặc vài sector đọc lỗi và đã tự động thay bằng sector dự phòng (spare sector) — cơ chế này vốn có sẵn trong mọi ổ hiện đại. Một vài bad sector lẻ tẻ, không tăng thêm qua các lần test sau, thường chưa phải chuyện khẩn cấp. Nhưng đây là lúc bạn nên bắt đầu để mắt kỹ hơn, không phải lúc phớt lờ.

Storage Pool "Degraded": một ổ trong mảng redundant (SHR, RAID 1/5/6...) bị lỗi hoặc bị rút ra. Vì mảng có dự phòng nên dữ liệu vẫn còn nguyên vẹn — đây là lúc RAID đang làm đúng việc của nó. Nhưng mảng lúc này không còn khả năng chịu thêm lỗi nào nữa. Trong 24 giờ tới, việc cần làm là: backup ngay nếu chưa có bản sao ngoài NAS, xác định đúng ổ lỗi, và chuẩn bị ổ thay thế.

Volume "Crashed": nghiêm trọng nhất. Thường xảy ra khi ổ thứ hai hỏng trong lúc mảng đang ở trạng thái Degraded — mất hẳn khả năng chịu lỗi. DSM không tự sửa được tình trạng này. Lúc này nên liên hệ Synology hỗ trợ hoặc khôi phục từ bản backup, thay vì tự ý thao tác thêm — vọc linh tinh lúc này rất dễ làm mất dữ liệu vĩnh viễn.

Nguyên tắc chung cần nhớ: SMART warning là đèn vàng, không phải đèn đỏ. Ổ vẫn đọc/ghi được, nhưng có dấu hiệu xấu dần theo thời gian. Đèn vàng nghĩa là "backup ngay đi", không phải "kệ nó, ổ vẫn chạy mà".

Ba chỉ số SMART đáng quan tâm nhất

Nếu bạn để ý kỹ Health Info hoặc dùng công cụ nâng cao (nói ở phần dưới), ba chỉ số sau là đáng theo dõi nhất khi nói tới bad sector:

  • Reallocated Sector Count (ID 5): số sector hỏng đã được thay bằng sector dự phòng. Con số này tăng dần theo thời gian là dấu hiệu xấu — ổ đang xuống cấp thật sự, không phải sự cố nhất thời.
  • Reallocated Event Count (ID 196): số lần xảy ra sự kiện reallocate, thường đi kèm ID 5.
  • Current Pending Sector Count (ID 197): sector nghi hỏng, đang chờ xác nhận. Có thể phục hồi (đọc lại thành công thì sector về bình thường) hoặc không (đọc lại vẫn lỗi thì chuyển sang reallocated).

Nếu bạn theo dõi Health Info qua vài tuần và thấy Current Pending Sector Count tăng dần chứ không đứng yên, đây là tín hiệu rõ ràng nhất để backup và đặt mua ổ thay thế trước khi ổ chết hẳn — không cần đợi tới khi DSM báo Degraded mới hành động.

Lỗi thường gặp khi xử lý cảnh báo SMART

1. Tưởng "Passed/Normal" nghĩa là ổ hoàn toàn ổn. SMART chỉ là một điểm tổng hợp tại thời điểm test, không phải lúc nào cũng bắt được ổ sắp hỏng sớm. Vẫn nên theo dõi xu hướng Reallocated/Pending Sector Count qua thời gian, không chỉ nhìn kết quả Pass/Fail một lần rồi yên tâm cả năm.

2. Hoảng loạn rút ổ đang chạy khi thấy Degraded. Một số model NAS không hỗ trợ hot-swap — rút ổ khi máy đang bật có thể gây lỗi thêm cho cả hệ thống. Kiểm tra tài liệu model NAS của bạn trước khi thao tác lúc máy đang bật; nếu không chắc, tắt máy an toàn trước khi rút ổ là lựa chọn chắc ăn hơn.

3. Rút nhầm ổ khỏe thay vì ổ lỗi. Ở trạng thái Degraded, xác nhận đúng số khay/đèn LED hiển thị trên Storage Manager trước khi rút bất cứ ổ nào. Rút sai ổ lúc mảng đang thiếu dự phòng có thể khiến cả mảng RAID sập ngay lập tức.

4. Mua ổ thay thế dung lượng nhỏ hơn ổ cũ. DSM sẽ không cho rebuild nếu ổ mới nhỏ hơn ổ nhỏ nhất hiện có trong mảng. Ổ thay thế phải bằng hoặc lớn hơn.

5. Nhầm lỗi khe cắm/cáp với ổ hỏng thật. Nếu một ổ liên tục mất kết nối/timeout nhưng SMART vẫn báo Normal, khả năng cao là do khay ổ hoặc kết nối SATA lỏng chứ không phải bản thân ổ có vấn đề. Thử đổi sang khay khác hoặc kiểm tra lại khay trước khi kết luận ổ hỏng và bỏ tiền mua ổ mới.

6. Chủ quan không backup trước khi rebuild. Quá trình rebuild đọc toàn bộ dữ liệu và tăng tải lên các ổ còn lại trong mảng. Nếu một ổ khác cũng đang âm thầm yếu, nó có thể lỗi tiếp ngay trong lúc rebuild — dẫn tới Crashed. Không có bản sao ngoài NAS lúc này đồng nghĩa mất trắng.

Quy trình thay ổ lỗi trong SHR/RAID mà không mất dữ liệu

Khi đã xác định cần thay ổ, làm theo đúng thứ tự sau:

  1. Vào Storage Manager > HDD/SSD, xác định chính xác số khay của ổ lỗi — ổ này sẽ không hiện màu xanh bình thường như các ổ còn lại.
  2. Kiểm tra tài liệu model NAS xem có hỗ trợ hot-swap không. Model hỗ trợ thì rút thẳng ổ lỗi khi máy đang chạy; model không hỗ trợ thì tắt máy an toàn trước.
  3. Lắp ổ mới vào đúng khay đó — ổ mới phải có dung lượng bằng hoặc lớn hơn ổ nhỏ nhất đang có trong mảng.
  4. Vào Storage Manager, chọn volume tương ứng, bấm Manage > Repair, chọn ổ mới vừa lắp để bắt đầu rebuild.
  5. Chờ quá trình rebuild hoàn tất. Thời gian tùy dung lượng ổ và số ổ trong mảng, có thể từ vài giờ tới hơn một ngày.

Trong lúc rebuild, hiệu năng NAS sẽ giảm rõ rệt vì toàn bộ ổ trong mảng đang phải đọc/ghi liên tục để tái tạo dữ liệu. Hạn chế các tác vụ nặng như chuyển mã video, sao lưu lớn hay truy cập nhiều người dùng cùng lúc trong giai đoạn này.

Chọn ổ thay thế: ưu tiên ổ NAS-grade theo đúng nhu cầu

Ổ NAS-grade được thiết kế riêng cho việc chạy 24/7 trong môi trường nhiều khay — khác với ổ desktop thông thường vốn không tính tới rung động từ các ổ lân cận hay tải làm việc liên tục. Chọn theo nhu cầu tải thực tế, không phải theo kiểu "hãng nào tốt hơn":

Với NAS gia đình/SOHO 1-4 khay dùng cho lưu trữ, chia sẻ file, backup thông thường, WD Red Plus hoặc Seagate IronWolf là lựa chọn chuẩn — đủ workload rating cho nhu cầu thực tế, giá hợp lý. Nếu NAS của bạn nhiều khay hơn, chạy Virtual Machine, hoặc có tải đọc/ghi liên tục (ví dụ chia sẻ cho nhiều người dùng đồng thời, chạy Surveillance Station với nhiều camera), nâng lên WD Red Pro, Seagate IronWolf Pro hoặc Toshiba N300 Pro sẽ hợp lý hơn — tốc độ rebuild cũng nhanh và ổn định hơn.

Một điều đáng lưu ý: cùng một dòng sản phẩm đôi khi có nhiều model khác nhau về công nghệ ghi (CMR/SMR), nên tra đúng mã model trên datasheet trước khi mua thay vì chỉ nhìn tên dòng. Muốn xem bảng so sánh chi tiết hơn về thông số, workload, giá của từng dòng ổ NAS, nashub có bài so sánh riêng, không nhắc lại toàn bộ ở đây.

Tiêu chíỔ NAS-gradeỔ desktop thường
Thiết kế chạy 24/7
Chống rung nhiều ổ
Workload rate/năm180-300TB~55TB
Bảo hành3-5 năm1-2 năm
GiáCao hơnRẻ hơn

Tùy chọn nâng cao (không bắt buộc)

Từ DSM 7.2.1, Synology đã ẩn bảng chi tiết các chỉ số SMART thô (Reallocated Sector Count, Pending Sector Count...) khỏi giao diện Storage Manager — chỉ còn hiển thị kết luận tổng hợp Normal/Warning/Critical. Với đa số người dùng thế là đủ, nhưng nếu bạn muốn tận mắt xem số liệu gốc, có một script cộng đồng mã nguồn mở tên 007revad/Synology_SMART_info (tìm trên GitHub), chạy qua SSH và hiển thị đầy đủ các attribute SMART thô như trên CrystalDiskInfo. Đây là bước dành cho người rành dòng lệnh, không phải bước cần thiết để theo dõi sức khỏe ổ hàng ngày.

Nếu NAS của bạn dùng ổ Seagate IronWolf/IronWolf Pro và là model đời trước dòng 22-series, có thể còn tính năng Seagate IronWolf Health Management (IHM) — tích hợp sâu hơn giữa firmware ổ và DSM. Lưu ý là Synology đã ngừng cập nhật danh sách model tương thích từ tháng 10/2022, nên cần kiểm tra kỹ tương thích của model NAS cụ thể trước khi kỳ vọng tính năng này hoạt động.

RAID không phải là backup — điều cần nhớ trước khi đụng vào ổ lỗi

SMART và Storage Manager giúp bạn phát hiện sớm, giảm rủi ro, nhưng chúng không thay thế cho một bản sao lưu thật sự. Nguyên tắc 3-2-1 (ít nhất một bản sao lưu ngoài NAS) vẫn cần được tuân thủ trước khi bạn đụng vào ổ đang có dấu hiệu lỗi — rebuild là lúc rủi ro cao nhất, không phải lúc để thử vận may.

Ổ đã ngoài bảo hành hoặc báo nhiều lỗi SMART nghiêm trọng thì nên thay sớm, đừng cố "dùng tới cùng". Chi phí một ổ mới luôn thấp hơn nhiều so với công sức cứu dữ liệu sau khi mảng RAID đã sập. Bad sector hôm nay có thể chỉ là đèn vàng, nhưng phớt lờ vài tháng thì rất dễ biến thành đèn đỏ lúc bạn ít ngờ tới nhất.

Mua NAS chính hãng

Xem tất cả →

Thiết bị NAS Synology & ổ cứng chính hãng Nhật Bản — tư vấn cấu hình, lắp đặt và bảo hành. Mua qua Shopee, giao toàn quốc.

No comments yet