Volume Degraded là gì, và có đáng sợ như bạn nghĩ không?
Bạn đi công tác về, mở DSM lên thấy chấm cam nhấp nháy và dòng chữ "Storage Pool Degraded " đỏ lòm. Tim hẫng một nhịp là chuyện bình thường — ai chơi NAS lâu năm cũng từng trải qua cảm giác này ít nhất một lần. Tin tốt: Degraded không đồng nghĩa với mất dữ liệu.
Volume Degraded là trạng thái DSM báo khi một ổ cứng trong storage pool (RAID hoặc SHR) bị lỗi hoặc rớt ra khỏi mảng. Hệ thống mất lớp dự phòng (redundancy) — nghĩa là nếu ổ thứ hai hỏng tiếp, bạn mới thật sự gặp rắc rối — nhưng dữ liệu hiện tại vẫn nguyên vẹn, đọc ghi bình thường. Đây cũng là khác biệt cốt lõi giữa NAS chạy RAID với một chiếc PC thường: ổ cứng PC hỏng là mất luôn, còn NAS có redundancy nên Degraded chỉ là báo động vàng — cần xử lý sớm, chưa phải khủng hoảng.
Thứ thật sự đáng sợ là Volume Crashed — nặng hơn hẳn, xảy ra khi có từ 2 ổ lỗi trở lên (RAID/SHR thường chỉ chịu được 1 ổ lỗi) hoặc mảng không thể assemble lại. Phân biệt đúng hai trạng thái này là việc đầu tiên cần làm, vì cách xử lý khác nhau hoàn toàn.
Vài tình huống hay gặp: NAS 2-4 khay chạy SHR-1 lâu ngày, một ổ bad sector tăng dần rồi DSM tự đẩy nó ra khỏi mảng trước khi nó chết hẳn; hoặc mất điện đột ngột không có UPS, khởi động lại thì DSM báo volume degraded vì file system chưa unmount sạch. Cả hai xử lý được nếu biết bấm đúng chỗ — và đó là nội dung bài này.

Việc đầu tiên: đừng hoảng, đừng thao tác vội
Bước này dễ bỏ qua nhất, vì thấy chữ đỏ là bản năng thôi thúc làm gì đó ngay. Nhưng thao tác sai lúc này — rút nhầm ổ, tắt máy giữa chừng, ép rebuild bằng dòng lệnh khi chưa hiểu rõ — có thể biến một sự cố cứu được thành mất dữ liệu thật sự.
Việc cần làm ngay: ngừng ghi dữ liệu nặng vào NAS (không copy phim mới, không chạy backup lớn), rồi vào DSM chẩn đoán trước khi động tay vào bất cứ ổ nào.
Xác định đúng trạng thái và ổ đang lỗi
Mở Storage Manager > Storage Pool. Trạng thái ở đây ghi rõ Degraded hay Crashed. Đọc kỹ, vì nó quyết định toàn bộ hướng xử lý phía dưới.
Sau đó qua tab Storage Manager > HDD/SSD để soi từng ổ. Ổ nào đang có vấn đề sẽ hiện Failed, Warning hoặc Crashed thay vì Normal. Đối chiếu thêm Health Info và SMART status của ổ đó cho chắc — đừng đoán mò qua đèn LED trên máy, vì đèn cam đôi khi chỉ báo đang hoạt động chứ không nhất thiết là ổ hỏng.
Vào luôn Log Center (trong Control Panel hoặc gói Log Center riêng) xem thời điểm và lý do volume chuyển trạng thái — lỗi đọc/ghi, quá nhiệt, hay do mất điện. Log này giúp phân biệt đây là lỗi phần cứng thật (ổ sắp chết) hay chỉ sự cố phần mềm sau một lần shutdown không sạch.

Cách sửa: nút Repair trong Storage Manager
Chỗ hay bị hiểu nhầm nhất: nút Repair CHỈ xuất hiện khi storage pool đang Degraded — tức mảng vẫn còn đủ ổ để assemble, chỉ thiếu redundancy. Nếu pool đã Crashed, nút này thường không hiện ra hoặc báo "insufficient drives". Thấy nút Repair là tin mừng — nghĩa là DSM đánh giá tình huống của bạn còn cứu được theo cách chính thống.
Trường hợp Degraded (1 ổ lỗi) — cách làm chuẩn
- Mua ổ thay thế có dung lượng bằng hoặc lớn hơn ổ nhỏ nhất đang có trong storage pool. Nhỏ hơn là DSM chặn ngay, không cho Repair.
- Rút ổ lỗi ra, lắp ổ mới vào đúng khay đó — đối chiếu số khay vật lý với thông tin trong DSM trước khi rút, đừng chỉ nhìn đèn cam mà đoán.
- Vào Storage Manager > Storage Pool, bấm icon "..." (More) ở góc trên phải pool đang Degraded, chọn Repair.
- DSM tự rebuild. Theo dõi thanh tiến trình %, đừng tắt hay khởi động lại NAS giữa chừng.
Trên DSM 7, Fast Repair mặc định bật sẵn cho các loại RAID có dự phòng (RAID 1/5/6/10, RAID F1, SHR-1, SHR-2). Nó bỏ qua vùng chưa cấp phát dữ liệu thay vì rebuild toàn bộ dung lượng ổ, nên rút ngắn thời gian đáng kể so với kiểu repair cũ.
Về thời gian: dao động rất lớn tùy dung lượng và tải sử dụng NAS lúc đó — cộng đồng ghi nhận từ khoảng 28 giờ tới 4-7 ngày với các mảng nhiều TB. Ước tính thô là 6-15 giờ cho mỗi TB dữ liệu đã dùng thực tế (không phải dung lượng ổ). NAS vẫn dùng được trong lúc rebuild nhưng hiệu năng giảm rõ, nên đừng lên lịch xem phim 4K hay đổ dữ liệu lớn vào đúng lúc này.
Trường hợp đã gán Hot Spare
Nếu NAS dư khay và đã cấu hình sẵn Hot Spare Drive, DSM tự kích hoạt ổ dự phòng và bắt đầu repair ngay khi phát hiện ổ lỗi — không cần bạn bấm gì cả. Đây là lý do dân chơi NAS nhiều khay hay để dư một khay trống làm hot spare, coi như mua bảo hiểm cho lúc nửa đêm ổ chết mà mình đang ngủ.
Trường hợp Crashed — ranh giới nguy hiểm
Nói thẳng luôn: nếu pool đã Crashed (từ 2 ổ lỗi trở lên, hoặc mảng không assemble được), đừng tự ý dùng dòng lệnh kiểu mdadm hay btrfs check --repair nếu không thật sự rành. Mỗi lần ghi hay rebuild ở trạng thái này có nguy cơ ghi đè lên phần dữ liệu vẫn còn cứu được. Nút Repair trong DSM lúc này thường không xuất hiện — đó là tín hiệu bạn đã vượt qua ngưỡng tự sửa an toàn.
Nếu dữ liệu quan trọng mà không có backup ngoài, gọi dịch vụ phục hồi dữ liệu chuyên nghiệp vẫn khôn hơn tự mò lệnh trên một hệ thống production. Bài này tập trung vào Degraded — trường hợp còn tự xử lý được qua giao diện — chứ không đi sâu vào phục hồi Crashed, vì đó là chuyện của dân chuyên, không phải của Storage Manager.
Sau khi rebuild xong, đừng vội thở phào rồi quên luôn
- Kiểm tra lại Storage Pool đã về trạng thái Healthy.
- Chạy SMART test cho toàn bộ ổ còn lại trong pool — các ổ mua cùng lô, cùng tuổi có xu hướng hỏng gần nhau, nên ổ vừa rebuild xong tạo tải cao lên các ổ còn lại là lúc dễ lộ ổ yếu tiếp theo.
- Review lại chiến lược backup 3-2-1 của bạn. Đây là lúc thích hợp để tự hỏi: nếu lần này là Crashed chứ không phải Degraded, mình có bản backup nào ngoài NAS không?
6 lỗi hay gặp khi xử lý Volume Degraded
- Bấm Repair khi pool đang Crashed chứ không phải Degraded — vô tác dụng, thậm chí có thể làm mất thêm dữ liệu recoverable. Luôn xác nhận đúng trạng thái ở Storage Pool trước khi bấm bất cứ nút nào.
- Rút nhầm ổ đang chạy tốt thay vì ổ lỗi. Biến 1 ổ hỏng thành 2, tức Degraded thành Crashed trong tích tắc. Lỗi tai hại nhất và cũng dễ mắc nhất, nhất là lúc vội — đối chiếu số khay trong DSM với khay vật lý, đừng tin trí nhớ.
- Tắt hoặc khởi động lại NAS giữa lúc đang rebuild — làm gián đoạn tiến trình, nhiều khi phải rebuild lại từ đầu hoặc tăng rủi ro lỗi thêm. Cứ để NAS chạy liên tục, thoáng mát cho tới khi xong.
- Mua ổ thay thế nhỏ hơn ổ nhỏ nhất trong pool — DSM từ chối Repair thẳng thừng. Kiểm tra dung lượng ổ nhỏ nhất trong pool trước khi đặt hàng, đừng để ship về mới phát hiện thiếu vài GB.
- Mất điện giữa chừng không có UPS — có thể biến Degraded thành Crashed do dữ liệu ghi dở dang. Đây là lý do UPS quan trọng hơn nhiều người nghĩ khi chạy RAID, không chỉ để "phòng khi cúp điện" như PC thường.
- Chủ quan để Degraded kéo dài không thay ổ ngay — các ổ còn lại trong mảng gánh tải cao hơn trong lúc chờ, tăng nguy cơ ổ thứ hai hỏng theo trước khi bạn kịp thay. Thấy Degraded là nên xử lý trong vài ngày, không phải để đó "khi nào rảnh".
Phòng chống để không phải đọc lại bài này lần nữa
Ba việc rẻ tiền nhất mà nhiều người dùng bỏ qua:
- Cấu hình SMART Test Scheduler: vào Storage Manager > HDD/SSD > Settings > Test Scheduler > Create. Đặt Quick Test chạy hàng tuần (vài phút), Extended Test chạy hàng tháng (vài giờ, nên đặt lúc NAS ít tải, ví dụ nửa đêm). Test định kỳ giúp phát hiện ổ yếu trước khi nó tự rớt khỏi mảng.
- Bật email/push notification: vào Control Panel > Notification, cấu hình SMTP để nhận cảnh báo ngay khi có ổ lỗi hoặc pool chuyển Degraded. Đáng lưu ý, theo phản hồi cộng đồng, cảnh báo kiểu "UPS chuyển sang chạy pin" đôi khi không tự gửi email theo cấu hình mặc định — vào kiểm tra kỹ danh sách sự kiện được bật, đừng mặc định nó tự lo hết cho mình.
- Lắp UPS: vào Control Panel > Hardware & Power > UPS. UPS cho NAS graceful shutdown khi mất điện thay vì ngắt đột ngột giữa lúc ghi dữ liệu — chính là nguyên nhân phổ biến khiến Degraded biến thành Crashed sau một lần cúp điện. Nhà có nhiều NAS thì dùng Network UPS Server để chia sẻ một UPS cho cả cụm.
Chọn đúng ổ NAS-grade khi build hoặc mở rộng hệ thống
Một nguyên nhân gốc rễ khiến Degraded/Crashed xảy ra thường xuyên hơn cần thiết là dùng ổ desktop thông thường thay vì ổ chuyên cho NAS. Ổ NAS-grade thiết kế để chạy 24/7, chịu rung động khi nhiều ổ chạy chung khay, và có firmware tối ưu cho RAID rebuild. Chọn theo nhu cầu và ngân sách, không có chuyện "tốt nhất tuyệt đối":
| Nhu cầu | Model | RPM | Workload | Bảo hành |
|---|---|---|---|---|
| NAS gia đình/SOHO, tải nhẹ | WD Red Plus | 5400–5640 | 180 TB/năm | 3 năm |
| NAS gia đình/SOHO, tải nhẹ | Toshiba N300 | 7200 | 180 TB/năm | 3 năm |
| Nhiều khay, chạy 24/7, tải vừa | Seagate IronWolf | 5400–7200 | 180 TB/năm | 3 năm |
| Nhiều khay, tải nặng, cần hiệu năng cao | WD Red Pro | 7200 | 300–550 TB/năm | 5 năm |
| Nhiều khay, tải nặng, cần recovery service | IronWolf Pro | 7200 | 300–550 TB/năm | 5 năm + Rescue 3 năm |
Tất cả các dòng NAS-grade kể trên (Red Plus, Red Pro, N300, IronWolf, IronWolf Pro) đều dùng công nghệ ghi CMR, phù hợp cho RAID rebuild. Chọn dòng Plus/Pro hay dòng thường chỉ phụ thuộc số khay và tải ghi thực tế của bạn, không phải chuyện đúng/sai — NAS gia đình 2-4 khay chạy nhẹ thì Red Plus hay N300 là đủ, còn build 8 khay chạy backup server cho công ty thì nên lên thẳng Red Pro hoặc IronWolf Pro để có workload rating và bảo hành cao hơn. Một lưu ý thực tế: cùng một dòng sản phẩm đôi khi có nhiều mã model khác nhau về công nghệ ghi, nên tra đúng mã trên datasheet trước khi mua thay vì chỉ nhìn tên dòng.
Tùy chọn nâng cao (không bắt buộc)
- Hot Spare Drive: nếu dư khay, gán sẵn một ổ làm hot spare để DSM auto-repair ngay khi phát hiện lỗi, không cần đợi bạn thao tác.
- Data Scrubbing định kỳ (với volume Btrfs): quét phát hiện lỗi âm thầm (silent data corruption) mà SMART test thông thường không bắt được.
- Network UPS Server: chia sẻ một UPS vật lý cho nhiều NAS trong cùng mạng, tiết kiệm chi phí nếu có từ 2 NAS trở lên.
RAID không phải backup, đừng quên điều này
Degraded hay Crashed cũng vậy — chúng bảo vệ bạn khỏi một ổ cứng hỏng, chứ không bảo vệ bạn khỏi hỏa hoạn, ransomware, hay tay bạn lỡ xóa nhầm thư mục. Nếu dữ liệu trên NAS không có bản sao nào khác bên ngoài, mọi cảnh báo Degraded bạn từng thấy chỉ là lời nhắc nhở nhẹ nhàng — trước khi có ngày nó nhắc bạn theo cách đau hơn nhiều.



No comments yet