Volume Degraded là gì mà làm dân NAS mất ngủ
Sáng dậy mở email thấy dòng "Storage Pool [1] bị suy giảm" là kiểu thông báo khiến tim đập nhanh hơn cả báo thức. Nhưng bình tĩnh đã — Degraded (suy giảm) không phải là "mất dữ liệu", mà là NAS đang báo một ổ trong nhóm RAID có dự phòng bị lỗi hoặc rớt ra khỏi mảng. Dữ liệu vẫn còn nguyên, NAS vẫn chạy, chỉ là đang chạy thiếu một chân.
Vấn đề là cái "thiếu một chân" này không chờ bạn rảnh mới xảy ra. Nó xảy ra đúng lúc bạn ít ngờ nhất: mất điện giữa đêm, ổ cứng già theo thời gian, hoặc đơn giản là hên xui phần cứng. Volume Degraded quan trọng vì đây là khoảng thời gian vàng — xử lý đúng thì mọi chuyện qua nhẹ nhàng, xử lý sai (rút nhầm ổ, bấm nhầm nút) thì từ "hơi lo" biến thành "mất trắng" chỉ trong một cú click.
Vài tình huống thực tế hay gặp:
- NAS mất điện đột ngột hoặc tự restart giữa lúc đang ghi dữ liệu, sáng ra mở app DS finder thấy cảnh báo đỏ mà không biết ổ nào "dính".
- Nhà dùng NAS 2-4 khay chạy SHR hoặc RAID 1 để lưu ảnh, video của con — một ổ báo lỗi SMART, cần thay đúng ổ mà không được làm hỏng phần còn lại.
- Văn phòng nhỏ chạy RAID 5/6 lưu file công việc, hai ổ cùng lô hàng báo cảnh báo gần nhau — lúc này phải quyết định rất nhanh: tự rebuild hay tạm dừng gọi cứu dữ liệu.
Phản xạ tự nhiên của người mới là restart máy cho "hết đèn đỏ" hoặc rút ổ ra để "test xem có phải nó không". Cả hai đều là cách nhanh nhất để biến một sự cố nhỏ thành thảm họa. Quy trình dưới đây bám sát đúng khuyến cáo của Synology: xác minh trước, hành động sau.

Degraded khác Crashed thế nào — ranh giới quyết định sống còn
Phân biệt rõ cái này trước đã, vì cách xử lý của hai trạng thái này ngược nhau hoàn toàn.
- Degraded: mảng RAID/SHR mất đúng số ổ mà mức dự phòng còn chịu được (ví dụ RAID 5 mất 1 ổ, RAID 6 mất 1-2 ổ). Dữ liệu vẫn đọc/ghi bình thường, DSM vẫn cho Repair.
- Crashed: mảng mất nhiều ổ hơn mức chịu đựng của RAID. Dữ liệu có thể không còn đọc được toàn vẹn, và DSM sẽ không hiện nút Repair kiểu bình thường nữa.
Chỉ có các loại RAID có dự phòng mới đi qua trạng thái Degraded trước khi Crashed: SHR, RAID 1, RAID 5, RAID 6, RAID 10. Còn RAID 0, Basic hay JBOD thì không có khái niệm degraded — mất một ổ là thẳng tiến Crashed luôn, không có cửa giữa.
Nếu bạn đang thấy chữ Crashed chứ không phải Degraded, đọc thẳng xuống mục "Nếu volume đã Crashed" bên dưới — đừng làm gì thêm trước đó.
| Tiêu chí | Degraded | Crashed |
|---|---|---|
| Dữ liệu | ✓ Đọc/ghi bình thường | ✗ Có thể không đọc được |
| Nút Repair trên DSM | ✓ Có | ✗ Không |
| RAID áp dụng | SHR, RAID 1/5/6/10 | Mọi loại RAID |
| Số ổ mất so với dự phòng | Trong mức chịu đựng | Vượt mức chịu đựng |
| Hành động nên làm | Thay ổ & rebuild | Dừng lại, gọi cứu dữ liệu |
Vì sao xử lý bằng Storage Manager thay vì SSH
Nhiều bài hướng dẫn trên mạng khoái dùng SSH kiểu mdadm --assemble hay ép superblock cho ra vẻ "dân kỹ thuật thật sự". Nhưng với volume degraded, đó lại là con đường nguy hiểm hơn, không phải an toàn hơn.
- Storage Manager > Storage Pool hiện ngay badge Degraded/Crashed bằng màu sắc trực quan, không cần đọc log dòng lệnh như
dmesghaymdadm --detail. - Storage Manager > HDD/SSD liệt kê rõ số sê-ri từng ổ kèm Health Status — đối chiếu với ổ vật lý cực dễ, không cần đoán mò.
- Nút Repair trong Storage Pool tự chọn đúng thuật toán rebuild theo loại RAID hay SHR đang dùng — bạn không cần hiểu RAID hoạt động ra sao ở tầng dưới.
Lệnh dòng lệnh ép mảng chạy lại thực ra rất dễ ghi đè lên phần dữ liệu còn sót trên ổ lỗi — thứ mà dân cứu dữ liệu chuyên nghiệp cần nguyên vẹn để phục hồi. Trừ khi bạn là kỹ thuật viên cứu dữ liệu, cứ để yên cho giao diện DSM lo phần này.
Các bước xử lý khi thấy cảnh báo Degraded
Bước 1: Xác minh đúng ổ lỗi trước khi động tay
Vào Storage Manager > HDD/SSD, tìm ổ có Health Status hiện "Ổ cứng lỗi" hoặc "Critical". Ghi lại số khay và số sê-ri hiển thị trên DSM, rồi đối chiếu với nhãn dán trên ổ vật lý (hoặc mặt trước khay ổ nếu NAS có ghi số khay). Bước này hay bị bỏ qua nhất vì ai cũng muốn xử lý cho lẹ — nhưng lại chính là bước quyết định bạn có rút nhầm ổ hay không.
Bước 2: Chạy SMART test để xác nhận chứ không đoán
Vào Storage Manager > HDD/SSD > chọn ổ nghi ngờ > tab S.M.A.R.T. Test, chọn Quick Test trước (vài phút), nếu cần chắc chắn hơn thì chạy thêm Extended Test (có thể mất vài giờ, nên chạy ban đêm). SMART test giúp loại trừ trường hợp lỗi không phải do ổ mà do cáp SATA hoặc khay ổ lỏng — chuyện này xảy ra thường xuyên hơn bạn nghĩ, đặc biệt sau khi vệ sinh máy hoặc di chuyển NAS.
Bước 3: Thay ổ lỗi bằng ổ NAS-grade
Sau khi xác nhận đúng ổ lỗi, rút ổ đó ra (nhiều model Synology hỗ trợ hot-swap, tức rút/lắp khi máy vẫn chạy; một số dòng thấp hơn cần tắt máy trước — kiểm tra tài liệu model của bạn). Lắp ổ thay thế vào đúng khay đó. Lưu ý bắt buộc: ổ mới phải có dung lượng lớn hơn hoặc bằng ổ nhỏ nhất đang có trong pool, không phải bằng ổ vừa hỏng. Ví dụ pool có ổ 4TB và 6TB, ổ nhỏ nhất là 4TB, thì ổ thay thế tối thiểu cũng phải 4TB dù ổ hỏng là ổ 6TB.
Bước 4: Bấm Repair và để DSM lo phần còn lại
Vào Storage Manager > Storage Pool, chọn pool đang Degraded, bấm icon "..." hoặc nút Manage, chọn Repair. DSM sẽ hiện danh sách ổ trống để chọn làm ổ thay thế, chọn ổ vừa lắp, bấm Next rồi Apply. DSM tự tính toán và chạy đúng thuật toán rebuild theo loại RAID/SHR đang dùng.
Trong lúc rebuild: làm gì và tuyệt đối không làm gì
NAS vẫn dùng được bình thường trong lúc rebuild, chỉ là chậm hơn hẳn vì ổ cứng đang bận tái tạo dữ liệu song song với việc phục vụ truy cập thường ngày. Thời gian rebuild dao động từ vài giờ đến vài ngày tùy dung lượng ổ và mức độ dùng máy trong lúc đó.
Trong khoảng thời gian này:
- Không rút thêm bất kỳ ổ nào khác, kể cả để "kiểm tra cho chắc".
- Không update DSM lên phiên bản mới — để dành việc đó cho lúc rebuild xong.
- Hạn chế chạy tác vụ ghi nặng (chuyển file lớn, backup dồn dập) vì càng làm rebuild càng chậm và ổ càng nóng.
- Giữ NAS ở nơi thoáng mát — rebuild là lúc ổ cứng làm việc cật lực nhất, nhiệt độ cao lúc này không phải bạn của bạn.
Nếu volume đã Crashed — dừng lại, đừng bấm gì thêm
Đây là chỗ dễ sai nhất và cũng là chỗ hậu quả nặng nhất: thấy Crashed nhưng lại tưởng giống Degraded rồi cứ thế bấm Repair như thường lệ. Đừng làm vậy. Với Crashed, thao tác ghi lên mảng — kể cả thao tác "sửa lỗi" của chính DSM — có thể ghi đè lên phần dữ liệu còn sót lại, khiến việc cứu dữ liệu sau này gần như bất khả thi.
Khi gặp Crashed:
- Tắt NAS ngay, không thao tác gì thêm trên giao diện Storage Manager.
- Đánh dấu rõ thứ tự các khay ổ trước khi tháo (chụp ảnh lại càng tốt).
- Nếu có ổ nào vẫn đọc được ở máy khác, backup ngay phần dữ liệu quan trọng nhất có thể lấy được.
- Liên hệ dịch vụ cứu dữ liệu chuyên nghiệp thay vì tự mày mò lệnh
mdadm --assemble --forcehay mang ổ sang NAS khác để "Migrate" — cả hai cách này đều có thể ghi đè dữ liệu còn sót, biến "cứu được" thành "mất trắng" vĩnh viễn.
Nói cách khác: Degraded là lúc bạn còn quyền tự quyết, Crashed là lúc nên nhường tay cho người có nghề.
Những lỗi hay gặp khi xử lý Degraded
- Rút nhầm ổ đang chạy tốt trong khi mảng đã degraded — hậu quả là sập luôn cả pool vì giờ thiếu tới 2 ổ cùng lúc. Luôn đối chiếu số sê-ri trong Storage Manager với ổ vật lý trước khi rút, đừng tin vào trí nhớ hay "chắc là ổ này".
- Mua ổ thay thế dung lượng nhỏ hơn ổ nhỏ nhất trong pool — DSM sẽ từ chối cho Repair, và bạn vừa mất công vừa mất tiền mua nhầm ổ. Kiểm tra dung lượng các ổ hiện có trước khi đặt hàng.
- Nhầm Crashed với Degraded rồi bấm Repair như bình thường — như đã nói ở trên, đây là lỗi nặng nhất vì có thể xóa sạch cơ hội cứu dữ liệu.
- Kết luận vội "ổ hỏng" mà không kiểm tra cáp SATA hay khay ổ — thay ổ mới xong vẫn báo lỗi y hệt, hóa ra do đầu cáp lỏng chứ ổ chẳng có tội gì.
- Không có bản backup nào trước khi động vào RAID — nếu ổ thay thế là loại không phù hợp (ví dụ ổ SMR đời cũ hoặc ổ desktop thường lắp nhầm vào NAS) khiến rebuild kéo dài bất thường, rủi ro ổ thứ hai lỗi giữa chừng sẽ tăng lên đáng kể. Không có backup thì lúc đó không còn đường lùi.
Chọn ổ NAS-grade để rebuild ổn định, ít rủi ro
Rebuild là lúc toàn bộ ổ còn lại trong pool phải làm việc hết công suất liên tục trong nhiều giờ — đây chính là lúc ổ không được thiết kế cho NAS (workload rate thấp, không tối ưu rung động đa ổ) dễ lộ ra vấn đề nhất. Ổ NAS-grade với workload rate và MTBF cao hơn giúp quá trình rebuild diễn ra ổn định hơn, giảm nguy cơ ổ thứ hai "gãy" giữa chừng.
| Model | RPM | Workload rate | MTBF | Phù hợp |
|---|---|---|---|---|
| WD Red Plus (WD40EFPX) | 5.400 | 180 TB/năm | 1 triệu giờ | NAS gia đình/SOHO 2-8 khay |
| Seagate IronWolf (ST4000VN006) | 5.400 | 180 TB/năm | 1 triệu giờ | Tương đương Red Plus |
| Toshiba N300 (HDWG440) | 7.200 | 300 TB/năm | 1,2 triệu giờ | Giá/hiệu năng, chạy nhanh hơn |
| WD Red Pro (WD4005FFBX) | 7.200 | 550 TB/năm | 2,5 triệu giờ | NAS nhiều khay, chạy 24/7 |
| Seagate IronWolf Pro (ST4000NE001) | 7.200 | 300 TB/năm | 1,2 triệu giờ | NAS nhiều khay, kèm gói cứu dữ liệu |
Cả 5 model trên đều dùng công nghệ ghi CMR (không phải SMR) — điều này quan trọng vì CMR cho tốc độ rebuild ổn định và dễ đoán hơn. Một lưu ý đáng nhớ: cùng một dòng sản phẩm đôi khi có nhiều mã model khác nhau, một số dùng CMR và một số dùng SMR cho phân khúc giá thấp hơn. Trước khi mua, cứ tra đúng mã model trên datasheet của hãng để chắc chắn mình lấy đúng bản CMR, đừng chỉ nhìn tên dòng sản phẩm.
Về lựa chọn theo nhu cầu: NAS gia đình 2-4 khay chạy vài giờ mỗi ngày thì WD Red Plus, Seagate IronWolf hay Toshiba N300 đều đáp ứng tốt, giá tại Việt Nam bản 4TB của Red Plus và IronWolf hiện quanh mức 2,7-2,9 triệu đồng (giá dao động theo thời điểm, nên chốt lại với nơi bán trước khi mua). Khi lên NAS nhiều khay (6 khay trở lên) hoặc chạy 24/7 với tải ghi/đọc liên tục, nên nâng cấp lên dòng Pro như WD Red Pro hay Seagate IronWolf Pro — không phải vì dòng cơ bản kém, mà vì workload rate và MTBF cao hơn phù hợp với cường độ dùng cao hơn. IronWolf Pro còn có thêm gói Rescue hỗ trợ cứu dữ liệu kèm theo, đáng cân nhắc nếu dữ liệu trên NAS là loại không thể mất.
Tùy chọn nâng cao: phát hiện sớm trước khi rơi vào Degraded
Phần này không bắt buộc và không phải bước xử lý khi đã degraded — đây là việc nên làm từ trước để giảm khả năng gặp lại tình huống này lần nữa.
- Vào Storage Manager > HDD/SSD > Settings > S.M.A.R.T. Test Scheduler, lập lịch chạy SMART test tự động định kỳ (ví dụ Quick Test hàng tuần, Extended Test hàng tháng) để phát hiện dấu hiệu ổ yếu trước khi nó rớt hẳn khỏi mảng.
- Bật cảnh báo qua email và app DS finder trong DSM để nhận thông báo ngay khi có sự cố, thay vì phát hiện muộn vài ngày sau.
Backup vẫn là lưới an toàn cuối cùng, không phải RAID
RAID và SHR chỉ chống được lỗi ổ cứng vật lý, chúng không chống được lỗi thao tác, ransomware, hay việc cả hai ổ cùng lô hàng cùng hỏng gần nhau — chuyện này không hiếm như bạn nghĩ. Nguyên tắc 3-2-1 (3 bản sao, 2 loại lưu trữ khác nhau, 1 bản ở nơi khác) vẫn là lưới an toàn thật sự, thực hiện qua Hyper Backup ra ổ ngoài hoặc cloud, hoặc Snapshot Replication sang một NAS thứ hai.
Khi chưa xác định rõ ổ nào lỗi, tốt nhất đừng đụng vào gì khác trên NAS — không update DSM, không vội bấm Repair, không rút thêm ổ để "thử". Và cũng đừng bao giờ chọn "Recreate Storage Pool" hay format lại trừ khi đã có backup đầy đủ, vì đó là cánh cửa một chiều. Ổ cứng nào rồi cũng có ngày báo lỗi, chỉ là nó chọn đúng lúc bạn chưa kịp backup hay không thôi — nên thôi, backup trước khi quá muộn vẫn rẻ hơn nhiều so với một cuộc gọi cứu dữ liệu.



No comments yet