Khôi phục dữ liệu NAS hỏng: tự cứu hay gọi thợ

Khôi phục dữ liệu NAS hỏng: tự cứu hay gọi thợ

2 giờ sáng, NAS tự nhiên kêu bíp, đèn ổ đĩa chuyển đỏ, Storage Manager báo pool "Degraded". Phản xạ của 90% người dùng lúc này là bấm loạn xạ: rút ổ ra cắm lại, bấm Repair, tệ hơn thì tháo ổ ra gõ gõ

NAS báo lỗi ổ, volume "Crashed": bình tĩnh trước, bấm sau

2 giờ sáng, NAS tự nhiên kêu bíp, đèn ổ đĩa chuyển đỏ, Storage Manager báo pool "Degraded". Phản xạ của 90% người dùng lúc này là bấm loạn xạ: rút ổ ra cắm lại, bấm Repair, tệ hơn thì tháo ổ ra gõ gõ vài cái "cho nó chạy lại". Đừng.

Tin không quá tệ: ổ báo lỗi không có nghĩa dữ liệu đã mất. Phần lớn trường hợp dữ liệu vẫn nằm nguyên trên mặt đĩa, chỉ là filesystem hoặc bảng RAID đang "lạc đường". Tin khó chịu hơn: vài giờ đầu tiên bạn làm gì sẽ quyết định một ca "còn cứu được" có biến thành "mất vĩnh viễn" hay không. Bài này giúp bạn xếp đúng tình huống của mình vào 1 trong 3 tầng — tự làm miễn phí, thuê dịch vụ vài trăm nghìn đến hai triệu, hoặc chấp nhận chi chục triệu cho lab phòng sạch — trước khi tay nhanh hơn não.

Sơ đồ 4 bước xử lý khi NAS báo lỗi ổ, từ phát hiện đến khôi phục dữ liệu

Vì sao RAID/NAS khó cứu hơn một ổ cứng gắn ngoài đơn thuần

Ổ gắn ngoài lỗi filesystem thì quét một lần là xong. NAS chạy RAID khác hẳn: dữ liệu bị xé nhỏ, rải đều trên nhiều ổ theo thuật toán striping/parity. RAID5 hay SHR (Synology Hybrid RAID) chỉ chịu được đúng 1 ổ chết — mất thêm ổ thứ hai là hết margin, hệ thống không còn đủ thông tin để tính lại phần dữ liệu bị thiếu.

Đây là lý do "rebuild" là con dao hai lưỡi. Thành công thì phục hồi toàn bộ dữ liệu. Nhưng nếu trong lúc rebuild rớt thêm một ổ nữa — chuyện rất hay gặp, vì ổ cùng lô cùng tuổi thường chết gần nhau — quá trình ghi đè để tái tạo parity sẽ đè lên chính phần dữ liệu đang cố cứu. Lúc đó có dừng lại cũng không hoàn tác được, block đã bị ghi mới rồi.

Bước 0-1: dừng lại và chẩn đoán trong 5 phút

Nghi có gì bất thường — ổ kêu lạ, NAS treo, volume rớt — tắt NAS hoặc rút ngay ổ nghi vấn, đừng thao tác thêm. Sau đó chẩn đoán nhanh theo thứ tự:

  • Nghe âm thanh: ổ khỏe khi cấp điện có tiếng spin-up êm rồi ổn định. Tiếng click-click lặp lại, tiếng rít, tiếng nghiến (grind), hoặc im lặng hoàn toàn không quay — dấu hiệu hỏng cơ khí (đầu từ hoặc PCB).
  • Kiểm tra nhận diện: NAS/máy tính có thấy ổ không, dung lượng hiển thị đúng không.
  • Đọc SMART nếu còn truy cập được. Theo phân tích của Backblaze trên khoảng 40.000 ổ cứng vận hành thực tế, 4 chỉ số đáng lo nhất là ID 5 Reallocated Sector Count, ID 197 Current Pending Sector Count (chỉ báo mạnh nhất cho nguy cơ hỏng sắp xảy ra), ID 198 Uncorrectable Sector Count, và ID 188 Command Timeout. Chỉ số nào trong nhóm này khác 0 và đang tăng là đèn vàng.
File:Samsung HS122JF hard drive SATA interface.jpg
Ảnh: JohnAlbertRigali (wikimedia) CC0

Ranh giới quyết định: tự làm được đến đâu thì phải dừng

Đi đúng thứ tự sau, đừng nhảy cóc:

  1. Có tiếng động lạ hoặc ổ không spin-up → bỏ qua mọi phần mềm, đi thẳng lab chuyên nghiệp. Mỗi lần cấp điện thêm là đầu từ cào thêm vào mặt đĩa.
  2. Ổ vẫn nhận diện, không tiếng lạ, nhưng SMART có sector lỗi tăng → nguy cơ cao. Nên image ổ bằng ddrescue (phần dưới) trước khi thử recovery, và cân nhắc dịch vụ semi-pro thay vì tự mày mò kéo dài thời gian ổ chạy.
  3. Lỗi thuần logic — xoá nhầm, format nhầm, filesystem lỗi, RAID metadata hỏng nhưng phần cứng khoẻ — thử phần mềm DIY trước, hoàn toàn hợp lý.
  4. RAID/NAS mất từ 2 ổ trở lên trên cấu hình chỉ chịu 1 ổ lỗi (RAID5, SHR 1 ổ dự phòng, RAIDZ1) → không tự rebuild, cần dịch vụ RAID reconstruction chuyên biệt.

Kiểm tra trạng thái RAID đúng cách trên từng nền tảng

Việc đầu tiên là xem hệ thống còn bao nhiêu "margin" trước khi quyết có được rebuild hay không:

  • Synology DSM: Storage Manager hiển thị pool "Degraded" (còn margin) hoặc "Crashed" (hết margin). Mất hơn 1 ổ trên SHR/RAID5 — không bấm Repair, không thêm ổ mới, không re-initialize.
  • QNAP QTS: Storage & Snapshots báo disk lỗi; QNAP còn cảnh báo riêng "disk unsuitable for rebuilding" khi ổ thay thế không đạt điều kiện. Nguyên tắc như trên: vượt số ổ redundancy cho phép thì không rebuild.
  • UGREEN NASync (UGOS/UGOS Pro): Storage Manager chạy trên nền RAID/mdadm tương tự DSM và QTS, cùng nguyên tắc: dừng, chụp lại màn hình tình trạng, không format hay rebuild vội.
  • TrueNAS/ZFS: chạy zpool status — DEGRADED nghĩa là còn margin, FAULTED là hết margin. Với RAIDZ1, mất ổ thứ hai là hết margin — tuyệt đối không chạy zpool import -f trước khi image từng ổ thành viên riêng. RAIDZ2/RAIDZ3 có biên an toàn cao hơn hẳn.
  • Unraid: kiến trúc không striping ở cấp block, nên các ổ chưa lỗi vẫn mount và đọc độc lập được ngay cả khi array ở trạng thái "failed/stopped". Khác biệt kiến trúc đáng nêu trung lập — không phải Unraid "tốt hơn RAID" tuyệt đối, chỉ là cách nó hỏng khác đi.

Tầng 1: tự cứu bằng phần mềm miễn phí

Tầng này dành cho lỗi logic thuần túy — ổ khỏe, SMART sạch, chỉ là xoá nhầm thư mục hoặc mất điện giữa lúc ghi file (case rất phổ biến với NAS gia đình 1-2 khay). Hai công cụ đáng tin cậy và miễn phí:

  • TestDisk & PhotoRec (cgsecurity.org) — mã nguồn mở, chạy được Windows/Linux/Mac, khôi phục bảng phân vùng và unerase file đã xoá.
  • ReclaiMe Free RAID Recovery — tự nhận diện tham số RAID (thứ tự ổ, kích thước stripe) khi metadata bị hỏng nhưng dữ liệu còn nguyên.

Ổ có bất kỳ dấu hiệu nghi ngờ nào (SMART tăng dần dù chưa tới mức báo động) thì đừng chạy phần mềm trực tiếp trên ổ gốc. Tạo bản image trước bằng ddrescue — chạy trên Linux live USB — rồi thử-sai trên bản image, để yên ổ gốc:

ddrescue -d -r3 /dev/sdX /path/to/image.img /path/to/logfile.log

Cách này tách hẳn việc "thử phần mềm nào" khỏi nguy cơ ghi đè ổ gốc — sai một phần mềm thì xoá image làm lại, không phải trả giá bằng dữ liệu thật.

Apple Lisa Teardown
Ảnh: eevblog (flickr) CC BY

Tầng 2 và 3: khi nào phải trả tiền, và trả bao nhiêu

Ba tầng chi phí, tóm gọn để không trả tiền oan mà cũng không cố gồng tự làm khi đã quá tay:

Mức 500k-2 triệu VND theo bảng giá phổ biến tại các đơn vị trong nước (như cuudulieuhcm.com, D2K) áp dụng cho lỗi logic/phần mềm. Lưu ý: ổ đã bị một đơn vị khác "mó tay" vào mâm đĩa trước khi đến bạn thì phí thường cộng thêm 20-30% — rủi ro và công sức xử lý tăng lên.

Với ca hư cơ phải mở phòng sạch (thay đầu từ, PCB, ghép mâm đĩa), giá quốc tế (Ontrack, SalvageData) thường tính theo cấu trúc:

Tại Việt Nam, ca "mở phòng sạch" quy đổi tương đương khoảng 5-50 triệu VND tuỳ số ổ và mức hư hỏng — con số chỉ mang tính tham khảo, cần chốt trực tiếp với đơn vị nhận ca cụ thể.

Một điểm dễ vướng: phần mềm recovery trả phí chuyên cho RAID/NAS như DiskInternals RAID Recovery, UFS Explorer RAID Recovery, hay R-Studio (cho phép dựng RAID thủ công từ các ổ thành viên) có license quốc tế 70-200 USD — cao hơn hẳn khung "vài chục nghìn đồng" mà nhiều người tưởng tượng khi nghe hai chữ "phần mềm". Ca của bạn phức tạp tới mức cần công cụ này thì so sánh giá license với giá thuê dịch vụ semi-pro trước khi quyết tự làm.

Hai case điển hình rơi vào tầng trả phí: NAS SOHO 4 khay chạy RAID5/SHR rớt 1 ổ, cắm ổ mới để rebuild thì rớt tiếp ổ thứ hai (double disk failure) — hết margin parity, đây là lúc dừng lại tìm dịch vụ RAID reconstruction, không tự rebuild tiếp. Hoặc ổ bị giật điện, rơi va đập, phát tiếng click-click khi cấp nguồn — hư phần cơ, phần mềm recovery bó tay hoàn toàn, chỉ lab phòng sạch xử lý được.

Tiêu chíTầng 1: Tự làmTầng 2: Dịch vụTầng 3: Lab phòng sạch
Chi phíMiễn phí300k - 2 triệuChục triệu+
Khi nào dùngỔ nhận diện tốt, lỗi filesystemRAID lỗi, chưa hư cơ khíHư cơ khí, ổ không spin-up
Rủi ro tự làmThấp nếu đúng bướcTrung bìnhKhông tự làm được
Thời gianVài giờ1-3 ngàyVài ngày - vài tuần

5 sai lầm biến ca "còn cứu được" thành mất vĩnh viễn

  1. Rebuild ngay khi thấy "Degraded" mà chưa sao lưu dữ liệu hiện có. Rebuild lỗi hoặc rớt thêm ổ sẽ ghi đè parity, mất luôn phần còn cứu được.
  2. Chạy phần mềm recovery hoặc chkdsk trên ổ đang có tiếng động lạ. Mỗi lần motor quay thêm là đầu từ cào thêm vào mặt đĩa.
  3. Tin mẹo "để ổ cứng vào tủ lạnh/tủ đông". Đây không phải kỹ thuật cứu dữ liệu, đây là cách gây ngưng tụ hơi nước lên mặt đĩa và biến một ổ hỏng nhẹ thành hỏng nặng. Giới chuyên môn (Rossmann Group và nhiều lab khác) đã bác bỏ myth này nhiều lần — đừng tin mấy video "mẹo dân gian" trên mạng xã hội.
  4. Tự tháo vỏ ổ cứng ngoài phòng sạch để "xem bên trong" khi ổ không nhận. Vài hạt bụi lọt vào là mặt đĩa xước, lab chuyên nghiệp sau đó cũng bó tay.
  5. Chạy recovery trực tiếp trên ổ gốc thay vì trên bản image ddrescue. Cách nhanh nhất để tự ghi đè lên chính vùng dữ liệu mình đang cố khôi phục.

Gửi ổ cho dịch vụ ngoài: hỏi rõ trước khi giao

Gửi ổ đi nghĩa là dữ liệu nhạy cảm — ảnh gia đình, hợp đồng, backup công ty — đi qua tay người khác. Hỏi rõ chính sách bảo mật và cam kết xoá dữ liệu/hình ảnh sau khi hoàn tất trước khi ký gửi.

Vài lưu ý khi đóng gói và gửi: giữ nguyên thứ tự khay ổ trong RAID (chụp ảnh lại trước khi tháo), đóng gói ổ bằng túi chống tĩnh điện, và hỏi rõ giá theo từng mức độ hư hỏng — tránh cảnh báo giá thấp ban đầu rồi phát sinh thêm khi ổ đã tháo ra rồi mới nói.

Ổ đã mã hoá — DSM volume encryption, BitLocker, ZFS native encryption — chuẩn bị sẵn khoá hoặc recovery key trước khi gửi đi hoặc chạy phần mềm. Lab có thể cứu từng sector vật lý hoàn hảo, nhưng không có khoá thì dữ liệu vẫn chỉ là một đống byte vô nghĩa. Tránh luôn các phần mềm recovery không rõ nguồn gốc quảng cáo "bẻ khoá" — loại công cụ này cần quyền truy cập raw disk/admin, rất dễ đi kèm malware.

Sau khi lấy lại dữ liệu: thay ổ đúng tải, đừng để lặp lại bài này

Cứu xong dữ liệu chỉ là xử lý hậu quả. Ổ cũ đã báo lỗi thì nên thay, và thay đúng theo tải chứ không phải theo "ổ nào đang bán chạy nhất". WD Red Plus, Toshiba N300 hay Seagate IronWolf là lựa chọn chuẩn cho NAS gia đình/SOHO 1-4 khay tải nhẹ. NAS nhiều khay hơn, chạy 24/7 hoặc rebuild thường xuyên thì nâng lên dòng Pro là hợp lý — workload rating và RPM cao hơn giúp rebuild ổn định hơn:

Nhu cầuModel gợi ýRPMWorkloadBảo hành
NAS 1-4 khay, tải nhẹWD Red Plus~5.640180 TB/năm3 năm
NAS 1-4 khay, tải nhẹToshiba N3007.200 (CMR)180 TB/năm3 năm
NAS 1-4 khay, dung lượng lớnSeagate IronWolf5.400-7.200180 TB/năm3 năm
NAS 8-24 khay, tải nặng 24/7WD Red Pro7.200550 TB/năm5 năm
NAS nhiều khay, doanh nghiệp nhỏSeagate IronWolf Pro7.200300 TB/năm5 năm + Rescue 2-3 năm
NAS nhiều khay, doanh nghiệp nhỏToshiba N300 Pro7.200300-550 TB/năm5 năm

Về CMR/SMR: chọn theo tải chứ không theo "loại nào tốt hơn tuyệt đối". Cùng một dòng sản phẩm đôi khi có model CMR và model SMR khác nhau tuỳ dung lượng, nên tra kỹ mã model trên datasheet trước khi mua ổ thay cho NAS — không riêng hãng nào. Ổ SMR đời cũ, đặc biệt ổ desktop SMR lắp nhầm vào NAS, có thể khiến rebuild kéo dài hơn hẳn so với ổ CMR cùng dung lượng — đáng kiểm tra trước khi mua, không phải lý do loại bỏ cả một dòng sản phẩm.

Và việc quan trọng nhất, nói ra thì nhàm nhưng vẫn phải nói: thiết lập backup định kỳ. rsync, Hyper Backup, HBS3, hay ZFS send/receive tuỳ nền tảng bạn đang dùng. Ổ cứng nào rồi cũng có ngày báo lỗi — sự khác biệt giữa "chuyện nhỏ, restore từ backup trong 10 phút" và "phải đọc hết bài này lúc 2 giờ sáng" chỉ nằm ở việc bạn có bản backup từ trước hay không.

Mua NAS chính hãng

Xem tất cả →

Thiết bị NAS Synology & ổ cứng chính hãng Nhật Bản — tư vấn cấu hình, lắp đặt và bảo hành. Mua qua Shopee, giao toàn quốc.

No comments yet