RAID 5 báo Degraded, ổ cứng đèn đỏ, và câu hỏi đầu tiên của hầu hết quản trị viên là: “Thay ổ mới rồi rebuild luôn được không?”. Câu trả lời là được, nếu rebuild đúng cách và đúng thời điểm. Nhưng tại phòng lab BK Recover, rất nhiều ca mất dữ liệu RAID không bắt đầu từ lúc ổ hỏng, mà bắt đầu từ một lần bấm rebuild sai.
Trả lời nhanh: Rebuild đúng (chỉ tính lại dữ liệu và ghi lên ổ mới thay thế) không làm mất dữ liệu. Rebuild sai thì có thể làm hỏng dữ liệu vĩnh viễn: bấm nhầm Initialize/Create, rebuild khi các ổ còn lại đã yếu, rebuild từ một ổ chứa dữ liệu cũ, hoặc tạo lại RAID với cấu hình khác. Nếu dữ liệu quan trọng và chưa có bản sao lưu, hãy sao lưu hoặc nhờ chuyên gia kiểm tra trước khi rebuild.
Nội dung chính
RAID 5 lưu dữ liệu như thế nào?
RAID 5 chia dữ liệu thành từng khối và rải đều lên các ổ. Trên mỗi “hàng”, một ổ giữ khối chẵn lẻ (parity), được tính từ các khối dữ liệu còn lại bằng phép XOR. Nhờ vậy, khi một ổ hỏng, hệ thống vẫn tính ra được phần dữ liệu bị thiếu.
| Hàng | Ổ 1 | Ổ 2 | Ổ 3 |
|---|---|---|---|
| 1 | Dữ liệu A1 | Dữ liệu A2 | Parity A |
| 2 | Dữ liệu B1 | Parity B | Dữ liệu B2 |
| 3 | Parity C | Dữ liệu C1 | Dữ liệu C2 |
Ví dụ RAID 5 gồm 3 ổ: mỗi hàng có 2 khối dữ liệu và 1 khối parity, vị trí parity xoay vòng qua các ổ.
RAID 5 “Degraded” nghĩa là gì?
Degraded nghĩa là RAID đã mất một ổ nhưng vẫn chạy: phần dữ liệu của ổ thiếu được tính tạm từ các ổ còn lại mỗi khi đọc. Lúc này hệ thống không còn dự phòng: chỉ cần thêm một ổ nữa gặp sự cố, RAID sẽ ngừng hoạt động.


Điều nguy hiểm là trạng thái Degraded có thể kéo dài rất lâu mà không ai để ý. Trong ca đầu ghi camera Hikvision 12 ổ mà BK Recover xử lý, nhật ký cho thấy RAID đã Degraded từ tháng 8/2025, tự rebuild khi một ổ “quay lại” vào tháng 1/2026, rồi lại Degraded vào tháng 3/2026 trước khi ngừng hẳn.
Rebuild đúng là gì?
Rebuild đúng là: thay ổ hỏng bằng ổ mới, controller tính lại toàn bộ dữ liệu của ổ hỏng từ các ổ còn lại và chỉ ghi lên ổ mới. Các ổ còn lại chỉ bị đọc, không bị ghi đè. Khi rebuild xong, RAID trở lại trạng thái có dự phòng.
Rebuild đúng vẫn có rủi ro: trong suốt quá trình rebuild, toàn bộ các ổ còn lại bị đọc liên tục, có khi nhiều giờ đến nhiều ngày với ổ dung lượng lớn. Nếu một ổ trong số đó đã yếu, đây chính là lúc nó dễ hỏng nhất.
4 kiểu rebuild sai khiến dữ liệu hỏng vĩnh viễn
1. Bấm “Initialize” hoặc “Create” thay vì “Rebuild”
Đây là lỗi nghiêm trọng và phổ biến nhất. Các công cụ quản lý RAID dùng nhiều thuật ngữ dễ nhầm: Add, Create, Assemble, Initialize, Rebuild, Restore. Khi người dùng chọn Initialize (khởi tạo) thay vì Rebuild, controller không tính lại dữ liệu cho ổ mới. Thay vào đó, nó tính lại parity trên các ổ cũ dựa trên ổ mới còn trống, và ghi đè lên dữ liệu gốc.
Hậu quả: dữ liệu bị sai rải rác trên toàn bộ RAID. Với RAID 5 gồm 3 ổ, cứ 3 khối thì khoảng 1 khối bị sai. Vì mỗi khối thường chỉ vài chục KB, gần như mọi file có kích thước vừa và lớn đều bị hỏng. RAID càng ít ổ thì tỷ lệ khối bị sai càng cao.
Với RAID 1 (mirror), lỗi tương tự còn tệ hơn: Initialize có thể sao chép từ ổ mới trống sang ổ còn tốt, xóa sạch bản dữ liệu duy nhất còn lại.
Điểm mấu chốt: sau khi lỡ Initialize, cơ hội khôi phục gần như chỉ còn nằm ở ổ bị hỏng ban đầu. Nếu ổ đó còn đọc được dữ liệu (kể cả phải sửa trong phòng lab), chuyên gia có thể dựng lại RAID. Nếu ổ đó đã bị vứt đi, gần như không thể khôi phục nguyên vẹn. Vì vậy, đừng bao giờ vứt ổ RAID bị hỏng.
2. Rebuild khi các ổ còn lại đã yếu
Các ổ trong cùng một RAID thường cùng lô, cùng tuổi, cùng chịu tải. Khi một ổ hỏng, các ổ còn lại cũng có thể đã có bad sector. Quá trình rebuild đọc toàn bộ bề mặt các ổ này, và có thể khiến ổ thứ hai hỏng ngay giữa chừng.
Đó chính là điều xảy ra trong ca SAN Dell RAID 5 chứa máy ảo VMware: ổ số 2 hỏng trước, và ổ số 8 hỏng tiếp ngay trong lúc rebuild. Khi kiểm tra, tất cả các ổ đều đã có nhiều bad sector, kể cả những ổ hệ thống vẫn báo “tốt”.

3. Rebuild từ một ổ chứa dữ liệu cũ
Một ổ rời khỏi RAID (do lỏng cáp, lỗi tạm thời…), sau một thời gian lại được nhận trở lại và controller tự rebuild. Nếu ổ này mang dữ liệu cũ mà lại được coi là “đúng”, dữ liệu mới hơn có thể bị ghi đè. Muốn xử lý đúng, phải biết chính xác ổ nào rời RAID vào lúc nào, thông qua nhật ký của hệ thống.
4. Tạo lại RAID với cấu hình khác để “thử”
Khi RAID mất cấu hình, nhiều người tạo lại RAID mới với thứ tự ổ, kích thước khối hoặc kiểu RAID khác để “xem có lên không”. Mỗi lần thử sai có thể ghi đè thông tin cấu hình và một phần dữ liệu, làm việc khôi phục sau này khó hơn rất nhiều.
Bảng xử lý nhanh theo tình huống
| Tình huống | Nên làm |
|---|---|
| Degraded, lỗi 1 ổ, dữ liệu đã có bản sao lưu đầy đủ | Có thể thay ổ và rebuild theo đúng hướng dẫn của hãng |
| Degraded, lỗi 1 ổ, chưa có bản sao lưu | Sao lưu dữ liệu quan trọng ra nơi khác trước, kiểm tra tình trạng các ổ còn lại, rồi mới rebuild |
| Lỗi từ 2 ổ trở lên, hoặc RAID không còn nhận | Tắt hệ thống, không rebuild, không tạo lại RAID, liên hệ chuyên gia |
| Rebuild bị dừng giữa chừng / ổ khác hỏng khi đang rebuild | Dừng mọi thao tác, giữ nguyên tất cả các ổ |
| Đã lỡ bấm Initialize / Create | Dừng ngay, không ghi thêm dữ liệu, giữ lại ổ hỏng ban đầu |
Checklist 6 bước trước khi bấm Rebuild
- Sao lưu dữ liệu quan trọng ra nơi khác nếu RAID vẫn còn truy cập được.
- Kiểm tra SMART và tình trạng bad sector của các ổ còn lại.
- Đánh số thứ tự các ổ theo vị trí khay và chụp ảnh lại.
- Chụp màn hình cấu hình RAID: kiểu RAID, kích thước khối (stripe), thứ tự ổ.
- Đọc kỹ tên lệnh: Rebuild ≠ Initialize ≠ Create. Không chắc thì dừng lại.
- Giữ lại ổ hỏng, không vứt, không đem đi bảo hành ngay.
Phòng lab xử lý RAID hỏng như thế nào?
Tại BK Recover, nguyên tắc đầu tiên với mọi hệ thống RAID là không thao tác trên ổ gốc:
- Tạo bản sao (image) từng ổ bằng thiết bị chuyên dụng PC-3000. Ổ hỏng vật lý được sửa trong phòng sạch trước khi đọc.
- Không dùng controller gốc để rebuild, vì controller có thể tự đề nghị rebuild hoặc ghi đè.
- Đọc nhật ký hệ thống để xác định thứ tự các ổ lỗi và ổ nào mang dữ liệu mới nhất.
- Dựng lại RAID bằng phần mềm giả lập, tính đúng thứ tự ổ và tham số, rồi trích xuất dữ liệu ra ổ lưu trữ riêng.
Xem thêm các ca thực tế: khôi phục máy chủ RAID 5 SSD khẩn cấp, SAN Dell RAID 5 lỗi 2 ổ, đầu ghi camera RAID 5 12 ổ 10TB.
Câu hỏi thường gặp
Rebuild RAID 5 mất bao lâu?
Tùy dung lượng ổ, số lượng ổ, tốc độ controller và tải hệ thống trong lúc rebuild. Với các ổ dung lượng lớn, rebuild có thể kéo dài từ nhiều giờ đến vài ngày. Đây cũng là khoảng thời gian rủi ro cao nhất cho các ổ còn lại.
RAID 5 lỗi 2 ổ còn cứu được dữ liệu không?
Có những trường hợp cứu được, khi các ổ lỗi còn đọc được dữ liệu thô sau khi xử lý phần cứng và hệ thống chưa bị khởi tạo lại. Khả năng thực tế chỉ đánh giá được sau khi kỹ thuật viên kiểm tra từng ổ. Hãy tắt hệ thống và giữ nguyên hiện trạng.
Có RAID 5 rồi thì có cần sao lưu nữa không?
Có. RAID giúp hệ thống chạy tiếp khi một ổ hỏng, nhưng RAID không phải là bản sao lưu: xóa nhầm, virus mã hóa, lỗi controller hay thao tác sai đều ảnh hưởng tới toàn bộ RAID. Hãy duy trì bản sao lưu riêng và thử khôi phục định kỳ.
RAID của bạn đang báo lỗi?
BK Recover miễn phí kiểm tra, không đặt cọc và chỉ thu phí sau khi bạn đã kiểm tra đúng, đủ dữ liệu. Có báo cáo kỹ thuật bằng văn bản, hợp đồng dịch vụ, NDA và hóa đơn VAT.
- Hotline: 1900 636 196 · Zalo: 0817 579 555
- Cơ sở chính: 29 ngõ 40 Tạ Quang Bửu, Hà Nội
- Cơ sở 2: 87 Trần Thái Tông, Cầu Giấy, Hà Nội
Xem thêm: Dịch vụ cứu dữ liệu RAID · Giải pháp backup dữ liệu server · Những điều nên và không nên làm khi RAID bị lỗi
Nguồn tham khảo kỹ thuật: ACE Lab – Proper and Improper Rebuild for RAID-5, Proper and Improper Rebuild for RAID-1 (Mirror).

