Table of Contents16 sections
Mỗi ngày, doanh nghiệp tạo ra hàng triệu bản ghi dữ liệu mới. Dữ liệu này có thể là thông tin khách hàng, hồ sơ nhân sự, giao dịch thanh toán, nhật ký hệ thống hay dữ liệu phục vụ các mô hình AI.
Giá trị của dữ liệu càng lớn thì rủi ro khi dữ liệu bị rò rỉ hoặc sử dụng sai mục đích cũng càng cao. Vì vậy, câu hỏi không còn là làm thế nào để lưu trữ dữ liệu, mà là làm thế nào để nhận biết, phân loại và bảo vệ những dữ liệu thực sự nhạy cảm.
Đây là một trong những bài toán quan trọng của Data Security hiện đại và cũng là lý do các giải pháp Data Loss Prevention (DLP) ngày càng đóng vai trò quan trọng trong kiến trúc bảo mật của doanh nghiệp.
Đây chính là khoảng trống mà Google Cloud Sensitive Data Protection được thiết kế để giải quyết.
"You can't protect what you don't know you have."
Bối cảnh
Trong nhiều năm, chiến lược bảo mật của doanh nghiệp chủ yếu tập trung vào việc bảo vệ hạ tầng (Infrastructure-centric Security):
Firewall
Network Segmentation
VPN
IAM
Encryption
WAF
Các giải pháp này kiểm soát đường đi của dữ liệu và quyền truy cập, nhưng không trả lời được những câu hỏi quan trọng như:
Dữ liệu nhạy cảm đang nằm ở đâu?
Có bao nhiêu file đang chứa thông tin khách hàng?
BigQuery dataset nào đang lưu số thẻ tín dụng?
Có bucket nào đang chứa dữ liệu cá nhân nhưng bị chia sẻ sai quyền?
Bộ dữ liệu nào có thể được sử dụng cho AI mà không vi phạm quy định về quyền riêng tư?
Trong các hệ thống hiện đại, dữ liệu không còn tập trung trong một cơ sở dữ liệu duy nhất. Chúng phân tán ở rất nhiều nơi:
Cloud Storage
BigQuery
Cloud SQL
Data Lake
Log
Backup
Data Pipeline
AI Dataset
Khối lượng dữ liệu càng lớn thì việc kiểm kê thủ công gần như không còn khả thi.
Doanh nghiệp có thể đã mã hóa toàn bộ dữ liệu, nhưng nếu không biết dữ liệu nào là dữ liệu nhạy cảm, việc xây dựng chính sách bảo vệ phù hợp sẽ trở nên rất khó khăn.
Từ Infrastructure-Centric Security đến Data-Centric Security

Thay vì chỉ tập trung vào việc bảo vệ hạ tầng, nhiều doanh nghiệp bắt đầu dành nhiều sự quan tâm hơn đến việc bảo vệ chính dữ liệu.
Nói cách khác, thay vì chỉ bảo vệ máy chủ hoặc mạng, doanh nghiệp cần hiểu rõ:
Dữ liệu nào đang được lưu trữ
Mức độ nhạy cảm của từng loại dữ liệu
Dữ liệu đang được sử dụng bởi ai
Dữ liệu có đang bị chia sẻ sai phạm vi hay không
Đây được gọi là Data-Centric Security. Trong mô hình này, dữ liệu trở thành đối tượng trung tâm của chiến lược bảo mật.

Google Cloud Sensitive Data Protection là gì?
Google Cloud Sensitive Data Protection (trước đây là Cloud Data Loss Prevention - Cloud DLP) là dịch vụ giúp doanh nghiệp:
Khám phá dữ liệu nhạy cảm (Discover)
Phân loại dữ liệu (Classify)
Bảo vệ dữ liệu (Protect)
Hỗ trợ tuân thủ các tiêu chuẩn bảo mật (Compliance)
Thay vì yêu cầu người dùng tự viết hàng trăm biểu thức Regex để tìm kiếm dữ liệu, Google cung cấp sẵn hàng trăm InfoType cùng các mô hình Machine Learning để nhận diện nhiều loại dữ liệu phổ biến.
Ví dụ:
Email
Phone Number
Credit Card
Passport
IP Address
JWT
API Key
Medical Record
Personal Name
Address
Ngoài các InfoType dựng sẵn, doanh nghiệp cũng có thể định nghĩa các Custom InfoType để nhận diện dữ liệu đặc thù của riêng mình.
DLP hoạt động như thế nào?

Thông thường, Sensitive Data Protection hoạt động theo bốn bước.
1. Inspect
Đây là bước đầu tiên và cũng là bước quan trọng nhất. DLP sẽ quét dữ liệu để xác định xem dữ liệu có chứa thông tin nhạy cảm hay không.
Ví dụ:
Customer Name : John Doe
Email : john@example.com
Credit Card : 4111 1111 1111 1111Sau khi quét, DLP có thể phát hiện:
Dữ liệu | InfoType |
|---|---|
John Doe | PERSON_NAME |
john@example.com | EMAIL_ADDRESS |
4111 1111 1111 1111 | CREDIT_CARD_NUMBER |
Việc phát hiện không chỉ dựa trên Regex mà còn kết hợp nhiều kỹ thuật như Machine Learning, Context Analysis và Pattern Matching nhằm giảm tỷ lệ false positive.
2. Classify
Sau khi phát hiện dữ liệu nhạy cảm, DLP sẽ tiến hành phân loại.
Ví dụ:
Data Type | Sensitivity |
|---|---|
Medium | |
Phone Number | Medium |
Credit Card | High |
Passport | High |
Ngoài loại dữ liệu, DLP còn cung cấp Likelihood Score để đánh giá độ tin cậy của kết quả phát hiện. Điều này giúp giảm đáng kể các trường hợp nhận diện sai.
3. De-identify
Sau khi phát hiện dữ liệu nhạy cảm, bước tiếp theo là de-identify dữ liệu trước khi chia sẻ hoặc sử dụng cho các mục đích như phân tích, kiểm thử hay huấn luyện mô hình AI.
Mục tiêu của quá trình này là giảm hoặc loại bỏ khả năng nhận diện danh tính của cá nhân, đồng thời vẫn giữ được giá trị sử dụng của dữ liệu.
Sensitive Data Protection hỗ trợ nhiều kỹ thuật de-identification khác nhau, phù hợp với từng nhu cầu sử dụng dữ liệu:
4. Monitor
DLP không chỉ quét dữ liệu một lần. Doanh nghiệp có thể:
Scan định kỳ
Scan theo lịch
Scan khi dữ liệu mới được tạo
Tích hợp vào Data Pipeline
Tích hợp vào CI/CD
Kết hợp với Event-driven Architecture
Điều này giúp việc bảo vệ dữ liệu diễn ra liên tục thay vì chỉ kiểm tra thủ công.
Vai trò của DLP trong Google Cloud Security

Một điểm thường gây hiểu nhầm là DLP không thay thế IAM hoặc Encryption. Thay vào đó, DLP bổ sung một lớp bảo mật tập trung vào dữ liệu. Có thể hình dung như sau:
Thành phần | Vai trò |
|---|---|
IAM | Kiểm soát ai được truy cập |
VPC Firewall | Kiểm soát lưu lượng mạng |
Cloud KMS | Mã hóa dữ liệu |
Cloud Armor | Bảo vệ ứng dụng |
Security Command Center | Phát hiện rủi ro bảo mật |
Sensitive Data Protection | Phát hiện và bảo vệ dữ liệu nhạy cảm |
Mỗi dịch vụ giải quyết một khía cạnh khác nhau trong chiến lược bảo mật tổng thể.
Những trường hợp sử dụng phổ biến
Sensitive Data Protection đặc biệt hữu ích trong các tình huống như:
Kiểm kê dữ liệu trước khi di chuyển lên Cloud
Doanh nghiệp cần biết hệ thống hiện tại đang chứa những loại dữ liệu nào trước khi thực hiện migration.
Phát hiện dữ liệu nhạy cảm trong Data Lake
Các Data Lake thường chứa dữ liệu từ nhiều nguồn khác nhau. DLP giúp xác định khu vực nào đang lưu thông tin cá nhân hoặc dữ liệu tài chính.
Làm sạch dữ liệu trước khi chia sẻ
Trước khi cung cấp dữ liệu cho đối tác hoặc đội phát triển, DLP có thể tự động loại bỏ hoặc che giấu các trường nhạy cảm.
Chuẩn bị dữ liệu cho AI
Khi xây dựng mô hình AI hoặc Generative AI, việc loại bỏ PII là yêu cầu gần như bắt buộc để tránh rò rỉ thông tin khách hàng.
Đáp ứng Compliance
DLP hỗ trợ doanh nghiệp đáp ứng nhiều tiêu chuẩn như GDPR, PCI DSS, HIPAA, ISO 27001 thông qua việc phát hiện và xử lý dữ liệu nhạy cảm một cách tự động.
Kết luận
Trong kỷ nguyên Cloud và AI, dữ liệu không chỉ là tài sản quan trọng mà còn là mục tiêu hàng đầu của các cuộc tấn công mạng. Vì vậy, bảo vệ hạ tầng thôi là chưa đủ; doanh nghiệp cần biết dữ liệu nào đang tồn tại, nằm ở đâu và mức độ nhạy cảm của chúng ra sao.
Google Cloud Sensitive Data Protection mang đến cách tiếp cận Data-Centric Security, giúp tự động phát hiện, phân loại và bảo vệ dữ liệu nhạy cảm trên nhiều dịch vụ của Google Cloud. Khi kết hợp với IAM, Cloud KMS, Security Command Center và các dịch vụ bảo mật khác, DLP trở thành một thành phần quan trọng trong chiến lược bảo vệ dữ liệu hiện đại.
