All posts
Google Cloud Sensitive Data Protection
clouddlp

Google Cloud Sensitive Data Protection

Dung Tran H.'s avatarDung Tran H.
Table of Contents16 sections

Mỗi ngày, doanh nghiệp tạo ra hàng triệu bản ghi dữ liệu mới. Dữ liệu này có thể là thông tin khách hàng, hồ sơ nhân sự, giao dịch thanh toán, nhật ký hệ thống hay dữ liệu phục vụ các mô hình AI.

Giá trị của dữ liệu càng lớn thì rủi ro khi dữ liệu bị rò rỉ hoặc sử dụng sai mục đích cũng càng cao. Vì vậy, câu hỏi không còn là làm thế nào để lưu trữ dữ liệu, mà là làm thế nào để nhận biết, phân loại và bảo vệ những dữ liệu thực sự nhạy cảm.

Đây là một trong những bài toán quan trọng của Data Security hiện đại và cũng là lý do các giải pháp Data Loss Prevention (DLP) ngày càng đóng vai trò quan trọng trong kiến trúc bảo mật của doanh nghiệp.

Đây chính là khoảng trống mà Google Cloud Sensitive Data Protection được thiết kế để giải quyết.

"You can't protect what you don't know you have."


Bối cảnh

Trong nhiều năm, chiến lược bảo mật của doanh nghiệp chủ yếu tập trung vào việc bảo vệ hạ tầng (Infrastructure-centric Security):

  • Firewall

  • Network Segmentation

  • VPN

  • IAM

  • Encryption

  • WAF

Các giải pháp này kiểm soát đường đi của dữ liệuquyền truy cập, nhưng không trả lời được những câu hỏi quan trọng như:

  • Dữ liệu nhạy cảm đang nằm ở đâu?

  • Có bao nhiêu file đang chứa thông tin khách hàng?

  • BigQuery dataset nào đang lưu số thẻ tín dụng?

  • Có bucket nào đang chứa dữ liệu cá nhân nhưng bị chia sẻ sai quyền?

  • Bộ dữ liệu nào có thể được sử dụng cho AI mà không vi phạm quy định về quyền riêng tư?

Trong các hệ thống hiện đại, dữ liệu không còn tập trung trong một cơ sở dữ liệu duy nhất. Chúng phân tán ở rất nhiều nơi:

  • Cloud Storage

  • BigQuery

  • Cloud SQL

  • Data Lake

  • Log

  • Backup

  • Data Pipeline

  • AI Dataset

Khối lượng dữ liệu càng lớn thì việc kiểm kê thủ công gần như không còn khả thi.

Doanh nghiệp có thể đã mã hóa toàn bộ dữ liệu, nhưng nếu không biết dữ liệu nào là dữ liệu nhạy cảm, việc xây dựng chính sách bảo vệ phù hợp sẽ trở nên rất khó khăn.


Từ Infrastructure-Centric Security đến Data-Centric Security

Thay vì chỉ tập trung vào việc bảo vệ hạ tầng, nhiều doanh nghiệp bắt đầu dành nhiều sự quan tâm hơn đến việc bảo vệ chính dữ liệu.

Nói cách khác, thay vì chỉ bảo vệ máy chủ hoặc mạng, doanh nghiệp cần hiểu rõ:

  • Dữ liệu nào đang được lưu trữ

  • Mức độ nhạy cảm của từng loại dữ liệu

  • Dữ liệu đang được sử dụng bởi ai

  • Dữ liệu có đang bị chia sẻ sai phạm vi hay không

Đây được gọi là Data-Centric Security. Trong mô hình này, dữ liệu trở thành đối tượng trung tâm của chiến lược bảo mật.


Google Cloud Sensitive Data Protection là gì?

Google Cloud Sensitive Data Protection (trước đây là Cloud Data Loss Prevention - Cloud DLP) là dịch vụ giúp doanh nghiệp:

  • Khám phá dữ liệu nhạy cảm (Discover)

  • Phân loại dữ liệu (Classify)

  • Bảo vệ dữ liệu (Protect)

  • Hỗ trợ tuân thủ các tiêu chuẩn bảo mật (Compliance)

Thay vì yêu cầu người dùng tự viết hàng trăm biểu thức Regex để tìm kiếm dữ liệu, Google cung cấp sẵn hàng trăm InfoType cùng các mô hình Machine Learning để nhận diện nhiều loại dữ liệu phổ biến.

Ví dụ:

  • Email

  • Phone Number

  • Credit Card

  • Passport

  • IP Address

  • JWT

  • API Key

  • Medical Record

  • Personal Name

  • Address

Ngoài các InfoType dựng sẵn, doanh nghiệp cũng có thể định nghĩa các Custom InfoType để nhận diện dữ liệu đặc thù của riêng mình.


DLP hoạt động như thế nào?

Thông thường, Sensitive Data Protection hoạt động theo bốn bước.

1. Inspect

Đây là bước đầu tiên và cũng là bước quan trọng nhất. DLP sẽ quét dữ liệu để xác định xem dữ liệu có chứa thông tin nhạy cảm hay không.

Ví dụ:

Customer Name : John Doe
Email         : john@example.com
Credit Card   : 4111 1111 1111 1111

Sau khi quét, DLP có thể phát hiện:

Dữ liệu

InfoType

John Doe

PERSON_NAME

john@example.com

EMAIL_ADDRESS

4111 1111 1111 1111

CREDIT_CARD_NUMBER

Việc phát hiện không chỉ dựa trên Regex mà còn kết hợp nhiều kỹ thuật như Machine Learning, Context Analysis và Pattern Matching nhằm giảm tỷ lệ false positive.

2. Classify

Sau khi phát hiện dữ liệu nhạy cảm, DLP sẽ tiến hành phân loại.

Ví dụ:

Data Type

Sensitivity

Email

Medium

Phone Number

Medium

Credit Card

High

Passport

High

Ngoài loại dữ liệu, DLP còn cung cấp Likelihood Score để đánh giá độ tin cậy của kết quả phát hiện. Điều này giúp giảm đáng kể các trường hợp nhận diện sai.

3. De-identify

Sau khi phát hiện dữ liệu nhạy cảm, bước tiếp theo là de-identify dữ liệu trước khi chia sẻ hoặc sử dụng cho các mục đích như phân tích, kiểm thử hay huấn luyện mô hình AI.

Mục tiêu của quá trình này là giảm hoặc loại bỏ khả năng nhận diện danh tính của cá nhân, đồng thời vẫn giữ được giá trị sử dụng của dữ liệu.

Sensitive Data Protection hỗ trợ nhiều kỹ thuật de-identification khác nhau, phù hợp với từng nhu cầu sử dụng dữ liệu:

4. Monitor

DLP không chỉ quét dữ liệu một lần. Doanh nghiệp có thể:

  • Scan định kỳ

  • Scan theo lịch

  • Scan khi dữ liệu mới được tạo

  • Tích hợp vào Data Pipeline

  • Tích hợp vào CI/CD

  • Kết hợp với Event-driven Architecture

Điều này giúp việc bảo vệ dữ liệu diễn ra liên tục thay vì chỉ kiểm tra thủ công.


Vai trò của DLP trong Google Cloud Security

Một điểm thường gây hiểu nhầm là DLP không thay thế IAM hoặc Encryption. Thay vào đó, DLP bổ sung một lớp bảo mật tập trung vào dữ liệu. Có thể hình dung như sau:

Thành phần

Vai trò

IAM

Kiểm soát ai được truy cập

VPC Firewall

Kiểm soát lưu lượng mạng

Cloud KMS

Mã hóa dữ liệu

Cloud Armor

Bảo vệ ứng dụng

Security Command Center

Phát hiện rủi ro bảo mật

Sensitive Data Protection

Phát hiện và bảo vệ dữ liệu nhạy cảm

Mỗi dịch vụ giải quyết một khía cạnh khác nhau trong chiến lược bảo mật tổng thể.


Những trường hợp sử dụng phổ biến

Sensitive Data Protection đặc biệt hữu ích trong các tình huống như:

Kiểm kê dữ liệu trước khi di chuyển lên Cloud

Doanh nghiệp cần biết hệ thống hiện tại đang chứa những loại dữ liệu nào trước khi thực hiện migration.

Phát hiện dữ liệu nhạy cảm trong Data Lake

Các Data Lake thường chứa dữ liệu từ nhiều nguồn khác nhau. DLP giúp xác định khu vực nào đang lưu thông tin cá nhân hoặc dữ liệu tài chính.

Làm sạch dữ liệu trước khi chia sẻ

Trước khi cung cấp dữ liệu cho đối tác hoặc đội phát triển, DLP có thể tự động loại bỏ hoặc che giấu các trường nhạy cảm.

Chuẩn bị dữ liệu cho AI

Khi xây dựng mô hình AI hoặc Generative AI, việc loại bỏ PII là yêu cầu gần như bắt buộc để tránh rò rỉ thông tin khách hàng.

Đáp ứng Compliance

DLP hỗ trợ doanh nghiệp đáp ứng nhiều tiêu chuẩn như GDPR, PCI DSS, HIPAA, ISO 27001 thông qua việc phát hiện và xử lý dữ liệu nhạy cảm một cách tự động.


Kết luận

Trong kỷ nguyên Cloud và AI, dữ liệu không chỉ là tài sản quan trọng mà còn là mục tiêu hàng đầu của các cuộc tấn công mạng. Vì vậy, bảo vệ hạ tầng thôi là chưa đủ; doanh nghiệp cần biết dữ liệu nào đang tồn tại, nằm ở đâu và mức độ nhạy cảm của chúng ra sao.

Google Cloud Sensitive Data Protection mang đến cách tiếp cận Data-Centric Security, giúp tự động phát hiện, phân loại và bảo vệ dữ liệu nhạy cảm trên nhiều dịch vụ của Google Cloud. Khi kết hợp với IAM, Cloud KMS, Security Command Center và các dịch vụ bảo mật khác, DLP trở thành một thành phần quan trọng trong chiến lược bảo vệ dữ liệu hiện đại.