GEODI Discovery Series | Friday
Güncelleme tarihi: 3 gün önce
Issue 09
Hassas Veri Tespiti: Bir Anahtar Kelime Aramasından Çok Daha Fazlası
Executive Summary
Kurumsal ortamlarda hassas veri; dosya sunucuları, e-postalar, PDF'ler, Office belgeleri, taranmış dokümanlar, arşivler ve farklı veri kaynakları arasında dağınık halde bulunur.
Bu veriyi tespit etmek için yalnızca dosya isimlerine veya belirli kelimelere bakmak yeterli değildir.
Etkili bir hassas veri keşfi yaklaşımı; içerik çıkarımı, desen analizi, bağlam değerlendirmesi, metadata, OCR ve sınıflandırma mantığını birlikte kullanmalıdır.
Çünkü aynı sayı dizisi bir belgede müşteri numarası olabilirken, başka bir belgede kişisel veya finansal veri anlamına gelebilir.
Asıl farkı yaratan, yalnızca veriyi görmek değil; verinin ne anlama geldiğini anlayabilmektir.
Hassas Veri Neden Kolay Bulunamaz?
Bir kurumun veri ortamını düşünelim.
Aynı kişiye ait bilgi;
· CRM sisteminde bir kayıt,
· Excel dosyasında bir satır,
· e-posta ekinde bir PDF,
· imzalı sözleşmenin içinde bir alan,
· taranmış bir kimlik belgesinde görüntü,
· yıllar önce oluşturulmuş ZIP arşivinin içerisinde eski bir doküman
· olarak bulunabilir.
Bu nedenle hassas veri tespiti, yalnızca belirli bir veri kaynağını taramak değildir.
Temel problem data sprawl, yani verinin zaman içerisinde farklı sistemlere, kullanıcılara ve dosya türlerine yayılmasıdır.
Bir veri güvenliği programı yalnızca bilinen veri tabanlarını kontrol ediyorsa, kurumsal veri yüzeyinin önemli bir kısmı kapsam dışında kalabilir.
1. İçerik Çıkarımı: Önce Dosyanın İçine Girebilmek Gerekir
Hassas veri analizi başlamadan önce belgenin içeriğinin makine tarafından okunabilir hale getirilmesi gerekir.
Bu aşamada farklı dosya türlerinden;
· metin,
· tablo,
· metadata,
· belge özellikleri,
· gömülü içerikler
çıkarılır.
Taranmış belgelerde veya görüntü tabanlı PDF'lerde ise OCR devreye girer.
Bu nokta önemlidir.
Çünkü içerik extraction aşamasında okunamayan bir belge, sonraki tüm güvenlik analizleri açısından görünmez kalır.
Okunamayan içerik, sınıflandırılamaz.

2. Pattern Detection: Desenleri Yakalamak
Hassas veri tespitinin temel katmanlarından biri belirli veri yapılarını tanımaktır.
Örneğin;
· kimlik numarası yapıları,
· IBAN formatları,
· kredi kartı numarası dizilimleri,
· telefon numaraları,
· e-posta adresleri,
· belirli kurumsal kayıt numaraları
matematiksel veya karakter tabanlı desenler gösterebilir.
Bu tür yapılar pattern matching yöntemleriyle tespit edilebilir.
Ancak burada önemli bir problem vardır:
Deseni yakalamak, verinin gerçekten hassas olduğunu kanıtlamaz.
11 haneli her sayı kimlik numarası değildir.
16 haneli her sayı kredi kartı değildir.
Dolayısıyla tek başına regex veya pattern matching kullanmak yüksek miktarda false positive üretebilir.
3. Bağlam Analizi: Sayının Ne Olduğunu Anlamak
Gerçek hassas veri tespitinde ikinci katman bağlamdır.
Örneğin bir sayı dizisinin yakınında;
“T.C. Kimlik No”
ifadesi bulunuyorsa, sistemin güven seviyesi yükselir.
Benzer şekilde;
IBAN, hesap sahibi, banka, şube
gibi kavramların aynı içerikte birlikte bulunması verinin finansal nitelikte olduğuna dair daha güçlü bir sinyal oluşturur.
Bu yaklaşım, hassas veri analizini basit string eşleşmesinden çıkararak context-aware detection seviyesine taşır.
4. Birden Fazla Sinyali Birlikte Değerlendirmek
Modern veri keşfi sistemlerinde tek bir sinyal yerine birden fazla kriter birlikte değerlendirilmelidir.
Örneğin:
Pattern + Keyword + Context + Document Type + Metadata
bir araya geldiğinde daha yüksek doğruluk elde edilir.
Bir dokümanda;
· kişisel isim,
· adres,
· telefon numarası,
· kimlik numarası
birlikte bulunuyorsa, sistem artık tek bir alan değil, bir veri kümesi görür.
Bu yaklaşım hassasiyet seviyesinin daha doğru belirlenmesini sağlar.
5. Metadata da Verinin Bir Parçasıdır
Bir belgenin içeriği kadar;
· kim tarafından oluşturulduğu,
· hangi dizinde bulunduğu,
· oluşturulma ve değiştirilme zamanı,
· dosya tipi,
· erişim noktası
gibi metadata bilgileri de risk değerlendirmesinde önemlidir.
Örneğin aynı hassas veri;
kontrollü bir arşiv sisteminde bulunuyorsa başka,
genel erişime açık bir paylaşım alanında bulunuyorsa başka bir risk seviyesine sahip olabilir.
Dolayısıyla veri keşfi yalnızca:
“Bu dosyada hassas veri var mı?”
sorusunu değil,
“Bu veri nerede ve hangi bağlamda bulunuyor?”
sorusunu da cevaplamalıdır.
6. False Positive ve False Negative Dengesi
Hassas veri tespitinde iki kritik hata türü vardır.
False Positive
Normal bir içeriğin yanlışlıkla hassas veri olarak işaretlenmesidir.
Sonuç:
· gereksiz alarm,
· operasyonel yük,
· güvenlik ekiplerinde alert fatigue.
False Negative
Gerçek hassas verinin tespit edilememesidir.
Bu ise çok daha kritik olabilir.
Çünkü korunduğu varsayılan bir bilgi, güvenlik politikalarının dışında kalabilir.
Bu nedenle iyi bir discovery yaklaşımının amacı yalnızca mümkün olduğunca fazla sonuç üretmek değil;
yüksek doğrulukta, bağlamsal olarak anlamlı sonuç üretmektir.
7. Discovery Sonrası Ne Olmalı?
Hassas veriyi bulmak son adım değildir.
Asıl değer, keşfedilen verinin sonraki süreçlere aktarılmasıyla ortaya çıkar.
Discovery sonuçları;
· veri sınıflandırma,
· risk analizi,
· erişim gözden geçirme,
· DLP politikaları,
· saklama ve imha süreçleri,
· KVKK/GDPR uyumluluk çalışmaları
için kullanılabilir.
Böylece veri güvenliği politikaları varsayımlara değil, gerçek veri envanterine dayanır.
GEODI Perspektifi
GEODI, farklı veri kaynaklarındaki içerikleri analiz ederek hassas bilgilerin görünür hale getirilmesine yardımcı olur.
Buradaki kritik yaklaşım yalnızca dosya bulmak değildir.
İçeriğin okunması, farklı veri yapılarına dönüştürülmesi, ilgili sinyallerin analiz edilmesi ve sonuçların kurumsal veri görünürlüğünün bir parçası haline getirilmesidir.
Bu sayede kurumlar yalnızca:
“Hassas verimiz var.”
demek yerine;
Hangi veri?
Hangi dosyada?
Hangi veri kaynağında?
Hangi bağlamda?
Ne kadar yayılmış?
sorularına cevap üretebilir.
Yönetici Notu
Hassas veri keşfinin başarısı, kaç dosyanın tarandığıyla ölçülmemelidir.
Asıl ölçülmesi gereken;
doğru verinin, doğru bağlamda ve mümkün olan en düşük hata oranıyla tespit edilip edilmediğidir.
KEY TAKEAWAY
Hassas veri tespiti bir arama problemi değil, içerik ve bağlam analizi problemidir.
GEODI Discovery Series
Prepared by Zero Second
Helping organizations discover, understand and protect their most valuable asset: data





















Yorumlar