GEODI Discovery Series | Friday
Güncelleme tarihi: 9 Eyl
Issue 10
Kişisel Veri Keşfi: KVKK/GDPR İçin Gerçek Görünürlük
Bir kurumda kişisel veri aramak kolay görünür.
T.C. Kimlik Numarası ararsınız.
E-posta adreslerini bulursunuz.
Telefon numaralarını tararsınız.
IBAN formatlarını kontrol edersiniz.
Ancak KVKK/GDPR açısından kişisel veri keşfi bundan çok daha karmaşık bir problemdir.
Çünkü kişisel veri her zaman açıkça tanımlanmış bir alan olarak karşımıza çıkmaz.
Bazen tek bir değerdir.
Bazen birkaç bilginin birleşimidir.
Bazen bir belgenin içindeki metindir.
Bazen taranmış bir görüntüdür.
Bazen de tek başına hiçbir anlam ifade etmeyen iki farklı veri parçasının birlikte değerlendirilmesiyle kişiyi tanımlanabilir hale getiren bir ilişkidir.
Bu nedenle gerçek kişisel veri keşfi yalnızca “eşleşme bulmak” değil;
verinin kimliklendirme gücünü anlayabilmektir.
Doğrudan Tanımlayıcılar Kolaydır
Bazı veri türlerinin tespit edilmesi görece kolaydır.
Örneğin:
· T.C. Kimlik Numarası
· Pasaport Numarası
· E-posta Adresi
· Telefon Numarası
· IBAN
belirli formatlara veya yapılara sahip olabilir.
Pattern detection, validation algoritmaları ve içerik analizi kullanılarak bu tür veriler tespit edilebilir.
Ancak KVKK/GDPR açısından kişisel veri evreni yalnızca bu alanlardan oluşmaz.
Asıl teknik zorluk bundan sonra başlar.

Tek Başına Kişisel Veri Olmayan Bir Bilgi, Başka Bir Veriyle Birleştiğinde Ne Olur?
Şu kayıtları düşünelim:
· 34 yaşında
· İstanbul
· Finans Departmanı
· Kadın
Tek tek değerlendirildiğinde bu bilgiler belirli bir kişiyi doğrudan göstermeyebilir.
Ancak aynı veri kümesine:
Şirket + Pozisyon + Lokasyon
gibi başka bilgiler eklendiğinde kişi çok daha kolay tanımlanabilir hale gelebilir.
Bu, privacy dünyasının kritik kavramlarından biridir:
Quasi-Identifier
Yani tek başına doğrudan kimlik bilgisi olmayan ancak başka verilerle birleştiğinde kişinin belirlenmesine katkıda bulunan bilgiler.
Bu nedenle gelişmiş discovery yalnızca belirli numara formatlarını aramakla yetinemez.
Veriler arasındaki ilişkiyi de değerlendirmelidir.
Structured PII ile Unstructured PII Aynı Şey Değildir
Bir CRM veritabanında kişisel veri oldukça düzenlidir.
Name | National ID | Phone |
Hangi kolonun ne içerdiği bellidir.
Ancak aynı bilgiler bir Word belgesinin içerisinde şöyle bulunabilir:
“Ahmet Yılmaz ile yapılan görüşmede 05xx xxx xx xx numaralı telefon üzerinden iletişim kurulmuş ve ödeme için TRxx xxxx... IBAN bilgisi paylaşılmıştır.”
Artık kolon yoktur.
Schema yoktur.
Field name yoktur.
Sadece doğal dil vardır.
Bu nedenle unstructured data içerisindeki kişisel veri keşfi, klasik database query yaklaşımından farklıdır.
Sistem içeriği okuyabilmeli, veri türlerini tanıyabilmeli ve bunları belge bağlamı içerisinde değerlendirebilmelidir.
Peki Belge Metin Bile Değilse?
Kurumsal ortamlarda önemli miktarda kişisel veri;
· taranmış kimliklerde,
· imzalı sözleşmelerde,
· başvuru formlarında,
· personel evraklarında,
· eski PDF arşivlerinde
görüntü olarak saklanır.
Dosya vardır.
İnsan okuyabilir.
Ama klasik search motoru için içerik yoktur.
Burada OCR kritik hale gelir.
Görüntünün metne dönüştürülmesiyle kişisel veri discovery pipeline'ına dahil edilebilir.
Image → OCR → Text → Entity Detection → Classification
Böylece daha önce search açısından görünmez olan içerik analiz edilebilir hale gelir.
Bir Eşleşme ile Bir Veri Profili Arasında Büyük Fark Vardır
Bir dokümanda tek bir telefon numarası bulunduğunu düşünelim.
Başka bir dokümanda ise:
· Ad Soyad
· T.C. Kimlik No
· Doğum Tarihi
· Adres
· Telefon
· IBAN
birlikte bulunuyor.
Her iki dosyada da kişisel veri vardır.
Ancak aynı risk seviyesinde değildirler.
İkinci belge çok daha yüksek bir PII density içerir.
Bu nedenle discovery sonuçlarının yalnızca:
“Match bulundu.”
şeklinde değerlendirilmesi yeterli değildir.
Belgedeki kişisel veri türlerinin sayısı, çeşitliliği ve birlikte bulunma durumu da önemlidir.
Data Density + Data Diversity + Context
birlikte değerlendirildiğinde çok daha anlamlı bir hassasiyet profili ortaya çıkar.
Özel Nitelikli Veride Bağlam Daha da Kritik Hale Gelir
Bir dokümanda:
“kan grubu”
ifadesinin geçmesi tek başına belirli bir kişiye ait sağlık verisi bulunduğu anlamına gelmeyebilir.
Ancak aynı içerikte:
Ad Soyad + T.C. Kimlik No + Kan Grubu
bulunuyorsa değerlendirme tamamen değişir.
Benzer şekilde sağlık, biyometrik veya diğer yüksek hassasiyet taşıyan veri kategorilerinde yalnızca keyword detection kullanmak ciddi miktarda yanlış sonuç üretebilir.
Bu nedenle:
Entity + Context + Relationship
birlikte değerlendirilmelidir.
Gerçek Görünürlük Nasıl Görünür?
Olgun bir kişisel veri discovery çalışmasının sonunda yalnızca dosya listesi elde edilmemelidir.
Kurum şu resmi görebilmelidir:
· Hangi kişisel veri türleri var?
· Hangi veri kaynaklarında bulunuyor?
· Hangi dokümanlarda yoğunlaşıyor?
· Hangi veri türleri birlikte bulunuyor?
· Hangi içerikler daha yüksek hassasiyet taşıyor?
· Görüntü tabanlı belgelerde ne kadar kişisel veri var?
· Beklenmeyen alanlarda kişisel veri bulunuyor mu?
Bu noktada discovery artık basit bir arama motoru değildir.
Kurumun privacy data map'ini oluşturan teknik görünürlük katmanıdır.
GEODI Perspektifi
GEODI; farklı veri kaynaklarındaki yapılandırılmış ve yapılandırılmamış içeriklerin keşfedilmesini, dokümanların analiz edilmesini ve kişisel ya da hassas bilgilerin görünür hale getirilmesini destekler.
OCR ile görüntü tabanlı içerikler de analiz kapsamına alınabilir; içerik ve bağlam analizi sayesinde yalnızca dosyanın varlığı değil, dosyanın içerisinde hangi bilginin bulunduğu değerlendirilebilir.
Böylece KVKK/GDPR çalışmaları yalnızca hazırlanmış veri envanterlerine değil, kurumun gerçek veri ortamından elde edilen discovery sonuçlarına da dayanabilir.
Yönetici Notu
Kişisel veri keşfinin başarısı kaç tane T.C. Kimlik Numarası bulunduğuyla ölçülmez.
Gerçek başarı;
doğrudan tanımlayıcıları, dolaylı tanımlayıcıları, veri ilişkilerini ve yüksek hassasiyetli veri kümelerini doğru şekilde görünür hale getirebilmektir.
Çünkü KVKK/GDPR açısından asıl soru:
“Kaç eşleşme bulduk?”
değil;
“Elimizdeki verinin kimi tanımlayabildiğini gerçekten biliyor muyuz?”
sorusudur.
KEY TAKEAWAY
Kişisel veri keşfi, kişisel veri formatlarını aramak değildir.
Verinin bir kişiyi nasıl tanımlayabildiğini anlayabilmektir.
GEODI Discovery Series
Prepared by Zero Second
Helping organizations discover, understand and protect their most valuable asset: data





















Yorumlar