top of page
background.jpg


 

GEODI Discovery Series | Friday

30 Ağu
2 dakikada okunur

Güncelleme tarihi: 9 Eyl

Issue 12


Duplicate & Redundant Data – Aynı Verinin Kaç Kopyasına İhtiyacınız Var?


 

Bir dosyanın adı Teklif_Final.docx.


Sonra aynı klasörde şunları görüyorsunuz:


·       Teklif_Final_v2.docx

·       Teklif_Final_SON.docx

·       Teklif_Final_SON2.docx

·       Teklif_Murat_revize.docx


Bir kopyası e-postada. Bir kopyası ortak alanda. Bir diğeri kullanıcının bilgisayarında. Eski sürümler yedekte. Aynı içeriğin PDF’e çevrilmiş hali de başka bir klasörde.


Ve bunların hiçbiri teknik olarak aynı dosya olmak zorunda değil.


Asıl problem de burada başlıyor.


Aynı Dosyayı Bulmak Kolaydır. Aynı Bilgiyi Bulmak Daha Zordur.


Klasik duplicate kontrolü çoğunlukla dosyanın birebir kopyalarını tespit etmeye odaklanır.


Dosyanın hash değeri aynıysa iki dosyanın birebir aynı olduğunu söylemek mümkündür.


Fakat kurumsal veri bununla sınırlı değildir.


Bir Word dokümanındaki içerik PDF’e dönüştürüldüyse? Excel dosyasındaki tablo başka bir rapora kopyalandıysa? Bir sözleşmenin yalnızca iki maddesi değiştirilip yeniden kaydedildiyse? Bir e-postanın eki ortak alana kaydedildikten sonra farklı bir isimle tekrar paylaşılmışsa?


Bunlar artık binary olarak aynı dosyalar değildir. Ancak bilgi açısından büyük ölçüde aynı içeriği taşıyor olabilirler.


Bu nedenle kurumsal veri ortamlarında yalnızca duplicate data değil, redundant data da önemlidir.


Duplicate ≠ Redundant


Duplicate Data, aynı verinin birebir veya çok yakın kopyalarıdır.


Redundant Data ise iş açısından artık gerekli olmayan, başka yerde bulunan bilgiyle büyük ölçüde örtüşen veya gereksiz şekilde çoğalmış veridir.


Aradaki fark önemlidir.


Çünkü kurumda 20 TB duplicate veri bulunması bir depolama problemi gibi görülebilir.


Ama bu 20 TB’ın içerisinde müşteri bilgileri, çalışan kayıtları, sözleşmeler veya hassas belgeler bulunuyorsa konu artık yalnızca storage değildir.


Her ekstra kopya; yeni bir erişim noktası, yeni bir korunması gereken varlık ve potansiyel olarak yeni bir risk yüzeyi oluşturur.


Teklif belgesinin farklı sistemlerdeki kopyalarının GEODI ile bulunmasını ve değerlendirilmesini gösteren şema.

Bir Veri Çoğaldıkça Kontrolü de Çoğalıyor mu?


Bir müşteri listesinin merkezi sistemde bulunması yönetilebilir.


Aynı listenin:


·       CRM’de

·       Excel export’unda

·       bir yöneticinin bilgisayarında

·       e-posta ekinde

·       SharePoint’te

·       dosya sunucusunda

·       eski bir backup içerisinde


bulunması ise bambaşka bir durumdur.


Artık tek bir veri varlığını değil, aynı bilginin farklı yaşamlarını yönetiyorsunuz.


Üstelik bu kopyaların erişim yetkileri, saklama süreleri ve güvenlik kontrolleri birbirinden farklı olabilir.


Merkezi sistemden kayıt silinse bile başka bir kopya yaşamaya devam edebilir.


İşte redundant data’nın görünmeyen maliyeti burada ortaya çıkar.


GEODI Açısından Mesele “Kaç Tane Aynı Dosya Var?” Sorusundan Daha Büyüktür


Discovery yaklaşımının değeri, farklı veri kaynaklarının birlikte değerlendirilebilmesidir.


Dosya sunucuları, kullanıcı alanları, arşivler, e-postalar ve diğer repository’ler keşfedildiğinde kurum yalnızca veri hacmini değil, bilginin nasıl çoğaldığını ve dağıldığını da görmeye başlayabilir.


İçerik, metadata ve keşfedilen varlıklar birlikte değerlendirildiğinde şu sorular anlam kazanır:


·       Bu içeriğin başka kopyaları nerede?

·       Hangi repository’lerde tekrar ediyor?

·       Hangi versiyonlar birbirine benziyor?

·       Hangileri aktif, hangileri yıllardır kullanılmıyor?

·       Tekrarlanan içerik hassas veri taşıyor mu?

·       Artık iş değeri olmayan veriyi neden hâlâ tutuyoruz?


Böylece duplicate analizi yalnızca bir storage optimization çalışması olmaktan çıkar.


Veri yönetişiminin parçası haline gelir.


1 Dosya Silmek Size Alan Kazandırabilir. 10.000 Gereksiz Kopyayı Keşfetmek İse Veri Riskinizi Değiştirebilir.


Kurumlar genellikle ne kadar veri ürettiklerini bilir.


Ama aynı bilginin kaç farklı yerde yaşamaya devam ettiğini bilmek çok daha zordur.


GEODI Discovery ile amaç yalnızca veriyi bulmak değil; kurumun veri varlığının içindeki tekrarları, dağılımı ve gereksiz veri yükünü görünür hale getirmektir.


Çünkü soru aslında çok basit:


Aynı Verinin Gerçekten Kaç Kopyasına İhtiyacınız Var?


KEY TAKEAWAY


Bir kopya depolama maliyetidir. Kontrolsüz biçimde çoğalan aynı bilgi ise güvenlik, uyum ve yönetişim riskidir.

 

 

GEODI Discovery Series

Prepared by Zero Second

Helping organizations discover, understand and protect their most valuable asset: data

 

 
 
 

Yorumlar


bottom of page