Adınızı silmek
sizi gizlemeye yetmez.
Netflix puanları, AOL aramaları, bir valinin hastane kaydı. “Anonim” diye paylaşılan verilerin sahiplerini bulmak çoğu zaman birkaç gün sürdü.
Yazıdan akılda kalması gereken üç şey.
- 01
İsimleri silmek veriyi anonim yapmaz: Posta kodu, doğum tarihi ve cinsiyet ABD nüfusunun yaklaşık yüzde 87'sini tanımlamaya yetiyor.
- 02
AOL ve Netflix'in “anonim” verileri gerçek kişilere bağlandı; 15 demografik özellik yüzde 99,98 doğrulukla yeniden kimliklendirmeye yetiyor.
- 03
curtaindata yalnızca isimleri değil doğum tarihi, adres, plaka, IP adresi ve özel nitelikli veriler gibi yarı tanımlayıcıları da bulup maskeler.
Bu yazıda · 6 dakikalık okuma
1997’de Massachusetts eyaleti, kamu çalışanlarının hastane kayıtlarını araştırmacılarla paylaştı. Kayıtlardan isimler, adresler ve sosyal güvenlik numaraları silinmişti; dönemin valisi William Weld de verinin güvenle anonimleştirildiğini söylüyordu. O sırada yüksek lisans öğrencisi olan Latanya Sweeney ise yirmi dolara Cambridge kentinin seçmen listesini satın aldı, iki listeyi yalnızca üç bilgiyle eşleştirdi ve valinin kendi sağlık kaydını buldu[1].
Hangi üç bilgi? Posta kodu, doğum tarihi ve cinsiyet. Ne bir isim, ne bir numara. Sadece her gün sayısız formda gönül rahatlığıyla doldurduğumuz üç küçük ayrıntı.
01İsim bir etikettir, kimlik bir izdir
Anonimleştirme denince çoğumuzun aklına aynı şey gelir: ismi sil, numarayı karart, bitti. Oysa insanları tanımlayan şey çoğu zaman isimleri değil, ayrıntıların kesişimidir. Kadıköy’de oturan, 1987 doğumlu, beyaz bir hatchback kullanan bir diş hekimi… Bu cümlede tek bir isim yok, ama muhtemelen aklınıza biri geldi.Gizlilik literatüründe bunlara yarı tanımlayıcı (quasi-identifier) denir: tek başına masum, birleşince kimlik kadar güçlü bilgiler.
2006’da iki olay bu gerçeği bütün dünyaya duyurdu. Ağustos’ta AOL, araştırmacılara yardımcı olmak için 650 binden fazla kullanıcısının üç aylık arama kayıtlarını yayımladı. İsimlerin yerine numaralar konmuştu. Birkaç gün içinde New York Times muhabirleri, 4417749 numaralı kullanıcının Georgia’nın Lilburn kasabasında yaşayan 62 yaşındaki Thelma Arnold olduğunu buldu[3]. Tek ihtiyaçları onun arama geçmişiydi (Lilburn’deki bahçıvanlar, Arnold soyadlı birkaç kişi, mahallesinde satılan evler).
Aynı yıl Netflix, öneri algoritmasını geliştirene bir milyon dolar vaat eden bir yarışma için yaklaşık yarım milyon abonesinin film puanlarını paylaştı. Yine isim yoktu. Texas Üniversitesi’nden iki araştırmacı bu puanları IMDb’deki herkese açık yorumlarla karşılaştırdı ve aboneleri tek tek tanımladı[4].
02On beş özellik, yüzde 99,98
Eski veriler, eski yöntemler diyebilirsiniz. 2019’da Nature Communications’ta yayımlanan bir çalışma tam tersini gösterdi: Bir veri setinde kişiye ait on beş demografik özellik varsa, Amerikalıların yüzde 99,98’i doğru şekilde yeniden tanımlanabiliyor[5]. Veri setinin eksik ya da yalnızca bir örneklem olması da sanıldığı kadar koruma sağlamıyor.Yaş, cinsiyet, medeni hâl, meslek, araç modeli, çocuk sayısı… On beş özellik ilk bakışta çok gibi gelir. Sıradan bir müşteri kaydında bundan fazlası vardır.
Mahremiyeti koruyan şey ismin yokluğu değil, izin yokluğudur.
03Türkçe bir metinde iz nasıl görünür?
Şimdi bu dersi gündelik bir metne taşıyalım. Bir insan kaynakları uzmanının “şu notu toparla” diyerek yapay zekâya yapıştırdığı birkaç cümleyi düşünün. İçinde tek bir isim yok:
Doğum tarihi, açık adres, araç plakası, IP adresi ve KVKK’nın özel nitelikli saydığı türden bir bilgi: sendika üyeliği. Bunlar bir araya geldiğinde kişiyi bulmak için Sweeney’nin seçmen listesine bile gerek kalmaz; bir şirket içi rehber yeter.Plaka, bu arada, yabancı araçların çoğunun tanımadığı bir veri türü. Testimizde Microsoft Presidio Türk plakalarının yalnızca yüzde 2’sini buldu; curtaindata tamamını.
04curtaindata yalnızca adı değil, izi perdeler
curtaindata’yı tasarlarken ilk kuralımız buydu: İsim bulmak işin yarısı bile değil. Kütüphane TC kimlik ve vergi numarasından IBAN’a, doğum tarihinden plakaya, mahkeme adından dosya numarasına, IP adresinden koordinata kadar yarı tanımlayıcıların peşine düşer. Sağlık, din, sendika üyeliği gibi özel nitelikli verileri bağlamından işaretler ve her bulguyu VERBİS kategorisine göre etiketler; neyin neden gizlendiğini de görürsünüz.
Dürüst olalım (bu konuda dürüstlük en iyi tanıtımdır): Kişisel veriyi maskelemek onu hukuken anonim yapmaz. KVKK’ya göre anonim veri, başka verilerle eşleştirilse bile kişiyle ilişkilendirilemeyen veridir[6]; geri açılabilen bir maskeleme ise takma ad işlemidir ve veri kişisel veri olmaya devam eder. Farkı maskeleme, anonimleştirme ve takma ad rehberinde ayrıntısıyla anlattık. Ama gündelik hayatta asıl soru şu: Bilgisayarınızdan çıkan metinde iz kalıyor mu? curtaindata’nın işi, o sorunun cevabını “hayır”a olabildiğince yaklaştırmak.
Bir sonraki adım sizin. Elinizdeki herhangi bir metni (bir e-posta, bir form, bir müşteri notu) ücretsiz maskeleme aracına yapıştırın ve içinde kaç iz olduğunu görün. Çoğu insan ilk denemede şaşırıyor.
curtaindata ekibi tarafından hazırlandı
Türkçe metinlerdeki kişisel verileri bulan ve gizleyen curtaindata’yı geliştiren ekip. Bu yazıdaki bütün sayılar kaynaklarıyla birlikte verilmiştir; örnek çıktılar curtaindata’nın gerçek sonuçlarıdır.
5 Ekim 2026 · 6 dk okuma
