Yapay Zeka Model Güvenliği: Model Çalma, Çıkarım ve Tersine Mühendislik
Model güvenliği, bir makine öğrenmesi modelinin kendisini çalma ve içindeki veriyi çıkarma saldırılarına karşı korumaktır. Modele yönelik saldırılar tablosu, model çıkarımı ve mahremiyet, erişim ve sorgu sınırı savunması ve KAOS ile değerlendirme.
Hızlı cevap: Yapay zeka model güvenliği, bir makine öğrenmesi modelinin kendisini çalma, kopyalama ve içindeki gizli bilgiyi çıkarma saldırılarına karşı korumaktır. Klasik güvenlik veriyi ve kodu korur; model güvenliği ise modelin kendisini bir varlık olarak korur. En sık saldırılar şunlardır: modelin çıktılarını sorgulayarak işlevini kopyalayan model çalma, modelin eğitim verisindeki gizli bilgiyi geri çıkaran model çıkarımı (inversion), ve modeli kandırmak için özel olarak hazırlanmış girdilerle yanlış karar verdiren düşmanca örnekler. Kök çözüm, modele erişimi ve sorgu hızını sınırlamak, çıktıyı ihtiyaç kadar açık tutmak, hassas eğitim verisini korumak ve modeli düşmanca girdilere karşı sağlamlaştırmaktır.
Bir kurum yapay zeka modeli geliştirdiğinde, o modele önemli bir yatırım ve çoğu zaman hassas veri gömülüdür. Saldırganlar artık yalnızca veriyi değil, modelin kendisini de hedefliyor: onu çalmak, kopyalamak ya da içindeki gizli bilgiyi çıkarmak için. Bu yazı, modele yönelik saldırıları ve doğru savunmayı anlatır.
Model neden bir hedef
Bir model, onu eğitmek için harcanan veriyi, emeği ve rekabet avantajını temsil eder. Ayrıca model, eğitildiği verinin izlerini taşır; bu veri kişisel ya da gizli olabilir. Bu yüzden model iki açıdan değerlidir: hem bir fikri mülkiyet hem içindeki verinin bir kabı. Saldırgan, modeli çalarak yatırımı ele geçirebilir ya da içindeki veriyi çıkararak gizliliği ihlal edebilir.
Modele yönelik saldırılar
| Saldırı | Ne yapıyor | Sonuç |
|---|---|---|
| Model çalma | Çıktıları sorgulayıp işlevi kopyalar | Fikri mülkiyet kaybı |
| Model çıkarımı | Eğitim verisini geri çıkarır | Gizli veri ifşası |
| Üyelik çıkarımı | Bir kaydın eğitimde olup olmadığını anlar | Mahremiyet ihlali |
| Düşmanca örnek | Özel girdiyle yanlış karar verdirir | Güvenlik atlatma |
| Model tersine mühendislik | Model yapısını çözer | Zayıflık keşfi |
Bu saldırıların ortak noktası, çoğunun modele normal sorgular göndererek çalışmasıdır. Saldırgan modeli kırmak yerine, ona yeterince soru sorarak sırlarını öğrenir. Bu, veri zehirlenmesinden farklı bir tehdit sınıfıdır: orada model bozulur, burada model soyulur.
Model çıkarımı ve mahremiyet
En sinsi saldırılardan biri model çıkarımıdır. Bir model, eğitim verisindeki desenleri öğrenir; dikkatli sorgularla bu desenler geri çıkarılabilir ve modelin gördüğü hassas veri ifşa olabilir. Üyelik çıkarımı ise belirli bir kaydın eğitim verisinde olup olmadığını anlamaya çalışır; bu, birinin verisinin kullanıldığını kanıtlayarak mahremiyeti ihlal eder. Bu yüzden model, içindeki verinin bir kabı olarak da korunmalıdır. RAG ve vektör veri tabanı güvenliği, modelin hafızasını korumanın bir parçasıdır.
Doğru savunma
1. Erişim ve sorgu sınırı
Modele erişim kimlik doğrulamayla korunmalı, sorgu hızı sınırlanmalıdır. Model çalma ve çıkarım, çok sayıda sorgu gerektirir; hız sınırı bu saldırıları yavaşlatır. Bu, rate limiting ve bot yönetimiyle aynı mantığa dayanır.
2. Çıktıyı sınırla
Model çıktısı ihtiyaç kadar bilgi vermeli, gereksiz ayrıntı ve güven skorları saldırgana yardımcı olacak biçimde açılmamalıdır.
3. Eğitim verisini koru
Hassas eğitim verisi, modelde geri çıkarılamayacak biçimde korunmalı, mahremiyet koruyan teknikler değerlendirilmelidir.
4. Düşmanca girdilere karşı sağlamlaştır
Model, kandırmak için hazırlanmış girdilere karşı test edilmeli ve sağlamlaştırılmalıdır. Bu, yapay zeka kırmızı takım çalışmasının bir parçasıdır.
KAOS ve DSET yaklaşımı
DSET, yapay zeka modellerinizi model çalma, çıkarım ve düşmanca girdi açısından kanıt temelli değerlendirir. Yerel yapay zekâ motoru KAOS, modele erişim ve sorgu yüzeyini sınar, çıktının gereğinden fazla bilgi verip vermediğini kontrol eder ve bir saldırının gerçekten modeli kopyalayabildiğini ya da veri çıkarabildiğini doğrular. KAOS çevrim dışı çalıştığı için değerlendirme sırasında modeliniz ve verisi dış servislere gönderilmez. Yalnızca gerçekten istismar edilebilir bulguyu, yanlış pozitif gürültüsü olmadan raporlar.
Sık sorulan sorular
Modelimi kimse indiremiyorsa güvende mi? Tam olarak değil. Saldırgan modeli indirmeden de, yalnızca çıktılarını sorgulayarak işlevini kopyalayabilir (model çalma) ya da eğitim verisini çıkarabilir. Bu yüzden erişim ve sorgu hızı sınırlanmalı, çıktı gereğinden fazla bilgi vermemelidir.
Model çıkarımı gerçek bir tehdit mi? Evet. Dikkatli sorgularla, modelin eğitim verisindeki hassas bilgi geri çıkarılabilir ve bir kaydın eğitimde kullanıldığı kanıtlanabilir. Bu, hem gizlilik hem mahremiyet ihlalidir ve model, içindeki verinin bir kabı olarak korunmalıdır.
Düşmanca örnek nedir? Modeli kandırmak için özel olarak hazırlanmış, insana normal görünen ama modele yanlış karar verdiren girdilerdir. Bir güvenlik modelinde bu, saldırının tespitten kaçmasına yol açabilir; bu yüzden model bu tür girdilere karşı test edilmelidir.
Kaynaklar
- MITRE ATLAS, yapay zeka sistemlerine yönelik tehditler: https://atlas.mitre.org
- DSET Yapay Zekâ Güvenliği Hizmetleri: https://dset.com.tr/hizmetler
Yapay zeka modellerinizi çalma, çıkarım ve düşmanca girdi açısından çalışan bir kanıtla değerlendirmek için DSET ile iletişime geçin. Ankara Hacettepe Teknokent laboratuvarımızdan KAOS ve uzman denetimiyle güvenlik sağlıyoruz.
Kimliğinizi doğrulayın
Yetkilendirilmiş erişim alanı. Tüm giriş denemeleri kayıt altına alınır.