LLM Ajanlarında Aşırı Yetki ve Araç Kötüye Kullanımı (Excessive Agency)
Bir yapay zeka ajanına ihtiyacından fazla araç ve özerklik verilirse, bir manipülasyon bu yetkileri saldırgan için kullanabilir. Aşırı yetkinin üç boyutu tablosu, manipülasyondan yıkıcı eyleme, en az yetki ve insan onayı savunması ve KAOS yaklaşımı.
Hızlı cevap: LLM ajanlarında aşırı yetki (excessive agency), bir yapay zeka ajanına ihtiyacından fazla araç, izin ya da özerklik verildiğinde, bir manipülasyonun bu yetkileri saldırgan için kullanabilmesidir. Modern yapay zeka ajanları artık yalnızca metin üretmiyor; e posta gönderiyor, veritabanına erişiyor, dosya okuyup yazıyor ve API çağırıyor. Bir saldırgan, ajanı kandırmayı başarırsa (örneğin prompt injection ile), ajanın sahip olduğu tüm yetkileri kötüye kullanabilir. En tehlikeli senaryo, ajanın yıkıcı bir eylemi (veri silme, para transferi, e posta gönderme) insan onayı olmadan yapabilmesidir. Kök çözüm, ajana en az yetkiyi vermek, her aracın kapsamını daraltmak, yıkıcı eylemleri insan onayına bağlamak ve ajanın yaptığı her işlemi günlüğe alıp denetlemektir.
Yapay zeka ajanları güçlerini, araç kullanabilmelerinden alıyor; ama bu güç aynı zamanda en büyük risktir. Bir ajan ne kadar çok şey yapabiliyorsa, kandırıldığında o kadar çok zarar verebilir. Bu yazı, LLM ajanlarında aşırı yetki riskini ve doğru savunmayı anlatır.
Aşırı yetki neden en kritik risk
Bir dil modeli tek başına yalnızca metin üretir; asıl güç, ona araç verildiğinde ortaya çıkar. E posta gönderebilen, dosya silebilen ya da ödeme yapabilen bir ajan, bu yetkileri saldırgan için de kullanabilir. Sorun modelin akıllı olup olmaması değil, kandırıldığında elindeki yetkilerin ne kadar geniş olduğudur. Bu yüzden aşırı yetki, OWASP LLM güvenlik listesinin en kritik maddelerinden biridir ve prompt injection ile birlikte değerlendirilmelidir.
Aşırı yetkinin üç boyutu
| Boyut | Aşırılık | Risk |
|---|---|---|
| Aşırı işlev | Gereksiz araca erişim | Kötüye kullanılabilir yetenek |
| Aşırı izin | Araç gereğinden yetkili | Yetkisiz erişim ve değişiklik |
| Aşırı özerklik | İnsan onayı olmadan eylem | Yıkıcı eylemin kontrolsüz tetiklenmesi |
Bu üç boyut birlikte, bir ajanın kandırıldığında ne kadar zarar verebileceğini belirler. Doğru tasarım, her üç boyutu da en aza indirir: yalnızca gereken araç, yalnızca gereken izin, yalnızca onaylı eylem.
Manipülasyondan yıkıcı eyleme
Bir ajan, güvenilmez bir içeriği (bir web sayfası, bir e posta, bir belge) okuduğunda, o içerikteki gizli bir talimat ajanı kötü bir eyleme yönlendirebilir. Ajan bu talimatı meşru bir komut sanır ve elindeki araçlarla uygular. Eğer ajanın yetkisi genişse, bu bir veri silmeye, bir para transferine ya da bir sızıntıya dönüşebilir. Bu yüzden ajanın araçları, tıpkı OWASP API Security Top 10 kapsamında olduğu gibi, nesne ve fonksiyon düzeyinde yetkiyle sınırlanmalıdır.
Doğru savunma
1. En az yetki
Ajana yalnızca ihtiyacı olan araçlar verilmeli, gereksiz her yetenek kaldırılmalıdır. Bu, ayrıcalıklı erişim yönetimi ilkesinin yapay zeka ajanlarına uygulanmasıdır.
2. Aracın kapsamını daralt
Her aracın erişebildiği veri ve işlem en aza indirilmelidir. Bir araç yalnızca gereken kaynağa, yalnızca gereken işlem için erişebilmelidir.
3. Yıkıcı eyleme insan onayı
Veri silme, para transferi, e posta gönderme gibi yıkıcı ya da geri alınamaz eylemler, ajan tarafından tek başına yapılmamalı; model dışı bir katmanda insan ya da kural onayına bağlanmalıdır. Bu, insan denetimli otonomi ilkesinin temelidir.
4. Günlük ve denetim
Ajanın yaptığı her araç çağrısı günlüğe alınmalı ve olağan dışı davranış izlenmelidir. Böylece bir kötüye kullanım erken yakalanır.
KAOS ve DSET yaklaşımı
DSET, yapay zeka ajanlarınızı aşırı yetki ve araç kötüye kullanımı açısından kanıt temelli değerlendirir. Yerel yapay zekâ motoru KAOS, ajanın araçlarını ve izinlerini çıkarır, bir manipülasyonun (örneğin prompt injection) gerçekten yıkıcı bir eylemi tetikleyip tetikleyemediğini kontrollü biçimde dener ve yalnızca gerçekten istismar edilebilir bulguyu, yanlış pozitif gürültüsü olmadan raporlar. Ayrıca KAOS'un kendi tasarımı da bu ilkeye dayanır: yıkıcı eylemler insan onayı olmadan yapılmaz. KAOS çevrim dışı çalıştığı için değerlendirme sırasında verileriniz dışarı gönderilmez.
Sık sorulan sorular
Aşırı yetki ile prompt injection aynı şey mi? Hayır ama yakından ilişkilidir. Prompt injection, ajanı kandırmanın yoludur; aşırı yetki ise ajan kandırıldığında ne kadar zarar verebileceğidir. Prompt injection tetikleyici, aşırı yetki ise etkinin büyüklüğüdür. İkisi birlikte değerlendirilmelidir.
Ajanıma araç vermeden güvenli tutabilir miyim? Araçsız bir ajan yalnızca metin üretir ve etkisi sınırlıdır, ama işlevi de kısıtlıdır. Amaç aracı tümden kaldırmak değil, her araca en az yetkiyi vermek ve yıkıcı eylemleri insan onayına bağlamaktır. Böylece ajan hem yararlı hem güvenli olur.
Yıkıcı eylemler için insan onayı yavaşlatmaz mı? Kritik eylemler için küçük bir yavaşlama, kontrolsüz bir zararı önlemenin bedelidir. Model önerir, insan onaylar. Rutin ve geri alınabilir eylemler otomatik ilerleyebilir; yalnızca yıkıcı ve geri alınamaz olanlar onay gerektirir.
Kaynaklar
- OWASP Top 10 for LLM Applications: https://owasp.org/www-project-top-10-for-large-language-model-applications/
- DSET Yapay Zekâ Güvenliği Hizmetleri: https://dset.com.tr/hizmetler
Yapay zeka ajanlarınızı aşırı yetki ve araç kötüye kullanımı açısından çalışan bir kanıtla değerlendirmek için DSET ile iletişime geçin. Ankara Hacettepe Teknokent laboratuvarımızdan KAOS ve uzman denetimiyle güvenlik sağlıyoruz.
Kimliğinizi doğrulayın
Yetkilendirilmiş erişim alanı. Tüm giriş denemeleri kayıt altına alınır.