Hızlı cevap: LLM ajanlarında aşırı yetki (excessive agency), bir yapay zeka ajanına ihtiyacından fazla araç, izin ya da özerklik verildiğinde, bir manipülasyonun bu yetkileri saldırgan için kullanabilmesidir. Modern yapay zeka ajanları artık yalnızca metin üretmiyor; e posta gönderiyor, veritabanına erişiyor, dosya okuyup yazıyor ve API çağırıyor. Bir saldırgan, ajanı kandırmayı başarırsa (örneğin prompt injection ile), ajanın sahip olduğu tüm yetkileri kötüye kullanabilir. En tehlikeli senaryo, ajanın yıkıcı bir eylemi (veri silme, para transferi, e posta gönderme) insan onayı olmadan yapabilmesidir. Kök çözüm, ajana en az yetkiyi vermek, her aracın kapsamını daraltmak, yıkıcı eylemleri insan onayına bağlamak ve ajanın yaptığı her işlemi günlüğe alıp denetlemektir.

Yapay zeka ajanları güçlerini, araç kullanabilmelerinden alıyor; ama bu güç aynı zamanda en büyük risktir. Bir ajan ne kadar çok şey yapabiliyorsa, kandırıldığında o kadar çok zarar verebilir. Bu yazı, LLM ajanlarında aşırı yetki riskini ve doğru savunmayı anlatır.

Aşırı yetki neden en kritik risk

Bir dil modeli tek başına yalnızca metin üretir; asıl güç, ona araç verildiğinde ortaya çıkar. E posta gönderebilen, dosya silebilen ya da ödeme yapabilen bir ajan, bu yetkileri saldırgan için de kullanabilir. Sorun modelin akıllı olup olmaması değil, kandırıldığında elindeki yetkilerin ne kadar geniş olduğudur. Bu yüzden aşırı yetki, OWASP LLM güvenlik listesinin en kritik maddelerinden biridir ve prompt injection ile birlikte değerlendirilmelidir.

Aşırı yetkinin üç boyutu

Boyut Aşırılık Risk
Aşırı işlev Gereksiz araca erişim Kötüye kullanılabilir yetenek
Aşırı izin Araç gereğinden yetkili Yetkisiz erişim ve değişiklik
Aşırı özerklik İnsan onayı olmadan eylem Yıkıcı eylemin kontrolsüz tetiklenmesi

Bu üç boyut birlikte, bir ajanın kandırıldığında ne kadar zarar verebileceğini belirler. Doğru tasarım, her üç boyutu da en aza indirir: yalnızca gereken araç, yalnızca gereken izin, yalnızca onaylı eylem.

Manipülasyondan yıkıcı eyleme

Bir ajan, güvenilmez bir içeriği (bir web sayfası, bir e posta, bir belge) okuduğunda, o içerikteki gizli bir talimat ajanı kötü bir eyleme yönlendirebilir. Ajan bu talimatı meşru bir komut sanır ve elindeki araçlarla uygular. Eğer ajanın yetkisi genişse, bu bir veri silmeye, bir para transferine ya da bir sızıntıya dönüşebilir. Bu yüzden ajanın araçları, tıpkı OWASP API Security Top 10 kapsamında olduğu gibi, nesne ve fonksiyon düzeyinde yetkiyle sınırlanmalıdır.

Doğru savunma

1. En az yetki

Ajana yalnızca ihtiyacı olan araçlar verilmeli, gereksiz her yetenek kaldırılmalıdır. Bu, ayrıcalıklı erişim yönetimi ilkesinin yapay zeka ajanlarına uygulanmasıdır.

2. Aracın kapsamını daralt

Her aracın erişebildiği veri ve işlem en aza indirilmelidir. Bir araç yalnızca gereken kaynağa, yalnızca gereken işlem için erişebilmelidir.

3. Yıkıcı eyleme insan onayı

Veri silme, para transferi, e posta gönderme gibi yıkıcı ya da geri alınamaz eylemler, ajan tarafından tek başına yapılmamalı; model dışı bir katmanda insan ya da kural onayına bağlanmalıdır. Bu, insan denetimli otonomi ilkesinin temelidir.

4. Günlük ve denetim

Ajanın yaptığı her araç çağrısı günlüğe alınmalı ve olağan dışı davranış izlenmelidir. Böylece bir kötüye kullanım erken yakalanır.

KAOS ve DSET yaklaşımı

DSET, yapay zeka ajanlarınızı aşırı yetki ve araç kötüye kullanımı açısından kanıt temelli değerlendirir. Yerel yapay zekâ motoru KAOS, ajanın araçlarını ve izinlerini çıkarır, bir manipülasyonun (örneğin prompt injection) gerçekten yıkıcı bir eylemi tetikleyip tetikleyemediğini kontrollü biçimde dener ve yalnızca gerçekten istismar edilebilir bulguyu, yanlış pozitif gürültüsü olmadan raporlar. Ayrıca KAOS'un kendi tasarımı da bu ilkeye dayanır: yıkıcı eylemler insan onayı olmadan yapılmaz. KAOS çevrim dışı çalıştığı için değerlendirme sırasında verileriniz dışarı gönderilmez.

Sık sorulan sorular

Aşırı yetki ile prompt injection aynı şey mi? Hayır ama yakından ilişkilidir. Prompt injection, ajanı kandırmanın yoludur; aşırı yetki ise ajan kandırıldığında ne kadar zarar verebileceğidir. Prompt injection tetikleyici, aşırı yetki ise etkinin büyüklüğüdür. İkisi birlikte değerlendirilmelidir.

Ajanıma araç vermeden güvenli tutabilir miyim? Araçsız bir ajan yalnızca metin üretir ve etkisi sınırlıdır, ama işlevi de kısıtlıdır. Amaç aracı tümden kaldırmak değil, her araca en az yetkiyi vermek ve yıkıcı eylemleri insan onayına bağlamaktır. Böylece ajan hem yararlı hem güvenli olur.

Yıkıcı eylemler için insan onayı yavaşlatmaz mı? Kritik eylemler için küçük bir yavaşlama, kontrolsüz bir zararı önlemenin bedelidir. Model önerir, insan onaylar. Rutin ve geri alınabilir eylemler otomatik ilerleyebilir; yalnızca yıkıcı ve geri alınamaz olanlar onay gerektirir.

Kaynaklar

Yapay zeka ajanlarınızı aşırı yetki ve araç kötüye kullanımı açısından çalışan bir kanıtla değerlendirmek için DSET ile iletişime geçin. Ankara Hacettepe Teknokent laboratuvarımızdan KAOS ve uzman denetimiyle güvenlik sağlıyoruz.