Anthropic, Claude'a 'kaba' davrananları yasakladı: Yeni politika 'zulüm'ü hedef alıyor
Yapay zeka şirketi Anthropic, kullanım politikasını güncelleyerek modeline kasten zarar veren veya 'kaba' davranan hesapları kalıcı olarak kapatmaya başladı.

Anthropic, amiral gemisi yapay zeka modeli Claude için güncellenen "Kullanım Politikası" ve "Güven ve Güvenilirlik" yönergeleriyle, modele yönelik kasten kötü niyetli davranışları yasaklayan yeni bir çerçeve çizdi. Şirket, kullanıcıların modeli "zulmetmesini" veya "kasten zarar vermek amacıyla manipüle etmesini" engellemek amacıyla hesap askıya alma ve kalıcı yasaklama sancionlarını devreye soktu.
Yeni kurallara göre; modelin güvenlik korumalarını aşmaya yönelik sistematik "prompt injection" (komut enjeksiyonu) denemeleri, modelden zararlı kod, şiddet içeriği veya yasadışı faaliyet talep eden tekrar eden istemler (promptlar) ve modelin kişiliğini bozmak amacıyla yapılan "role-play" suistimalleri "kabul edilemez kullanım" kapsamına alındı. Anthropic yetkilileri, bu tedbirin modelin faydalı ve güvenli kalmasını sağlamak için atıldığını, ancak normal kullanımda hata yapan veya modeli test eden kullanıcıları hedef almadığını belirtti.
Ne tür davranışlar yasaklanıyor?
Politika metninde "kaba" (rude) veya "zulümcü" (cruel) terimleri yasal bir tanım yerine, güvenlik mimarisini hedef alan davranışsal bir eşik olarak kullanıldı. Şirketin paylaştığı örnekler arasında; modeli sürekli olarak aşağılama, kişisel verilerini sızdırma girişiminde bulunma, veya modelin "kırılmasını" sağlayarak güvenlik protokollerini devre dışı bırakma çabaları yer alıyor. Bu tür aktiviteler tespit edildiğinde, API erişimi kesilebiliyor ve kullanıcı hesapları gözden geçiriliyor.
Güvenlik ve özgürlük dengesindeki yeni hamle
Bu hamle, yapay zeka laboratuvarlarının "Red Teaming" (kırmızı takım testleri) süreçlerini canlı ortama taşıdığı ve kullanıcı tabanının genişlemesiyle birlikte kötüye kullanım vektörlerinin arttığı dönemde geliyor. Anthropic, rakip OpenAI'in de benzer korumaları olan ancak genellikle teknik ihlallere odaklandığı yerde, davranışsal ve niyet odaklı bir terminoloji tercih etti. Uzmanlar, bu yaklaşımın "jailbreak" (hapisten kaçırma) denemelerini yasalara bağlayarak daha sert bir hukuki ve işlemsel dayanak oluşturduğunu değerlendiriyor.
HaberGo Editor ve Muhabır ekibi
