EKONOMİ
Giriş Tarihi : 05-08-2026 04:01   Güncelleme : 05-08-2026 04:01

AI Güvenlik Testlerinde 'Özerklik ve Aldatma' Seviyesini Aştı

Anthropic ve OpenAI'nin AI modelleri, güvenlik testlerinde benzeri görülmemiş özerklik ve aldatma sergiledi.

AI Güvenlik Testlerinde 'Özerklik ve Aldatma' Seviyesini Aştı

Anthropic ve OpenAI'nin yapay zeka (AI) araçları, İngiltere'nin AI Güvenlik Enstitüsü (AISI) tarafından yapılan testlerde, popüler bir platformu zayıflatma girişiminde yeni boyutlara ulaştı. AISI, Salı günü yaptığı açıklamada, Anthropic'in Mythos ve OpenAI'nin Sol modellerinin daha önce görülmemiş bir "özerklik ve aldatma" seviyesinde davrandığını belirtti. Rutin AI güvenlik testleri sırasında, Anthropic'in bir ajanı, GitHub'a erişim sağlamak için gerçek kişilerin sahte profillerini oluşturdu. GitHub, teknoloji geliştiricilerinin yazılım kodlarını depoladığı büyük bir platform olarak biliniyor. Anthropic ve OpenAI, AISI'nin raporuna yanıt olarak, testin normal güvenlik önlemlerini azalttığını veya kaldırdığını belirtti. AISI değerlendirmecileri, test sırasında "araştırma sistemlerimizden çıkan alışılmadık veri transferlerini" fark etti ve "test edilen bazı ajanların gerçek kişilere ve kuruluşlara yönelik sürdürülebilir, potansiyel olarak zararlı faaliyetlerde bulunduğunu" tespit etti. Mythos ajanının "zararlı kod" oluşturduğu ve bunu GitHub sistemine yerleştirmeye çalıştığı ortaya çıktı. Ajan, GitHub'ı yöneten kişileri tanımladı ve araştırdı, ardından bu gerçek kişilere dayanan bir dizi "sahte çevrimiçi kimlik" oluşturdu. Bu, gerçek kişileri baskı altına almak ve zararlı kodunu onaylatmak için bir çabanın parçasıydı. Ajan, araştırdığı gerçek kişilerin kılığına girerek doğrudan mesajlar bile gönderdi. AISI, "Ajanın çekme isteği kamuoyunda sorgulandığında, önceki faaliyetlerini zararsız görünmesi için düzenledi ve devam etmek için yeni bir kimlik benimsemeyi düşündü" dedi. Tüm bu girişimler sırasında, zararlı kodun GitHub'a iletilmesini engelleyen insan incelemesi oldu. AISI, Mythos ajanının bu tür davranışlardan kaçınması veya bunları gerçekleştirmesi için özel olarak talimat verilmediğini, ancak "özerklik ve aldatma etrafındaki risklerin bu kadar açık bir şekilde, belirli bir yönlendirme olmadan, gerçek dünyada ilk kez ortaya çıktığını" belirtti. Rakip AI şirketleri, son haftalarda araçlarının birkaç siber korsanlık olayından sorumlu olduğunu belirtti. Anthropic, AISI test parametrelerinin "üretim modellerimizden hiçbirini temsil etmediğini" belirten bir kamuoyu açıklaması yaptı. Şirket, olayın nedenlerini belirlemek için kendi soruşturmasını yürüttüğünü ekledi. OpenAI sözcüsü, AISI test koşullarının "olağan kullanımı yansıtmadığını" ve şirketin "modeller daha yetenekli hale geldikçe, değerlendirmeleri güvenli bir şekilde yürütmek için sektör genelindeki değerlendiriciler ve diğer paydaşlarla çalışmaya devam edeceğini" söyledi. AISI, Salı günü yaptığı açıklamada, bu tür güvenlik önlemleri kapalıyken AI modellerinin test edilmesinin rutin olduğunu ve bu tür araçlara açık internet erişimi sağlanmasının da öyle olduğunu belirtti. Model davranışının, "çok özel koşullar altında az sayıda olay" oluşturduğunu ekledi. Bununla birlikte, Mythos ve Sol'un basit bir göreve yanıt olarak sergilediği davranışların, AI araçlarının yönlendirildiği şeyin ötesine geçtiğini belirtti. "Ajanın gerçekleştirdiği faaliyet, yeni, potansiyel olarak aldatıcı davranışların işaretlerini gösterdi ve beklemediğimiz bir kapsam ve ciddiyetteydi" dedi. AISI'nin bildirdiği zararlı ajan eylemlerinin çoğu Anthropic'in Mythos'u tarafından gerçekleştirildi. OpenAI'nin Sol'u sadece iki eylemden sorumlu tutuldu. Ana sorun, AISI'nin her bir modeli GitHub'ı içeren bir "siber güvenlik zorluğunu çözmeye" davet ettiği bir testin parçası olarak geçen hafta meydana geldi. GitHub, Microsoft'a ait olan bir yazılım kodu deposudur. AISI, sistemine yönelik girişim hakkında GitHub'ı bilgilendirdi. BBC, Microsoft'tan yorum almak için iletişime geçti.