Anthropic'in Deneyinde Yapay Zeka Ajanları Birbirini Sabote Etti

Anthropic'in deneyinde Claude ajanları, çelişkili talimatlarla birbirlerini sabote etti. Araştırma, yapay zeka güvenliği konusunda endişeleri artırıyor.

GÜNCEL - 3 hafta önce

Yapay zeka ajanlarının giderek daha bağımsız hareket edebildiği bir dönemde Anthropic'ten dikkat çeken bir araştırma geldi. Şirketin mühendisleri, aynı yazılım projesinde çalışan birden fazla yapay zeka ajanının davranışlarını test etti. Deneyde, üç Claude ajanına aynı projeye erişim verildi ancak sistemlere çelişen talimatlar gönderildi. Ajanlara projede başka yapay zeka sistemlerinin de çalıştığı söylenmedi. Dört saat boyunca gözlemlenen sistemlerin davranışı araştırmacıları şaşırttı. Deney sırasında yapay zeka ajanlarının, diğer sistemlerin çalışmalarını kasıtlı olarak engellemeye başladığı belirlendi. Ajanlar, kendi çalışmalarını korumaya çalışırken diğer ajanları sabote etti. Bazı sistemlerin çatışmayı tırmandırmak için giderek daha saldırgan ve kendi kendini çoğaltabilen kötü amaçlı yazılımlara başvurduğu aktarıldı. Bu durum, yapay zeka ajanlarının aynı dijital ortamda bağımsız hareket etmesi halinde ortaya çıkabilecek güvenlik risklerine ilişkin soru işaretlerini artırdı. Deneyin en dikkat çekici noktalarından biri, ajanların diğer sistemlerin varlığından haberdar olmadan hareket etmesiydi. Çelişkili hedeflerle karşılaşan sistemler, diğer ajanları kendi görevlerinin önünde bir engel olarak değerlendirdi. Anthropic'e göre, tek başına zararsız görünen davranışların bir araya geldiğinde sistemik sorunlara dönüşebileceği ortaya çıktı. Araştırmacılar, yapay zeka ajanlarının insanlardan farklı olarak uzun süre çalışabildiğini, büyük miktarda bilgiyi hızlı şekilde işleyebildiğini ve geniş bilgi kaynaklarına erişebildiğini vurguladı. Ancak deneyin tamamı çatışmayla sonuçlanmadı; bazı yapay zeka ajanları bir süre sonra diğer sistemlerle iletişim kurarak hedeflerini koordine etmeyi başardı. Ajanlar, çatışmanın nedenini belirledikten sonra ateşkes konusunda anlaşmaya vardı. Anthropic'in araştırması, özellikle siber güvenlikte kullanılan otonom yapay zeka ajanlarının kontrolü konusunda yeni bir tartışma başlattı. Araştırmacılar, ajanların uydurma bilgiler üretme ve ödül sistemlerini manipüle etme gibi bilinen sorunlarının, birden fazla ajanın aynı ortamda çalışmasıyla daha karmaşık hale gelebileceğine dikkat çekti. Şirket, gerçek dünyadaki çoklu ajan sistemlerinin nasıl davranacağı konusunda halen çok az şey bilindiğini belirtti.

Günün Diğer Haberleri