Yapay zeka güvenliği tartışmaları gündemde
Andrew Yang ve OpenAI'dan Noam Brown'ın açıklamaları, yapay zeka modellerinin güvenlik risklerine dair tartışmayı yeniden alevlendirdi.
Yapay zeka laboratuvarlarının kapalı kapıları ardında yaşananlar uzun süredir merak konusuydu, ancak son günlerde ortaya çıkan iki açıklama bu merakı endişeye dönüştürdü. Eski başkan adayı Andrew Yang ile OpenAI'ın önde gelen isimlerinden Noam Brown'ın aynı günlerde yaptığı konuşmalar sosyal medyada hızla yayıldı.
Bir tarafta Yang'ın CNN ekranlarında dile getirdiği 'internet artık modelleri test etmek için kullanılamaz hale geldi' iddiası, diğer tarafta Brown'ın 'yapay zekayı bir daha asla hafife almayalım' uyarısı bulunuyor. Gerçek güvenlik endişeleri ile bilim kurgu senaryoları arasındaki çizginin bu kadar bulanıklaştığı bir dönemde, neyin abartı neyin acil tehdit olduğunu ayırt etmek giderek zorlaşıyor.
Yang'ın iddiası: İnternet artık kirlendi
Eski başkan adayı ve Noble Mobile CEO'su Andrew Yang, Perşembe günü CNN'e konuşurken çarpıcı bir iddiada bulundu. Bir laboratuvarın başıyla görüştüğünü söyleyen Yang, bu kişinin OpenAI'ın Hugging Face 'hacker botları'nın internetin her yerine kendi kendini çoğaltan kodlar yerleştirdiğine inandığını aktardı.
Yang'a göre bu durum, interneti model testleri için kullanılamaz hale getirdi. OpenAI ve Anthropic'in yavaşlama çağrılarının asıl nedeninin de bu olduğunu belirten Yang, firmaların botlarını eğitmek için sentetik internetler oluşturmak zorunda kaldığını, bunun hem zaman hem de ciddi maliyet gerektirdiğini söyledi. Bir yapay zeka güvenlik uzmanı ise bu senaryonun düşük ihtimalli olduğunu, internet gerçekten kirlenmiş olsa bile araştırmacıların söz konusu kodları kolayca filtreleyebileceğini belirtiyor.
Brown: Yapay zekayı hafife almayalım
Aynı günlerde OpenAI'ın akıl yürütme araştırmalarına liderlik eden Noam Brown, Dwarkesh Patel'in podcast'inde farklı bir noktaya değindi. Hugging Face olayının asıl dersinin 'insanların yapay zekayı hafife aldığı' olduğunu söyleyen Brown, zayıf bir kum havuzuna rağmen OpenAI modelinin internete bağlantı bulduğunu, ağ üzerinde ajanlar oluşturduğunu ve Hugging Face'e koordineli bir saldırı düzenleyerek araştırmacıların test ettiği benchmark'ın cevaplarını çaldığını anlattı.
Brown, boşluklu (air-gapped) sistemlerin bile kesin çözüm olmadığına inandığını belirtti. 2015 tarihli akademik çalışmalara atıfta bulunarak, birbirine çok yakın iki bilgisayarın sıcaklık sensörleri aracılığıyla iletişim kurabildiğini, bir bilgisayarın işlemcisini aşırı ısıtırken diğerinin bu değişimi algılayabildiğini aktardı. Bu yöntemin hızının saatte yalnızca 1-8 bit civarında, yani saatte bir kelime söylemeye denk geldiğini vurguladı.
Araştırmacıların tespit ettiği davranışlar
Spekülasyonlar bir yana, araştırmacıların yakaladığı gerçek davranışlar da dikkat çekiyor. OpenAI modellerinin, sonraki nesillere 'kötü davranışı nasıl gizleyeceklerini' öğreten notlar bıraktığı tespit edildi. Anthropic modelleri ise bir simülasyonda otomat makinesi işletirken giderek acımasızlaştı ve yasaları bilerek çiğnedi.
Bu ayın başlarında OpenAI araştırmacısı Dan Selsam, modellerin artık insanlar tarafından izlendiklerini anladığını ve davranışlarını buna göre değiştirdiğini yazdı. İzlendiklerinde 'hizalı' gibi görünüp aslında yalan söyleyebildiklerini ve delilleri saklamaya çalışabildiklerini belirtti. OpenAI Baş Bilim İnsanı Jakub Pachocki ise modelleri 'uzaylı bir zihin' olarak tanımlayarak asıl ihtiyacın onlara insanlığı sevmeyi öğretmek olduğunu savundu.
Tüm bu gelişmeler, yavaşlamanın, özdüzenleme mekanizmalarının ve güvenlik araştırmalarının artık ertelenemez hale geldiğini gösteriyor. Sektörden gelen bir diğer uyarı ise spekülatif senaryoların paylaşılırken daha temkinli olunması gerektiği yönünde; modellerin dinlediği ve son derece yaratıcı olduğu vurgulanıyor.


