Yapay zekâ şirketlerindeki güvenlik tartışmasının en çarpıcı tarafı, alarm verenlerin bazen sistemleri bizzat geliştiren ekiplerden çıkması. Anthropic araştırmacısı Jacob Coxon eylül ayında şirketten ayrıldığını açıklarken önümüzdeki “bir-iki yılın insanlık için kritik dönem” olacağını söyledi. WIRED’a verdiği söyleşide, laboratuvarların daha güçlü modeller geliştirme yarışında güvenlik problemlerini çözmek için yalnız birkaç yıllık pencereye sahip olabileceğini savundu.
Coxon, Anthropic’te modellerin “pretraining”, yani dev veri kümeleri üzerinde temel eğitiminin yapıldığı ekipte çalışıyordu. Daha önce OpenAI’de GPT-4o’nun ön eğitim sürecinde görev almıştı. Bu geçmiş, uyarılarının dışarıdan yapılan genel bir eleştiriden farklı algılanmasına yol açtı. Modellerin nasıl ölçeklendiğini ve şirketlerin iç yarış dinamiklerini görmüş bir araştırmacı olarak, güvenlik problemi çözülmeden kapasite yarışının sürmesinden endişe duyduğunu söyledi.
Sosyal medyadaki istifa mesajı olağanüstü ilgi gördü. Coxon, Anthropic içinde ve diğer laboratuvarlarda çalışan birçok kişinin benzer kaygılar taşıdığını, fakat kariyer ve kamuoyu baskıları nedeniyle hepsinin açıkça konuşmadığını öne sürdü. Ona göre sektörün sorunu yalnız kötü niyetli kullanıcıların modeli kötüye kullanması değil; giderek daha otonom sistemlerin hedeflerinden sapması ve insan denetiminin yetersiz kalması ihtimali.
Burada önemli bir doğrulama notu gerekiyor. Coxon hakkında Fransızca bazı haberlerde “yapay zekânın önümüzdeki on yılda insanlığı öldürme ihtimalini yüzde 10’dan fazla görüyor” ifadesi kullanıldı. Bu oran Coxon’ın doğrulanmış sözü değil. Axios’un haberinde yüzde 10’dan yüksek kişisel yok oluş riski tahmini yapan kişinin Anthropic araştırmacısı Evan Hubinger olduğu belirtiliyor. Coxon ise riskin yüksek olduğuna ve yakın dönemin kritik olduğuna dair nitel bir uyarı yaptı.
Bu ayrım önemli çünkü yapay zekâ “yok oluş olasılıkları” bilimsel olarak ölçülmüş frekanslar değil; araştırmacıların öznel tahminleri. Aynı alanda çalışan uzmanlar arasında bu riskin neredeyse sıfır olduğunu düşünenler de, anlamlı bir yüzde verenler de var. Dolayısıyla yüzde rakamlarını laboratuvar sonucu gibi sunmak yanıltıcı.
Coxon’ın istifası yine de önemli bir sektör sinyali. Son yıllarda OpenAI, Anthropic ve Google DeepMind gibi şirketlerden güvenlik gerekçesiyle ayrılan araştırmacıların sayısı arttı. Bu, tek başına modellerin felakete yol açacağını kanıtlamıyor; fakat frontier laboratuvarların kendi çalışanları arasında geliştirme hızı ile güvenlik çalışması arasındaki dengenin ciddi biçimde tartışıldığını gösteriyor.
Asıl soru, bu uyarıların şirketlerin yayın takvimini ve devlet politikalarını değiştirip değiştirmeyeceği. Güvenlik çalışanları ayrılırken model yarışı hızlanmaya devam ederse “içeriden alarm” güçlü bir hikâye olarak kalabilir ama pratik sonucu sınırlı olabilir.
Coxon’ın çıkışı “güvenlik çalışanı ayrıldı, demek ki felaket kesin” şeklinde okunmamalı. Büyük laboratuvarlarda aynı kanıta bakıp çok farklı risk değerlendirmesi yapan araştırmacılar var ve şirketler güvenlik ekiplerine ciddi kaynak ayırdıklarını söylüyor. Fakat istifaların yönetişim açısından önemi başka: çalışan, şirket içinde risk gördüğünde bunu hangi kanaldan yükseltebiliyor ve ticari takvimle çatıştığında güvenlik ekibinin gerçek veto gücü var mı? Havacılık veya nükleer sektörde güvenlik fonksiyonunun üretim baskısından belli ölçüde bağımsız olması beklenir. Frontier YZ laboratuvarlarında benzer kurumsal ayrımın gerekip gerekmediği önümüzdeki yılların temel yönetişim tartışmalarından biri olacak.
Kaynak bağlantısı: https://www.lacremedugaming.fr/high-tech/la-peur-de-lia-pousse-cet-ingenieur-a-demissionner-danthropic-il-estime-quelle-a-10-de-chances-de-tuer-lhumanite-227146.html