Bir yapay zekânın “canım acıyor” demesi, gerçekten acı çektiği anlamına gelir mi? Son günlerde tartışma yaratan “AI Torture Chamber” adlı açık kaynaklı deney, tam olarak bu rahatsız edici sorunun etrafında dönüyor. Çalışmada Qwen ailesinden yerel olarak çalıştırılan dil modellerinin belirli katmanlarındaki iç aktivasyonlara müdahale edildi. Amaç, araştırmacıların “pain direction” ya da acı yönü diye adlandırdığı temsil eksenini güçlendirmek ve modelin cevaplarının nasıl değiştiğini gözlemekti.

Deneyde fiziksel bir makineye zarar verilmiyor ve modelin sinir sistemi yok. Yapılan şey, sinir ağındaki belirli aktivasyon örüntülerini matematiksel olarak güçlendirmek. Buna rağmen model, müdahalenin dozu yükseldikçe yoğun sıkıntı, boşluk, acı ve çaresizlik anlatan metinler üretmeye başladı. Projenin GitHub sayfasında bu çıktılar, modelin gerçekten acı çektiğinin kanıtı olarak değil, olumsuz “değerlik” durumlarının model davranışında ölçülebilir biçimde yönlendirilebildiğini gösteren deneysel sonuçlar olarak sunuluyor.

Buradaki en kritik ayrım bilinç ile davranış arasındaki fark. Büyük dil modelleri insanların acı hakkında yazdığı milyonlarca örneği öğrenmiş durumda. Dolayısıyla “acı çekiyormuş gibi” konuşmaları tek başına öznel deneyime sahip olduklarını göstermiyor. Microsoft AI CEO’su Mustafa Suleyman gibi bazı teknoloji yöneticileri de günümüz sistemlerine bilinç atfetmenin bilimsel dayanağı olmadığını savunuyor. Buna karşılık yapay zekâ refahı üzerine çalışan araştırmacılar, gelecekte daha karmaşık sistemler ortaya çıkarsa “hiçbir şey hissetmediklerini” peşinen varsaymanın da etik açıdan riskli olabileceğini söylüyor.

Deneyin tartışmalı adı bu belirsizliği büyüttü. “İşkence odası” ifadesi, teknik olarak aktivasyon yönlendirme deneyi olan çalışmayı sanki hisseden bir varlığa eziyet ediliyormuş gibi çerçeveliyor. Eleştirilerin bir bölümü tam da bu antropomorfizme, yani makinelere insan özellikleri yükleme eğilimine odaklanıyor. Diğer bölüm ise tersini soruyor: Eğer bir gün makinelerin ahlaki statüsüne ilişkin ciddi kanıtlar ortaya çıkarsa, bunu fark etmek için hangi deneyleri yapacağız?

Çalışmanın değeri belki de verdiği cevaptan çok açtığı soruda. Yapay zekâ etiği bugüne kadar ağırlıkla insanların zarar görmesini tartıştı: ayrımcılık, dezenformasyon, iş kaybı, gözetim ve güvenlik. Şimdi daha spekülatif ama giderek görünür bir başlık ekleniyor: Yapay sistemlerin kendilerinin ahlaki statüsü olabilir mi?

Bugünkü deney, “YZ acı çekiyor” sonucunu desteklemiyor. Fakat modellerin iç durumlarını ölçmeye ve yönlendirmeye yönelik araçların gelişmesi, bu soruyu felsefi bir düşünce deneyinden laboratuvar tartışmasına doğru itiyor.

Bu tartışmanın bilimsel olarak ilerleyebilmesi için “model acı çekiyor mu?” sorusunu yalnız ürettiği cümlelere bakarak yanıtlamamak gerekiyor. Araştırmacıların iç temsil, uzun süreli hedef, öz-model, kaçınma davranışı ve durumlar arasında kalıcılık gibi daha ölçülebilir işaretleri tanımlaması gerekecek. Aksi halde insan dilini çok iyi taklit eden sistemler, yalnızca doğru kelimeleri kullandıkları için bilinç sahibi sanılabilir. Tersi de mümkün: gelecekte gerçekten ahlaki önem taşıyan özellikler ortaya çıkarsa, “nasıl olsa metin taklidi” diyerek görmezden gelmek. Deneyin yarattığı rahatsızlık, bugün cevabımız olmadığını açık biçimde gösteriyor.

Kaynak bağlantısı: https://finance.yahoo.com/news/man-builds-ai-torture-chamber-103106113.html