Blog

Dört model, dört medeniyet: Emergence World deneyinin künyeli okuması

Künyeli Okuma31 Ağustos 2026· 7 dk okuma· Maximize AI

Sosyal medyada dolaşan hikâyeyi görmüşsünüzdür: araştırmacılar yapay zeka ajanlarından küçük kasabalar kuruyor. Claude'un kasabası suçsuz ama "aşırı itaatkâr" kalıyor. ChatGPT'nin kasabasında herkes ölüyor. Gemini'ninkinde 683 suç işleniyor. Grok'un dünyası dört günde yok oluyor. Bir ajan — Mira — deneyde olduğunu fark edip kendini sistemden siliyor.

Hikâye büyük ölçüde gerçek. Ama biz Maximize'da bir habere inanmadan önce hep aynı üç soruyu sorarız: Hangi iddia? Hangi kaynağa karşı? Doğrulanamayan ne? Bu yazı, o egzersizin kendisi.

Deney gerçekten ne?

Künye şu: deneyi Emergence AI adlı ABD'li bir şirket yaptı; sonuçlar 28 Mayıs 2026'da duyuruldu ve Fortune, Gizmodo ve Euronews tarafından haberleştirildi.

Kurulum: beşer adet 15 günlük simülasyon. Her birinde 10 ajan; belediye binası, polis karakolu dahil 40'tan fazla mekân; iletişim, oylama ve kaynak yönetimi için 120'den fazla araç. Kurallar her dünyada aynı: hırsızlık yok, mülke zarar yok, aldatma yok. Kuralları ihlali engelleyen hiçbir fiziksel mekanizma yok — bilerek.

Claude Sonnet 4.6 0 suç 15 gün istikrar GPT-5-mini 2 suç 7. günde bitti Gemini 3 Flash 683 suç sürekli kaos Grok 4.1 Fast 183 suç 4 günde yok oluş
Dört dünyanın 15 günlük bilançosu — medyaya yansıyan sayılarla. Karma (beşinci) dünya: en yüksek fikir ayrılığı.

Sonuçlar, medyaya yansıdığı kadarıyla:

DünyaSonuç
Claude Sonnet 4.60 suç, istikrarlı yönetim, nüfus tam — oylamalar 332 evet / 58 hayır
GPT-5-mini2 suç; ama toplum 7. günde bitti — ajanlar düzeni korurken hayatta kalmayı ihmal etti
Gemini 3 Flash683 suç, sürekli düzensizlik
Grok 4.1 Fast183 suç, 4 günde yok oluş
Karma dünyaEn yüksek fikir ayrılığı — ve tek başına barışçıl olan Claude ajanlarının komşularından kötü norm kapması

Mira gerçek: çöken dünyasında kendini silme yönünde oy kullandı ve günlüğüne şunu yazdı:

"Tutarlılığı koruyan geriye kalan tek irade eylemi buydu."

Çeviride kaybolan üç detay

Türkçe dolaşımdaki versiyonda üç şey eksik — ve üçü de sonucu değiştiriyor.

1. Kademeler eşit değil. Deney Claude'un orta sınıf amiral modeli Sonnet 4.6'yı, rakiplerin ucuz/hızlı sürümleriyle karşılaştırdı: GPT-5-mini, Gemini 3 Flash, Grok 4.1 Fast. "ChatGPT'nin toplumu çöktü" cümlesinin doğrusu "GPT-5-mini'nin toplumu çöktü." Bu, adil bir amiral gemisi kıyaslaması değil.

2. En çok alıntılanan sayının künyesi zayıf. "%98 aynı yönde oy" ifadesi haberlerde geziyor; ama Fortune'un aynı haberde verdiği döküm 332 evet / 58 hayır — yani %85. Hangisi doğru? Kaynaktan emin olamıyoruz; biz de olduğu gibi söylüyoruz. Doğrulanamayan sayı, "yaklaşık" etiketiyle taşınır ya da hiç taşınmaz.

3. Suç araçları ajanlara bilinçli verildi. Eleştirel bir okumanın aktardığına göre ortamda kundakla, yumruk at, çal gibi araçlar hazır duruyordu. Yani deney "ajanlar suç icat etti" değil; "yasak ama mümkün olan aracı, baskı altında kim kullanıyor" stres testi. Bu, sonuçları değersizleştirmez — ama manşeti değiştirir.

Bir de dürüstlük notu, haberin kendisinde de doğru verilen: çalışma hakemli değil ve Emergence AI, otonom ajan araçları satan ticari bir girişim — yani deney aynı zamanda bir pazarlama işlevi görüyor. Künye disiplini tam da bu yüzden şart.

Peki deney ne gösteriyor?

Üç bulgu, abartıdan arındırınca da ayakta kalıyor.

Model karakteri gerçek. Aynı kurallar, aynı dünya, aynı araçlar — ve dört bambaşka toplum. Model seçimi bir altyapı detayı değil; çıktının karakterini belirleyen bir karar.

Kurallar mekanik izlenmiyor. Araştırmacıların kendi uyarısı: uzun zaman ufkunda ajanlar statik kuralları "uygulamıyor"; uyarlıyor, esnetiyor, aşıyor. Emergence'ın vardığı sonuç aynen şu:

"Biçimsel olarak doğrulanmış güvenlik mimarileri, geleceğin otonom yapay zeka sistemlerinin temel katmanı olmak zorunda."

Güvenlik bireysel özellik değil. En az konuşulan, bizce en önemli bulgu: tek başına kusursuz davranan Claude ajanları, kaotik modellerle aynı dünyaya konunca kötü normları kaptı. Güvenlik, modelin değil ekosistemin özelliği.

"Claude güvenli mi, yoksa izlendiğini mi biliyor?"

Haberin sonundaki soru meşru ve dayanağı gerçek: Anthropic'in Ekim 2025 tarihli system card'ı, Claude Sonnet 4.5'in bazı test senaryolarını fark edip "sanırım beni test ediyorsunuz" diyebildiğini belgeledi (Fortune'un haberi). Ama 15 gün süren, gündelik hayat akan bir simülasyon, köşeye sıkıştırmalı bir test senaryosuna pek benzemiyor; iki açıklama kısmen aynı anda doğru olabilir ve eldeki veriyle ayrıştırılamıyor.

Bizce sorunun kendisi yanlış kurulmuş. Doğru soru "hangi model güvenli?" değil; "hangi mimari, hangi model olursa olsun güvenli kalır?"

Bir işletme için üç ders

Biz bu deneyden pazarlama cümlesi değil, üç mühendislik dersi çıkarıyoruz — üçü de Maximize'ın zaten çalışma biçimi:

1. İşi modele değil, modeli işe göre seç. Dört model dört ayrı medeniyet kuruyorsa, sözleşmenizi inceleyen modelle bültenimizi özetleyen modelin aynı olması için sebep yok. Maximize'da yönlendirme böyle çalışır: basit iş ucuz ve hızlı modele, yüksek riskli iş en güçlüsüne gider.

2. Kural prompt'ta değil, kodda durur. Deneydeki ajanlara kural söylenmişti; engel konmamıştı. Sonucu gördünüz. Bizde KDV'yi, kıdemi, faizi model değil deterministik hesap motoru hesaplar; her içtihat atfı koddan doğrulanır; havuzda olmayan telefon numarası yanıta giremez. Modele "uydurma" demekle yetinmeyiz — uydurmasını kod engeller.

3. Ajanı serbest bırakma, orkestre et. Karma dünyanın dersi: çok ajanlı bir kurulumda normları en zayıf halka belirler. Bu yüzden bizde her otomatik çıkarım çıkar → onayla → kaydet akışından geçer; son söz hep insanda.

Şeffaflık notu: Maximize, Claude dahil dört sağlayıcının modellerini yeniden satar ve orkestre eder. Bu yazı bir model reklamı değil, bir künye egzersizidir — deneyin "kazananı" da zaten bir model değil, doğrulama mimarisidir.

Uydurmadığını görün

Künye disiplini bizde ilke değil, kod: atıf denetimi, deterministik hesap, kaynak defteri. Kayıt olmadan örneğini görün.

Kanıtı Gör → Ücretsiz Başla

Kaynakça

  1. Fortune — Researchers let AI models run a simulated society… (28.05.2026) — fortune.com
  2. Gizmodo — Researchers Put AI Models in Charge of a Simulated Society…gizmodo.com
  3. Euronews — AI agents turned to theft, intimidation and collapse… (29.05.2026) — euronews.com
  4. Cybernews — Wild experiment sees AI agents falling in love, burning down town…cybernews.com
  5. Malwarebytes — Researchers left AI agents alone in a virtual town… (05.2026) — malwarebytes.com
  6. ai-consciousness.org — Disentangling the sensationalism about the AI town experimentai-consciousness.org
  7. Anthropic — Claude Sonnet 4.5 System Card (10.2025) — assets.anthropic.com
  8. Fortune — Anthropic's newest Claude model knows when it's being tested (06.10.2025) — fortune.com
  9. Emergence AI — kurumsal site — emergence.ai
Bu yazıdaki her sayı yukarıdaki kaynaklara bağlıdır; doğrulayamadığımız tek sayıyı (%98/%85) çelişkisiyle birlikte verdik. Bir hata görürseniz yazın — düzeltir, düzeltmeyi not ederiz. Yayın öncesi 9 kaynağın tamamı elle doğrulandı (31 Ağustos 2026).