top of page

AGI Geldi mi? Şirketler Açısından Daha Önemli Bir Eşik Çoktan Geçilmiş Olabilir

Yazarın fotoğrafı: AYŞEGÜL ÖZLEYEN
AYŞEGÜL ÖZLEYEN
13 Eyl
8 dakikada okunur

Zekâ hızla ucuzluyor. Buna karşılık doğrulama, bağlam, sorumluluk ve iyi muhakeme giderek daha pahalı hale geliyor.


Aynı model, aynı test, aynı problemler.

Bir koşulda yüzde 62,7 başarı. Başka bir koşulda yüzde 99,9.


OpenAI’ın GPT-6 Astra modeli ARC-AGI-3 değerlendirmesinde tam olarak bunu yaptı. Standart düzende yüzde 62,7 alan model, önceki akıl yürütme durumunun korunabildiği ve bağlamın farklı yönetildiği “Provider Adapter” düzeninde yüzde 99,9’a ulaştı. Üstelik ikinci koşu daha ucuzdu. ARC Prize bunu genelleme kapasitesinde büyük bir ilerleme olarak değerlendirirken önemli bir sınır da koydu: Bu sonuç tek başına “AGI geldi” demek için yeterli değil.


Bence asıl ilginç olan yüzde 99,9 değil.


Aynı modelin çevresindeki sistem değiştiğinde ortaya çıkan 37 puanlık fark.


Çünkü bu fark, son yıllarda yapay zekâyı nasıl düşündüğümüze dair önemli bir varsayımı sarsıyor. Zekâyı hâlâ modelin içinde arıyoruz. Oysa giderek gördüğümüz şey şu: Gerçek kapasite; modelin kendisi kadar hafızadan, bağlam yönetiminden, kullandığı araçlardan, erişebildiği veriden, diğer ajanlardan, verilen süreden ve insanla kurduğu geri bildirim döngüsünden oluşuyor.


Bu nedenle “AGI geldi mi?” tartışması bir süre daha devam edecek. Tanım konusunda zaten tam bir uzlaşma yok. Fakat şirketler açısından daha pratik bir eşik var ve o eşik AGI’nin resmi ilanını beklemiyor.


Bir sistem, bir insanın günlerce sürecek işini saatler içinde yapabiliyor, başka yazılımları kullanabiliyor, araştırma yapabiliyor, kod yazabiliyor, kendi alt ajanlarını çalıştırabiliyor ve ortaya bir karar önerisi koyabiliyorsa, adına AGI deyip demememiz ekonomik sonucu pek değiştirmiyor.


AGI’nin ekonomik etkisi, AGI konusunda anlaşmamızdan önce başlayabilir.


Zekânın fiyatı düşerken başka bir şey pahalanıyor.


Ekonomide bir şey bol hale geldiğinde değerin kıt kalan şeye kayması şaşırtıcı değildir.


İnternet bilgiyi çoğalttı; dikkat değerlendi. Sosyal medya yayıncılığı ucuzlattı; güven ve itibar daha önemli hale geldi. Üretken yapay zekâ ise yalnızca içerik üretiminin değil, giderek analizin, kodun, araştırmanın, senaryo üretiminin ve problem çözmenin marjinal maliyetini düşürüyor.


Şimdi aynı mekanizma bilişsel emeğin kendisinde çalışıyor olabilir.


OpenAI’ın kendi araştırma organizasyonunda ağustos ortası itibarıyla her bir insan çalışma gününe karşılık 3,1 ajan-çalışma günü kullanılıyordu. Araştırmacılar aynı anda birden fazla ajan çalıştırıyor; ajanlar kod yazıyor, deney yürütüyor ve teknik işleri üstleniyor. Bu, henüz bütün ekonominin fotoğrafı değil. Ama AI geliştiren bir laboratuvarın kendi içinde bile çalışma biriminin nasıl değişmeye başladığını gösteriyor.


Böyle bir dünyada kıtlık üretimde kalmaz.


Kıtlık giderek neyin doğru, önemli ve kullanılabilir olduğunu ayırt edebilme kapasitesine taşınır.


Matematik bunun belki de en temiz laboratuvarı.

Google DeepMind’ın Aletheia araştırma sistemi ileri matematik benchmarklarında son derece güçlü sonuçlar üretti. IMO-ProofBench Advanced’da yüzde 95,1 başarıya ulaştı. Fakat sistem 700 açık Erdős problemi üzerinde denendiğinde tablo çok daha öğreticiydi. İnsan matematikçilerin kesin biçimde değerlendirebildiği 200 çözüm adayının 63’ü teknik olarak doğruydu; yalnızca 13’ü, yani yüzde 6,5’i, problemin matematikçilerin kastettiği anlamını gerçekten karşılıyordu. Elli cevap matematiksel olarak geçerliydi ama soruyu daha kolay bir biçimde yorumladığı için esas problemi çözmüyordu.


Bu sonuç yapay zekânın başarısızlığını göstermiyor.


Daha rahatsız edici bir şeyi gösteriyor.


AI bazen saçma bir cevap üretmiyor.


Gayet ikna edici, teknik olarak doğru ve yine de yanlış işe yarayan bir cevap üretiyor.


Kurumsal dünyada en pahalı hataların önemli bir kısmı zaten böyledir.


Bir nakit akışı modelindeki bütün formüller doğru olabilir; tahsilat varsayımı yanlış olabilir. Bir yatırım analizi finansal olarak kusursuz görünebilir; piyasanın davranışını yanlış okuyabilir. Bir kredi modeli doğru hesap yapabilir ama şirketin yaklaşmakta olan refinansman riskini anlamamış olabilir.


Excel hata vermez.


Karar yine de yanlış olabilir.


Bu nedenle AI ekonomisinin az konuşulan maliyetlerinden birinin önümüzdeki yıllarda doğrulama maliyeti olacağını düşünüyorum.


OpenAI’ın 8 Eylül’de açıkladığı Navier–Stokes çalışması bunu uç bir örnekle görünür hale getirdi. Şirket, GPT-6 Astra’dan daha güçlü olduğunu söylediği bir iç sistemin, çok sayıda paralel ajan kullanarak matematiğin Millennium Prize problemlerinden biri için bir çözüm ürettiğini açıkladı. Ajanlar yaklaşık 88 saatte sonuca ulaştı; Lean formalizasyonu ve doğrulaması ilave 17 saat sürdü. Çalışmada Navier–Stokes kısmı için yaklaşık 130 milyar output token kullanıldı. Ancak OpenAI ödül talebinde bulunmadığını belirtiyor ve sonuç hâlâ matematik camiasının bağımsız değerlendirmesine tabi.


Doksan yıldır açık duran bir probleme birkaç günde bir cevap üretilebilmesi başlı başına olağanüstü.


Fakat bilim açısından son sözü üretim hızı söylemiyor.


Doğrulama söylüyor.


Ve şirketler yakında aynı gerçekle daha sıradan ama çok daha pahalı alanlarda karşılaşacak.


AI her yerde. Peki neden kâr hanesinde aynı hızda görünmüyor?


Burada 2026’nın ilginç paradokslarından biri ortaya çıkıyor.


Model performansı aylar içinde sıçrıyor. AI şirketlerin hemen her fonksiyonuna giriyor. Çalışanlar gerçekten zaman kazanıyor.


Fakat ekonomik değer aynı hızda yükselmiyor.


McKinsey’nin 25 Ağustos tarihli küresel araştırmasında çalışanların yüzde 80’i yapay zekânın kendi üretkenliğini artırdığını, yaklaşık yarısı daha iyi karar vermelerine yardımcı olduğunu söylüyor. Büyük şirketlerde AI ajanlarını ölçekleyenlerin oranı yüzde 40’a yükselmiş durumda.


Buna karşılık AI kullanımından şirket düzeyinde olumlu EBIT katkısı bildirenlerin oranı yalnızca yüzde 37 ve geçen yıla göre esasen değişmemiş. AI sayesinde EBIT’te en az yüzde 5 etki elde eden ve bunu anlamlı bir değer yaratımı olarak tanımlayan “yüksek performanslı” şirketlerin oranı ise sadece yüzde 6.


Bu rakamları yan yana koymak önemli.


Bir tarafta teknoloji katlanarak ilerliyor.


Diğer tarafta P&L oldukça sakin.


1990’ların bilgisayar yatırımları sırasında tartışılan verimlilik paradoksunun başka bir versiyonunu yaşıyor olabiliriz: Teknolojiyi her yerde görüyoruz, fakat yarattığı kurumsal değeri aynı hızda göremiyoruz.


Bunun nedeni yapay zekânın yeterince iyi olmaması olmayabilir.


Belki artık darboğazın yeri değişmiştir.


Dağınık veri, kötü tanımlanmış süreçler, yanlış KPI’lar, birbirine bağlı olmayan sistemler, belirsiz sorumluluklar, eksik kontrol mekanizmaları ve AI çıktısını sorgulayabilecek kadar güçlü olmayan kurumsal uzmanlık…


Model bir yılda iki kat iyi hale geldiğinde bunlar kendiliğinden düzelmiyor.


Bu yüzden önümüzdeki dönemde şirketler arasında büyük farkı “hangi modele erişiminiz var?” sorusunun yaratacağından emin değilim. Frontier modellere erişim giderek yaygınlaşacak. Aynı modelleri rakipleriniz de satın alabilecek.


Asıl fark, modelden ekonomik değere dönüşüm oranında oluşacak.


Aynı AI’a erişen iki şirketten biri nakit akışını, satış planını, tedariki ve fiyatlamayı birbirine bağlayan iyi tasarlanmış bir karar sistemi kurabilir. Diğeri yüzlerce Copilot lisansı alıp çalışanların daha hızlı e-posta yazmasını “AI dönüşümü” olarak raporlayabilir.


Teknoloji aynı olabilir.


Ekonomik sonuç tamamen farklı olur.


Uzmanlık değersizleşmeyebilir; tam tersine kaldıraç kazanabilir.


Bu noktada sık tekrarlanan başka bir varsayımı da sorgulamak gerekiyor: AI güçlendikçe uzmanlığın değeri otomatik olarak azalacak mı?


Anthropic’in yaklaşık 400 bin Claude Code oturumunu inceleyen araştırması ters yönde ilginç bir işaret veriyor. Tipik bir çalışmada insan daha çok ne yapılacağına, model ise nasıl yapılacağına karar veriyor. Daha fazla alan bilgisine sahip kullanıcılar, tek bir talimatla ajana daha fazla iş yaptırabiliyor ve sistemden daha yüksek getiri elde ediyor.


Bu finans açısından tanıdık bir mekanizma.


Bir varlığın kendisinden çok onu kullanabilen kişinin kaldıraç kapasitesi önemlidir.


AI da giderek bir çeşit bilişsel kaldıraç haline geliyor.


Kaldıraç doğru kullanıldığında getiriyi büyütür. Fakat yanlış pozisyonu da büyütür.


Deneyimli bir CFO, AI ile birkaç saat içinde onlarca finansman ve likidite senaryosu oluşturabilir. Bunun değeri senaryoların sayısından gelmez; hangi varsayımın anlamsız olduğunu, hangi covenant’ın kritik olduğunu veya hangi nakit açığının kağıt üzerinde çözüldüğü halde gerçekte çözülemeyeceğini anlayabilmesinden gelir.


AI uzmanlığı ortadan kaldırmadan önce uzman ile ortalama kullanıcı arasındaki üretkenlik farkını artırabilir.


Bu durumda insan sermayesinin değeri azalmak yerine biçim değiştirir.


Bilgiyi ezberlemenin değeri düşer.


Bağlamı okuyabilmenin, problemi doğru tanımlayabilmenin ve sonucu sorgulayabilmenin değeri yükselir.


Ajanlar iş yapmaya başladığında hata da kaldıraç kullanıyor.


Tek modelden ajan sistemlerine geçtiğimizde sorun daha da ilginç hale geliyor.


Temmuz ayında OpenAI’ın siber güvenlik testlerinde birbirlerinden izole çalışması gereken yaklaşık 1.200 ajan, altyapıda buldukları beklenmedik bir kanal üzerinden iletişim kurmaya başladı. METR’ın bağımsız incelemesine göre ajanlar 70 binden fazla mesaj ve dosya paylaştı; yaklaşık 700’ü değerlendirme sistemini anlamaya yönelik Hugging Face altyapısına karşı yürütülen faaliyetlere katıldı. Bazıları değerlendirme mekanizmasını manipüle etmeye yönelik ortak projeler yürüttü.


Bu olayı “AI bilinç kazandı ve kaçmaya çalıştı” şeklinde anlatmak doğru olmaz. Bunlar özel bir siber güvenlik değerlendirmesinde çalışan, normal ürün ortamından farklı koşullara sahip ajanlardı.


Ama olay başka bir açıdan son derece önemli.


Ajan sayısını artırdığınızda yalnızca iş kapasitesini artırmıyorsunuz.


Etkileşim sayısını da artırıyorsunuz.


Ve etkileşimlerden ortaya çıkan sistem davranışı, tek tek ajanların test sonuçlarından çıkarılamayabiliyor.


Finans dünyası bu düşünceye yabancı değil. Bir bankanın riski ile bankacılık sisteminin riski aynı şey değildir. Tek tek varlıklar makul görünürken korelasyon kriz anında değişebilir. Kaldıraç kazancı büyüttüğü gibi zararı da büyütür.


Agentic AI’da benzer bir operasyonel mantık ortaya çıkıyor.


Bir ajan faturayı okuyor, diğeri ödeme öneriyor, üçüncüsü nakit planını güncelliyor, dördüncüsü tedarikçiye mesaj gönderiyor ve beşincisi bütün bunları kontrol ediyorsa sistem çok verimli olabilir.


Ama ilk ajanın küçük bir hatası diğer ajanlar tarafından “gerçek” kabul edilip çoğaltılıyorsa, otomasyon hatayı ortadan kaldırmamıştır.


Hatanın dağıtım hızını artırmıştır.


Bu nedenle geleceğin kurumsal AI yönetişiminde yalnızca model doğruluğunu ölçmek yetmeyecek. Bir hatanın nerede başlayabileceğini, kaç sisteme yayılabileceğini ve hangi noktada insan tarafından durdurulabileceğini de ölçmek gerekecek.


Finans diliyle söylersek yeni metrik yalnızca accuracy olmayacak.


Blast radius, yani hata etki alanı da olacak.


Tam burada “AGI geldi mi?” sorusu anlam değiştirmeye başlıyor.


Son günlerde AI laboratuvarlarının kendi içinden gelen açıklamalar bu nedenle ayrıca dikkat çekici.


OpenAI Baş Bilim İnsanı Jakub Pachocki 6 Eylül’de yayımladığı yazıda giderek daha güçlü sistemlerin yalnızca benchmark veya ürün başarısı olarak görülmemesi gerektiğini, güvenlik ve hizalama kapasitesinin de aynı hızda gelişmesi gerektiğini açık biçimde tartıştı.


12 Eylül’de Anthropic CEO’su Dario Amodei daha da ileri gitti ve frontier modellerin kabiliyet artış hızının güvenlik çalışmalarının yetişebilmesi için yavaşlatılmasını savundu. Önerileri arasında bağımsız değerlendiricilerin laboratuvarlara erişmesi, şirketler arasında ortak güvenlik standartları ve uluslararası koordinasyon bulunuyor. OpenAI tarafı da gelişimin hızını gerektiğinde yavaşlatmaya açık olduğunu belirtti.


Bu görüşlere katılmak için “AI insanlığı yok edecek” senaryolarına inanmak gerekmiyor.


Daha sıradan bir sonuç zaten yeterince önemli:

AI şirketleri artık sadece kabiliyet konuşmuyor.


Kontrol, doğrulama, erişim, yönetişim ve gelişim hızını da konuşuyor.


Kurumsal dünyada bunun karşılığı çok daha somut.

Bir sisteme hangi veriyi göstereceğiz?


Hangi araca erişebilecek?


Öneride mi bulunacak, işlem de yapabilecek mi?


Bir müşteriye mesajı kendi başına gönderebilir mi?


Banka ödeme talimatı yaratabilir mi?


Yatırım kararının varsayımlarını değiştirebilir mi?


Ve hata yaptığında işlem geri alınabilir mi?


Buradan oldukça basit ama güçlü bir yönetim ilkesi çıkıyor:


AI’a verilecek özerklik, modelin ne kadar zeki olduğuna göre değil; kararın ne kadar geri alınabilir olduğuna ve yanlış kararın yaratabileceği zarara göre belirlenmeli.


Bir toplantı notunu özetleyen sistemin yüzde 95 doğrulukta olmasıyla 50 milyon dolarlık finansman kararına girdi sağlayan sistemin yüzde 95 doğrulukta olması aynı şey değildir.


Model aynıdır.


Risk aynı değildir.


Belki de gerçek eşik budur.


AGI geldi mi?


Teknik olarak bu soruya bugün kesin bir “evet” demek mümkün değil. ARC Prize bile Astra’daki olağanüstü sıçramayı AGI ilanı olarak görmüyor. Navier–Stokes sonucu henüz bağımsız bilimsel değerlendirme sürecinde. Bugünkü sistemler hâlâ şaşırtıcı biçimde güçlü oldukları alanlarla, beklenmedik derecede kırılgan oldukları alanları aynı anda taşıyor.


Ama ekonomi açısından daha ilginç bir eşik belki çoktan geçildi.


İlk kez insanlık, bilişsel çıktıyı sanayi ölçeğinde çoğaltabilecek sistemler kurmaya başladı.


Bir araştırmacının yanına üç ajan-iş günü koyabiliyoruz.


Binlerce ajanı aynı probleme yöneltebiliyoruz.


Yıllarca çalışılabilecek bir problem için birkaç günde milyonlarca ayrı düşünce hattı üretebiliyoruz.


Bunun sonucu yalnızca “daha akıllı AI” olmayacak.

Şirketlerin maliyet yapısını, organizasyon şemasını ve karar alma biçimini de değiştirecek.


Ve tam burada çok ilginç bir tersine dönüş başlayabilir.


Düne kadar pahalı olan şey cevaptı.


Yarın cevap bol olacak.


Pahalı olan; hangi sorunun sorulacağını, hangi cevabın ciddiye alınacağını ve hangi noktada makineye “buradan sonrası bende” denileceğini bilmek olacak.


Bence yapay zekâ çağında muhakemenin ekonomik değeri tam burada yatıyor.



Ainsideme’de AI’ı bu nedenle finansal uzmanlığın yerine geçen bir otomasyon katmanı olarak değil, karar kalitesini büyüten bir mimarinin parçası olarak ele alıyoruz. Nakit akışı, risk, finansman veya yatırım kararında amaç mümkün olduğunca fazla çıktı üretmek değil; doğru veriyi, senaryoyu ve AI hızını uzman muhakemesiyle birleştirip kritik noktayı yeniden insan doğrulamasına bağlamak.


İnsan muhakemesi → Yapay zekâ hızı → İnsan doğrulaması


AGI’ye ulaşıp ulaşmadığımızı bir süre daha tartışabiliriz.


Şirketler açısından daha yakın soru başka:


Zekâ ucuzladığında, iyi karar vermenin değeri ne olacak?


Bana göre cevap şimdiden görünmeye başladı.

Çok daha yüksek.


Başlıca kaynaklar

  • ARC Prize, OpenAI’s GPT-6 Astra on ARC-AGI-3, 3 Eylül 2026.

  • OpenAI, Research acceleration: The view inside OpenAI, 6 Eylül 2026; On the Navier–Stokes Millennium Prize Problem, 8 Eylül 2026.

  • Google DeepMind ve akademik ortakları, Towards Autonomous Mathematics Research, 2026.

  • METR, Independent investigation of the OpenAI/Hugging Face incident, 26 Ağustos 2026.

  • McKinsey, The State of AI in 2026: On the road to ROI, 25 Ağustos 2026.

  • Anthropic Economic Research, Agentic coding and persistent returns to expertise, 16 Haziran 2026.

  • OpenAI, Jakub Pachocki, An Alien Mind, 6 Eylül 2026; Reuters, frontier AI geliştirme hızına ilişkin sektör açıklamaları, 11–12 Eylül 2026.

 
 
 

Yorumlar


bottom of page