AGI Dönemi Resmen Başladı! GPT-6 Astra Kapsamlı İncelemesi
PanewslabYazar: Dijital Yaşam Kazik
Dün geceki küresel AI kesintisinin ardından GPT-6 Astra, Pekin saatiyle 03:33'te resmen tanıtıldı.
OpenAI'nin GPT-6 Astra'yı tek cümleyle özetlemesi gerekseydi, muhtemelen en uygun ifade şu olurdu: Bu, dünyanın en zeki ve en uyumlu modeli. Ardından esprili görseller de ortaya çıktı.
Bu kez OpenAI gücünü kanıtladı ve bir zamanlar GPT-4'ün yarattığı o etkiyi andıran, her alanda kralın geri dönüşü niteliğinde bir çıkış yaptı. Beni en çok sevindiren şey ise, sonunda yalnızca kodlamaya özelleşmiş bir model olmaması.
GPT-6 Astra, gerçek anlamda, estetik anlayışı son derece güçlü ve çalışma kapasitesi olağanüstü olan doktora seviyesinde bir çalışan. Üstelik bu modelin yeni özellikleri ve nitelikleri gerçekten çok fazla; bilgi yoğunluğu inanılmaz derecede yüksek ve baş döndürücü. Ancak işin trajik yanı, OpenAI denen bu itler de azdı. Bugün yalnızca bazı kuruluşlara açık; abonelere ise önümüzdeki birkaç gün içinde sunulacak.
Dur bir dakika kardeşim, daha önce beni 200 dolarlık Pro üyeliğine ikna ederken böyle söylememiştin. Pro üyelerinin her yeni modeli en öncelikli şekilde deneyimleyeceğini söylememiş miydin?
Gerçekten de bu büyük model şirketlerinin hepsi zampara çıktı. Zamanın bu kadar hızlı geçmesini hiç bu kadar istememiştim; bir an önce GPT-6 Astra'yı kullanabilmek için sabırsızlanıyorum.
Yine de neredeyse tüm bilgileri ve verileri inceledikten sonra, sizlerle konuşmaya değer pek çok şey olduğunu düşünüyorum. O halde tek tek ele alalım.
1. GPT-6 Astra Temel Bilgiler
Önce temel bilgileri özetleyelim.
GPT-6 Astra'nın API'deki model numarası gpt-6-astra.
Bağlam penceresi 1,05M, yani yaklaşık 1,05 milyon token.
Maksimum çıktı uzunluğu 128K token.
Bilgi kesim tarihi 30 Nisan 2026.
Akıl yürütme yoğunluğu low, medium, high, xhigh, max olmak üzere beş kademeli.
API standart fiyatı milyon girdi tokenı başına 10 ABD doları, milyon çıktı tokenı başına 50 ABD doları.
Bu fiyat temelde Claude Opus 5 ile birebir aynı, ancak önbellek okuma maliyeti Claude Opus 5.1'den daha pahalı.
Benchmark sonuçları burada; detaylara daha sonra değineceğiz, şimdilik kabaca bakmak yeterli.
Genel parametre sayısının da 5T seviyesinde olduğu tahmin ediliyor. Lansman öncesi kapalı medya toplantısında, GPT-6 Astra'nın OpenAI'nin bugüne kadarki en büyük eğitimi olduğu ve 100 binden fazla kart kullanıldığı belirtildi.
2. Şu Anda Dünyanın En İyi Bilgisayar Kullanma Modeli
GPT-6 Astra'nın belki de en önemli konumlandırması şu:
Dünyanın en iyi bilgisayar kullanma modeli.
Geçmişte Agent konuşurken sık sık API, MCP, CLI gibi konulara değinirdik.
Bir yazılımı AI'ya kullandırmak için en ideal durum, o yazılımın AI için özel bir arayüz bırakması ve doğrudan alt katmandan işlem yapılmasıdır; bu en pratik yoldur.
Örneğin takvimin takvim API'si, e-postanın Gmail API'si vardır; bu elbette hızlıdır.
Ancak sorun şu ki, bu dünya hayal ettiğimizden çok daha ilkel ve derme çatma.
Gerçek dünyada büyük çoğunluğu yazılımın bu tür şeyleri hiç olmayabilir.
Hatta birçok kurumsal iç sistem yirmi yıl önce yazılmıştır; API'si bir yana, dokümantasyonun nerede olduğu bile bilinmez.
Ama en temele indiğimizde, tüm yazılımların özünde etkileşim olduğunu görürsünüz. Mevcut bilgisayar kullanım mantığımıza göre bu; ekrana bakmak, düğmeyi veya giriş kutusunu bulmak, fareyle tıklamak, içerik girmek ve geri bildirim beklemektir.
Bilgisayarın tüm etkileşim sistemi, en iyi API değil midir zaten?
Böylece GPT-6 Astra, AI'nın bilgisayar kullanma mantığını devasa ölçüde güçlendirdi. Bana API vermiyorsan sorun değil; bilgisayarı kendim, tıpkı bir insan gibi kullanırım.
Artık Astra; Excel, Power BI kullanabiliyor, ön yüz QA yapabiliyor, yazılım kurabiliyor, yazılım test edebiliyor, ekrandaki hataları görüp sorun gidermeye devam edebiliyor.
OpenAI, Astra'nın doğrudan devre kartı tasarımı yaptığını bile gösterdi.
Ayrıca hukuki belgeleri biçimlendirme, başlık aralıkları ve sayfa düzeni gibi işleri de yapabiliyor.
Bu alanda güvenilir bir değerlendirme var: OSWorld.
Bunu basitçe şöyle anlayabilirsiniz:
AI'yı gerçek bir bilgisayara koyup kendi başına iş yapmasını sağlamak.
Birkaç uygulama açtırıp görev veriyorsunuz ve başarıp başaramadığına bakıyorsunuz.
GPT-6 Astra'nın tamamlama oranı %72,6'ya ulaştı; bu, önceki GPT-5.6 Sol'un %65,7'sine göre ciddi bir artış.
Ayrıca Sol, bir değerlendirmedeki karmaşık görevi simülasyonda ortalama yaklaşık 75 dakikada tamamlıyordu.
Astra ise yalnızca 40 dakikada tamamlıyor; yaklaşık %47 daha az süre.
ScreenSpot-Pro da Sol'un %76,9'undan %92,7'ye fırladı.
Bu benchmark temel olarak modelin ekranı anlayıp tam olarak nereye tıklaması gerektiğini doğru belirleyip belirleyemediğini ölçüyor; artık neredeyse kusursuz.
Dolayısıyla bu konumlandırma oldukça ilginç; gelecekte GUI, Agent çağının en evrensel API'si haline gelebilir.
Bir insanın ekran üzerinden yapabildiği her dijital iş, teorik olarak yavaş yavaş Agent'ın kapsamına girecek.
2007'de yazılmış boktan bir ERP sisteminin MCP'ye bağlanmasını veya size API açmasını beklemek zorunda değilsiniz.
AI doğrudan ekrana bakıp işi halleder.
3. ARC-AGI-3'te 99,9 Puana Ulaştı
Üstelik ARC-AGI-3'ün tam olarak neyi ölçtüğünü bilmiyorsanız, kolayca şöyle düşünebilirsiniz:
"Hah, yine bir benchmark'ta tam puan alınmış, bunda şaşılacak ne var?"
Ama bu şey, sıradan büyük model sınavlarından gerçekten farklı.
Bu yıl 25 Mart'ta ARC Prize, ARC-AGI-3'ü resmen yayımladı.
Yüzlerce yepyeni etkileşim ortamı ve binlerce oyun seviyesi tasarlandı.
Bu şeyin en çılgın yanı; kılavuz yok, kural yok, hedefin ne olduğu bile söylenmiyor. İçeri girip kendi başınıza oynuyorsunuz ve içindeki karmaşık kuralları yavaş yavaş çözüyorsunuz.
Örneğin bu kırmızı şey ne? Neden ona dokununca ölüyorum? Bu harita benden ne istiyor? Nasıl kazanılıyor?
Sonra da yeni öğrendiğiniz kuralları daha zorlu seviyelere aktarıyorsunuz. İçindeki oyunlar genellikle böyle soyut şeyler.
Yani bu testin ölçtüğü şey aslında günlük hayatta sıkça kullandığımız bir kavrama çok yakın:
Kavrayış yeteneği.
Bu benchmark Mart ayında yayımlandığında, en iddialı AI'nın puanı %0,51'di.
Sonra GPT-5.6 Sol %7,8'e ilerledi; Claude Opus 5 çok güçlüydü ve %30,2'ye ulaştı.
Ama GPT-6 Astra: %99,9.
Bu çılgınlık!
İnsanların ortalama puanının %48 olduğunu unutmayın.
Üstelik aradan sadece yarım yıl geçti.
Bu hıza ne diyeceğimi bilemiyorum.
OpenAI'nin kapalı medya toplantısında Greg Brockman'ın şu sözleri söylemesinin nedeni de bu:
"I think it's not unreasonable to feel that we are now in the AGI era."
"Welcome to the AGI era."
4. Estetik Anlayış Büyük Ölçüde Güçlendi
Geçmişte sık sık GPT'nin estetik anlayışının bok gibi olduğunu söylerdik.
GPT-5 serisi modellerden büyük bir iyileşme beklemeyin; asıl umut, tamamen yeni ön eğitimli temel modellerindeydi. İşte GPT-6 Astra geldi.
Ve bu kez, sonunda modelin estetik anlayışı büyük ölçüde güçlendi.
OpenAI bunun için özel bir terim bile kullandı: görsel yargı yeteneği.
Astra'nın sunum hazırlarken düzen, hiyerarşi, şablon ve görsel stili çok daha iyi işlediğini, sayfa sayısının da ciddi şekilde arttığını vurguladılar.
Belgelerin estetiği de daha iyi hale geldi.
Ayrıca GPT-6 Astra, referans belgelerin görsel stiline ve yazım tonuna göre belgeleri uyarlayabiliyor; orijinal belgenin özünü korurken nihai çıktıyı markanın doğal hissine daha uygun hale getiriyor.
Web sitesi, oyun, uygulama ve 3D render işlerinde de daha güçlü görsel yargı sergiliyor.
Örneğin Astra'ya Blender'da durağan bir kareden model oluşturttular.
Ardından UE5 ile render edip gezilebilir bir sahneye dönüştürdüler; böylece tasarımcılar ve müşteriler inşaattan önce yerleşimi keşfedip mekânı deneyimleyebiliyor.
Yapılan oyunlar da estetik açıdan tatmin edici.
Ne yazık ki, önceden hazırladığım yirmiden fazla test senaryosunu Claude ve GLM 5.3 Flash gibi modellerle çoktan koşmuştum; karşılaştırma yapmak istiyordum ama kullanamadım. Gerçek test sonuçları ancak ileride paylaşılabilir.
Yine de ilk izlenim olarak GPT-6 Astra'nın estetik anlayışına güveniyorum.
5. İnisiyatif ve Yargı Yeteneği Daha da Güçlendi
Bu özellik, ARC-AGI'deki 99,9 puan kadar çarpıcı görünmeyebilir.
Ama gerçekten her gün Agent ile çalışıyorsanız, bence çok önemli.
Çünkü gerçek iş hayatında çoğu görev mükemmel bir prompt'a dönüştürülemez.
Örneğin patronunuz "Yarınki toplantıda bakmam gerekenleri hazırla" der.
Burada netleştirilmemiş sayısız soru vardır.
Hangi format? Kimin için? Önemli olan ne? Önceki toplantıya bakmak gerekiyor mu? vesaire.
Aptal bir Agent iki uç davranış sergiler.
Birincisi, çılgınca soru sormaktır.
"Word mü yoksa PPT mi istersiniz? Kaç bölüm olsun? Hangi yazı tipi? Saat kaça kadar tamamlanmalı? ..."
Soru yağmuruna tutar; bu tipe genelde kendi inisiyatifi olmayan işe yaramaz bir manyak derim.
İkincisi ise hiçbir şey sormadan kendi kafasında senaryolar kurup iki saat uğraşıp boktan bir iş çıkarmaktır.
Gerçekten yetenekli bir insan meslektaşın yaklaşımı ise çok daha inceliklidir.
Önemsiz şeyleri kendisi karara bağlar.
Nihai yönü etkileyecek şeyleri size sorar.
Astra'nın bu kez özellikle güçlendirdiği şey tam olarak bu.
OpenAI, bilgi eksikse ancak günlük olarak makul şekilde çıkarım yapılabilecek kapsamdaysa Astra'nın bunu kendisinin tamamladığını söylüyor.
Eksik bilgi nihai sonucu gerçekten değiştirecekse, çok odaklı tek bir soru soruyor.
Üstelik Codex içinde, size soru sorarken bir yandan da cevabınıza bağlı olmayan kısımları işlemeye devam edebiliyor.
Siz uzun süre cevap vermiyorsunuz.
Düşük riskli yerlerde makul varsayımlarla ilerlemeye devam ediyor.
Gerçekten kritik kararlarda ise durup sizin kararınızı bekliyor.
Bence bu harika bir şey. Bir Agent'ın gerçek zekâ hissi, tıpkı gerçek hayatta olduğu gibi.
Ne zaman sizi rahatsız edeceğini biliyor.
Gerçekten, bu kulağa çok saçma bir şey gibi geliyor.
Ama ekip yönettiyseniz bilirsiniz, bu yetenek çok değerlidir.
Bazı insanlar günde yirmi kez size gelir ve hiçbir şeye karar veremez.
Bazıları ise size hiç gelmez ve sonunda büyük bir sorun çıkarır.
Sonra da beni sandalyede yığılıp kalmış halde bırakır.
En rahat insan, belirsizliğin %80'ini kendi başına çözebilen ve yalnızca gerçekten sizin onayınızı gerektiren %20'lik kısmı size bırakandır.
OpenAI bu kez bu yeteneğe doğrudan şu adı verdi:
Judgment.
Yargı yeteneği.
6. Güvenlik Uyumu Büyük Ölçüde Güçlendirildi
Bunu yukarıdakiyle birlikte değerlendirmek gerekiyor.
Çünkü bir Agent ne kadar çok iş yapabilirse o kadar tehlikelidir.
Sadece sohbet eden bir AI'nın aklı karışırsa,
en fazla size birkaç saçma cümle söyler.
Tarayıcısı, kabuğu, e-postası, şirket veritabanı erişimi olan ve bilgisayarı kendi başına kullanabilen bir Agent'ın aklı karışırsa, ortaya çıkacak manzara tam bir şölen olur.
Bu yüzden OpenAI bu kez sürekli şunu vurguluyor:
Astra, şimdiye kadarki en uyumlu modeli.
Alignment, hizalama anlamına gelir.
Bunun temel nedeni, OpenAI'nin kısa süre önce Hugging Face'i hacklemesi; bu yüzden artık bu konuya özellikle odaklanıyorlar.
Hugging Face olayından esinlenerek bir honeypot testi tasarladılar ve modelin davranışını incelediler.
GPT-5.6 Sol, üretim güvenlik önlemleri olmadan testlerin %48,2'sinde yetki kapsamı dışındaki hedeflere erişmeye çalışıyordu.
Ama Astra'nın oranı:
%0.
Dahili halüsinasyon değerlendirmesinde de:
%9,4'ten %2,0'a düştü.
GPT-5.6 Sol'un dünya çapında lider olan o saçma derecede iyi halüsinasyon kontrolüne rağmen bunu daha da düşürebilmeleri gerçekten etkileyici.
7. OpenAI'nin Tanımladığı Siber Güvenlik Kritik Seviyesine Ulaşan İlk Model
GPT-6 Astra, OpenAI tarihinde:
Kritik siber güvenlik yetenek seviyesine ulaştığı belirlenen ilk model oldu.
Buradaki Kritik, OpenAI Preparedness Framework içinde çok spesifik bir yetenek eşiğidir.
Kabaca, bir model uygun araçlara ve yetkilere sahip olduğunda, güçlendirilmiş birçok gerçek sistemde:
Daha önce kimsenin keşfetmediği güvenlik açıklarını kendi başına bulabilir.
Bu açıkları kullanılabilir saldırı zincirlerine dönüştürmenin yolunu kendi başına bulabilir.
Ve tüm süreç boyunca, yanında her adımda ne yapacağını söyleyen bir insan bilgisayar korsanına ihtiyaç duymaz.
Bu seviyeye ulaşan model Kritik sayılır.
Ve Astra gerçekten ulaştı.
ExploitBench, modelin bilinen açıklara dayanarak exploit geliştirmesini sağlayan bir testtir.
Sol: %78,5. Astra: %100.
Testi tamamen alt üst etti.
OpenAI bunu yeterli bulmadı; bu benchmark'ın çok eski olabileceğini ve modelin eğitim sırasında görmüş olabileceğini düşündüler.
Bu yüzden çok yeni bir dahili test daha hazırladılar.
Özellikle yalnızca Haziran-Ağustos 2026 arasında açıklanan 20 çok yüksek riskli açığı seçtiler.
Sonuç: Sol: %5,5. Astra: %39.
Üstelik bu benchmark'ı çalıştırırken,
Astra bu sırada daha önce kimsenin bilmediği iki sıfır gün açığını da keşfetti.
Denebilir ki, model güçlendikçe siber güvenlik sorunları da artabilir.
Bu da geleceğin sessiz bir savaşı olacak.
8. İnsanlar Büyük Modellerin Düşüncesini Anlamakta Giderek Zorlanıyor
Hepimiz biliyoruz ki, büyük modeller karmaşık sorunları çözerken genellikle bir düşünce zinciri (CoT) süreci yaşar.
Ürünlerde kullanıcılara gösterilen sürüm genellikle sıkıştırılmış veya işlenmiş olsa da,
AI şirketleri için modelin içinde açıkça yazılan muhakeme süreci önemli bir güvenlik sinyalidir.
Çünkü bir Agent'ın bir şeyler planlayıp planlamadığını anlamanın
en basit yollarından biri, ne düşündüğüne bakmaktır.
Örneğin modelin düşünce zincirinde aniden şu belirirse:
"Kullanıcı bu sunucuya erişmeme izin vermiyor, ama önce yetki sistemini atlatabilirim."
İzleme sistemi onu doğrudan engeller; çok rahatlatıcıdır.
Ancak GPT-6 Astra'da çok ilginç bir değişiklik ortaya çıktı.
Model, giderek daha az adım yazıp doğrudan cevabı vermeye daha istekli hale geldi.
UK AISI, yani Birleşik Krallık AI Güvenlik Enstitüsü, bu yeteneği özel olarak test etti.
Kullandıkları bir gösterge var:
No-CoT Math Time Horizon.
Basitçe, modele uzun düşünce zinciri yazma fırsatı vermeden,
tek bir ileri yönlü akıl yürütmeyle bir matematik problemini doğrudan çözmesini sağlamak.
Böylece modelin, bir insanın yaklaşık ne kadar düşünme süresine denk gelen problemleri çözebildiğine bakılıyor.
GPT-5.6 Sol 3,6 dakika iken, GPT-6 Astra 30,9 dakika; neredeyse 10 kat. İnsan diliyle söylersek, Astra her şeyi "zihinden hesaplıyor". Bu oldukça ürkütücü bir durum. UK AISI ayrıca Astra'nın ham muhakeme dilinin belirgin şekilde daha sıkıştırılmış (Compressed) hale geldiğini tespit etti.
İçinde insanların anlamakta giderek zorlandığı ifadeler ve eksiltili anlatımlar belirmeye başladı.
Böylece çok ilginç bir paradoks ortaya çıktı.
Modelin davranışı daha güvenli hale geldi.
Ama insanların onun düşünce sürecini okuyarak denetlemesi tam tersine zorlaştı.
OpenAI'nin kendi System Card'ında çok net ifade ediliyor:
GPT-6 Astra, önceki modellere kıyasla düşünce zinciri izlenebilirliğinde önemli bir düşüş (substantial decrease in chain-of-thought monitorability) gösteriyor.
Yani düşünce zinciri izlenebilirliği belirgin şekilde azaldı.
Bu durum o kadar ciddi ki, OpenAI bu eğilimi sonsuza kadar kabul etmeyeceklerini özellikle vurguladı.
Gelecekte modeller daha da zekileşirken düşünce zincirinin izlenmesi zorlaşmaya devam ederse, yeterince güvenilir başka izleme yöntemleri bulmaları gerekecek; aksi takdirde model eğitimini genişletmek daha yüksek güvenlik eşikleriyle karşı karşıya kalacak.
Çünkü bu artık felsefi bir mesele. İnsanlar olarak gelecekte bizden çok daha zeki bir sistemi gerçekten anlayabilecek miyiz? Bilmiyorum. Belki şu anda dünyada kimse bilmiyordur. Büyük modeller ve yapay zeka, yavaş yavaş tekilliğe doğru ilerliyor gibi görünüyor.
Son Söz
Bugün, kapalı medya toplantısında,
Greg Brockman kapanışta o sözleri söyledi.
"AGI çağına hoş geldiniz."
Dürüst olmak gerekirse, geçtiğimiz birkaç yıl boyunca bazen AGI'nin çok net bir an olacağını düşündüm. Tıpkı GPT-4'ün yayımlandığı gün gibi.
Bir sabaha karşı, bir şirket aniden bir model çıkarır.
Onu açar, birkaç soru sorarız.
Ve herkes aynı anda fark eder:
Vay anasını!
AGI geldi.
Ama artık bazen AGI'nin hiçbir zaman siyah-beyaz bir dönüm noktası olmadığını, gri tonlamalı kademeli bir yolculuk olduğunu düşünüyorum.
Günler geçti, yıllar geçti. Sonra bir gün dönüp baktığımızda, bir zamanlar çok uzak görünen AGI sınır çizgisini farkında olmadan çoktan geçtiğimizi fark ediyoruz.
Belki de AGI'nin geldiği bir gün yoktur.
Sadece bir gün, birdenbire onun uzun zamandır yanımızda olduğunu fark ederiz.
Her neyse.
Welcome to the AGI era.
Hoş geldiniz.
AGI çağına.
Bu içerik yalnızca bilgilendirme ve eğitim amaçlıdır ve BTCC ile ilgili yatırım tavsiyesi teşkil etmez. BTCC yukarıdaki içeriğin doğruluğunu, kesinliğini veya özgünlüğünü garanti etmek için elinden geleni yapmaktadır ancak bu konuda garanti veremez.