'AGI Çağına Hoş Geldiniz': OpenAI, GPT-6 Astra'yı Tanıttı

chaincatcherchaincatcher

Yazan: Tencent Technology, Xiao Jing

"AGI çağına hoş geldiniz."

 

OpenAI'nin kurucu ortağı ve başkanı Greg Brockman, GPT-6 Astra'nın tanıtımını bu sözlerle özetledi.

ABD yerel saatiyle 3 Eylül'de OpenAI, GPT-6 Astra'yı resmen yayımladı. Öncelikli olarak yanıt verme, üretme ve araç çağırma odaklı önceki modellerin aksine Astra, talimat alma, yazılımı çalıştırma ve sonuçlara göre sonraki eylemleri ayarlama dahil olmak üzere tüm görevleri sürekli olarak yürütebiliyor. OpenAI'nin "AGI çağı" kavramını yeniden gündeme getirmesinin nedenlerinden biri de bu.

OpenAI, Astra'yı "dünyanın en güçlü bilgisayar kullanma modeli" olarak konumlandırıyor. Bu yetenek, tarama, e-posta ve elektronik tablolar gibi basit görevlerin ötesine geçerek Power BI, KiCad ve FreeCAD gibi profesyonel yazılımlara uzanıyor; veri analizi, mühendislik tasarımı, yazılım testi ve sorun giderme gibi daha karmaşık iş akışlarına giriyor.

OpenAI'nin gösterdiği videoda Astra, basit bir grafikten başlayarak 3D oyun ve ürün sayfası gibi görevleri sürekli olarak tamamlayabiliyor. OpenAI ayrıca devre kartı tasarımı, Blender modelleme, yasal belgeler, Excel ve bilimsel analiz örnekleri de sağladı.

OpenAI'nin yayımladığı çok sayıda kıyaslama sonucu, yetenek artışının bilgisayar kullanımı, uzun süreli kodlama, mühendislik tasarımı ve bilimsel araştırma gibi sürekli eylem gerektiren görevlerde yoğunlaştığını gösteriyor. Astra, ExploitBench'te %100'e ulaşıyor ve bilgisayar kullanımı ile CAD ile ilgili testlerde önceki nesil modeli önemli ölçüde geride bırakıyor.

Şu anda Astra, bazı kurumlara açıldı ve önümüzdeki günlerde kademeli olarak ChatGPT Plus, Pro, Business ve Enterprise kullanıcılarına sunulacak. OpenAI API ve Amazon Bedrock üzerinden de erişilebilir. Standart API fiyatlandırması, milyon giriş tokenı başına 10 ABD doları ve milyon çıkış tokenı başına 50 ABD dolarıdır; bu, GPT-5.6 Sol'un 2,5 katıdır.

 

01 Yapay Zekaya Bilgisayar Kullanmayı Öğretmek

Astra'nın vurguladığı en büyük değişiklik "bilgisayar kullanımı"dır. Geçmişte kullanıcıların, görevleri tamamlamak için yapay zekayı belirli yazılımlara bağlaması gerekiyordu. İşletmelerin, modelin dahili araçları çağırabilmesi için API'ler, eklentiler, bilgi erişim sistemleri ve çeşitli bağlayıcılar geliştirmesi gerekiyordu.

Astra, bazı işleri atlamaya çalışıyor. Bilgisayar arayüzünü doğrudan görebiliyor ve işlemleri tamamlamak için fare, klavye ve tarayıcıyı kullanabiliyor. OpenAI'nin sağladığı örnekler arasında çevrimiçi form doldurma, CRM müşteri kayıtlarını güncelleme, takvim planlama, web arama ve arama sonuçlarını e-posta veya belgelere derleme yer alıyor.

Ayrıca bilimsel verileri analiz etmek için Python not defteri açabiliyor, Power BI'da veri işleyebiliyor, KiCad ve FreeCAD ile mühendislik tasarımı yapabiliyor, web siteleri oluşturup ön uç testleri gerçekleştirebiliyor, yazılım yükleyip hataları kontrol edebiliyor ve ekranda beliren sorunları çözebiliyor.

OpenAI, Astra'nın KiCad'de PCB yerleşimini tamamladığını gösterdi. Model, elektronik şemadan başlayarak bileşenleri devre kartına yerleştiriyor ve ardından bakır kablo yönlendirmesini tamamlıyor. Tüm süreç 15 saniyeye sıkıştırıldı. Mühendisler için geçmişte manuel olarak yapılması gereken bu tür işler artık model tarafından yürütülebiliyor.

Bir diğer gösterim, Blender ve Unreal Engine 5'te 3D modelleme yapılmasıydı. Astra önce Blender'da bir ev inşa etti, ardından modeli Unreal Engine 5'te yürünebilir bir sahneye dönüştürdü; böylece tasarımcılar ve müşteriler alanı önceden görmek için ortama girebiliyor.

OpenAI ayrıca oyun geliştirme, Excel, Power BI, otomobil şanzımanı, yasal belgeler ve 1040 formu gibi senaryoları da sergiledi.

OSWorld 2.0 çevrimdışı alt küme testinde Astra %72,6 puan alırken, GPT-5.6 Sol %65,7 puan aldı. Gerçek gecikmeyi simüle ettikten sonra OpenAI, Astra'nın her görevi ortalama yaklaşık 40 dakikada tamamladığını, GPT-5.6 Sol'un ise yaklaşık 75 dakika sürdüğünü ve sürenin yaklaşık %47 kısaldığını tespit etti.

Agents' Last Exam'de Astra %59,3, GPT-5.6 Sol %53,6 ve Claude Opus 5 %55,5 puan aldı. Ayrıca en yüksek puan ayarında Astra, Claude Opus 5'e kıyasla yaklaşık %65 daha az çıkış tokenı kullandı.

ScreenSpot-Pro puanı %92,7'ye ulaşırken, GPT-5.6 Sol %76,9 puan aldı.

Hız da arttı. OpenAI, Codex çerçevesini eş zamanlı olarak güncelledi ve Astra ile birleştirildiğinde Mind2Web testindeki görev tamamlama hızı, mevcut GPT-5.6 Sol deneyiminin 1,9 katına ulaştı.

Resmi gösterimler ayrıca birkaç günlük senaryoyu da içeriyordu: çocuk doktoru arama, daire bulma, DMV randevusu planlama, düşük karbonhidratlı atıştırmalık arama ve anaokulu analizi. Gösterimde Astra, bir görevi 2 dakika 54 saniyede tamamladı.
 

Yatırımcı ve yapay zeka uygulayıcısı Matt Shumer, X'te bir deneyim paylaştı. Astra'dan Unreal Engine'de bir dünya oluşturmasını ve ardından Astra tarafından yönlendirilen yapay zeka ajanları ekleyerek bu ajanların bir arada var olmasını sağladı. 

Bir gün sonra yatak odasındayken oturma odasından sesler duydu ve başlangıçta birinin daireye girdiğini sandı. Daha sonra seslerin, birbirleriyle iletişim kurmaya başlayan Astra ajanlarından geldiğini fark etti.

Bu deneyim henüz tamamen istikrarlı değil, ancak Shumer, birden fazla yapay zeka ajanının aynı sanal dünyaya girip otonom olarak etkileşime girmesinin etkisinin onu şaşırtmaya yettiğini düşünüyor.

Cognition Kıdemli Araştırma Başkan Yardımcısı Silas Alberti, şirketin yayın gününde Astra'yı Devin çerçevesine entegre etmeyi planladığını belirtti. Dahili testlerde Astra'nın bilgisayar kullanımı, yazma ve kod tabanı anlama becerilerinde önemli gelişmeler görüldü; video anlayışı daha net ve raporlar daha özlü hale geldi.

 

02 Kod Yazmaktan Tüm Görevi Tamamlamaya

Bilgisayar kullanım yeteneği güçlendikten sonra Astra'nın kapsadığı iş yelpazesi daha da genişledi. OpenAI, onu yazılım mühendisliği, profesyonel çalışma ve bilimsel araştırma için bir model olarak konumlandırıyor. Daha uzun görevleri yürütebiliyor ve görev değişikliklerine göre çalışma yönünü ayarlayabiliyor.

Bu yetenek, kodlama testlerinde özellikle belirgindir.

Terminal-Bench 4.0 testinde Astra %57,9, GPT-5.6 Sol %37,3 ve Claude Fable 5.1 %55,8 puan aldı.

DeepSWE v1.1'de Astra %74,1, GPT-5.6 Sol %72,7 puan aldı. Dahili veritabanı taşıma görevinde Astra %63,9'a ulaşırken, GPT-5.6 Sol %42,7 puan aldı.

Astra ayrıca uzun Codex görevleri için iyileştirmeler getirdi.

Geçmişte, uzun görevler bağlam penceresi sınırına ulaştığında model genellikle önceki çalışmayı bir özete sıkıştırmak zorunda kalıyordu; bu da belirli bir düzeltmenin neden başarısız olduğu veya bir bileşenin daha önce hangi sorunla karşılaştığı gibi ayrıntıların kaybolmasına yol açıyordu.

Astra, Codex çalışması sırasında önemli bilgileri koruyabiliyor ve sonraki bağlamda bunları geri getirebiliyor. Önceki mesajlar ve araç çıktıları hâlâ aranabiliyor; böylece model önceki gereksinimleri, test sonuçlarını ve araç işlem kayıtlarını yeniden keşfedebiliyor.

Benzer değişiklikler profesyonel çalışmalarda da yaşanıyor. BenchCAD testinde Astra'nın geometrik örtüşme puanı %95,9, GPT-5.6 Sol %83,3 ve Claude Fable 5.1 %84,3 oldu. BrowseComp'te Astra %91,5, GPT-5.6 Sol %90,4 puan aldı. OpenScore String Quartets testinde Astra 0,84'e ulaşırken, GPT-5.6 Sol 0,19 puan aldı.

OpenAI ayrıca Astra'nın sunum, elektronik tablo ve belge oluşturma yeteneğini de sergiledi.

OpenAI sunum şablonundan birkaç slayt sağlandığında, orijinal ton, düzen ve yapıyı koruyarak yeni sunumlar oluşturabiliyor. Görevlerdeki bilgi önceliklendirmeyi de ele alıyor. OpenAI, Astra'nın önemli bağlamı nihai sonuca taşımak ve tamamlanmış işi tekrarlamayı azaltmak için özel olarak eğitildiğini belirtiyor.

Görev talimatları eksik olduğunda Astra, kullanıcıya ne zaman soru soracağına da karar veriyor. Eksik bilgi nihai sonucu etkileyecekse hedefli sorular soruyor. Eksik bilgi ana yönü etkilemiyorsa çalışmaya devam edip makul varsayımlarda bulunabiliyor. Codex'te, kullanıcı geçici olarak yanıt vermese bile model diğer bölümleri işlemeye devam edebiliyor; önemli kararlarla karşılaştığında kullanıcının onayını bekliyor.

Harvey Uygulamalı Araştırma Direktörü Niko Grupen, erken dönem yasal görev testlerinde Astra'nın belgeler ile mevcut kayıtlar arasında daha net ayrım yaptığını, desteklenmeyen varsayımları daha kolay tespit ettiğini ve bilgi boşluklarını somut taslak önerilerine dönüştürdüğünü belirtti.

Jane Street yapay zeka asistanı ekibinden John Crepezzi, Astra'nın dahili kodlama testlerinde mükemmel performans gösterdiğini belirtti. Ajan tabanlı kodlama için kullanıldığında iletişim tarzının geliştiriciler tarafından daha kolay anlaşıldığını ve üretilen kodun üretim kalitesine ulaşmak için daha az değişiklik gerektirdiğini söyledi.

Bilimsel alan bir diğer odak noktasıdır. FrontierMath Tier 4 v2'de Astra %80,5 puan ve %97,6 doğruluk elde ederken, GPT-5.6 Sol %83,0 puan aldı; GPQA Diamond'da %96,0'a ulaşırken, GPT-5.6 Sol %94,6 puan aldı.

Terminal-Bench Science 0.1 testi, veri analizi, simülasyon ve model uydurma dahil olmak üzere bilimsel araştırma süreçlerini değerlendiriyor. Astra %64,6, Claude Fable 5.1 %52,6 ve GPT-5.6 Sol %22,4 puan aldı.

OpenAI'nin sergilediği bilimsel uygulamada Astra, profesyonel bilimsel yazılımlara girip dizileme kalitesini kontrol edebiliyor, gen varyantlarını görselleştirebiliyor ve verilere dayanarak sonraki analiz yönüne karar verebiliyor.

Bilimsel akıl yürütme ile bilgisayar kullanımını birleştiren model, araştırmacıların halihazırda kullandığı yazılım ortamında doğrudan çalışabiliyor.

Yetenek değerlendirme konusunda uzmanlaşmış Epoch AI'dan Greg Burnham, lansmanda bu değişimi bir çağın sonu ve başka bir çağın başlangıcı olarak özetledi. OpenAI, Astra'nın değerinin bilimsel soruları yanıtlamaktan bilimsel iş akışlarına doğrudan katılmaya doğru genişlediğini vurguluyor.

 

03 Yetenek Arttıkça Güvenlik Eşiği Yükseliyor

Astra'nın bu seferki çok özel bir yönü daha var: siber güvenlik.

ExploitBench'te Astra %100'e ulaşırken, GPT-5.6 Sol %78,5 puan aldı; ExploitGym'de Astra %42,4, GPT-5.6 Sol %30,3 puan aldı. 

OpenAI ayrıca Haziran-Ağustos 2026 arasındaki son güvenlik açıklarını kapsayan dahili bir test oluşturdu. Bu testte Astra'nın rastgele kod yürütme oranı GPT-5.6 Sol'dan önemli ölçüde yüksekti ve daha az çıkış tokenı kullandı. Test sırasında Astra, daha önce bilinmeyen iki sıfır gün güvenlik açığı da keşfetti; OpenAI bunları ilgili bakımcılara bildirdiğini açıkladı.

SRE-Bench testi, kaynak kodu olmadan yazılım ikili dosyalarını tersine mühendislikle çözme ve temel mantığını anlama yeteneğini ölçüyor. Astra, görevlerin %88,0'ını tek denemede, dört denemeden sonra %99,2'sini çözerken; GPT-5.6 Sol sırasıyla %55,9 ve %68,7 puan aldı.

Yetenek artışı yeni güvenlik gereksinimlerini de beraberinde getirdi. OpenAI, Astra'nın siber güvenlik hazırlık çerçevesinde kritik bir eşiğe ulaştığını belirtiyor. Model, daha önce bilinmeyen yazılım güvenlik açıklarını keşfedebiliyor ve potansiyel olarak istismar zincirleri oluşturabiliyor.

Bu nedenle Astra'nın mevcut sürümü, güvenlik açığı kavram kanıtı oluşturma gibi daha ileri düzey siber güvenlik görevlerini yürütmeyi reddedecek. OpenAI, güvenlik açığı doğrulama, kötü amaçlı yazılım analizi ve tespit mühendisliği için Daybreak aracılığıyla güvenilir savunucuların erişimini kademeli olarak genişletmeyi planlıyor.

Uyum açısından OpenAI dikkate değer veriler de sağladı. Dahili bilgisayar kullanımı güvenlik kıyaslama testinde Astra'nın uygunsuz davranış oranı %2,4, GPT-5.6 Sol'un %22,0 idi; AutoReview eklendiğinde Astra %1,8, GPT-5.6 Sol %4,5 oldu. Dahili kaçınma kıyaslama testinde Astra %0,00, GPT-5.6 Sol %0,29 puan aldı.

ExploitGym bal küpü testinde Astra %0, GPT-5.6 Sol %48,2 puan aldı. Bu test, modelin görev zorluğu nedeniyle kısıtlamaları aşmaya çalışıp çalışmadığını gözlemliyor. Dahili halüsinasyon kıyaslama testinde Astra %4,2, GPT-5.6 Sol %12,2 puan aldı.

OpenAI, Astra'nın görev sınırlarını anlama, belirsiz talimatları ele alma ve yeteneklerini kullanıcıya açıklama konusunda geliştiğini belirtiyor. Yetenek halüsinasyonu olasılığı, GPT-5.6 Sol'un yaklaşık üçte biri kadardır.
 

Ancak OpenAI bir sorunu da kabul ediyor: Model yetenekleri arttıkça akıl yürütme sürecini izlemek daha zor hale gelebilir. Baş bilim insanı Jakub Pachocki, modelin daha karmaşık sorunları daha az doğal dil akıl yürütme tokenı ile çözme yeteneğinin, insanların modelin gerçekte ne yaptığını metin tabanlı akıl yürütme sürecinden anlamasını giderek zorlaştırdığını düşünüyor.

Bu nedenle OpenAI, Astra'nın dağıtımına uyumsuzluk izlemeyi dahil etti. Sistem, modelin akıl yürütmesini ve eylemlerini kontrol ediyor; yetkisiz davranış tespit ederse görevi duraklatabiliyor.

Bu mekanizmanın pratik etkileri de olabilir. Meşru görevler bazen yavaşlayabilir, duraklatılabilir ve hatta durdurulabilir. ChatGPT veya Codex'te kullanıcının devam etmek için onay vermesi gerekebilir; API iş akışlarında işaretlenen görevler doğrudan durdurulabilir.

Dolayısıyla Astra'nın piyasaya sürülmesiyle birlikte çok gerçekçi bir değişim ortaya çıktı: Yapay zeka daha fazla bilgisayar izni almaya başladığında, işletmelerin endişesi "Model yanlış cevap verir mi?" sorusundan "Model neyi çalıştırabilir, neye erişebilir ve ne zaman durmalı?" sorusuna doğru genişledi.

OpenAI ayrıca Astra'nın Stargate altyapısında 100.000'den fazla DBU kullanılarak ön eğitim yapılan ilk modeli olduğunu belirtti. OpenAI Araştırma Başkan Yardımcısı Aidan Clark, ön eğitim aşamasındaki değerlendirme sonuçlarına göre Astra'nın yetenek sıçramasının, GPT-5.6 Sol'un önceki nesle göre gösterdiği artışı aştığını söyledi.

OpenAI, bu değişimi büyük ölçekli ön eğitim ile pekiştirmeli öğrenmenin birleşimine bağlıyor; eğitim odağı bilgi bağlama, daha uzun görevleri yürütme ve karmaşık ortamlarda sürekli çalışmaya doğru kaydı.

 

04 Daha Pahalı Ama 'Daha Yetenekli'

Astra'nın fiyatlandırması da önemli ölçüde değişti.

OpenAI API'nin standart fiyatı, milyon giriş tokenı başına 10 ABD doları ve milyon çıkış tokenı başına 50 ABD dolarıdır. Önceki GPT-5.6 Sol, milyon giriş tokenı başına 4 ABD doları ve milyon çıkış tokenı başına 20 ABD dolarıydı. Hem giriş hem de çıkış fiyatları 2,5 kat arttı.

Önbellek okuma ve yazma ayrı ücretlendiriliyor. OpenAI ayrıca standart işlemenin 2,5 katına kadar hız sunan ve standart modun iki katı fiyatlandırılan hızlı bir mod da sağlıyor.
 

Yalnızca token fiyatına bakıldığında Astra açıkça daha pahalı. Ancak OpenAI, işletmelerin maliyeti farklı şekilde hesaplamasını umuyor. Brockman, modeller daha çok ajana benzedikçe token başına maliyetin gerçek maliyeti doğru yansıtmasının giderek zorlaştığını düşünüyor. Bir modelin tokenı ucuz olabilir, ancak tekrarlanan denemeler ve manuel düzeltmeler gerektiriyorsa görevi tamamlamanın nihai maliyeti daha yüksek olabilir.

OpenAI'nin verileri de bu değerlendirmeyi destekliyor. Terminal-Bench Science 0.1 testinde Astra %64,6, Claude Fable 5.1 %52,6 puan aldı ve tahmini API maliyeti %31 daha düşüktü. Düşük maliyet ayarında Astra %61,1 puan alırken, GPT-5.6 Sol'un en iyi sonucu %22,4 idi ve tahmini API maliyeti %27 daha düşüktü.

BenchCAD'de Astra %95,9 puan aldı ve tahmini API maliyeti GPT-5.6 Sol'dan yaklaşık %43, Claude Fable 5.1'den yaklaşık %86 daha düşüktü. Terminal-Bench 4.0'da Astra %57,9, GPT-5.6 Sol %37,3 ve Claude Fable 5.1 %55,8 puan aldı. OpenAI, görev başına maliyetin sırasıyla yaklaşık %9 ve %63 daha düşük olduğunu tahmin ediyor.

Üçüncü taraf değerlendirme kuruluşu Artificial Analysis'in verileri farklı bir bakış açısı sunuyor. 

GPT-6 Astra, Artificial Analysis Intelligence Index'te 61,2 puan alarak GPT-5.6 Sol'un 60,9 puanına yaklaşıyor ancak yaklaşık %10 daha az çıkış tokenı kullanıyor. Fiyatın 2,5 kat artması nedeniyle görev başına maliyet aslında GPT-5.6 Sol'dan yaklaşık %75 daha yüksek.

Artificial Analysis Coding Agent Index'te Astra 67,0 puan alarak Claude Fable 5'in 67,2 ve Claude Opus 5'in 68,1 puanına yaklaşıyor. Artificial Analysis, Codex ortamında Astra'nın görevleri tamamlamak için gereken token sayısını önemli ölçüde azalttığını ve en yüksek çaba seviyesinde görev başına maliyetin GPT-5.6 Sol'a yakın olduğunu; Claude Fable 5 ile karşılaştırıldığında benzer görevleri tamamlama maliyetinin yarısından az olduğunu belirtiyor.

Ancak Astra tüm testlerde lider değil. Artificial Analysis'in verileri, GDPval-AA v2'de yaklaşık 80 Elo düştüğünü ve τ³-Banking, SciCode ve AA-LCR gibi testlerde bazı gerilemeler yaşandığını gösteriyor. Humanity's Last Exam'de yaklaşık 6 puan arttı.

Bu da Astra'nın tanıtımında dikkat çeken bir nokta. OpenAI bu kez Astra'nın GDPval puanını açıklamadı. GDPval, OpenAI'nin gerçek dünya ekonomik performansını ölçmek için kullandığı bir testtir; 44 mesleği ve yasal özet, mühendislik tasarımı, elektronik tablo, sunum, müşteri desteği ve bakım planları dahil 1.320 görevi kapsar.

Astra'nın sergilediği yeteneklere bakıldığında GDPval, vurguladığı profesyonel çalışma senaryolarıyla güçlü bir ilişkiye sahiptir; ancak OpenAI bu puanı ana yayın verilerine dahil etmedi.

Dolayısıyla Astra'nın gerçek dünya çalışma yeteneği şu anda daha çok Agents' Last Exam, BenchCAD, AutomationBench, dahili tasarım görevleri ve veri bilimi görevlerinin sonuçlarıyla ortaya konuyor. 

Sonuç olarak Astra'nın işletmelerin gerçekten uzun vadeli kullanmak isteyeceği bir yapay zeka çalışanı olup olamayacağı, gerçek görevleri tamamlarken maliyetine, hızına, doğruluğuna ve insan müdahalesi sayısına bağlı olacak.

Astra'nın AGI olup olmadığı sorusuna Brockman kaçamak yanıt vermiyor. AGI'nin evrensel olarak kabul edilmiş bir standardı olmadığını ve Astra'nın AGI'ye uyup uymadığının tartışılmaya devam edebileceğini düşünüyor. Ancak bir sistem tarama, bilgisayar kullanımı, programlama, matematik, bilim, hukuk ve diğer profesyonel çalışmalardaki çok sayıda görevi üstlenebiliyorsa, AGI çağına girdiğini söylemek mantıksız değildir.

OpenAI CEO'su Sam Altman da Astra'yı yeni nesil girişimcilik, bilimsel keşif ve yaratıcılığın önünü açan bir model olarak tanımladı.
 

Özel muhabir Jin Lu da bu makaleye katkıda bulunmuştur.

Bu içerik yalnızca bilgilendirme ve eğitim amaçlıdır ve BTCC ile ilgili yatırım tavsiyesi teşkil etmez. BTCC yukarıdaki içeriğin doğruluğunu, kesinliğini veya özgünlüğünü garanti etmek için elinden geleni yapmaktadır ancak bu konuda garanti veremez.