Az önce Claude 5.1 yayınlandı! Dünyanın en güçlü modeli geldi

chaincatcherchaincatcher

Orijinal haber: Follow AI'nın Machine Heart'ı


Anthropic, yeni nesil modeller Claude Fable 5.1 ve Claude Mythos 5.1'i piyasaya sürdü.

Anthropic, Claude Fable 5.1'in karmaşık akıl yürütme, uzun süreli görevler ve ajan iş akışları için tasarlanmış, halka açık en güçlü modellerden biri olduğunu iddia ediyor. Claude Mythos 5.1 ise daha yüksek yetenek sınırlarını keşfetme çabalarını temsil ediyor.

Her iki modelin de aynı temel model yeteneklerini paylaştığını, ancak farklı kullanım senaryoları için farklı güvenlik önlemleri benimsendiğini belirtmek gerekir.

Fable 5.1 genel kullanıcılara, geliştiricilere ve işletmelere açıkken, Mythos 5.1 incelenmiş yüksek riskli alan ortaklarına yöneliktir ve daha sıkı erişim kontrolleri uygulanır.

Başka bir deyişle, biri gerçek dünya görevlerini üstlenirken, diğeri daha sıkı kontrol edilen bir ortamda tutulur. Bu aynı zamanda Anthropic'in yapay zeka ürünlerinin gelecekteki biçimlerine yönelik bir keşfi olabilir: en güçlü modeller herkese aynı biçimde sunulmayabilir.

Resmi açıklama, bu iki modelin Claude serisinin yeteneklerinde önemli ilerlemeleri temsil ettiğini ve model yeteneklerini geliştirirken güvenli dağıtımı nasıl sürdürdüklerini gösterdiğini belirtiyor.

"Görünürdeki en güçlü" model olarak Fable 5.1 hâlâ etkileyici bir performans sergiliyor. Resmi veriler, Fable 5.1'in birden fazla kıyaslama testinde önceki amiral gemisi Fable 5'i geride bıraktığını gösteriyor.

Ancak daha gelişmiş yeteneklerle birlikte fiyat düştü. Anthropic, Fable 5.1'in aynı temel fiyatı koruduğunu, önbellek okuma maliyetinin ise Fable 5'e kıyasla %75 azaldığını belirtiyor. Pratik kullanımda bu, tipik iş yükleri için modelin genel maliyetini yaklaşık %25 azaltır; yüksek düzeyde ajanlaştırılmış iş yükleri için maliyetler %45'e kadar düşebilir.

Görünüşe göre en güçlü modeller bile maliyet etkinliğine odaklanıyor.

Daha yakından bakalım.

 

Alt seviyeler önceki nesle yetişiyor, Fable 5.1 "maliyet etkinliğine" odaklanıyor

Anthropic, bu kez yalnızca liderlik tablosunu yenilemek yerine şunu vurgulamak istiyor: Fable 5.1, daha önce Fable 5'in yüksek kademelerini gerektiren görevleri daha düşük çıkarım maliyetleriyle tamamlayabilir.

Resmi testlere göre Fable 5.1, düşük ila orta çıkarım gücünde Fable 5'e yakın hatta onu aşan bir performans elde etti. Claude Code varsayılan olarak yüksek çıkarım gücünü kullanırken, Claude Cowork ve Claude .ai varsayılan olarak orta gücü kullanır; kullanıcılar görev karmaşıklığına göre hız, maliyet ve etkinlik arasında ayarlama yapabilir.

Özellikle Fable 5.1, bilimsel araştırma yapay zeka ajanı kıyaslaması Terminal - Bench - Science 0.1'de %52,6 puan alarak Fable 5'in %24,7'lik puanını ikiye katladı; Terminal - Bench 4.0'da Fable 5.1 %55,8'e ulaşırken, daha yetenekli Mythos 5.1 %60,9'a ulaştı.

Bilgi işi, bilgisayar işlemleri ve iş süreci testlerinde de yeni model iyileşmeler gösterdi. AutomationBench puanları Fable 5'in %17,1'inden %31,4'e yükseldi ve CursorBench 3.2.0 %70,5'ten %73,4'e çıktı.

Birden fazla kıyaslama testinde Fable 5.1'in puanları Fable 5'i aştı; en önemli iyileşmeler bilimsel araştırma ajanları ve iş akışı yeteneklerinde görüldü.

Terminal - Bench 4.0 testinde hem Fable 5.1 hem de Mythos 5.1, farklı çıkarım güçlerinde önceki nesil Mythos 5'i geride bıraktı.

Terminal - Bench - Science 0.1 testinde Fable 5.1, Fable 5'in iki katından fazla olan %52,6'lık maksimum puana ulaştı.

Anthropic, Fable 5.1'deki önemli bir değişikliğin, sorunların kök nedenlerini takip etme konusunda daha istekli olması olduğuna ve bunun saatlerce hatta onlarca saat süren karmaşık görevleri yürütmek için daha uygun hale getirdiğine inanıyor.

Yatırım firması Millennium, testlerde bir iç kod parçasının yaklaşık her milyon çalıştırmada bir çöktüğünü tespit etti. Bu sorun mühendislik ekibini dört ila beş yıldır rahatsız ediyordu ve diğer modeller nedeni belirleyememişti. Fable 5.1, harici satıcının kütüphanesini tersine mühendislikle inceleyip çekirdek dökümü dosyalarını karşılaştırarak sorunu üçüncü taraf bir program kütüphanesindeki bir hataya kadar izledi.

Ramp ayrıca Fable 5.1'i 38 saat boyunca sürekli çalıştırdı. Orijinal makine öğrenimi sonuçlarının etiketleme hatalarından etkilendiğini keşfettikten sonra model, sorunu otonom olarak düzeltti ve eşzamanlı olarak altı deney seti başlatarak sonunda yeni sonuçları ve sonraki önerileri derledi.

 

Kod yazmaktan bilimsel araştırma yürütmeye

Bu sürümde Anthropic, Fable 5.1 ve Mythos 5.1'in bilimsel araştırmadaki performansını tartışmaya önemli bir bölüm ayırdı.

Protein tasarımı deneylerinde araştırmacılar, Mythos 5.1'e açık kaynaklı protein tasarımı ve katlama araçlarını kullandı ve ardından üretilen tasarımları deneysel doğrulama için iki harici kuruma gönderdi.

Üç hedef protein için Mythos 5.1 tarafından tasarlanan ligandların bağlanma gücü, Adaptyv Bio ile ilgili protein tasarımı yarışmasındaki en iyi çözümlerin on katına ulaştı. On iki hedef proteinle karşılaşıldığında modelin etkili ligand isabet oranı %50'ye yaklaşırken, Anthropic tarafından sağlanan sektör ortak seviyesi %10 ila %15'tir.

Fable 5.1 ayrıca NASA'nın Magellan uzay aracı tarafından 30 yılı aşkın süre önce toplanan radar görüntülerini kullanarak Venüs yüzeyinin yaklaşık üçte biri için yeni bir yüksek çözünürlüklü rakım haritası oluşturdu.

NASA'nın Magellan uzay aracı tarafından çekilen Venüs radar görüntüleri, merkezde yaklaşık 15 kilometre çapında küçük bir kalkan volkanı bulunuyor.

Orijinal harita yalnızca 10 ila 20 kilometre ölçeğinde ayrıntılar sunabilirken, yeni harita çözünürlüğü 2 ila 3 kilometreye çıkarıyor ve yükseklik ölçüm doğruluğu %25'e kadar iyileşiyor. Anthropic, bu haritayı NASA'nın VERITAS ve Avrupa Uzay Ajansı'nın EnVision gibi gelecekteki görevler için bilgi paylaşımı lisansı altında kamuya açıklamayı planlıyor.

Hesaplamalı biyoloji alanında Mythos 5.1, özel GPU çekirdek fonksiyonları yazarak ve ara sonuçları önbelleğe alarak yedi açık kaynaklı protein ve genomik derin öğrenme modelinin çalışma hızını 2,5 kata kadar artırırken çıktı sonuçlarını tutarlı tuttu. Bazı tam genom analizi görevlerinde GPU maliyetlerini %30 ila %60 oranında azaltması bekleniyor.

Yedi açık kaynaklı protein ve genomik modeli optimize ettikten sonra Mythos 5.1'in işlem hızı 1,4 ila 2,5 kat arttı.

Anthropic, bu vakaları kullanarak modelin bilgiyi düzenleme ve kod yazmaktan çözüm önerme, araçları çalıştırma ve deneysel olarak doğrulanabilir araştırma sonuçları sunmaya doğru evrildiğini göstermeyi amaçlıyor.

Önbellek fiyatları %75 düştü, yapay zeka ajanı görevleri %45'e kadar daha ucuz hale geldi.

Performansın ötesinde, Fable 5.1'deki en belirgin değişiklik fiyattır.

Fable 5.1'in giriş ve çıkış fiyatları ayarlanmadı ve sırasıyla milyon token başına 10 ABD doları ve 50 ABD doları olarak kaldı, ancak önbellek okuma fiyatı %75 azaltılarak milyon token başına 0,25 ABD dolarına düşürüldü.

Önbellek okuma, modelin daha önce işlenmiş bağlamı yeniden kullanması anlamına gelir. Sıradan soru-cevap işlemlerinde oranı sınırlı olabilir, ancak kod tabanlarının, geçmiş diyalogların ve araç sonuçlarının tekrar tekrar okunmasını gerektiren ajan görevlerinde önbellekleme genellikle önemli bir maliyet oluşturur.

Anthropic'in Ağustos 2026'daki gerçek kullanım verilerine dayanan hesaplamalarına göre, Fable 5.1 ile tipik görevleri çalıştırmanın genel maliyeti Fable 5'e kıyasla yaklaşık %25 daha düşüktür; daha uzun bağlamlara ve sık araç çağrılarına sahip karmaşık ajan görevleri için maliyet azalması yaklaşık %45'e kadar çıkabilir.

Önbellek okuma fiyatlarındaki düşüşün ardından Fable 5.1 ile tipik görevlerin maliyeti yaklaşık %25 azalırken, yüksek düzeyde ajan tabanlı görevlerin maliyeti yaklaşık %45'e kadar azalır.

Fable 5.1 artık Claude .ai, Claude Code ve Claude API'de mevcut olup AWS, Google Cloud ve Microsoft Azure aracılığıyla da sağlanmaktadır. Geliştiriciler yeni modeli claude-fable-5-1 aracılığıyla çağırabilir.

 

Güçlendirilmiş anti-damıtma mekanizması

Fable 5.1 ve Mythos 5.1 aslında aynı temel modeli kullanır; temel fark güvenlik kısıtlamalarıdır.

Fable 5.1 genel kullanıcılara ve işletmelere tamamen açıktır; Mythos 5.1 ise daha gevşek siber güvenlik ve yaşam bilimleri kısıtlamalarına sahiptir ve şu anda yalnızca incelenmiş kişi ve kurumlara sunulmaktadır.

Siber güvenlik alanında Fable 5.1, kullanıcıların yazılım açıklarını keşfetmesine yardımcı olabilir ancak yine de doğrudan sömürü programları üretemez. Sızma testi, sömürü üretimi ve ikili dosya tabanlı açık taraması gibi çift kullanımlı görevler yine de daha sıkı kısıtlamalara sahip modellere yönlendirilebilir.

Ayarlamaların ardından yeni siber güvenlik koruma mekanizması, Fable 5'e kıyasla yanlış alarmları yaklaşık %60 azalttı. Temel biyoloji ve tıbbi sorunlarda biyogüvenlik mekanizmalarının yanlış alarm oranı da %85 azalırken, yaşam bilimleri araştırmalarıyla ilgili ileri yetenekler öncelikle Mythos 5.1 inceleme programı aracılığıyla açılıyor.

Anthropic ayrıca Enterprise Frontier Safeguards'ı başlattı. İşletmeler verileri kontrol ettikleri bulut altyapısında saklayabilir; varsayılan manuel incelemelerden işletme sorumlu olur ve böylece güvenlik izleme yeteneklerini korurken neredeyse "sıfır veri saklama" gizlilik etkileri elde edilir. Bu mekanizmanın bu sonbahardan itibaren kademeli olarak uygulanması planlanıyor.

Büyük ölçekli model damıtma için Fable 5.1'e de yeni kısıtlamalar eklendi. O günden sonra oluşturulan API hesapları, Claude'un geçmiş düşünce kayıtlarını korurken çok turlu diyaloglarda önceki bağlamı manuel olarak değiştiremeyecek. Anthropic, bu değişikliğin esas olarak kamuya açık bir yetenek çıkarma yöntemini engellemek için olduğunu belirtiyor.

Ayrıca AB'nin Yapay Zeka Yasası'nın gerekliliklerini karşılamak için Fable 5.1'in metin çıktısı görünmez damgalar içerecek. Anthropic ayrıca, başlangıçta düzenleyici kurumlara, medyaya, doğrulama kuruluşlarına ve araştırma kurumlarına açık olan tespit API'lerinin küçük ölçekli testlerine başladı.

Son olarak, internet kullanıcıları haklı; erken kalkan yol alır: 5.1'i önce kullanır.

Bu içerik yalnızca bilgilendirme ve eğitim amaçlıdır ve BTCC ile ilgili yatırım tavsiyesi teşkil etmez. BTCC yukarıdaki içeriğin doğruluğunu, kesinliğini veya özgünlüğünü garanti etmek için elinden geleni yapmaktadır ancak bu konuda garanti veremez.

Önerilen

Meta'nın Zuckerberg'i Trump'ı özel olarak aradı: YZ düzenleme kurumu kurulmasınHisse Senedi Eşli Meme Coin'lerin Short Squeeze Efsanesi Neden Çökmeye Mahkum?Jensen Huang G20'de: NVIDIA bu yıl ABD'ye yaklaşık 1 trilyon dolar yatıracakAra Seçimler ABD Hisse Senetleri İçin Bir Destek Sağlayabilir mi?BTCC Günlük (9.3) | CLARITY Yasası'nın 15 Eylül'de Senato Oylamasına Taşınması Bekleniyor, Bitcoin 78.000 Dolar Civarında Konsolide Oluyor