Yapay Zekanın Kavşak Noktası: Wall Street Neden ChatGPT ve Claude'a "Hayır" Diyor?
chaincatcherYazar: Jeff @IOSG
Özel Yapay Zekaya Neden İhtiyaç Duyuluyor?
1 Temmuz'da Palantir CEO'su Alex Karp, CNBC'de 20 dakikalık bir röportaj verdi ve bazı medya kuruluşları bunu "akıl sağlığı bozukluğu" olarak nitelendirdi. Karp'a göre, şirketler en son teknolojiye sahip laboratuvarlara sembolik bir prim öderken, kendi fikri mülkiyetlerinin model tedarikçilerine akmasını izliyorlar. Bu sızıntıyı, mimari düzeyde gerçekleşen alfa transferi olarak adlandırdı: kapalı kaynaklı bir modele gönderilen her istek, servis sağlayıcısının sunucusuna düz metin olarak ulaşıyor. Program yayınlanmadan sadece birkaç gün önce Palantir, açık kaynaklı Nemotron modellerini müşteri kontrollü ortamlarda çalıştırmak için NVIDIA ile bir ortaklık duyurmuş ve dokuz maddelik bir yapay zeka egemenliği bildirgesi yayınlamıştı. CNBC programı yayınlandıktan sonra PLTR %8 oranında yükseldi.
Son yirmi yıldır şirketler, protokol düzeyinde güvene dayalı bulut yazılımlarını benimsedi ve bu işe yaradı. Her SaaS sağlayıcısı kurumsal verilerin yalnızca bir bölümünü görüyor ve çoğu, müşteri verilerini temel ürünlerine geri beslemek için çok az teşvike sahip. Salesforce satış kanallarını, Workday İK'yı, Jira geliştirme yinelemelerini görüyor ve AWS depolama ve bilgi işlem için temel sağlıyor. Bununla birlikte, günümüzün yapay zeka iş akışları, verimliliği en üst düzeye çıkarmak amacıyla, çeşitli departmanları birbirine bağlayan yapılandırılmış bağlamla birlikte tüm varlıkların tek seferlik yüklenmesini savunuyor. İyi niyeti bir kenara bırakırsak, yukarı akış hizmet sağlayıcıları artık bu verileri sunucularda toz toplamasına izin vermek yerine yeni özellikler geliştirmek için kullanabilirler.
Hiç kimse yavaşlamıyor; Anthropic'in yıllık geliri Mayıs ayında 47 milyar dolara ulaşarak 2025 sonundaki 9 milyar dolardan önemli bir sıçrama yaptı, OpenAI ise Şubat ayında 900 milyon haftalık aktif kullanıcıyı aştı. Her iki şirket de bu bahar yeni finansman turlarını tamamladı ve değerlemeleri 1 trilyon dolara yaklaştı; daha da yüksek değerlemelerle halka arz edilmeleri bekleniyor. Yıllarca süren gizlilik ve fikri mülkiyet iddiaları, her iki şirketin de ivme kaybetmesine neden olmadı.
Bazı şirketler zaten harekete geçti. Şubat 2023'te, ChatGPT'nin piyasaya sürülmesinden üç aydan kısa bir süre sonra, büyük Wall Street bankaları kullanımını kısıtladı. Mayıs 2023'te, bir Samsung mühendisinin çip kaynak kodunu ChatGPT'ye sızdırmasının ardından şirket, ağında üretken yapay zekayı yasakladı. Buna karşılık, OpenAI aynı yılın Ağustos ayında ChatGPT Enterprise'ı piyasaya sürerek, eğitim için ticari veri kullanmayacağına ve sıfır veri saklama (ZDR) protokolüne söz verdi; bu protokol daha sonra kurumsal tedarik için standart bir gereklilik haline geldi.
Ancak sözleşmeler yalnızca şirket hesaplarını güvence altına alır. IBM, 2025 yılına kadar veri ihlali olaylarının beşte birinde gölge yapay zekanın (çalışanların kişisel hesapları aracılığıyla yetkisiz yapay zeka araçlarına şirket verilerini aktarması) rol oynadığını ve yoğun gölge yapay zeka kullanımının ihlal maliyetlerine ortalama 670.000 dolar eklediğini tespit etti. Güvenlik eğitimi şirketi Anagram'ın 2025 yılında yaptığı bir ankette, dört çalışan görevleri daha hızlı tamamlamak için yapay zeka kullanım politikalarını ihlal etmeye istekli olduklarını belirtti.
Şirketler en azından ZDR sözleşmeleri ve eğitim gerektirmeyen hizmet katmanlarıyla para harcayarak bu durumdan kurtulabilirler ve eğer bir devlet kurumu veya Palantir müşterisiyseniz, bağımsız dağıtım seçenekleri de mevcuttur. Ancak, sizin ve benim gibi sıradan kullanıcılar için, gizlilik odaklı yapay zekanın önemi, mahkeme celbi kapıya ulaşana kadar tartışılmaya devam edecektir.
Mayıs 2025'te verilen bir mahkeme kararı, OpenAI'yi kullanıcıların sildiği tüketici sohbet kayıtlarını bile saklamaya zorladı ve Kasım ayında bir hakim, bu kayıtlardan 20 milyonunun delil olarak New York Times avukatlarına teslim edilmesini emretti. Ardından ceza davaları geldi: Palisades kundaklama davasındaki sanığın ChatGPT kayıtları delil olarak sunuldu ve Florida'daki çifte cinayet davasındaki bir yeminli ifadede, şüphelinin cesedin nasıl ortadan kaldırılacağına dair soruları yer aldı. Sam Altman ayrıca Temmuz 2025'te verdiği bir röportajda ChatGPT konuşmalarının yasal ayrıcalıkla korunmadığını ve davalarda OpenAI'nin kullanıcı sohbet kayıtlarını "teslim etmesinin gerekebileceğini" kabul etti.
Mesele şu ki, özel konuşmalara ihtiyaç duyanlar sadece suçlular değil. İnsanlar ve yapay zekâ arasındaki konuşmaların arşivlenmesi ve mahkeme celbine tabi tutulması, çoğu kullanıcının farkında olmadığı bir gözetim yönünü temsil ediyor. Kolmogorov Hukuk Bürosu'nun Ekim 2025'te 1000 Amerikalı yapay zekâ kullanıcısıyla yaptığı bir anket, katılımcıların %50'sinin bu konuşmaların mahkeme celbine tabi tutulabileceğinin farkında olmadığını, üçte ikisinin ise bu sohbetlerin avukatlar veya doktorlarla yapılan görüşmelerle aynı korumaya sahip olması gerektiğine inandığını ortaya koydu.
Doğrulanabilir ortamlarda çalışan, kendi sunucularında barındırılan veya açık kaynaklı modeller hızla gelişiyor, ancak en güçlü modeller bile genel yetenekler açısından en gelişmiş kapalı kaynaklı modellerin yaklaşık dört ay gerisinde kalıyor. Bu durum, token maksimizasyonuyla uğraşan işletmeleri ve bireyleri bir yol ayrımına getiriyor: ya bu gizlilik için model kalitesinden birkaç ay fedakarlık edecekler ya da rakipler bu şekilde verimlilik avantajı elde ederken hassas materyalleri Anthropic'in sunucularına yüklemeye devam edecekler.
Şu anda piyasada mükemmel çözümler bulunmamaktadır. Bir rapor, çeşitli tarafların bu açığı kapatma girişimlerini özetliyor ve kanıtlanabilir gizlilik altında en son teknolojiye sahip istihbaratın işletmelere ve sıradan kullanıcılara sunulmasından ne kadar uzak olduğunu inceliyor.
Gizlilik Şu Anda Nasıl Sağlanıyor?
Gizlilik odaklı yapay zeka tek bir proje değil, ancak piyasadaki her mekanizma şu anda aynı olayı ele alıyor: bir komut istemi cihazınızdan ayrılıyor, ağ üzerinden geçiyor, modeli çalıştıran bir makineye ulaşıyor ve ardından bir yanıt döndürüyor. Mekanizmalar arasındaki fark, düz metnin bu yol boyunca nerede bulunduğu, orada kimin okuyabileceği ve yanıtın gizliliğini doğrulamak için neyin kullanıldığıyla ilgilidir.
Protokol Düzeyinde Gizlilik
Bu seviyede, sizin dışınızda başkaları da düz metin komutunuzu okuyabilir ve bundan sonra ne olacağı tamamen bir vaade bağlıdır.
Sözleşmeye Dayalı Sıfır Saklama, kurumsal çözümdür. Hizmet sağlayıcı kim olduğunuzu bilir, talebinizi işler ve sözleşmeler ve itibar yoluyla güvence altına alınan şekilde, talebinizi saklamayacağına söz verir.
Anonim proxy'ler kimliğinizi siler ancak söylediklerinizi şifrelemez; alt hizmet sağlayıcılar yine de düz metni kendi politikalarına göre işler. Şartlar sağlayıcıya göre değişir; örneğin, Duck.ai (DuckDuckGo'nun chatbot ürünü) model satıcılarıyla silme anlaşmaları yapabilirken, Venice kullanıcıların hizmet sağlayıcının her şeyi saklayacağını varsayacağını varsayar, ancak iki taraf da bunu doğrulayamaz.
Makineler arasındaki rotanın her bölümü, yalnızca veri yolunu şifreleyen TLS üzerinde çalışır; alıcı taraf tüm bilgileri okuyabilir. Röleler genellikle bu bilgi edinme hakkını ayırmak için Gizli HTTP (RFC 9458) kullanır; bu, bir arkadaşın notu iletmesi gibi işlev görür. Arkadaş notu kimin ilettiğini bilir ancak içeriğini okuyamaz; alıcı içeriği okuyabilir ancak kimin yazdığını bilmez. OHTTP, Ocak 2024'te IETF standardı haline geldi ve birçok şirket artık üretim trafiğini Cloudflare ve Fastly'den kiralanan OHTTP röleleri üzerinde yürütüyor.
Bu durum, matematiksel bir problem nedeniyle, kapalı kaynaklı modellere erişimde elde edilebilecek gizlilik sınırını da göstermektedir. Amiral gemisi seviyesindeki eğitimlerin mevcut maliyeti milyarlarca dolardır ve bu laboratuvarların yaklaşık trilyon dolarlık değerlemeleri, model ağırlıklarının münhasırlığına dayanmaktadır. Model yetenek açığının süresi, primin süresini belirler; bu nedenle laboratuvarlar, ağırlık dosyalarını devlet sırrı olarak korurlar.
Meta bu deneyi pasif bir şekilde gerçekleştirdi. Şubat 2023'te yayınlanan LLaMA modeli başlangıçta yalnızca araştırmacılara açıktı, ancak bir hafta içinde ağırlıklar 4chan'e tohum şeklinde sızdı. Bir hafta sonra, llama.cpp en küçük 7B modelinin bir MacBook'ta yerel olarak çalışmasına izin verdi ve üç gün sonra Stanford, aynı model üzerinde 600 dolardan daha düşük bir maliyetle Alpaca adlı bir sohbet asistanını ince ayar yaptı. Bu sızıntı, Llama'nın işletme maliyetlerini elektriğe indirgedi ve dosyaya sahip olan herkesin onu evde çalıştırmasına olanak sağladı. Temmuz 2023'te Meta, 700 milyon aylık aktif kullanıcıyı hariç tutan bir maddeyi dışlayan ticari bir lisansla Llama 2'yi resmi olarak açık kaynaklı hale getirdi. Ağırlıklar çalıştı ve ardından premium sürüm geldi.
Teoride, en ileri teknolojiye sahip laboratuvarlar, kapalı kaynaklı modeller üzerinde çıkarım için doğrulama (uzaktan kanıt) sağlayabilir, ancak doğrulama yalnızca hangi kod parçasının komut istemini okuduğunu kanıtlayabilir; bu kodun onunla ne yaptığını kanıtlayamaz. Sunucunun verileri saklayıp saklamadığını belirlemek için, sunucu kodunu denetlememiz ve donanım tarafından bildirilen hash'e yeniden oluşturmamız gerekir. Bununla birlikte, sunucu kodu teslim edildikten sonra, laboratuvar aynı zamanda kar marjlarını destekleyen toplu işleme ve önbellekleme tekniklerinden de vazgeçer ve bu teknikler gelecekteki her model nesline taşınacaktır. Apple ve Meta, iPhone ve WhatsApp'ın arkasındaki hizmet yığınları için uzaktan kanıt sağlayabilir çünkü karları cihazlardan ve reklamlardan gelir ve hizmet kodunu kamuya açıklamak neredeyse hiçbir maliyet getirmez.
Bu nedenle, amiral gemisi modellerinin ağırlıkları ve hizmet kodları harici operatörlere ulaşmaz. Harici operatörler olmadan, üçüncü taraf onayı olmaz; onay olmadan, doğrulanabilir gizlilik yalnızca açık kaynaklı modellerde mevcuttur.
Yapısal Düzeyde Gizlilik
Bu kategorideki her mekanizma, güven vaatlerini donanım, kriptografik veya fiziksel kanıtlarla değiştirir, ancak her birinin gizlilik iyileştirmeleri için farklı maliyetleri vardır; bunun temel nedeni, yalnızca açık kaynaklı modelleri çalıştırabilmeleridir.
TEE (Güvenilir Yürütme Ortamı) Gizli Hesaplama, çıkarım işlemini donanım koruma alanı (çip üzerinde, makine operatörünün bile açamayacağı kapalı bir bölme) içinde gerçekleştirir; çip, hangi modelin ve kod parçasının çalıştırıldığını ayrıntılarıyla belirten bir onay belgesi imzalar.
İstemi yalnızca uç noktada mühürler. Vekil sunucu tarafından aracılık edilen yol boyunca düz metni okuyabilen bir rol kalır ve yalnızca protokol, vekil sunucunun rölenin içeriğini kaydetmesini veya sızdırmasını engeller.
Uçtan Uca Şifreleme (E2EE), okunabilir röleleri mühürler. Kullanıcının cihazı, komut istemini güvenli bölgenin anahtarıyla şifreler ve aradaki her atlama noktası, yalnızca güvenli bölgenin açabileceği mühürlü bir zarf taşır.
Güven, istemci tarafındadır. İstemi şifrelemek ve onayı doğrulamaktan sorumlu kod, bu garantiyi geri alma yeteneğine de sahiptir. Bu nedenle, doğrulanabilir uçtan uca şifreleme (E2EE), hem kanıtlanmış bir güvenli ortam (enclave) hem de açık ve tekrarlanabilir istemci kodu gerektirir.
TEE'nin basitliğine kıyasla, E2EE'nin maliyeti mühendislik yüküdür ve bu da işlevsel entegrasyonu yavaşlatır. E2EE, proxy'yi kör bir haberciye dönüştürür; bu nedenle düz metin okumaya dayanan tüm işlevler, istemci anahtarı etrafında yeniden oluşturulmalı veya yalnızca güvenli alan içinde dahili olarak yeniden yapılandırılmalıdır.
FHE (Tam Homomorfik Şifreleme ve MPC varyantları) güvenilir tarafı tamamen ortadan kaldırır. Sunucu, şifrelenmiş metin üzerinde asla açamayacağı kilitli bir kutuda hesaplamalar yapar; anahtar yalnızca sizin elinizdedir. MPC (Çok Taraflı Hesaplama) ise, aynı etkiyi elde etmek için, tüm katılımcılar iş birliği yapmadığı sürece, istemi birden fazla taraf arasında dağıtılan gizli paylara böler.
Maliyet, hızdır. FHE doğal olarak yalnızca toplama ve çarpma işlemlerini gerçekleştirir, bu nedenle transformatör işlemi için gerekli olan doğrusal olmayan adımların yüksek bir maliyetle yeniden oluşturulması gerekir. Şifreli metin üzerindeki çıkarım maliyeti, düz metne göre 10.000 ila 100.000 kat daha fazladır ve küçük modellerde her bir belirteç için saniyeler ila dakikalar sürerken, şifrelenmemiş koşullar altında yalnızca milisaniyeler sürer.
Şifreli hesaplama için özelleştirilmiş çiplerin bu farkı kapatması bekleniyor, ancak ilk prototipin demosunu tamamlaması 2026 yılının başlarına kadar sürecek ve ticari sürümlerin piyasaya sürülmesi birkaç yıl daha alacak.
Yerel Çıkarım bu yolu doğrudan ortadan kaldırır. Model kendi donanımınızda çalışır; röle, sunucu, servis sağlayıcı veya doğrulama gereksinimi yoktur.
Bariz maliyetler, masraf ve model kapasitesidir. gpt-oss-120b, Yapay Analiz endeksinde GLM-5.2'nin yaklaşık yarısı kadar puan alıyor, ancak boyutu 65 GB olup, piyasadaki iki amiral gemisi oyun grafik kartının toplam VRAM'ini aşıyor. Tam hassasiyetli GLM-5.2 yalnızca 8 kartlı bir veri merkezi düğümünde çalıştırılabiliyor ve sadece GPU'lar için 300.000 dolardan fazla maliyeti var.
Ancak, bu yapısal sınırlamaların ötesinde, çıkarım işlemini güvenli ortamlara yerleştirmenin maliyeti azalmaktadır. Tek kartlı çıkarımda, güvenli ortam bulut hizmeti sağlayıcısı Phala'nın kıyaslama testleri, güvenli ortam modunda H100 için verim kaybının ortalama %7'den az olduğunu ve büyük modellerde neredeyse sıfır olduğunu göstermektedir; çünkü asıl maliyet, çip içinde hesaplama yapmaktan ziyade verilerin çipe taşınmasında yatmaktadır. Çok kartlı çıkarımda, NVIDIA'nın yeni nesil GPU'su Blackwell artık çipler arası trafiğin doğrudan şifrelenmesini desteklerken, eski H100 aynı etkiyi yalnızca bant genişliğinin yedide biri oranında CPU ana bilgisayarı üzerinden yönlendirme yaparak elde edebiliyor. NVIDIA'nın Blackwell üzerindeki kendi kıyaslama testleri, güvenli ortam modunda 397B model için verim kaybının %8'den az olduğunu göstermektedir. Bu gelişmelerle birlikte, gizlilik çıkarımının performans kaybı artık belirleyici bir kısıtlama olmaktan çıkmıştır.
Aslında, güvenli alanın kendisi operatör için neredeyse hiçbir ek işletme maliyeti getirmiyor. 2023'ten sonraki her H100, güvenli alan moduyla birlikte geliyor ve ek maliyet, ekstra çiplerden değil, şifrelemeden kaynaklanan verim kaybından kaynaklanıyor. Şu anda, Azure'da gizli H100 SKU'larının kiralama fiyatı saatte 8,90 dolar iken, güvenli alan olmadan bu fiyat 6,98 dolar olup, geleneksel bulut tesislerine göre %27'lik bir fiyat artışını temsil ediyor. Öte yandan, güvenli alanlarda uzmanlaşmış Phala gibi operatörler, gizli modlu H100'leri saatte 3,80 dolardan başlayan fiyatlarla kiralıyor; bu fiyat, Lambda'nın standart SXM kartları için 3,99 ila 4,29 dolar arasındaki fiyat aralığından daha düşük. Barındırılan API çözümlerinde, NEAR AI, Amazon Bedrock, Together ve Groq'daki düz metin rotalarına benzer şekilde, gpt-oss-120b için milyon token girişi başına 0,15 dolar ve çıkış başına 0,55 dolar fiyatla onaylama özelliğine sahip uç noktalar sunuyor. Çoklu çip paralelliği gerektiren modellerde bile, NEAR AI'nin GLM 5.2'deki fiyatlandırması Fireworks ile aynıdır ve daha büyük Kimi K2.6'da girişler %15, çıkışlar ise %4 daha ucuzdur.
Bu yeni gizlilik çıkarımı sağlayıcıları pazar payı kapmak için karlarını feda ediyor olabilirler (bu, büyümeyi hedefleyen piyasadaki her şirket için geçerlidir), ancak yapısal eğilim, hem tüketiciler hem de operatörler için gizliliğin maliyetinin azalması yönündedir.
Açık Kaynak Modelleri Nasıl Kazanıyor?
Performans yükü azaltılmış olsa da, en gelişmiş modeller ile en son teknolojiye sahip açık kaynak modelleri arasında gözle görülür bir fark bulunmaktadır. Maksimum verimlilik hedefleyen bir kuruluş, fikri mülkiyetini çalmayacağından emin olmak için en gelişmiş laboratuvarlara güvenmek zorundadır.
Aradaki fark hâlâ mevcut, ancak Bridgewater ve Thinking Machines bünyesindeki AIA Labs, 30 Haziran'da bir örnek sundu: Uzman açıklamalarıyla ince ayar yapılan açık kaynaklı bir model, hem doğruluk hem de maliyet açısından en yeni modelden aynı anda daha iyi performans gösterdi.
Çalışmada, ekip Qwen3-235B modelini Tinker (Thinking Machines'in barındırdığı ince ayar API hizmeti) üzerinde ince ayar yaptı. İlk olarak satıcıdan ek açıklamalar aldılar, bu veri grubuyla ilk turu eğittiler ve ardından farklı örnekleri yeniden açıklama için şirketin yatırım personeline geri gönderdiler. Eğitimde, üç değişiklikle birlikte takviyeli öğrenme (GRPO) kullanıldı: döngüsel gruplama (her görev sırayla bir grup üretir), CISPO kaybı (tek bir cevabın modeli ne kadar ileriye taşıyabileceğini sınırlama) ve politika tabanlı damıtma (modelin daha zayıf kopyalardan öğrenmemesini sağlamak için mevcut en iyi kontrol noktasına sabitleme).
Tüm görevler, yatırım personelinin günlük iş akışlarından alınmıştır: bir haber makalesinin üst düzey yatırım profesyonelleri için önemli olup olmadığı, bir merkez bankası belgesinin gelecekteki faiz oranı değişikliklerini öngörüp öngörmediği ve bir belgede veya e-postada şablon ifadelerine nereden başlanacağı gibi. Puanlama, bağımsız bir test setinden elde edilmiştir; en gelişmiş modeller basit sorularda ortalama %50 başarı gösterirken, uzman sorularında yalnızca %78,2'ye ulaşarak yatırım personeli tarafından belirlenen %80 eşiğinin altında kalmıştır. İyileştirilmiş Qwen modeli %84,7'lik bir başarı elde etmiştir; bu da orijinal metne göre, en gelişmiş optimal modele göre %29,8 daha az hata yaptığı ve çıkarım maliyetlerinin 13,8 kat daha düşük olduğu anlamına gelmektedir.
https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/
Bu örnek, açık kaynaklı modellerin hem doğruluk hem de maliyet açısından üstünlük sağlayabileceğini gösteriyor, ancak eğitim süreci yine de gizli değil. Süreçte kullanılan uzman açıklamaları, Bridgewater'dan alınan özel veriler olup, Tinker'ın üçüncü taraf hizmetinden geçerek ZDR protokolüyle aynı güven düzeyine ulaşıyor. Fon ayrıca işlem gücü kiraladı ve tüm eğitim, asla kontrol etmediği makinelerde gerçekleştirildi. Güven varsayımı olmadan bu formülü isteyen alıcıların bugün çok az seçeneği var. Sadece GPU kümeleri kiralamak, eğitim sürecini bulut operatörleri için okunabilir hale getiriyor. Bir küme satın almak veri barındırma sorununu çözüyor, ancak maliyetler fırlıyor.
Onaylı rota nihayet geldi. Mart ayında Workshop Labs ve Tinfoil, tek bir 8 kartlı düğümde Tinfoil enklavlarında çalışan ve anahtarları yalnızca müşteri tarafından kontrol edilen bir eğitim sonrası yığını olan Silo'yu piyasaya sürdü. Makalede, enklav maliyetinin iki saatlik bir eğitim oturumuna 11 dakika eklediği ve bu yığının, temel ağırlıkları dondurarak ve yalnızca bunların üzerine küçük adaptörler eğiterek trilyon parametreli bir modeli (Kimi K2 Düşüncesi) barındırabileceği belirtiliyor. Zorluk, takviyeli öğrenmenin bileşenler arasında veri taşımayı gerektirmesinde ve veri taşımanın tam olarak enklav maliyetlerinin ortaya çıktığı noktada yatmaktadır.
Silo'nun piyasaya sürülmesinden bir ay bile geçmeden Workshop Labs, Thinking Machines tarafından satın alındı ve artık bu ortamda bir sonraki Bridgewater tarzı RL döngüsünü çalıştırmak için gereken tüm bileşenler aynı şirketin bünyesinde bulunuyor.
Bağlantı Katmanında Gizlilik
Tüm özel çıkarım mekanizmalarının dışında kalan başka bir sorun daha var. Bu mekanizmaların her biri komut isteminden modele giden yolu yönetirken, bir ajan tarafından başlatılan her harici araç çağrısı, çıkarım katmanının temelde dokunamayacağı bir yol açar. Son zamanlardaki donanım mühendisliği trendi bu sorunu daha da büyütüyor; modeli çevreleyen her araç, bellek deposu ve veri kaynağı, iş akışının kendi dilimini düz metin olarak okuyan başka bir hedeftir. Takvim sunucuları programları okur, veritabanı sunucuları sorguları okur. Tamamen yerel bir ajan, eğitim kümesinin dışında bir şey istiyorsa, arama terimlerini düz metin olarak bir arama motoruna göndermek zorundadır, çünkü sunucu düz metni okuyamaz ve dolayısıyla soruları yanıtlayamaz.
Ana akım çözümler hala varsayılan olarak protokol katmanını kullanıyor. Runlayer ve MintMCP gibi şirketler, tüm araç trafiğini kontrol etmek için merkezi bir ağ geçidi kullanıyor ve istekler gönderilmeden önce kişisel olarak tanımlanabilir bilgileri (PII) maskeliyor. Ağ geçidi ayrıca hangi sunucuların trafiği alabileceğine karar veriyor, doğrulanmamış olanları engelliyor ve ileride referans olması için her çağrının hedef adresini ve içeriğini kaydediyor. Bu kontroller bağımsız denetimlere (SOC 2) tabi olsa bile, araç sunucularının yanıt vermek için düz metin sorgularını okuması gerekiyor ve kopyaları saklayıp saklamadıkları, kendi saklama politikalarına ve sistemdeki her bir araç sayısına bağlı. Dahası, ağ geçidinin kendisi de doğrulama yerine yol boyunca güvene bağlı ek bir okuma tarafıdır.
Yapısal düzeydeki çözümler bu orta katmanı hedef alır. Örneğin, Phala, cüzdanları, kod yürütmeyi ve veri kaynaklarını kapsayan MCP sunucusunu doğrudan bir TEE içinde barındırır ve kullanıcıların operatöre güvenmek yerine gizlilik bildirimlerini bir onay belgesiyle doğrulamalarına olanak tanır. Bununla birlikte, TEE'de barındırılan araçların yine de hizmet sağlayıcılara düz metin halinde sorgular göndermesi gerekir; güvenli alan yalnızca mesajı ileteni mühürler, hedefi değil.
Sadece birkaç platform, okuma yapmadan yanıt vermeyi öğrendi, ancak bu sadece yapılandırılmış sorgular için geçerli. Apple, iPhone için özel bilgi alma özelliği sunarak, arayan numaralarının spam arama veritabanlarıyla eşleştirilmesini, numaranın ifşa edilmemesini sağlıyor ve Microsoft da Edge tarayıcısında şifreler için aynı yöntemi kullanıyor. MongoDB'nin Sorgulanabilir Şifreleme özelliği, istemcilerin alanları ayrılmadan önce şifrelemesine olanak tanıyarak, sunucunun eşitlik ve aralık eşleştirmesini yalnızca şifrelenmiş metne dayanarak gerçekleştirmesini sağlıyor.
Ancak, açık uçlu aramalar için günümüzdeki en iyi cevaplar hala güvene dayanmaktadır; doğrulanabilir şifreli arama henüz laboratuvardan çıkmamıştır. Brave, 40 milyar sayfalık kendi dizininde (Google'ınkinden farklı olarak) sıfır veri saklama sözü veriyor, ancak yine de protokol katmanının altında kalıyor. Exa, kullanıcı anahtar kelimelerini anlamsal olarak yerleştiren ve sonuçları anlamsal olarak eşleştiren bir sinirsel dizin oluşturdu, ancak bu yerleştirme adımı hala Exa'nın sunucularında düz metinden başlıyor. MIT'nin 2023 tarihli Tiptoe makalesi, sorguları ifşa etmeden 360 milyon web sayfasında sıralama elde etti, ancak her arama önemli miktarda sunucu işlem gücü tüketiyor ve sıralama kalitesi şifrelenmemiş aramalardan farklı. Apple'ın 2024 tarihli Wally makalesi, gerçek sorguları yanıltıcı sorgular arasında gizleyerek iletişim maliyetlerini 31 kata kadar azaltıyor, ancak bu matematik yalnızca milyonlarca eş zamanlı sorguda ucuz hale geliyor; bu da şu anda hiçbir özel arama sisteminin sahip olmadığı bir ölçek.
Şifreli arama mümkün; ancak performans ve fiyat açısından ticari olarak uygulanabilir bir seviyeye henüz ulaşmadı.
Görünüm
Özel yapay zekâya olan talep artıyor. Venice AI kısa süre önce 3,5 milyon kayıtlı kullanıcıyı ve aylık 1,3 trilyon token işlem hacmini aşarak, 1 milyar dolar değerinde yeni bir A Serisi öz sermaye finansmanı turunu tamamladı. Doğrudan rakibi olan Proton'un sohbet ürünü Lumo, piyasaya sürülmesinden bir yıl içinde 10 milyon kullanıcıyı aştı. Altyapı açısından, Phala şu anda OpenRouter üzerinde günlük 2 ila 3 milyar token işlem gerçekleştiriyor. Duck.ai, gpt-oss-120b ve Gemma'yı Tinfoil'in güvenli alanına yönlendirerek, kullanıcı proxy'lerinin ötesinde doğrulanabilir gizlilik sağlıyor. Bu, modellerin kişinin kendi donanımında çalışması ve kullanım izi bırakmaması nedeniyle, özel çıkarım için muhtemelen en büyük kanal olan kendi kendine barındırmayı bile hesaba katmıyor.
Ancak, genel olarak yaygın yapay zekâ dalgasında, gizlilik odaklı yapay zekâ yalnızca küçük bir paya sahip ve bu açık, ancak en ileri teknolojiye sahip laboratuvarlar bu talebi bilinçli olarak karşıladığında kapanacak. Mayıs ayında Google, tüm ürünlerinde 320 trilyon token işledi; bu da Venice'in aylık işlem hacminin kabaca Google'ın 18 dakikalık işlem hacmine eşdeğer olduğu anlamına geliyor. Geçen Kasım ayında Google, NCC Group tarafından bağımsız olarak denetlenen tasarımlarla, şirketin kendisinden izole edilmiş kapalı TPU ortamlarında Gemini tabanlı bazı özellikleri çalıştıran Özel Yapay Zeka Hesaplama (PAC) hizmetini başlattı. Ancak sorun şu ki, PAC yalnızca kişiselleştirilmiş öneriler ve ses özetleri gibi birkaç Pixel özelliğini kapsıyor, yüz milyonlarca kişi tarafından kullanılan Gemini uygulamalarını kapsamıyor. Google, bu özelliklerin token satışı yoluyla değil, cihazlar ve reklamlar aracılığıyla para kazanması nedeniyle tasarımları denetçilere teslim etmeye istekli.
Mevcut barındırma çözümleri de kusurludur. Uçtan uca şifreleme (E2EE) yoluyla en yüksek gizliliği arayan kullanıcılar, hizmet sağlayıcıların okuyamadığı yerlerde yeni özelliklerin yeniden oluşturulmasını beklemek zorundadır. Özel ağlar hala hizmet katmanındaki protokollere bağlıdır. Makul fiyatlı eğitim sonrası hizmetler, en iyi ince ayar sonuçlarını elde etmek için üçüncü taraf tedarikçilere güvenmeyi gerektirir. Kendi kendine barındırma, tüm hizmet sağlayıcılarını tamamen ortadan kaldırır, ancak en güçlü açık kaynak modellerini yerel olarak çalıştırmak, onları barındıran binadan daha pahalıya mal olabilir.
Kusurları bir kenara bırakırsak, özel yapay zeka gerçek ve uygun fiyatlı bir seçenek haline geldi ve kalan boşluklar daralıyor. Sıradan tüketiciler için, Lumo ve Venice'te kayıt tutmama sözüyle sunulan açık model özel sohbetler hiçbir maliyet gerektirmezken, Venice veya Tinfoil'den 18 ila 20 dolarlık abonelikler aynı sohbetleri güvenli ortamlarda (enclaves) kapsüller ve ChatGPT aboneliğinden daha pahalı değildir. Kurumsal iş akışları için, doğrulama özelliğine sahip uç noktalar artık düz metin rotalarından bile daha ucuz. NEAR'ın E2EE API'si gibi uç noktalar, bellek, dosya yüklemeleri ve özel talimatlarla birlikte şifrelenmiş bağlamı güvenli ortamlara (enclaves) getirebiliyor. Doğrulama ile eğitim sonrası işlemlere gelince, NVIDIA'nın yakında piyasaya süreceği Vera Rubin NVL72, gizli hesaplamayı Blackwell'in 8 kartlı düğümlerinden 72 kartlı raflara genişleterek, IP'yi açığa çıkarmadan en son teknolojiye sahip RL döngülerini daha uygulanabilir hale getirecek.
Ancak, asıl değer yakalama bu fiyat sıkıştırma seviyelerinin ötesinde yatıyor. Gizlilik, zaten var olduğu yerlerde neredeyse ücretsiz, ancak ana akım ajan tabanlı iş akışlarını kapsamamış durumda. Güvenlik alanlarını kiralamaya ve satmaya odaklanan operatörler, standart çipler üzerinde bir anahtara sahipler, bir hendek değil; protokol katmanı ağ geçitleri ise geleneksel ara yazılımlarla rekabet ediyor. Savunulabilir alan, bu raporun çözülmemiş kalan yarısıdır: güvenlik alanlarına kilitlenmiş eğitim döngüleri, uçtan uca mühürlenmiş araç çağrıları ve görünmez terim arama indeksleri. Bunlardan birini ilk başaran, herhangi bir fiyat savaşıyla ticarileştirilemeyecek bir şey satacaktır. Gizlilik yapay zekasını kovalayan sermaye, o anahtarı değil, boşlukları satın almalıdır.
Peki, güvenmek mi yoksa doğrulamak mı? Yoğun işlem gerektiren ve ajan ağırlıklı görevler için güvenmeyi seçin, çünkü her araç çağrısı doğal olarak, güvenli bölgelerin mühürleyemediği hedeflere düz metin gönderir ve en gelişmiş modeller bu tür döngülerde fiyatlarını hak eder. Bir şirketi rakiplerinden ayıran üst düzey düşünce söz konusu olduğunda ise doğrulamayı seçin. Yıllarca süren profesyonel deneyimden damıtılmış strateji, planlama ve yargılar tam olarak bu tartışmalı alfa değeridir. İleriye dönük yol, şirket kontrolü sınırları içinde bu özel içgörülerle açık kaynaklı modelleri ince ayarlamaktır. Bir şirketin alfa değerinin bulunduğu alanlarda, uzmanlar tarafından ayarlanmış açık kaynaklı modeller, doğruluk ve maliyet açısından en gelişmiş modelleri aynı anda geride bırakmıştır ve gizlilik ortamlarında bunları oluşturmak için gereken altyapı adım adım gelmektedir.
Bu içerik yalnızca bilgilendirme ve eğitim amaçlıdır ve BTCC ile ilgili yatırım tavsiyesi teşkil etmez. BTCC yukarıdaki içeriğin doğruluğunu, kesinliğini veya özgünlüğünü garanti etmek için elinden geleni yapmaktadır ancak bu konuda garanti veremez.