Yushu (bir teknoloji şirketi) yöneticisi işleri baltalıyor mu? Somutlaştırılmış zekanın "ChatGPT anına" ne zaman ulaşacağız?
PanewslabGiderek artan bir eğilim, somutlaştırılmış zeka endüstrisinin, daha önce uzak bir zaman dilimi olan "genel amaçlı robotlar"ı gelecekteki tek bir teknolojik döngüye sıkıştırmasıdır.
İnsansı robotların en popüler olduğu bir dönemde, A hisse senedi piyasasında işlem gören "ilk insansı robot hissesinin" yöneticisi, sektöre soğuk duş etkisi yaratmış gibi görünüyor.
20 Ağustos'ta, 2026 Dünya Robot Konferansı'nda, Unitree Robotics'in kurucusu Wang Xingxing, şirketin halka arzından sonraki ilk kamuoyu konuşmasında, somutlaştırılmış zekâ olan ChatGPT'nin anının henüz gelmediğini kabul etti. Bu, en erken iki ila üç yıl, en geç beş ila on yıl sonra gerçekleşebilir.
Son iki yıldır insansı robotlar en gözde teknoloji "moda ürünü" haline geldi. Bu fütüristik robotlar, büyük galaların sahnelerinde, oyun şirketlerinin sergilerinde ve hatta alışveriş merkezlerinin ve perakende mağazalarının girişlerinde giderek daha fazla görünür hale geliyor. Dans ediyorlar, yürüyorlar ve el sallıyorlar; bazen çevik, bazen beceriksizce hareket ederek izleyicilerle etkileşim kuruyorlar ve tokalaşıyorlar, hızla laboratuvardan halkın gözü önüne çıkıyorlar.
Ancak bu hareketli gösterilerin ardında, bu robotların gerçek yetenekleri, insanların "geleceğin robotları" hakkındaki hayal gücünden açıkça çok uzakta. En azından daha yaygın beklentide, robotlar sadece sahnede performans sergilemek veya pazarlama amacıyla kullanılmakla kalmamalı, fabrikalara ve evlere girerek taşıma, düzenleme, alet çalıştırma veya bazı ev işleri ve bakım görevlerini üstlenmelidir. Halkın sorusu ise spesifik ve doğrudan: Robotlar ne zaman gerçekten çalışabilir hale gelecek?
Büyük dil modelleri alanında ChatGPT, oldukça sembolik bir yanıt sağladı. İlk dil modeli olmasa da, çok sayıda sıradan kullanıcının yapay zekanın belirli bir yetenek eşiğini aştığını sezgisel olarak fark etmesini sağlayan ilk modeldi. Benzer bir anın somutlaştırılmış zeka alanında ne zaman gerçekleşeceği, robotik endüstrisindeki en acil sorulardan biri haline geliyor.
Robotların her eve girmesinin anahtarı, genelleme yeteneklerinde yatıyor.
20 Ağustos'ta düzenlenen Dünya Robot Konferansı'nda Unitree Robotics'in kurucusu Wang Xingxing, sektörde defalarca tartışılan ve somutlaştırılmış zekanın en büyük darboğazı olarak nitelendirilen bir soruna dikkat çekti.
Ona göre, yeterli veri toplama ve eğitim sağlandığı takdirde, birçok robot modeli sabit senaryolarda %100'e yakın başarı oranına ulaşabilir. Bununla birlikte, manipüle edilen nesne değişirse veya ortam biraz değişirse, başarı oranı önemli ölçüde düşebilir.
Bu, robotların hayatlarımıza ve evlerimize gerçekten girmesinden önce aşılması gereken en önemli engeldir.
Wang Xingxing oldukça spesifik bir kriter sundu: Eğer bir gün bir robot tamamen yabancı bir eve veya ortama getirilip sadece sesli veya sözlü komutlar kullanarak görevlerin yaklaşık %80'ini tamamlayabilirse, o zaman somutlaştırılmış zeka "ChatGPT anına" ulaşmış olacaktır. Zamanlama açısından, bunun en hızlı şekilde 2 ila 3 yıl, en yavaş şekilde ise 5 ila 10 yıl sürebileceğine inanıyor.
Wang Xingxing özellikle asıl zorluğun robotun "genel olarak ne yapacağını bilmesini" sağlamakta değil, son birkaç santimetrede hatta milimetrede olduğunu vurguladı.
Örneğin, bir robottan bir nesneyi almasını isterseniz, model tüm eylemi doğru bir şekilde planlamış olabilir ve robot kolu nesnenin yakınına hareket etmiş olabilir. Ancak, son konum hatası, dokunsal geri bildirim veya kavrama kuvveti doğru şekilde düzeltilmezse, tüm görev başarısız olabilir.
Robotlar ve büyük dil modelleri bu noktada da büyük farklılıklar göstermektedir.
Bir dil modelinin girdisi ve çıktısı her zaman dijital alanda gerçekleşirken, bir robotun her algısı ve eylemi gerçek fiziksel dünyayla etkileşim halinde olmalıdır. Sensörlerde gürültü, aktüatörlerde hatalar vardır ve nesnelerin konumu, malzemesi ve ağırlığı sürekli değişmektedir; bu hatalar görevler yerine getirilirken birikir. Bu nedenle, somutlaştırılmış zekâ için, "temelde bir şeyi yapabilmekten" "onu tutarlı bir şekilde doğru yapmaya" geçmek, bir görevi ilk öğrenmekten daha zor olabilir.
Wang Xingxing'in yukarıda belirtilen değerlendirmesiyle neredeyse eş zamanlı olarak, Galaxy General'in kurucusu ve CTO'su Wang He de daha spesifik bir yıl belirtti. Wang He, sürekli veri birikimi ve teknolojik atılımlarla birlikte, somutlaştırılmış zekanın 2028 yılında "ChatGPT anına" ulaşmasının beklendiğini ifade etti. Bu dönüm noktasını şu şekilde tanımlıyor: robotların, belirli bir görev için özel bir eğitim almadan günlük görevlerin yaklaşık %70 ila %80'ini tamamlayabilmesi.
Değerlendirmeleri aslında birbirine çok yakın. Wang Xingxing, robotun yabancı bir ortama girdikten sonraki görev tamamlama oranına odaklanırken, Wang He ise özel bir eğitim almadan temel modelin doğrudan genelleme yeteneğine odaklanıyor. Bununla birlikte, her ikisi de bilinmeyen görevler için başarı oranını yaklaşık %70 ila %80 olarak belirlemiş durumda.
Bu aynı zamanda, bahsettikleri "ChatGPT anının" günümüzdeki insansı robotların sergilediği hareketlilik ya da iyi eğitilmiş, sabit bir demo tarafından elde edilen %99'luk başarı oranı olmadığı anlamına da geliyor. Gerçek değişim, robotlar sabit sahnelerden, sabit nesnelere ve özel eğitime olan bağımlılıklarından kurtulmaya başladıktan sonra gerçekleşmelidir.
Robotlar ne zaman gerçekten "anlayacak"? Genel kanı 2 ila 5 yıl arasında.
Bundan sadece bir ay önce, 2026 Dünya Yapay Zeka Konferansı'nda (WAIC), somutlaştırılmış zeka alanında önde gelen altı girişimci ve araştırmacıya aynı soru yöneltilmişti.
19 Temmuz'da, Zhiyuan Robotics ve Mifeng Technology'nin ev sahipliğinde düzenlenen "Akıllı Vücutlu Forum"da, final yuvarlak masa tartışması sırasında sunucu altı konuğa oldukça doğrudan bir soru yöneltti: Robotlar için ChatGPT anına kaç yıl kaldı?
Sonuçlar şaşırtıcı derecede yoğunlaşmıştı. Zhiyuan Robotics ortağı ve Mifeng Technology'nin başkanı ve CEO'su Yao Maoqing 2 yıl cevabını verdi; Sunday Robotics'in kurucu ortağı ve CEO'su Tony Zhao 3 yıl içinde olacağına inanıyordu; Tencent'in baş bilimcisi ve Robotics X Lab'ın direktörü Zhang Zhengyou 3 ila 5 yıl verdi; Dyna Robotics'in kurucu ortağı ve baş bilimcisi Ma Yecheng yaklaşık 4 yıl süreceğine inanıyordu; Physical Intelligence'ın araştırma bilimcisi Ren Zhiyi 4 ila 5 yıl süreceğini tahmin etti; ve Georgia Teknoloji Enstitüsü'nden profesör Xu Danfei 5 yıl cevabını verdi.
Altı kişi tamamen farklı şirketlerden ve araştırma kurumlarından geliyordu ve teknik yaklaşımları da farklıydı, ancak nihai cevaplarının tümü önümüzdeki iki ila beş yıla odaklanmıştı.
Bunlar arasında Yao Maoqing en iyimser olanıdır. Onun değerlendirmesi esas olarak veri ölçeğinin büyümesine dayanmaktadır. Yao Maoqing'in görüşüne göre, fiziksel yapay zekanın daha da gelişmesini kısıtlayan temel faktörler üç duvar olarak özetlenebilir: "veri, temsil ve kapalı döngü". İnternet dünyasında ucuza elde edilebilen büyük miktardaki metin ve görüntülerle karşılaştırıldığında, gerçek dünya robot etkileşim verileri yalnızca pahalı olmakla kalmaz, aynı zamanda robotun kendisindeki, görevdeki ve senaryodaki farklılıklarla da sınırlıdır.
Gerçekten kullanıma hazır bir robotun, açık uçlu doğal dil komutlarını anlaması ve yaygın görevlerde yaklaşık %70 ila %80'lik temel bir başarı oranına ulaşması gerekir. Bunu başarmak için, somutlaştırılmış zeka, mevcut seviyelerin çok ötesinde bir ölçekte veri gerektirir. Hatta gelecekte, yüz milyonlarca saatlik veri gerektirebileceğini bile öne sürdü.
Başka bir deyişle, Yao Maoqing'in değerlendirme çerçevesinde, "ChatGPT anı" büyük ölçüde bir ölçeklendirme problemidir: gerçek dünya verileri, simülasyon verileri, internet videoları, birinci şahıs bakış açısı verileri ve robot konuşlandırmasından sonra geri dönen veriler belirli bir ölçeğe ulaştıkça, modelin yetenekleri de kritik noktayı aşabilir.
Öte yandan, Sunday Robotics'ten Zhao Zihao, üç yıldan daha kısa bir zaman dilimi belirledi. Zhao, giderek daha karmaşık robot gövdeleri geliştirmek yerine, robotun "beyninin" gerçekten olgunlaşacağı zamanla daha çok ilgileniyor. Sunday Robotics uzun zamandır ev robotlarına ve temel modellere odaklanıyor. Düşünceleri şu ki, yeterince güçlü bir temel robot modeli, nispeten basit ve düşük maliyetli tutucular kullansa bile, karmaşık ortamları ve görevleri anlayabiliyorsa, öncelikle çok sayıda pratik sorunu çözebilir.
Zhang Zhengyou'nun tavrı çok daha temkinliydi. 3 ila 5 yıl arasında bir cevap verdi, ancak bu zaman diliminin sektörün aniden daha büyük bir modelin ortaya çıkmasını beklemesi gerektiği anlamına gelmediğini vurguladı. Büyük dil modellerinin hızlı ölçeklendirilmesinin temel ön koşullarından biri, Transformer'ın kademeli olarak daha birleşik bir mimariye dönüşmesidir. Ancak robotik zekâ henüz böyle net bir teknolojik paradigma oluşturmamıştır.
Yüksek seviye bilişsel yeteneklerden, görsel algıdan ve görev planlamasından gerçek zamanlı hareket kontrolüne, vücut geri bildirimine ve güvenlik tepkilerine kadar, bir robotun farklı zaman ölçeklerindeki sorunları eş zamanlı olarak ele alması gerekir. Bu nedenle, gerçek atılımlar, büyük dil modellerinin ölçeklendirme yasasını basitçe kopyalamak yerine, veri toplama, simülasyon, gerçek dünya uygulaması, arıza giderme ve donanım ile modellerin eş zamanlı geliştirilmesinde ilerlemeler gerektirebilir. Bu nedenle, Zhang Zhengyou değerlendirmesini yaparken, sektörün hala "özenle ve pratik bir şekilde çalışması" gerektiğini özellikle vurguladı.
Dyna Robotics'ten Ma Yecheng, yaklaşık dört yıllık bir zaman dilimi tahmin ediyor. Değerlendirmesi büyük ölçüde ticari kullanıma dayanıyor. Bir laboratuvar demosunda, teknolojinin etkinliğini kanıtlamak için %80 veya %90'lık bir başarı oranı yeterli olabilir; ancak, robot satın alan bir fabrika veya hizmet şirketi için bu güvenilirlik genellikle yeterli olmaktan çok uzaktır. Bu nedenle, somutlaştırılmış zekanın "ChatGPT anı", robotun daha fazla görevi anlayabilmesi anlamına gelmekle kalmaz, aynı zamanda gerçek dünya ticari ortamlarında kabul edilebilir bir güvenilirlik seviyesine kadar daha da geliştirilmesi gerektiği anlamına da gelir.
Physical Intelligence şirketinden Ren Zhiyi, bu süreç için 4 ila 5 yıllık bir zaman dilimi öngördü. Zhiyi, Physical Intelligence'a katılmadan önce bu sürecin 10 yıl sürebileceğini düşündüğünü, ancak son bir yılda temel robot modellerinin geliştirilmesiyle beklentilerinin önemli ölçüde kısaldığını belirtti.
Physical Intelligence, "robot temel modeli" yaklaşımında önde gelen şirketlerden biridir ve aynı modelin, farklı ontolojiler ve görevler arası veri eğitimi yoluyla kademeli olarak daha geniş operasyonel yetenekler kazanmasını hedeflemektedir. Bu yaklaşımın gerçekten önemli yönü, model ve veri ölçeği genişledikçe robot yeteneklerinin sürekli olarak ortaya çıkıp çıkamayacağı ve nihayetinde büyük dil modellerinde sıfır atışlı transfer öğrenimine benzer bir etki yaratıp yaratamayacağıdır.
Georgia Teknoloji Enstitüsü'nden Profesör Xu Danfei en muhafazakar cevabı verdi, ancak bu bile sadece 5 yıllık bir süreyi kapsıyordu. Belirli bir model yaklaşımına bel bağlamak yerine, üç temel ölçüte daha çok odaklandı: modelin verilerden gerçekten öğrenip öğrenemeyeceği, öğrenilen yeteneklerin yeni ortamlara ve görevlere genelleştirilip genelleştirilemeyeceği ve çıkarım hızının robotun gerçek dünyadaki gerçek zamanlı operasyonel gereksinimlerini karşılayıp karşılayamayacağı.
Wang Xingxing'in "en hızlı şekilde 2 ila 3 yıl" tahmini, Wang He'nin "2028" tahmini ve WAIC'deki altı konuğun yanıtlarını bir araya getirdiğimizde, giderek daha belirgin hale gelen bir olgu ortaya çıkıyor: somutlaştırılmış zeka endüstrisi, daha önce uzak bir zaman dilimi olan "genel robotlar"ı gelecekteki bir teknolojik döngüye sıkıştırıyor.
Bu, açık bir tarihsel dönüm noktası mı, yoksa kademeli bir süreç mi?
Ancak, bu girişimciler ve araştırmacılar zamanlama konusunda tahminlerinde birbirlerine daha çok yaklaşsalar da, "ChatGPT anı"nı tartışmak için aslında aynı standartları kullanmıyorlar.
Wang He, temel modelin yeteneklerindeki sıçramaya odaklanıyor. Tanımına göre, somutlaştırılmış zeka, bir robotun her yeni görev için yeniden eğitilmesine gerek kalmadığında ve yalnızca temel modeli kullanarak günlük görevlerin %70 ila %80'ini tamamlayabildiğinde, ChatGPT'ye benzer kritik bir noktayı aşıyor. Bu standart, modelin belirli görevler için "uzmanlaşmış zekadan" güçlü aktarılabilirlik özelliğine sahip genel zekaya geçip geçemeyeceğini öncelikle ölçüyor.
Wang Xingxing'in standardı, gerçek dünyadaki robotların performansına daha yakındır. O da yaklaşık %80'lik bir görev tamamlama oranını önemli bir eşik olarak görüyor, ancak robotun yabancı bir ortama girdiğinde yalnızca dil komutlarına dayanarak çoğu görevi tamamlayıp tamamlayamayacağına vurgu yapıyor. Ona göre, günümüzde birçok robot iyi eğitilmiş, sabit ortamlarda yüksek bir başarı oranı elde edebiliyor. Asıl zorluk, modelin ortamda, nesnelerde veya görevlerde meydana gelen değişikliklerden sonra çalışmaya devam edip edemeyeceğinde yatıyor.
Bu iki tanım benzer görünse de aslında farklı seviyelere odaklanıyorlar. Bir modelin sıfır atış veya çapraz görev yetenekleri iyi olsa bile, bu, o modelle donatılmış bir robotun güvenilir bir üretim aracı haline geldiği anlamına gelmez. Wang Xingxing, WRC'de Unitree'nin otomobil fabrikalarında ve kendi fabrikalarında robotlar kullandığını ve bazı basit montaj görevlerini tamamlayabildiklerini, ancak büyük ölçekli kullanımın henüz mümkün olmadığını belirtti. Bunun önemli bir nedeni, robotların verimliliğinin hala insanlardan daha düşük olması ve yeni görevlerle başa çıkmak için sık sık yeniden eğitilmeleri gerekmesidir.
Xinghaitu CEO'su Gao Jiyang, bu konu hakkında ilginç bir ikili değerlendirme sundu. Bu yılki WRC'de sunulan sektör yol haritasında Xinghaitu, teknoloji açısından 2027'yi açıkça "GPT anı" olarak işaretledi ve Ölçeklendirme Yasası'nın temel model yeteneklerini dönüm noktasını aşacak şekilde yönlendirmesinin ardından dikey uygulama senaryolarının hızlanmaya başlayacağına inanıyor; ancak gerçek "ticarileşme dönüm noktası"nın 2028'de, ardından 2029'da derin penetrasyonun ve 2030'da yaygın dağıtımın gerçekleşeceğini öngörüyor.
Ancak, somutlaştırılmış zekanın ChatGPT gibi tarihi bir anı tekrarlayıp tekrarlamayacağı tartışılırken, Gao Jiyang açıkça "böyle bir anın gerçekleşme olasılığının düşük olduğuna" inandığını belirtti. Bunun nedeni, somutlaştırılmış zekanın herkesin erişebileceği bir yazılım ürünü aracılığıyla anında yaygınlaşmayacak olması, daha ziyade B2B senaryolarında başlayıp, sektör sektör ve görev görev kendini kademeli olarak ortaya çıkaracak olmasıdır.
Teknolojik atılımlar ve anlık kamuoyu farkındalığının aynı anda gerçekleşmesi olası değildir. Bunun nedeni, GPT'nin patlayıcı büyümesinin herkesin bir cep telefonu veya bilgisayar kullanarak bunu doğrudan deneyimleyebilmesine bağlı olması, oysa somutlaştırılmış zekanın ilk uygulamalarının fabrikalar ve depolar gibi üretim ortamlarında olması ve bu nedenle genel halkın doğrudan algılamasının zor olmasıdır. Bu nedenle, endüstriyel dönüm noktaları yavaş yavaş, incelikli ve yaygın bir şekilde ortaya çıkacak ve insanlar aniden farkına vardıklarında her yerde mevcut hale gelecektir.
Bu iki ifade tamamen çelişkili değil. Gao Jiyang aslında model yeteneklerinin teknolojik dönüm noktası ile endüstriyel yayılımın sosyal dönüm noktası arasında bir ayrım yapıyor: ilki belirli bir yılda nispeten net bir şekilde ortaya çıkabilirken, ikincisi senaryo doğrulaması, büyük ölçekli üretim, maliyet düşürme ve iş modeli olgunlaşması gerektirerek kademeli olarak gerçek dünyaya yayılır.
Bu, robotlar ve büyük dil modelleri arasındaki en önemli farklardan biridir. ChatGPT Kasım 2022'de piyasaya sürüldükten sonra, model yeteneklerindeki değişiklikler neredeyse aynı gün dünya çapındaki kullanıcılara iletilebildi. Bir yazılım ürünü için, sunucu ve işlem gücü bunu kaldırabildiği sürece, yeni bir kullanıcı eklemenin maliyeti nispeten sınırlıdır. Kullanıcılar, bir web sayfasını açıp bir soru girerek model yeteneklerindeki sıçramayı anında algılayabilirler. Bu nedenle, ChatGPT'de teknolojik atılımlar, ürün lansmanları ve büyük ölçekli kullanıcı benimsemesi neredeyse aynı zaman dilimine sıkıştırıldı.
Robotlar ise fiziksel dünyaya gerçek bir beden aracılığıyla girmek zorundadır. Temel bir model yarın aniden önemli ölçüde daha güçlü genelleme yetenekleri kazansa bile, bu yeteneklerin yine de çipler, sensörler, eklemler, becerikli eller ve aktüatörler aracılığıyla gerçek hareketlere dönüştürülmesi gerekir; ayrıca doğruluk, kararlılık, güvenlik, kullanım ömrü, bakım ve maliyet gibi bir dizi mühendislik zorluğuyla da karşı karşıya kalınmalıdır.
Bu nedenle, somutlaştırılmış zekânın nihayetinde 30 Kasım 2022 gibi net bir tarihsel dönüm noktasını tekrarlaması zor olabilir. Daha ziyade, kademeli olarak ortaya çıkan bir dizi dönüm noktası olarak kendini gösterecektir. Belki de insanlar gelecekte "somutlaştırılmış zekânın ChatGPT anını" doğrulamak için geriye baksalar bile, herkesin üzerinde hemfikir olduğu tek bir nokta bulamayabilirler.
Bu içerik yalnızca bilgilendirme ve eğitim amaçlıdır ve BTCC ile ilgili yatırım tavsiyesi teşkil etmez. BTCC yukarıdaki içeriğin doğruluğunu, kesinliğini veya özgünlüğünü garanti etmek için elinden geleni yapmaktadır ancak bu konuda garanti veremez.