ユーシュー(テクノロジー系メディア企業)のトップは、事態に水を差しているのだろうか?身体化された知能の「ChatGPTの瞬間」はいつ訪れるのだろうか?

PanewslabPanewslab

近年の傾向として、身体性を備えた知能産業は、これまで遠い未来の話とされてきた「汎用ロボット」の実現時期を、将来の単一の技術サイクルに圧縮しつつある。

人型ロボットの人気が最高潮に達しているこの時期に、A株市場における「初の人型ロボット関連銘柄」のトップが、業界に冷水を浴びせたようだ。

8月20日、2026年世界ロボット会議において、ユニツリー・ロボティクスの創業者である王興興氏は、同社のIPO後初の公式スピーチで、チャットGPTのような身体化された知能の時代はまだ到来していないと認めた。それは早ければ2~3年後、遅ければ5~10年後になるだろうと述べた。

ここ2年間で、人型ロボットは最もホットなテクノロジー「ファッションアイテム」となった。これらの未来的なロボットは、主要なガラパーティーのステージ、ゲーム会社の展示会、さらにはショッピングモールや小売店の入り口など、様々な場所で見かけるようになった。軽やかに、時にはぎこちなく、踊ったり、歩いたり、手を振ったりしながら、観客と交流し、握手を交わし、研究所から急速に人々の目に触れるようになった。

しかし、賑やかなデモンストレーションの裏側では、これらのロボットの実際の能力は、人々が想像する「未来のロボット」とは明らかにかけ離れている。少なくとも一般的な期待では、ロボットは舞台でパフォーマンスをしたり、マーケティング目的で利用されるだけでなく、実際に工場や家庭に入り込み、物を運んだり、整理したり、工具を操作したり、家事や介護をしたりするべきである。人々の疑問は依然として具体的かつ直接的だ。ロボットはいつになったら本当に働けるようになるのだろうか?

大規模言語モデルの分野において、ChatGPTは非常に象徴的な答えを示した。言語モデル自体は初めてではないものの、多くの一般ユーザーがAIが一定の能力の閾値を超えたことを直感的に認識できるようになった最初の事例となった。身体化された知能の分野で同様の瞬間がいつ訪れるのかは、ロボット産業において最も差し迫った課題の一つになりつつある。

 

ロボットがあらゆる家庭に普及するための鍵は、その汎用性にある。

8月20日に開催された世界ロボット会議で、ユニツリー・ロボティクスの創業者である王興興氏は、業界で繰り返し議論されてきた、身体化された知能の最大のボトルネックとなる問題点を指摘した。

彼の見解では、十分なデータ収集とトレーニングが行われていれば、多くのロボットモデルは固定されたシナリオにおいてほぼ100%の成功率を達成できる。しかし、操作対象物が変化したり、環境がわずかに変化したりすると、成功率は大幅に低下する可能性がある。

これは、ロボットが私たちの生活や家庭に真に入り込む前に乗り越えなければならない最も重要なハードルでもある。

王興興氏はかなり具体的な基準を提示した。もしロボットが、全く見知らぬ家や環境に持ち込まれ、音声コマンドだけで作業の約80%を完了できるようになれば、身体化された知能は「ChatGPTの瞬間」を迎えたことになる、というのだ。時期については、最短で2~3年、最長で5~10年かかるだろうと彼は考えている。

王興興氏は特に、真の難しさはロボットに「大まかに何をすべきかを理解させる」ことではなく、最後の数センチメートル、あるいは数ミリメートルの精度にあると強調した。

例えば、ロボットに物体をつかむように指示した場合、モデルは動作全体を正しく計画し、ロボットアームは物体の近くまで移動したかもしれません。しかし、最終的な位置誤差、触覚フィードバック、または把持力が正しく修正されない場合、タスク全体が失敗する可能性があります。

この点においても、ロボットと大規模言語モデルは大きく異なっている。

言語モデルの入出力は常にデジタル空間で行われるのに対し、ロボットのあらゆる知覚と動作は現実の物理世界と相互作用しなければなりません。センサーにはノイズがあり、アクチュエーターには誤差があり、物体の位置、材質、重量は常に変化しています。これらの誤差はタスクの実行に伴って蓄積されます。したがって、身体化された知能においては、「基本的に何かができる」状態から「一貫して正しく実行できる」状態へと移行することは、最初にタスクを学習するよりも難しい場合があります。

王興興氏の前述の評価とほぼ同時に、ギャラクシー・ジェネラルの創業者兼CTOである王和氏も、より具体的な年を提示した。王和氏は、データの継続的な蓄積とさらなる技術的ブレークスルーにより、具現化された知能は2028年に「ChatGPTの瞬間」を迎えると予想されると述べた。彼はこのマイルストーンを、ロボットが特定のタスクに対する特別なトレーニングなしに、日常業務の約70%から80%を完了できるようになることと定義している。

両者の評価は実際には非常に近い。王興興はロボットが未知の環境に入った後のタスク完了率に注目し、王和は特別な訓練なしに基本モデルが直接汎化できる能力に注目している。しかし、両者とも未知のタスクに対する成功率が70%から80%程度を重要な基準点としている。

つまり、彼らが言う「ChatGPTの瞬間」とは、今日のヒューマノイドロボットが示すような機動性でもなければ、十分に訓練された固定デモで達成される99%の成功率でもない。真の変化は、ロボットが固定されたシーン、固定された物体、そして専門的な訓練への依存から脱却し始めた後に起こるはずだ。

 

ロボットが本当に「理解」できるようになるのはいつになるのだろうか? 一般的な見方では、2年から5年後とされている。

わずか1ヶ月前に開催された2026年世界人工知能会議(WAIC)において、身体化された知能の分野における6人の主要な起業家や研究者に対し、同じ質問が円卓会議で投げかけられた。

7月19日、Zhiyuan RoboticsとMifeng Technologyが主催した「インテリジェント・エンボディード・フォーラム」の最終ラウンドテーブルディスカッションで、主催者は6人の参加者に対し、非常に直接的な質問を投げかけた。「ロボットにとってのChatGPTのような瞬間は、あと何年で訪れるだろうか?」

結果は驚くほど一致していた。Zhiyuan Roboticsのパートナーであり、Mifeng Technologyの会長兼CEOであるYao Maoqing氏は2年と回答し、Sunday Roboticsの共同創業者兼CEOであるTony Zhao氏は3年以内だと考え、Tencentのチーフサイエンティストであり、Robotics X LabのディレクターであるZhang Zhengyou氏は3~5年と回答し、Dyna Roboticsの共同創業者兼チーフサイエンティストであるMa Yecheng氏は約4年かかると考え、Physical Intelligenceの研究科学者であるRen Zhiyi氏は4~5年かかると判断し、ジョージア工科大学の教授であるXu Danfei氏は5年と回答した。

この6人はそれぞれ全く異なる企業や研究機関に所属しており、技術的なアプローチも異なっていたが、最終的な回答はいずれも今後2年から5年に焦点を当てたものだった。

中でも、姚茂清氏は最も楽観的だ。彼の判断は主にデータ規模の拡大に基づいている。姚茂清氏の見解では、現在、物理AIのさらなる発展を阻害している主要因は、「データ、表現、クローズドループ」という3つの壁に集約される。インターネットの世界では安価に入手できる膨大な量のテキストや画像と比べると、現実世界のロボットとのインタラクションデータは高価であるだけでなく、ロボット自体、タスク、シナリオの違いによっても制約を受ける。

真に実用的なロボットは、自由形式の自然言語コマンドを理解し、一般的なタスクにおいて約70~80%の基本的な成功率を達成する必要がある。これを実現するには、身体化された知能には、現在のレベルをはるかに超える規模のデータが必要となる。彼はさらに、将来的には数億時間規模のデータが必要になる可能性さえ示唆した。

言い換えれば、姚茂青の判断枠組みでは、「ChatGPTの瞬間」は主にスケーリングの問題である。つまり、現実世界のデータ、シミュレーションデータ、インターネット動画、一人称視点データ、ロボット配備後にフィードバックされるデータなどが徐々に一定の規模に達すると、モデルの能力も臨界点を超える可能性がある。

一方、Sunday Roboticsの趙子豪氏は、3年以内という期限を設定している。趙氏は、ロボットのボディをますます複雑化させることよりも、ロボットの「頭脳」が真に成熟する時期をより重視している。Sunday Roboticsは長年、家庭用ロボットや基本モデルに注力してきた。彼らの考えは、十分に強力な基本ロボットモデルが複雑な環境やタスクを理解できれば、たとえロボットが比較的シンプルで低コストのグリッパーを使用しても、まず多くの実用的な問題を解決できる可能性があるというものだ。

張正友氏の姿勢ははるかに慎重だった。彼は3年から5年という回答を示したが、この期間は業界が単に大規模なモデルが突然出現するのを待つ必要があるという意味ではないと強調した。大規模言語モデルの急速な拡張の重要な前提条件は、Transformerが徐々に統一されたアーキテクチャになることである。しかし、ロボット知能はまだそのような明確な技術パラダイムを形成していない。

高度な認知、視覚認識、タスク計画から、リアルタイムの動作制御、身体フィードバック、安全対応に至るまで、ロボットはさまざまな時間スケールの問題を同時に処理する必要があります。そのため、真のブレークスルーを実現するには、大規模言語モデルのスケーリング法則を単に模倣するのではなく、データ収集、シミュレーション、実世界への展開、障害復旧、そしてハードウェアとモデルの同時開発における進歩が必要となるでしょう。こうした理由から、張正友氏は評価を行う際に、業界は依然として「勤勉かつ実践的に取り組む必要がある」と特に強調しました。

Dyna Roboticsの馬葉成氏は、その期間を約4年と見積もっている。彼の評価は主に商用展開に基づいている。ラボでのデモであれば、80%または90%の成功率で技術の有効性を証明できるかもしれないが、実際にロボットを購入する工場やサービス会社にとっては、そのような信頼性では到底十分とは言えないことが多い。したがって、具現化された知能の「ChatGPTモーメント」とは、ロボットがより多くのタスクを理解できるようになるだけでなく、実際の商用環境で許容できるレベルの信頼性までさらに向上させる必要があることを意味する。

フィジカル・インテリジェンス社のレン・ジイー氏は、4~5年という期間を提示した。同氏は、フィジカル・インテリジェンス社に入社する前は、このプロセスには10年かかるかもしれないと考えていたが、過去1年間で基本的なロボットモデルが開発されたことで、その予想は大幅に短縮されたと述べた。

Physical Intelligenceは、「ボット基盤モデル」アプローチにおけるリーディングカンパニーの一つであり、異なるオントロジーやタスクのデータを用いたトレーニングを通じて、同一モデルが徐々に幅広い運用能力を獲得していくことを目指しています。このアプローチの真に重要な点は、モデルとデータの規模が拡大するにつれてロボットの能力が継続的に出現し、最終的に大規模言語モデルにおけるゼロショット転移学習と同様の効果を生み出すことができるかどうかです。

ジョージア工科大学の徐丹飛教授は最も保守的な回答を示したが、それでもわずか5年だった。彼は特定のモデルアプローチに賭けるのではなく、より基本的な3つの指標に焦点を当てた。すなわち、モデルがデータから真に学習できるかどうか、学習した能力が新しい環境やタスクに一般化できるかどうか、そして推論速度が現実世界のロボットのリアルタイム運用要件を満たすことができるかどうかである。

王興興氏の「最短で2~3年」、王和氏の「2028年」、そしてWAICの6人のゲストの回答を総合すると、ますます明白な現象が浮かび上がってくる。それは、具現化された知能産業が、これまで遠い未来の出来事とされてきた「汎用ロボット」の実現時期を、未来の技術サイクルへと圧縮しているということだ。

 

それは明確な歴史的節目なのか、それとも漸進的なプロセスなのか?

しかし、これらの起業家や研究者は、その時期に関する予測において近づきつつあるものの、「ChatGPTの瞬間」について議論する際に、実際には同じ基準を用いているわけではない。

王和氏は、基本モデル自体の能力の飛躍的な向上に注目している。彼の定義によれば、具現化された知能は、ChatGPTと同様に、ロボットが新しいタスクごとに再学習する必要がなくなり、基本モデルのみを使用して日常業務の70~80%を完了できる臨界点を超える。この基準は主に、モデルが特定のタスク向けの「特化型知能」から、高い汎用性を備えた汎用知能へと移行できるかどうかを測定するものである。

王興興氏の基準は、現実世界におけるロボットの性能により近い。彼はタスク完了率約80%を重要な閾値と考えているが、特に、ロボットが未知の環境に入った際に、言語コマンドのみに頼ってほとんどのタスクを完了できるかどうかを重視している。彼の見解では、今日の多くのロボットは、十分に訓練された固定環境では高い成功率を達成できる。真の課題は、環境、物体、タスクの変化後もモデルが機能し続けることができるかどうかにある。

これら2つの定義は似ているように見えるが、実際には異なるレベルに焦点を当てている。たとえモデルが優れたゼロショット機能やクロスタスク機能を備えていたとしても、それを搭載したロボットが信頼できる生産ツールになったとは限らない。王興興氏はWRCで、Unitreeは実際に自動車工場や自社工場にロボットを導入しており、簡単な組み立て作業は完了できるものの、大規模な導入はまだ不可能だと述べた。その重要な理由の一つは、ロボットの効率が依然として人間よりも低く、新しい作業に対応するために再訓練が必要になることが多いからだ。

星海図のCEOである高継陽氏は、この問題について興味深い二重の評価を示した。今年のWRCで発表された業界ロードマップの中で、星海図は技術面で2027年を「GPTの瞬間」と明確に位置づけ、スケーリング法則によって基本モデルの機能が変曲点を超えた後、垂直応用シナリオが加速し始めると考えている。しかし、真の「商業化の変曲点」は2028年に位置づけられ、2029年に深く浸透し、2030年に広く展開されるとしている。

しかし、身体化された知能がChatGPTのような歴史的な瞬間を再現するかどうかについて議論する際、高継陽氏は「そのような瞬間は起こらない可能性が高い」と明言した。その理由は、身体化された知能は誰もが利用できるソフトウェア製品を通じて瞬時に普及するのではなく、B2Bのシナリオから始まり、業界ごと、タスクごとに徐々にその可能性が開かれていく可能性が高いからである。

技術的なブレークスルーと、一般の人々の即時的な認知が同時に起こる可能性は低い。なぜなら、GPTの爆発的な成長は、誰もが携帯電話やコンピューターを使って直接体験できることに依存しているのに対し、具現化された知能の初期応用は工場や倉庫などの生産現場で行われるため、一般の人々が直接認識することは難しいからである。したがって、業界の転換点は徐々に、そして巧妙かつ浸透的に現れ、人々が突然それに気づく頃には、すでに遍在するようになっているだろう。

この二つの主張は、完全に矛盾しているわけではない。高継陽氏は実際には、モデル能力の技術的転換点と産業普及の社会的転換点を区別している。前者は特定の年に比較的明確に現れる可能性がある一方、後者はシナリオ検証、大規模生産、コスト削減、ビジネスモデルの成熟を経て、徐々に現実世界に広まっていく必要がある。

これは、ロボットと大規模言語モデルの最も大きな違いの一つでもあります。2022年11月にChatGPTがリリースされて以来、モデル機能の変更は世界中のユーザーにほぼ同日に伝えられるようになりました。ソフトウェア製品の場合、サーバーと計算能力が許せば、新規ユーザーを追加するコストは比較的限定的です。ユーザーはウェブページを開いて質問を入力するだけで、モデル機能の飛躍的な向上をすぐに実感できます。そのため、ChatGPTでは、技術革新、製品リリース、そして大規模なユーザー導入がほぼ同時期に実現しました。

しかし、ロボットは実体を通して物理世界に入り込まなければなりません。たとえ基本モデルが明日、突然大幅に汎化能力を高めたとしても、その能力はチップ、センサー、関節、器用な手、アクチュエーターなどを介して実際の動きに変換される必要があり、同時に精度、安定性、安全性、寿命、メンテナンス、コストといった一連の工学的課題にも直面します。

したがって、身体化された知能は、2022年11月30日のような明確な歴史的節目を再現することは最終的に困難となるかもしれない。むしろ、徐々に現れる一連の転換点として現れる可能性が高い。おそらく、将来人々が振り返って「身体化された知能のChatGPTの瞬間」を確認しようとしても、誰もが同意する単一のポイントを見つけることはできないだろう。

この内容は情報提供および教育目的であり、BTCCに関連する投資助言ではありません。BTCCは信頼性・正確性・独自性に努めていますが、これらを完全に保証するものではありません。