유슈(기술 회사) 대표가 찬물을 끼얹고 있는 걸까요? 인공지능이 실체화되는 "ChatGPT의 순간"은 언제쯤 올까요?
Panewslab최근 들어 지능형 로봇 산업이 "범용 로봇"의 등장 시기를 과거 멀게만 보였던 것에서 벗어나 미래의 단일 기술 주기로 압축하는 추세가 뚜렷하게 나타나고 있습니다.
휴머노이드 로봇이 가장 큰 인기를 누리는 시기에, A주 시장에 상장된 "최초의 휴머노이드 로봇 관련 주식"의 대표가 해당 산업에 찬물을 끼얹은 듯한 발언을 했습니다.
8월 20일, 유니트리 로보틱스의 창립자 왕싱싱은 2026 세계 로봇 컨퍼런스에서 회사 IPO 이후 첫 공개 연설을 통해, 인공지능을 구현한 ChatGPT의 시대는 아직 오지 않았다고 인정했습니다. 그는 그 시기가 빠르면 2~3년, 늦으면 5년 또는 10년이 될 것이라고 예측했습니다.
지난 2년 동안 휴머노이드 로봇은 가장 인기 있는 기술 '패션 아이템'으로 떠올랐습니다. 이 미래형 로봇들은 주요 갈라 행사 무대, 게임 회사 전시회는 물론 쇼핑몰과 소매점 입구에서도 점점 더 자주 볼 수 있게 되었습니다. 때로는 민첩하게, 때로는 어설프게 춤을 추고, 걷고, 손을 흔들며 관객과 소통하고 악수를 나누는 등, 연구실에서 벗어나 빠르게 대중의 시선 속으로 진입하고 있습니다.
하지만 화려한 시연 이면에는, 이 로봇들의 실제 능력은 사람들이 상상하는 "미래의 로봇"과는 거리가 멀어 보입니다. 적어도 일반적인 기대에서는 로봇이 단순히 무대 공연이나 마케팅 목적으로만 존재하는 것이 아니라, 공장과 가정에 들어가 물건을 옮기고, 정리하고, 도구를 조작하고, 가사 노동이나 돌봄 등의 일을 해야 합니다. 대중의 질문은 여전히 구체적이고 직접적입니다. 로봇이 진정으로 일할 수 있는 시대는 언제일까요?
대규모 언어 모델 분야에서 ChatGPT는 매우 상징적인 해답을 제시했습니다. 최초의 언어 모델은 아니었지만, 일반 사용자들이 인공지능이 특정 능력의 임계점을 넘어섰다는 것을 직관적으로 깨닫게 해준 최초의 모델이었습니다. 이와 유사한 순간이 인공지능 분야에서 언제쯤 올 것인가는 로봇 산업에서 가장 시급한 질문 중 하나로 점차 대두되고 있습니다.
로봇이 모든 가정에 보급될 수 있는 핵심은 바로 로봇의 일반화 능력에 있다.
8월 20일에 열린 세계 로봇 컨퍼런스에서 유니트리 로보틱스의 창립자 왕싱싱은 업계에서 반복적으로 논의되어 온 문제, 즉 인공지능 구현의 가장 큰 병목 현상을 지적했습니다.
그의 견해에 따르면, 많은 로봇 모델은 충분한 데이터 수집과 훈련이 이루어진다면 고정된 시나리오에서 거의 100%에 가까운 성공률을 달성할 수 있습니다. 그러나 조작 대상 물체가 바뀌거나 환경이 조금이라도 변하면 성공률은 크게 떨어질 수 있습니다.
이는 로봇이 진정으로 우리의 삶과 가정에 들어오기 전에 넘어야 할 가장 중요한 장애물이기도 합니다.
왕싱싱은 상당히 구체적인 기준을 제시했습니다. 언젠가 로봇이 완전히 낯선 집이나 환경에 들어가 음성 명령만으로 작업의 약 80%를 완료할 수 있다면, 그때가 바로 '챗GPT의 순간'이라고 할 수 있다는 것입니다. 그는 이러한 시대가 가장 빠르면 2~3년, 가장 느리게는 5~10년 안에 도래할 것으로 예상했습니다.
왕싱싱은 특히 로봇이 "일반적으로 무엇을 해야 할지 알게 하는 것"이 아니라 마지막 몇 센티미터, 심지어 몇 밀리미터의 미세한 차이에서 진정한 어려움이 발생한다고 강조했습니다.
예를 들어, 로봇에게 물체를 집으라고 요청했을 때, 모델이 전체 동작을 정확하게 계획하고 로봇 팔이 물체 근처로 이동했을 수 있습니다. 그러나 최종 위치 오차, 촉각 피드백 또는 파지력이 제대로 수정되지 않으면 전체 작업이 실패할 수 있습니다.
로봇과 대규모 언어 모델이 매우 다른 점도 바로 이 부분입니다.
언어 모델의 입력과 출력은 항상 디지털 공간에서 이루어지지만, 로봇의 모든 인지와 행동은 실제 물리적 세계와 상호작용해야 합니다. 센서에는 노이즈가 있고, 액추에이터에는 오류가 있으며, 물체의 위치, 재질, 무게는 끊임없이 변합니다. 이러한 오류는 작업을 수행하면서 누적됩니다. 따라서 체화된 지능의 경우, "기본적으로 무언가를 할 수 있는 것"에서 "일관되게 정확하게 수행하는 것"으로 나아가는 것은 처음 작업을 학습하는 것보다 더 어려울 수 있습니다.
왕싱싱의 앞서 언급한 평가와 거의 동시에 갤럭시 제너럴의 창립자 겸 CTO인 왕허는 보다 구체적인 연도를 제시했습니다. 왕허는 지속적인 데이터 축적과 기술 혁신을 통해 인공지능이 2028년에 "챗GPT의 순간"에 도달할 것으로 예상한다고 밝혔습니다. 그는 이 시점을 로봇이 특정 작업에 대한 별도의 훈련 없이 일상 업무의 약 70~80%를 수행할 수 있는 시점으로 정의했습니다.
실제로 두 사람의 판단은 매우 유사합니다. 왕싱싱은 낯선 환경에 진입한 후 로봇의 작업 완료율에 초점을 맞추는 반면, 왕허는 특별한 훈련 없이 기본 모델의 직접적인 일반화 능력에 초점을 맞춥니다. 그러나 두 사람 모두 미지의 작업에 대한 성공률을 약 70~80%로 임계점으로 설정했습니다.
이는 그들이 말하는 "ChatGPT의 순간"이 오늘날 휴머노이드 로봇이 보여주는 이동성이나, 잘 훈련된 고정된 데모에서 달성한 99%의 성공률을 의미하는 것이 아님을 뜻합니다. 진정한 변화는 로봇이 고정된 장면, 고정된 물체, 그리고 특수 훈련에 대한 의존에서 벗어나기 시작할 때 일어날 것입니다.
로봇이 진정으로 '이해하는' 시기는 언제일까요? 전문가들은 2년에서 5년 정도 걸릴 것으로 예상합니다.
불과 한 달 전, 2026 세계 인공지능 컨퍼런스(WAIC)에서 열린 원탁 토론에서 체화된 지능 분야의 선도적인 기업가와 연구자 6명에게 동일한 질문이 던져졌습니다.
7월 19일, 지위안 로보틱스와 미펑 테크놀로지가 공동 주최한 "지능형 로봇 포럼"의 마지막 원탁 토론에서 사회자는 여섯 명의 참석자에게 매우 직설적인 질문을 던졌습니다. "로봇에게 ChatGPT와 같은 기술이 등장하기까지 몇 년이 걸릴까요?"
결과는 놀랍도록 의견이 집중되었습니다. 지위안 로보틱스의 파트너이자 미펑 테크놀로지의 회장 겸 CEO인 야오 마오칭은 2년을, 선데이 로보틱스의 공동 창업자 겸 CEO인 토니 자오는 3년을, 텐센트의 수석 과학자이자 로보틱스 X 랩 소장인 장정유는 3~5년을, 다이나 로보틱스의 공동 창업자 겸 수석 과학자인 마 예청은 약 4년을, 피지컬 인텔리전스의 연구원인 런즈이는 4~5년을, 그리고 조지아 공과대학교의 쉬 단페이 교수는 5년을 예상했습니다.
이 여섯 명은 완전히 다른 회사와 연구 기관 출신이었고, 기술적 접근 방식도 제각각이었지만, 최종 답변은 모두 향후 2년에서 5년 사이의 미래에 초점을 맞추었습니다.
그중에서도 야오 마오칭은 가장 낙관적입니다. 그의 판단은 주로 데이터 규모의 증가에 기반합니다. 야오 마오칭의 관점에서 물리적 AI의 발전을 저해하는 핵심 요소는 "데이터, 표현, 폐쇄 루프"라는 세 가지 장벽으로 요약할 수 있습니다. 인터넷 세상에서 저렴하게 얻을 수 있는 방대한 양의 텍스트와 이미지와 달리, 실제 로봇 상호작용 데이터는 비용이 많이 들 뿐만 아니라 로봇 자체, 작업, 시나리오의 차이로 인해 제약이 많습니다.
진정으로 활용 가능한 로봇은 개방형 자연어 명령을 이해하고 일반적인 작업에서 약 70~80%의 기본 성공률을 달성해야 합니다. 이를 위해서는 현재 수준을 훨씬 뛰어넘는 규모의 데이터가 필요합니다. 그는 심지어 미래에는 수억 시간 규모의 데이터가 필요할 수도 있다고 제안했습니다.
다시 말해, 야오마오칭의 판단 기준에서 "ChatGPT의 한계점"은 주로 규모 확장의 문제입니다. 실제 데이터, 시뮬레이션 데이터, 인터넷 영상, 1인칭 시점 데이터, 로봇 배치 후 되돌아오는 데이터 등이 점차 일정 규모에 도달함에 따라 모델의 능력 또한 임계점을 넘어설 수 있다는 것입니다.
반면, 선데이 로보틱스의 자오쯔하오는 3년 이내의 시간표를 제시했습니다. 단순히 로봇 본체를 더욱 복잡하게 만드는 것보다 로봇의 "두뇌"가 진정으로 성숙하는 시점에 더 관심을 두고 있습니다. 선데이 로보틱스는 오랫동안 가정용 로봇과 기본 모델 개발에 집중해 왔습니다. 그들의 생각은, 충분히 강력한 기본 로봇 모델이 복잡한 환경과 작업을 이해할 수 있다면, 로봇이 비교적 단순하고 저렴한 그리퍼를 사용하더라도 많은 실용적인 문제를 먼저 해결할 수 있을 것이라는 것입니다.
장정유는 훨씬 더 신중한 태도를 보였다. 그는 3년에서 5년 정도 걸릴 것이라고 답했지만, 이 기간이 업계가 더 큰 모델이 갑자기 등장하기를 기다려야 한다는 의미는 아니라고 강조했다. 대규모 언어 모델의 빠른 확장을 위한 핵심 전제 조건은 트랜스포머 아키텍처가 점차 통합되는 것이다. 그러나 로봇 지능 분야에서는 아직 그러한 명확한 기술적 패러다임이 형성되지 않았다.
고차원적 인지, 시각적 인식, 작업 계획부터 실시간 동작 제어, 신체 피드백, 안전 대응에 이르기까지 로봇은 다양한 시간 규모에서 동시에 문제를 처리해야 합니다. 따라서 진정한 혁신은 대규모 언어 모델의 확장 법칙을 단순히 모방하는 것이 아니라 데이터 수집, 시뮬레이션, 실제 배포, 오류 복구, 하드웨어와 모델의 동시 개발 분야에서 발전을 이루어야 할 것입니다. 이러한 이유로 장정유는 업계가 여전히 "성실하고 실질적으로 노력해야 한다"고 강조했습니다.
다이나 로보틱스의 마 예청은 상용화까지 약 4년 정도 걸릴 것으로 예상합니다. 그의 평가는 주로 상용 배포를 기반으로 합니다. 실험실 데모에서는 80% 또는 90%의 성공률만으로도 기술의 효과를 입증하기에 충분할 수 있지만, 실제로 로봇을 구매하는 공장이나 서비스 회사에서는 그러한 신뢰도로는 턱없이 부족한 경우가 많습니다. 따라서 '챗GPT의 순간'은 로봇이 더 많은 작업을 이해할 수 있게 되는 것뿐만 아니라, 실제 상업 환경에서 허용 가능한 수준의 신뢰도를 확보할 수 있도록 지속적으로 개선되어야 함을 의미합니다.
피지컬 인텔리전스의 런즈이는 개발 기간을 4~5년으로 예상했다. 그는 피지컬 인텔리전스에 합류하기 전에는 이 과정이 10년은 걸릴 것이라고 생각했지만, 지난 1년간 기본 로봇 모델 개발이 진행되면서 예상 기간이 크게 단축되었다고 밝혔다.
Physical Intelligence는 "봇 기반 모델" 접근 방식 분야의 선두 기업 중 하나로, 다양한 온톨로지와 작업 데이터 학습을 통해 동일한 모델이 점진적으로 더 광범위한 운영 기능을 습득할 수 있도록 하는 것을 목표로 합니다. 이 접근 방식의 핵심은 모델과 데이터 규모가 확장됨에 따라 로봇 기능이 지속적으로 발전할 수 있는지 여부이며, 궁극적으로 대규모 언어 모델에서 제로샷 전이 학습과 유사한 효과를 낼 수 있는지 여부입니다.
조지아 공과대학의 쉬 단페이 교수는 가장 보수적인 답변을 내놓았지만, 그마저도 5년이라는 짧은 기간만을 예상했습니다. 그는 특정 모델 접근 방식에 투자하기보다는 세 가지 근본적인 지표에 더 집중했습니다. 즉, 모델이 데이터를 통해 진정으로 학습할 수 있는지, 학습된 능력이 새로운 환경과 작업에 일반화될 수 있는지, 그리고 추론 속도가 실제 세계에서 로봇의 실시간 작동 요구 사항을 충족할 수 있는지 여부입니다.
왕싱싱의 "가장 빠른 2~3년", 왕허의 "2028년", 그리고 WAIC에 참석한 여섯 명의 게스트들의 답변을 종합해 보면, 점점 더 분명해지는 현상이 드러납니다. 바로, 인공지능 기반 로봇 산업이 이전에는 먼 미래의 일로 여겨졌던 "범용 로봇"의 시대적 시점을 미래의 기술 발전 주기 안으로 압축하고 있다는 것입니다.
이는 명확한 역사적 이정표인가, 아니면 점진적인 과정인가?
하지만 이러한 기업가와 연구자들이 시기에 대한 예측에 점점 더 가까워지고 있음에도 불구하고, "ChatGPT의 등장"을 논의하는 데 있어 실제로 동일한 기준을 사용하고 있는 것은 아닙니다.
왕허는 기본 모델 자체의 능력 향상에 초점을 맞춥니다. 그의 정의에 따르면, 로봇이 새로운 작업을 수행할 때마다 재학습이 필요하지 않고 기본 모델만으로 일상 작업의 70~80%를 완료할 수 있을 때, 체화된 지능은 ChatGPT와 유사한 임계점을 넘어섭니다. 이 기준은 주로 모델이 특정 작업에 특화된 지능에서 강력한 전이성을 가진 일반 지능으로 발전할 수 있는지 여부를 측정합니다.
왕싱싱의 기준은 실제 환경에서의 로봇 성능에 더 가깝습니다. 그는 작업 완료율 80% 정도를 중요한 임계값으로 여기지만, 낯선 환경에 진입했을 때 언어 명령에만 의존하여 대부분의 작업을 완료할 수 있는지 여부를 더 중요하게 생각합니다. 그의 견해로는 오늘날 많은 로봇들이 잘 훈련된 고정된 환경에서는 높은 성공률을 달성할 수 있습니다. 진정한 과제는 환경, 사물 또는 작업이 변경된 후에도 모델이 계속해서 기능할 수 있는지 여부에 있습니다.
이 두 가지 정의는 비슷해 보이지만 실제로는 다른 수준에 초점을 맞추고 있습니다. 아무리 뛰어난 제로샷 또는 크로스태스크 능력을 갖춘 모델이라 하더라도, 그러한 능력을 갖춘 로봇이 신뢰할 수 있는 생산 도구가 되었다는 의미는 아닙니다. 왕싱싱 대표는 WRC에서 유니트리가 실제로 자동차 공장과 자사 공장에 로봇을 배치하여 간단한 조립 작업을 수행하고 있지만, 대규모 배치는 아직 어렵다고 언급했습니다. 중요한 이유 중 하나는 로봇의 효율성이 여전히 인간보다 낮고, 새로운 작업을 수행하기 위해 재교육이 필요한 경우가 많기 때문입니다.
싱하이투(Xinghaitu) CEO 가오 지양(Gao Jiyang)은 이 문제에 대해 흥미로운 이중적 평가를 내렸습니다. 올해 WRC에서 발표한 산업 로드맵에서 싱하이투는 기술적인 측면에서 2027년을 "GPT의 전환점"으로 명시하며, 스케일링 법칙(Scaling Law)에 따라 기본 모델의 역량이 변곡점을 넘어서면 수직적 응용 시나리오가 가속화될 것이라고 예측했습니다. 그러나 실제 "상용화 변곡점"은 2028년, 심층 시장 침투는 2029년, 광범위한 배포는 2030년에 이를 것으로 전망했습니다.
그러나 가오 지양은 체화된 지능이 ChatGPT와 같은 역사적 순간을 재현할 수 있을지에 대한 논의에서 "그러한 순간이 다시 일어날 가능성은 매우 낮다"고 명확히 밝혔습니다. 그 이유는 체화된 지능이 누구나 접근할 수 있는 소프트웨어 제품을 통해 즉시 대중화되기보다는 B2B 시나리오에서 시작하여 산업별, 작업별로 점진적으로 확산될 가능성이 더 높기 때문입니다.
기술적 혁신과 대중의 즉각적인 인식은 동시에 발생할 가능성이 낮습니다. GPT의 폭발적인 성장은 모든 사람이 휴대폰이나 컴퓨터를 통해 직접 경험할 수 있어야 가능하지만, 실물 지능의 초기 적용 분야는 공장이나 창고와 같은 생산 현장이기 때문에 일반 대중이 직접적으로 인지하기 어렵기 때문입니다. 따라서 산업의 전환점은 미묘하고 광범위하게 서서히 나타나다가 사람들이 갑자기 인식하게 될 때쯤에는 이미 보편화되어 있을 것입니다.
이 두 가지 주장은 완전히 모순되는 것은 아닙니다. 가오 지양은 실제로 모델 역량의 기술적 변곡점과 산업 확산의 사회적 변곡점을 구분합니다. 전자는 특정 연도에 비교적 명확하게 나타날 수 있는 반면, 후자는 시나리오 검증, 대규모 생산, 비용 절감 및 비즈니스 모델의 성숙도를 거쳐 점진적으로 현실 세계에 확산되어야 합니다.
이는 로봇과 대규모 언어 모델 간의 가장 중요한 차이점 중 하나이기도 합니다. 2022년 11월 ChatGPT가 출시된 후, 모델 기능의 변화는 전 세계 사용자에게 거의 동시에 전달될 수 있었습니다. 소프트웨어 제품의 경우, 서버와 컴퓨팅 성능만 허용된다면 새로운 사용자를 추가하는 데 드는 비용은 상대적으로 적습니다. 사용자는 웹페이지를 열고 질문을 입력하는 것만으로 모델 기능의 비약적인 발전을 즉시 체감할 수 있습니다. 따라서 ChatGPT에서는 기술적 혁신, 제품 출시, 그리고 대규모 사용자 확보가 거의 동시에 이루어졌습니다.
하지만 로봇은 실제 몸체를 통해 물리적인 세계에 진입해야 합니다. 설령 기본적인 모델이 내일 갑자기 훨씬 강력한 일반화 능력을 갖추게 된다 하더라도, 이러한 능력은 칩, 센서, 관절, 정교한 손, 액추에이터를 통해 실제 움직임으로 구현되어야 하며, 정확성, 안정성, 안전성, 수명, 유지보수, 비용 등 여러 가지 공학적 과제에도 직면해야 합니다.
따라서, 구체화된 지능은 궁극적으로 2022년 11월 30일과 같은 명확한 역사적 이정표를 재현하기 어려울 수 있습니다. 오히려 점진적으로 나타나는 일련의 전환점으로 나타날 가능성이 더 큽니다. 어쩌면 미래에 사람들이 "구체화된 지능의 ChatGPT 순간"을 확인하기 위해 되돌아본다 하더라도, 모두가 동의하는 단일 지점을 찾지 못할 수도 있습니다.
이 콘텐츠는 정보 및 교육 목적으로만 제공되며 BTCC와 관련된 투자 자문을 하지 않습니다. BTCC는 위 내용의 진실성, 정확성 및 독창성을 보장하기 위해 최선을 다하지만, 보장할 수는 없습니다.