Liệu người đứng đầu Yushu (một công ty truyền thông công nghệ) đang dội gáo nước lạnh vào mọi thứ? Bao lâu nữa thì sẽ xảy ra "khoảnh khắc ChatGPT" của trí tuệ thể hiện?
PanewslabMột xu hướng ngày càng phát triển là ngành công nghiệp trí tuệ nhân tạo đang rút ngắn khung thời gian vốn xa vời trước đây của "robot đa năng" thành một chu kỳ công nghệ duy nhất trong tương lai.
Vào thời điểm robot hình người đang được ưa chuộng nhất, người đứng đầu "cổ phiếu robot hình người đầu tiên" trên thị trường chứng khoán A-share dường như đã dội gáo nước lạnh vào ngành công nghiệp này.
Vào ngày 20 tháng 8, tại Hội nghị Robot Thế giới 2026, Wang Xingxing, người sáng lập Unitree Robotics, đã thừa nhận trong bài phát biểu công khai đầu tiên sau khi công ty IPO rằng thời điểm của ChatGPT, trí tuệ thể hiện qua hình thể, vẫn chưa đến. Nó có thể đến sớm nhất là hai đến ba năm, hoặc muộn nhất là năm hoặc mười năm.
Trong hai năm qua, robot hình người đã trở thành "món đồ thời trang" công nghệ hot nhất. Những robot tương lai này ngày càng xuất hiện nhiều hơn trên sân khấu của các buổi gala lớn, tại các triển lãm của các công ty game, và thậm chí cả ở lối vào các trung tâm thương mại và cửa hàng bán lẻ. Chúng nhảy múa, đi bộ và vẫy tay, lúc thì nhanh nhẹn, lúc thì vụng về, tương tác với khán giả và bắt tay, nhanh chóng chuyển từ phòng thí nghiệm ra trước công chúng.
Nhưng đằng sau những màn trình diễn náo nhiệt, khả năng thực tế của những robot này rõ ràng còn xa so với trí tưởng tượng của mọi người về "robot tương lai". Ít nhất trong kỳ vọng phổ biến hơn, robot không chỉ nên biểu diễn trên sân khấu hoặc phục vụ mục đích tiếp thị, mà còn nên thực sự được vào nhà máy và nhà cửa, di chuyển, sắp xếp, vận hành công cụ, hoặc đảm nhận một số công việc nhà và nhiệm vụ chăm sóc. Câu hỏi của công chúng vẫn cụ thể và trực tiếp: Khi nào robot mới thực sự có thể làm việc?
Trong lĩnh vực mô hình ngôn ngữ quy mô lớn, ChatGPT đã đưa ra một câu trả lời mang tính biểu tượng cao. Mặc dù không phải là mô hình ngôn ngữ đầu tiên, nhưng nó là mô hình đầu tiên giúp một lượng lớn người dùng thông thường nhận ra một cách trực quan rằng trí tuệ nhân tạo đã vượt qua một ngưỡng năng lực nhất định. Việc khi nào một khoảnh khắc tương tự sẽ xảy ra trong lĩnh vực trí tuệ thể hiện đang dần trở thành một trong những câu hỏi cấp bách nhất trong ngành công nghiệp robot.
Chìa khóa để robot có thể thâm nhập vào mọi hộ gia đình nằm ở khả năng khái quát hóa của chúng.
Tại Hội nghị Robot Thế giới được tổ chức vào ngày 20 tháng 8, Wang Xingxing, người sáng lập Unitree Robotics, đã chỉ ra một vấn đề đã được thảo luận nhiều lần trong ngành công nghiệp này như là nút thắt cổ chai lớn nhất của trí tuệ thể hiện qua hình thể.
Theo ông, nhiều mô hình robot có thể đạt tỷ lệ thành công gần 100% trong các kịch bản cố định, miễn là chúng có đủ dữ liệu thu thập và huấn luyện. Tuy nhiên, tỷ lệ thành công có thể giảm đáng kể nếu vật thể được thao tác thay đổi hoặc môi trường bị biến đổi dù chỉ một chút.
Đây cũng là rào cản quan trọng nhất trước khi robot có thể thực sự bước vào cuộc sống và nhà cửa của chúng ta.
Wang Xingxing đưa ra một tiêu chí khá cụ thể: nếu một ngày nào đó, một robot có thể được đưa vào một ngôi nhà hoặc môi trường hoàn toàn xa lạ và hoàn thành khoảng 80% nhiệm vụ chỉ bằng giọng nói hoặc mệnh lệnh bằng lời nói, thì trí tuệ thể hiện sẽ đạt đến "khoảnh khắc ChatGPT" của nó. Về thời gian, ông tin rằng có thể mất từ 2 đến 3 năm trong trường hợp nhanh nhất và từ 5 đến 10 năm trong trường hợp chậm nhất.
Wang Xingxing đặc biệt nhấn mạnh rằng khó khăn thực sự không nằm ở việc làm cho robot "biết phải làm gì nói chung", mà nằm ở vài centimet hoặc thậm chí vài milimet cuối cùng.
Ví dụ, nếu bạn yêu cầu robot nhặt một vật thể, mô hình có thể đã lập kế hoạch chính xác toàn bộ hành động và cánh tay robot có thể đã di chuyển đến gần vật thể. Tuy nhiên, nếu sai số vị trí cuối cùng, phản hồi xúc giác hoặc lực nắm không được điều chỉnh chính xác, toàn bộ nhiệm vụ có thể thất bại.
Đây cũng là điểm khác biệt lớn giữa robot và các mô hình ngôn ngữ quy mô lớn.
Quá trình nhập và xuất của mô hình ngôn ngữ luôn diễn ra trong không gian kỹ thuật số, trong khi mọi nhận thức và hành động của robot đều phải tương tác với thế giới vật lý thực. Cảm biến có nhiễu, bộ truyền động có sai số, và vị trí, vật liệu và trọng lượng của các vật thể liên tục thay đổi; những sai số này tích lũy khi thực hiện nhiệm vụ. Do đó, đối với trí tuệ thể hiện, việc chuyển từ "có thể làm một việc gì đó về cơ bản" sang "làm việc đó một cách nhất quán và chính xác" có thể khó khăn hơn so với việc học một nhiệm vụ ban đầu.
Gần như đồng thời với đánh giá của Wang Xingxing đã đề cập ở trên, Wang He, người sáng lập kiêm CTO của Galaxy General, cũng đưa ra một mốc thời gian cụ thể hơn. Wang He cho rằng với sự tích lũy dữ liệu liên tục và những đột phá công nghệ hơn nữa, trí tuệ thể hiện dự kiến sẽ đạt đến "thời điểm ChatGPT" vào năm 2028. Ông định nghĩa cột mốc này là: robot có thể hoàn thành khoảng 70% đến 80% các nhiệm vụ hàng ngày mà không cần đào tạo cụ thể cho bất kỳ nhiệm vụ nào.
Thực tế, đánh giá của họ rất sát nhau. Wang Xingxing tập trung vào tỷ lệ hoàn thành nhiệm vụ của robot sau khi進入 môi trường không quen thuộc, trong khi Wang He tập trung vào khả năng khái quát hóa trực tiếp của mô hình cơ bản mà không cần huấn luyện cụ thể. Tuy nhiên, cả hai đều đặt điểm mấu chốt ở tỷ lệ thành công khoảng 70% đến 80% đối với các nhiệm vụ chưa biết.
Điều này cũng có nghĩa là "khoảnh khắc ChatGPT" mà họ đang nói đến không phải là khả năng di chuyển mà các robot hình người thể hiện ngày nay, cũng không phải là tỷ lệ thành công 99% đạt được bởi một bản demo cố định, được huấn luyện bài bản. Sự thay đổi thực sự sẽ xảy ra sau khi robot bắt đầu thoát khỏi sự phụ thuộc vào các cảnh cố định, các vật thể cố định và quá trình huấn luyện chuyên biệt.
Khi nào robot mới thực sự "hiểu được"? Theo đa số ý kiến thì khoảng 2 đến 5 năm nữa.
Chỉ một tháng trước tại Hội nghị Trí tuệ Nhân tạo Thế giới 2026 (WAIC), một cuộc thảo luận bàn tròn đã đặt ra câu hỏi tương tự cho sáu doanh nhân và nhà nghiên cứu hàng đầu trong lĩnh vực trí tuệ thể hiện.
Vào ngày 19 tháng 7, trong khuôn khổ "Diễn đàn Trí tuệ Nhân tạo" do Zhiyuan Robotics và Mifeng Technology tổ chức, người dẫn chương trình đã đặt một câu hỏi rất trực tiếp cho sáu vị khách mời trong buổi thảo luận bàn tròn cuối cùng: Còn bao nhiêu năm nữa thì robot sẽ đạt được cột mốc ChatGPT?
Kết quả khá tập trung. Yao Maoqing, đối tác của Zhiyuan Robotics và chủ tịch kiêm CEO của Mifeng Technology, đưa ra câu trả lời là 2 năm; Tony Zhao, đồng sáng lập kiêm CEO của Sunday Robotics, tin rằng sẽ trong vòng 3 năm; Zhang Zhengyou, nhà khoa học trưởng của Tencent và giám đốc của Robotics X Lab, đưa ra con số từ 3 đến 5 năm; Ma Yecheng, đồng sáng lập kiêm nhà khoa học trưởng của Dyna Robotics, tin rằng sẽ mất khoảng 4 năm; Ren Zhiyi, nhà nghiên cứu khoa học của Physical Intelligence, đánh giá sẽ mất từ 4 đến 5 năm; và Xu Danfei, giáo sư tại Viện Công nghệ Georgia, đưa ra câu trả lời là 5 năm.
Sáu cá nhân này đến từ các công ty và viện nghiên cứu hoàn toàn khác nhau, và phương pháp kỹ thuật của họ cũng khác nhau, nhưng câu trả lời cuối cùng của họ đều tập trung vào hai đến năm năm tới.
Trong số đó, Yao Maoqing là người lạc quan nhất. Nhận định của ông chủ yếu dựa trên sự tăng trưởng về quy mô dữ liệu. Theo quan điểm của Yao Maoqing, các yếu tố chính hiện đang hạn chế sự phát triển hơn nữa của trí tuệ nhân tạo vật lý có thể được tóm gọn thành ba bức tường: "dữ liệu, biểu diễn và vòng lặp kín". So với lượng lớn văn bản và hình ảnh có thể thu được với chi phí thấp trên Internet, dữ liệu tương tác robot trong thế giới thực không chỉ đắt đỏ mà còn bị hạn chế bởi sự khác biệt giữa chính robot, nhiệm vụ và kịch bản.
Một robot thực sự sẵn sàng sử dụng cần phải hiểu được các mệnh lệnh ngôn ngữ tự nhiên không giới hạn và đạt được tỷ lệ thành công cơ bản khoảng 70% đến 80% đối với các nhiệm vụ thông thường. Để đạt được điều này, trí tuệ thể hiện cần dữ liệu ở quy mô vượt xa mức hiện tại. Ông thậm chí còn gợi ý rằng trong tương lai, nó có thể cần dữ liệu ở quy mô hàng trăm triệu giờ.
Nói cách khác, trong khuôn khổ đánh giá của Yao Maoqing, "khoảnh khắc ChatGPT" chủ yếu là một vấn đề về quy mô: khi dữ liệu thực tế, dữ liệu mô phỏng, video trên internet, dữ liệu góc nhìn người thứ nhất và dữ liệu phản hồi sau khi triển khai robot dần đạt đến một quy mô nhất định, khả năng của mô hình cũng có thể vượt qua điểm tới hạn.
Ngược lại, Zhao Zihao của Sunday Robotics lại đặt ra mục tiêu dưới ba năm. Thay vì chỉ theo đuổi việc chế tạo những thân robot ngày càng phức tạp, Zhao quan tâm hơn đến thời điểm "não bộ" của robot thực sự trưởng thành. Sunday Robotics từ lâu đã tập trung vào robot gia đình và các mô hình cơ bản. Quan điểm của họ là nếu một mô hình robot cơ bản đủ mạnh có thể hiểu được môi trường và nhiệm vụ phức tạp, ngay cả khi robot sử dụng các bộ phận kẹp tương đối đơn giản và chi phí thấp hơn, nó vẫn có thể giải quyết được một số lượng lớn các vấn đề thực tiễn.
Thái độ của Zhang Zhengyou thận trọng hơn nhiều. Ông đưa ra câu trả lời là từ 3 đến 5 năm, nhưng nhấn mạnh rằng khung thời gian này không có nghĩa là ngành công nghiệp chỉ cần chờ đợi một mô hình lớn hơn đột nhiên xuất hiện. Điều kiện tiên quyết quan trọng cho việc mở rộng nhanh chóng các mô hình ngôn ngữ lớn là Transformer phải dần trở thành một kiến trúc thống nhất hơn. Tuy nhiên, trí tuệ robot vẫn chưa hình thành một mô hình công nghệ rõ ràng như vậy.
Từ nhận thức cấp cao, tri giác thị giác và lập kế hoạch nhiệm vụ đến điều khiển chuyển động thời gian thực, phản hồi cơ thể và phản ứng an toàn, robot cần xử lý các vấn đề ở các thang thời gian khác nhau cùng một lúc. Do đó, những đột phá thực sự có thể đòi hỏi những tiến bộ trong thu thập dữ liệu, mô phỏng, triển khai thực tế, phục hồi lỗi và phát triển đồng thời phần cứng và mô hình, chứ không chỉ đơn giản là sao chép quy luật tỷ lệ của các mô hình ngôn ngữ lớn. Vì lý do này, khi đưa ra đánh giá của mình, Zhang Zhengyou đã đặc biệt nhấn mạnh rằng ngành công nghiệp vẫn cần phải "làm việc siêng năng và thực tế".
Ông Ma Yecheng của Dyna Robotics ước tính khung thời gian khoảng bốn năm. Đánh giá của ông chủ yếu dựa trên việc triển khai thương mại. Đối với một bản demo trong phòng thí nghiệm, tỷ lệ thành công 80% hoặc 90% có thể đủ để chứng minh hiệu quả của công nghệ; tuy nhiên, đối với một nhà máy hoặc công ty dịch vụ thực sự mua robot, độ tin cậy như vậy thường không đủ. Do đó, "khoảnh khắc ChatGPT" của trí tuệ thể hiện không chỉ có nghĩa là robot có thể hiểu được nhiều nhiệm vụ hơn, mà còn có nghĩa là nó phải được cải tiến hơn nữa để đạt được mức độ tin cậy có thể chấp nhận được trong môi trường thương mại thực tế.
Ren Zhiyi của Physical Intelligence đưa ra khung thời gian từ 4 đến 5 năm. Ông cho biết trước khi gia nhập Physical Intelligence, ông từng nghĩ quá trình này có thể mất đến 10 năm, nhưng với sự phát triển của các mô hình robot cơ bản trong năm qua, kỳ vọng của ông đã được rút ngắn đáng kể.
Physical Intelligence là một trong những công ty hàng đầu áp dụng mô hình "nền tảng robot", nhằm mục đích cho phép cùng một mô hình dần dần có được khả năng vận hành rộng hơn thông qua việc huấn luyện dữ liệu đa ngành và đa nhiệm. Khía cạnh thực sự quan trọng của phương pháp này là liệu khả năng của robot có thể liên tục phát triển khi mô hình và dữ liệu mở rộng quy mô hay không, cuối cùng tạo ra hiệu ứng tương tự như học chuyển giao không cần dữ liệu huấn luyện (zero-shot transfer learning) trong các mô hình ngôn ngữ lớn.
Giáo sư Xu Danfei của Viện Công nghệ Georgia đã đưa ra câu trả lời thận trọng nhất, nhưng ngay cả con số đó cũng chỉ là 5 năm. Thay vì đặt cược vào một phương pháp mô hình cụ thể, ông tập trung hơn vào ba chỉ số cơ bản: liệu mô hình có thực sự học được từ dữ liệu hay không, liệu khả năng học được có thể khái quát hóa sang các môi trường và nhiệm vụ mới hay không, và liệu tốc độ suy luận có đáp ứng được các yêu cầu vận hành thời gian thực của robot trong thế giới thực hay không.
Khi chúng ta kết hợp dự đoán "nhanh nhất là 2 đến 3 năm" của Wang Xingxing, "năm 2028" của Wang He và câu trả lời của sáu vị khách mời tại WAIC, một hiện tượng ngày càng rõ ràng xuất hiện: ngành công nghiệp trí tuệ nhân tạo đang rút ngắn khung thời gian vốn xa vời của "robot thông thường" thành một chu kỳ công nghệ tương lai.
Đây có phải là một cột mốc lịch sử rõ ràng, hay là một quá trình diễn ra dần dần?
Tuy nhiên, mặc dù các doanh nhân và nhà nghiên cứu này đang ngày càng tiến gần hơn đến dự đoán về thời điểm, nhưng họ lại không thực sự sử dụng cùng một bộ tiêu chuẩn để thảo luận về "thời điểm ChatGPT".
Wang He tập trung vào bước nhảy vọt về khả năng của chính mô hình cơ bản. Theo định nghĩa của ông, trí tuệ thể hiện vượt qua một điểm quan trọng tương tự như ChatGPT khi robot không còn cần phải được huấn luyện lại cho mỗi nhiệm vụ mới và có thể hoàn thành 70% đến 80% các nhiệm vụ hàng ngày chỉ bằng mô hình cơ bản. Tiêu chuẩn này chủ yếu đo lường xem mô hình có thể chuyển từ "trí tuệ chuyên biệt" cho các nhiệm vụ cụ thể sang trí tuệ tổng quát với khả năng chuyển giao mạnh mẽ hay không.
Tiêu chuẩn của Wang Xingxing gần hơn với hiệu suất của robot trong thế giới thực. Ông cũng coi tỷ lệ hoàn thành nhiệm vụ khoảng 80% là một ngưỡng quan trọng, nhưng nhấn mạnh liệu robot có thể hoàn thành hầu hết các nhiệm vụ chỉ dựa vào lệnh ngôn ngữ khi vào một môi trường không quen thuộc hay không. Theo ông, nhiều robot hiện nay có thể đạt được tỷ lệ thành công cao trong môi trường cố định, được huấn luyện tốt. Thử thách thực sự nằm ở chỗ liệu mô hình có thể tiếp tục hoạt động sau khi môi trường, vật thể hoặc nhiệm vụ thay đổi hay không.
Hai định nghĩa này thoạt nhìn có vẻ giống nhau, nhưng thực chất chúng tập trung vào các cấp độ khác nhau. Ngay cả khi một mô hình có khả năng xử lý dữ liệu huấn luyện ngay từ đầu (zero-shot) hoặc thực hiện nhiều nhiệm vụ cùng lúc (cross-task) tốt, điều đó không có nghĩa là robot được trang bị khả năng đó đã trở thành một công cụ sản xuất đáng tin cậy. Wang Xingxing đã đề cập tại WRC rằng Unitree thực sự đã triển khai robot trong các nhà máy sản xuất ô tô và nhà máy của chính họ, và chúng có thể hoàn thành một số nhiệm vụ lắp ráp đơn giản, nhưng việc triển khai trên quy mô lớn vẫn chưa khả thi. Một lý do quan trọng là hiệu quả của robot vẫn thấp hơn so với con người, và chúng thường cần được đào tạo lại để đối mặt với các nhiệm vụ mới.
CEO Gao Jiyang của Xinghaitu đã đưa ra một đánh giá kép thú vị về vấn đề này. Trong lộ trình ngành được trình bày tại WRC năm nay, Xinghaitu đã chỉ rõ năm 2027 là "thời điểm GPT" về mặt công nghệ, tin rằng sau khi Quy luật Tỷ lệ thúc đẩy khả năng của mô hình cơ bản vượt qua điểm uốn, các kịch bản ứng dụng theo chiều dọc sẽ bắt đầu tăng tốc; tuy nhiên, "điểm uốn thương mại hóa" thực sự nằm ở năm 2028, tiếp theo là sự thâm nhập sâu rộng vào năm 2029 và triển khai rộng rãi vào năm 2030.
Tuy nhiên, khi thảo luận về việc liệu trí tuệ thể hiện có thể tái hiện một khoảnh khắc lịch sử như ChatGPT hay không, Gao Jiyang đã khẳng định rõ ràng rằng ông tin "khả năng cao là khoảnh khắc như vậy sẽ không xảy ra". Lý do là trí tuệ thể hiện sẽ không được phổ biến ngay lập tức thông qua một sản phẩm phần mềm dành cho tất cả mọi người, mà nhiều khả năng sẽ bắt đầu trong các kịch bản B2B, dần dần được khai thác từng ngành và từng nhiệm vụ một.
Những đột phá công nghệ và sự nhận thức tức thời của công chúng khó có thể xảy ra đồng thời. Điều này là do sự bùng nổ của công nghệ thông minh toàn cầu (GPT) dựa trên việc mọi người đều có thể trải nghiệm trực tiếp bằng điện thoại di động hoặc máy tính, trong khi các ứng dụng ban đầu của trí tuệ thể hiện (embodied intelligence) lại nằm trong môi trường sản xuất như nhà máy và kho hàng, khiến công chúng khó có thể cảm nhận trực tiếp. Do đó, những bước ngoặt của ngành sẽ dần dần xuất hiện một cách tinh tế và sâu rộng, trở nên phổ biến vào thời điểm mọi người đột nhiên nhận ra điều đó.
Hai nhận định này không hoàn toàn mâu thuẫn. Trên thực tế, Gao Jiyang phân biệt giữa điểm uốn công nghệ của năng lực mô hình và điểm uốn xã hội của sự lan tỏa công nghiệp: điểm uốn công nghệ có thể xuất hiện tương đối rõ ràng trong một năm nhất định, trong khi điểm uốn xã hội đòi hỏi phải xác minh kịch bản, sản xuất quy mô lớn, giảm chi phí và sự trưởng thành của mô hình kinh doanh để dần dần lan rộng ra thế giới thực.
Đây cũng là một trong những điểm khác biệt quan trọng nhất giữa robot và các mô hình ngôn ngữ quy mô lớn. Sau khi ChatGPT được phát hành vào tháng 11 năm 2022, những thay đổi về khả năng của mô hình có thể được truyền đạt đến người dùng trên toàn thế giới gần như cùng một ngày. Đối với một sản phẩm phần mềm, miễn là máy chủ và sức mạnh tính toán có thể xử lý được, chi phí để thêm một người dùng mới là tương đối hạn chế. Người dùng có thể ngay lập tức nhận thấy bước nhảy vọt về khả năng của mô hình chỉ bằng cách mở một trang web và nhập một câu hỏi. Do đó, những đột phá công nghệ, việc ra mắt sản phẩm và việc người dùng quy mô lớn chấp nhận sản phẩm gần như được gói gọn trong cùng một khoảng thời gian với ChatGPT.
Tuy nhiên, robot phải đi vào thế giới vật lý thông qua một cơ thể thực. Ngay cả khi một mô hình cơ bản đột nhiên có được khả năng khái quát hóa mạnh mẽ hơn đáng kể vào ngày mai, những khả năng này vẫn cần được chuyển đổi thành các chuyển động thực tế thông qua chip, cảm biến, khớp nối, bàn tay khéo léo và bộ truyền động, đồng thời phải đối mặt với một loạt thách thức kỹ thuật như độ chính xác, độ ổn định, an toàn, tuổi thọ, bảo trì và chi phí.
Do đó, trí tuệ thể hiện cuối cùng có thể khó có thể tái hiện một cột mốc lịch sử rõ ràng như ngày 30 tháng 11 năm 2022. Nó có nhiều khả năng biểu hiện dưới dạng một loạt các điểm bùng phát xuất hiện dần dần. Có lẽ, ngay cả khi mọi người nhìn lại trong tương lai để xác nhận "khoảnh khắc ChatGPT của trí tuệ thể hiện", họ cũng có thể không tìm thấy một điểm duy nhất mà tất cả mọi người đều đồng ý.
Nội dung này chỉ mang tính chất tham khảo và cung cấp thông tin, không phải lời khuyên đầu tư liên quan đến BTCC. BTCC luôn cố gắng cung cấp thông tin chính xác, nhưng không đảm bảo tuyệt đối về tính xác thực, độ chính xác hoặc bản quyền nội dung trên.