¿Está el director de Yushu (una empresa de medios tecnológicos) echando agua fría a la situación? ¿Cuánto falta para el "momento ChatGPT" de la inteligencia encarnada?
PanewslabUna tendencia creciente es que la industria de la inteligencia incorporada está comprimiendo el cronograma, antes lejano, de los "robots de uso general" en un único ciclo tecnológico en el futuro.
En un momento en que los robots humanoides gozan de gran popularidad, el director de la "primera empresa de robots humanoides" que cotiza en el mercado de acciones A parece haber echado un jarro de agua fría sobre el sector.
El 20 de agosto, en la Conferencia Mundial de Robótica de 2026, Wang Xingxing, fundador de Unitree Robotics, admitió en su primer discurso público tras la salida a bolsa de la compañía que el momento de ChatGPT, la inteligencia encarnada, aún no ha llegado. Podría llegar en dos o tres años, o incluso en cinco o diez.
En los últimos dos años, los robots humanoides se han convertido en el artículo tecnológico de moda más popular. Estos robots futuristas son cada vez más visibles en los escenarios de las principales galas, en las exposiciones de las compañías de videojuegos e incluso en las entradas de centros comerciales y tiendas. Bailan, caminan y saludan, a veces con agilidad, a veces con torpeza, interactuando con el público y estrechando manos, pasando rápidamente del laboratorio al ojo público.
Pero tras las bulliciosas demostraciones, las capacidades reales de estos robots distan mucho de la imagen que la gente tiene de los "robots del futuro". Al menos según la expectativa más común, los robots no deberían limitarse a actuar en escenarios o con fines publicitarios, sino que deberían entrar en fábricas y hogares, moviendo objetos, organizando, manejando herramientas o realizando tareas domésticas y de cuidado. La pregunta del público sigue siendo clara y directa: ¿Cuándo podrán los robots trabajar de verdad?
En el campo de los modelos de lenguaje a gran escala, ChatGPT ofreció una respuesta sumamente simbólica. Si bien no fue el primer modelo de lenguaje, sí fue el primero en lograr que un gran número de usuarios comunes comprendieran intuitivamente que la IA había superado un cierto umbral de capacidad. Cuándo se producirá un momento similar en el campo de la inteligencia incorporada se está convirtiendo gradualmente en una de las preguntas más apremiantes de la industria robótica.
La clave para que los robots lleguen a todos los hogares reside en su capacidad de generalización.
En la Conferencia Mundial de Robótica celebrada el 20 de agosto, Wang Xingxing, fundador de Unitree Robotics, señaló un problema que se ha debatido repetidamente en la industria como el mayor obstáculo para la inteligencia incorporada.
En su opinión, muchos modelos de robots pueden alcanzar una tasa de éxito cercana al 100 % en escenarios fijos, siempre que cuenten con suficiente recopilación de datos y entrenamiento. Sin embargo, la tasa de éxito puede disminuir significativamente si el objeto que se manipula cambia o si el entorno se modifica ligeramente.
Este es también el obstáculo más importante antes de que los robots puedan entrar realmente en nuestras vidas y hogares.
Wang Xingxing propuso un criterio bastante específico: si algún día se puede introducir un robot en un hogar o entorno completamente desconocido y completar aproximadamente el 80 % de las tareas utilizando únicamente comandos de voz o verbales, entonces la inteligencia encarnada habrá alcanzado su "momento ChatGPT". En cuanto a los plazos, cree que podría tardar entre 2 y 3 años como mínimo, y entre 5 y 10 años como máximo.
Wang Xingxing hizo especial hincapié en que la verdadera dificultad no reside en lograr que el robot "sepa en general qué hacer", sino en los últimos centímetros o incluso milímetros.
Por ejemplo, si le pides a un robot que recoja un objeto, el modelo puede haber planificado correctamente toda la acción y el brazo robótico puede haberse movido a las proximidades del objeto. Sin embargo, si el error de posición final, la retroalimentación táctil o la fuerza de agarre no se corrigen correctamente, la tarea completa puede fracasar.
Aquí es también donde los robots y los grandes modelos de lenguaje se diferencian notablemente.
La entrada y salida de un modelo de lenguaje siempre se produce en el espacio digital, mientras que cada percepción y acción de un robot debe interactuar con el mundo físico real. Los sensores generan ruido, los actuadores presentan errores y la posición, el material y el peso de los objetos cambian constantemente; estos errores se acumulan a medida que se realizan las tareas. Por lo tanto, para la inteligencia encarnada, pasar de "ser capaz de hacer algo de forma básica" a "hacerlo correctamente de forma consistente" puede resultar más difícil que aprender una tarea inicialmente.
Casi simultáneamente con la evaluación de Wang Xingxing, Wang He, fundador y director de tecnología de Galaxy General, también proporcionó una fecha más específica. Wang He afirmó que, con la continua acumulación de datos y los avances tecnológicos, se espera que la inteligencia incorporada alcance su "momento ChatGPT" en 2028. Define este hito como la capacidad de los robots para completar aproximadamente entre el 70 % y el 80 % de las tareas diarias sin necesidad de un entrenamiento específico para ninguna tarea en particular.
Sus conclusiones son, en realidad, muy similares. Wang Xingxing se centra en la tasa de finalización de tareas del robot tras entrar en un entorno desconocido, mientras que Wang He se centra en la capacidad de generalización directa del modelo básico sin entrenamiento específico. Sin embargo, ambos establecen el punto crítico en una tasa de éxito de entre el 70 % y el 80 % para tareas desconocidas.
Esto también significa que el "momento ChatGPT" al que se refieren no es la movilidad que demuestran los robots humanoides hoy en día, ni la tasa de éxito del 99 % que se logra con una demostración fija y bien entrenada. El verdadero cambio debería producirse cuando los robots empiecen a liberarse de su dependencia de escenas fijas, objetos fijos y entrenamiento especializado.
¿Cuándo lo entenderán realmente los robots? El consenso general es de 2 a 5 años.
Hace apenas un mes, en la Conferencia Mundial de Inteligencia Artificial (WAIC) de 2026, una mesa redonda planteó la misma pregunta a seis destacados emprendedores e investigadores en el campo de la inteligencia incorporada.
El 19 de julio, durante el "Foro de Robots Inteligentes Integrados" organizado por Zhiyuan Robotics y Mifeng Technology, el presentador formuló a los seis invitados una pregunta muy directa durante la mesa redonda final: ¿Cuántos años faltan para que llegue el momento ChatGPT para los robots?
Los resultados fueron sorprendentemente concentrados. Yao Maoqing, socio de Zhiyuan Robotics y presidente y director ejecutivo de Mifeng Technology, dio una respuesta de 2 años; Tony Zhao, cofundador y director ejecutivo de Sunday Robotics, creía que serían 3 años; Zhang Zhengyou, científico jefe de Tencent y director de Robotics X Lab, dio de 3 a 5 años; Ma Yecheng, cofundador y científico jefe de Dyna Robotics, creía que tomaría alrededor de 4 años; Ren Zhiyi, científico investigador de Physical Intelligence, estimó que tomaría de 4 a 5 años; y Xu Danfei, profesor del Instituto Tecnológico de Georgia, dio una respuesta de 5 años.
Las seis personas provenían de empresas e instituciones de investigación completamente diferentes, y sus enfoques técnicos también diferían, pero todas sus respuestas finales se centraron en los próximos dos a cinco años.
Entre ellos, Yao Maoqing es el más optimista. Su análisis se basa principalmente en el crecimiento del volumen de datos. En opinión de Yao Maoqing, los factores clave que actualmente limitan el desarrollo de la IA física se resumen en tres obstáculos: datos, representación y bucle cerrado. En comparación con la enorme cantidad de texto e imágenes que se pueden obtener fácilmente en internet, los datos de interacción con robots en el mundo real no solo son costosos, sino que también están limitados por las diferencias entre el propio robot, la tarea y el escenario.
Un robot verdaderamente listo para usar necesita comprender comandos abiertos en lenguaje natural y alcanzar una tasa de éxito básica de entre el 70 % y el 80 % en tareas comunes. Para lograrlo, la inteligencia incorporada requiere datos a una escala que supera con creces los niveles actuales. Incluso sugirió que, en el futuro, podría requerir datos equivalentes a cientos de millones de horas.
En otras palabras, en el marco de análisis de Yao Maoqing, el "momento ChatGPT" es en gran medida un problema de escala: a medida que los datos del mundo real, los datos de simulación, los vídeos de Internet, los datos desde la perspectiva en primera persona y los datos que fluyen después del despliegue del robot alcanzan gradualmente una cierta escala, las capacidades del modelo también pueden cruzar el punto crítico.
Por otro lado, Zhao Zihao, de Sunday Robotics, ha establecido un plazo de menos de tres años. En lugar de centrarse simplemente en cuerpos robóticos cada vez más complejos, Zhao está más preocupado por cuándo el "cerebro" del robot alcanzará su plena madurez. Sunday Robotics se ha enfocado durante mucho tiempo en robots domésticos y modelos básicos. Su filosofía es que si un modelo robótico básico suficientemente robusto puede comprender entornos y tareas complejos, incluso si el robot utiliza pinzas relativamente simples y de bajo costo, podría resolver una gran cantidad de problemas prácticos desde el principio.
La actitud de Zhang Zhengyou fue mucho más cautelosa. Dio una respuesta de 3 a 5 años, pero enfatizó que este plazo no significa que la industria simplemente deba esperar a que surja repentinamente un modelo más grande. Un requisito clave para la rápida expansión de los modelos de lenguaje a gran escala es que Transformer se haya convertido gradualmente en una arquitectura más unificada. Sin embargo, la inteligencia robótica aún no ha conformado un paradigma tecnológico tan claro.
Desde la cognición de alto nivel, la percepción visual y la planificación de tareas hasta el control de movimiento en tiempo real, la retroalimentación corporal y las respuestas de seguridad, un robot necesita abordar problemas en diferentes escalas temporales simultáneamente. Por lo tanto, los avances significativos pueden requerir mejoras en la adquisición de datos, la simulación, la implementación en el mundo real, la recuperación ante fallos y el desarrollo simultáneo de hardware y modelos, en lugar de simplemente replicar la ley de escala de los grandes modelos de lenguaje. Por esta razón, al realizar su evaluación, Zhang Zhengyou enfatizó específicamente que la industria aún necesita "trabajar con diligencia y pragmatismo".
Ma Yecheng, de Dyna Robotics, estima un plazo de unos cuatro años. Su evaluación se basa principalmente en la implementación comercial. Para una demostración en laboratorio, una tasa de éxito del 80 % o 90 % podría ser suficiente para demostrar la eficacia de la tecnología; sin embargo, para una fábrica o empresa de servicios que adquiere robots, dicha fiabilidad suele ser insuficiente. Por lo tanto, el "momento ChatGPT" de la inteligencia incorporada no solo implica que el robot pueda comprender más tareas, sino también que debe mejorarse aún más hasta alcanzar un nivel de fiabilidad aceptable en entornos comerciales reales.
Ren Zhiyi, de Physical Intelligence, estimó un plazo de entre 4 y 5 años. Comentó que, antes de unirse a Physical Intelligence, pensaba que este proceso podría durar 10 años, pero gracias al desarrollo de modelos básicos de robots durante el último año, sus expectativas se han reducido considerablemente.
Physical Intelligence es una de las empresas líderes en el enfoque del "modelo base de bots", cuyo objetivo es permitir que un mismo modelo adquiera gradualmente capacidades operativas más amplias mediante el entrenamiento con datos de diversas ontologías y tareas. El aspecto verdaderamente importante de este enfoque es si las capacidades del robot pueden surgir continuamente a medida que el modelo y los datos se expanden, produciendo en última instancia un efecto similar al aprendizaje por transferencia de cero disparos en grandes modelos de lenguaje.
El profesor Xu Danfei, del Instituto Tecnológico de Georgia, ofreció la respuesta más conservadora, pero incluso esa cifra era de tan solo 5 años. En lugar de apostar por un modelo específico, se centró más en tres métricas fundamentales: si el modelo puede aprender realmente de los datos, si las capacidades aprendidas pueden generalizarse a nuevos entornos y tareas, y si la velocidad de inferencia puede satisfacer los requisitos operativos en tiempo real del robot en el mundo real.
Cuando combinamos la afirmación de Wang Xingxing de que "en el plazo más rápido de 2 a 3 años", la de Wang He de que "2028" y las respuestas de los seis invitados en WAIC, emerge un fenómeno cada vez más evidente: la industria de la inteligencia incorporada está comprimiendo el plazo, antes lejano, de los "robots generales" en un futuro ciclo tecnológico.
¿Se trata de un hito histórico claro o de un proceso gradual?
Sin embargo, aunque estos emprendedores e investigadores se acercan cada vez más en sus predicciones sobre el momento oportuno, en realidad no utilizan el mismo conjunto de criterios para hablar del "momento ChatGPT".
Wang He se centra en el salto cualitativo del modelo básico. Según su definición, la inteligencia incorporada alcanza un punto crítico similar al de ChatGPT, cuando un robot ya no necesita ser reentrenado para cada nueva tarea y puede completar entre el 70 % y el 80 % de las tareas diarias utilizando únicamente el modelo básico. Este estándar mide principalmente si el modelo puede pasar de una «inteligencia especializada» para tareas específicas a una inteligencia general con una gran transferibilidad.
El estándar de Wang Xingxing se acerca más al rendimiento de los robots en el mundo real. Considera que una tasa de finalización de tareas cercana al 80 % es un umbral importante, pero hace hincapié en si el robot puede completar la mayoría de las tareas basándose únicamente en comandos de lenguaje al entrar en un entorno desconocido. En su opinión, muchos robots actuales pueden alcanzar una alta tasa de éxito en entornos fijos y bien entrenados. El verdadero desafío reside en si el modelo puede seguir funcionando tras cambios en el entorno, los objetos o las tareas.
Estas dos definiciones parecen similares, pero en realidad se centran en niveles diferentes. Incluso si un modelo tiene buenas capacidades de autoensamblaje o de tareas múltiples, no significa que un robot equipado con él se haya convertido en una herramienta de producción fiable. Wang Xingxing mencionó en el WRC que Unitree ya ha desplegado robots en fábricas de automóviles y en sus propias fábricas, y que estos pueden completar algunas tareas de ensamblaje sencillas, pero su despliegue a gran escala aún no es posible. Una razón importante es que la eficiencia de los robots todavía es menor que la de los humanos, y a menudo necesitan ser reentrenados para realizar nuevas tareas.
El director ejecutivo de Xinghaitu, Gao Jiyang, ofreció una interesante evaluación dual de este tema. En la hoja de ruta de la industria presentada en la WRC de este año, Xinghaitu señaló explícitamente 2027 como el "momento GPT" en términos de tecnología, creyendo que después de que la Ley de Escalado impulse las capacidades del modelo básico a superar el punto de inflexión, los escenarios de aplicación vertical comenzarán a acelerarse; sin embargo, el verdadero "punto de inflexión de la comercialización" se sitúa en 2028, seguido de una penetración profunda en 2029 y un despliegue generalizado en 2030.
Sin embargo, al analizar si la inteligencia incorporada replicaría un momento histórico como ChatGPT, Gao Jiyang afirmó explícitamente que cree que "hay una alta probabilidad de que tal momento no ocurra". La razón es que la inteligencia incorporada no se popularizará instantáneamente a través de un producto de software accesible para todos, sino que es más probable que comience en escenarios B2B, desplegándose gradualmente sector por sector y tarea por tarea.
Es improbable que los avances tecnológicos y la concienciación pública inmediata se produzcan simultáneamente. Esto se debe a que el crecimiento exponencial de la tecnología de procesamiento de imágenes depende de que todos puedan experimentarla de primera mano mediante un teléfono móvil o un ordenador, mientras que las aplicaciones iniciales de la inteligencia incorporada se dan en entornos de producción como fábricas y almacenes, lo que dificulta su percepción directa por parte del público en general. Por lo tanto, los puntos de inflexión de la industria surgirán gradualmente de forma sutil y generalizada, hasta volverse omnipresentes cuando la gente finalmente se dé cuenta.
Estas dos afirmaciones no son del todo contradictorias. Gao Jiyang distingue entre el punto de inflexión tecnológico de las capacidades del modelo y el punto de inflexión social de la difusión industrial: el primero puede aparecer con relativa claridad en un año determinado, mientras que el segundo requiere verificación de escenarios, producción a gran escala, reducción de costos y madurez del modelo de negocio para extenderse gradualmente al mundo real.
Esta es también una de las diferencias más significativas entre los robots y los grandes modelos de lenguaje. Tras el lanzamiento de ChatGPT en noviembre de 2022, los cambios en las capacidades del modelo pudieron comunicarse a usuarios de todo el mundo casi el mismo día. Para un producto de software, siempre que el servidor y la capacidad de procesamiento lo permitan, el coste de añadir un nuevo usuario es relativamente limitado. Los usuarios pueden percibir de inmediato el salto en las capacidades del modelo con solo abrir una página web e introducir una pregunta. Por lo tanto, los avances tecnológicos, los lanzamientos de productos y la adopción masiva por parte de los usuarios se comprimieron prácticamente en el mismo lapso de tiempo en ChatGPT.
Sin embargo, los robots deben interactuar con el mundo físico a través de un cuerpo real. Incluso si un modelo básico adquiere repentinamente capacidades de generalización significativamente mayores mañana, estas capacidades aún deben traducirse en movimientos reales mediante chips, sensores, articulaciones, manos diestras y actuadores, al tiempo que se enfrentan a una serie de desafíos de ingeniería como la precisión, la estabilidad, la seguridad, la vida útil, el mantenimiento y el costo.
Por lo tanto, es posible que la inteligencia encarnada tenga dificultades para replicar un hito histórico claro como el 30 de noviembre de 2022. Es más probable que se manifieste como una serie de puntos de inflexión que surgen gradualmente. Quizás, incluso si en el futuro se analiza retrospectivamente el "momento ChatGPT de la inteligencia encarnada", es posible que no se encuentre un único punto en el que todos estén de acuerdo.
Este contenido se proporciona únicamente con fines informativos y educativos y no constituye asesoramiento de inversión relacionado con BTCC. BTCC realiza todos los esfuerzos posibles, pero no puede garantizar la veracidad, exactitud u originalidad del contenido anterior.