En el foro principal de la Cumbre Mundial de Robótica 2026, el fundador, CEO y CTO de Minglue Technology, Wu Minghui, ofrecerá una charla titulada (Agente + encarnación: una ruta evolutiva impulsada por las necesidades de aplicación hacia la inteligencia robótica), en la que compartirá sus más recientes reflexiones y prácticas en materia de agentes, inteligencia encarnada y aplicaciones en la industria.

Él plantea que para que los robots realmente entren en los sistemas de producción no solo se necesita un “cerebro” individual más inteligente, sino también un “cerebro organizativo” que conecte al robot, a los agentes y a los sistemas de TI, y que supere el último kilómetro de la entrega de ingeniería, la reestructuración de los procesos de negocio y el despliegue en el sitio.

A continuación, notas breves de la ponencia:

Muchos amigos quizás se preguntan por qué Minglue Technology, que en el pasado participó más en la Conferencia Mundial de IA, vino esta vez a la Conferencia Mundial de Robótica. En realidad, hace 12 años participé en la fundación de una empresa de robótica, es decir, Cloud Trace Technology, enfocada en escenarios de servicio para hoteles. El año pasado ya cotizó en la Bolsa de Hong Kong.

Yo mismo me he dedicado durante mucho tiempo al trabajo relacionado con la inteligencia artificial. Hace 20 años empecé a estudiar la inteligencia artificial de la generación anterior y, después, me convertí en doctorando de la Universidad de Pekín. Estos años he estado observando el desarrollo de la IA tanto en el mundo digital como en el mundo físico.

Hoy, la inteligencia artificial ya ha generado muchas aplicaciones a nivel de productividad en el mundo digital. Puede producir contenido, escribir código y realizar análisis complejos de datos, mostrando un nivel de inteligencia bastante alto.

Pero en el mundo físico, la mayoría de los robots todavía se encuentran principalmente en una etapa que aporta valor emocional. ¿Cuándo podrán los robots convertirse realmente en productividad? Esa es una pregunta que he estado pensando. Por eso, estar hoy aquí también significa que decidimos involucrarnos de forma más profunda en esta ola tecnológica de los robots.

Por supuesto, en lo que se refiere al mundo físico, yo sigo sintiendo mucho respeto. Yo soy de formación en software y en inteligencia artificial. En mi opinión, el mundo físico es mucho más complejo que el mundo digital: en él hay muchos problemas relacionados con fabricación, despliegue y adaptación en sitio.

Hoy, Minglue ha entrado en el campo de la inteligencia corpórea y los robots, pero tampoco elegimos luchar en solitario: nos hemos asociado con Hikvision Robots. Hikvision Robots tiene una base sólida en los sectores de industria y logística, y ya ha logrado un volumen de producción relativamente alto y una salida estable de productividad.

Minglue y Hikvision Robots son dos empresas con estructuras de capacidades muy diferentes: Minglue se especializa en software, agentes y modelos; por lo tanto, en la cooperación asume más la investigación y desarrollo de modelos y la planificación de coordinación entre múltiples agentes. Hikvision Robots, por su parte, aprovecha plenamente su profunda acumulación en el desarrollo de robots móviles como equipos completos, control de movimiento, fusión de múltiples sensores, plataforma de software de sistemas, integración de sistemas y producción en masa con ingeniería de productos.

Todos dicen que la segunda mitad del futuro de los robots es el “cerebro”. Y, en efecto, no están equivocados, pero yo creo que el cerebro del robot incluye dos dimensiones.

El primero es el “cerebro” del robot en el sentido tradicional: es decir, las capacidades de razonamiento del robot, toma de decisiones de tareas y planificación de operaciones, incluidas las capacidades que ofrecen modelos como VLM y VLA.

El segundo es el “cerebro” de toda la organización. Cuando los robots se despliegan realmente en sistemas de producción y entran en la industria de servicios presenciales y escenarios comerciales, ¿cómo conectar los robots con los robots? ¿Cómo conectar los robots con los agentes? ¿Cómo conectar los robots con los sistemas IT de la generación anterior? Y, finalmente, formar un cerebro a nivel organizacional: esto también es muy importante.

Tenemos una empresa conjunta con Yum China. En las tiendas de KFC y Pizza Hut, una gran cantidad de sistemas digitales y sistemas de trabajo han sido desarrollados y desplegados con la participación de Minglue. En el futuro, también llevaremos a los robots a esos escenarios.

Minglue publicó recientemente una plataforma de código abierto de colaboración humano-máquina — la plataforma Octo—, que puede conectar varios agentes y runtimes. En el futuro, en la cooperación con robots de Hikvision, esta plataforma también tendrá un papel importante. Esperamos que conecte los “cerebros” individuales de cada robot para formar un cerebro de colaboración humano-máquina a nivel organizacional.

Estos días, al preparar una charla, también usé el agente inteligente de análisis de opinión pública del sistema de la marca Secunda de Minglue para analizar discusiones sobre el “último kilómetro” de la implementación industrial de la inteligencia corpórea en China y en el extranjero.

Por los temas de discusión, los problemas que se observan tanto en China como en el extranjero son básicamente los mismos: entrega de ingeniería, modelos económicos, coordinación de software y hardware, etc. Pero según la distribución del nivel de interés reciente, también hay algunas diferencias. Las discusiones en China se concentran más en la entrega de ingeniería, el calendario de software y hardware y los modelos económicos, es decir, “si el robot realmente puede usarse”. En cambio, en el extranjero se presta más atención a la robustez del volante de datos y las tareas de largo recorrido, es decir, “si el robot puede seguir fortaleciéndose”.

Cuando veo problemas como el volante de datos y las tareas de largo recorrido, de pronto me parecen muy familiares. Porque estos también son problemas a los que nos hemos enfrentado durante mucho tiempo y que hemos estado resolviendo en el proceso de llevar a la industria la IA Agentic, es decir, la IA del mundo digital. Aunque la IA Agentic y la inteligencia corpórea (embodied intelligence) pertenecen a dos campos distintos, sus rutas de implementación tecnológica tienen una fuerte homología.

Pensemos en herramientas operativas: en el mundo digital, lo más temprano que se usó fueron motores de reglas tradicionales, sistemas expertos y RPA. Luego apareció Workflow, y más adelante apareció un Agente general como Manus. El usuario solo tiene que encomendar una tarea, y el Agente puede operar de manera autónoma software y herramientas, como los modelos VLA del mundo digital, y completar la tarea de extremo a extremo.

Esta ruta ha pasado por el proceso de ir desde reglas escritas de antemano, a la apertura total y la exploración libre. A partir del segundo semestre del año pasado y en lo que va de este año, representado por las Claude Code Skills de Anthropic, apareció también una Skill estructurada. No es ni un conjunto completamente “codificado” de reglas, ni una exploración libre sin restricciones: está en equilibrio entre costos, eficiencia, grado de libertad y capacidad de realización.

Lo más importante es que hoy las Skills no las tiene que definir solo personal de investigación en IA. Cada trabajador en el ámbito laboral puede, basándose en su experiencia, sedimentar y escribir Skills. Esto es sumamente clave.

El campo de la inteligencia corpórea también ha pasado por un proceso evolutivo similar: de los motores de reglas tradicionales y la programación PLC, a Behavior Tree, y luego a los modelos VLA de extremo a extremo que se debaten ampliamente hoy. Sin embargo, en sistemas de aplicación reales, adoptar completamente VLA de extremo a extremo quizá no sea la mejor ruta. En el futuro también podría aparecer una arquitectura híbrida, que forme una capa intermedia similar a Skills del mundo digital. En este campo, la inteligencia corpórea ya ha empezado a surgir con Atomic Skill Library, es decir, un repositorio estructurado de habilidades atómicas, que se está validando gradualmente en aplicaciones reales.

Otro ejemplo con homología es la Memoria: es decir, la memoria.

La memoria es una capacidad muy importante para la IA del mundo digital. Queremos que, cuando la IA entre en un escenario concreto, pueda entender ese escenario y, gradualmente, convertirse en una IA que realmente sabe de ese escenario. Los modelos base siempre exploran capacidades de aprendizaje continuo, pero desde la perspectiva de costos, seguridad de datos y protección de privacidad, todavía hay muchos problemas.

Desde este año, OpenClaw ha traído una nueva idea: además de los parámetros del modelo, también se puede guardar información mediante archivos de configuración y un sistema de memoria. Esas memorias, más allá de los parámetros, se convierten en una parte importante para que la IA entre realmente en los sistemas de producción y siga funcionando de forma continua.

Me gusta mucho el marco de CoALA sobre la memoria de los agentes. Divide la memoria en Working Memory, Episodic Memory, Semantic Memory y Procedural Memory.

Working Memory es el estado temporal que se está trabajando en la tarea actual; Episodic Memory registra las tareas, conversaciones y eventos ocurridos en el pasado, similar a un diario; Semantic Memory guarda hechos, conceptos y relaciones; Procedural Memory se parece más a una habilidad (Skill): guarda el procedimiento y los métodos para completar algún trabajo.

La inteligencia corpórea también necesita estas memorias: memoria espacial, memoria de trayectorias de tiempo y tareas, memoria semántica y el repositorio de habilidades atómicas. La estructura de memoria de los agentes digitales y la estructura de memoria de los agentes corpóreos, en esencia, también es el mismo sistema de memoria aplicado a “dos cuerpos” diferentes.

En el campo de la inteligencia corpórea, “ontología” (en términos del “本体”) normalmente se refiere al cuerpo físico del robot; pero en otro contexto, Ontology se refiere a la abstracción de conceptos y sus relaciones, y puede considerarse como una parte importante de Semantic Memory. En el futuro, la Ontology en la IA Agentic y el cuerpo físico en la inteligencia corpórea también deberán conectarse, y ambas deberán compartir un mismo sistema de memoria semántica.

Por lo tanto, entre la productividad del trabajo en el mundo digital y la productividad del trabajo en el mundo físico, existe un gran espacio para la cooperación.

En 2018, propuse un concepto llamado HAO inteligencia. H representa Human, es decir, los humanos con cuerpo; A representa Artificial Intelligence, que incluye tanto agentes del mundo digital como robots del mundo físico; O representa Organizational Intelligence, es decir, inteligencia organizacional.

Siempre he tenido un sueño: conectar de verdad a los robots entre sí, a los robots con las personas, y a las personas con los agentes en una gran red.

En una organización, no es necesario que cada Agente, cada robot o cada persona tenga capacidades completas para completar por sí solo todo el trabajo de la organización. La sociedad humana funciona precisamente a través de la división del trabajo y la cooperación. Hay quienes se encargan del trabajo administrativo, otros se encargan de la planificación creativa y otros de ejecutar la implementación. Un entorno de productividad real necesita la fuerza unida y la organización, y también requiere que cada individuo dentro de la organización esté conectado de manera fluida para, finalmente, formar el cerebro de la organización.

Durante los últimos seis años, hemos seguido este objetivo, dando poder con IA a empresas de los sectores de servicios tradicionales. En el pasado nos enfocamos principalmente en la productividad digital dentro de oficinas. En el futuro, junto con los robots de Hikvision, exploraremos más a fondo la transformación inteligente de los servicios presenciales.

Hoy existe un concepto muy popular llamado “organización nativa de IA”. ¿Cómo evolucionan las organizaciones tradicionales hacia una organización nativa de IA? Tras muchos años de pensamiento y práctica, propusimos una ruta de evolución de L1 a L5.

L1 es Token Ready. Para una organización, el primer paso es que los empleados realmente tengan tokens utilizables. Aunque muchos empleados quieren usar IA, dentro de la empresa no existe una puerta de enlace unificada, por lo que no se puede gestionar de forma efectiva el acceso a modelos, los permisos y los costos.

L2 es “en línea para el trabajo”. Aquí “en línea” no solo significa que las personas estén en línea, sino que permite que todos usen agentes de IA para trabajar, que el trabajo en sí esté en línea y que las herramientas de software de la generación anterior también puedan ser llamadas por agentes. Por ejemplo, aunque hoy todavía escribo código cada día, ya casi no escribo línea por línea en el editor; en cambio, dejo que el Coding Agent me ayude a completarlo.

L3 es la sedimentación estructurada. Cuando las herramientas y el trabajo de cada persona estén en línea, entre las personas y entre las personas y los agentes se necesita compartir memorias estructuradas, especialmente Semantic Memory. En una organización grande, en el futuro cada Agente e incluso cada robot necesitará compartir este tipo de memoria.

L4 es una red compleja de colaboración entre la generación de productividad: es decir, optimizar continuamente mediante Loop, Evals y Benchmark, para que una persona pueda aprovechar una productividad mayor y crear una eficiencia más alta.

L5 es “crecer a medida que crece el río”, es decir, el paso más difícil. Cada empresa debe acumular sus propios datos y capacidades únicas, y desacoplarse del modelo base específico. A medida que avancen el hardware base, el cómputo, los modelos base y los frameworks, también podrá mejorar de forma continua la capacidad de toda la organización para ejecutar IA.

Estos son los cinco estadios de la organización nativa de IA que resumimos en el mundo digital. En el mundo de la inteligencia corpórea, el futuro también podría existir una serie de L1 a L5 con estructura homóloga. Por supuesto, en este momento aún no tengo una respuesta completa; sigo pensando y explorando.

El problema que necesitamos resolver es: en la industria de servicios presenciales, especialmente en sectores como restauración y retail, ¿cómo llevar al frente las capacidades que Hikvision Robots ya tiene bastante maduras, y ayudar a que la organización forme procesos de servicio más automatizados y eficientes con la participación de robots?

Aunque la L1 a la L5 de la inteligencia corpórea aún no están completamente definidas, hay tres principios básicos que sí están claros.

Primero, hay que reorganizar la división del trabajo según los requisitos de la nueva era: que las personas hagan lo que corresponde a las personas y las máquinas hagan lo que corresponde a las máquinas.

En segundo lugar, cuando las personas y la IA formen una nueva división del trabajo, también se necesitan nuevas formas de colaboración, nuevos procesos y una nueva organización. Tanto si los agentes entran a la oficina como si los robots entran en escenarios de servicios presenciales, la estructura organizativa, los flujos de trabajo y la división de puestos deben cambiar en consecuencia.

Uno de mis amigos había trabajado en un robot lavaplatos y lo vendió a restaurantes. Luego descubrió que la eficiencia del restaurante no mejoraba de forma notable. La razón era que el lavaplatos original no solo lavaba platos: también recogía platos, se ocupaba de otros asuntos y, cuando no estaba ocupado, limpiaba el restaurante. El robot lavaplatos solo podía sustituir una parte del trabajo, pero no podía completar la totalidad de tareas que implica ese puesto.

Por eso, para desplegar realmente robots en una organización y lograr reducir costos y aumentar la eficiencia, no basta con poner un robot en el sitio; también se necesita rediseñar los procesos de negocio.

Tercero, y también la más importante: que sea amable con las personas.

La inteligencia artificial no debería entrar en las empresas con el objetivo único de reemplazar mano de obra y reducir costos. Lo que más deberíamos pensar es cómo usar la inteligencia artificial para amplificar el valor de las personas, ayudando a las empresas a abrir topes de crecimiento más altos, creando así un nuevo valor como objetivo principal de aplicación de robots e inteligencia artificial.

Cada organización tradicional del sector de servicios, ya sea el sector servicios en el mundo digital o los servicios presenciales, al llevar la IA a la práctica se enfrenta a algo como “el último kilómetro”. Ahora hay un puesto muy popular llamado FDE, que significa Forward Deployed Engineer (ingeniero de despliegue en primera línea).

FDE requiere profundizar en el sitio del cliente, conectando de verdad las necesidades del escenario con la tecnología de IA. En el campo de la IA Agentic, empresas como Palantir adoptan un modelo similar: que el cliente instale herramientas de IA no significa que el negocio ya esté funcionando. FDE necesita, en el sitio, incrustar los Agentes, Skills y Memory dentro de los SOP del cliente.

Que los robots entren en un entorno de producción también requiere FDE. El hecho de que un robot llegue al sitio no significa que la productividad ya se haya generado. Además, hace falta que alguien combine VLA, WBC y los SOP del escenario para convertir realmente al robot en un “empleado” dentro del proceso productivo de la organización.

Además del despliegue en primera línea, los robots también generan muchas necesidades de operación y mantenimiento. En los últimos cinco o seis años, también hemos construido un equipo de ingenieros que cubre sucursales y tiendas presenciales para dar mantenimiento a dispositivos IoT a clientes del sector de restaurantes y servicios.

Si una persona se enferma, va sola al hospital; pero cuando fallan dispositivos IoT y equipos inteligentes en restaurantes y tiendas minoristas, e incluso robots, no van por sí mismos al hospital. Todavía se necesita que los ingenieros vayan al sitio a dar mantenimiento y reparaciones. Ustedes pueden entender este tipo de servicio como “llamar a un ingeniero de mantenimiento como pedir un taxi”.

FDE es solo una de las necesidades. Cuando los robots entran realmente en los sistemas de producción y resuelven problemas productivos reales, hay aún un gran espacio para la imaginación.

Por último, quiero convocarlos a todos a abrazar juntos el código abierto.

Hoy, la inteligencia artificial, especialmente los agentes, le otorga a cada persona una gran capacidad. Podemos usar la IA del mundo digital para acelerar el desarrollo iterativo de robots de inteligencia corpórea. Hoy, con la ayuda de la inteligencia artificial, cada persona tiene la oportunidad de crear sus propias herramientas de código abierto.

Minglue también eligió firmemente el código abierto. Actualmente, dentro de la empresa ya hay alrededor de 1.800 empleados y más de 4.000 agentes de IA trabajando juntos en esta plataforma.

Creemos que en el futuro Octo no solo podrá conectar agentes del mundo digital, sino también dispositivos de inteligencia corpórea, incluidos robots e incluso automóviles inteligentes. El automóvil inteligente también puede integrarse a la plataforma como un “empleado digital”. Por ejemplo, si un cliente o socio llega a Beijing y necesita que yo le organice la recepción, puedo llevar al agente del conductor a un grupo, y el agente y el vehículo se comunicarán directamente con el cliente. De manera similar, otros robots funcionales dentro de la empresa también pueden integrarse a esta plataforma como entidades independientes.

Este plataforma debería ser de código abierto y abierta; debería funcionar como el correo electrónico en los sistemas de oficina de la generación anterior: cada empresa puede construir su propia plataforma y además conectarse entre sí.

Todos los robots entre sí, los robots y los agentes, y los sistemas IT de la generación anterior con los sistemas de IA de la nueva generación, deberían lograr la interconexión mediante protocolos abiertos. Eso es precisamente el cerebro inteligente organizacional que queremos construir en conjunto, y también es un maravilloso mundo de colaboración humano-máquina.

Eso es todo por mi parte en esta presentación. Muchas gracias a todos y espero conectar y cooperar juntos en el futuro en un mundo abierto de robots y agentes. ¡Gracias a todos!