Gemini Robotics ER 2: el cerebro de IA para robots que trabaja mientras el robot actúa, colabora con otros y sabe cuándo ha terminado

Wait 5 sec.

Google DeepMind lanzó el 30 de julio de 2026 Gemini Robotics ER 2 («ER» de Embodied Reasoning), su modelo más capaz para dar a los robots un «cerebro de alto nivel» que les permita pensar en lo que viene después mientras ejecutan la tarea actual, sin pausas de «stop-and-think». El modelo está disponible ahora mismo para developers a través de la API de Gemini, Google AI Studio y en private preview en la plataforma Gemini Enterprise Agent Platform.ER 2 es un salto cualitativo sobre ER 1.6, el modelo anterior, en tres capacidades que son los cuellos de botella históricos de la robótica con IA.Las tres capacidades clave que definen ER 21. Saber cuándo una tarea está terminada. Parece trivial pero es uno de los problemas más difíciles de la robótica: ¿cómo sabe el robot que ha apretado suficientemente el tornillo? ¿Que el café está listo para la siguiente persona? ER 2 analiza feeds de vídeo continuo y clasifica el progreso de la tarea en cinco niveles (0-20%, 20-40%, 40-60%, 60-80%, 80-100%). Si algo sale mal a mitad de la tarea, el robot puede detectarlo y reintentarlo sin reiniciar todo el workflow. La precisión de progress classification de ER 2: 57,4% — mejor que todos los modelos competidores evaluados.El «moment finding» — identificar el frame exacto donde ocurre un evento crítico — alcanza 91,3% de precisión con una distancia media de 0,96 segundos. Eso es la latencia sub-segundo necesaria para operar robots físicos de forma segura en tiempo real. Y lo hace a 4 veces la velocidad de modelos de mayor tamaño con rendimiento comparable.2. Colaboración multi-robot. ER 2 permite que robots diferentes (un rover de ruedas, un brazo robótico, un humanoide) compartan comprensión semántica de la tarea y se coordinen. La demo más llamativa del lanzamiento: el humanoide Apollo 2 de Apptronik y el brazo Franka F3 Duo colaboran en una tarea que ninguno podría completar solo. Cada robot sabe qué está haciendo el otro y cuándo necesita intervenir.3. Tool calling en tiempo real. ER 2 puede invocar herramientas externas — Google Search, APIs de navegación, funciones personalizadas del usuario — mientras el robot está en movimiento. La demo con Boston Dynamics Spot ilustra esto: el robot de cuatro patas busca un snack por comando de voz, llama a la API de navegación de Spot para moverse, llama a la API de manipulación para agarrar el objeto, y usa ER 2 como cerebro coordinando todo con latencia sub-segundo.El modelo de arquitectura: separar el pensar del moverseLa filosofía de diseño de ER 2 es importante para entender por qué funciona mejor que los modelos end-to-end que intentan hacer todo a la vez. ER 2 actúa como el «cerebro de alto nivel» que planifica y coordina. El control motor (cómo mover exactamente las articulaciones) lo delega a modelos VLA (Vision-Language-Action) de bajo nivel. Esta separación permite que el cerebro de alto nivel (ER 2) sea agnóstico al tipo de robot — funciona con Spot, Apollo, Franka, o cualquier otro robot que tenga un modelo VLA compatible.La integración con la Gemini Live API usa streaming bidireccional optimizado para baja latencia, lo que elimina las pausas entre acciones que hacen que los robots parezcan «robóticos» en el sentido negativo.Kimi K3 de Moonshot AI con 2,8 billones de parámetros también tiene capacidades de razonamiento espacial avanzadas: la competencia en modelos de razonamiento espacial entre laboratorios chinos y Google se extiende ahora a la robótica. Qualcomm adquirió Modular para desarrollar arquitecturas de chips que compiten con el monopolio de CUDA de NVIDIA: la robótica de IA necesita chips de baja potencia con alta densidad de cómputo en el punto de uso — exactamente el tipo de hardware que Qualcomm quiere proveer. La alianza de Netflix y Runway muestra cómo la IA transforma industrias físicas que antes se resistían a la automatización: el patrón es el mismo que Google DeepMind está persiguiendo en robótica, que es otra industria que ha resistido la automatización general durante décadas.Mi valoraciónLo que más me convence de Gemini Robotics ER 2 es el énfasis en la seguridad: que el modelo para el robot cuando una persona está cerca y solo reanuda cuando el área está despejada no es una característica opcional — es el requisito mínimo para que los robots trabajen junto a humanos en entornos reales. Que Google lo haya incluido como benchmark primario, no solo de rendimiento, es la señal correcta.Lo que más me preocupa es el tiempo entre «disponible para developers en la API» y «desplegado en fábricas y hospitales». La distancia entre las demos con Boston Dynamics y los entornos industriales reales sigue siendo enorme — sensores no controlados, iluminación variable, superficies irregulares, personas impredecibles.Preguntas frecuentes¿Es Gemini Robotics ER 2 solo para humanoides o funciona con cualquier tipo de robot?Funciona con cualquier robot que tenga un modelo VLA (Vision-Language-Action) compatible para el control motor. En las demos de Google se usaron Spot (cuadrúpedo), Apollo 2 (humanoide), y Franka F3 Duo (brazo robótico). Los developers pueden declarar sus propias APIs de control como «herramientas» que ER 2 puede invocar.¿Cuánto cuesta usar Gemini Robotics ER 2?Google no ha publicado precios específicos para ER 2. El acceso es a través de la API de Gemini (con precios por tokens), Google AI Studio (con un tier gratuito de uso), y Gemini Enterprise Agent Platform (private preview, probablemente con precios enterprise negociados). El coste real dependerá del volumen de video procesado y las llamadas de herramientas.¿Qué es el «Embodied Reasoning» (ER) en robótica?Embodied Reasoning es la capacidad de un sistema de IA para razonar sobre el mundo físico desde la perspectiva de un agente que ocupa espacio y actúa sobre objetos. A diferencia del razonamiento puramente lingüístico, incluye comprensión espacial (qué está dónde), razonamiento temporal (qué pasa primero), y razonamiento causal físico (si empujo esto, qué cae). Es la capacidad que hace que un robot pueda planificar una secuencia de acciones físicas, no solo responder preguntas.La noticia Gemini Robotics ER 2: el cerebro de IA para robots que trabaja mientras el robot actúa, colabora con otros y sabe cuándo ha terminado fue publicada originalmente en Wwwhatsnew.com por Natalia Polo.