EmbeddingGemma 2: Google DeepMind lanza el modelo multimodal on-device que procesa texto, código, imágenes, audio y vídeo con 740 millones de parámetros

Wait 5 sec.

Google DeepMind publicó EmbeddingGemma 2, un modelo de representación multimodal de 740 millones de parámetros diseñado para ejecutarse directamente en el dispositivo del usuario sin necesidad de conexión a la nube. El modelo puede procesar texto, código, imágenes, audio y vídeo simultáneamente y genera representaciones vectoriales —embeddings— que permiten a las aplicaciones comparar, buscar y clasificar contenido multimodal con un único modelo unificado. El lanzamiento incluye licencia Apache 2.0, que permite el uso libre incluso en productos comerciales, y está construido sobre la arquitectura Gemma 4, la misma base de la familia de modelos abiertos de Google. La primera generación de Gemma acumuló 20 millones de descargas en sus primeros meses de disponibilidad: EmbeddingGemma 2 apunta a un caso de uso diferente pero con un potencial de adopción comparable.¿Qué son los embeddings multimodales y para qué sirven en un dispositivo?Un embedding es una representación matemática compacta de un contenido —una imagen, un fragmento de texto, un clip de audio— en un espacio vectorial donde la distancia entre puntos indica similitud semántica. Dos imágenes del mismo perro tienen embeddings cercanos aunque sean fotos completamente diferentes; una imagen de un perro y la frase «cachorro de labrador» tienen embeddings cercanos aunque sean modalidades distintas. Eso permite buscar imágenes por descripción textual, recomendar vídeos similares a uno que acabas de ver, o detectar si una foto y un texto hablan del mismo tema: todas las tareas que hacen inteligentes a las aplicaciones de búsqueda y recomendación.El problema hasta ahora era que la mayoría de modelos de embeddings multimodales de calidad corrían en la nube, lo que implicaba latencia de red y, más importante, que el contenido del usuario salía del dispositivo para ser procesado. EmbeddingGemma 2 trae esa capacidad al dispositivo con un tamaño de 740 millones de parámetros: suficientemente pequeño para correr en un smartphone de gama alta de 2024-2026 o en cualquier portátil moderno con aceleración de hardware, pero suficientemente capaz para producir embeddings de calidad comparable a los modelos cloud anteriores. Si el modelo corre en el teléfono, las fotos de la galería del usuario no tienen que salir del dispositivo para ser indexadas de forma inteligente.La arquitectura Gemma 4 como base: coherencia de ecosistemaConstruir EmbeddingGemma 2 sobre Gemma 4 no es solo una decisión de ingeniería interna. Es una apuesta por la coherencia del ecosistema de desarrollo. Gemma 4 es la última generación de la familia de modelos abiertos de Google, y cualquier desarrollador que ya tenga experiencia optimizando aplicaciones con Gemma 4 puede transferir ese conocimiento a EmbeddingGemma 2 sin empezar desde cero: mismas herramientas de cuantización, mismas rutas de despliegue en Android con ML Kit o en TensorFlow Lite, mismo proceso de ajuste fino para dominios específicos.La licencia Apache 2.0 es el otro elemento crítico. Sin restricciones de uso comercial, los desarrolladores pueden integrar el modelo en sus productos pagados sin negociar términos con Google ni pagar royalties, lo que reduce drásticamente la fricción de adopción en startups que no tienen legal team para revisar contratos de licencia.La apuesta de OpenAI en imagen con 300 millones de dólares en un equipo de ex-Apple que trabaja en una nueva cámara de smartphone y la estrategia de chips propios que OpenAI ha estado construyendo desde 2024 señalan el mismo terreno de competencia desde ángulos distintos: OpenAI quiere controlar el hardware para controlar la capa de captura de datos; Google apuesta por controlar el software que corre sobre cualquier hardware. EmbeddingGemma 2 es una pieza de esa estrategia de software ubicuo: si cualquier dispositivo puede correr el modelo de Google para indexar su contenido local, Google mantiene relevancia en la capa de organización del conocimiento aunque no sea el fabricante del dispositivo.20 millones de descargas de Gemma 1: la señal de adopciónEl primer Gemma alcanzó 20 millones de descargas convirtiéndolo en uno de los modelos abiertos de mayor adopción de la historia reciente. La mayoría de esas descargas no vinieron de investigadores académicos: vinieron de desarrolladores construyendo aplicaciones reales que necesitaban un modelo de lenguaje competente que no les costara dinero en API calls. EmbeddingGemma 2 apunta al mismo segmento pero con un caso de uso diferente: no para generar texto, sino para indexar, comparar y buscar contenido multimodal de forma privada y sin latencia de red.La unificación de cinco modalidades —texto, código, imágenes, audio y vídeo— en un único modelo de embeddings de 740 millones de parámetros es técnicamente ambiciosa. La mayoría de los modelos de embeddings en producción son monomodales o manejan como mucho dos modalidades con arquitecturas separadas para cada una. Un modelo que unifica las cinco en un espacio vectorial común permite búsquedas y comparaciones entre modalidades que los modelos especializados no pueden hacer de forma nativa: buscar el momento de un vídeo que corresponde a una imagen fija, o encontrar documentos de código que hacen la misma cosa que describe una captura de pantalla de una interfaz.El asistente anticipatorio que Snap integró en sus Spectacles de 2.195 dólares es el tipo de dispositivo para el que EmbeddingGemma 2 está diseñado: hardware portátil con acceso continuo a múltiples modalidades de entrada que necesita modelos que procesen lo que ven, oyen y leen sin depender de la nube para cada consulta. La narrativa de la IA on-device lleva años prometiendo ese futuro y llegando con retraso a la mayoría de los casos de uso reales. Lo que diferencia a EmbeddingGemma 2 de los intentos anteriores es la combinación de tres factores simultáneos: la calidad técnica de Google DeepMind, la licencia Apache 2.0 que elimina todas las barreras comerciales, y el timing de 2026 en el que el hardware de consumo tiene finalmente la potencia para correr 740 millones de parámetros de forma fluida sin sacrificar la batería del dispositivo. La convergencia, esta vez, parece genuina.La noticia EmbeddingGemma 2: Google DeepMind lanza el modelo multimodal on-device que procesa texto, código, imágenes, audio y vídeo con 740 millones de parámetros fue publicada originalmente en Wwwhatsnew.com por Natalia Polo.