Google DeepMind publicó EmbeddingGemma 2, un modelo de representación multimodal de 740 millones de parámetros diseñado para ejecutarse directamente en el dispositivo del usuario sin necesidad de conexión a la nube. El modelo puede procesar texto, código, imágenes, audio y vídeo simultáneamente y genera representaciones vectoriales —embeddings— que permiten a las aplicaciones comparar, buscar y clasificar contenido multimodal con un único modelo unificado. El lanzamiento incluye licencia Apache 2.0, que permite el uso libre incluso en productos comerciales, y está construido sobre la arquitectura Gemma 4, la misma base de la familia de modelos abiertos de Google. La primera generación de Gemma acumuló 20 millones de descargas en sus primeros meses de disponibilidad: EmbeddingGemma 2 apunta a un caso de uso diferente pero con un potencial de adopción comparable. Continúa leyendo «EmbeddingGemma 2: Google DeepMind lanza el modelo multimodal on-device que procesa texto, código, imágenes, audio y vídeo con 740 millones de parámetros»