
Mientras espera que la comunidad de IA publique Jemi 3, Google está siguiendo una estrategia complementaria en las familias de sus modelos de idiomas grandes: crear una flota de pequeños modelos especiales diseñados para habilidad. Después de la reciente publicación Jemma 3 270 m Modelo de lenguaje pequeño, nuevo Incorporado Alcanzado como su parte especialmente construida.
IncredingHemma es un modelo de cable codificador que puede crear una incrustación para la búsqueda, clasificación, mediciones de molinos y más. Crea un ingrediente importante para habilitar la IA fuerte y privada que está totalmente alimentada en su dispositivo.
EmbayDgema proporciona el texto sofisticado del texto sofisticado para su tamaño. Este es el modelo de incrustación multilingüe de texto multilingüe de máxima clasificación con 500 millones de parámetros Combinación de referencia de texto enorme (MTEB), valor de oro para la evaluación de incrustación de texto.

El modelo tiene 308 millones de parámetros y fue capacitado en más de 100 idiomas, ofrece una amplia aplicabilidad. Su diseño se centra en las habilidades; Con CuantificaciónEl modelo puede ejecutarse en menos de 200 MB RAM, lo que lo hace adecuado para hardware con recursos con recursos como teléfonos móviles.
El rendimiento del modelo proviene de una arquitectura especialmente creada para crear una incrustación. Utiliza una gema 3 Columna vertebral Sin embargo, la dirección bidireccional la corrige correctamente. Permite que el modelo considere todo el contexto de un orden de texto, convirtiéndolo en un codificador, que puede exceder el LLM basado en el decodificador estándar en las funciones de incrustación. Este diseño de codificación-canal es una elección deliberada, que refleja la misma filosofía de especialización específica de tareas que se ve en otros modelos de Gemma compactos.
Las dos estrategias clave hacen que la embadehemma sea extremadamente eficiente. El primero es el entrenamiento consciente de la cuantización (CAT). En lugar de entrenar al modelo con plena precisión y luego en lugar de comprimirlo, Kat en sí mismo incluye el diseño dependiente de corto en el proceso de entrenamiento. Este método reduce significativamente el tamaño del modelo final y los requisitos de memoria durante la preservación de alta precisión.
Es la segunda estrategia Matrioshak (MRL) Este método, que nombra a la muñeca de nido ruso, entrena el modelo para establecer la información más importante en las dimensiones iniciales de sus vectores de salida. Permite a los desarrolladores usar una incrustación completa de 768 dimensiones para la más alta calidad o cortar en un tamaño pequeño como 256 o 128 para procesamiento rápido y bajos gastos de almacenamiento, lo que les permite usar todos del mismo modelo. El esquema MRL confirma la información más importante si recorta las dimensiones de salida.
Una de las aplicaciones más importantes para la insuficiencia de la incrustación es fortalecer el dispositivo. Generación de recuperación (Trapo), donde funciona con sus hermanos generadores. En este sistema, la incrustación de incrustaciones produce integridades de alta calidad a partir de canteras y documentos, que pueden usarse para encontrar la información más relevante del documento local del usuario mediante una tienda vectorial. Una vez encontrado, este contexto se da a un «generador» compacto, tal modelo de Jemma 3 para crear una respuesta fundamentada.
Este método de dos modelos permite cada componente del dispositivo en servicio creando un dispositivo en el dispositivo que es mejor hacer. Esto permite una búsqueda personal y personalizada sin ningún dato en el correo electrónico, notas y archivos de un usuario. Uno de los ejemplos interesantes que se muestran por el equipo de Google utiliza InScutinghema para hacer una tienda vectorial de dispositivos de las páginas web que han sido inspeccionadas. Los usuarios pueden guardarlo para una búsqueda más próspera en su historial de navegación.
Otras aplicaciones en Incredinghemmer incluyen clasificación. Por ejemplo, puede usarlo para realizar un análisis de sensación en publicaciones de correo electrónico y redes sociales en su navegador.
Incredinghema está disponible a través de centros populares como Abrazo Y el papel. Para los desarrolladores, la incrustación simplifica su uso en los flujos de trabajo existentes directamente en el marco principal de IA, incluidos los transformadores de oraciones, Langchen y Llamindex. El modelo está respaldado por una variedad de equipos de jerarquía locales populares como Olama, LMStudio y Lama.PP, que proporciona actuaciones optimizadas en MLX Apple Silicon. Para la IA basada en la web, puede ejecutarse directamente en el navegador a través de Transformers.js.
Incredinghemma también está diseñado para la personalización. Los desarrolladores pueden hacer que el modelo sea sutil para un dominio o tarea específica para lograr actuaciones más potentes. En un caso, el equipo de cara abrazada El modelo base es una melodía En pautas médicas y datos de recuperación (Miriad). Como resultado, el modelo ha mejorado un rendimiento significativo en la recuperación de pasajes de los documentos médicos científicos. Eventualmente excede los modelos de incrustación de objetos generales que han duplicado su tamaño, mostrando la posibilidad de crear equipos altamente especializados y calificados para industrias específicas.
La incrustación delhemma encaja en la filosofía de una «flota de expertos», donde las tareas complejas se rigen por una compilación de pequeños elementos especialmente diseñados, no por un modelo exclusivo.
En este caso, la incrustación es un bloque de Lego fundamental: piezas de «recuperación». Está diseñado para funcionar, así como otros modelos como el modelo Jemma 30M. Este método compuesto proporciona bajo costo, alta velocidad y mejor precisión para tareas específicas. Proporciona un mayor control y privacidad al permitir que las operaciones clave operen los dispositivos de borde sin enviar datos confidenciales a servicios en la nube de terceros.
Hay una discusión continua sobre si los modelos de idiomas grandes, incluidos más datos y parámetros, han alcanzado el nivel de escalas que han alcanzado una escala. Sin embargo, para lo que vemos, los modelos pequeños apenas comienzan.

