TL;DR
TurboFieldfare informa que ejecuta una configuración de Gemma 4 26B solo texto con aproximadamente 2GB de memoria en tiempo de ejecución, manteniendo en memoria los componentes compartidos y una caché KV de 4K mientras transmite desde SSD los expertos enrutados. Esta es una configuración especializada de baja memoria para Apple Silicon, no un requisito mínimo universal para Gemma 4 26B.
Gemma 4 26B A4B es un modelo de Mezcla de Expertos (MoE) de 25.2B parámetros que activa aproximadamente 3.8B parámetros por token. Google también ofrece acceso hospedado a través de la Gemini API con el ID de modelo gemma-4-26b-a4b-it.
TurboFieldfare reduce la memoria residente manteniendo únicamente el núcleo compartido del modelo, la caché KV y los expertos usados recientemente en memoria. Otros expertos enrutados se cargan desde SSD a medida que se generan los tokens.
El resultado de 2GB informado viene con varias limitaciones:
- Utiliza una caché KV de 4K, no la ventana de contexto completa de 256K del modelo.
- La instalación local del modelo sigue requiriendo aproximadamente 14.3GB de almacenamiento SSD.
- El rendimiento depende de la velocidad del SSD, el comportamiento de la caché y el hardware Apple Silicon.
- El tiempo de ejecución actual admite inferencia solo de texto.
La ruta local está diseñada para uso sin conexión, privacidad en el dispositivo y control del hardware. La API hospedada de Google ofrece entrada de texto e imagen, infraestructura gestionada y escalado más sencillo.
Esta guía explica la configuración de 2GB y luego compara la inferencia local con la API de Google en memoria, velocidad, contexto, privacidad, preparación para producción y coste total.
Gemma 4 26B API vs Local de un vistazo
| Dimensión | API Gemini oficial | Tiempo de ejecución local TurboFieldfare |
|---|---|---|
| Modelo | gemma-4-26b-a4b-it | Gemma 4 26B A4B IT |
| Arquitectura | 25.2B parámetros totales, aproximadamente 3.8B activos | Mismo modelo MoE subyacente, reempaquetado y cuantizado |
| Ventana de contexto | Hasta 256K tokens | Configurable; el resultado de 2GB usa una caché KV de 4K |
| Modalidades de entrada | Texto e imágenes | Solo texto |
| Salida | Texto | Texto |
| Modo de pensamiento | Admitido | Dependiente del tiempo de ejecución |
| Instrucciones del sistema | Admitidas | Admitidas mediante formato de chat local |
| Llamadas a funciones | Admitidas a través de la API | Las llamadas a herramientas deben aprobarse y ejecutarse en el cliente |
| Precio directo actual | Nivel gratuito; actualmente no hay nivel de pago listado para Gemma 4 | Sin tarifa por token del proveedor, pero aplican costos de hardware y operación |
| Tratamiento de datos | El contenido del nivel gratuito puede usarse para mejorar productos de Google | Los prompts pueden permanecer en el dispositivo local |
| Almacenamiento local del modelo | No requerido | Aproximadamente 14.3GB |
| Memoria de ejecución informada | Gestionada por Google | Aproximadamente 2GB para pesos y una caché KV de 4K |
| Infraestructura | Operada por Google | Operada por el desarrollador |
| Preparación para producción | Hospedada, sujeta a cuotas y disponibilidad | Requiere seguridad, monitorización, planificación de capacidad y conmutación por error |
Según la ficha de modelo oficial de Gemma 4, la variante 26B A4B utiliza 128 expertos enrutados, activa ocho expertos enrutados por token e incluye un experto compartido.
Contexto rápido sobre Gemma 4 26B A4B
Gemma 4 (lanzado ~abril de 2026 por Google DeepMind bajo Apache 2.0) incluye modelos densos (E2B, E4B, 12B, 31B) y esta variante de Mezcla de Expertos (MoE): ~25.2B parámetros totales pero solo ~3.8B activos por token (la “A4B”). Enruta cada token a un pequeño subconjunto de expertos (normalmente 8 activos de 128 totales + 1 compartido). Esto ofrece una calidad cercana a 31B con un coste computacional de clase ~4B, con una ventana de contexto de 256K y compatibilidad multimodal (texto + imagen).
Distinción importante: Todos los ~26B parámetros aún deben estar disponibles para el enrutamiento. Los tiempos de ejecución convencionales (Ollama, llama.cpp, LM Studio, vLLM, etc.) cargan todos los pesos cuantizados en RAM/VRAM.
¿Qué significa la afirmación local de 2GB para Gemma 4?
El resultado de 2GB proviene de TurboFieldfare, un tiempo de ejecución independiente en Swift y Metal construido específicamente para Gemma 4 26B A4B en Apple Silicon.
TurboFieldfare no mantiene toda la instalación local del modelo en memoria unificada. Mantiene en memoria un núcleo del modelo compartido de 1.35GB y la caché KV en FP16, y transmite desde el SSD los expertos enrutados requeridos para cada token.
El proyecto informa la siguiente configuración de referencia:
| Medición del tiempo de ejecución local | Valor informado | Interpretación correcta |
|---|---|---|
| Memoria en tiempo de ejecución | Aproximadamente 2GB | Pesos y una caché KV de 4K bajo la configuración publicada |
| Datos del modelo instalado | Aproximadamente 14.3GB | Almacenamiento SSD requerido tras el reempaquetado |
| Transferencia inicial | Aproximadamente 15GB | Datos descargados y reempaquetados durante la configuración |
| Hardware básico validado | 8GB M2 MacBook Air | El equipo completo sigue requiriendo 8GB de memoria |
| Velocidad de decodificación en M2 | 5.1–6.3 tokens por segundo | Medición de la comunidad en un M2 MacBook Air de 8GB |
| Velocidad de decodificación en M5 Pro | 31–35 tokens por segundo | Medición de la comunidad en un M5 Pro de 24GB |
| Entrada admitida | Texto | No se admiten imágenes, audio ni vídeo |
| Interfaz de API local | Servidor experimental compatible con OpenAI | Pensado para acceso por loopback, no para exposición directa a Internet |
Estas son mediciones de tiempo de ejecución de la comunidad, no benchmarks oficiales de Google. La longitud del prompt, la longitud generada, el rendimiento del SSD, el comportamiento de la caché de expertos y la configuración del hardware pueden afectar al resultado.
El resumen exacto es:
TurboFieldfare ejecuta una configuración cuantizada y solo de texto de Gemma 4 26B A4B utilizando aproximadamente 2GB para los pesos y una caché KV de 4K, transmitiendo desde SSD los expertos enrutados.
No debe resumirse como:
Gemma 4 26B solo necesita 2GB de RAM.
Esa afirmación más corta omite el requisito de 14.3GB de almacenamiento, la configuración limitada de contexto, la dependencia del SSD, el método de cuantización y la memoria que aún requiere macOS y otras aplicaciones.
Qué requiere realmente la inferencia local estándar
Google publica los siguientes requisitos aproximados de memoria para la inferencia convencional de Gemma 4 26B A4B:
| Precisión | Memoria aproximada |
|---|---|
| BF16 | 57.7GB |
| SFP8 | 28.8GB |
| Q4_0 | 14.4GB |
Estas cifras incluyen un 20% estimado de sobrecarga de carga del modelo. No incluyen la memoria adicional necesaria para el framework de inferencia o la caché KV.
Consulta la visión general de Gemma 4 y la tabla de memoria de Google para las estimaciones oficiales actuales.
¿Cómo se compara 2GB con los requisitos estándar de memoria?
TurboFieldfare alcanza una cifra de memoria residente mucho menor porque no mantiene el modelo cuantizado completo residente en memoria. Combina:
- Pesos del modelo en cuatro bits.
- Una caché de expertos en memoria acotada.
- Transmisión desde SSD para expertos enrutados.
- Una caché KV de 4K en la configuración publicada.
- Kernels de inferencia personalizados en Swift y Metal.
Esto produce una compensación diferente respecto a un despliegue totalmente residente.
Un modelo Q4 totalmente residente requiere mucha más memoria pero evita cargar repetidamente datos de expertos desde el almacenamiento. TurboFieldfare reduce la presión de memoria pero hace que el rendimiento dependa más del ancho de banda del SSD, los aciertos de caché, la longitud de contexto y la generación de hardware.
Funciona porque el modelo es MoE. Los modelos densos no pueden hacer esto de forma útil: cada peso participa en cada pasada hacia delante. Este es un truco de ingeniería que aprovecha la arquitectura, no un cambio fundamental en el tamaño del modelo. El rendimiento es utilizable para trabajo por lotes/asíncrono en Macs con poca RAM, pero no para chat en tiempo real en el hardware más lento. Actualmente es solo para Mac/Apple Silicon y específico del modelo.
¿Puede la configuración de 2GB usar la ventana de contexto completa de 256K?
El modelo Gemma 4 26B A4B oficial admite una ventana de contexto de hasta 256K tokens. La configuración de TurboFieldfare de aproximadamente 2GB, sin embargo, utiliza una caché KV de 4K.
Estas son mediciones separadas:
- Capacidad oficial del modelo: Hasta 256K tokens.
- Resultado local de memoria publicado: Caché KV de 4K.
- Contexto local práctico: Determinado por la memoria disponible, los ajustes del runtime, la longitud del prompt y la latencia aceptable.
La memoria de la caché KV crece a medida que el prompt y la respuesta generada se alargan. Ampliar la configuración local hacia 32K, 128K o 256K tokens incrementaría el uso de memoria y también podría afectar el tiempo de precarga (prefill) y la velocidad de generación.
Los equipos que evalúen análisis de documentos largos deberían probar su contexto objetivo real en lugar de asumir que el resultado de 2GB se aplica a la ventana completa del modelo.
¿Qué tan rápido es Gemma 4 26B en Apple Silicon?
TurboFieldfare informa dos rangos de velocidad de decodificación de referencia:
- 8GB M2 MacBook Air: 5.1–6.3 tokens por segundo.
- 24GB M5 Pro: 31–35 tokens por segundo.
Estos resultados demuestran cuánto influye el hardware en la inferencia local. No deben tratarse como garantías de rendimiento universales.
Estimar la salida mensual máxima
Máximos tokens de salida mensuales = tokens de decodificación por segundo × 60 × 60 × 24 × 30
Usando las velocidades de decodificación informadas:
| Resultado de hardware | Salida teórica 24/7 | Salida al 50% de utilización |
|---|---|---|
| M2 a 5.1 tok/s | 13.2M tokens/mes | 6.6M tokens/mes |
| M2 a 6.3 tok/s | 16.3M tokens/mes | 8.2M tokens/mes |
| M5 Pro a 31 tok/s | 80.4M tokens/mes | 40.2M tokens/mes |
| M5 Pro a 35 tok/s | 90.7M tokens/mes | 45.4M tokens/mes |
Estas son estimaciones solo de decodificación. Las aplicaciones reales también invierten tiempo en:
- Precarga del prompt.
- Encolado de solicitudes.
- Carga del modelo y reinicios.
- Respuestas fallidas o rechazadas.
- Actividad del sistema operativo.
- Monitorización y mantenimiento.
- Paradas planificadas y no planificadas.
Por ejemplo, producir cuatro millones de tokens de salida a 5.1 tokens por segundo requiere aproximadamente 9.1 días de decodificación ininterrumpida. Producir 20 millones de tokens de salida requeriría aproximadamente 45.4 días, lo que hace que esa carga de trabajo sea imposible para una máquina M2 dentro de un mes de 30 días.
Un modelo de costes local realista debe, por tanto, tener en cuenta la capacidad de throughput además del coste fijo del hardware.
¿Existe una API oficial para Gemma 4 26B?
Sí.
Google ofrece acceso hospedado a Gemma 4 26B a través de la Gemini API. El ID de modelo oficial es:
gemma-4-26b-a4b-it
El endpoint hospedado admite generación de texto, comprensión de imágenes, instrucciones del sistema, pensamiento configurable, llamadas a funciones y conversaciones multi-turno. Esto lo convierte en la forma más rápida de evaluar el modelo sin descargar pesos ni operar un servidor de inferencia.
Google proporciona los ejemplos de implementación más recientes en su documentación de Gemma en la Gemini API.
Llamar a Gemma 4 26B con Python
Instala el SDK Gen AI de Google:
pip install -U google-genai
Configura tu clave de la Gemini API en el entorno y envía una solicitud:
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemma-4-26b-a4b-it",
contents="Explain mixture-of-experts routing in simple terms.",
)
print(response.text)
Este ejemplo confirma el acceso básico a la API. No valida cuotas de producción, latencia, rendimiento de contexto largo ni requisitos de tratamiento de datos para tu aplicación.
¿Cuánto cuesta la API de Gemma 4 26B?
Actualmente, Google lista Gemma 4 como gratuito en entrada, salida y caché de contexto en el nivel gratuito de la Gemini API. Actualmente no se lista un nivel de pago para Gemma 4.
Aviso de datos del nivel gratuito: Google indica que el contenido enviado a través del nivel gratuito puede usarse para mejorar sus productos. No envíes información confidencial, regulada o de clientes hasta que tu equipo revise los términos aplicables de uso y retención de datos.
Nota sobre precios: El acceso del nivel gratuito no debe tratarse como un compromiso de precios permanente en producción. La disponibilidad, las cuotas, los términos de datos y las opciones de nivel de pago pueden cambiar.
Consulta la página oficial de precios de la Gemini API antes de tomar una decisión de producción.
La estructura de precios actual crea una comparación inusual:
- La API oficial puede no tener coste directo por token dentro de los límites del nivel gratuito.
- La inferencia local no tiene factura por token del proveedor, pero sigue consumiendo hardware, electricidad, almacenamiento, mantenimiento y tiempo de ingeniería.
- Proveedores hospedados de terceros pueden ofrecer capacidad, precios, políticas de retención y términos comerciales diferentes.
Para Gemma 4 26B, usa la documentación oficial de Gemma en la Gemini API de Google y verifica los límites actuales en la página de precios de la Gemini API.
CometAPI actualmente no lista Gemma 4 26B como un modelo disponible. Los equipos que también quieran evaluar alternativas hospedadas de Gemini pueden revisar modelos listados actualmente como Gemini 3.6 Flash, Gemini 3 Flash y otras opciones en el catálogo de modelos de Google en CometAPI.
¿Gemma 4 local es más barato que la API?
Bajo los precios actuales, la API oficial de Gemini puede ser más barata en términos financieros directos porque Gemma 4 está disponible gratis dentro del nivel gratuito.
Sin embargo, el precio directo por token es solo una parte de la decisión.
Ejemplo de coste de hardware local
Supongamos que un equipo compra una máquina Apple Silicon de $1,200 y la amortiza a 24 meses.
Amortización mensual de hardware $1,200 ÷ 24 meses = $50 por mes
Si la máquina genera con éxito cuatro millones de tokens de salida por mes:
Amortización de hardware por 1M de tokens de salida $50 ÷ 4 = $12.50 por 1M de tokens de salida
La aritmética es correcta, pero no es una estimación completa del coste total. Excluye:
- Electricidad.
- Desgaste del SSD y reemplazo.
- Puesta en marcha y tiempo de ingeniería.
- Monitorización y mantenimiento.
- Generaciones fallidas y reintentos.
- Revisión humana.
- Capacidad de respaldo.
- Tiempo de inactividad y conmutación por error.
- El coste de oportunidad de usar la máquina para inferencia.
También asume que el hardware puede producir el volumen de tokens objetivo dentro de la ventana operativa disponible.
Comparar coste por tarea aceptada
Coste local por tarea aceptada = amortización de hardware
- electricidad
- almacenamiento y mantenimiento
- tiempo de ingeniería
- generaciones fallidas y reintentos
- revisión humana ÷ tareas aceptadas
Para un servicio hospedado de pago:
Coste hospedado por tarea aceptada = cargos por tokens de entrada
- cargos por tokens de salida
- cargos por caché, herramientas o solicitudes
- reintentos
- revisión humana ÷ tareas aceptadas
El precio por token más bajo anunciado no siempre produce el menor coste de aplicación. Una ruta con respuestas más lentas, salida estructurada no válida o una alta tasa de reintentos puede costar más por resultado aceptado.
¿Puede usarse en producción el servidor local compatible con OpenAI?
TurboFieldfare incluye un servidor experimental compatible con OpenAI que escucha en:
http://127.0.0.1:8080/v1
Admite Chat Completions, streaming, declaraciones de funciones y reutilización de prefijos de prompt. Sin embargo, el proyecto indica que el servidor debe permanecer en la interfaz de loopback porque no proporciona autenticación remota ni TLS.
Debe tratarse por defecto como un endpoint local de desarrollo.
Un despliegue de producción necesitaría una capa de servicio adicional con:
- Autenticación y autorización.
- TLS para tráfico que salga del host.
- Límites de tamaño de solicitud y salida.
- Controles de cola y concurrencia.
- Supervisión de procesos y reinicios automáticos.
- Comprobaciones de disponibilidad del modelo.
- Monitorización de presión de memoria.
- Métricas de SSD y de caché de expertos.
- Monitorización de latencia y throughput.
- Registro respetuoso con la privacidad.
- Gestión de sobrecargas.
- Una ruta de respaldo en caso de fallo local.
El servidor local puede devolver llamadas a herramientas generadas por el modelo, pero la aplicación debe inspeccionar, autorizar y ejecutar cada acción. No se debe permitir que el modelo ejecute herramientas directamente.
Para Gemma 4 26B, la Gemini API de Google es la ruta hospedada oficial. Si la aplicación también usa otros modelos hospedados, la guía de inicio rápido de CometAPI muestra cómo conectar modelos admitidos mediante una interfaz compatible con OpenAI. Esto puede proporcionar un respaldo hospedado adicional, pero no debe presentarse como una ruta de CometAPI para Gemma 4 a menos que el modelo aparezca en el catálogo en vivo.
Decisión de despliegue de Gemma 4 26B
API (hospedada, Gemini API, otros)
- Precios alrededor de $0.07 / 1M tokens de entrada y $0.30–0.34 / 1M tokens de salida (varía por proveedor; algunos ligeramente más altos).
- Cero costes de hardware o configuración, alta velocidad/throughput, escalado fácil, multimodal y con todas las funciones disponibles.
-
Coste por token continuo, los datos salen de tu máquina, límites de tasa/cuotas, posible variación de latencia.
Local estándar
- Coste único de hardware + electricidad; privacidad y capacidad sin conexión.
- Necesita suficiente RAM/VRAM (típicamente 18–32+ GB utilizables) o aceptar velocidades bajas/intercambio.
-
Control total, sin tarifas por token tras la configuración, pero tú gestionas cuantización, servicio, actualizaciones y hardware.
Local estilo TurboFieldfare
- Ejecuta la capacidad completa del 26B MoE en máquinas que de otro modo no podrían (incluso Macs de 8 GB).
-
Privacidad/sin conexión + coste marginal casi nulo, pero más lento que una GPU bien aprovisionada o una buena API, solo Mac hoy, centrado en texto en la implementación actual y requiere un runtime especializado.
Usa una ruta híbrida cuando:
- Las cargas de trabajo privadas deban permanecer locales.
- El tráfico público o de ráfagas requiera capacidad hospedada.
- La aplicación necesite conmutación por error.
- Diferentes tareas se beneficien de distintos modelos.
- Quieras comparar rutas mediante una API coherente.
Un camino de decisión simple es:
Must the workload remain offline or on-device?
├── Yes → Test the local Apple Silicon runtime
└── No
├── Need image input or fast setup? → Start with the Gemini API
├── Need paid capacity or an SLA? → Evaluate hosted providers
└── Need privacy plus burst capacity? → Use a hybrid route
API oficial vs local vs hosting de terceros
| Requisito | API Gemini oficial | TurboFieldfare local | API hospedada de terceros |
|---|---|---|---|
| Configuración inicial rápida | Fuerte | Moderada | Fuerte |
| Entrada de texto | Sí | Sí | Dependiente del proveedor |
| Entrada de imagen | Sí | No | Dependiente del proveedor |
| Operación sin conexión | No | Sí | No |
| Los datos permanecen en el dispositivo | No | Sí | No |
| Precio directo por token actual | Nivel gratuito | Sin tarifa por token del proveedor | Dependiente del proveedor |
| Nivel de pago de producción | No listado actualmente para Gemma 4 | Autogestionado | Dependiente del proveedor |
| Tráfico en ráfagas | Sujeto a cuota del proveedor | Limitado a la capacidad local | Usualmente más fuerte |
| Contexto completo de 256K | Compatible por el modelo | No mostrado en la configuración de 2GB | Dependiente del proveedor |
| Autenticación y TLS | Gestionados | Deben añadirse | Usualmente gestionados |
| Propiedad de la infraestructura | Desarrollador | Proveedor | |
| Acuerdo de servicio | No implícito por acceso al nivel gratuito | Autogestionado | Dependiente del proveedor |
| Control del runtime | Limitado | Alto | Dependiente del proveedor |
Antes de seleccionar una ruta de terceros, verifica que el modelo exacto esté disponible actualmente en lugar de asumir compatibilidad. Gemma 4 26B debe accederse a través de la Gemini API oficial de Google, a menos que otro proveedor liste explícitamente el mismo ID de modelo. Para otros modelos hospedados de Gemini, el catálogo de modelos de Google en CometAPI muestra las opciones actualmente admitidas, mientras que la documentación de CometAPI explica cómo llamar a esos modelos admitidos mediante un endpoint compatible con OpenAI.
Un despliegue híbrido puede ser el diseño más práctico a largo plazo: inferencia local para tareas de texto privadas o sin conexión, un endpoint oficial para evaluación multimodal rápida y una ruta hospedada para capacidad de producción o conmutación por error.
Cómo evaluar Gemma 4 26B: API vs local
Ejecuta la misma carga de trabajo en cada ruta de despliegue.
Un conjunto de evaluación práctico podría incluir:
- Diez tareas de codificación, extracción o transformación.
- Cinco tareas de razonamiento con respuestas objetivas.
- Cinco tareas de contexto largo con diferentes longitudes de contexto.
- Cinco tareas de comprensión de imágenes para rutas que admitan imágenes.
- Cinco tareas de llamadas a funciones con autorización del lado del cliente.
- Cinco tareas de salida estructurada con validación estricta de JSON.
Registra:
- Tiempo hasta el primer token.
- Tiempo total de finalización.
- Tiempo de precarga del prompt.
- Tokens de decodificación por segundo.
- Pico de memoria local.
- Bytes leídos del SSD.
- Tiempo de cola.
- Comportamiento de concurrencia.
- Longitud de contexto.
- Validez de la salida estructurada.
- Validez de llamadas a herramientas.
- Tasa de tareas aceptadas.
- Tiempo de corrección humana.
- Tasa de fallos y reintentos.
- Coste operativo local.
- Cargos por tokens y solicitudes hospedadas.
Usa las mismas plantillas de prompt, límites de salida, temperaturas y reglas de aceptación.
No compares una solicitud de texto local corta con una solicitud hospedada multimodal larga y presentes el resultado como un benchmark directo del modelo.
Preguntas frecuentes
¿Existe una API oficial para Gemma 4 26B?
Sí. Google ofrece Gemma 4 26B a través de la Gemini API con el ID de modelo gemma-4-26b-a4b-it. Admite generación de texto, entrada de imágenes, instrucciones del sistema, pensamiento configurable, llamadas a funciones y conversaciones multi-turno.
¿La API de Gemma 4 26B es gratuita?
Actualmente, Google lista la entrada, salida y caché de contexto de Gemma 4 como gratuitas en el nivel gratuito de la Gemini API. No hay un nivel de pago listado actualmente para Gemma 4. El contenido del nivel gratuito puede usarse para mejorar productos de Google, así que revisa los términos aplicables antes de enviar información sensible.
¿Puede Gemma 4 26B realmente ejecutarse con 2GB de RAM?
TurboFieldfare informa aproximadamente 2GB para los pesos y una caché KV de 4K. La configuración completa sigue requiriendo un Mac Apple Silicon de 8GB, aproximadamente 14.3GB de almacenamiento y transmisión de expertos desde SSD.
¿La configuración de 2GB admite contexto de 256K?
El modelo admite hasta 256K tokens, pero el resultado local publicado de 2GB utiliza una caché KV de 4K. Los contextos locales más largos requieren memoria adicional y pruebas de rendimiento.
¿Gemma 4 local es más barato que una API hospedada?
Puede serlo para cargas de trabajo de texto sostenidas en hardware que ya posees, pero el resultado depende del throughput, la utilización, la electricidad, el mantenimiento, los reintentos y la calidad de la salida. Dado que la API oficial es actualmente gratuita dentro de los límites del nivel gratuito, el despliegue local no es automáticamente la opción menos costosa.
Recomendación final
La configuración de aproximadamente 2GB de TurboFieldfare es una técnica de despliegue especializada para Apple Silicon, no un requisito de memoria universal de Gemma 4 26B. Funciona limitando la caché KV y transmitiendo desde SSD los expertos enrutados en lugar de mantener residente en memoria el modelo cuantizado completo.
Para la mayoría de los usuarios, las opciones prácticas siguen siendo:
- Usar la API por comodidad y velocidad si el coste y la privacidad lo permiten.
- Ejecutar versiones locales cuantizadas estándar si tienes 24 GB+ de memoria.
- Usar TurboFieldfare (u otros motores similares futuros) si específicamente quieres la calidad de 26B MoE en hardware Apple Silicon con limitaciones.
Para cargas de trabajo de producción, compara ambas rutas utilizando los mismos prompts, longitudes de contexto, límites de salida y comprobaciones de aceptación. La decisión final debe basarse en calidad, latencia, privacidad, throughput alcanzable y coste total por tarea aceptada, no solo en el titular de 2GB.
