- No existe una versión oficial de Gemma 4 hasta agosto de 2026. La familia más reciente de Gemma incluye Gemma 2 (2B, 9B y 27B) y la versión original Gemma (2B y 7B).
- Ejecute Gemma 2 en Ollama con
ollama run gemma2:27b,ollama run gemma2:9b, oollama run gemma2:2bsegún la memoria VRAM de su GPU. - El modelo de 27B requiere 16 GB o más de VRAM para precisión completa, mientras que el de 9B funciona cómodamente en GPUs de 8 GB y el de 2B en GPUs de 4 GB.
- Todos los modelos Gemma disponibles en Ollama admiten mensajes del sistema (system prompts), modo JSON y conversaciones multiturno de forma nativa.
Al buscar «Gemma 4 en Ollama», probablemente esté buscando los modelos Gemma más recientes disponibles a través de Ollama. Hasta agosto de 2026, Google DeepMind no ha lanzado oficialmente una versión Gemma 4. Los modelos más recientes son la serie Gemma 2 (variantes de 2B, 9B y 27B parámetros) y la serie original Gemma (2B y 7B). Ambas familias se ejecutan de forma nativa en Ollama con un único comando.
Modelos Gemma disponibles en Ollama
Ollama admite seis variantes de modelos Gemma distribuidas en dos generaciones. Todos utilizan la licencia de pesos abiertos de Google y pueden ejecutarse completamente sin conexión tras su descarga.
| Nombre del modelo | Parámetros | Comando Ollama | VRAM mínima (Q4) | Longitud del contexto |
|---|---|---|---|---|
| Gemma 2 27B | 27 000 millones | ollama run gemma2:27b | 16 GB | 8192 tokens |
| Gemma 2 9B | 9000 millones | ollama run gemma2:9b | 6 GB | 8192 tokens |
| Gemma 2 2B | 2000 millones | ollama run gemma2:2b | 2 GB | 8192 tokens |
| Gemma 7B | 7000 millones | ollama run gemma:7b | 5 GB | 8192 tokens |
| Gemma 2B | 2000 millones | ollama run gemma:2b | 2 GB | 8192 tokens |
| Gemma 2B Instruct | 2000 millones | ollama run gemma:2b-instruct | 2 GB | 8192 tokens |
La serie Gemma 2 ofrece un mejor rendimiento por parámetro que los modelos originales Gemma. Para la mayoría de los usuarios, gemma2:9b ofrece el mejor equilibrio entre calidad y requisitos de hardware. Puede comparar el rendimiento de estos modelos frente a alternativas en la Clasificación de modelos de lenguaje grande (LLM).
Instalación y ejecución de modelos Gemma
Primero, asegúrese de tener instalado Ollama en su sistema. Si aún no lo ha instalado, siga las Guía de instalación de Ollama instrucciones correspondientes a su plataforma. Una vez instalado, ejecutar cualquier modelo Gemma requiere un único comando que descarga e inicia automáticamente el modelo.
macOS y Linux
Abra la Terminal y ejecute:
ollama run gemma2:9bEsto descarga el modelo Gemma 2 de 9 mil millones de parámetros (aproximadamente 5,5 GB para la versión cuantizada a 4 bits) e inicia una sesión interactiva de chat. Para usar otra variante de tamaño:
# Para 27B (máxima calidad, requiere 16 GB o más de VRAM)
ollama run gemma2:27b
# Para 2B (más rápido, funciona en GPUs de 4 GB)
ollama run gemma2:2b
# Gemma original de 7B
ollama run gemma:7bWindows
Abra el símbolo del sistema o PowerShell y use los mismos comandos:
ollama run gemma2:9bLos usuarios de Windows con GPUs NVIDIA deben asegurarse de tener instalados los controladores más recientes para obtener un rendimiento óptimo. El soporte para GPUs AMD mediante ROCm está disponible en Linux, pero sigue siendo experimental en Windows hasta agosto de 2026.
Ejecución como servidor API
Para ejecutar Gemma como un servicio API persistente, en lugar de una sesión interactiva de chat:
# Inicie el servidor Ollama (se inicia automáticamente en macOS/Linux; manual en Windows)
ollama serve
# En otra terminal, descargue el modelo sin iniciar la sesión de chat
ollama pull gemma2:9b
# Realice solicitudes API
curl http://localhost:11434/api/generate -d '{
"model": "gemma2:9b",
"prompt": "Explica el entrelazamiento cuántico en términos sencillos.",
"stream": false
}'Este método funciona de forma idéntica en todas las plataformas e integra fácilmente con bibliotecas compatibles con OpenAI al configurarlas para apuntar a http://localhost:11434.
Requisitos del sistema y rendimiento
Los modelos Gemma se ejecutan eficientemente en hardware de consumo gracias a las optimizaciones y técnicas de cuantización implementadas por Ollama. Los requisitos de VRAM varían considerablemente según el tamaño del modelo y el nivel de cuantización.
| Modelo | Precisión completa (FP16) | Cuantización de 4 bits (Q4) | Tokens por segundo (RTX 4090) |
|---|---|---|---|
| Gemma 2 27B | 54 GB | 16 GB | 22-28 t/s |
| Gemma 2 9B | 18 GB | 6 GB | 45-60 t/s |
| Gemma 2 2B | 4 GB | 2 GB | 120-150 t/s |
| Gemma 7B | 14 GB | 5 GB | 40-55 t/s |
De forma predeterminada, Ollama descarga versiones cuantizadas de 4 bits que reducen el uso de memoria en un 75 % con una pérdida mínima de calidad. Calcule los requisitos exactos de VRAM para su hardware mediante la Calculadora de VRAMcalculadora de memoria de Ollama Requisitos de VRAM por modelo.
GPU recomendadas
- RTX 4060 Ti 16 GB / RTX 3090: Capaz de ejecutar Gemma 2 27B con cuantización Q4 y ventanas de contexto completas.
- RTX 4070 / RX 7800 XT: Ideal para Gemma 2 9B, con margen suficiente para conversaciones largas.
- RTX 4060 / RTX 3060: Maneja cómodamente Gemma 2 2B y Gemma 7B.
- GPU integradas (Apple Silicon, Intel Arc): Gemma 2 2B funciona bien en Macs con chips M1/M2 y en GPU recientes Intel Arc con 16 GB o más de memoria unificada.
Para recomendaciones detalladas de GPU y comparativas de rendimiento, consulte la mejores GPUs para ejecutar LLMs localmente guía.
Elección entre los modelos Gemma
La elección del modelo Gemma adecuado depende de su caso de uso, hardware y requisitos de calidad. Los modelos Gemma 2 superan sistemáticamente a sus predecesores en tareas de razonamiento, seguimiento de instrucciones y programación.
Gemma 2 27B compite en calidad con modelos mucho más grandes, pero requiere una cantidad sustancial de VRAM. Úselo para tareas complejas de razonamiento, redacción técnica o generación de código, donde la precisión es más importante que la velocidad. En muchas pruebas comparativas, su rendimiento es comparable al de modelos de 70B de otras familias.
Gemma 2 9B es el punto óptimo para la mayoría de los desarrolladores. Se ejecuta en GPU de gama media, ofrece un rendimiento sólido en tareas generales y genera respuestas lo suficientemente rápidas para aplicaciones interactivas. Este es el modelo con el que debería comenzar, a menos que tenga restricciones específicas.
Gemma 2 2B destaca en escenarios de alto rendimiento: procesamiento por lotes, despliegue en el borde (edge) o ejecución simultánea de múltiples agentes. Aunque es menos capaz que las variantes más grandes, resulta sorprendentemente competente para extracción de datos estructurados, clasificación y diálogos sencillos.
El original Gemma 7B y Gemma 2B siguen disponibles, pero no ofrecen ventajas frente a Gemma 2 salvo un ligero ahorro de VRAM a tamaños equivalentes. Para nuevos proyectos, se recomienda usar Gemma 2 como opción predeterminada.
Para más opciones, explore el catálogo completo de Lista de modelos de Ollama modelos de Ollama mejores modelos locales para Ollama o vea las
Configuración y optimización de modelos
Ollama expone varios parámetros para ajustar el comportamiento y el rendimiento de Gemma. Cree un Modelfile archivo Modelfile para personalizar la configuración:
FROM gemma2:9b
# Establecer la temperatura (0,0 = determinista, 1,0 = creativo)
PARAMETER temperature 0.7
# Limitar la longitud de la respuesta
PARAMETER num_predict 512
# Establecer el mensaje del sistema
SYSTEM Usted es un asistente técnico para documentación. Proporcione respuestas precisas y concisas, con ejemplos de código.Cargue su configuración personalizada:
ollama create my-gemma -f ./Modelfile
ollama run my-gemmaLos parámetros clave incluyen:
temperature: Controla el grado de aleatoriedad (0,1-0,3 para tareas factuales; 0,7-0,9 para trabajos creativos)top_p: Umbral de muestreo por núcleo (valor predeterminado: 0,9; valores más bajos producen resultados más enfocados)num_predict: Número máximo de tokens a generar (-1 para ilimitado; típicamente entre 512 y 2048)num_ctx: Tamaño de la ventana de contexto (entre 2048 y 8192; valores más altos consumen más VRAM)
Para comparar los costos de ejecutar Gemma localmente frente al uso de APIs alojadas, utilice la calculadora de autohospedaje frente a API para encontrar su punto de equilibrio.
Integración con herramientas de desarrollo
Los modelos Gemma en Ollama funcionan con bibliotecas estándar de LLM al apuntarlas al extremo (endpoint) local de Ollama. A continuación se muestra cómo integrarlos con frameworks populares:
Python (LangChain)
from langchain_community.llms import Ollama
llm = Ollama(model="gemma2:9b")
response = llm.invoke("Escriba una función en Python para calcular números de Fibonacci.")
print(response)JavaScript (LangChain.js)
import { Ollama } from "@langchain/community/llms/ollama";
const llm = new Ollama({
baseUrl: "http://localhost:11434",
model: "gemma2:9b",
});
const response = await llm.invoke("Explique async/await en JavaScript.");
console.log(response);Clientes compatibles con OpenAI
Muchas bibliotecas admiten el formato de API de OpenAI. Configúrelas para usar Ollama:
import openai
client = openai.OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # obligatorio, pero ignorado
)
response = client.chat.completions.create(
model="gemma2:9b",
messages=[{"role": "user", "content": "¡Hola!"}]
)
print(response.choices[0].message.content)Resolución de problemas comunes
Las descargas de modelos fallan o agotan el tiempo de espera: Los modelos Gemma oscilan entre 1,5 GB (2B cuantizado) y 54 GB (27B en precisión completa). En conexiones lentas, use ollama pull gemma2:9b en una terminal dedicada para supervisar el progreso de la descarga. Las descargas parciales se reanudan automáticamente si se interrumpen.
Errores de memoria insuficiente (out of memory): Si Ollama se bloquea o rechaza cargar un modelo, es probable que su GPU no disponga de suficiente VRAM. Opte por un modelo más pequeño (por ejemplo,gemma2:2b en lugar de 9b), o reduzca la ventana de contexto mediante PARÁMETRO num_ctx 2048 en un archivo Modelfile personalizado. Consulte los requisitos reales con la Calculadora de VRAM.
Generación lenta en Apple Silicon: Asegúrese de que la aceleración Metal esté habilitada. Ollama utiliza Metal de forma predeterminada en macOS, pero versiones antiguas de Ollama podrían recurrir a la CPU. Actualice a la versión más reciente mediante brew upgrade ollama o reinstálela desde el sitio web de Ollama.
La API devuelve respuestas vacías: Verifique que ollama serve se esté ejecutando y sea accesible en http://localhost:11434. Pruebe con curl http://localhost:11434/api/tags para enumerar los modelos disponibles. Si el modelo no aparece, ejecute ollama pull gemma2:9b primero.
GPU de Windows no detectada: Ollama requiere GPU NVIDIA con soporte para CUDA o GPU AMD con ROCm (solo en Linux). Actualice los controladores de su GPU mediante el Administrador de dispositivos o desde el sitio web del fabricante. Verifique la detección con nvidia-smi (NVIDIA) o rocm-smi (AMD).
Preguntas frecuentes
¿Existe un modelo Gemma 4 disponible?
No. Hasta agosto de 2026, Google DeepMind ha lanzado Gemma (2B, 7B) y Gemma 2 (2B, 9B, 27B), pero no existe ningún modelo Gemma 4. El «2» en Gemma 2 hace referencia a la segunda generación de la familia de modelos, no al número de parámetros. Cuando busque «Gemma 4», probablemente desee los modelos más recientes: Gemma 2 27B para máxima calidad, Gemma 2 9B para un equilibrio entre rendimiento y eficiencia, o Gemma 2 2B para entornos con recursos limitados.
¿Cuál es la diferencia entre Gemma y Gemma 2?
Gemma 2 es una arquitectura de segunda generación con mejoras significativas en razonamiento, seguimiento de instrucciones y capacidades multilingües. Los modelos Gemma 2 logran una calidad comparable a la de modelos de primera generación más grandes, mientras consumen menos memoria y generan respuestas más rápido. Por ejemplo, Gemma 2 9B iguala o supera al original Gemma 7B en la mayoría de los benchmarks. A menos que tenga una razón específica para usar la serie original Gemma, comience con Gemma 2.
¿Puedo usar los modelos Gemma con fines comerciales?
Sí. Los modelos Gemma se distribuyen bajo la licencia de pesos abiertos de Google, que permite su uso comercial, modificación y redistribución. A diferencia de algunos modelos abiertos cuyas licencias están restringidas al ámbito investigador, puede implementar Gemma en aplicaciones de producción, productos SaaS o sistemas empresariales sin necesidad de licencias adicionales. La única restricción es que no puede utilizar el nombre «Gemma» para sugerir que Google respalda su producto.
¿Cómo se compara Gemma 2 9B con Llama 3 8B en Ollama?
Ambos modelos funcionan bien en hardware similar (6-8 GB de VRAM), pero tienen fortalezas distintas. Gemma 2 9B suele desempeñarse mejor en tareas que requieren seguimiento de instrucciones y generación de salidas estructuradas, lo que lo hace preferible para el uso de herramientas, generación de JSON y aplicaciones basadas en agentes. Llama 3 8B tiende a producir respuestas conversacionales más naturales y maneja ligeramente mejor la escritura creativa. En tareas técnicas y de programación, la mayoría de los desarrolladores consideran a Gemma 2 9B más fiable. Evalúe ambos modelos en su caso de uso específico, ya que la percepción de calidad varía según la aplicación.
¿Debo pagar para ejecutar modelos Gemma en Ollama?
No. Ollama es software gratuito y de código abierto, y los modelos Gemma se publican con sus pesos abiertos sin costo alguno. Solo pagará por el hardware necesario (GPU, RAM, electricidad) para ejecutarlos. Para comparar costos de uso, la Calculadora de costos de API muestra cuándo alojar localmente resulta más económico que utilizar APIs en la nube. La mayoría de los desarrolladores que realizan más de 10 000 consultas mensuales ahorran dinero al autoalojar Gemma en lugar de usar APIs comerciales.
¿Pueden ejecutarse los modelos Gemma sin GPU?
Sí, pero muy lentamente. Ollama recurre a la ejecución en CPU cuando no detecta una GPU compatible. Gemma 2 2B genera entre 3 y 8 tokens por segundo en CPUs modernas (Ryzen 5000+ o Intel de 12.ª generación en adelante), lo cual es aceptable para consultas ocasionales, pero frustrante para chats interactivos. Gemma 2 9B y modelos mayores generan menos de 2 tokens por segundo en CPU, lo que los vuelve poco prácticos. Para un uso serio LLM local , invierta en una GPU: incluso una RTX 3060 económica o una RTX 2080 usada mejora drásticamente la experiencia. Consulte las recomendaciones de hardware en la Guía completa de Ollama.

