Monday, 17 August 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

Ollama Gemma 4 : les modèles Gemma actuels et comment les exécuter

En bref :

  • Il n’existe aucune version officielle « Gemma 4 » à ce jour (août 2026). La dernière famille Gemma comprend Gemma 2 (2 milliards, 9 milliards et 27 milliards de paramètres) ainsi que la version initiale Gemma (2 milliards et 7 milliards de paramètres).
  • Exécutez Gemma 2 sur Ollama avec la commande ollama run gemma2:27b, ollama run gemma2:9b, ou ollama run gemma2:2b selon la mémoire GPU dont vous disposez.
  • Le modèle 27B nécessite au moins 16 Go de VRAM en précision complète, tandis que le modèle 9B fonctionne confortablement sur des GPU disposant de 8 Go de VRAM, et le modèle 2B sur des GPU de 4 Go.
  • Tous les modèles Gemma disponibles sur Ollama prennent nativement en charge les invites système, le mode JSON et les conversations multi-tours.

Lorsque vous recherchez « Ollama Gemma 4 », vous cherchez probablement les modèles Gemma les plus récents disponibles via Ollama. À ce jour (août 2026), Google DeepMind n’a publié aucune version officielle « Gemma 4 ». Les modèles les plus récents sont la famille Gemma 2 (variantes à 2, 9 et 27 milliards de paramètres) et la série originale Gemma (2 et 7 milliards de paramètres). Ces deux familles s’exécutent nativement sur Ollama à l’aide d’une seule commande.

Modèles Gemma disponibles sur Ollama

Ollama prend en charge six variantes de modèles Gemma réparties sur deux générations. Chacun utilise la licence open-weight de Google et peut s’exécuter entièrement hors ligne une fois téléchargé.

Nom du modèleParamètresCommande OllamaVRAM minimale (Q4)Longueur de contexte
Gemma 2 27B27 milliardsollama run gemma2:27b16 Go8 192 jetons
Gemma 2 9B9 milliardsollama run gemma2:9b6 Go8 192 jetons
Gemma 2 (2 milliards)2 milliardsollama run gemma2:2b2 Go8 192 jetons
Gemma 7B7 milliardsollama run gemma:7b5 Go8 192 jetons
Gemma 2B2 milliardsollama run gemma:2b2 Go8 192 jetons
Gemma 2B Instruct2 milliardsollama run gemma:2b-instruct2 Go8 192 jetons

La série Gemma 2 offre de meilleures performances par paramètre que les modèles Gemma d’origine. Pour la plupart des utilisateurs, gemma2:9b constitue le meilleur compromis entre qualité et exigences matérielles. Vous pouvez comparer ces modèles à d’autres solutions dans le Classement des grands modèles linguistiques (LLM).

Installation et exécution des modèles Gemma

Commencez par vérifier que Ollama est bien installé sur votre système. Si ce n’est pas encore fait, suivez les Guide d’installation d’Ollama instructions d’installation adaptées à votre plateforme. Une fois installé, l’exécution de n’importe quel modèle Gemma ne nécessite qu’une seule commande qui télécharge et lance automatiquement le modèle.

macOS et Linux

Ouvrez le Terminal et exécutez la commande suivante :

ollama run gemma2:9b

Cette commande télécharge le modèle Gemma 2 à 9 milliards de paramètres (environ 5,5 Go pour la version quantifiée en 4 bits) et démarre une session interactive de discussion. Pour utiliser une autre taille de modèle :

# Pour le modèle 27B (qualité maximale, nécessite 16 Go de VRAM ou plus)
ollama run gemma2:27b

# Pour le modèle 2B (le plus rapide, fonctionne sur des GPU de 4 Go)
ollama run gemma2:2b

# Gemma original 7B
ollama run gemma:7b

Windows

Ouvrez l’invite de commandes ou PowerShell et utilisez les mêmes commandes :

ollama run gemma2:9b

Les utilisateurs Windows équipés de GPU NVIDIA doivent veiller à disposer des pilotes GPU les plus récents pour obtenir des performances optimales. Le support des GPU AMD via ROCm fonctionne sous Linux, mais reste expérimental sous Windows à ce jour (août 2026).

Exécution en tant que serveur API

Pour exécuter Gemma comme un service API persistant plutôt que comme une session interactive de discussion :

# Démarrer le serveur Ollama (démarrage automatique sous macOS/Linux, manuel sous Windows)
ollama serve

# Dans un autre terminal, télécharger le modèle sans démarrer la discussion
ollama pull gemma2:9b

# Envoyer des requêtes API
curl http://localhost:11434/api/generate -d '{
  "model": "gemma2:9b",
  "prompt": "Expliquez simplement l’intrication quantique.",
  "stream": false
}'

Cette approche fonctionne de manière identique sur toutes les plateformes et s’intègre aux bibliothèques compatibles OpenAI en redirigeant leurs appels vers http://localhost:11434.

Configuration système requise et performances

Grâce aux optimisations et à la quantification intégrées d’Ollama, les modèles Gemma s’exécutent efficacement sur du matériel grand public. Les besoins en VRAM varient considérablement selon la taille du modèle et le niveau de quantification.

ModèlePrécision complète (FP16)Quantification 4 bits (Q4)Jetons/seconde (RTX 4090)
Gemma 2 27B54 Go16 Go22–28 t/s
Gemma 2 9B18 Go6 Go45–60 t/s
Gemma 2 (2 milliards)4 Go supplémentaires2 Go120-150 t/s
Gemma 7B14 Go5 Go40-55 t/s

Par défaut, Ollama télécharge des versions quantifiées en 4 bits qui réduisent la consommation mémoire de 75 % avec une perte de qualité minimale. Calculez précisément les besoins en VRAM pour votre matériel à l’aide du Calculateur de VRAMcalculateur de mémoire Exigences en VRAM selon le modèle.

GPU recommandés

  • RTX 4060 Ti 16 Go / RTX 3090 : Permettent d’exécuter Gemma 2 27B en quantification Q4 avec des fenêtres de contexte complètes.
  • RTX 4070 / RX 7800 XT : Idéaux pour Gemma 2 9B, avec une marge suffisante pour des conversations longues.
  • RTX 4060 / RTX 3060 : Gèrent confortablement Gemma 2 2B et Gemma 7B.
  • GPU intégrés (puces Apple Silicon, Intel Arc) : Gemma 2 2B fonctionne bien sur les Mac M1/M2 et les GPU Intel Arc récents disposant de 16 Go ou plus de mémoire unifiée.

Pour des recommandations détaillées concernant les GPU et des comparatifs de performances, consultez le meilleurs GPU pour exécuter localement des LLM guide.

Choix entre les modèles Gemma

Le choix du modèle Gemma adapté dépend de votre cas d’usage, de votre matériel et de vos exigences en matière de qualité. Les modèles Gemma 2 surpassent systématiquement leurs prédécesseurs dans les tâches de raisonnement, de suivi d’instructions et de programmation.

Gemma 2 27B fait concurrence à des modèles beaucoup plus volumineux en termes de qualité, mais nécessite une quantité substantielle de VRAM. Utilisez-le pour des tâches complexes de raisonnement, de rédaction technique ou de génération de code, lorsque la précision prime sur la vitesse. Il est comparable, sur de nombreux benchmarks, aux modèles de 70 milliards de paramètres d’autres familles.

Gemma 2 9B représente le meilleur compromis pour la plupart des développeurs. Il s’exécute sur des GPU grand public, offre de solides performances dans les tâches générales et génère des réponses suffisamment rapidement pour des applications interactives. C’est le modèle par défaut à privilégier, sauf contraintes spécifiques.

Gemma 2 (2 milliards) excelle dans les scénarios à haut débit : traitement par lots, déploiement embarqué ou exécution simultanée de plusieurs agents. Bien qu’il soit moins performant que les variantes plus grandes, il se révèle étonnamment compétent pour l’extraction de données structurées, la classification et les dialogues simples.

L’original Gemma 7B et Gemma 2B restent disponibles, mais n’offrent aucun avantage par rapport à Gemma 2, hormis une consommation légèrement moindre de VRAM pour des tailles équivalentes. Pour tout nouveau projet, privilégiez Gemma 2.

Pour davantage d’options, explorez l’intégralité de la Liste des modèles Ollama ou consultez les Meilleurs modèles locaux pour Ollama pour des alternatives telles que Llama, Mistral et Qwen.

Configuration et optimisation des modèles

Ollama expose plusieurs paramètres permettant d’ajuster le comportement et les performances de Gemma. Créez un Modelfile fichier Modelfile pour personnaliser ces paramètres :

FROM gemma2:9b

# Définir la température (0,0 = déterministe, 1,0 = créatif)
PARAMETER temperature 0,7

# Limiter la longueur de la réponse
PARAMETER num_predict 512

# Définir l’instruction système
SYSTEM Vous êtes un assistant spécialisé dans la rédaction de documentation technique. Fournissez des réponses précises et concises, accompagnées d’exemples de code.

Chargez votre configuration personnalisée :

ollama create my-gemma -f ./Modelfile
ollama run my-gemma

Les principaux paramètres sont les suivants :

  • temperature: Contrôle l’aléatoire (0,1–0,3 pour les tâches factuelles, 0,7–0,9 pour les tâches créatives)
  • top_p: Seuil d’échantillonnage par noyau (valeur par défaut : 0,9 ; une valeur inférieure produit des sorties plus ciblées)
  • num_predict: Nombre maximal de jetons à générer (−1 pour illimité, typique : 512–2048)
  • num_ctx: Taille de la fenêtre de contexte (2048–8192 ; une valeur plus élevée consomme davantage de VRAM)

Pour comparer les coûts entre l’exécution locale de Gemma et l’utilisation d’API hébergées, utilisez le calculateur auto-hébergement vs API pour déterminer votre seuil de rentabilité.

Intégration avec les outils de développement

Les modèles Gemma sur Ollama sont compatibles avec les bibliothèques standard de grands modèles linguistiques (LLM), à condition de les configurer pour qu’elles pointent vers le point de terminaison local d’Ollama. Voici comment les intégrer avec des frameworks populaires :

Python (LangChain)

from langchain_community.llms import Ollama

llm = Ollama(model="gemma2:9b")
response = llm.invoke("Écrivez une fonction Python pour calculer les nombres de Fibonacci.")
print(response)

JavaScript (LangChain.js)

import { Ollama } from "@langchain/community/llms/ollama";

const llm = new Ollama({
  baseUrl: "http://localhost:11434",
  model: "gemma2:9b",
});

const response = await llm.invoke("Expliquez le fonctionnement d’async/await en JavaScript.");
console.log(response);

Clients compatibles avec l’API OpenAI

De nombreuses bibliothèques prennent en charge le format d’API OpenAI. Configurez-les pour utiliser Ollama :

import openai

client = openai.OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # requis mais ignoré
)

response = client.chat.completions.create(
    model="gemma2:9b",
    messages=[{"role": "user", "content": "Bonjour !"}]
)
print(response.choices[0].message.content)

Résolution des problèmes courants

Échec ou délai d’expiration lors du téléchargement des modèles : Les modèles Gemma varient de 1,5 Go (2B quantifié) à 54 Go (27B en précision complète). Sur une connexion lente, utilisez la commande ollama pull gemma2:9b dans un terminal dédié afin de suivre la progression du téléchargement. Les téléchargements partiels reprennent automatiquement en cas d’interruption.

Erreurs « mémoire insuffisante » : Si Ollama plante ou refuse de charger un modèle, votre GPU ne dispose pas de suffisamment de VRAM. Passez à un modèle plus petit (gemma2:2b au lieu de 9b) ou réduisez la taille de la fenêtre de contexte à l’aide de la directive PARAMETER num_ctx 2048 dans un fichier Modelfile personnalisé. Vérifiez les besoins réels à l’aide du Calculateur de VRAM.

Génération lente sur les puces Apple Silicon : Assurez-vous que l’accélération Metal est activée. Ollama utilise Metal par défaut sur macOS, mais les versions plus anciennes d’Ollama peuvent revenir à l’exécution sur CPU. Mettez à jour vers la dernière version avec brew upgrade ollama ou réinstallez-la depuis le site web d’Ollama.

L’API renvoie des réponses vides : Vérifiez que ollama serve est en cours d’exécution et accessible à l’adresse http://localhost:11434. Testez avec curl http://localhost:11434/api/tags pour lister les modèles disponibles. Si le modèle n’apparaît pas, exécutez ollama pull gemma2:9b premier.

GPU non détecté sous Windows : Ollama nécessite des GPU NVIDIA compatibles CUDA ou des GPU AMD compatibles ROCm (Linux uniquement). Mettez à jour vos pilotes graphiques via le Gestionnaire de périphériques ou directement depuis le site web du fabricant. Vérifiez la détection avec nvidia-smi (pour NVIDIA) ou rocm-smi (AMD).

Questions fréquemment posées

Existe-t-il un modèle Gemma 4 ?

Non. En août 2026, Google DeepMind a publié Gemma (2 milliards et 7 milliards de paramètres) ainsi que Gemma 2 (2, 9 et 27 milliards de paramètres), mais aucun modèle Gemma 4 n’existe. Le « 2 » dans Gemma 2 désigne la deuxième génération de la famille de modèles, et non le nombre de paramètres. Lorsque vous recherchez « Gemma 4 », vous cherchez probablement les modèles les plus récents : Gemma 2 27B pour une qualité maximale, Gemma 2 9B pour un équilibre entre performances et efficacité, ou Gemma 2 2B pour les environnements aux ressources limitées.

Quelle est la différence entre Gemma et Gemma 2 ?

Gemma 2 est une architecture de deuxième génération qui apporte des améliorations significatives en matière de raisonnement, de suivi des instructions et de capacités multilingues. Les modèles Gemma 2 atteignent une qualité comparable à celle de modèles plus volumineux de première génération, tout en consommant moins de mémoire et en générant plus rapidement. Par exemple, Gemma 2 9B égale ou dépasse le modèle initial Gemma 7B sur la plupart des benchmarks. À moins d’avoir une raison spécifique d’utiliser la série originale Gemma, commencez plutôt par Gemma 2.

Puis-je utiliser les modèles Gemma à des fins commerciales ?

Oui. Les modèles Gemma sont publiés sous la licence open-weight de Google, qui autorise leur utilisation commerciale, leur modification et leur redistribution. Contrairement à certains modèles ouverts soumis à une licence « usage recherche uniquement », vous pouvez déployer Gemma dans des applications de production, des services logiciels en nuage (SaaS) ou des systèmes d’entreprise sans licence supplémentaire. La seule restriction est que vous ne pouvez pas utiliser le nom « Gemma » pour suggérer un soutien ou une approbation de Google concernant votre produit.

Comment Gemma 2 9B se compare-t-il à Llama 3 8B sur Ollama ?

Les deux modèles fonctionnent bien sur du matériel similaire (6 à 8 Go de VRAM), mais ils présentent des forces différentes. Gemma 2 9B obtient généralement de meilleurs résultats sur les tâches impliquant le suivi des instructions et la génération de sorties structurées, ce qui le rend particulièrement adapté à l’utilisation d’outils, à la génération de JSON et aux applications basées sur des agents. Llama 3 8B produit plutôt des réponses conversationnelles plus naturelles et gère légèrement mieux l’écriture créative. Pour les tâches techniques et de programmation, la plupart des développeurs jugent Gemma 2 9B plus fiable. Effectuez des tests comparatifs sur votre cas d’usage spécifique, car la perception de la qualité varie selon l’application.

Dois-je payer pour exécuter les modèles Gemma sur Ollama ?

Non. Ollama est un logiciel libre et open source, et les modèles Gemma sont publiés avec des poids ouverts, sans coût. Vous ne payez que le matériel nécessaire (GPU, RAM, électricité) pour les faire fonctionner. Pour comparer les coûts d’utilisation, le Calculateur de coûts d’API montre à quel moment l’hébergement local devient plus économique que les API cloud. La plupart des développeurs effectuant plus de 10 000 requêtes par mois réalisent des économies en hébergeant Gemma localement plutôt qu’en utilisant des API commerciales.

Les modèles Gemma peuvent-ils fonctionner sans GPU ?

Oui, mais très lentement. Ollama revient automatiquement à l’exécution sur CPU lorsqu’aucun GPU compatible n’est détecté. Gemma 2 2B génère 3 à 8 jetons par seconde sur des processeurs modernes (Ryzen 5000+ ou Intel de 12ᵉ génération ou ultérieur), ce qui reste utilisable pour des requêtes occasionnelles, mais devient frustrant pour une discussion interactive. Gemma 2 9B et les modèles plus volumineux produisent moins de 2 jetons par seconde sur CPU, ce qui les rend peu pratiques. Pour une utilisation sérieuse LLM local investissez dans un GPU — même un modèle abordable comme l’RTX 3060 ou un ancien RTX 2080 améliore considérablement l’expérience. Consultez les recommandations matérielles dans la Guide complet d’Ollama.

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en temps réel des modèles IA du site, son indice de rapport prix/performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts d’API et l’économie de l’hébergement local. Il écrit notamment sur la tarification des modèles, les résultats de benchmarks et le matériel requis pour exécuter localement des modèles d’intelligence artificielle, privilégiant systématiquement les données mesurées aux affirmations des éditeurs.

Défiler vers le haut
Featured on There's An AI For That