- gpt-oss:20b s’exécute avec environ 16 Go de mémoire (convient à la plupart des GPU grand public) gpt-oss:120b nécessite environ 70 Go (un seul GPU de 80 Go ou répartition sur plusieurs cartes grand public)
- Installez-le avec la commande
ollama pull gpt-oss:20bouollama pull gpt-oss:120b, puis exécutez-le avecollama run gpt-oss:20b - Les deux variantes utilisent la quantification MXFP4 à 4,25 bits par paramètre et prennent en charge des fenêtres de contexte de 128 K tokens
- Publiés par OpenAI sous forme de modèles à poids ouverts dans le cadre d’un partenariat avec Ollama, ils offrent une qualité comparable à celle de Llama 3.1 et de Qwen 2.5
OpenAI a publié gpt-oss comme modèles à poids ouverts en août 2025, distribués exclusivement via Ollama. La famille gpt-oss comprend deux variantes : un modèle de 20 milliards de paramètres, exécutable aisément sur du matériel grand public, et un modèle de 120 milliards de paramètres, offrant des performances proches de l’état de l’art sur un seul GPU haut de gamme. Les deux modèles utilisent la quantification MXFP4, compressant les poids à 4,25 bits par paramètre tout en conservant une qualité proche de celle de l’inférence en précision pleine.
Quels sont les modèles GPT-OSS ?
Les modèles gpt-oss constituent la première publication par OpenAI de modèles à poids ouverts, suite aux pressions exercées par le secteur en faveur de la transparence et de la reproductibilité. Contrairement à GPT-4 ou GPT-4o, ces modèles sont fournis avec l’intégralité de leurs poids, les détails architecturaux complets et des licences permissives autorisant leur usage commercial sans restriction.
Les deux modèles prennent en charge une fenêtre de contexte de 128 K tokens, gèrent les conversations multi-tours et suivent les instructions avec une efficacité comparable à celle des autres modèles ouverts de leur classe de paramètres. La variante 20B est directement concurrente de Llama 3.1 8B et Mistral 7B, tandis que le modèle 120B se situe entre Llama 3.1 70B et les systèmes de pointe complets tels que GPT-4.
OpenAI a conclu un partenariat avec Ollama pour assurer la distribution et l’optimisation de l’inférence. Cela signifie que vous installez et exécutez gpt-oss de la même manière que n’importe quel autre modèle Ollama, sans étape de conversion ou de quantification séparée.
Exigences matérielles
Le tableau ci-dessous indique les configurations matérielles minimales et recommandées pour chaque variante gpt-oss. Les valeurs mémoire tiennent compte des poids du modèle ainsi qu’une marge raisonnable pour le contexte et les tampons d’inférence.
| Modèle | Paramètres | Taille disque | Mémoire minimale | Mémoire recommandée | Exemples de matériel |
|---|---|---|---|---|---|
| gpt-oss:20b | 20B | 14 Go | 16 Go | 24 Go | RTX 4090, RTX 3090, A5000 |
| gpt-oss:120b | 120B | 65 Go | 70 Go | 80 Go | A100 80 Go, H100, 2 × RTX 4090 |
Le modèle de 20 milliards de paramètres s’exécute aisément sur les GPU grand public sortis depuis 2020. Si vous disposez d’une RTX 3090 ou d’une RTX 4090 dotée de 24 Go de VRAM, vous pouvez exécuter gpt-oss:20b avec suffisamment de mémoire libre pour une fenêtre de contexte de 16 K tokens. Avec 16 Go de VRAM (RTX 4080, RTX 3080 Ti), vous pouvez toujours faire fonctionner le modèle, mais vous devrez limiter la longueur du contexte à 8 K tokens afin d’éviter un dépassement de mémoire.
Le modèle de 120 milliards de paramètres nécessite du matériel de centre de données ou une configuration multi-GPU grand public. Une carte A100 80 Go le prend en charge aisément. Deux RTX 4090 installées dans un poste de travail peuvent répartir le modèle entre les deux cartes, bien que la vitesse d’inférence diminue légèrement par rapport à une configuration mono-GPU. Utilisez le Calculateur de VRAM pour estimer les besoins mémoire selon différentes longueurs de contexte.
Processeur (CPU) et mémoire système (RAM)
En cas de VRAM insuffisante, Ollama décharge certaines couches vers la mémoire système et les exécute sur le CPU. Pour gpt-oss:20b, vous devez disposer d’au moins 32 Go de RAM système si vous exécutez entièrement le modèle sur le CPU. Pour gpt-oss:120b, l’inférence sur CPU est impraticable — attendez-vous à plusieurs secondes par token, même sur des systèmes dotés d’un très grand nombre de cœurs. Consultez le meilleur Cartes graphiques pour les grands modèles linguistiques locaux guide si vous construisez ou mettez à niveau du matériel spécifiquement destiné à l’inférence de modèles.
Installation
Commencez par installer Ollama si ce n’est pas déjà fait. Le processus varie selon la plateforme :
macOS
Téléchargez l’application Ollama pour macOS depuis ollama.com et glissez-la vers /Applications. L’installateur configure automatiquement l’interface en ligne de commande (CLI) ollama . Vous pouvez également l’installer via Homebrew :
brew install ollama
Linux
Exécutez le script d’installation officiel, qui place le binaire à l’emplacement , puis supprimez et configure un service systemd :
curl -fsSL https://ollama.com/install.sh | sh
Pour une installation manuelle ou des instructions spécifiques à une distribution, consultez la Guide d’installation d’Ollama.
Windows
Téléchargez le programme d'installation pour Windows à partir de ollama.com et exécutez-le. L’installateur ajoute automatiquement Ollama à votre variable PATH et démarre le service en arrière-plan. Une fois l’installation terminée, ouvrez PowerShell ou l’invite de commandes pour vérifier :
ollama --version
Téléchargement et exécution des modèles
Une fois Ollama installé, téléchargez le modèle souhaité. Pour la variante de 20 milliards de paramètres :
ollama pull gpt-oss:20b
Pour la variante de 120 milliards de paramètres :
ollama pull gpt-oss:120b
Le téléchargement copie les poids du modèle dans le dossier ~/.ollama/models sur macOS et Linux, ou dans %USERPROFILE%.ollamamodels sur Windows. Le téléchargement est reprendre-à-partir-de-là, donc vous pouvez l’interrompre et le relancer sans perdre les progrès réalisés.
Après le téléchargement, lancez une session interactive :
ollama run gpt-oss:20b
Ou, pour le modèle plus volumineux :
ollama run gpt-oss:120b
Cela ouvre une interface de discussion. Saisissez votre demande, appuyez sur Entrée, et le modèle affiche progressivement sa réponse. Tapez /bye pour quitter.
Accès à l’API
Ollama exécute un serveur HTTP local à l’adresse http://localhost:11434. Vous pouvez envoyer des requêtes à l’aide de curl, de Python ou de tout client HTTP :
curl http://localhost:11434/api/generate -d '{
"model": "gpt-oss:20b",
"prompt": "Expliquez la quantification MXFP4 en une phrase."
}'
Pour les applications structurées, utilisez le SDK Python ou JavaScript d’Ollama. Les deux sont disponibles via les gestionnaires de paquets standards (pip install ollama, npm install ollama) et fournissent des interfaces typées pour la génération de texte, les embeddings et la gestion des modèles.
Performances et comparaison entre modèles
Le modèle de 20 milliards de paramètres génère 15 à 30 jetons par seconde sur une carte graphique RTX 4090, selon la longueur du contexte et la complexité de la demande. Le modèle de 120 milliards de paramètres produit 8 à 15 jetons par seconde sur une carte A100 de 80 Go. Ces chiffres supposent des paramètres par défaut, sans optimisations supplémentaires telles que le décodage spéculatif.
Sur le plan de la qualité, gpt-oss:20b obtient des résultats comparables à ceux de Llama 3.1 8B et de Mistral 7B sur des benchmarks de raisonnement tels que MMLU et GSM8K. Il les dépasse tous deux en suivi d’instructions sur plusieurs tours, probablement grâce au réglage par apprentissage par renforcement à partir de commentaires humains (RLHF) mis en œuvre par OpenAI. La variante 120B atteint une qualité proche de celle de GPT-3.5 Turbo, ce qui en fait, en août 2026, le modèle ouvert le plus performant parmi ceux comptant moins de 200 milliards de paramètres.
Par rapport aux modèles propriétaires accessibles via API, l’exécution locale de gpt-oss devient rentable à partir d’environ 2 millions de jetons par mois pour le modèle 20B, ou de 500 000 jetons par mois pour le modèle 120B, à condition que vous possédiez déjà le matériel requis. Utilisez le calculateur auto-hébergement vs API pour estimer votre seuil de rentabilité en fonction du volume de jetons et des coûts matériels.
Quantification MXFP4
Les deux modèles gpt-oss intègrent nativement la quantification MXFP4. MXFP4 est un format flottant à micro-échelle qui représente les poids avec une précision moyenne de 4,25 bits par paramètre, contre 16 bits en demi-précision standard. Contrairement aux anciens schémas de quantification tels que GPTQ ou AWQ, MXFP4 préserve une plage dynamique plus étendue, réduisant ainsi la perte d’exactitude habituellement associée à une compression agressive.
En pratique, les modèles quantifiés en MXFP4 se comportent presque identiquement à leurs homologues en pleine précision sur la plupart des tâches. Cette quantification s’effectue durant l’entraînement, et non a posteriori, ce qui permet au modèle de s’adapter à la précision réduite. Cette approche réduit la consommation de mémoire VRAM d’environ 75 % par rapport au format FP16, rendant ainsi l’exécution de modèles de 120 milliards de paramètres possible sur une seule carte graphique grand public.
Fenêtre de contexte et utilisation mémoire
Les deux variantes gpt-oss prennent en charge une fenêtre de contexte de 128 K jetons, soit environ 100 000 mots en anglais. Toutefois, l’utilisation effective de cette fenêtre complète nécessite une mémoire supplémentaire importante, au-delà des poids de base du modèle.
Pour gpt-oss:20b, une fenêtre de contexte de 128 K entraîne une surcharge mémoire d’environ 8 Go. Avec 24 Go de VRAM, vous pouvez utiliser confortablement la fenêtre complète. Avec 16 Go de VRAM, il est conseillé de limiter le contexte à 32 K–48 K jetons afin d’éviter une saturation de la mémoire en cours de génération.
Pour gpt-oss:120b, une fenêtre de contexte de 128 K ajoute environ 20 Go de surcharge mémoire. Une carte graphique de 80 Go peut la supporter, mais un déploiement sur deux cartes grand public (70 Go au total) devrait limiter la fenêtre de contexte à 64 K jetons. Consultez Exigences en VRAM selon le modèle pour obtenir des courbes détaillées de l’évolution de la consommation mémoire.
Questions fréquemment posées
Puis-je affiner les modèles gpt-oss ?
Oui. OpenAI a publié gpt-oss sous une licence permissive autorisant l’affinage à toute fin, y compris commerciale. Vous pouvez utiliser des cadres d’affinage standard tels qu’Axolotl ou Hugging Face TRL. Les poids du modèle sont compatibles avec l’architecture Llama, de sorte que la plupart des outils conçus pour Llama fonctionnent sans modification.
Comment gpt-oss:120b se compare-t-il à Llama 3.1 70B ?
gpt-oss:120b surpasse Llama 3.1 70B en suivi d’instructions et en conversations multi-tours, notamment dans les tâches nécessitant le maintien d’un contexte sur de nombreux échanges. Llama 3.1 70B obtient de meilleurs résultats sur des benchmarks de raisonnement pur tels que MATH et DROP. Les deux modèles sont globalement équivalents sur les tâches de programmation. Le modèle 120B nécessite davantage de VRAM (70 Go contre 40 Go), mais offre une amélioration sensible de la qualité dans les interactions de type assistant.
Puis-je exécuter gpt-oss:120b sur plusieurs cartes graphiques grand public ?
Oui. Ollama divise automatiquement le modèle entre les GPU disponibles si un seul GPU ne dispose pas de suffisamment de mémoire. Deux cartes RTX 4090 (48 Go de VRAM au total) peuvent exécuter gpt-oss:120b, bien que la vitesse d’inférence diminue de 20 à 30 % par rapport à celle d’une seule carte de 80 Go, en raison de la surcharge liée aux communications inter-GPU. Trois GPU ou plus apportent des gains décroissants : si vous avez le budget nécessaire, une seule carte A100 ou H100 s’avère plus rentable.
gpt-oss fonctionne-t-il hors ligne ?
Oui, dès lors que vous avez téléchargé le modèle à l’aide de ollama pull. Ollama stocke intégralement les poids du modèle localement, et l’inférence s’effectue entièrement sur votre machine. L’accès réseau n’intervient que lors du téléchargement initial et lors de la vérification des mises à jour du modèle. Vous pouvez désactiver les mises à jour automatiques en définissant la variable d’environnement OLLAMA_SKIP_UPGRADE=1 dans votre environnement.
Quelle licence s’applique aux sorties générées par gpt-oss ?
La licence gpt-oss d’OpenAI ne revendique aucun droit de propriété sur les sorties générées. Vous conservez la pleine propriété des contenus que vous produisez et pouvez les utiliser à toute fin, y compris commerciale, pour des produits ou services. Cela diffère des conditions d’utilisation de l’API OpenAI, qui restreignent certains cas d’usage. Veuillez toujours consulter le texte intégral de la licence fourni avec le téléchargement du modèle afin de vérifier les derniers termes applicables.
Puis-je utiliser les modèles gpt-oss à des fins commerciales ?
Oui. La licence autorise l’usage commercial sans restriction, y compris l’intégration du modèle dans des produits propriétaires, sa mise à disposition en tant que service ou son utilisation pour générer du contenu destiné à la vente. Vous n’êtes pas tenu de publier sous licence libre vos travaux dérivés ni de divulguer l’utilisation de gpt-oss dans votre produit, bien que la mention de la source soit encouragée.
