{"id":2199,"date":"2026-08-14T06:18:40","date_gmt":"2026-08-14T06:18:40","guid":{"rendered":"https:\/\/convly.ai\/?p=2199"},"modified":"2026-08-14T06:18:40","modified_gmt":"2026-08-14T06:18:40","slug":"ollama-gpt-oss-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/","title":{"rendered":"Ollama GPT OSS: Lokales Ausf\u00fchren von Open-Source-LLMs (Anleitung)"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>Zusammenfassung<\/strong><\/p>\n<ul>\n<li>OpenAI hat keine Modellfamilie namens \u201eGPT-OSS\u201c ver\u00f6ffentlicht. Der Suchbegriff bezieht sich wahrscheinlich darauf, Open-Source-Alternativen (Llama 3, Mistral, Qwen) \u00fcber Ollama lokal auszuf\u00fchren.<\/li>\n<li>Ollama f\u00fchrt Hunderte offener Modelle lokal aus. Beliebte Optionen: <code>ollama pull llama3.1:8b<\/code>, <code>ollama pull mistral:7b<\/code>, <code>ollama pull qwen2.5:7b<\/code>.<\/li>\n<li>VRAM-Bedarf: Modelle mit 7 Milliarden Parametern ben\u00f6tigen 6\u20138 GB (Q4-Quantisierung), Modelle mit 13 Milliarden Parametern 10\u201314 GB und Modelle mit 70 Milliarden Parametern 40\u201348 GB. Verwenden Sie den <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> zur Absch\u00e4tzung.<\/li>\n<li>Quantisierte Modelle (Q4, Q5) passen auf Consumer-GPUs mit nur geringem Qualit\u00e4tsverlust. FP16 bietet die beste Qualit\u00e4t, verdoppelt jedoch den VRAM-Bedarf.<\/li>\n<\/ul>\n<\/div>\n<p>Falls Sie nach \u201eollama gpt oss\u201c gesucht haben, m\u00f6chten Sie wahrscheinlich Open-Source-Sprachmodelle mithilfe von Ollama lokal ausf\u00fchren \u2013 doch OpenAI hat keine offene Modellfamilie namens \u201eGPT-OSS\u201c ver\u00f6ffentlicht. OpenAI stellte 2019 GPT-2 als offenes Modell zur Verf\u00fcgung, doch j\u00fcngste Modelle (GPT-4, GPT-4o, GPT-4.1) bleiben propriet\u00e4re, ausschlie\u00dflich \u00fcber APIs zug\u00e4ngliche Produkte. Was hingegen <em>\u00fcberlebt<\/em> existiert: Hunderte offener Modelle von Meta (Llama), Mistral AI, Alibaba (Qwen) und anderen, die Sie \u00fcber Ollama auf Ihrer eigenen Hardware herunterladen und ausf\u00fchren k\u00f6nnen. Diese Anleitung behandelt, welche Modelle funktionieren, wie viel VRAM die jeweiligen Gr\u00f6\u00dfen ben\u00f6tigen, wie sich Quantisierung auf die Qualit\u00e4t auswirkt und wie sie sich zueinander verhalten.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7ee9e398f9c\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7ee9e398f9c\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#What_Ollama_Actually_Runs\" >Was Ollama tats\u00e4chlich ausf\u00fchrt<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Open-Source_Model_Families_Available_in_Ollama\" >In Ollama verf\u00fcgbare Open-Source-Modellfamilien<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Pulling_and_Running_a_Model\" >Herunterladen und Ausf\u00fchren eines Modells<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Parameter_Sizes_and_VRAM_Requirements\" >Parametergr\u00f6\u00dfen und VRAM-Anforderungen<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Quantization_Quality_vs_VRAM_Trade-Off\" >Quantisierung: Kompromiss zwischen Qualit\u00e4t und VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Performance_Comparison_7B_Class\" >Leistungsvergleich: Klasse mit 7 Milliarden Parametern<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Which_Model_to_Pick\" >Welches Modell w\u00e4hlen?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#When_to_Self-Host_vs_Use_an_API\" >Wann selbst hosten statt eine API nutzen?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Platform-Specific_Notes\" >Plattformspezifische Hinweise<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/de\/ollama-gpt-oss-guide\/#Frequently_Asked_Questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Ollama_Actually_Runs\"><\/span>Was Ollama tats\u00e4chlich ausf\u00fchrt<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama ist eine lokale Inferenz-Engine, die offene Sprachmodelle unter macOS, Linux und Windows herunterl\u00e4dt, quantisiert und ausf\u00fchrt. Sie hostet keine OpenAI-Modelle. Die <a href=\"https:\/\/convly.ai\/de\/ollama-models-list-2026\/\">Ollama-Modellliste<\/a> includes Llama 3.1, Mistral 7B, Qwen 2.5, Gemma 2, Phi-3, and dozens more. Each model is available in multiple quantization levels (Q4_K_M, Q5_K_M, FP16) to trade VRAM for quality.<\/p>\n<p>Ausf\u00fchrliche Installationsanleitung: <a href=\"https:\/\/convly.ai\/de\/how-to-install-ollama-2026\/\">So installieren Sie Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Open-Source_Model_Families_Available_in_Ollama\"><\/span>In Ollama verf\u00fcgbare Open-Source-Modellfamilien<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Modellfamilie<\/th>\n<th>Entwickler<\/th>\n<th>Parametergr\u00f6\u00dfen<\/th>\n<th>Lizenz<\/th>\n<th>Besonders hervorzuheben<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1<\/td>\n<td>Meta<\/td>\n<td>8 Mrd., 70 Mrd., 405 Mrd.<\/td>\n<td>Llama 3.1 (kommerziell nutzbar)<\/td>\n<td>Beste allgemeine Schlussfolgerungsf\u00e4higkeit in jeder Gr\u00f6\u00dfenklasse<\/td>\n<\/tr>\n<tr>\n<td>Mistral<\/td>\n<td>Mistral AI<\/td>\n<td>7 Mrd., 22 Mrd. (Mixtral 8x7B)<\/td>\n<td>Apache 2.0<\/td>\n<td>Schnell, effizient, stark im Codieren<\/td>\n<\/tr>\n<tr>\n<td>Qwen 2.5<\/td>\n<td>Alibaba<\/td>\n<td>0,5 Mrd., 1,5 Mrd., 3 Mrd., 7 Mrd., 14 Mrd., 32 Mrd., 72 Mrd.<\/td>\n<td>Apache 2.0<\/td>\n<td>Mehrsprachig, langer Kontext (128 k)<\/td>\n<\/tr>\n<tr>\n<td>Gemma 2<\/td>\n<td>Google<\/td>\n<td>2 Mrd., 9 Mrd., 27 Mrd.<\/td>\n<td>Gemma (kommerziell nutzbar)<\/td>\n<td>Klein, schnell, l\u00e4uft auch auf der CPU<\/td>\n<\/tr>\n<tr>\n<td>Phi-3.5<\/td>\n<td>Microsoft<\/td>\n<td>3,8 Mrd. (Mini), 14 Mrd. (Medium)<\/td>\n<td>MIT<\/td>\n<td>Kompakt, starke Leistung bei Schlussfolgerungsbenchmarks<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Der <a href=\"https:\/\/convly.ai\/de\/models\/\">Datenbank f\u00fcr KI-Modelle<\/a> listet Spezifikationen, VRAM-Anforderungen und Preise f\u00fcr 37 Modelle \u2013 darunter alle oben genannten \u2013 auf.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Pulling_and_Running_a_Model\"><\/span>Herunterladen und Ausf\u00fchren eines Modells<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Sobald Ollama installiert ist, laden Sie ein Modell mit <code>ollama pull &lt;Modell&gt;:&lt;Tag&gt;<\/code>herunter. Der Tag gibt Parameteranzahl und Quantisierung an. Beispiele:<\/p>\n<pre><code>ollama pull llama3.1:8b\nollama pull mistral:7b-instruct-q4_K_M\nollama pull qwen2.5:7b\nollama pull gemma2:9b<\/code><\/pre>\n<p>F\u00fchren Sie das Modell aus:<\/p>\n<pre><code>ollama run llama3.1:8b<\/code><\/pre>\n<p>Dadurch wird eine interaktive Chat-Sitzung ge\u00f6ffnet. Geben Sie Ihre Eingabeaufforderung ein, dr\u00fccken Sie Enter, und das Modell generiert lokal eine Antwort. Um die Sitzung zu beenden, geben Sie <code>\/bye<\/code>.<\/p>\n<p>ein. Um das Modell programmatisch \u00fcber die API zu nutzen:<\/p>\n<pre><code>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"llama3.1:8b\",\n  \"prompt\": \"Erkl\u00e4ren Sie Rekursion in einem Satz.\"\n}'<\/code><\/pre>\n<p>Ollama stellt einen OpenAI-kompatiblen <code>\/v1\/chat\/completions<\/code> Endpunkt bereit, sodass Sie bestehenden OpenAI-SDK-Code auf <code>http:\/\/localhost:11434<\/code> ausrichten und durch ein lokales Modell ersetzen k\u00f6nnen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Parameter_Sizes_and_VRAM_Requirements\"><\/span>Parametergr\u00f6\u00dfen und VRAM-Anforderungen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die Modellgr\u00f6\u00dfe (7 Mrd., 13 Mrd., 70 Mrd.) bestimmt sowohl Qualit\u00e4t als auch VRAM-Bedarf. Gr\u00f6\u00dfere Modelle weisen bessere Schlussfolgerungsf\u00e4higkeiten auf, ben\u00f6tigen aber mehr GPU-Speicher. Die Quantisierung (Q4, Q5, FP16) komprimiert die Gewichte, um den VRAM-Bedarf bei geringem Qualit\u00e4tsverlust zu reduzieren.<\/p>\n<table>\n<thead>\n<tr>\n<th>Parameteranzahl<\/th>\n<th>Quantisierung<\/th>\n<th>VRAM (ca.)<\/th>\n<th>Beispielmodelle<\/th>\n<th>GPU-Empfehlung<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>7B<\/td>\n<td>Q4_K_M<\/td>\n<td>4,5 GB<\/td>\n<td>Llama 3.1 8B, Mistral 7B<\/td>\n<td>RTX 3060 (12 GB), RTX 4060 Ti (16 GB)<\/td>\n<\/tr>\n<tr>\n<td>7B<\/td>\n<td>Q5_K_M<\/td>\n<td>5,5 GB<\/td>\n<td>Wie oben<\/td>\n<td>Gleich<\/td>\n<\/tr>\n<tr>\n<td>7B<\/td>\n<td>FP16<\/td>\n<td>14 GB<\/td>\n<td>Wie oben<\/td>\n<td>RTX 4060 Ti (16 GB), RTX 4070<\/td>\n<\/tr>\n<tr>\n<td>13B<\/td>\n<td>Q4_K_M<\/td>\n<td>8 GB<\/td>\n<td>Qwen 2.5 14B, Phi-3.5 14B<\/td>\n<td>RTX 3060 (12 GB), RTX 4060 Ti (16 GB)<\/td>\n<\/tr>\n<tr>\n<td>13B<\/td>\n<td>FP16<\/td>\n<td>26 GB<\/td>\n<td>Gleich<\/td>\n<td>RTX 4090 (24 GB) oder A5000 (24 GB)<\/td>\n<\/tr>\n<tr>\n<td>70B<\/td>\n<td>Q4_K_M<\/td>\n<td>40 GB<\/td>\n<td>Llama 3.1 70B, Qwen 2.5 72B<\/td>\n<td>A100 (40\/80 GB), zwei RTX 3090 (insgesamt 48 GB)<\/td>\n<\/tr>\n<tr>\n<td>70B<\/td>\n<td>FP16<\/td>\n<td>140 GB<\/td>\n<td>Gleich<\/td>\n<td>Multi-GPU-Setup oder A100 mit 80 GB<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Verwenden Sie den <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> um den VRAM-Bedarf f\u00fcr beliebige Modelle und Quantisierungsstufen abzusch\u00e4tzen. Die <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">Leitfaden zu VRAM-Anforderungen<\/a> listet pr\u00e4zise Werte f\u00fcr alle g\u00e4ngigen Modelle auf.<\/p>\n<p>F\u00fcr Entscheidungshilfen beim GPU-Kauf siehe <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">besten GPUs f\u00fcr lokales LLM-Hosting<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quantization_Quality_vs_VRAM_Trade-Off\"><\/span>Quantisierung: Kompromiss zwischen Qualit\u00e4t und VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quantisierung reduziert die Genauigkeit der Modellgewichte von 16-Bit-Gleitkommazahlen (FP16) auf 4-Bit- oder 5-Bit-Ganzzahlen (Q4, Q5). Dadurch sinkt der VRAM-Bedarf um 60\u201375 %, bei nur geringf\u00fcgigen Einbu\u00dfen bei der Qualit\u00e4t f\u00fcr die meisten Aufgaben.<\/p>\n<ul>\n<li><strong>Q4_K_M<\/strong>: 4-Bit-Quantisierung. Geringster VRAM-Bedarf, leichter Qualit\u00e4tsverlust bei komplexen Schlussfolgerungsaufgaben. Gut geeignet f\u00fcr Chatbots, Zusammenfassungen und Code-Vervollst\u00e4ndigung.<\/li>\n<li><strong>Q5_K_M<\/strong>: 5-Bit-Quantisierung. Etwa 20 % mehr VRAM als Q4, Qualit\u00e4t nahe an FP16. Beste Balance f\u00fcr die meisten Nutzer.<\/li>\n<li><strong>Q8_0<\/strong>: 8-Bit-Quantisierung. Nahezu FP16-Qualit\u00e4t, 50 % weniger VRAM. Verwenden Sie diese Stufe, wenn ausreichend VRAM zur Verf\u00fcgung steht.<\/li>\n<li><strong>FP16<\/strong>: Volle Pr\u00e4zision. Beste Qualit\u00e4t, doppelt so viel VRAM wie bei Q4. Nur f\u00fcr Forschungszwecke erforderlich oder falls Qualit\u00e4tsr\u00fcckg\u00e4nge unbedingt vermieden werden m\u00fcssen.<\/li>\n<\/ul>\n<p>Example: Llama 3.1 8B at Q4_K_M uses 4.5 GB and scores 67.2 on MMLU. At FP16 it uses 14 GB and scores 68.1 on MMLU. For most tasks the 0.9-point difference is imperceptible.<\/p>\n<p>Um eine bestimmte Quantisierung herunterzuladen:<\/p>\n<pre><code>ollama pull llama3.1:8b-instruct-q4_K_M\nollama pull llama3.1:8b-instruct-fp16<\/code><\/pre>\n<p>Falls Sie die Quantisierungsangabe weglassen, verwendet Ollama standardm\u00e4\u00dfig Q4_K_M.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_Comparison_7B_Class\"><\/span>Leistungsvergleich: Klasse mit 7 Milliarden Parametern<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die Modellgr\u00f6\u00dfe der Klasse 7B\u20138B ist f\u00fcr lokale Anwendungen am verbreitetsten. Sie passt auf Consumer-GPUs und liefert hervorragende Ergebnisse bei Programmieraufgaben, logischem Denken und im Chat.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modell<\/th>\n<th>MMLU (ohne Beispiele)<\/th>\n<th>HumanEval (pass@1)<\/th>\n<th>Kontextl\u00e4nge<\/th>\n<th>VRAM (Q4)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>67.2<\/td>\n<td>62.2<\/td>\n<td>128k<\/td>\n<td>4,5 GB<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B v0.3<\/td>\n<td>62.5<\/td>\n<td>40.2<\/td>\n<td>32k<\/td>\n<td>4,1 GB<\/td>\n<\/tr>\n<tr>\n<td>Qwen 2.5 7B<\/td>\n<td>70.3<\/td>\n<td>61.6<\/td>\n<td>128k<\/td>\n<td>4,3 GB<\/td>\n<\/tr>\n<tr>\n<td>Gemma 2 9B<\/td>\n<td>71.3<\/td>\n<td>61.0<\/td>\n<td>8k<\/td>\n<td>5,2 GB<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Qwen 2.5 7B und Gemma 2 9B f\u00fchren bei MMLU (Allgemeinwissen). Llama 3.1 8B f\u00fchrt bei HumanEval (Programmierung). Mistral 7B ist am schnellsten und verf\u00fcgt \u00fcber die permissivste Lizenz (Apache 2.0). Der <a href=\"https:\/\/convly.ai\/de\/llm-leaderboard\/\">LLM-Leaderboard<\/a> bewertet s\u00e4mtliche Modelle nach Intelligenz, Preis und Kontextl\u00e4nge.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Which_Model_to_Pick\"><\/span>Welches Modell w\u00e4hlen?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><strong>Beste Gesamtqualit\u00e4t (7B-Klasse)<\/strong>: <code>ollama pull qwen2.5:7b<\/code> oder <code>ollama pull llama3.1:8b<\/code><\/li>\n<li><strong>Bestes Modell f\u00fcr Programmierung<\/strong>: <code>ollama pull llama3.1:8b<\/code> oder <code>ollama pull qwen2.5-coder:7b<\/code><\/li>\n<li><strong>Schnellste Inferenz<\/strong>: <code>ollama pull mistral:7b<\/code> oder <code>ollama pull gemma2:2b<\/code> (f\u00fcr CPU\/niedrigen VRAM)<\/li>\n<li><strong>Mehrsprachig<\/strong>: <code>ollama pull qwen2.5:7b<\/code> (unterst\u00fctzt 29 Sprachen)<\/li>\n<li><strong>Lange Dokumente (128k+ Kontext)<\/strong>: <code>ollama pull llama3.1:8b<\/code> oder <code>ollama pull qwen2.5:7b<\/code><\/li>\n<li><strong>St\u00e4rkste Schlussfolgerungsf\u00e4higkeit (bei 40+ GB VRAM)<\/strong>: <code>ollama pull llama3.1:70b<\/code> oder <code>ollama pull qwen2.5:72b<\/code><\/li>\n<\/ul>\n<p>Der <a href=\"https:\/\/convly.ai\/de\/best-local-llms-to-run-on-ollama-2026\/\">beste lokale LLMs f\u00fcr Ollama<\/a> -Leitfaden bewertet s\u00e4mtliche Modelle und empfiehlt spezifische Tags je nach Anwendungsfall.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_to_Self-Host_vs_Use_an_API\"><\/span>Wann selbst hosten statt eine API nutzen?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Der lokale Betrieb von Ollama lohnt sich, wenn:<\/p>\n<ul>\n<li>Sie bereits \u00fcber eine GPU mit mindestens 12 GB VRAM verf\u00fcgen (z. B. RTX 3060, 4060 Ti oder besser)<\/li>\n<li>Sie sensible Daten verarbeiten, die Ihr Netzwerk nicht verlassen d\u00fcrfen<\/li>\n<li>Sie monatlich mehr als f\u00fcnf Millionen Tokens generieren (API-Kosten \u00fcberschreiten dann die Gesamtbetriebskosten des Self-Hosting)<\/li>\n<li>Sie eine garantierte Verf\u00fcgbarkeit und keine Rate-Limits ben\u00f6tigen<\/li>\n<\/ul>\n<p>Verwenden Sie stattdessen eine gehostete API (OpenAI, Anthropic, Groq), wenn:<\/p>\n<ul>\n<li>Sie generieren weniger als 1 Million Tokens pro Monat (die Amortisation einer selbst gehosteten GPU dauert Jahre)<\/li>\n<li>Sie ben\u00f6tigen die absolut beste Qualit\u00e4t (Claude 3.5 Sonnet und GPT-4o \u00fcbertreffen alle Open-Source-Modelle)<\/li>\n<li>Sie m\u00f6chten keine Inferenz-Infrastruktur verwalten<\/li>\n<\/ul>\n<p>Der <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Selbsthosting vs. API-Rechner<\/a> sch\u00e4tzt den Break-even-Punkt basierend auf Ihrem Token-Volumen, den GPU-Kosten und Ihrem Stromtarif. Der <a href=\"https:\/\/convly.ai\/de\/ai-api-cost-calculator\/\">API-Kostenrechner<\/a> berechnet die monatlichen Ausgaben pro Modell.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Platform-Specific_Notes\"><\/span>Plattformspezifische Hinweise<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>macOS<\/h3>\n<p>Ollama nutzt Metal f\u00fcr GPU-Beschleunigung auf M1-\/M2-\/M3-Macs. Der einheitliche Speicher bedeutet, dass VRAM = Arbeitsspeicher (RAM) ist. Ein M2 Max mit 64 GB RAM kann Llama 3.1 70B in der Q4-Quantisierung (40 GB) ausf\u00fchren und noch gen\u00fcgend Speicher f\u00fcr das Betriebssystem freihalten. Installation \u00fcber Homebrew:<\/p>\n<pre><code>installieren Sie Ollama \u00fcber Homebrew mit \u201ebrew install ollama\u201c<\/code><\/pre>\n<p>Starten Sie den Dienst:<\/p>\n<pre><code>ollama serve<\/code><\/pre>\n<h3>Linux<\/h3>\n<p>Ollama erfordert NVIDIA-GPUs mit CUDA 11.8+ oder AMD-GPUs mit ROCm 5.7+. Installieren Sie mit:<\/p>\n<pre><code>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/code><\/pre>\n<p>Dadurch wird die Bin\u00e4rdatei nach <code>\/usr\/local\/bin\/ollama<\/code> installiert und ein systemd-Dienst erstellt. Starten Sie ihn mit:<\/p>\n<pre><code>sudo systemctl start ollama<\/code><\/pre>\n<p>Modelle werden nach <code>~\/.ollama\/models<\/code>heruntergeladen. Um den Speicherort zu \u00e4ndern, setzen Sie <code>OLLAMA_MODELS=\/pfad\/zum\/modelle<\/code> in <code>\/etc\/systemd\/system\/ollama.service<\/code>.<\/p>\n<h3>Windows<\/h3>\n<p>Die Windows-Version von Ollama erfordert NVIDIA-GPUs mit CUDA 11.8+ und Treiber-Version 520+. Laden Sie den Installer von <code>ollama.com<\/code> herunter und f\u00fchren Sie ihn aus. Der Dienst startet automatisch. Modelle werden nach <code>C:\\Users\\\\.ollama\\models<\/code>.<\/p>\n<p>heruntergeladen. Um Ollama \u00fcber PowerShell auszuf\u00fchren:<\/p>\n<pre><code>ollama run llama3.1:8b<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Bietet OpenAI ein Open-Source-Modell an, das ich in Ollama ausf\u00fchren kann?<\/h3>\n<p>Nein. OpenAI ver\u00f6ffentlichte 2019 GPT-2 als Open-Weight-Modell, doch alle j\u00fcngeren Modelle (GPT-3.5, GPT-4, GPT-4o, o1) sind propriet\u00e4r und ausschlie\u00dflich \u00fcber die API nutzbar. Falls Sie eine lokal lauff\u00e4hige Alternative mit OpenAI-\u00e4hnlicher Schlussfolgerungsqualit\u00e4t suchen, probieren Sie Llama 3.1 70B oder Qwen 2.5 72B \u2013 beide schneiden bei den meisten Benchmarks besser ab als GPT-3.5 und laufen in Ollama mit 40 GB VRAM in Q4-Quantisierung.<\/p>\n<h3>Kann ich Ollama auf einer CPU ohne GPU ausf\u00fchren?<\/h3>\n<p>Ja, allerdings ist die Inferenz 10\u201350-mal langsamer. Kleinere Modelle (z. B. Gemma 2 2B, Qwen 2.5 0.5B, Phi-3.5 mini 3.8B) sind auf modernen CPUs mit 16 oder mehr Threads durchaus nutzbar. Gr\u00f6\u00dfere Modelle (ab 7B Parameter) erzeugen auf der CPU nur 1\u20133 Tokens pro Sekunde, was f\u00fcr interaktive Anwendungen zu langsam ist. Falls Sie keine GPU besitzen, erw\u00e4gen Sie stattdessen die Nutzung einer gehosteten API \u2013 siehe dazu die <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Selbsthosting vs. API-Rechner<\/a>.<\/p>\n<h3>Wie hoch sind die Kosten f\u00fcr den Betrieb von Ollama im Vergleich zur OpenAI-API?<\/h3>\n<p>OpenAI berechnet 0,15 USD pro Million Eingabetokens und 0,60 USD pro Million Ausgabetokens f\u00fcr GPT-4o mini. Eine 12-GB-GPU (z. B. RTX 4060 Ti f\u00fcr 400 USD), auf der Llama 3.1 8B l\u00e4uft, verursacht bei einem Strompreis von 0,12 USD\/kWh und einem Systemverbrauch von 400 W Stromkosten von etwa 0,05 USD pro Stunde. Der Break-even liegt bei ca. 3\u20135 Millionen Tokens pro Monat. Der <a href=\"https:\/\/convly.ai\/de\/ai-api-cost-calculator\/\">API-Kostenrechner<\/a> und <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Self-Hosting-Rechner<\/a> zeigt die genauen Gesamtbetriebskosten (TCO) f\u00fcr Ihre individuelle Nutzung an.<\/p>\n<h3>Was ist der Unterschied zwischen Q4_K_M, Q5_K_M und FP16?<\/h3>\n<p>Q4_K_M verwendet 4-Bit-Quantisierung (geringster VRAM-Bedarf, geringf\u00fcgiger Qualit\u00e4tsverlust). Q5_K_M verwendet 5-Bit-Quantisierung (ca. 20 % mehr VRAM, Qualit\u00e4t nahe der Vollpr\u00e4zision). FP16 ist die vollst\u00e4ndige 16-Bit-Genauigkeit (beste Qualit\u00e4t, doppelter VRAM-Bedarf im Vergleich zu Q4). F\u00fcr die meisten Anwendungsf\u00e4lle stellt Q5_K_M das beste Verh\u00e4ltnis aus Effizienz und Qualit\u00e4t dar. FP16 sollten Sie nur verwenden, wenn ausreichend VRAM verf\u00fcgbar ist und Sie f\u00fcr Forschung oder Produktion die letzte 1\u20132 % an Qualit\u00e4t ben\u00f6tigen.<\/p>\n<h3>Kann ich Modelle in Ollama feinjustieren (fine-tunen)?<\/h3>\n<p>Nein. Ollama ist ein reiner Inferenz-Engine und kein Trainingsframework. Um ein Open-Source-Modell zu fine-tunen, nutzen Sie Hugging Face Transformers mit PEFT\/LoRA, Axolotl oder LLaMA Factory. Exportieren Sie die fine-getunten Gewichte ins GGUF-Format und importieren Sie sie anschlie\u00dfend mittels <code>ollama create<\/code>. Der <a href=\"https:\/\/convly.ai\/de\/what-is-ollama-complete-guide-2026\/\">Kompletter Ollama-Leitfaden<\/a> in Ollama \u2013 dieser Workflow wird dort ausf\u00fchrlich beschrieben.<\/p>\n<h3>Welche GPU sollte ich kaufen, um 7B-Modelle lokal auszuf\u00fchren?<\/h3>\n<p>F\u00fcr Q4-Quantisierung (4,5 GB VRAM): RTX 3060 mit 12 GB VRAM (ca. 250 USD gebraucht) oder RTX 4060 Ti mit 16 GB VRAM (ca. 450 USD neu). F\u00fcr FP16 (14 GB VRAM): RTX 4060 Ti mit 16 GB VRAM oder RTX 4070 (550\u2013600 USD). F\u00fcr 70B-Modelle in Q4-Quantisierung (40 GB): zwei RTX 3090 mit je 24 GB VRAM (ca. 1800 USD gebraucht) oder A100 mit 40 GB VRAM (ab 6000 USD gebraucht). Der <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">Beste-GPUs-Leitfaden<\/a> bewertet Preis-Leistungs-Verh\u00e4ltnisse f\u00fcr jede GPU-Klasse anhand praktischer Benchmarks.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DR OpenAI has not released a model family called &#8220;GPT-OSS&#8221;. The search term likely refers to running open-source alternatives (Llama [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2200,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2199","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2199","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2199"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2199\/revisions"}],"predecessor-version":[{"id":2201,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2199\/revisions\/2201"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2200"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2199"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2199"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2199"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}