{"id":2485,"date":"2026-08-30T20:13:51","date_gmt":"2026-08-30T20:13:51","guid":{"rendered":"https:\/\/convly.ai\/?p=2485"},"modified":"2026-08-30T20:13:51","modified_gmt":"2026-08-30T20:13:51","slug":"ollama-local-ai","status":"publish","type":"post","link":"https:\/\/convly.ai\/de\/ollama-local-ai\/","title":{"rendered":"Ollama Local AI: Vollst\u00e4ndige Einrichtungsanleitung und Modellvoraussetzungen"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>Zusammenfassung<\/strong><\/p>\n<ul>\n<li>Ollama erm\u00f6glicht es Ihnen, KI-Sprachmodelle wie Llama, Mistral und Gemma lokal \u00fcber ein einziges Kommandozeilenwerkzeug auszuf\u00fchren<\/li>\n<li>Installation in Sekunden: <code>curl https:\/\/ollama.com\/install.sh | sh<\/code> (Linux\/macOS) oder laden Sie den Windows-Installer herunter<\/li>\n<li>Modelle f\u00fcr den Einstiegsbereich ben\u00f6tigen 4\u20138 GB VRAM; Produktionsmodelle mit 70 Milliarden Parametern ben\u00f6tigen bei 4-Bit-Quantisierung etwa 40 GB VRAM<\/li>\n<li>Kostengleichgewicht im Vergleich zu Cloud-APIs: ca. 500.000 Tokens\/Monat f\u00fcr ein 70B-Modell, weniger f\u00fcr kleinere Modelle<\/li>\n<\/ul>\n<\/div>\n<p>Ollama is a command-line tool that packages AI language models into containers you can run on your own hardware. Instead of sending prompts to OpenAI, Anthropic, or Google and paying per token, you download a model once\u2014Llama 3.3 70B, Mistral 7B, Phi-4, or any of <a href=\"https:\/\/convly.ai\/de\/ollama-models-list-2026\/\">Dutzende unterst\u00fctzten Modelle<\/a>\u2013 und f\u00fchren die Inferenz vollst\u00e4ndig auf Ihrer GPU oder CPU durch. Ihre Daten bleiben lokal, nach den anf\u00e4nglichen Hardwarekosten fallen keine Kosten pro Anfrage an, und Sie behalten die volle Kontrolle \u00fcber Verhalten und Verf\u00fcgbarkeit des Modells.<\/p>\n<p>Der Kompromiss liegt in der Hardware: Sie ben\u00f6tigen gen\u00fcgend VRAM, um das Modell zu halten. Ein 7B-Parameter-Modell mit 4-Bit-Quantisierung ben\u00f6tigt etwa 4\u20135 GB GPU-Speicher \u2013 ausreichend f\u00fcr eine Consumer-GPU wie die RTX 4060. Ein 70B-Modell ben\u00f6tigt bei 4-Bit-Quantisierung rund 40 GB VRAM und erfordert daher eine Workstation-GPU wie die RTX 6000 Ada oder einen Multi-GPU-Setup. Die <a href=\"https:\/\/convly.ai\/de\/llm-vram-calculator\/\">VRAM-Rechner<\/a> zeigt die exakten Anforderungen f\u00fcr jede Modellgr\u00f6\u00dfe und jeden Quantisierungsgrad an.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a94c1976d172\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Umschalten<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a94c1976d172\"  aria-label=\"Umschalten\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/de\/ollama-local-ai\/#Installing_Ollama\" >Ollama installieren<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/de\/ollama-local-ai\/#Running_Your_First_Model\" >Ihr erstes Modell ausf\u00fchren<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/de\/ollama-local-ai\/#Model_Selection_and_VRAM_Requirements\" >Modellauswahl und VRAM-Anforderungen<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/de\/ollama-local-ai\/#Common_Commands_and_Configuration\" >H\u00e4ufig verwendete Befehle und Konfiguration<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/de\/ollama-local-ai\/#Hardware_Requirements\" >Hardware-Anforderungen<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/de\/ollama-local-ai\/#Cost_Comparison_Local_vs_API\" >Kostenvergleich: Lokale Ausf\u00fchrung vs. API<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/de\/ollama-local-ai\/#Frequently_Asked_Questions\" >H\u00e4ufig gestellte Fragen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Installing_Ollama\"><\/span>Ollama installieren<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Linux<\/h3>\n<p>F\u00fchren Sie das offizielle Installations-Skript aus, das Ihre Distribution erkennt und den <code>Ollama<\/code> Dienst einrichtet:<\/p>\n<pre>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/pre>\n<p>Dadurch wird die Bin\u00e4rdatei nach <code>\/usr\/local\/bin\/ollama<\/code> und registriert einen systemd-Dienst. Der Dienst startet automatisch und bleibt nach einem Neustart aktiv. Zur \u00dcberpr\u00fcfung:<\/p>\n<pre>ollama --version<\/pre>\n<p>Wenn Sie sich hinter einem Unternehmensproxy befinden oder eine manuelle Installation ben\u00f6tigen, laden Sie die Bin\u00e4rdatei direkt von den <a href=\"https:\/\/github.com\/ollama\/ollama\/releases\" rel=\"noopener\" target=\"_blank\">GitHub-Releases<\/a> herunter und platzieren Sie sie in Ihrem <code>PATH<\/code>.<\/p>\n<h3>macOS<\/h3>\n<p>Laden Sie das <code>.dmg<\/code> Installer von <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a>, \u00f6ffnen Sie ihn und ziehen Sie Ollama in den Ordner \u201eAnwendungen\u201c. Die Men\u00fcleisten-App startet den lokalen Server unter <code>localhost:11434<\/code>. Um Ollama \u00fcber das Terminal zu nutzen:<\/p>\n<pre>ollama --version<\/pre>\n<p>macOS users on Apple Silicon (M1\/M2\/M3\/M4) can run models using unified memory instead of discrete VRAM. A Mac Studio with 192 GB unified memory can serve a Llama 4 Maverick (240 GB at 4-bit) by swapping to disk, though inference speed drops significantly when exceeding physical RAM.<\/p>\n<h3>Windows<\/h3>\n<p>Laden Sie das <code>OllamaSetup.exe<\/code> Installer von <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a> und f\u00fchren Sie ihn aus. Der Installer f\u00fcgt <code>ollama.exe<\/code> zu Ihrem PATH hinzu und startet den Hintergrunddienst. \u00d6ffnen Sie PowerShell oder die Eingabeaufforderung und \u00fcberpr\u00fcfen Sie die Installation mit:<\/p>\n<pre>ollama --version<\/pre>\n<p>Windows Subsystem for Linux (WSL2) mit GPU-Passthrough wird unterst\u00fctzt: Installieren Sie Ollama innerhalb Ihrer WSL2-Distribution gem\u00e4\u00df den Linux-Anweisungen und stellen Sie sicher, dass die NVIDIA-CUDA-Treiber auf dem Windows-Host installiert sind.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_Your_First_Model\"><\/span>Ihr erstes Modell ausf\u00fchren<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Laden Sie das Modell Llama 3.1 8B herunter und f\u00fchren Sie es aus \u2013 ein leistungsf\u00e4higes Modell zur Befolgung von Anweisungen, das in 5 GB VRAM Platz findet:<\/p>\n<pre>ollama run llama3.1:8b<\/pre>\n<p>Ollama l\u00e4dt das Modell (ca. 4,7 GB) nach <code>~\/.ollama\/models<\/code> (Linux\/macOS) oder <code>%USERPROFILE%.ollamamodels<\/code> (Windows) herunter, l\u00e4dt es in den Arbeitsspeicher und \u00f6ffnet eine interaktive Eingabeaufforderung. Geben Sie eine Nachricht ein, dr\u00fccken Sie Enter, und das Modell generiert lokal eine Antwort. Dr\u00fccken Sie <code>Strg+D<\/code> oder geben Sie <code>\/bye<\/code> zum Beenden.<\/p>\n<p>Um ein Modell im Hintergrund auszuf\u00fchren und per API darauf zuzugreifen:<\/p>\n<pre>ollama serve<\/pre>\n<p>Dies startet einen Server unter <code>http:\/\/localhost:11434<\/code>. In einem anderen Terminalfenster:<\/p>\n<pre>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"llama3.1:8b\",\n  \"prompt\": \"Erkl\u00e4ren Sie TCP-Congestion-Control\",\n  \"stream\": false\n}'<\/pre>\n<p>Die Antwort wird als JSON zur\u00fcckgegeben, wobei die vollst\u00e4ndige Generierung im Feld <code>response<\/code> enthalten ist.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Selection_and_VRAM_Requirements\"><\/span>Modellauswahl und VRAM-Anforderungen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama unterst\u00fctzt Open-Weight-Modelle von Meta, Mistral AI, Microsoft, Google, Alibaba und anderen. Die folgende Tabelle zeigt beliebte Modelle sowie ihren Speicherbedarf bei 4-Bit-Quantisierung, basierend auf der <a href=\"https:\/\/convly.ai\/de\/vram-requirements-every-major-llm-2026\/\">VRAM-Anforderungsdatenbank<\/a>:<\/p>\n<table>\n<thead>\n<tr>\n<th>Modell<\/th>\n<th>Parameter<\/th>\n<th>Kontextl\u00e4nge<\/th>\n<th>VRAM bei 4-Bit<\/th>\n<th>Einsatzgebiet<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>8B<\/td>\n<td>128 K<\/td>\n<td>~5 GB<\/td>\n<td>Allgemeine Anweisungsbefolgung, passt auf Consumer-GPUs<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B<\/td>\n<td>7B<\/td>\n<td>32K<\/td>\n<td>~4,5 GB<\/td>\n<td>Schnelle Inferenz, gute Codegenerierung<\/td>\n<\/tr>\n<tr>\n<td>Phi-4<\/td>\n<td>14B<\/td>\n<td>16K<\/td>\n<td>~9 GB<\/td>\n<td>Schlussfolgern und Mathematik, effizient f\u00fcr seine Gr\u00f6\u00dfe<\/td>\n<\/tr>\n<tr>\n<td>Mistral NeMo 12B<\/td>\n<td>12B<\/td>\n<td>128 K<\/td>\n<td>~7,5 GB<\/td>\n<td>Aufgaben mit langem Kontext, mehrsprachig<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 8B<\/td>\n<td>8B<\/td>\n<td>128 K<\/td>\n<td>~5 GB<\/td>\n<td>Starke multilinguale Leistung, konkurrenzf\u00e4hig mit gr\u00f6\u00dferen Modellen<\/td>\n<\/tr>\n<tr>\n<td>Gemma 3 4B<\/td>\n<td>4 Mrd.<\/td>\n<td>128 K<\/td>\n<td>ca. 3 GB<\/td>\n<td>Kleinstes praktikables Modell, l\u00e4uft auf integrierten GPUs<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>70B<\/td>\n<td>128 K<\/td>\n<td>~40 GB<\/td>\n<td>Produktionsreife Schlussfolgerungsf\u00e4higkeit, vergleichbar mit GPT-4-Klasse<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1 Distill Llama 70B<\/td>\n<td>70B<\/td>\n<td>128 K<\/td>\n<td>~40 GB<\/td>\n<td>Destilliertes Schlussfolgerungsmodell mit starker Leistung in MINT-F\u00e4chern<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>So listen Sie alle verf\u00fcgbaren Modelle auf Ihrem System auf:<\/p>\n<pre>ollama list<\/pre>\n<p>So l\u00f6schen Sie ein Modell und gewinnen Speicherplatz auf der Festplatte frei:<\/p>\n<pre>ollama rm llama3.1:8b<\/pre>\n<p>Modell-Tags folgen dem Format <code>name:size<\/code> oder <code>name:version<\/code>. Wird das Tag weggelassen, wird standardm\u00e4\u00dfig <code>:latest<\/code>verwendet. Den vollst\u00e4ndigen Katalog finden Sie unter <a href=\"https:\/\/convly.ai\/de\/best-local-llms-to-run-on-ollama-2026\/\">beste lokale LLMs f\u00fcr Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Common_Commands_and_Configuration\"><\/span>H\u00e4ufig verwendete Befehle und Konfiguration<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>F\u00fchren Sie ein Modell mit benutzerdefinierten Parametern aus:<\/p>\n<pre>ollama run llama3.1:8b --temperature 0.7 --top-p 0.9<\/pre>\n<p>\u00dcbergeben Sie eine Eingabeaufforderung direkt, ohne den interaktiven Modus zu betreten:<\/p>\n<pre>ollama run llama3.1:8b \"Schreiben Sie eine Python-Funktion zum Parsen von ISO-8601-Datumsangaben\"<\/pre>\n<p>Laden Sie ein Modell in den Arbeitsspeicher, ohne eine Eingabeaufforderung anzuzeigen (n\u00fctzlich zum Vorw\u00e4rmen vor der Verarbeitung von Anfragen):<\/p>\n<pre>ollama pull llama3.1:8b<\/pre>\n<p>Pr\u00fcfen Sie, welche Modelle aktuell im VRAM geladen sind:<\/p>\n<pre>ollama ps<\/pre>\n<p>Legen Sie die Anzahl der GPU-Schichten fest, die ausgelagert werden sollen (n\u00fctzlich f\u00fcr teilweises GPU-Offloading bei begrenztem VRAM):<\/p>\n<pre>OLLAMA_NUM_GPU=35 ollama run llama3.3:70b<\/pre>\n<p>Standardm\u00e4\u00dfig entl\u00e4dt Ollama alle Schichten auf die GPU. Durch Verringerung von <code>OLLAMA_NUM_GPU<\/code> bleiben einige Schichten auf der CPU, wodurch Geschwindigkeit zugunsten geringeren VRAM-Verbrauchs geopfert wird. Ein 70B-Modell mit 20 Schichten auf der GPU ben\u00f6tigt m\u00f6glicherweise nur 20 GB VRAM, l\u00e4uft aber 3\u20135\u00d7 langsamer.<\/p>\n<p>Um das Modellspeicherverzeichnis zu \u00e4ndern, setzen Sie <code>OLLAMA_MODELS<\/code> vor dem Ausf\u00fchren:<\/p>\n<pre>export OLLAMA_MODELS=\/mnt\/nvme\/ollama_models\nollama pull llama3.1:8b<\/pre>\n<p>Ollama nutzt Memory-mapped Files, daher laden Modelle von NVMe schneller als von SATA-SSDs. Auf einem modernen System ist mit einer Ladezeit von 10\u201315 Sekunden f\u00fcr ein 8B-Modell und 60\u201390 Sekunden f\u00fcr ein 70B-Modell zu rechnen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Hardware_Requirements\"><\/span>Hardware-Anforderungen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Der limitierende Faktor ist das VRAM, nicht die Rechenleistung. Ein 4-Bit-quantisiertes 70B-Modell ben\u00f6tigt 40 GB GPU-Speicher, l\u00e4uft aber durchaus akzeptabel auf Architekturen der vorherigen Generation. Eine RTX 3090 (24 GB) kann zwei 8B-Modelle oder ein 30B-Modell bedienen. Eine RTX 4090 (24 GB) bew\u00e4ltigt dieselbe Last mit einer um 30\u201340 % h\u00f6heren Durchsatzrate dank der verbesserten Tensor-Kernen von Ada Lovelace.<\/p>\n<p>Empfohlene GPUs nach Budget:<\/p>\n<ul>\n<li><strong>Einsteiger ($300\u2013500):<\/strong> RTX 4060 Ti 16 GB bew\u00e4ltigt 8B- und 12B-Modelle<\/li>\n<li><strong>Prosumer ($1000\u20131500):<\/strong> RTX 4090 oder A4000 Ada f\u00fchrt 30B-Modelle problemlos aus<\/li>\n<li><strong>Workstation ($4000\u20137000):<\/strong> RTX 6000 Ada (48 GB) oder zwei RTX 4090 f\u00fcr 70B-Modelle<\/li>\n<li><strong>Mehrfachmodell-Bereitstellung ($10.000+):<\/strong> A100 80 GB oder H100 80 GB f\u00fcr mehrere 70B-Instanzen<\/li>\n<\/ul>\n<p>Weitere Details finden Sie im <a href=\"https:\/\/convly.ai\/de\/best-gpus-for-local-llms-2026\/\">GPU-Kaufberater<\/a> f\u00fcr detaillierte Vergleiche. Nutzer von Apple Silicon profitieren vom einheitlichen Arbeitsspeicher: Ein M2 Ultra mit 192 GB kann Modelle ausf\u00fchren, f\u00fcr die sonst eine NVIDIA-Hardware im Wert von 25.000 US-Dollar erforderlich w\u00e4re \u2013 allerdings liegt die Token-Durchsatzrate um das 2\u20133-Fache niedriger als bei einer A100.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Cost_Comparison_Local_vs_API\"><\/span>Kostenvergleich: Lokale Ausf\u00fchrung vs. API<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Cloud-APIs berechnen pro Token. <a href=\"https:\/\/convly.ai\/de\/models\/\">Claude Sonnet 5<\/a> kostet 2,00 US-Dollar pro Million Eingabetokens und 10,00 US-Dollar pro Million Ausgabetokens. Eine typische Sitzung mit einem Code-Assistenten erzeugt monatlich 500.000 Tokens (250.000 Eingabe-, 250.000 Ausgabetokens), was j\u00e4hrliche Kosten von 3.000 US-Dollar bedeutet.<\/p>\n<p>Ein selbstgehostetes Llama-3.3-70B-Modell auf einer 6.000-US-Dollar-Workstation (RTX 6000 Ada) verursacht nach dem Hardwarekauf keine weiteren marginalen Kosten. Der Break-even-Punkt liegt bei etwa 500.000 Tokens pro Monat. Darunter sind Cloud-APIs kosteng\u00fcnstiger; dar\u00fcber lohnt sich lokale Inferenz. Nutzen Sie den <a href=\"https:\/\/convly.ai\/de\/self-hosting-vs-api-calculator\/\">Self-Hosting-Rechner<\/a> , um Ihre spezifische Arbeitslast zu modellieren.<\/p>\n<p>Kleinere Modelle erreichen den Break-even schneller. Ein 8B-Modell auf einer 500-US-Dollar-RTX-4060-Ti amortisiert sich bei moderater Nutzung (100.000 Tokens\/Monat) innerhalb von drei bis vier Monaten gegen\u00fcber Cloud-APIs. Der Vorteil liegt in der Privatsph\u00e4re: Ihr Code, Ihre Dokumente und Ihre internen Daten verlassen niemals Ihr Netzwerk.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Kann Ollama Modelle ausschlie\u00dflich auf der CPU ausf\u00fchren?<\/h3>\n<p>Ja, allerdings ist die Inferenz je nach Modellgr\u00f6\u00dfe 10\u201350\u00d7 langsamer. Ein 8B-Modell generiert 1\u20133 Tokens pro Sekunde auf einer modernen Ryzen- oder Intel-CPU, verglichen mit 40\u201380 Tokens\/Sek. auf einer RTX 4090. Setzen Sie <code>OLLAMA_NUM_GPU=0<\/code> , um ausschlie\u00dflich CPU-basierte Inferenz zu erzwingen. Praktisch f\u00fcr Batch-Verarbeitung oder Anwendungen mit geringem Datenverkehr, jedoch ungeeignet f\u00fcr interaktive Chats.<\/p>\n<h3>Wie beeinflusst Quantisierung die Qualit\u00e4t?<\/h3>\n<p>4-Bit-Quantisierung reduziert die Modellgr\u00f6\u00dfe um 75 % bei nur geringf\u00fcgigem Qualit\u00e4tsverlust \u2013 Benchmarks zeigen einen Genauigkeitsr\u00fcckgang von 1\u20133 % bei MMLU und HumanEval im Vergleich zu FP16. 3-Bit-(Q3-)Quantisierung verringert die Gr\u00f6\u00dfe weiter, verschlechtert aber Schlussfolgerungsf\u00e4higkeit und Befolgung von Anweisungen sp\u00fcrbar. Ollama verwendet standardm\u00e4\u00dfig Q4_0, um Qualit\u00e4t und VRAM-Verbrauch auszugleichen. Sie k\u00f6nnen 8-Bit- oder FP16-Versionen durch Angabe entsprechender Tags wie <code>llama3.1:8b-q8_0<\/code>abrufen, wodurch sich der VRAM-Bedarf verdoppelt.<\/p>\n<h3>Kann ich Modelle mit Ollama feinjustieren?<\/h3>\n<p>Nein. Ollama ist eine Inferenz-Laufzeitumgebung, kein Trainingsframework. Um ein Modell anzupassen, verwenden Sie Tools wie Hugging Face Transformers, Axolotl oder LLaMA Factory, exportieren das Ergebnis im GGUF-Format und importieren es \u00fcber eine Modelfile in Ollama. Der gesamte Prozess ist im GitHub-Repository von Ollama unter <code>docs\/import.md<\/code>.<\/p>\n<h3>Was ist die Ollama-API und wie verwende ich sie?<\/h3>\n<p>Ollama stellt eine OpenAI-kompatible REST-API unter <code>localhost:11434<\/code>. Der <code>\/api\/generate<\/code> bereit, die Komplettierungen verarbeitet; der Endpunkt <code>\/api\/chat<\/code> unterst\u00fctzt Mehr-Runden-Gespr\u00e4che mit Nachrichtenverlauf. Sie k\u00f6nnen Ollama nahtlos in bestehende Codebasen integrieren, indem Sie einfach die Basis-URL austauschen: Statt <code>https:\/\/api.openai.com\/v1<\/code>rufen Sie Ihren Client auf <code>http:\/\/localhost:11434<\/code>auf. Viele Frameworks wie LangChain und LlamaIndex bieten native Ollama-Unterst\u00fctzung.<\/p>\n<h3>Wie viele Anfragen pro Sekunde kann Ollama verarbeiten?<\/h3>\n<p>Ein einmal geladenes Modell bearbeitet jeweils nur eine Anfrage gleichzeitig. Der Durchsatz h\u00e4ngt von der Modellgr\u00f6\u00dfe und der Hardware ab: Eine RTX 4090 erzeugt f\u00fcr ein 8B-Modell 60\u201380 Tokens\/Sekunde, f\u00fcr ein 70B-Modell 15\u201325 Tokens\/Sekunde. Um mehrere gleichzeitige Benutzer zu bedienen, k\u00f6nnen Sie entweder horizontal skalieren (mehrere Maschinen) oder das Application-Layer-Batching nutzen. Ollama bietet keine eingebaute Anfragewarteschlange; daf\u00fcr ben\u00f6tigen Sie einen Reverse-Proxy wie NGINX oder einen Load-Balancer.<\/p>\n<h3>Kann ich mehrere Modelle gleichzeitig ausf\u00fchren?<\/h3>\n<p>Ja, sofern ausreichend VRAM zur Verf\u00fcgung steht. Laden Sie ein zweites Modell mit <code>ollama run<\/code> in einem neuen Terminal, w\u00e4hrend das erste Modell l\u00e4uft. Ollama teilt die GPU zwischen den Modellen. Zwei 8B-Modelle (insgesamt ca. 10 GB) laufen problemlos auf einer 24-GB-RTX-4090. Der Wechsel zwischen Modellen erfolgt nahezu sofort, wenn beide bereits geladen sind; andernfalls sind Ladezeiten von 10\u201390 Sekunden je nach Modellgr\u00f6\u00dfe zu erwarten.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DROllama lets you run AI models like Llama, Mistral, and Gemma locally via a single command-line tool Install in seconds: [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2486,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2485","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2485","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/comments?post=2485"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2485\/revisions"}],"predecessor-version":[{"id":2487,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/posts\/2485\/revisions\/2487"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media\/2486"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/media?parent=2485"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/categories?post=2485"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/de\/wp-json\/wp\/v2\/tags?post=2485"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}