Qwen 3.8 mit Ollama installieren dauert zwei Befehle: Ollama installieren, dann ollama run qwen3.8 ausführen. Das Modell heißt in der Ollama-Bibliothek qwen3.8, der Standard-Tag lädt die 27-Milliarden-Variante in 4-bit-Quantisierung mit 18 GB Download. Dafür brauchst du laut den RAM-Angaben von unsloth.ai (Stand 16.09.2026) 16 bis 19 GB freien Arbeitsspeicher, bei 8-bit rund 31 GB, bei voller Genauigkeit 56 GB. Zwei Dinge musst du nach dem ersten Start ändern, sonst wirst du enttäuscht: Ollama startet mit 4.096 Token Kontext, und Qwen 3.8 denkt standardmäßig lange nach, bevor es antwortet.
Ich betreibe Qwen 3.8 lokal, allerdings nicht unter Ollama, sondern unter SGLang auf einem Nvidia DGX Spark. Ollama ist auf dem Spark installiert, bislang ohne Modelle. Auf meinem MacBook Pro habe ich das Modell mit LM Studio gemessen. Deshalb kann ich dir zwei Dinge geben: die offiziellen Ollama-Schritte aus der Doku und die ehrliche Einordnung, wann Ollama für dieses Modell reicht und wann nicht. Alles zu KI in meinem Betrieb sammle ich auf der Seite KI. Wenn du erst einmal wissen willst, welche Werkzeuge es überhaupt gibt, lies zuerst Lokale KI einrichten: Ollama bis SGLang, dort ist Ollama die erste von drei Stufen. Hier geht es nur um diese erste Stufe, Schritt für Schritt.
Was Qwen 3.8-27B ist und warum es sich für lokal eignet
Qwen 3.8-27B ist laut Modellkarte auf Hugging Face ein dichtes Modell mit 27 Milliarden Parametern unter Apache-2.0-Lizenz. Es verarbeitet nativ 262.144 Token Kontext, sieht Bilder und hat Thinking standardmäßig eingeschaltet, mit dem Parameter reasoning_effort in den Stufen xhigh (Standard), medium und low. Die Ollama-Bibliothek nennt 27,8 Milliarden Parameter, die Modellkarte 27B; ich lasse beide Angaben so stehen.
Für den lokalen Betrieb ist die Größe der Grund, warum das Modell interessant ist: 27 Milliarden Parameter passen in 4-bit auf eine einzelne Grafikkarte mit 24 GB oder einen Mac mit genug Unified Memory, und trotzdem kann das Modell Werkzeuge aufrufen und lange Dokumente lesen. Wo es im Vergleich zu anderen offenen Modellen steht, habe ich in Open-Source-KI-Modelle im Vergleich sortiert. Meine eigene Erfahrung mit dem Modell im Dauerbetrieb steht in Qwen 3.8 lokal: Erfahrung mit DGX Spark.
Hardware-Check: welche Quantisierung auf welchen Speicher passt
Bevor du etwas herunterlädst, rechne mit deinem freien Arbeitsspeicher, nicht mit dem eingebauten. Auf einem Mac teilt sich das Modell den Speicher mit allem anderen, auf einem PC zählt der VRAM der Grafikkarte, und was nicht hineinpasst, landet im langsameren Hauptspeicher. Die Download-Größen stammen aus der Ollama-Tagliste, abgerufen am 18.09.2026. Der Speicherbedarf ist die RAM-Empfehlung von unsloth.ai zu diesem Modell (Stand 16.09.2026); die Zahlen mit dem Zusatz „ggml-org" sind die Dateigrößen der GGUF-Quants im Repo ggml-org/Qwen3.8-27B-GGUF auf Hugging Face (abgerufen 18.09.2026), also kein RAM-Wert. Die Formate sind nicht gleichartig, deshalb steht jedes in einer eigenen Zeile. Ollama selbst nennt keinen RAM-Mindestwert für das Modell, und der Kontext kostet zusätzlich Speicher, für den ich keine belegte Zahl je Kontextlänge habe.
Für meine beiden Rechner heißt das: Auf dem MacBook Pro M3 Max mit 64 GB passt 8-bit, und genau so habe ich es mit LM Studio auch laufen, mit 27,5 GiB belegtem RAM. Auf dem DGX Spark mit 119 GB nutzbarem Unified Memory passt sogar BF16, dort nutze ich aber den NVFP4-Checkpoint unter SGLang, weil er schneller ist. Mit 16 GB Gesamtspeicher würde ich das Modell nicht empfehlen; die Rechnung dazu steht in den Fragen unten.
Ein Punkt, den viele Anleitungen verschweigen: die Download-Zeit. An meinem Standort liegt die Leitung bei rund 2 MB/s. Der 18-GB-Standard-Tag braucht damit rechnerisch etwa zweieinhalb Stunden, der BF16-Tag einen Arbeitstag. Plane den ersten ollama run also nicht fünf Minuten vor einem Termin ein.
Ollama installieren auf Mac, Linux und Windows
Die Installation läuft laut Ollama-README auf GitHub über einen Befehl je Betriebssystem. Ollama selbst steht unter MIT-Lizenz.
# macOS und Linux
curl -fsSL https://ollama.com/install.sh | sh
# Windows PowerShell
irm https://ollama.com/install.ps1 | iex
Wenn du Ollama lieber in Docker betreibst, zum Beispiel auf einem Server mit Nvidia-Karte, nennt die Ollama-Doku auf ihrer Docker-Seite diese Befehle, wobei die GPU-Variante das NVIDIA Container Toolkit und sudo nvidia-ctk runtime configure --runtime=docker voraussetzt:
# nur CPU
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
# mit Nvidia-GPU
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
# Modell im Container starten
docker exec -it ollama ollama run qwen3.8
Die Modelle liegen danach unter ~/.ollama/models auf dem Mac und unter /usr/share/ollama/.ollama/models auf Linux. Das solltest du wissen, bevor die 18 GB auf einer kleinen Systemplatte landen.
Qwen 3.8 in Ollama laden und starten: die Tags erklärt
Der Befehl von der Modellseite in der Ollama-Bibliothek lädt den Standard-Tag und öffnet direkt einen Chat im Terminal:
ollama run qwen3.8
Willst du eine andere Quantisierung, hängst du den Tag mit Doppelpunkt an. pull lädt nur herunter, run lädt und startet:
ollama pull qwen3.8:27b-q8_0
ollama run qwen3.8:27b-q8_0
Die Tags mit mtp im Namen verweisen auf Multi-Token Prediction. Belegt ist zweierlei: Die Modellkarte nennt MTP als Teil des Trainings, und die Ollama-Tagliste führt 27b-mtp-q4_K_M, 27b-mtp-q8_0 und 27b-mtp-bf16 (abgerufen 18.09.2026). Nicht belegt ist, ob und wie die Ollama-Laufzeit diese Gewichte nutzt, etwa für Speculative Decoding, und was das an Geschwindigkeit bringt; in der Ollama-Doku steht dazu nichts, und ich habe es nicht gemessen. Wer es wissen will, misst beide Tags auf der eigenen Hardware gegeneinander. nvfp4 ist das Format, das auch die vLLM-Rezepte für Blackwell-Karten nennen, mlx ist laut Drittquellen für Apple Silicon gedacht, offiziell bestätigt ist das auf der Ollama-Seite nicht. Alle Tags haben 256K Kontext und verarbeiten Text und Bild. Was Ollama an Geschwindigkeit daraus macht, habe ich noch nicht selbst gemessen; die einzigen Zahlen, die ich dir mit Beleg nennen kann, stammen aus SGLang und LM Studio, dazu unten mehr.
Die zwei Fallen: 4.096 Token Kontext und Thinking auf xhigh
Falle eins: Ollama startet jedes Modell laut FAQ der Ollama-Doku mit einem Standardkontext von 4.096 Token. Das Modell könnte 262.144, du bekommst 4.096, und lange Dokumente werden stillschweigend abgeschnitten. Drei Wege aus der Doku, den Kontext zu setzen:
# für den ganzen Dienst, beim Start
OLLAMA_CONTEXT_LENGTH=8192 ollama serve
# im laufenden Chat
/set parameter num_ctx 32768
# per API: Feld num_ctx in den options der Anfrage
Größerer Kontext kostet Speicher, und zwar zusätzlich zu den Werten in der Tabelle. Steigere den Wert also schrittweise und beobachte, ob das Modell noch komplett im schnellen Speicher bleibt.
Falle zwei: Thinking. Qwen 3.8 hat laut Modellkarte Thinking standardmäßig an und reasoning_effort auf xhigh. Das ist für schwierige Aufgaben gut, für eine kurze Frage im Terminal bedeutet es, dass du lange auf einen Textblock Überlegungen wartest, bevor die Antwort kommt. Die Modellkarte nennt die Stufen medium und low; wie du die Stufe in Ollama setzt, steht weder in der Ollama-FAQ noch auf der Modellseite, die ich am 16.09.2026 geprüft habe. Prüfe ollama run --help und die Modellseite auf aktuelle Angaben, bevor du mit Skripten drumherum baust.
Ollama im Netz freigeben und per API ansprechen
Ollama hört standardmäßig nur auf dem eigenen Rechner unter Port 11434. Soll ein anderer Rechner im Netz das Modell nutzen, setzt du laut FAQ die Umgebungsvariable OLLAMA_HOST für den Dienst. Ich würde das nur in einem abgeschotteten Netz oder über ein VPN tun; bei mir läuft der Zugriff auf den Spark über Tailscale.
Für Programme gibt es drei Wege, die alle in der Doku stehen: die eigene API unter http://localhost:11434/api/chat, eine OpenAI-kompatible Schnittstelle unter http://localhost:11434/v1 und eine Anthropic-kompatible unter /v1/messages. Damit sprechen Werkzeuge, die für OpenAI oder Claude gebaut sind, mit deinem lokalen Qwen, ohne dass du ihren Code änderst. So bindest du einen Terminal-Coding-Agenten an, wie ich es in Claude Code Alternative ohne Cloud: Pi beschrieben habe.
Zwei Einstellungen aus der FAQ, die im Betrieb zählen: keep_alive hält ein Modell nach der letzten Anfrage standardmäßig 5 Minuten im Speicher, ein negativer Wert hält es dauerhaft geladen. OLLAMA_MAX_LOADED_MODELS erlaubt standardmäßig 3 gleichzeitig geladene Modelle; bei einem 27B-Modell reicht dein Speicher meist nur für eines.
Wann Ollama nicht reicht: mein Setup mit SGLang
Ollama ist der einfachste Einstieg, und für einen Rechner mit einem Nutzer ist es oft die richtige Wahl. Bei mir läuft Qwen 3.8 trotzdem unter SGLang, aus einem Grund: Geschwindigkeit bei gleichzeitigen Anfragen. Auf dem DGX Spark messe ich mit dem NVFP4-Checkpoint und Speculative Decoding 50,7 Tokens pro Sekunde beim Erzeugen, gemessen mit 300 Token in einem Stream vom Mac aus über Tailscale. Das Upstream-Rezept nennt 32 bis 40 Tokens pro Sekunde im Agentic Coding. Auf dem MacBook Pro M3 Max mit LM Studio in 8-bit sind es 11 Tokens pro Sekunde.
Der Preis für SGLang ist Aufwand: Docker, ein Startskript mit --mem-fraction-static 0.50 (höher kann den Host einfrieren, das ist die Unified-Memory-Falle des Spark), erster Start rund 9 Minuten. Das ist nichts für den Feierabend-Test, sondern für einen Server, der mehrere Nutzer oder Agenten bedient. Eine Ollama-Messung auf dem Spark habe ich noch nicht gemacht, und ich nenne dir keine Zahl, die ich nicht selbst gesehen habe. Wenn du überlegst, ob sich dafür eigene Hardware lohnt, lies Eigener KI-Server: Hardware und Kosten und meinen DGX Spark im Test: lohnt sich der Kauf?.
Häufige Fragen
Läuft Qwen 3.8 auf 16 GB RAM?
Rechnerisch knapp und in der Praxis meist nicht sinnvoll. Der 4-bit-Tag braucht laut unsloth.ai 16 bis 19 GB, dazu kommen Betriebssystem, Browser und der Kontext. Auf einem Mac mit 16 GB Unified Memory bleibt für das Modell zu wenig übrig; auf einem PC mit 16 GB VRAM landet in der Regel ein Teil im Hauptspeicher und bremst. Mit 24 GB wird es entspannt, das ist auch die Größe, die unsloth für 4-bit nennt.
Welchen Ollama-Tag soll ich nehmen: q4, q8 oder bf16?
Nimm den größten, der mit Luft in deinen Speicher passt. Q4_K_M ist der Standard und für die meisten Aufgaben ausreichend; Q8_0 ist näher am Original und braucht 31 GB; BF16 ist das unveränderte Modell mit 56 GB und lohnt sich nur, wenn du es ohnehin hast. Ich fahre auf dem Mac 8-bit und auf dem Spark NVFP4.
Wie schalte ich das Nachdenken bei Qwen 3.8 ab?
Die Modellkarte nennt die Stufen xhigh, medium und low für reasoning_effort; unsloth nennt zusätzlich none. Einen Ollama-Befehl dafür habe ich in der Ollama-Doku am 16.09.2026 nicht gefunden, deshalb schreibe ich hier keinen hin. Schau in ollama run --help und auf die Modellseite, dort ändert sich das mit jeder Version.
Kann Qwen 3.8 in Ollama Bilder lesen?
Ja, alle Tags in der Ollama-Bibliothek sind als Text und Bild markiert, und die Modellkarte nennt Vision als nativen Bestandteil. Die GGUF-Dateien bei ggml-org auf Hugging Face bringen dafür eine eigene Projektionsdatei mit, die 629 MB bis 931 MB groß ist.
Ist Qwen 3.8 kostenlos für Firmen nutzbar?
Das Modell steht laut Modellkarte unter Apache 2.0, einer Lizenz, die kommerzielle Nutzung erlaubt. Auf der Ollama-Modellseite ist keine Lizenz angegeben, maßgeblich ist die Modellkarte. Was du damit tun darfst und welche Daten du hineingibst, ist eine eigene Frage; dazu habe ich Lokale KI und Datenschutz: Cloud oder Server? geschrieben, das ist keine Rechtsberatung.
Wie lange dauert der Download von Qwen 3.8?
Das hängt allein an deiner Leitung. Der Standard-Tag hat 18 GB; bei meinen rund 2 MB/s sind das rechnerisch etwa zweieinhalb Stunden, bei 100 MB/s wären es rechnerisch drei Minuten.
Kann ich Qwen 3.8 in Ollama mit Claude Code oder anderen Agenten nutzen?
Ollama bietet laut Doku eine OpenAI-kompatible und eine Anthropic-kompatible Schnittstelle. Welche Agenten damit brauchbar arbeiten, ist eine andere Frage als die Anbindung; ich habe bislang Pi gegen mein lokales Qwen laufen, und der Vergleich zu Claude Code ist bei mir qualitativ, ohne Benchmark.
Wie du weitermachst
Installiere Ollama, starte ollama run qwen3.8 und stell dem Modell eine Frage aus deinem Alltag, während der Download noch warm ist. Setze dann den Kontext hoch und probiere ein echtes Dokument. Wenn das Modell dir taugt und du mehr willst als einen Rechner mit einem Nutzer, ist der nächste Schritt die zweite und dritte Stufe aus Lokale KI einrichten: Ollama bis SGLang. Was SGLang auf dem Spark bei mir bringt und welche Fallen es hat, steht in Qwen 3.8 lokal: Erfahrung mit DGX Spark. Und ob Qwen 3.8 überhaupt das richtige Modell für deine Aufgabe ist, klärt Open-Source-KI-Modelle im Vergleich.