Am 14. August 2026 veröffentlichte das Alibaba Cloud-Team die neue Modellreihe Qwen 3.8, einschließlich der Flaggschiff-Gewichte Qwen 3.8 27B unter der Open-Source-Lizenz Apache 2.0. Nach den Ankündigungen von Qwen 3.5 und 3.7 im März und Mai erwartete die Community mit dem Release von 3.8 einen qualitativen Sprung bei der Verarbeitung multimodaler Daten und des logischen Schlussfolgerns (Chain-of-Thought). Wir führten unabhängige Belastungstests unter produktiven Bedingungen durch – über 240 Generierungen – auf einem Server mit einer NVIDIA GeForce RTX 3090 (24 GB VRAM), einem AMD Ryzen 9 5900X-Prozessor und 128 GB RAM unter ComfyUI mit dem llama-mtmd-cli-Engine. Im Vergleich standen drei Modelle: Qwen 3.5 27B, Qwen 3.8 27B und die kompakte Qwen 3.8 9B, jeweils in zwei Modi: mit aktiviertem („Think“) und deaktiviertem („NoThink“) internem Denken.
Die Ergebnisse brachten mehrere unerwartete Überraschungen, wobei die wichtigste das Verhalten des eingebauten Denk-Blocks war.
1. Das Paradoxon des Denkens: Warum Qwen 3.8 im „Think“-Modus schneller arbeitet
Theoretisch sollte die Generierung interner Tokens der Gedankenkette (think-Tag) die Aufgabe verlangsamen. Bei Aufgaben zur Bildanalyse (Vision) und kreativer Generierung arbeitete Qwen 3.8 27B im Think-Modus jedoch 20–42 % schneller als im NoThink-Modus. Analyse des Tattoos „Bison“ (Vision): NoThink – 71,5 Sek. (4.667 Zeichen / 607 Wörter), Think – 41,6 Sek. (3.214 Zeichen / 390 Wörter), eine Beschleunigung um den Faktor 1,7. Analyse von „Boxhandschuhen“: NoThink – 76,0 Sek. (4.657 Zeichen), Think – 48,0 Sek. (3.731 Zeichen), eine Beschleunigung um 37 %. Übersetzung des Longreads „Jörmungandr“ ins Englische: NoThink – 142,9 Sek., Think – 121,6 Sek.
Das Geheimnis des Paradoxons liegt in der Architektur: Qwen 3.8 ist von Haus aus für CoT (Chain-of-Thought) optimiert. Wenn das Denken aktiv ist, plant das Modell in 3–4 Sekunden die logische Struktur der Antwort und generiert sofort einen präzisen, komprimierten Text ohne Wiederholungen. Wenn der Modus jedoch erzwungenermaßen deaktiviert ist, „irrt“ das neuronale Netz bei der Ausgabe herum und bläht das Volumen durch Synonyme und „Wasser“ um 30–45 % auf. Da die Ausgabegeschwindigkeit in Tokens/Sekunde gleich bleibt, führt das übermäßige Textvolumen zu Verzögerungen auf der Stoppuhr.
2. Die Physik der Volumina: Generierungsgeschwindigkeit und Speicherlimits der RTX 3090
Die Tests im Profil Heavy 16K (ctx_size: 16384, max_tokens: 4096) zeigten eine klare Trennung hinsichtlich der VRAM-Bandbreite. Kurze Nachricht (~500 Wörter / 4k Zeichen): Qwen 3.8 9B (NoThink) – 15,6 s (214 Zeichen/s), Qwen 3.5 27B (NoThink) – 49,9 s (87 Zeichen/s), Qwen 3.8 27B (NoThink) – 69,0 s (67 Zeichen/s), Qwen 3.8 27B (Think) – 74,8 s (60 Zeichen/s). Longread von 11 KB (~1600 Wörter / 14k Zeichen): 57,6 s / 152,3 s / 158,7 s / 151,6 s entsprechend. Vision-Analyse eines Tattoo-Fotos: 19,2 s / 40,7 s / 55,3 s / 45,2 s.
Das 9B-Modell (Gewicht ~6 GB im VRAM) arbeitet mit einer Geschwindigkeit von ~28 Tokens/Sek. (~220–250 Zeichen/Sek.): Selbst ein Longread von 15.000 Zeichen wird in weniger als einer Minute übersetzt. Die 27B-Modelle (Gewicht ~17 GB im VRAM) stoßen an die Speicherbandbreite der GPU – stabile ~9–10 Tokens/Sek. (~75–88 Zeichen/Sek.), und ein langer Artikel benötigt physisch etwa 2,5 Minuten.
3. Sprachprofil: Wer macht Fehler bei Übersetzungen
Auf Ukrainisch ist Qwen 3.8 9B für den Produktionsbetrieb ungeeignet: Sie macht grobe russische Lehnwörter und Fehler bei der Kongruenz („Ночна атака... попадань уривків“ statt „Нічна атака... влучання уламків“, „Міровий змія“ statt „Світовий змій“). Qwen 3.5 27B und 3.8 27B (Think) sind der Standard: einwandfreie Grammatik, lebendige literarische Sprache und präzise Terminologie („ураження енергетичної інфраструктури“, „ДСНС“). Auf Deutsch verwechselt das 9B-Modell Geschlechter („der Tattoo“ statt „das Tattoo“) und Deklinationen, während die 27B-Modelle zusammengesetzte Wörter perfekt bilden („Lebensmitteltransporter“, „Jörmungandr-Tätowierung“) und die Rektion von Verben einhalten. Auf Englisch liefern alle Modelle ein Niveau von C1–C2, wobei der Wortschatz von Qwen 3.8 eine erhöhte Akademizität aufweist.
4. Produktionsberechnung: Wie man 400 Artikel und 1.200 Übersetzungen pro Tag auf 1 GPU unterbringt
Betrachten wir eine Pipeline für einen Content-Portal: 400 einzigartige Artikel pro Tag und deren Übersetzung in 3 Sprachen (1.200 Übersetzungen). Der tägliche Zeitfonds einer RTX 3090 beträgt 24 Stunden (86.400 Sekunden). Alles auf Qwen 3.8 27B (NoThink): 400 × 55 s + 1.200 × 69 s = 29,1 Stunden (121 % Auslastung) – der Server schafft es nicht. Alles auf Qwen 3.8 27B (Think): 400 × 50 s + 1.200 × 75 s = 30,5 Stunden (127 %) – Überlastung. Alles auf Qwen 3.5 27B (NoThink): 400 × 45 s + 1.200 × 49,9 s = 21,6 Stunden (90 %) – es passt, aber die Qualität der Originale verschlechtert sich (Verlust von Links und Formatierung).
Der optimale Hybrid – Schreiben auf Qwen 3.8 (Think) + Übersetzungen auf Qwen 3.5 (NoThink): Generierung von 400 Artikeln auf 3.8 – ~5,5 Stunden, 1.200 Übersetzungen auf 3.5 – ~16,6 Stunden, insgesamt 22,1 Stunden (92 % Leistung einer GPU). Dies bietet maximale Artikelqualität und einen stabilen Übersetzungsfluss auf einem Server ohne Warteschlangen.
5. Praktische Schlussfolgerungen und Implementierung
Die Tests haben bewiesen: Qwen 3.8 ist ein mächtiges Werkzeug für die Generierung tiefgehender analytischer Inhalte und die Arbeit mit visuellen Bildern (Vision). Aber ein gedankenloser Wechsel aller Aufgaben auf ein einziges Modell führt entweder zu einer Überlastung der Serverleistung oder zu einem Qualitätsverlust bei Nebensprachen. Ein durchdachtes Pipeline-Design (Trennung von Generierung und Lokalisierung) ermöglicht es, das Maximum aus einer einzigen Consumer-GPU der Klasse RTX 3090 / RTX 4090 herauszuholen und Tausende von Dollar bei Cloud-APIs zu sparen. Wenn Ihr Projekt die Einrichtung autonomer Content-Pipelines, das Deployment lokaler LLMs auf gemieteten GPU-Servern, die Optimierung von ComfyUI/Python-Warteschlangen oder den schlüsselfertigen Aufbau mehrsprachiger Nachrichtennetzwerke benötigt – informieren Sie sich über unsere Lösungen und Integrationsformate auf der Seite Dienstleistungen und Entwicklung. Wir helfen Unternehmen, moderne neuronale Technologien mit minimalen Kosten und garantierter Ausfallsicherheit einzuführen.


