14 серпня 2026 року команда Alibaba Cloud випустила у вільний доступ лінійку моделей нового покоління — Qwen 3.8, включаючи флагманські ваги Qwen 3.8 27B під відкритою ліцензією Apache 2.0. Після березневих та травневих анонсів Qwen 3.5 та 3.7 спільнота чекала на реліз 3.8 якісного стрибка в обробці мультимодальних даних та міркуваннях (Chain-of-Thought). Ми провели незалежне стрес-тестування в умовах бойового продакшену — понад 240 генерацій — на сервері з відеокартою NVIDIA GeForce RTX 3090 (24 ГБ VRAM), процесором AMD Ryzen 9 5900X та 128 ГБ RAM під керуванням ComfyUI з рушієм llama-mtmd-cli. У порівнянні взяли участь три моделі: Qwen 3.5 27B, Qwen 3.8 27B та компактна Qwen 3.8 9B, кожна — у двох режимах: із увімкненим («Think») та вимкненим («NoThink») прихованим мисленням.
Результати подарували кілька несподіваних сюрпризів, головним із яких стало поведінка вбудованого блоку міркувань.
1. Парадокс мислення: чому Qwen 3.8 у режимі «Think» працює швидше
У теорії генерація внутрішніх токенів ланцюжка думок (тег think) має сповільнювати задачу. Однак на задачах аналізу зображень (Vision) та творчої генерації Qwen 3.8 27B у режимі Think відпрацювала на 20–42% швидше, ніж у NoThink. Розбір татуювання «Бизон» (Vision): NoThink — 71,5 с (4 667 знаків / 607 слів), Think — 41,6 с (3 214 знаків / 390 слів), прискорення у 1,7 рази. Розбір «Боксерських рукавиць»: NoThink — 76,0 с (4 657 знаків), Think — 48,0 с (3 731 знак), прискорення на 37%. Переклад лонгріду «Йормунганд» англійською: NoThink — 142,9 с, Think — 121,6 с.
Секрет парадокса — в архітектурі: Qwen 3.8 спочатку оптимізована під CoT. Коли мислення активне, модель за 3–4 секунди планує логічну структуру відповіді та одразу генерує точний, стислий текст без повторів. Коли ж режим примусово вимкнено, нейросеть «блукать» у висновку, роздуваючи обсяг синонімами та «водою» на 30–45%. Оскільки швидкість виводу в токенах/сек однакова, надмірний обсяг тексту призводить до затримок за секундоміром.
2. Фізика обсягів: швидкість генерації та ліміти пам'яті RTX 3090
Тестування на профілі Heavy 16K (ctx_size: 16384, max_tokens: 4096) показало чітке розділення за пропускною здатністю VRAM. Коротка новина (~500 сл / 4к зн.): Qwen 3.8 9B (NoThink) — 15,6 с (214 зн/с), Qwen 3.5 27B (NoThink) — 49,9 с (87 зн/с), Qwen 3.8 27B (NoThink) — 69,0 с (67 зн/с), Qwen 3.8 27B (Think) — 74,8 с (60 зн/с). Лонгрід 11 КБ (~1600 сл / 14к зн.): 57,6 с / 152,3 с / 158,7 с / 151,6 с відповідно. Vision-аналіз одного фото тату: 19,2 с / 40,7 с / 55,3 с / 45,2 с.
Модель 9B (вага ~6 ГБ у VRAM) працює зі швидкістю ~28 токенів/сек (~220–250 знаків/сек): навіть лонгрід на 15 000 символів перекладається менш ніж за хвилину. Моделі 27B (вага ~17 ГБ у VRAM) стикаються з пропускною здатністю пам'яті GPU — стабільні ~9–10 токенів/сек (~75–88 знаків/сек), і довга стаття фізично потребує близько 2,5 хвилин.
3. Мовний профіль: хто «маже» на перекладах
Українською Qwen 3.8 9B непридатна для продакшену: допускає грубі русизми та помилки узгодження («Нічна атака... попадань уривків» замість «Нічна атака... влучання уламків», «Міровий змія» замість «Світовий змій»). Qwen 3.5 27B та 3.8 27B (Think) — еталон: бездоганна граматика, живий літературний мовлення та точна термінологія («ураження енергетичної інфраструктури», «ДСНС»). Німецькою 9B плутає роди («der Tattoo» замість «das Tattoo») та відмінки, тоді як 27B-моделі ідеально будують складні слова («Lebensmitteltransporter», «Jörmungandr-Tätowierung») та дотримуються керування дієслів. Англійською всі моделі видають рівень C1–C2, при цьому у Qwen 3.8 словниковий запас відрізняється підвищеною академічністю.
4. Розрахунок продакшену: як укласти 400 статей та 1 200 перекладів на добу на 1 GPU
Розглянемо конвеєр контентного порталу: 400 унікальних статей на добу та їх переклад на 3 мови (1 200 перекладів). Добовий фонд часу однієї RTX 3090 — 24 години (86 400 секунд). Все на Qwen 3.8 27B (NoThink): 400 × 55 с + 1 200 × 69 с = 29,1 год (121% завантаження) — сервер не справляється. Все на Qwen 3.8 27B (Think): 400 × 50 с + 1 200 × 75 с = 30,5 год (127%) — перевантаження. Все на Qwen 3.5 27B (NoThink): 400 × 45 с + 1 200 × 49,9 с = 21,6 год (90%) — укладається, але погіршується якість оригіналів (втрати посилань та форматування).
Оптимальний гібрид — написання на Qwen 3.8 (Think) + переклади на Qwen 3.5 (NoThink): генерація 400 статей на 3.8 — ~5,5 год, 1 200 перекладів на 3.5 — ~16,6 год, підсумок 22,1 год (92% потужності одного GPU). Це дає максимальну якість статей та стабільний потік перекладів на одному сервері без черг.
5. Практичні висновки та впровадження
Тести довели: Qwen 3.8 — потужний інструмент для генерації глибокого аналітичного контенту та роботи з візуальними образами (Vision). Але бездумний переклад усіх задач на одну модель веде або до перерасходу серверних потужностей, або до падіння якості на неосновних мовах. Грамотне проектування конвеєра (розділення генерації та локалізації) дозволяє вичавити максимум з одного споживчого GPU класу RTX 3090 / RTX 4090 та економити тисячі доларів на хмарних API. Якщо вашому проекту потрібна налаштування автономних контент-пайплайнів, розгортання локальних LLM на орендованих GPU-серверах, оптимізація черг ComfyUI/Python або побудова мультимовних новинних мереж під ключ — ознайомтеся з нашими рішеннями та форматами інтеграції на сторінці Послуги та розробка. Ми допомагаємо бізнесу впроваджувати сучасні нейросіткові технології з мінімальною собівартістю та гарантованою відмовостійкістю.


