14 августа 2026 года команда Alibaba Cloud выкатила в открытый доступ линейку моделей нового поколения — Qwen 3.8, включая флагманские веса Qwen 3.8 27B под открытой лицензией Apache 2.0. После мартовских и майских анонсов Qwen 3.5 и 3.7 сообщество ждало от релиза 3.8 качественного скачка в обработке мультимодальных данных и рассуждений (Chain-of-Thought). Мы провели независимое стресс-тестирование в условиях боевого продакшена — более 240 генераций — на сервере с видеокартой NVIDIA GeForce RTX 3090 (24 ГБ VRAM), процессором AMD Ryzen 9 5900X и 128 ГБ RAM под управлением ComfyUI с движком llama-mtmd-cli. В сравнении участвовали три модели: Qwen 3.5 27B, Qwen 3.8 27B и компактная Qwen 3.8 9B, каждая — в двух режимах: с включённым («Think») и выключенным («NoThink») скрытым мышлением.

Результаты преподнесли несколько неожиданных сюрпризов, главный из которых — поведение встроенного блока рассуждений.

1. Парадокс мышления: почему Qwen 3.8 в режиме «Think» работает быстрее

В теории генерация внутренних токенов цепочки мыслей (тег think) должна замедлять задачу. Однако на задачах анализа изображений (Vision) и творческой генерации Qwen 3.8 27B в режиме Think отработала на 20–42% быстрее, чем в NoThink. Разбор татуировки «Бизон» (Vision): NoThink — 71,5 сек (4 667 знаков / 607 слов), Think — 41,6 сек (3 214 знака / 390 слов), ускорение в 1,7 раза. Разбор «Боксерских перчаток»: NoThink — 76,0 сек (4 657 знаков), Think — 48,0 сек (3 731 знак), ускорение на 37%. Перевод лонгрида «Йормунганд» на английский: NoThink — 142,9 сек, Think — 121,6 сек.

Столбчатая диаграмма бенчмарка времени генерации текста моделями Qwen 3.8 9B, Qwen 3.5 27B и Qwen 3.8 27B в режиме NoThink на видеокарте RTX 3090 24GB VRAM для короткой новости, лонгрида и vision-задачи

Секрет парадокса — в архитектуре: Qwen 3.8 изначально оптимизирована под CoT. Когда мышление активно, модель за 3–4 секунды планирует логическую структуру ответа и сразу генерирует точный, сжатый текст без повторов. Когда же режим принудительно отключён, нейросеть «блуждает» в выводе, раздувая объём синонимами и «водой» на 30–45%. Поскольку скорость вывода в токенах/сек одинакова, избыточный объём текста приводит к задержкам по секундомеру.

2. Физика объёмов: скорость генерации и лимиты памяти RTX 3090

Тестирование на профиле Heavy 16K (ctx_size: 16384, max_tokens: 4096) показало чёткое разделение по пропускной способности VRAM. Короткая новость (~500 сл / 4k зн.): Qwen 3.8 9B (NoThink) — 15,6 с (214 зн/с), Qwen 3.5 27B (NoThink) — 49,9 с (87 зн/с), Qwen 3.8 27B (NoThink) — 69,0 с (67 зн/с), Qwen 3.8 27B (Think) — 74,8 с (60 зн/с). Лонгрид 11 КБ (~1600 сл / 14k зн.): 57,6 с / 152,3 с / 158,7 с / 151,6 с соответственно. Vision-анализ одного фото тату: 19,2 с / 40,7 с / 55,3 с / 45,2 с.

Сравнительная диаграмма Qwen 3.8 27B: время генерации и объём вывода в режимах Think и NoThink на RTX 3090 — парадокс мышления

Модель 9B (вес ~6 ГБ в VRAM) работает со скоростью ~28 токенов/сек (~220–250 знаков/сек): даже лонгрид на 15 000 символов переводится менее чем за минуту. Модели 27B (вес ~17 ГБ в VRAM) упираются в пропускную способность памяти GPU — стабильные ~9–10 токенов/сек (~75–88 знаков/сек), и длинная статья физически требует около 2,5 минут.

3. Языковой профиль: кто «мажет» на переводах

На украинском Qwen 3.8 9B непригодна для продакшена: допускает грубые русизмы и ошибки согласования («Ночна атака... попадань уривків» вместо «Нічна атака... влучання уламків», «Міровий змія» вместо «Світовий змій»). Qwen 3.5 27B и 3.8 27B (Think) — эталон: безупречная грамматика, живой литературный язык и точная терминология («ураження енергетичної інфраструктури», «ДСНС»). На немецком 9B путает роды («der Tattoo» вместо «das Tattoo») и склонения, тогда как 27B-модели идеально строят составные слова («Lebensmitteltransporter», «Jörmungandr-Tätowierung») и соблюдают управление глаголов. На английском все модели выдают уровень C1–C2, при этом у Qwen 3.8 словарный запас отличается повышенной академичностью.

4. Расчёт продакшена: как уложить 400 статей и 1 200 переводов в сутки на 1 GPU

Рассмотрим конвейер контентного портала: 400 уникальных статей в сутки и их перевод на 3 языка (1 200 переводов). Суточный фонд времени одной RTX 3090 — 24 часа (86 400 секунд). Все на Qwen 3.8 27B (NoThink): 400 × 55 с + 1 200 × 69 с = 29,1 часа (121% загрузки) — сервер не справляется. Все на Qwen 3.8 27B (Think): 400 × 50 с + 1 200 × 75 с = 30,5 часа (127%) — перегрузка. Все на Qwen 3.5 27B (NoThink): 400 × 45 с + 1 200 × 49,9 с = 21,6 часа (90%) — укладывается, но ухудшается качество оригиналов (потери ссылок и форматирования).

Титровый слайд сравнения Qwen 3.8 и Qwen 3.5: тест-драйв на RTX 3090, скорость, мышление и мультиязычные переводы, конвейер на 400 статей в сутки

Оптимальный гибрид — написание на Qwen 3.8 (Think) + переводы на Qwen 3.5 (NoThink): генерация 400 статей на 3.8 — ~5,5 часа, 1 200 переводов на 3.5 — ~16,6 часа, итого 22,1 часа (92% мощности одного GPU). Это даёт максимальное качество статей и стабильный поток переводов на одном сервере без очередей.

5. Практические выводы и внедрение

Тесты доказали: Qwen 3.8 — мощный инструмент для генерации глубокого аналитического контента и работы с визуальными образами (Vision). Но бездумный перевод всех задач на одну модель ведёт либо к перерасходу серверных мощностей, либо к падению качества на неосновных языках. Грамотное проектирование конвейера (разделение генерации и локализации) позволяет выжать максимум из одного потребительского GPU класса RTX 3090 / RTX 4090 и экономить тысячи долларов на облачных API. Если вашему проекту требуется настройка автономных контент-пайплайнов, развертывание локальных LLM на арендованных GPU-серверах, оптимизация очередей ComfyUI/Python или построение мультиязычных новостных сетей под ключ — ознакомьтесь с нашими решениями и форматами интеграции на странице Услуги и разработка. Мы помогаем бизнесу внедрять современные нейросетевые технологии с минимальной себестоимостью и гарантированной отказоустойчивостью.