Сучасний ринок штучного інтелекту продовжує стрімко розвиватися, стираючи межі між важкими хмарними системами та рішеннями для локального запуску. Яскравим підтвердженням цього став нещодавній експеримент із моделлю Qwen3.8-27B, яка продемонструвала неочікувано високі результати в спеціалізованих бенчмарках для програмування. Примітно, що успіх був досягнутий на сильно стисненій 4-бітній версії, що відкриває зовсім нові перспективи для розробників та ентузіастів, які бажають використовувати потужні мовні моделі прямо на власному залізі без відправки конфіденційного коду на віддалені сервери.
Суть експерименту та перші успіхи
Згідно з опублікованими даними тестів DeepSWE, локальна модель Qwen3.8-27B на одному із завдань з рев'ю коду змогла пройти 98% перевірок і набрати бездоганні 12 із 12 балів. Для порівняння, передові хмарні системи на цьому ж конкретному підмножині тестів набирають у середньому близько 96,6%. такий прорив викликав бурхливе обговорення в професійній спільноті, адже йдеться про модель із відкритим вихідним кодом, запущену в оптимізованому та сильно квантованому вигляді, а не про закритий промисловий гігант із колосальними обчислювальними ресурсами.
Технічні характеристики та локальний запуск
Окрім вражаючих результатів у кодингу, ключовою перевагою Qwen3.8-27B залишається її доступність для локальної інфраструктури. Завдяки 4-бітному стисканню модель займає від 13 до 18 ГБ відеопам'яті, що дозволяє запускати її на споживчих відеокартах — наприклад, на популярних рішеннях із 16 ГБ VRAM за грамотного налаштування або на потужних споживчих флагманах на кшталт RTX 4090 із 24 ГБ пам'яті. На останній конфігурації швидкість генерації досягає вражаючих 115 токенів на секунду, роблячи взаємодію зі штучним інтелектом практично миттєвою та комфортною для повсякденних завдань програмування.
Протирічні дані
Тим не менш, експерти закликають зберігати здорову частку скептицизму і не поспішати ховати хмарні флагманські моделі. Сам автор експерименту підкреслює, що успіх був зафіксований лише під час одного конкретного запуску на вузькому завданні. Повний бенчмарк DeepSWE включає 113 різноманітних тестів, у рамках яких найкращі хмарні системи в середньому справляються з 70–74% завдань, проходячи конкретну перевірку без єдиної помилки лише приблизно у двох випадках із трьох. Крім того, у межах глибшого тестування з 43 прихованих перевірок модель пройшла 40, але підсумковий бінарний результат виявився нульовим, оскільки завдання повністю вирішити все ж не вдалося. Таким чином, поточні досягнення Qwen3.8-27B демонструють колосальний потенціал відкритих локальних нейромереж, але поки що не означають їхнього повного технічного паритету з передовими хмарними екосистемами у всіх сценаріях використання.