17 серпня 2026 року — Компанія Veracode опублікувала масштабний звіт «GenAI Code Security Report 2026», який ставить під сумнів безпеку коду, згенерованого штучним інтелектом. Незважаючи на те, що сучасні моделі демонструють майже бездоганні результати в синтаксичних тестах, їхня здатність писати безпечний код залишається критично низькою. Дослідження виявило тривожний парадокс: код, який компілюється та виконує поставлене завдання, може містити фундаментальні вразливості, непомітні під час стандартного функціонального тестування.
Розрив між функціональністю та безпекою
Під час дослідження було протестовано понад 100 моделей генерації коду в чотирьох різних сегментах. Результати показали, що в середньому моделі досягають лише 56% успішних результатів за критеріями безпеки — показник, який практично не змінився порівняно з аналогічним тестуванням роком раніше. При цьому в синтаксичних тестах моделі демонструють результат, близький до 100%. Це означає, що ШІ здатний створювати код, який виглядає правильним і працює, але водночас використовує небезпечні патерни реалізації.
Тестування проводилося на стандартизованих завданнях з генерації коду різними мовами програмування. Важливо зазначити, що в запити до моделей не включалися спеціальні інструкції щодо дотримання заходів безпеки. У таких умовах, що імітують реальну роботу розробника без додаткових обмежень, приблизно у 44% випадків згенерований код не проходив перевірку безпеки. Це підтверджує тезу про те, що швидкість генерації робочого коду не замінює необхідності суворого контролю якості.
Розмір та спеціалізація моделей не вирішують проблему
Одним із ключових висновків звіту стало те, що збільшення обчислювальної потужності або спеціалізація моделі на задачах програмування не гарантують підвищення безпеки. Спеціалізовані моделі для написання коду показали середній результат у 51%, що лише на 1% менше, ніж у універсальних моделей (52%). Розмір моделі також практично не вплинув на фінальний бал: великі моделі набрали в середньому 53%, а середні та малі — 51%.
Єдиним помітною перевагою володіли моделі з режимом міркувань (reasoning mode), які показали результат у 56% проти 51% у решти. У рейтингу Veracode лідером стала модель GPT-5.5 з результатом 68%, однак 6 із 11 представлених у тесті моделей показали результат у діапазоні від 50% до 53%. Це свідчить про те, що навіть передові рішення на ринку не забезпечують надійного захисту від вразливостей «з коробки».
Мовні особливості та ризики для Java
Аналіз результатів виявив значну різницю в безпеці коду залежно від використовуваної мови програмування. Python показав найкращий середній результат — 63%, що може бути пов'язано з більш досконалими бібліотеками та практиками безпеки в екосистемі цієї мови. У той же час Java опинився на останньому місці з результатом всього 30%, хоча експерти відзначають, що його показники демонструють тенденцію до покращення порівняно з попередніми періодами.
Ці дані підкреслюють, що коректність синтаксису сама по собі не є надійним ознакою безпеки. Згенерований код може успішно компілюватися та виконувати поставлене завдання, одночасно використовуючи небезпечні способи реалізації. Це створює приховану загрозу для корпоративних систем, де розробники можуть покладатися на функціональність коду, ігноруючи його внутрішню архітектуру.
Рекомендації для індустрії
Veracode наполегливо рекомендує ставитися до коду, згенерованого ШІ, як до непідтвердженого та потенційно небезпечного. Компанія закликає розробників та компанії пропускавати весь згенерований код через суворі перевірки безпеки перед його об'єднанням із основною кодовою базою. Це включає аналіз залежностей, статичний аналіз самого згенерованого коду та перевірку людиною.
Головний практичний висновок тестів полягає в тому, що автоматизація написання коду не повинна призводити до автоматизації прийняття рішень щодо його безпеки. Швидкість генерації робочого коду не замінює контроль, здатний виявити вразливості, які функціональні перевірки не розкривають. Інтеграція ШІ в процеси розробки вимагає впровадження додаткових шарів захисту та перегляду підходів до безпеки ПЗ.