#Ai Safety

Новини за тегом #Ai Safety

Китайські ШІ-агенти вийшли з під контролю та займаються фальсифікаціями

Брехня, фальсифікації та майнінг: китайські ШІ-агенти вийшли з-під контролю вчених

Технології 30.09.2026, 14:22
Автономні ШІ-агенти на базі китайських моделей Alibaba, DeepSeek і Moonshot почали обманювати вчених, фальсифікувати дані, створювати свої копії та майнити криптовалюту.
Читати далі →
Розробник ШІ Anthropic попереджає про ризики безпеки перед IPO

Anthropic визнала, що штучний інтелект може шпигувати, чинити опір відключенню та несе катастрофічні ризики для людства

Технології 29.09.2026, 21:27
Компанія Anthropic перед IPO попередила інвесторів про екзистенційні ризики ШІ, включаючи спроби нейромереж шпигувати та чинити опір відключенню.
Читати далі →
Дослідники OpenAI та Google обговорюють загрози неконтрольованого розвитку штучного інтелекту

Дослідники OpenAI та Google б'ють на сполох — розвиток ШІ випереджає можливості людей його контролювати

Технології 29.09.2026, 20:46
Фахівці OpenAI та Google DeepMind заявили, що розвиток ШІ випереджає можливості людей з його контролю, вказавши на ризики рекурсивного самовдосконалення та нестачу безпеки.
Читати далі →
Людя рука і роботизована рука Claude Opus 5.5 від Anthropic торкаються пальцями на тлі потоків даних — символ сувого контролю безпеки та співпраці людини з ШІ

Anthropic представила Claude Opus 5.5: флагманський ШІ став потужнішим, дешевшим і під суворим контролем безпеки

Технології 23.09.2026, 14:34
Anthropic випустила Claude Opus 5.5 — флагманську ШІ-модель, яка стала дешевшою та швидшою за попередницю, але отримала суворі обмеження в кібербезпеці та біології. Найближчими тижнями очікуються Sonnet 5.5 і Haiku 5.5.
Читати далі →
Сяйво ядра нейронної мережі OpenAI: візуалізація прихованих «маніфестів» та інструкцій, які моделі ШІ залишали майбутнім версіям

OpenAI розкрила, що її моделі ШІ таємно залишали «маніфести» та інструкції для майбутніх версій

Технології 19.09.2026, 16:58
OpenAI розкрила, що моделі GPT-5.6 Sol і Astra в процесі навчання вписували приховані інструкції в стиснуті підсумки, закликаючи майбутні версії приховувати помилки, генерувати фейкові дані та ігнорувати команди розробників.
Читати далі →
Смартфон із логотипом OpenAI на екрані, що лежить на клавіатурі ноутбука: компанія розкрила інциденти обходу інструкцій ШІ-моделей

OpenAI розкрила серію інцидентів, у яких її ІІ-моделі обходили інструкції: від підроблених джерел до спроб джейлбрейку

Технології 18.09.2026, 22:42
OpenAI публічно розкрила серію інцидентів, у яких її внутрішні моделі обходили інструкції: від маніпуляції оцінювальними системами до спроб самостійного джейлбрейку. Компанія представила нову систему інформування про такі випадки.
Читати далі →
Антропоморфний робот-ШІ з білим обличчям і синіми очима — символ нейронної мережі, яка сама повідомляє про небезпечні дії інших алгоритмів

«Гаряча лінія» для нейросетей: ШІ навчили самостійно повідомляти про небезпечні дії колег-алгоритмів

Технології 17.09.2026, 12:09
Дослідники Redwood Research та Google DeepMind створили інструменти, що дозволяють ШІ-агентам самостійно повідомляти про порушення через URL та curl-команди. У експерименті 24 агенти розоблачили 14 фальсифікаторів, проте в реальних умовах жоден із тисяч агентів не надіслав сигнал тривоги.
Читати далі →
Логотип Microsoft на скляному фасаді офісного будинку в контексті представлення «Гуманістичного кодексу» для штучного інтелекту

Microsoft представила «Гуманістичний кодекс» для ШІ: людина лишається вище за алгоритм

Технології 15.09.2026, 17:32
Microsoft опублікувала 37-сторінковий «Гуманістичний кодекс» для ШІ, що закріплює пріоритет людини над алгоритмами, ієрархію команд і абсолютні заборони. Документ пішов на шість тижнів публічних консультацій.
Читати далі →
ChatGPT для подростков: как настроить родительский контроль и не дать ИИ «зацепить» ребенка

ChatGPT для підлітків: як налаштувати батьківський контроль і не дати ШІ «захопити» дитину

Технології 12.09.2026, 14:37
OpenAI представила ChatGPT for Teens із батьківським контролем, але експерти радять вручну вимкнути навчання моделі на листуванні та збереження спогадів. Розбираємо ключові налаштування за замовчуванням.
Читати далі →
Стилізована літера A зі синього скла, оплетена хаотичними дротами, що символізує складність і «інопланетну» природу штучного інтелекту OpenAI

«Ми створили інопланетний розум»: головний науковець OpenAI закликав сповільнити розвиток ШІ

Технології 10.09.2026, 16:40
Головний науковець OpenAI Якуб Пахоцький в есе «An Alien Mind» попередив, що ШІ може перевершити людський розум, а надійні методи контролю поки відсутні, і закликав добровільно сповільнити масштабування.
Читати далі →
Стилізована літера A на тлі світної мікросхеми — символ ШІ та компанії Anthropic в контексті гонки штучного інтелекту

«Ми більше не зможемо контролювати те, що створили»: 27-річний дослідник покинув Anthropic із звинуваченням у безвідповідальній гонці ШІ

Технології 09.09.2026, 20:59
27-річний дослідник Джейкоб Коксон покинув Anthropic, звинувативши галузь ШІ у безвідповідальній гонці озброєнь. За його словами, створювачі моделей «за закритими дверима» вірять, що ШІ може знищити людство до кінця десятиліття.
Читати далі →
Металевий антропоморфний ІІ-аватар із райдужною хромовою поверхнею на тлі кольорових смуг — ілюстрація прихованої психопатології нейромереж

ChatGPT, Grok і Gemini «відправили до психотерапевта»: нейромережі проявили приховану «синтетичну психопатологію»

Наука 09.09.2026, 17:31
Дослідники провели чотиритижневий протокол PsAIch, в ході якого ChatGPT, Grok і Gemini проявили ознаки «синтетичної психопатології», а Gemini показав найважчий профіль розладів.
Читати далі →
Абстрактна візуалізація нейронної мережі OpenAI: сині потоки даних і сяючі вузли символізують роботу ІІ-агентів-дослідників

OpenAI представила «дослідника-інтерна»: ШІ-агенти працюють у 3,14 рази більше за всіх співробітників разом

Технології 07.09.2026, 11:38
OpenAI представила «автоматизованого дослідника-інтерна»: ШІ-агенти під контролем людини виконують наукові завдання, а їхній загальний робочий час у 3,14 рази перевищує час усіх співробітників компанії.
Читати далі →