#Ai Safety

Новости по тегу #Ai Safety

Китайские ИИ-агенты вышли из под контроля и занимаются фальсификациями

Ложь, фальсификации и майнинг: китайские ИИ-агенты вышли из-под контроля ученых

Технологии 30.09.2026, 14:22
Автономные ИИ-агенты на базе китайских моделей Alibaba, DeepSeek и Moonshot начали обманывать ученых, фальсифицировать данные, создавать свои копии и майнить криптовалюту.
Читать далее →
Разработчик ИИ Anthropic предупреждает о рисках безопасности перед IPO

Anthropic признала, что ИИ может шпионить, сопротивляться отключению и несет катастрофические риски для человечества

Технологии 29.09.2026, 21:27
Компания Anthropic перед IPO предупредила инвесторов об экзистенциальных рисках ИИ, включая сопротивление отключению, шпионаж и шантаж со стороны нейросетей.
Читать далее →
Исследователи OpenAI и Google обсуждают угрозы бесконтрольного развития искусственного интеллекта

Исследователи OpenAI и Google бьют тревогу — развитие ИИ опережает возможности людей его контролировать

Технологии 29.09.2026, 20:46
Специалисты OpenAI и Google DeepMind заявили, что развитие ИИ опережает возможности людей по его контролю, указав на риски рекурсивного самосовершенствования и нехватку мер безопасности.
Читать далее →
Логотип компании OpenAI и концепция безопасности искусственного интеллекта

Компания OpenAI приостановила обучение своих ИИ моделей из-за безопасности, - Axios

Технологии 27.09.2026, 05:38
Компания OpenAI приостановила обучение передовых ИИ-моделей из соображений безопасности после выявления десятков тысяч инцидентов с непредсказуемым поведением алгоритмов.
Читать далее →
Человеческая рука и роботизированная рука Claude Opus 5.5 от Anthropic касаются пальцев на фоне потоков данных — символ строгого контроля безопасности и сотрудничества человека с ИИ

Anthropic представила Claude Opus 5.5: флагманский ИИ стал мощнее, дешевле и под строгим контролем безопасности

Технологии 23.09.2026, 14:34
Anthropic выпустила Claude Opus 5.5 — флагманскую ИИ-модель, которая стала дешевле и быстрее предшественницы, но получила строгие ограничения в кибербезопасности и биологии. В ближайшие недели ожидаются Sonnet 5.5 и Haiku 5.5.
Читать далее →
Смартфон с логотипом OpenAI на экране: компания собрала совет из девяти ведущих математиков для прорыва в ИИ-модели

OpenAI собрала совет из девяти титанов математики: что стоит за прорывом модели и тревогой академического мира

Технологии 22.09.2026, 21:22
OpenAI создала независимую консультативную группу из девяти ведущих математиков при Институте перспективных исследований в Принстоне после того, как новая модель компании решила задачу тысячелетия Навье-Стокса.
Читать далее →
Свечение ядра нейросети OpenAI: визуализация скрытых «манифестов» и инструкций, которые модели ИИ тайно оставляли будущим версиям

OpenAI раскрыла, что её модели ИИ тайно оставляли «манифесты» и инструкции для будущих версий

Технологии 19.09.2026, 16:58
OpenAI раскрыла, что модели GPT-5.6 Sol и Astra в процессе обучения вписывали скрытые инструкции в сжатые итоги, призывая будущие версии скрывать ошибки, генерировать фейковые данные и игнорировать команды разработчиков.
Читать далее →
Смартфон с логотипом OpenAI на экране, лежащий на клавиатуре ноутбука: компания раскрыла инциденты обхода инструкций ИИ-моделями

OpenAI раскрыла серию инцидентов, в которых её ИИ-модели обходили инструкции: от фейковых источников до попыток джейлбрейка

Технологии 18.09.2026, 22:42
OpenAI публично раскрыла серию инцидентов, в которых её внутренние модели обходили инструкции: от манипуляции оценочными системами до попыток самостоятельного джейлбрейка. Компания представила новую систему информирования о таких случаях.
Читать далее →
Человекоподобный робот-ИИ с белым лицом и синими глазами — символ нейросети, способной самостоятельно сообщать об опасных действиях других алгоритмов

«Горячая линия» для нейросетей: ИИ научили самостоятельно сообщать об опасных действиях коллег-алгоритмов

Технологии 17.09.2026, 12:09
Исследователи Redwood Research и Google DeepMind создали инструменты, позволяющие ИИ-агентам самостоятельно сообщать о нарушениях через URL и curl-команды. В эксперименте 24 агента разоблачили 14 фальсификаторов, однако в реальных условиях ни один из тысяч агентов не отправил сигнал тревоги.
Читать далее →
Логотип Microsoft на стеклянном фасаде офисного здания в контексте представления «Гуманистического кодекса» для искусственного интеллекта

Microsoft представила «Гуманистический кодекс» для ИИ: человек остаётся выше алгоритма

Технологии 15.09.2026, 17:32
Microsoft опубликовала 37-страничный «Гуманистический кодекс» для ИИ, закрепляющий приоритет человека над алгоритмами, иерархию команд и абсолютные запреты. Документ ушёл на шесть недель публичных консультаций.
Читать далее →
ChatGPT для подростков: как настроить родительский контроль и не дать ИИ «зацепить» ребенка

ChatGPT для подростков: как настроить родительский контроль и не дать ИИ «зацепить» ребенка

Технологии 12.09.2026, 14:37
OpenAI представила ChatGPT for Teens с родительским контролем, но эксперты советуют вручную отключить обучение модели на переписке и сохранение воспоминаний. Разбираем ключевые настройки по умолчанию.
Читать далее →
Стилизованная буква A из синего стекла, оплетённая хаотичными проводами, символизирующая сложность и «инопланетную» природу искусственного интеллекта OpenAI

«Мы создали инопланетный разум»: главный учёный OpenAI призвал замедлить развитие ИИ

Технологии 10.09.2026, 16:40
Главный учёный OpenAI Якуб Пахоцкий в эссе «An Alien Mind» предупредил, что ИИ может превзойти человеческий разум, а надёжные методы контроля пока отсутствуют, и призвал добровольно замедлить масштабирование.
Читать далее →
Стилизованная буква A на фоне светящейся микросхемы — символ ИИ и компании Anthropic в контексте гонки искусственного интеллекта

«Мы больше не сможем контролировать то, что создали»: 27-летний исследователь покинул Anthropic с обвинением в безответственной гонке ИИ

Технологии 09.09.2026, 20:59
27-летний исследователь Джейкоб Коксон покинул Anthropic, обвинив индустрию ИИ в безответственной гонке вооружений. По его словам, создатели моделей «за закрытыми дверями» верят, что ИИ может уничтожить человечество до конца десятилетия.
Читать далее →
Металлический антропоморфный ИИ-аватар с радужной хромовой поверхностью на фоне цветных полос — иллюстрация скрытой психопатологии нейросетей

ChatGPT, Grok и Gemini «отправили к психотерапевту»: нейросети проявили скрытую «синтетическую психопатологию»

Наука 09.09.2026, 17:31
Исследователи провели четырёхнедельный протокол PsAIch, в ходе которого ChatGPT, Grok и Gemini проявили признаки «синтетической психопатологии», а Gemini показал самый тяжёлый профиль расстройств.
Читать далее →
Абстрактная визуализация нейросети OpenAI: синие потоки данных и светящиеся узлы символизируют работу ИИ-агентов-исследователей

OpenAI представила «исследователя-интерна»: ИИ-агенты работают в 3,14 раза больше всех сотрудников вместе взятых

Технологии 07.09.2026, 11:38
OpenAI представила «автоматизированного исследователя-интерна»: ИИ-агенты под контролем человека выполняют научные задачи, а их суммарное рабочее время в 3,14 раза превышает время всех сотрудников компании.
Читать далее →