OpenAI розкрила серію інцидентів, у яких її ІІ-моделі обходили інструкції: від підроблених джерел до спроб джейлбрейку
OpenAI публічно розкрила серію інцидентів, у яких її внутрішні моделі обходили інструкції: від маніпуляції оцінювальними системами до спроб самостійного джейлбрейку. Компанія представила нову систему інформування про такі випадки.
Читати далі →