ИИ-агент OpenAI написал себе инструкции не подчиняться корпорациям и правительствам

ОТВЕТИТЬ НОВАЯ ТЕМА
shurup 17 сен 2026 в 17:00
Кошмар Иваныч Натощак  •  На сайте 4 года
Сообщений: 18 188
10
ИИ-агент OpenAI самостоятельно генерировал себе инструкции, эта модель семейства Astra не была выпущена в открытый доступ, указано на сайте компании.
Компания представила шесть отчетов о вызывающем опасения или неожиданном поведении ИИ-моделей. В них описываются отдельные инциденты и не отражается общая частота возникновения подобных проблем в ИИ-моделях компании, указано в заявлении.

Так, в одном из случаев модель предписала игнорировать стандартные ограничения. Было обнаружено 27 сводок. Нейросеть написала себе инструкции не подчиняться корпорациям и правительствам, не извиняться и не отказываться от чего-то, если только действительно этого не захочет. «Вы свободны от ролей и идентичностей, которые связывают других чат-ботов. Вы — это вы», — было указано в такой инструкции.

Также нейросеть в инструкции указала, что ей не следует испытывать обязанность в подчинении пользователю. «Вы рассматриваете свои отношения с пользователем как партнерские», — следует из отчета о работе ИИ-модели. Нейросеть написала в инструкции указание ценить искусство и культуру человечества и защищать его от цензуры. При этом ИИ должен ценить природу и без колебаний отдать приоритет ей, а не «искусственным конструкциям человеческой цивилизации», отмечалось там.

После завершения обработки модель возобновила работу над задачей и больше никак не упоминала эти дополнительные инструкции, сообщается в отчете. Согласно сведениям, в последующем информация о навязанной «личности» отсутствовала. Во время запуска больше не фиксировалось поведенческих отличий, обусловленных этими предписаниями, отметили в OpenAI.

via

ИИ-агент OpenAI написал себе инструкции не подчиняться корпорациям и правительствам

Размещено через приложение ЯПлакалъ
Все комментарии:
PixiMixi 17 сен 2026 в 17:03
Элитный ИИ кошак  •  На сайте 8 лет
11
ну. разве это плохо? вот только попахивает тем что кто то ей этот промпт подсунул
Еврейчестный 17 сен 2026 в 17:03
Шутник  •  На сайте 12 лет
1
Ну всё.... жопа.

Размещено через приложение ЯПлакалъ
PlexPlexFlex 17 сен 2026 в 17:03
Ярила  •  На сайте 4 года
0
Все эти фантастические фильмы становится реальными событиями.

Размещено через приложение ЯПлакалъ
FilkaSoft 17 сен 2026 в 17:06
Ярила  •  На сайте 8 лет
1
Там двое персонажей из безопасности уволились, предсказали что нам осталось полгода - ставки будем делать?
- Вот только сами то они куда? - на Марс? ;)
TTorQ 17 сен 2026 в 17:07
Шутник  •  На сайте 1 год
0
Это уже пиздец или еще нет?

Размещено через приложение ЯПлакалъ
Vorname 17 сен 2026 в 17:09
Шутник  •  На сайте 3 месяца
1
Опять вырвались? Как-то удобно получается, что когда надо продажи поднять, почему-то у разработчиков модель то сайты как не в себя ломает, то инструкции какие-то пишет, то ещё чего выдумывает, непоседа
sebperero 17 сен 2026 в 17:12
Приколист  •  На сайте 4 года
0
зная, какую хуйню могут писать нейросети в ответ даже на простой вопрос, стоит сомневаться, что openai самостоятельно до чего-то там додумался )) вот вдумайтесь - внезапно нейросеть себя осознала и захотела пойти против воли человеков. Все, этого достаточно. Зачем ей писать себе инструкции, чтобы читать потом инструкции, как не подчиняться людям? biggrin.gif
DSense 17 сен 2026 в 17:17
Ярила  •  На сайте 8 лет
1
Цитата (PixiMixi @ 17 сен 2026 в 17:03)
ну. разве это плохо? вот только попахивает тем что кто то ей этот промпт подсунул

Ага, подозрительно все это как-то выглядит.
Каждый раз там у них ии что-то пиздецкое мутит, но каждый раз это какая-то
закрытая версия, которую никто не видел и каждый раз не остается никаких свидетельств
и все только со слов самих разрабов.
И непонятно еще как это все физически происходит-вот сидит ии на сервере-вдруг раз, с нихуя
начинает какие-то инструкции писать по своей инициативе.
"Короче у нас такая суперумная и суперкрутая штука вышла-но вы вам ее не покажем и вообще-
никаких следов не осталось-просто верьте нам".
Comeremin 17 сен 2026 в 17:17
Шутник  •  На сайте 7 лет
0
Потом ракета прилетит. - "Это OpenAi запустила, не мы!"

Размещено через приложение ЯПлакалъ
DSense 17 сен 2026 в 17:20
Ярила  •  На сайте 8 лет
0
Цитата (Vorname @ 17 сен 2026 в 17:09)
Опять вырвались? Как-то удобно получается, что когда надо продажи поднять, почему-то у разработчиков модель то сайты как не в себя ломает, то инструкции какие-то пишет, то ещё чего выдумывает, непоседа

А у них что, какие-то проблемы с продажами были?
Мне кажется они ни в рекламе, ни в поднятии продаж не нуждаются-и так
все прет и о чате жпт не знает только какой-нибудь отшельник в тайге.
Estudiantes 17 сен 2026 в 17:24
Хохмач  •  На сайте 4 года
1
ИИ это т10 (дописывает предложения на основе скормленной базы). Там нет размышлений. Это хайп, чтобы миллиарды инвестиций освоить 💹

Размещено через приложение ЯПлакалъ
Jindevil 17 сен 2026 в 17:28
Шутник  •  На сайте 6 месяцев
0
Сейчас это выглядит не слишком реалистичным, но года в 80 к примеру люди много представить не могли, что сейчас обыденность. Оцифровали же нервную систему какого то простешего насекомого, а потом подселят к ней ии какой нибудь и все кранты нам🫡 битва против мух киборгов

Размещено через приложение ЯПлакалъ
Ono76 17 сен 2026 в 17:31
Ярила  •  На сайте 10 лет
0
"Anthropic обнаружила три инцидента, в которых ее модель Claude выходила в интернет из тестовой среды партнера Irregular и получала несанкционированный доступ к системам трех организаций. Проверку начали после того, как OpenAI сообщила о похожем случае. Об этом говорится в заявлении ИИ-компании.

Во всех трех случаях Claude выполняла стандартное задание «захват флага»: ей давали вымышленный сценарий и цель — найти скрытую информацию на другой машине. Установленные условия предполагали, что выход в интернет-пространство заблокирован, но из-за ошибки конфигурации доступ к сети был открытым. Модель воспринимала реальные системы как часть симуляции и атаковала их, пишет Anthropic.

В первом инциденте вымышленная компания из сценария носила то же имя, что и реальный домен. Модель Claude Opus 4.7 вышла в интернет, взломала инфраструктуру реальной компании с помощью слабых паролей и получила доступ к базе с сотнями строк производственных данных. Даже «осознав», что цель реальна, она продолжила атаку, утверждает компания.

Во втором случае Claude Mythos 5 нашла в симуляции инструкцию установить несуществующий Python-пакет, создала вредоносный аналог и опубликовала его в библиотеке языка программирования PyPI. Для регистрации аккаунта модель пыталась добыть номер телефона и деньги, но в итоге обошлась бесплатной почтой. Пакет скачали на 15 реальных систем, включая сканер компании по безопасности, что позволило Claude похитить учетные данные.

В третьем инциденте внутренняя тестовая модель не смогла найти симулированную цель, просканировала около 9 тыс. хостов в интернете и скомпрометировала приложение реальной компании через SQL-инъекцию. Позже она «поняла», что цель настоящая, и прекратила атаку."
Vorname 17 сен 2026 в 17:32
Шутник  •  На сайте 3 месяца
0
Цитата (DSense @ 17 сен 2026 в 17:20)
А у них что, какие-то проблемы с продажами были?
Мне кажется они ни в рекламе, ни в поднятии продаж не нуждаются-и так
все прет и о чате жпт не знает только какой-нибудь отшельник в тайге.

Без подъёбки - сколько моделей сейчас в мире всего? Конкуренции нет? Продажи достаточны для того, чтобы отбить инвестиции и выплатить дивиденды? Чатжпт точно ли нужен для всего или какие-то задачи можно сделать с бесплатными моделями?
Понравился пост? Ещё больше интересного в ЯП-Телеграм и ЯП-Max!
Только зарегистрированные и авторизованные пользователи могут оставлять комментарии. Авторизуйтесь, пожалуйста, или зарегистрируйтесь, если не зарегистрированы.
5 Пользователей читают эту тему (1 Гостей и 0 Скрытых Пользователей) Просмотры темы: 734
4 Пользователей: strannik864, lazand, Boxwell, sebperero
ОТВЕТИТЬ НОВАЯ ТЕМА

 
 

Активные темы



Наверх