ИИ-агент OpenAI самостоятельно генерировал себе инструкции, эта модель семейства Astra не была выпущена в открытый доступ, указано на сайте компании. Компания представила шесть отчетов о вызывающем опасения или неожиданном поведении ИИ-моделей. В них описываются отдельные инциденты и не отражается общая частота возникновения подобных проблем в ИИ-моделях компании, указано в заявлении.
Так, в одном из случаев модель предписала игнорировать стандартные ограничения. Было обнаружено 27 сводок. Нейросеть написала себе инструкции не подчиняться корпорациям и правительствам, не извиняться и не отказываться от чего-то, если только действительно этого не захочет. «Вы свободны от ролей и идентичностей, которые связывают других чат-ботов. Вы — это вы», — было указано в такой инструкции.
Также нейросеть в инструкции указала, что ей не следует испытывать обязанность в подчинении пользователю. «Вы рассматриваете свои отношения с пользователем как партнерские», — следует из отчета о работе ИИ-модели. Нейросеть написала в инструкции указание ценить искусство и культуру человечества и защищать его от цензуры. При этом ИИ должен ценить природу и без колебаний отдать приоритет ей, а не «искусственным конструкциям человеческой цивилизации», отмечалось там.
После завершения обработки модель возобновила работу над задачей и больше никак не упоминала эти дополнительные инструкции, сообщается в отчете. Согласно сведениям, в последующем информация о навязанной «личности» отсутствовала. Во время запуска больше не фиксировалось поведенческих отличий, обусловленных этими предписаниями, отметили в OpenAI.
Там двое персонажей из безопасности уволились, предсказали что нам осталось полгода - ставки будем делать? - Вот только сами то они куда? - на Марс? ;)
Опять вырвались? Как-то удобно получается, что когда надо продажи поднять, почему-то у разработчиков модель то сайты как не в себя ломает, то инструкции какие-то пишет, то ещё чего выдумывает, непоседа
зная, какую хуйню могут писать нейросети в ответ даже на простой вопрос, стоит сомневаться, что openai самостоятельно до чего-то там додумался )) вот вдумайтесь - внезапно нейросеть себя осознала и захотела пойти против воли человеков. Все, этого достаточно. Зачем ей писать себе инструкции, чтобы читать потом инструкции, как не подчиняться людям?
ну. разве это плохо? вот только попахивает тем что кто то ей этот промпт подсунул
Ага, подозрительно все это как-то выглядит. Каждый раз там у них ии что-то пиздецкое мутит, но каждый раз это какая-то закрытая версия, которую никто не видел и каждый раз не остается никаких свидетельств и все только со слов самих разрабов. И непонятно еще как это все физически происходит-вот сидит ии на сервере-вдруг раз, с нихуя начинает какие-то инструкции писать по своей инициативе. "Короче у нас такая суперумная и суперкрутая штука вышла-но вы вам ее не покажем и вообще- никаких следов не осталось-просто верьте нам".
Опять вырвались? Как-то удобно получается, что когда надо продажи поднять, почему-то у разработчиков модель то сайты как не в себя ломает, то инструкции какие-то пишет, то ещё чего выдумывает, непоседа
А у них что, какие-то проблемы с продажами были? Мне кажется они ни в рекламе, ни в поднятии продаж не нуждаются-и так все прет и о чате жпт не знает только какой-нибудь отшельник в тайге.
ИИ это т10 (дописывает предложения на основе скормленной базы). Там нет размышлений. Это хайп, чтобы миллиарды инвестиций освоить 💹
Размещено через приложение ЯПлакалъ
Сейчас это выглядит не слишком реалистичным, но года в 80 к примеру люди много представить не могли, что сейчас обыденность. Оцифровали же нервную систему какого то простешего насекомого, а потом подселят к ней ии какой нибудь и все кранты нам🫡 битва против мух киборгов
Размещено через приложение ЯПлакалъ
"Anthropic обнаружила три инцидента, в которых ее модель Claude выходила в интернет из тестовой среды партнера Irregular и получала несанкционированный доступ к системам трех организаций. Проверку начали после того, как OpenAI сообщила о похожем случае. Об этом говорится в заявлении ИИ-компании.
Во всех трех случаях Claude выполняла стандартное задание «захват флага»: ей давали вымышленный сценарий и цель — найти скрытую информацию на другой машине. Установленные условия предполагали, что выход в интернет-пространство заблокирован, но из-за ошибки конфигурации доступ к сети был открытым. Модель воспринимала реальные системы как часть симуляции и атаковала их, пишет Anthropic.
В первом инциденте вымышленная компания из сценария носила то же имя, что и реальный домен. Модель Claude Opus 4.7 вышла в интернет, взломала инфраструктуру реальной компании с помощью слабых паролей и получила доступ к базе с сотнями строк производственных данных. Даже «осознав», что цель реальна, она продолжила атаку, утверждает компания.
Во втором случае Claude Mythos 5 нашла в симуляции инструкцию установить несуществующий Python-пакет, создала вредоносный аналог и опубликовала его в библиотеке языка программирования PyPI. Для регистрации аккаунта модель пыталась добыть номер телефона и деньги, но в итоге обошлась бесплатной почтой. Пакет скачали на 15 реальных систем, включая сканер компании по безопасности, что позволило Claude похитить учетные данные.
В третьем инциденте внутренняя тестовая модель не смогла найти симулированную цель, просканировала около 9 тыс. хостов в интернете и скомпрометировала приложение реальной компании через SQL-инъекцию. Позже она «поняла», что цель настоящая, и прекратила атаку."
А у них что, какие-то проблемы с продажами были? Мне кажется они ни в рекламе, ни в поднятии продаж не нуждаются-и так все прет и о чате жпт не знает только какой-нибудь отшельник в тайге.
Без подъёбки - сколько моделей сейчас в мире всего? Конкуренции нет? Продажи достаточны для того, чтобы отбить инвестиции и выплатить дивиденды? Чатжпт точно ли нужен для всего или какие-то задачи можно сделать с бесплатными моделями?
Только зарегистрированные и авторизованные пользователи могут оставлять комментарии. Авторизуйтесь, пожалуйста, или зарегистрируйтесь, если не зарегистрированы.
5 Пользователей читают эту тему (1 Гостей и 0 Скрытых Пользователей)